返回產學研開源生態 任意模態互轉模型 研究開源

專案檔案

NExT-GPT

首個任意模態互轉大語言模型(文本、影像、影片、音訊)

GitHub Stars
3.6k+
論文
ICML 2024
模態
文本 / 影像 / 影片 / 音訊
機構
NUS NExT++ Research Center
分組
大學與研究機構
類別
任意模態互轉模型
狀態
研究開源
啟動
2023-08
語言 / 形態
Python
協議
BSD-3-Clause
GitHub Stars
3,638
資訊更新
2026-05-04

NExT-GPT 是 NUS 在多模態大模型上的代表性專案,目標是讓一個系統在文本、影像、影片、音訊之間理解和生成。

是什麼

NExT-GPT 把大語言模型作為中樞,連線不同模態的編碼器和生成器。使用者可以輸入文本、圖片、影片或音訊,系統再輸出另一種或多種模態。

它的意義在於把多模態從"圖文問答"推向更完整的任意模態互轉。

與 AI 的關係

多模態是大模型下一階段的核心方向之一。NExT-GPT 提前探索的是模型編排問題:如何讓不同專業模型圍繞 LLM 協同,而不是每一種輸入輸出都重訓一個巨型模型。

這種路線對研究很重要,也給應用層提供了可組合的架構參考。

與新加坡的關係

NExT-GPT 說明 NUS 在多模態基礎研究上有全球可見成果。它不是新加坡本地應用專案,而是新加坡學術機構參與全球模型範式競爭的樣本。

這類專案未來適合繼續補充引用、後續模型、產業轉化和與 NUS 其他多模態團隊的關係。

關鍵里程碑

  1. 2023-08
    NExT-GPT 倉庫釋出
  2. 2024
    論文發表於 ICML 2024

資源入口

更多產學研專案