專案檔案
NExT-GPT
首個任意模態互轉大語言模型(文本、影像、影片、音訊)
GitHub Stars
3.6k+
論文
ICML 2024
模態
文本 / 影像 / 影片 / 音訊
- 機構
- NUS NExT++ Research Center
- 分組
- 大學與研究機構
- 類別
- 任意模態互轉模型
- 狀態
- 研究開源
- 啟動
- 2023-08
- 語言 / 形態
- Python
- 協議
- BSD-3-Clause
- GitHub Stars
- 3,638
- 資訊更新
- 2026-05-04
NExT-GPT 是 NUS 在多模態大模型上的代表性專案,目標是讓一個系統在文本、影像、影片、音訊之間理解和生成。
是什麼
NExT-GPT 把大語言模型作為中樞,連線不同模態的編碼器和生成器。使用者可以輸入文本、圖片、影片或音訊,系統再輸出另一種或多種模態。
它的意義在於把多模態從"圖文問答"推向更完整的任意模態互轉。
與 AI 的關係
多模態是大模型下一階段的核心方向之一。NExT-GPT 提前探索的是模型編排問題:如何讓不同專業模型圍繞 LLM 協同,而不是每一種輸入輸出都重訓一個巨型模型。
這種路線對研究很重要,也給應用層提供了可組合的架構參考。
與新加坡的關係
NExT-GPT 說明 NUS 在多模態基礎研究上有全球可見成果。它不是新加坡本地應用專案,而是新加坡學術機構參與全球模型範式競爭的樣本。
這類專案未來適合繼續補充引用、後續模型、產業轉化和與 NUS 其他多模態團隊的關係。
關鍵里程碑
- 2023-08NExT-GPT 倉庫釋出
- 2024論文發表於 ICML 2024