返回產學研開源生態 多模態理解與生成模型 活躍研究線

專案檔案

Show-o

統一多模態理解與生成的單 Transformer 模型

GitHub Stars
1.9k+
論文
ICLR / NeurIPS
核心能力
理解 + 生成
機構
NUS Show Lab
分組
大學與研究機構
類別
多模態理解與生成模型
狀態
活躍研究線
啟動
2024-08
語言 / 形態
Python / Models
協議
Apache-2.0
GitHub Stars
1,960
資訊更新
2026-05-04

Show-o 是 NUS Show Lab 的多模態基礎模型路線:用一個 Transformer 同時處理影像理解和影像生成,而不是把兩類能力拆成不同系統。

是什麼

Show-o 的目標是統一多模態理解和生成。它把視覺理解、文本條件生成、影像生成等能力放進一個模型框架裡,試圖減少"理解模型"和"生成模型"之間的割裂。

Show Lab 後續還推進了 Show-o2,把這條路線繼續擴充套件到更強的生成和理解能力。

與 AI 的關係

多模態模型正在從拼接式系統走向統一架構。Show-o 的問題意識很直接:如果一個模型既能看懂影像,也能生成影像,很多互動式設計、編輯、視覺問答和內容生產流程會更自然。

這也是開源多模態研究裡的關鍵方向。

與新加坡的關係

Show-o 把 NUS Show Lab 放在全球多模態開源研究圖譜上。對新加坡來說,它是"高校實驗室輸出前沿模型"的樣本,而不是政府專案或企業應用。

未來可以繼續追蹤 Show Lab 的模型系列、論文接受情況、Hugging Face 模型使用量和是否形成產業工具。

關鍵里程碑

  1. 2024-08
    Show-o 倉庫建立
  2. 2025-01
    Show-o 接收為 ICLR 2025 論文
  3. 2025-09
    Show-o2 接收為 NeurIPS 2025 論文

資源入口

更多產學研專案