專案檔案
VideoLLaMA3
前沿影片理解多模態模型
代表模型
2B / 7B
平臺
Hugging Face
方向
影片理解
- 機構
- Alibaba DAMO-NLP-SG
- 分組
- 國際企業實驗室
- 類別
- 影片理解多模態模型
- 狀態
- 模型釋出中
- 啟動
- 2025
- 語言 / 形態
- Models
- 資訊更新
- 2026-05-04
VideoLLaMA3 是 Alibaba DAMO-NLP-SG 的影片理解模型線,重點處理長影片、影像和視覺問答等多模態任務。
是什麼
VideoLLaMA3 是釋出在 Hugging Face 上的一組多模態模型,常見版本包括 2B 和 7B。它服務的是影片和影像理解:讓模型基於視覺內容回答問題、提取資訊、理解時序事件。
與影片生成不同,它的重點是"看懂影片"。
與 AI 的關係
影片理解是 AI 應用的關鍵基礎能力。安全巡檢、教育內容分析、會議和媒體檢索、機器人感知都需要模型處理長時序視覺資訊。
VideoLLaMA3 代表的是企業實驗室在開源影片理解模型上的快速推進。
與新加坡的關係
DAMO-NLP-SG 是阿里達摩院在新加坡的語言技術實驗室。VideoLLaMA3 讓這個實驗室不只出現在 NLP 語境裡,也進入多模態影片模型生態。
這類專案有助於觀察新加坡如何承接中資科技公司的全球 AI 研發網路。
關鍵里程碑
- 2025VideoLLaMA3 模型線釋出