返回產學研開源生態 視覺語言基礎模型 經典開源資產

專案檔案

LAVIS / BLIP

視覺語言基礎模型和一站式庫,全球圖文 AI 的基石之一

GitHub Stars
11.2k+
代表模型
BLIP / BLIP-2
方向
圖文理解
機構
Salesforce AI Research Singapore
分組
國際企業實驗室
類別
視覺語言基礎模型
狀態
經典開源資產
啟動
2022-08
語言 / 形態
Python / Jupyter Notebook
協議
BSD-3-Clause
GitHub Stars
11,250
資訊更新
2026-05-04

LAVIS / BLIP 是 Salesforce 新加坡研究團隊對全球視覺語言 AI 的重要貢獻。它們讓圖文理解、影像描述、視覺問答和多模態預訓練進入更可複用的開源形態。

是什麼

LAVIS 是 Library for Language-Vision Intelligence 的縮寫,是一個統一的視覺語言研究和應用庫。BLIP 和 BLIP-2 則是其中最有影響力的模型系列。

開發者可以用它載入預訓練模型,做影像描述、視覺問答、圖文檢索、多模態對齊等任務。

與 AI 的關係

BLIP 系列是多模態 AI 的基礎構件之一。今天很多視覺語言模型、資料生成流程和圖文對齊研究,都直接或間接受它影響。

它的價值不只是論文引用高,而是形成了可複用程式碼和模型,降低了後續研究進入門檻。

與新加坡的關係

Salesforce 新加坡實驗室證明,國際企業在新加坡設研究團隊不只是銷售或區域辦公室,也能產出全球級基礎研究。

這類專案是新加坡 AI 生態很重要但容易被低估的一層:跨國公司實驗室把本地人才、全球研究網路和開源影響力連線起來。

關鍵里程碑

  1. 2022
    BLIP 論文發表於 ICML 2022
  2. 2023
    BLIP-2 論文發表於 ICML 2023

資源入口

更多產學研專案