프로젝트 정보
NExT-GPT
첫 번째 임의 모달리티 상호 변환 대규모 언어 모델(텍스트, 이미지, 비디오, 오디오)
GitHub stars
3.6k+
논문
ICML 2024
모달리티
텍스트 / 이미지 / 비디오 / 오디오
- 기관
- NUS NExT++ Research Center
- 분류
- 대학 및 연구 기관
- 카테고리
- 임의의 모달 상호 변환 모형
- 상태
- 연구 오픈소스
- 시작
- 2023-08
- 언어 / 형태
- Python
- 라이선스
- BSD-3-Clause
- GitHub Stars
- 3,638
- 정보 업데이트
- 2026-05-04
NExT-GPT는 다중 모달리티 대규모 모델 분야에서 NUS의 대표 프로젝트이며, 시스템이 텍스트, 이미지, 비디오, 오디오 간에 이해하고 생성할 수 있도록 하는 것을 목표로 합니다.
무엇인가
NExT-GPT는 대규모 언어 모델을 중추로 하여 서로 다른 모달리티의 인코더와 생성기를 연결합니다. 사용자는 텍스트, 이미지, 비디오 또는 오디오를 입력할 수 있으며, 시스템은 다른 하나 또는 여러 모달리티를 출력합니다.
그 의의는 다중 모달리티를 「이미지-텍스트 질의응답」에서 더욱 완전한 임의 모달리티 상호 변환으로 나아가게 한다는 것입니다.
AI와의 관계
다중 모달은 거대 모형의 다음 단계의 핵심 방향 중 하나입니다. NExT-GPT가 미리 탐색한 것은 모형 편성 문제입니다: 각 입출력마다 거대 모형을 재훈련하는 대신 다양한 전문 모형이 LLM을 중심으로 협동하도록 하는 방법입니다.
이러한 경로는 연구에 중요하며 응용 계층에 구성 가능한 아키텍처 참고 자료를 제공합니다.
싱가포르와의 관계
NExT-GPT는 NUS가 다중 모달리티 기초 연구에서 전 지구적으로 가시적인 성과를 내고 있음을 보여 줍니다. 이는 싱가포르 현지 응용 프로젝트가 아니라 싱가포르 학술 기관이 전 지구적 모델 패러다임 경쟁에 참여하는 사례입니다.
이러한 유형의 프로젝트는 향후 지속적으로 인용 자료를 보충하고, 후속 모델, 산업 전환, 그리고 NUS의 다른 다중 모달리티 팀과의 관계를 추가하기에 적합합니다.
주요 마일스톤
- 2023-08NExT-GPT 저장소 공개
- 2024논문은 ICML 2024에 게재됨