プロジェクト情報
OAT
LLM オンラインアラインメント訓練フレームワーク
GitHub stars
652
方向
モデルアラインメント
形態
訓練フレームワーク
- 機関
- Sea AI Lab (SAIL)
- グループ
- 国際企業ラボ
- カテゴリー
- LLM オンラインアラインメントフレームワーク
- ステータス
- 積極的なメンテナンス
- ローンチ
- 2024-10
- 言語 / 形態
- Python
- ライセンス
- Apache-2.0
- GitHub Stars
- 666
- 情報更新
- 2026-05-04
OAT は Sea AI Lab の LLM アラインメント訓練フレームワークで、強化学習、選好学習などのポストトレーニング段階を対象としています。
説明
OAT は Online Alignment Training の略です。LLM のポストトレーニングで一般的な強化学習、選好最適化、オンラインサンプリング、評価プロセスを研究向けのフレームワークにカプセル化しています。
これは一般ユーザー向けの製品ではなく、モデル研究・訓練チームが使用するツールです。
AIとの関係
モデルの能力はますますポストトレーニングに依存するようになっています。事前トレーニングは基礎知識を決定し、SFT、RLHF、DPO、オンライン強化学習などのプロセスは、モデルが指示に従うか、安定しているか、有用かを決定します。
OAT の意義は、これらの複雑なアラインメント実験を再利用可能なエンジニアリングフレームワークに変えることにあります。
シンガポールとの関係
OAT は、Sea AI Lab が地域言語モデルだけでなく、モデル訓練の基盤となるツールも開発していることを示しています。これはシンガポール本土のテック企業が基礎モデルの競争に参加する上で非常に重要です。
今後、それが Sailor または他の SAIL モデル訓練パイプラインに採用されるかどうかを追跡することができます。
重要マイルストーン
- 2024-10OAT リポジトリ作成