虎嗅

535B規模の大規模モデルが3ヶ月間「ライブ配信」でトレーニングされた:コード、データ、損失関数(Loss)がすべて公開され、エンダ・ウー(Andrew Ng)が公然とその成果を支持

原文:535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

核心内容の要約

Marinはスタンフォード大学が主導するオープンな基礎モデルプロジェクトで、現在5350億個の総パラメータを持つハイブリッドエキスパート(MoE)モデルの訓練を行っています。その最大の特徴はパラメータの規模ではなく、訓練プロセスを完全に透明化することです。実験の仮説、コードの設定、訓練曲線、失敗記録まで、すべてリアルタイムでオンラインに公開されており、訓練が途中で失敗する可能性があっても隠されることはありません。このプロジェクトは、計算能力が集中し、訓練の手法が閉鎖的になっている今日のAI業界において、基礎モデルをオープンソースソフトウェアのようにして、誰もが研究や構築に参加できるようにするという核心的な問題を解決しようとしています。ジェフ・ウィンダーはこれを「AIのオープン性を守る貴重な例」と評していますが、現在モデルはまだ訓練中であり、最終的な効果はまだ見極められていません。

1. なぜMarinが注目されているのか?パラメータの大きさではなく、「完全な透明性」

多くの人はMarinが注目されている理由をパラメータの大きさにあると思っていますが、実際の焦点はそのオープン性にあります。以前のオープンソースモデル(LlamaやGemmaなど)は最終的なモデルの重みのみを公開しており、訓練時に使用される「レシピ」(データ、コード、決定プロセス)は隠されていました。BLOOMやOLMoのようによりオープンなプロジェクトであっても、訓練が終わった後に資料が公開されます。

Marinは異なり、研究室の日常を「ライブ配信」しています:

  • 実験を行う前に、GitHubで「どのような仮説を検証したいのか」「どのような方法を使用するのか」を明確にします;
  • 訓練中には、訓練曲線(モデルがデータにどの程度適合しているか)やハードウェアの動作状態をリアルタイムで公開します;
  • 訓練が失敗したり途中で計画を変更したりしても、そのプロセスを記録します。

これはまるで料理人が料理をする様子を見るようなもので、完成品だけでなく、野菜を買って切って炒めるまでの全過程をライブで見せてもらうようなものです。AI業界ではこれは非常に革新的なことです。なぜなら、大規模モデルの訓練方法やプロセスは通常、企業の核心的な秘密だからです。

2. 5350億個のパラメータを持つMoEモデル:見た目は大きいが、実際にはそんなに多くの計算をしていない

Marinの5350億個のパラメータは「総パラメータ」であり、実際に使用されるのは各Token(モデルが処理する「単語や文字」と考えられる)につき230億個だけです。これがMoE(ハイブリッドエキスパート)モデルの特徴です:

  • モデルには多くの「エキスパート」(数学を担当するもの、コードを書くもの、会話を担当するものなど)がいます;
  • Tokenが来ると、まず「ルーティングモジュール」がどのエキスパートに処理を依頼するかを判断します(例えば数学の問題は数学のエキスパートに);
  • 選ばれたエキスパートのみが処理を行い、他のエキスパートは待機します。

この方法の利点は、モデルの総容量が大きく(より多くの知識を学ぶことができる)、個々のTokenの計算コストが爆発的に増加しないことです。ただし、230億個のアクティブパラメータが230億個の通常のモデルと同じではないことに注意が必要です。なぜなら、共有エキスパートやルーティングモジュールなどの「固定コスト」もあるからです。したがって、単純に性能を比較することはできません。

3. これほど大規模なMoEを訓練する際には、どのような技術的な問題に直面したのか?

MoEモデルの難しさはパラメータが多いことではなく、通信と負荷分散にあります:

  • 通信の問題:異なるGPU上にいるエキスパート間でTokenをやり取りする必要があり、これは宅配便のように遅くなると全体のパフォーマンスを低下させます;
  • ホットスポットエキスパート:人気のあるエキスパート(例えば日常会話を処理するもの)は多くのTokenを受け取り、GPUの処理能力を超えるとTokenが破棄され(Token Dropping)、訓練結果に影響を与えます;
  • 数値の不安定性:訓練中に勾配(モデルの調整方向)が突然大きくなり、モデルが誤った方向に学習することがあります。

Marinチームはどのようにこれらの問題を解決したのでしょうか?

  • スケーリングアップ:まずは小規模なモデル(総パラメータ1.6億から277億個)で試行錯誤を行い、1%の計算量で大規模モデルの問題を予測します;
  • コンテキスト長の調整:65Kの長いコンテキストを一時的に4Kに減らしてTokenの分布を均一にし、ホットスポットエキスパートを減らします;
  • logit z-lossの追加:モデルの出力の変動を制限し、数値の不安定性を避けます。

4. このプロジェクトがAI業界にとってどのような意味があるのか?

Marinの価値は最も優れたモデルを作ることではなく、閉鎖性を打破し、より多くの人が大規模モデルの研究に参加できるようにすることにあります:

  • 小規模なチームでもMarinの訓練記録を見て、MoEの通信問題の解決方法やエキスパートの負荷調整方法を学ぶことができます;
  • 失敗記録の公開の方が成功よりも価値があります。以前は成功したモデルしか見ることができず、どれだけの問題に直面したかがわかりませんでした;
  • AI研究を「オープンソース協力」の状態に戻すことを促進します。GitHubでみんなが一緒にコードを書くように、今ではみんなで大規模モデルの訓練方法を見ています。

ジェフ・ウィンダーは「研究成果を公開することはかつて業界の常態だった」と述べており、Marinはその常態を取り戻そうとしています。

5. 今すぐMarinが最も優れたモデルだと言えるのか?まだ早い

パラメータの規模や計算量は大きいですが、現時点で結論を出すには早すぎます:

  • MoEの効果は役割分担に依存する:エキスパート間の役割分担が明確でなければ(例えば数学のエキスパートが会話も処理する場合)、パラメータが多くても意味がありません;
  • 訓練はまだ完了していない:現在は予備訓練の段階であり、中間訓練や後期訓練を経て、実際の能力(コード、数学、長いコンテキストなど)を評価する必要があります;
  • 公開されているからといって成功したわけではない:訓練中にハードウェアの障害やデータの問題で途中で調整が行われたり、失敗したりする可能性があります。しかし、失敗しても公開された障害記録は貴重な経験となります。

したがって、Marinが現段階で最も価値があるのは、その「訓練日記」であり、3ヶ月後のモデルの重みではありません。

最後のまとめ

Marinの目的は「最も優れたモデル」を作ることではなく、「最も透明な研究室」を作ることです。AI研究を「少数の企業の秘密」から「誰もが参加できるオープンな科学」に変えることを目指しています。最終的にモデルが成功するかどうかにかかわらず、この試み自体が非常に意義深いものです。