核要内容のまとめ
この記事では、大規模なモデルの訓練ロジックにおける大きな変化について説明しています。以前はベースモデル(Base Model)に重点を置き、可能な限り多くの人間の知識を吸収させようとしていましたが、今ではベースモデルの役割が変わりました。もはや「知識の容器」としてではなく、「基本的なスキルのツールボックス」となり、Pythonやコード構造といった「原子レベルの能力」を提供するようになっています。モデルの最終的な高度な能力(ソフトウェアの開発や長期間にわたるタスクの解決など)は、その後の強化学習(RL: Reinforcement Learning)や新しく登場したミッドトレーニング(Mid-training)によって実現されます。また、事前訓練用のデータも「大量のウェブページの混合物」から「ターゲットを絞った精密なデータ」へと変化し、訓練段階の境界線も徐々に曖昧になってきており、「教師あり学習で基礎を築く+RLで応用を磨く」という2つのステップに簡略化されています。
1. ベースモデル:「超大型図書館」から「基本的なツールボックス」へ
以前のベースモデルは、インターネットやウィキペディア、書籍などをすべて収めた超大型図書館のようなものでした。GPT-3の時代には、事前訓練用のデータの85%がウェブページやウィキから来ており、「事前訓練がうまくいけばモデルも強くなる」と考えられていました。その時代の後続のトレーニングはチャットスタイルの微調整に過ぎず、RLの役割は限定的でした。
しかし今では、ベースモデルの目的が変わりました。もはや複雑なタスク(10時間かけてのソフトウェア開発など)を直接こなす必要はありませんが、Pythonの文法やコード構造、Gitの操作、APIの呼び出しといった基本的なスキルを習得する必要があります。料理を例にすると、ベースモデルが野菜の切り方や調味料の混ぜ方を教え、その後のRLがこれらのステップを組み合わせて一つの完成品を作る方法を教えます。ベースモデルは「何でも知っている」存在から、「基本的なスキルを持っている」存在へと変化し、高度な能力を実現するための出発点となりました。
2. 事前訓練用データ:「混合物」から「精密なデータ」へ
以前の事前訓練用データはウェブページが85%を占める「何でも入っている状態」でしたが、今ではその割合が15%に減少し、コードが最大のデータソースとなっています。なぜかというと、モデル開発会社はモデルに必要な能力(プログラミングや推論、長期間にわたるタスク処理など)を明確に理解しており、それに合わせてデータを提供しているからです。
また、合成データの重要性も高まっています。これはインターネットから実際のデータを収集するのではなく、タスクに合わせて人為的に作成されたデータを使用することです。例えば、通常のコードを「バグの検出+修正+ツールの呼び出し+連続したタスクの実行」という訓練用サンプルに変更することで、モデルが事前訓練段階で実際のタスクシナリオに触れるようになります。これは単に知識を学ぶだけでなく、「知識をどのように活用するか」も学ぶことを意味します。以前は単語帳を暗記するだけでしたが、今では「単語+例文+シナリオ対話」を直接覚える方が実用的です。
3. RLと後続のトレーニング:「微調整」から「能力拡大器」へ
以前の後続のトレーニングはモデルの細かい修正(例えばチャットスタイルの改善)に過ぎませんでしたが、今ではRLが能力向上の鍵となっています。RLをうまく行えば、事前訓練後のモデルも大幅に強化されます。業界関係者によると、事前訓練と後続のトレーニングに必要な計算リソースはほぼ同等だと言われています。
これはつまり、モデルの最終的な能力はもはや事前訓練だけに依存しなくなり、後続のトレーニングとRLが「上限を決定する」要素となるということです。例えば、未完成の家(ベースモデル)を購入した場合、以前は少しの費用で改装すればよかったのに対し、今では改装にかかる費用が家を買う費用とほぼ同じになり、その改装の質が住み心地を直接左右するということです。
4. ミッドトレーニング:事前訓練と後続のトレーニングの間の「緩衝帯」
以前は事前訓練で得られるのは「静的な知識」(ウェブページや書籍)で、後続のトレーニングでは「動的なタスク」(推論処理やエージェントとのインタラクション、ツールの呼び出し)が突然必要になり、データのスタイルの違いからモデルが適応できないことがありました。特にMoE(多専門家モデル)では、各専門家の役割が固定されており、データを突然変更するとそのバランスが崩れます。
ミッドトレーニングはこの問題を解決するためのもので、事前訓練と後続のトレーニングの間に過渡的な段階を設けることで、モデルが長い文脈や推論データ、タスクシナリオに慣れるようにします。これは小学校卒業後に直接大学に進学するとついていけないのと同じで、ミッドトレーニングは中学のようなもので、スムーズな移行を助けます。
5. トレーニングパラダイムの簡略化:「2つのステップ」で大規模モデルを実現
今ではトレーニングプロセスを以下の2つのステップに簡略化できます:
- 第1ステップ:教師あり学習(事前訓練+ミッドトレーニング):モデルに知識や基本的なスキル(原子レベルの能力)を身につけさせる。例えば単語の認識、Pythonの使用方法、論理の理解など。
- 第2ステップ:強化学習(RL):モデルが実際の環境で試行錯誤し、フィードバックを受けながら基本的なスキルを組み合わせて複雑な問題を解決する。例えばソフトウェアの開発や意思決定など。
以前は複数の段階(事前訓練、ミッドトレーニング、後続のトレーニング)がありましたが、その境界線は徐々に曖昧になっており、重要なのは「まず基礎を築き、その後で応用を磨く」という流れです。これはまるで小学校で四則演算を学んだ後に応用問題を解くようなもので、論理がより明確になっています。
最後に:ベースモデルは死んでいない——ただ役割が変わっただけ
記事のタイトル「The Base Model Is Dead」は誇張されていますが、ベースモデルの地位は確かに「核心」としてではなく「出発点」となりました。それでも依然として重要です。基本的なスキルがなければRLも機能しませんが、今では「どのようにRLを使って基本的なスキルを高度な能力に変えるか」に注目が集まっています。これは大規模モデル業界が「知識量の追求」から「応用能力の追求」へと移行する上での重要な変化です。