核要内容のまとめ
8月6日、AI業界で2つの大きな出来事が重なりました。Google DeepMindの創設者は、自社開発のモデル「Gemini」のパフォーマンスが期待に達しなかったためCEOを辞任しました。また、ByteDanceの張一鳴(ジャング・イーミン)は「大規模なAIモデルにおいては『蒸留』(distillation)を行わない」という決定を下しました。この決定は業界内で意見の対立を引き起こしています。一方では「名声を得るための策略」と批判され、もう一方では「本質に立ち返った正しい選択」と評価されています。記事では、「蒸留」の本質やByteDanceの決定の背景、業界内の議論、そして中国のAI企業が取る多様なアプローチについて詳しく分析しており、ByteDanceが選んだ道は「費用がかかり、困難な道」であるものの、このような多様性こそが中国のAIエコシステムにとって必要だと指摘しています。
詳細な解説
1. 「蒸留」とは何か?なぜ皆がこれを使うのか?
「蒸留」とはAIモデルのトレーニング手法の一つで、以下の2種類に分けられます:
- 自己蒸留:自社の大型モデルを用いて小型モデルを訓練する(例:GPT-4を使ってGPT-3.5をトレーニングする)。これは業界で一般的な方法で、特に問題はありません。
- 他者の蒸留:他社が開発したモデルの出力結果を利用して自社のモデルを訓練する(例:ChatGPTの回答を使って)。これが議論の焦点となっています。
例えば、他者のモデルを利用することは、学生が優秀な生徒の宿題をコピーするようなものです。すぐに「成績(モデルランキング)」を上げることはできますが、「問題解決のための思考方法」(内部的な推論能力)を本当に身につけられているかどうかは疑問です。なぜ皆がこれを使うのか?それは「効果が早く、計算リソースを節約できる」からです。例えば、DeepSeekは80万件のR1モデルの出力データを使用して小型モデルの成績(AIME24ベンチマーク)をOpenAIのo1-previewを上回るレベルに引き上げましたが、その計算コストは非常に低かったです。
しかし、問題はここから始まります。アメリカでは「他者のモデルを利用する」ことを制裁の根拠としており、ホワイトハウスはAnthropicが中国の企業が偽のアカウントを使ってデータを収集していると非難しています。さらに、IPやアクセスパターンから蒸留行為を検出できるともされています。
2. 張一鳴が「蒸留を行わない」という決定:罰を恐れているのか?それとも自分なりの信念なのか?
多くの人はByteDanceがTikTokがアメリカから問題視されることを恐れていると推測していますが、記事では反証が示されています。例えば、国内でオープンソース化されたKimi K3モデルでさえも蒸留を許可していません。これらのモデルはライセンスが緩く、リスクもなく、TikTokに影響を与えることはありません。では、本当の理由は何でしょうか?
- 技術的な潔癖症:ByteDanceは昨年、「合成データ」(モデルが生成したデータ)を含まないモデルをオープンソース化しており、そのデータが基盤となるモデルの品質に影響を与えることを恐れています。実験を行う際には清潔な試薬管が必要であり、問題を正確に特定するためです。
- TikTokの立場:これが主な理由ではないかもしれませんが、ByteDanceは世界最大の海外事業を持っており、何らかの問題を抱えることを避けたいと考えています(過去にProject SeedがGPTを使用してOpenAIからアカウント停止処分を受けたこともあります)。
- 個人的な技術的判断:張一鳴はCEOを辞任した後、AIの研究に専念しています。Seedチームの評価に参加したり、夜通し論文を読んだり、シンガポールの教授に指導を受けたりしています。これが彼が下した最初の重要な決定であり、「短期間は遅れても本物の技術を身につける」という考えです。
3. 蒸留は「近道」なのか?それとも「行き止まり」なのか?業界内で意見が分かれている
賛成派と反対派の両方に理論的な根拠があります:
- 賛成派:効果的で、リソースを節約できる。清華大学の研究によると、蒸留されたモデルの性能は基礎モデルよりも大幅に向上する。Anthropic自身も「蒸留は合法的なトレーニング手法だ」と認めている。
- 反対派:上限を設けてしまう可能性がある。オックスフォード大学の研究によると、モデルが自分自身や他者の出力結果を繰り返し学ぶと「情報の損失」(例えば伝言ゲームで情報が歪む)が発生する。これを「モデルの崩壊」と呼んでいる。
- 中立的な見解:AI研究者のLambertによると、蒸留は「模倣」に過ぎず、強化学習は「探求」(自分で試行錯誤して道を見つける)ことだ。真の強さは探求から生まれる。ただし、合成データを適切に使用すれば(多様な教師や実際のデータを組み合わせて使用すれば)、モデルの崩壊は防げるとも指摘しています。
4. 中国のAI企業:蒸留だけに頼っていない
記事では、蒸留が単なるツールであり、中国のAIの全てではないことを3つの例で示しています:
- 智谱GLM-5.3:蒸留もパラメータの追加もせず、強化学習や長い文脈構造を利用して能力を向上させている。公式には「基盤となるモデルの潜在能力はまだ十分に引き出されていない」とされています。
- DeepSeek:自己対戦を通じて推論能力を鍛え、外部の出力に依存していない。OpenAIのチーフ研究者でさえも彼らがo1のコアコンセプトを独自に発見したと認めている。
- 阿里千问:蒸留を行っていると非難されているが、オープンソースコミュニティでは「教師」としても活躍しており、世界中の多くの小型モデルが阿里千问を基盤として使用している。これはその基礎的な能力が高いことを示しています。
5. ByteDanceの賭け:最も困難な道を選び、歴史を変えるか?
ByteDanceでは「5兆〜10兆パラメータを持つモデル」のトレーニングについて内部で議論が進んでいます。この道はどれほど困難なのでしょうか?
- 短期的なコスト:梁汝波(リャン・ルボ)は「海外の先進モデルとの差が広がっている」と公に認めています。
- 長期的な価値:成功すれば、ByteDanceは世界のAI分野で重要なプレイヤーになり、中国のAI開発史を変える可能性があります。失敗すれば、業界にとって「高額な教訓」となるかもしれません。
しかし、記事ではこのような多様性こそが良いことだと強調しています。中国のAIエコシステムには異なる資質を持つ企業がそれぞれ異なる道を歩む必要があり、張一鳴の選択は尊重されるべきです。これを業界の標準として広める必要はありません。
最後に
「蒸留」は立場を示すためのものではなく、単なる技術的なツールに過ぎません。ByteDanceが選んだ道は最も困難ですが、このような「流れに乗らない」勇気こそがAIイノベーションに必要なものです。結果がどうであれ、中国のAIエコシステムに新たな可能性をもたらしています。