虎嗅

**日本語の見出し:** 「10兆パラメータの大型モデルもまだ形にならない中、字節跳动(ByteDance)はすでに新部門を設立した」

原文:10万亿参数大模型还没影,字节先造了个一级部门

核心内容の要約

ByteDanceは最近、各事業部門に分散していたデータチームを統合し、「AIデータおよびセキュリティ」という一級部門を設立しました。これは、超大規模な(最大10兆パラメータ)AIモデルの研究開発を目指す同社の野望に基づくものです。創業者の張一鳴(ジャン・イーミング)が「外部モデルのコピー」(他人の成果を利用すること)を明確に反対しているため、ByteDanceは自らデータの供給問題を解決しなければなりません。現在、大規模モデル業界全体が「高品質なデータの不足」に直面しており、公開されているインターネット上の優良なテキストはほとんど使い果たされつつあります。そのため、大手企業は著作権の購入や専門家の雇用、さらには実体書のスキャンなどの方法でデータを争奪しており、著作権紛争(例えばAnthropicが海賊版の本で15億ドルの損害賠償を支払ったケース)にも頻繁に巻き込まれています。ByteDanceのこの組織再編は、超大規模モデルのための「データの備蓄」を目的としているのです。

詳細な分析

1. データ部門を一級部門に昇格させることの重要性

ByteDanceが新設した「AIデータおよびセキュリティ」部門は、新たに作られたわけではなく、元々Global Data、DMC(データミドルウェア)、FlowのAIDPプラットフォームなどに分散していたチームを統合したものです。なぜこのような措置を取ったのでしょうか?

大規模モデルは「超大型の学生」のようなもので、パラメータが多ければ多いほど(つまり脳が発達しているほど)、必要とする「教材」(データ)の量も質も高くなります。ByteDanceが10兆パラメータのモデルを目指す場合、主流のモデルよりもはるかに多くのトレーニングデータが必要となります。以前は分散していたチームがそれぞれデータを扱っており、作業の重複や効率の低下が問題でしたが、今回一級部門に統合することで、Seed(大規模モデル部門)やTikTokと同じレベルでデータを重要なプロジェクトとして扱うようになりました。十分なデータがなければ、どんなに強力な計算能力やアルゴリズムも無意味です。

また、ByteDanceはデータに多くの投資をしてきました。Seedanceのデータ評価チームには数千人がおり(1人のアルゴリズムエンジニアに対して10人のデータスタッフが配属されている)、今年の世界モデルやコーディング分野のデータ予算は数千万ドルに達しています。これは単に外部にアウトソーシングしてラベリングを依頼するだけのレベルを超えており、購入、クリーニング、合成、評価までの全プロセスを自社で行う必要があります。

2. 張一鳴は「他人の成果のコピー」を許さない

8月には、張一鳴がSeedの全体会議で「外部モデルのコピー」に明確に反対したというニュースがありました。簡単に言えば、「他人がトレーニングしたモデルを圧縮して直接利用する」ということです。短期的には迅速に追いつくことができますが、長期的には他人に依存し、独自の競争力を持てなくなります。

張一鳴が「短期的な利益を犠牲にする」選択をしたことは、ByteDanceが自らデータを蓄積しなければならないことを意味しています。これは、生徒が同級生の宿題をコピーせずに自分で教科書を読んだり練習問題を解いたりするようなものです。時間はかかりますが、基礎がしっかりと築けます。データ部門の昇格は、このような「長期的なアプローチ」を支えるためのものであり、教材の探し方や作成方法、評価までを徹底的に行う専門チームが必要です。

3. 大規模モデルのデータ消費が急増し、「データ不足」が問題となる

過去には、大規模モデルを強化するためのロジックは単純でした:パラメータを増やし、計算能力を高め、データを増やす。しかし現在、データが不足しています。

DeepMindのChinchilla論文によると、パラメータを倍増させる場合、トレーニングデータの量も同時に倍増させなければ最適な結果は得られません。しかし、公開されているインターネット上の優良なテキスト(ニュース、書籍、論文など)は限られています。研究機関Epoch AIの推計によると、品質と再利用を考慮すると、世界中の公開テキストの総量は約300兆トークンであり、現在の消費速度では2026年から2032年までに使い果たされる見込みです。もしモデルが「過度なトレーニング」(同じデータを繰り返し学ぶこと)を行う場合、その時期はさらに早まるでしょう。

そのため、大手企業は公開インターネットの枠を超えて、「囲い込みされた」データ(有料ニュース、専門データベース、さらにはデジタル化されていない実体書など)を争奪せざるを得ません。

4. データを争うための大手企業の取り組み

データ不足に直面して、各社はあらゆる手段を尽くしています:

  • 著作権の購入:GoogleはRedditに年間6000万ドルを支払ってフォーラムのコンテンツを購入しており、OpenAIやNews CorpはWall Street JournalやThe Timesのコンテンツを利用しています。
  • 専門家の雇用:コード、数学、科学などの専門分野では、エンジニアや博士にデータの作成や評価を依頼しています。一般の人が高品質な専門コンテンツを作ることは難しいからです。
  • 実体書のスキャン:Anthropicはさらに積極的で、「Project Panama」を開始し、数百万冊の実体書を購入してスキャンしデジタル化しており、数千万ドルを費やしています。以前は海賊版の図書館から書籍をダウンロードしていたこともあり、その結果15億ドルの損害賠償を支払いました。この15億ドルは「高品質なデータ」の価値を物語っています。

5. ByteDanceの10兆パラメータモデルの夢:データが最大の障害

ByteDaceが10兆パラメータのモデルを目指すには、他人の成果をコピーすることができません。つまり、自ら大きな課題に直面しています:

  • データ量の急増:Chinchillaの法則によれば、10兆パラメータに必要なトレーニングデータの量は現在の主流モデルの数倍になる可能性がありますが、どこから調達するのでしょうか?
  • データの品質要求:超大規模モデルに必要なのは低品質なデータではなく、正確で専門的で重複のない高品質なコンテンツです。これには大量の人的リソースと資金が必要です。
  • 著作権リスク:もしByteDanceもAnthropicのように実体書をスキャンする場合、著作権の問題に直面する可能性があります。これは新設された「セキュリティ」部門が解決すべき課題です。

したがって、今回のデータ部門の昇格は、ByteDanceが挑戦に対応する第一歩に過ぎません。次に、どれだけ十分で高品質な合法的なデータを見つけるかが、大規模モデル分野で後発企業として成功するかの鍵となります。

最後のまとめ

ByteDanceのこの組織再編は、大規模モデル業界における「データ戦争」の縮図です。計算能力やアルゴリズムだけが障壁ではなくなった今、高品質なデータを掌握できる企業が将来のAI競争で優位に立つことになります。ByteDanceはこの戦争に向けて事前に準備を進めています。