核要内容のまとめ
字節跳動は最近、各事業部門に分散していたAIデータチームを統合し、「AIデータおよびセキュリティ部門」(大規模モデル部門のSeedやFlowなどと並行する組織)を設立しました。この部門は、同社が保有するすべての大規模モデルに対してクロスモーダルなデータサービスを提供する役割を担っています。元責任者の傅越氏は退職し、新しい責任者として王赢磊氏が就任しました。王赢磊氏はTikTok事業出身で(ライブ配信やプラットフォーム運営を担当していた)モデル研究者ではありません。この調整は、字節跳動が大規模モデルの「自社開発路線」(「抽出」による近道を取らない方針)を堅持するためのものであり、データの役割がバックステージでのサポートから会社全体の中核的な能力へと変化していることを示しています。また、業界のトレンドも反映しており、AIデータの生成は「インターネットからの収集」から「能動的な製造」へと移行しており、テクノロジー企業にとって新たなインフラストラクチャーとなっています。しかし、字節跳動が事業管理者を責任者に選んだことで、「データ生成が最先端の研究にどのように密接に関連するか」という疑問も生じています。
1. なぜ字節跳動はAIデータチームを独立した部門に昇格させたのか?
簡単に言えば、データは今や大規模モデルの命脈であり、分散して管理するだけでは不十分だからです。
字節跳動の以前のAIデータ機能は「バラバラ」でした:Global Data、DMC(データミドルウェア)、Flow傘下のAIDPなどがそれぞれ異なる事業部門に存在していました。しかし、張一鳴氏と梁汝波氏が「抽出を行わず、自社開発を続ける」と明確にした後、データの重要性が変わりました。自社開発されたモデルには継続的で高品質かつ多様なデータ(テキスト、ビデオ、コード、世界の知識など)が必要となり、それらを事業部門を超えて統一的に調達する必要があります。
例えば、Seedモデルがデータを必要とする場合はGlobal Dataに依頼し、TikTokモデルがデータを必要とする場合は別のチームに依頼するなど、効率が低かったです。今回の統合により、「データの中央キッチン」ができたわけで、すべてのモデルが必要とするデータをここから一元的に供給できるようになり、著作権やプライバシーといった問題も解決されます。これは、レストラン経営に例えられます。以前は野菜の仕入れ、切り分け、洗浄をそれぞれ別の人が行っていましたが、今ではそれらを一つのキッチンに統合し、すべてのレストラン(モデル)に一元的に供給することでコストを削減しつつ品質を保証しています。
2. 新しい責任者はなぜモデル研究者ではなく事業出身者なのか?
字節跳動が王赢磊氏(TikTokの元ライブ配信/プラットフォーム運営責任者)を選んだ理由は2つあります:
1. データ部門は「プラットフォーム型組織」であり、中立性と管理能力が求められる:この新しい部門はすべてのモデル(Seedベース、抖音事業用モデル、Codingモデルなど)にサービスを提供する必要があります。もしモデル研究者が責任者だと、自分のモデルのニーズに偏る可能性があります。しかし王赢磊氏は事業運営の経験があり、組織管理や部門間の調整に長けており、数千人のチームや数千万ドルの予算を効果的に運用できます。データ生成はもはや小規模な実験室での作業ではありません。
2. セキュリティとコンプライアンスが重要:王赢磊氏はTikTokのプラットフォーム運営(コンテンツ管理、セキュリティコンプライアンス)を担当しており、データ部門も著作権やプライバシー問題(他人のコンテンツの使用による侵害やユーザーデータの漏洩など)を管理する必要があります。これは彼の強みです。
しかし、ここにも疑問が残ります:現在のデータ生成は「研究」に似てきています。例えば、モデルに何か問題がある場合、どのようなデータが必要かを判断するにはモデルを理解している人が必要です。DeepSeekでは核心研究者が直接データの仕様を決定しており、これは「問題発見→データ生成→モデル訓練」のフィードバックサイクルを短縮するためです。しかし、事業管理者がデータを管理することでフィードバックが遅くなるのではないかという懸念もあります。
3. AIデータ生成は今どのように変化しているのか?「インターネットからの収集」だけでは不十分
以前は大規模モデルのデータを主にインターネットから収集していましたが、もはやそれだけでは不十分です:
- インターネット上のデータが不足している:Cloudflareによると、ロボットによるトラフィックはすでに人間を超えており、5年後にはその1000倍になる可能性があります。インターネットは「食料庫」のようなもので、使えば使うほど少なくなり、中には「答え」しか含まれておらず(数学の問題の解き方など)「思考過程」がありません。
- データを能動的に生成する必要がある:モデルが何を必要としているかに応じて、それを作り出す必要があります。例えば、モデルがコードを書けない場合はプログラマーに依頼し、法律を理解できない場合は弁護士にケーススタディを依頼します。さらには、「仮想環境」を作ってモデルの訓練を行うこともあります(例えばExcelやブラウザをシミュレートしてAIに操作を学ばせる)。
これは、以前は市場から食材を買って調理していたのに対し、今では自分で野菜を栽培したり(データのラベル付け)、家禽を飼ったり(データの合成)、キッチンを作ってシェフが練習するようなものです。
業界の変化はさらに激しく、求人プラットフォームのHandshakeは博士や弁護士にデータ生成を依頼し、年収を数千万ドルから10億ドルに増やしています。Googleは仮想ワーク環境の会社を15億ドルで買い取り、Metaは従業員のキーボードやマウスの操作データを収集してAIに仕事の方法を学ばせています。データは「原材料」から「カスタムメイド製品」へと変化しています。
4. この調整の背後にある業界のトレンド:データがAI企業の「新たなインフラストラクチャー」となっている
字節跳動の調整は個別の事例ではありません。業界全体でデータを中心に再編成が進んでいます:
- 腾讯:独立したデータ部門は設立していませんが、字節跳動からデータ人材を引き抜き(給与を数倍に増やし)、50以上の事業部門からフィードバックを集めてモデルに供給しており、「データの品質」をモデル成長の鍵としています。
- DeepSeek:核心研究者の半分にデータの仕様決定を任せており、「AI問題の解決はデータの仕様決定にかかっている」と考えています。
- Meta:Scale AIの49%の株式を購入し、現在その半分の事業が強化学習環境の開発に注力しています。
簡単に言えば、AI競争は「モデルアルゴリズムの比較」から「データ生成能力の比較」へと変わっています。どちらの企業がより迅速かつ正確にモデルに必要なデータを生成できるかが、長期的な競争で勝利する鍵となります。字節跳動がデータ部門を独立した部門に昇格させたのも、この「新たなインフラストラクチャー」への賭けです。
5. 字節跳動の選択:利点かリスクか?
字節跳動のアプローチは典型的な字節跳動らしく、組織能力を活かして事業を拡大するものです。しかし、リスクも伴います:
- フィードバックサイクルが長くなるのではないか? モデルは急速に変化し、今日有効だったデータが明日には不要になる可能性があります。研究者がデータを必要とする場合、事業管理者の承認を得る必要があるため、最適なタイミングを逃すかもしれません。
- データ生成と研究が乖離するのではないか? 現在のデータ生成にはモデルを理解している人の参加が必要ですが、管理者がモデルを理解していなければ、どのデータに投資すべきかを判断できるでしょうか?
しかし、字節跳動には独自の論理もあります。自社開発されたモデルは長期的な戦略であり、データ生成には規模化とコンプライアンスが必要です。事業管理者がこれらの基盤を築くことが求められています。そして、「規模」と「最先端性」のバランスをどのように取るかは、王赢磊氏が今後解決すべき課題です。
総括
字節跳動のこの調整は、大規模モデルの自社開発路線への強い支持であり、AIデータ生成の新たなトレンドに対する応答でもあります。これは私たちにこう伝えています:AI時代において、データはもはや「無料の lunch」ではなく、多額の投資と組織力、能力が必要な「核心的な燃料」となっています。この燃料を効果的に活用できる企業が、競争でリードすることになるでしょう。