虎嗅

日本語の見出し: 中国の大規模モデルの簡単な歴史01:モデルはどんどん大きくなっているが、それが何になるべきかを知っている人はいない

原文:中国大模型简史01:模型越做越大,却没人知道它该变成什么

一、核心内容の要約

これは『中国の大規模モデルの簡単な歴史』の序章部分であり、2021年の夏から2022年の年末にChatGPTがリリースされるまでの国内の大規模モデル業界が経験した「混乱の2年間」を振り返っています。当時は成功した事例がまったくなく、大規模モデルが最終的にどのような形になるのか誰にもわかりませんでした。研究機関、大企業、初期の起業家たちはすべて手探りで投資をしていました。GPT-3の10倍ものパラメータを持つ超大規模モデルを作った人もいましたが、その活用方法が見つかりませんでした。また、資金を調達しても最初の製品が何であるべきかさえ明確にしていない人もいました。2022年の年末に2つの出来事が相次いで起こり、業界の発展の方向性が私たちが後に知るようになった「全民大規模モデル競争」の軌道に完全に乗り換えられました。

---

二、分かりやすい解説

1. 2021年の大規模モデルは、決して一般ユーザー向けのものではありませんでした

今では大規模モデルといえばチャットボットを連想するかもしれませんが、2021年に国内で開発されたトリリオン規模の大規模モデルは「チャット」とは全く関係ありませんでした。例えば、当時リリースされた「悟道2.0」はパラメータの規模が1.75トリリオンに達し、GPT-3の10倍でしたが、多モーダル認識やタンパク質予測などの科学研究機能が搭載されていましたが、一般ユーザー向けのチャットインターフェースはありませんでした。

当時の関係者の想像は非常に「壮大」でした。ある人は大規模モデルを発電所に例え、データを消費して知能を生み出し、すべての小規模なAI製品に電力を供給するものだと考えていました。また、別の人は大規模モデルを工業の流れ作業ラインに例え、企業がAIを開発する際に毎回データをゼロから収集し、モデルをトレーニングする必要がなくなると考えていました。しかし、最終的には誰もが簡単にテキストを入力して会話できる小さなダイアログボックスになるとは思ってもみませんでした。まるで巨大な発電所を作ったのに、結局は一般の人々がそれを使って火鍋を温めるようになるとは、当時の誰も予想していませんでした。

2. 初期のパラメータ競争は、ニュースを作って資金を調達するためのものではありませんでした

後に多くの人が、初期の大規模モデルにおける「パラメータの大きさ」を競うことは意味のない軍拡競争だと批判しましたが、実際には研究界では新しい法則が見つかっていました。以前はAIは細分化された分野でそれぞれ研究が行われており、翻訳に特化した研究や感情分析に特化した研究があり、研究者はその分野で一生を過ごすことができました。しかし2020年にGPT-3が登場し、状況が変わりました。モデルを十分に大きくし、十分な量のテキストを与えれば、翻訳や文章作成、数学問題の解決などを自動的に行うことができるようになりました。これは「規模の法則」として確認されており、パラメータやデータ、計算能力を増やせばモデルの能力は安定して向上するというものです。以前は2、3枚のグラフィックカードで研究ができましたが、今では数百枚のカードが必要になります。まるでゲームで最初はいくつかの普通の装備でクリアできたのに、新しいバージョンではチーム全体の高性能な装備が必要になるようなものです。関係者は資源を集めてモデルを大きくすることに必死でしたが、それは投資家を騙すためではありませんでした。

3. 異なる背景を持つ関係者は、大規模モデルに対する理解がまったく異なっていました

2021年に国内で最初に大規模モデルを開発した人々には統一された「正解」がありませんでした。それぞれが過去の経験を新しいものに当てはめていました。

  • 「智源」という研究機関は北京が主導し、清華大学、北京大学、バイドゥ、字節などの機関と協力しており、大規模モデルを公共のインフラと考え、すべての業界で使用できる発電所として開発しようとしていました。
  • 华為は以前から企業向けのAIソリューションを提供しており、顧客がAI機能を求めるたびにデータの収集やモデルのトレーニングから始めなければならないという問題を経験していたため、大規模モデルを工業の生産ラインと考え、AI開発の繰り返し作業をなくそうとしていました。
  • バイドゥは20年間検索サービスを提供しており、50億の実際の知識グラフを持っていたため、大規模モデルには人類が蓄積した知識を組み込む必要があると考えていました。

これら3つの組織を2021年に一緒に議論会に招いても、話す内容はまったく異なり、誰も誰の意見にも納得しませんでした。なぜなら、当時は本当に使える大規模モデルを見た人がいなかったからです。誰も自分のアプローチが間違っているとは言えませんでした。

4. 初期の大規模モデルの起業は、想像をはるかに超えていました

2021年の年末に大規模モデルの起業に投じた人々は、周囲から見れば「狂人」でした。例えば、後にMiniMaxを開発した闫俊杰は、資金を調達する際にはChatGPTすら存在せず、世界中に模倣できるチャット製品もありませんでした。彼自身も最初の製品が何であるべきかわかりませんでした。投資家が彼に投資したのは、「この若者が話す内容は理解できないが、未来を感じさせる」という理由からでした。

彼らがようやく300億のパラメータを持つモデルをトレーニングしたとき、そのモデルは無意味なことを話すだけで、信頼できるオフィスアシスタントにはなりませんでした。そこで彼らはその能力を活かしてAIチャット製品「Glow」を開発し、ユーザーが仮想キャラクターを操作して遊ぶことができるようにしました。当時の大規模モデルの起業は「明確なビジネスプランを持って実施する」というものではなく、まずモデルを作り、それが何ができるかを見てから、それを活用できるシナリオを探すというものでした。まるで最初に工具を作り、それを使って必要とする企業を探すようなものでした。

5. 2022年の年末の2つの出来事が、大規模モデルのルールを完全に変えました

2022年10月まで、国内の大規模モデル業界は混乱していましたが、少なくとも明確な目標がありました。それは計算能力を集めてモデルをさらに大きくし、徐々に応用シナリオを探すことでした。しかし、その2ヶ月の間に2つの大きな出来事が相次ぎ、以前のすべての進行を乱しました。

第一に、アメリカが高級AIチップの輸出規制を導入しました。大規模モデルのトレーニングに最適なA100/H100チップが中国に売られなくなりました。以前は計算能力の高さが問題でしたが、今では購入できるかどうかが問題になりました。まるでゲームで装備を半分集めたところで、公式が購入チャネルを閉鎖したようなものです。

第二に、ChatGPTが無料で公開されました。誰もが簡単に使用できるチャットボックスが登場し、これまで2年間議論されていた「大規模モデルが何ができるのか」という問題に明確な答えを出しました。発電所や工業の生産ラインを作ろうとしていた人々はすぐに気づきました。「ああ、大規模モデルの最も直感的なユーザーインターフェースはチャットだったのか!」と。以前のすべての意見の相違は、突然「誰もが納得するもの」になりました。