虎嗅

日本語の見出し: 数学だけでなく、あのくそったれの直感も必要だ

原文:除了数学,还要那该死的直觉

核心内容の要約

この記事は、「LLMは高級製造業である」とか「AIの究極は電力である」といった単純化された認識に反論し、LLM競争の本質は数学/応用数学と工学的直感の競いであると指摘しています。中国のDeepSeekやKimiチームは、MLA圧縮やKDA長距離推論といったオリジナル技術を通じて、「中国は工学的なことはできてもオリジナルのことはできない」という古い固定観念を打ち破り、世界の資産価格決定の論理を書き換えました。また、LLMには現在厳密な数学的基盤が欠けており、多くの未解決の理論的問題があるため、今後の競争では数学的才能と直感の価値をより重視する必要があると強調しています。さもなければ、「目隠しで走る」ような状況に陥るリスクがあると述べています。

一、なぜLLMは「高級製造業」ではないのか?

製造業の核心は「リソースの積み重ねとプロセス化」です。例えば、マスクは十分な人材、チップ、サプライチェーンを持っていますが、彼のGrokモデルの性能は平凡で、10万枚のチップをAnthropicに貸さなければなりません。しかしLLMは違います。より多くのカードを購入したり、組織構造を調整したりするだけではうまくいきません。重要なのは基礎となる数学的本質への洞察です。

例えば、DeepSeekチームはKV Cache(モデルが文脈を処理する際に使用するキー情報)が高次元の複雑なデータのように見えますが、実際には低次元の潜在的な構造を持っていることを発見しました。これは、製造業の流れ作業では代替できない、物理数学における「複雑なシステムの簡略化モデルの特定」という直感に基づくものです。

二、中国チームのオリジナル的な突破は何を変えたのか?

以前、市場では「中国のAIは工学的なことはできてもオリジナルのことはできない」と一般的に考えられていましたが、DeepSeekとKimiの技術はこの偏見を打ち破りました:

  • DeepSeekのMLA技術:数学的な方法を用いてKV Cacheを低ランク分解し、モデルのコストを大幅に削減し、そのフレームワークをオープンソース化しました。これがなければ、国内のモデル(例えば智谱)はオープンソースのフレームワークに囚われたままでしょう。
  • KimiのKDA技術:注意機構の関数を再設計し、長文の推論時の誤差の蓄積問題を解決しました。

これらの突破により、国内のLLMは最先端に追いつき、OpenAIやAnthropicの独占を打破しました。以前は彼らが価格を自由に設定できましたが、今ではLLMが多様化しており、「高級製造業」という誤った認識さえ生まれています。さらに重要なのは、これによって資産価格の決定方法が変わったことです。以前は中国のAIが古い時代に閉じ込められていると市場は考えていましたが、これらのオリジナル技術により、中国の資産に対する見方が変わりました(例えば、中国科学院の公式ウェブサイトでもDeepSeekの成果が報じられています)。

三、直感はLLMにとってどれほど重要か?

ここでの「直感」とは、複雑なシステムの本質を見抜く能力のことです。例えば、標準的な注意機構におけるKV Cacheは高次元の行列ですが、線形代数を理解している大学院生なら低ランク分解を知っています。しかし、梁文锋チームだけが「KV Cacheには本来低次元の構造がある」と気づきました(「圧縮可能」ではなく、「本来単純」なのです)。

長距離推論は機能コンポーネントを追加するだけではなく、数学的な枠組みの再構築が必要です。注意機構が誤差の蓄積を抑制し、残差接続が勾配の意味を保持するようにするためには、「自己回帰誤差の指数関数的な減衰」に関する数学的な直感が必要です。このような直感は訓練によって得られるものではなく、特別な才能が必要です。例えば、情報幾何学の父である甘利俊一や、CNNの前身を発明した福島邦彦のような人々です。彼らのアイデアは日本で生まれましたが、アメリカや中国で成果を上げました。DeepSeekやKimiのチームメンバーは、静かに公式を導き、大胆に試行錯誤することができます。このような「偶然」は、著者によって「国運」とさえ呼ばれています。

四、LLMの数学的な弱点にはどのような問題が隠されているのか?

現在のLLMは、シャノン以前の通信業界のような状態です。エンジニアは電話を作ることはできますが、情報の本質を理解している人はいません。LLMの多くの重要な問題には厳密な数学的な証明がありません:

  • スケーリング法則(パラメータが大きいほどモデルの性能が向上する)はなぜ二乗則なのでしょうか?何兆ものパラメータがあっても成り立つのでしょうか?わかりませんが、とりあえず訓練してみましょう。
  • GRPOアルゴリズム(DeepSeekが使用している訓練方法)はなぜ収束するのでしょうか?チームは「試してみたら崩れなかった」としか言っていませんが、後になって消すことのできないバイアスがあることが発見されました。
  • 幻覚問題:モデルが無秩序に情報を生成しますが、その本質は高次元空間での確率分布が「適当に動いている」ことです。これは、モデルが「正解する」か「わからない」という間で最適な決定を下すための数学的な枠組みがないためです。

これらの問題は小さな問題ではありません。もしスケーリング法則が極限に達したら(パラメータがさらに大きくなってもモデルの性能が向上しない)、または圧縮・予測のトークンが単なる「フィッティングゲーム」に過ぎなければ、「AGIがいずれ到来する」という評価はすべて崩れます。市場の最近の変動はこれが原因かもしれません。

五、LLM競争の鍵は「数学の学習」

記事によると、LLM競争の後半では数学がより重要になります。現在のLLMには「風洞実験」さえありません。飛行機の設計者はマッハ数がどれだと振動するかを知っていますが、LLMはどれだけのパラメータが幻覚を引き起こすか、どれだけの文脈が意味のずれを引き起こすかを知りません。これらの問題を解決するためには:

1. 数学的な才能を持つ人材を招く:非凸最適化、行列計算、微分方程式に精通した人々に公式を導かせ、LLMの「無次元数」(例えば飛行機のレイノルズ数)を見つけさせる必要があります。

2. 「シャノンの瞬間」を待つ:シャノンが一ページの公式で情報を定義したように、将来は誰かが簡潔な公式でLLMの圧縮の限界や推論の一貫性の下限、自己回帰誤差の対策などを教えてくれる必要があります。

そうすることで、LLMは「確率生成器」から本当に信頼できるツールになります。さもなければ、MaaS(モデル即サービス)の高収益の話は幻想に過ぎません。誰が「無秩序な生成」に長期的な投資をするでしょうか?

最後に:若者へのアドバイス

著者は、才能と直感を持つ若者に数学や物理学を学ぶよう呼びかけています。もしかすると、将来誰かがLLMの「シャノンの定理」を書き出し、等価な知能の境界を公式で定義するかもしれません。それこそが真の「創世の瞬間」であり、お金では買えない突破口です。

この記事の核心的な論理は、LLMは「リソースを積み重ねる」ゲームではなく、「本質を見つける」競争であるということです。数学と直感が勝敗を決定する鍵であり、中国のチームはすでにその分野で重要な一歩を踏み出していますが、まだ長い道のりがあります。