核心内容の概要
この報道は、現在非常に注目を集めている大規模なAIモデル業界に冷や水を浴びせるものです。現在のすべての主流AI製品(GPTから国内の通義千問まで)の基盤となっているのは、2017年にGoogleが提案したTransformer技術であり、この技術によってAI業界は過去7年間で前例のない高みに達しました。しかし、その性能にはもはや限界があるとされています。最近登場した「長い文脈の処理」や「推論の高速化」といった新機能も、実際には既存の技術の欠陥を補うものであり、計算コストの急増、エネルギー消費の増大、複雑なタスクの処理不能といった根本的な問題を解決していません。
現在、歴史的な負担がないAIスタートアップ企業たちは、4つの全く異なる技術的アプローチで突破口を見つけています。これらのアプローチにより、AIモデルの処理速度を数倍にし、コストを大幅に削減することができ、さらには現在のTransformerでは不可能な複雑な推論タスクも実現できるようになりました。これらは次のAI業界の爆発的な成長のきっかけとなる可能性があり、現在の競争構造を根本的に変えるかもしれません。
---
詳細な解説
1. かつてのAIの「強み」が、なぜ今では足かせになっているのか?
Transformerの最大の強みであると同時に、現在の最大の弱点でもあります。テキストを処理する際のロジックが非常に硬直的で、1万文字の入力に対して、それぞれの文字を残りの9999文字と一つ一つ比較し、関連性を計算しなければなりません。これは、1万文字の記事を読む際に、任意の2文字の組み合わせをすべて検討してから全体の意味を決定するようなものです。精度は高いですが、コストが非常に高くなります。1万文字に対して5000万回の乗算処理が必要であり、OpenAIは年間500億ドルを計算リソースの購入に費やしています。国際エネルギー機関の予測によると、2030年までに世界中のデータセンターの電力消費は倍増し、それはEU全体の電力消費量に匹敵するとされています。
さらに問題なのは、AIが扱うタスクがますます複雑になっていることです。例えば、コードライブラリ全体を読んだり、数週間にわたって自動的に科学研究を行ったり、数十万の数学問題を解いたりするようなタスクには、Transformerの硬直的な処理方式では対応できません。現在、長い文脈の処理機能は、サーバーを増やしたりパッチを適用したりすることで対応していますが、これはまるで20年前の古いコンピューターに外付けハードディスクを10個接続して最新の3Dゲームを動かそうとするようなもので、一時的な解決策に過ぎません。
2. 注意力メカニズムの最適化:不要な計算を90%削減しながらも性能を維持
1つ目のアプローチは最も実用的です。Transformerの大枠組みを変えずに、最も電力を消費する「文字ごとの比較」の部分を改善し、不要な計算をすべて削減します。以前にも「スパースアテンション」という類似の技術がありましたが、計算量を削減するとAIの意味理解能力が低下してしまいました。しかし、SubquadraticとManifest AIという2つのスタートアップ企業がこの問題を解決しました。Subquadraticは動的な選択メカニズムを開発し、AIが記事を読む際に重要な情報と無関係な単語をリアルタイムで判断し、重要な単語間のみを比較するようにしました。その結果、性能が市場の主流AIモデルに匹敵するようになり、多くの人が試用を待っています。Manifest AIは従来の全量アテンション方式を「ローリングサマリー」方式に置き換えました。これは、3時間の会議の議事録を作成するようなもので、すべての発言を記録する必要はなく、関連する重要な内容のみを継続的に更新するだけで、計算量を大幅に削減できます。既存のオープンソースAIモデルでも、基盤コードを少し変更するだけでこの機能を利用できるようになりました。
3. 逆転のアプローチ:大規模なモデルを使わずに、小規模なモデルの方がより賢く、電力も節約できる
業界では一般的に「モデルのパラメータが多ければ多いほど賢い」とされていますが、MIT出身のLiquid AIはその考え方を逆転させました。彼らはウォームの脳から着想を得た「液体ニューラルネットワーク」とTransformerを組み合わせて、通常のAIモデルの数分の1のサイズで4倍の性能を実現しました。通常のTransformerモデルは一度訓練するとそのパターンが固定されてしまいますが、この液体モデルは実行中に新しい情報に応じて自己調整する能力を持っています。これは、人間が新しい資料を見ながら新しい知識を学ぶのに似ており、事前にすべての情報を頭に刻む必要がありません。彼らのモデルは50ドルのRaspberry Piで動作し、車載用の低価格チップでも動作します。年収1000万ドル未満の小規模企業でも無料で利用できるため、AIの利用ハードルを大幅に下げることができます。これにより、クラウドサーバーを使わずにスマートフォンで高性能なAIを実行でき、プライバシー漏洩や応答の遅さの心配もありません。
4. 文字ごとの処理の問題を解決:AIに一気に全文を出力させ、処理速度を10倍に
AIチャットツールを使ったことがある人ならわかると思いますが、AIは文字を一つずつ出力するため、完全な回答を得るまでに時間がかかります。これは意図的なものではなく、Transformerの固有の制限です。AIは最初の文字を計算した後に次の文字を計算しなければならないため、効率が非常に低いです。現在、画像生成で成功している「拡散技術」をテキストAIモデルに応用する企業もあります。拡散技術は、画面に表示された雪のような点を一度に高解像度の画像に変換するものですが、この技術を改良することで、AIが乱れた単語を一度にまとまった文章に変換できるようになりました。Inceptionというスタートアップ企業が開発した最新モデルは、2023年のGPT-4に匹敵する性能を実現し、コストは10分の1に削減されました。Googleもこのアプローチでプロトタイプを開発しており、AIに質問すると入力を終えるとすぐに回答が得られます。
5. 最終的なアプローチ:AIに文字で考えさせず、抽象的な論理で問題を解決させる
現在のすべてのTransformerモデルには「知能の限界」があります。すべての処理は文字列に変換されなければならないため、例えば数独を解いたりチェスをしたりする際には、各ステップを「次に3行5列の5を動かす」と頭の中で言わなければなりません。これは効率が非常に低く、言葉で表現できない抽象的な問題には対応できません。以前のテストでは、主流のAIモデルが非常に難しい数独問題を解けないこともありました。Pathwayというスタートアップ企業は、Transformerのアテンションメカニズムを完全に廃止し、「状態空間」という数学的な論理を使用して情報を抽象的な構造に圧縮しました。これにより、97%の非常に難しい数独問題を解決できるようになりました。彼らのモデルは、既存のテキスト知識のみを学ぶのではなく、オリジナルの科学研究や癌のような問題に取り組むためには、「文字で考える」必要がなくなりました。