核心内容の要約
AIが現在に至るまでに進化する過程で、公開されているインターネットデータはほぼすべて利用され尽くされてしまった。より高度な機能(チャットボットから実際の仕事をこなせる「デジタル従業員」へ)を実現するため、AI企業は倒産したり買収されたスタートアップ企業の内部データ——コード、チャット記録、メール、会議の音声記録など——に目を向け始めている。このようなデータの取引は今年急増しているが、その背後にはプライバシー漏洩、法的な曖昧さ、倫理的な問題などが潜んでいる。皮肉なことに、GoogleやMetaなどの大手企業は既にプライバシーポリシーを変更することでユーザーデータを「合法的」にAIの訓練に利用しており、Mercorはその需要をよりグレーゾーンへと押し進めているだけだ。AIの進化は本質的に人間のデジタルプライバシーを消費するものであり、この矛盾は短期間で解決される見込みはない。
一、なぜAIは倒産した企業の「仕事の記録」を狙うのか?公開データだけでは不十分
AIの知能は何もないところから生まれるわけではなく、データを「与える」ことで成長する。以前は大手研究所がインターネット上のウェブページや論文、コード、フォーラムの投稿などを集めていたが、これが「公開データのフェスティバル」だった。しかし今ではその時代は終わりを告げている。AIが「チャットする」から「実際に仕事をする」へと進化するために必要なのは「答え」ではなく、「プロセス」——つまり、エンジニアがどのように問題を発見し、どのように解決策を議論し、コードを修正し、バグを解消するかといった情報だ。これらは倒産した企業の内部記録(SlackのチャットやZoomの音声記録、コードの変更履歴など)に隠されており、AIの訓練に最も欠けている「実際のビジネスデータ」だ。例えば、GitHubがAIのコード能力を飛躍的に向上させたのは、そのcommit記録(コードの変更履歴)が「問題→議論→修正→検証」という完全なプロセスを保持しているからだ。他の業界にはこのようなデータソースがないため、倒産した企業の内部データがその欠けている部分を補っており、Mercorが30万ドルを出して買収する理由でもある。
二、これらのデータを購入するリスク:プライバシー漏洩は氷山の一角
これらの内部データには非常に敏感な情報が含まれており、無造作に使用すると大きな問題が発生する可能性がある:
1. プライバシーの保護が不可能:Mercorは敏感情報を隠せると主張しているが、業界では「誰がいつ何を言い、それによってどのような行動が起こったか」という情報が最も価値があることが知られている。例えば、従業員の名前を「エンジニアA」に変更しても、職務やプロジェクト、顧客関係などの関連情報は完全に削除できず、簡単に再識別されてプライバシーが漏洩する。
2. 従業員の同意が得られていない:企業がデータを売却する際、従業員は自分のチャット記録や会議での発言が売られていることを知らされていない。知的財産権に関する契約を結んだからといっても、それが「仕事中の会話」をAIの訓練に使用する同意を意味するわけではない。
3. 商業秘密や偏見:データには顧客情報や企業の機密情報が含まれている可能性があり、さらに悪いことに、人間の仕事における偏見(特定の顧客への差別や意思決定の誤りなど)がAIによって複製・拡大され、「アルゴリズムのバイアス」として現れる。
4. 法的な規制がない:世界中で「企業が内部データをAI企業に売却できるか」について明確な規定がないため、これは法的な空白地帯だ。これによりAIの急速な発展が可能になる一方で、プライバシー漏洩の危険も生じる。
三、大手企業も既に行っている:プライバシーポリシーを変更すれば、あなたのデータはAIの燃料に
Mercorだけがグレーゾーンで取引をしているわけではない。GoogleやMetaなどの大手企業も既にユーザーデータを「合法的」にAIの訓練に利用している:
- Googleは2023年の独立記念日にプライバシーポリシーをこっそりと更新し、「公開情報を使ってAIを訓練する」と宣言した(GmailのメールやGoogle Docsの文書、検索履歴なども含まれる)。2026年にはすべてのユーザーを自動的にAIの訓練プログラムに組み込み、ユーザーが自ら退出する必要があった。
- Metaも2023年にポリシーを変更し、FacebookやInstagramの公開投稿や写真を使ってAIを訓練している。2024年にはEUのユーザーデータの使用を一時的に停止したが、2026年に再開し、ユーザーには「反対」する権利のみを与えている(同意ではない)。
要するに、Mercorは大手企業がこっそりと行っていたことを表に出しただけであり、違いは大手企業が「サービス利用規約の変更」という合法的な手段を使っているのに対し、Mercorはグレーゾーンを歩んでいる。
四、この問題をどう解決するか?法律、技術、自律が必要だが道のりは長い
この矛盾は解決不可能ではないが、各方面の協力が必要だ:
1. 法的な規制の整備:「これらのデータの所有者は誰か」(企業?従業員?顧客?)や、「データを売却する前に誰の同意が必要か」を明確にする必要がある。
2. 技術的なプライバシー保護:「フェデレーテッドラーニング」(データが存在する場所でAIを訓練し、元のデータを出さない)や「差分プライバシー」(データにノイズを加えて特定の人物を識別できなくするがAIの学習には影響しない)といった技術により、プライバシー漏洩のリスクを減らすことができる。
3. 業界や企業の自律:データを扱う企業はトレース可能な仕組みを確立し、データを売却する前に従業員に明確に通知し同意を得る必要がある。
しかし、これらの解決策には時間がかかる。AI企業は発展を続けたいし、ユーザーはプライバシーを守りたいし、大手企業は利益を求めているため、この問題の解決は容易ではない。短期間でAIの進化が止まることはなく、「人間のデジタルプライバシー」を消費する競争はまだ続く。
最後に
AIの知能が向上するたびに、私たちが残したデジタル痕跡が消費されている。公開されたウェブページから仕事の記録まで、大手企業による「合法的な」収集からグレーゾーンでの取引まで……私たちはAIの強さに驚きつつも、その知能の基盤が多くの人々のプライバシーに基づいているという事実を受け入れなければならない。将来は法的な規制が導入されるだろうが、現在この「プライバシーと知能の交換」というゲームは続いている。