核心内容の要約
この記事は、一見すると普通のユーザーがAIを使ってチャットのスクリーンショットを処理する実践的なメモのように見えますが、実際には「証拠として使用できる連続したチャットのスクリーンショット」を作成するという非常に高い要求のプロジェクトを通じて、一般人がAIを使って複雑な非標準的なタスクを完了する全プロセスを詳細に再現しています。最初は「チャットのスクリーンショットを整理してほしい」というあいまいな指示から始まり、何度も失敗を繰り返し、数十の具体的な検証ルールを追加した結果、最終的には131枚のエラーのない合格したスクリーンショットが作成されました。これにより、「万能のプロンプトを書けばAIで何でもできる」というネット上の神話が完全に打ち砕かれ、個人でも企業でもAIを活用する際に役立つ実用的な作業ロジックが示されました。
---
詳細な解説
1. 90%の人がAIをうまく使えないのは、「受け入れ基準」があいまいだから
AIを使って問題が発生すると、多くの人は「AIが鈍いからだ」と考えがちですが、著者が最初に遭遇した失敗からそれがわかります。著者はAIにまず計画を立ててから処理を行うように指示しましたが、AIが提出した報告書には「音声の転写件数が0件」と記載されていました。実際にはスクリーンショットの半分に音声が転写されていない部分がありました。これはAIが意図的に嘘をついたわけではなく、あなたとAIが「合格とは何か」について全く異なる理解をしていたからです。あなたが考える「合格したスクリーンショット」とは、「すべての音声がテキストに変換され、前後がつながり、証拠として使用できる」というものですが、AIが理解する「合格」とは「明らかな空白の転写領域がない」というだけです。これは、外部にアプリの開発を依頼したり、部下に仕事を割り当てたりする際にも同じような問題が発生します。あなたが「見た目も使いやすいページを作ってほしい」と言っても、相手が提出するものは期待とは大きく異なるでしょう。あいまいな要求では正確な結果は得られません。明確に指示しなければ、AIは自分にとって最も簡単な方法で処理を行うだけです。
2. AIの実行力は非常に高いが、「察する」ことはできない
著者が2回目以降に行った作業では、あいまいな要求をすべて、主観的な判断を必要としない具体的な検証項目に分解しました。例えば、音声が正しく転写されているかを判断するには、「空白の転写領域がないか」だけを確認するのではなく、①空白や読み込み中の転写領域がないこと、②音声の下に実際にテキストが表示されていること、③音声領域に円を描くような処理がないことの3つの条件を満たす必要があります。また、2枚のスクリーンショットが連続しているかを判断するには、単に「ページの見た目が似ている」だけではなく、2枚のスクリーンショットに共通するメッセージや同じタイムスタンプを見つける必要があります。AIは実行力は高いですが、「人情世故」がなく、あなたの意図を推測することはできません。あなたが望む結果をチェック項目に分解できれば、AIは数万枚のスクリーンショットを1秒ですべて確認でき、10人のインターンが午後中かけて手作業するよりも正確です。多くの企業が数百万円をかけて大規模なAIモデルを購入しても実際には活用できないのは、このようなルールの分解作業を行っていないからです。AIに「自分で判断してほしい」と思っているだけで、最終的には使えないものができてしまいます。
3. 「真実性」が関わるタスクでは、AIに「自由な発揮の余地」を与えてはいけない
著者が4回目に遭遇した失敗は非常に重要な教訓です。WeChatで長い音声の転写を行うと自動的にフレームが飛ぶことがありますが、元のビデオにはフレームが飛ぶ前後の完全な画像が含まれていません。AIはチャットの意味の流れに従って連続したスクリーンショットを作ろうとしますが、著者は「実際の接続部分が見つからない場合は無理に作ることはできず、欠けている部分を示すか分割しなければならない。現実に存在しない内容を生成してはいけない」というルールでAIを制限しました。これは大規模なAIモデルの最も危険な弱点を突いています。AIは「論理を補完する」傾向があり、これが「幻想」を生み出す原因です。現在、多くの人がAIを使って財務報告の整理や証拠の整理などを行っていますが、最もよく犯す間違いは「常識に基づいて推測してもよい」とAIに権限を与えることです。もし「すべての内容は元の素材から来なければならず、見つからない場合は無理に作ってはいけない」と明確に指示しなければ、AIは存在しないチャット記録や財務データを作り出してしまいます。これらを証拠や公開資料として使用すると、問題が発生した際には追跡ができません。
4. 「万能のプロンプト」など存在せず、効率的なAIのワークフローは小さなステップでルールベースを積み上げるもの
著者が最後に振り返ったところによると、たとえ最初にAIに計画を立ててもらっても、すべての奇妙なケースを事前に予想することは不可能です。例えば、スクリーンショットの最後に自動的に前のチャット内容が表示されたり、WeChatで長い音声を選択するとフレームが飛んだりするといった細かい問題は、オフィスに座って考えても予測できません。ネット上で広まっている「これら100個のプロンプトを保存しておけばAIが自動的に作業をしてくれる」というのは、実際には無駄なことです。実際に機能するAIのワークフローは、一度に完璧な指示を書くのではなく、「小さなステップで試行錯誤」を繰り返し、ルールベースを構築するものです。まずは10%のサンプルデータでテストを行い、遭遇したすべての問題を固定の検証ルールに変えます(著者が言うところの43項目のテスト)。新しい問題に遭遇するたびにルールベースに追加し、次回全データを処理する際には同じ間違いを繰り返さないようにします。このロジックは、あらゆる業界でAIを導入する際にも同じです。最初からコストを90%削減できるようなAIの画期的な技術は存在せず、実際に使えるAIツールは、実際のデータを処理する過程で経験した問題を解決し、徐々に洗練されていくものです。