Claudeの新しいDeep Researchツールは、1回の呼び出しで657万トークンを処理することができ、これは膨大な計算予算があって初めて維持できるものです。このシステムは単一のモノリシックな言語モデルではなく、検索を分散させ、データを取得し、主張を3つの独立した検証器と照らし合わせ、最終的にレポートを合成する、厳格なJavaScriptのマップリデュース・パイプラインとして動作します。
なぜそのアーキテクチャが重要なのか
ほとんどのAI搭載型リサーチアシスタントは、単一の「問いと答え」のインターフェースを提供し、モデルにテキストと引用を一度に生成させます。ClaudeのDeep Researchはそのモデルを覆します。タスクを個別の、型定義されたステージに分割し、モデルにソフトウェア・ハーネスに従うことを強制します。設計者は、豊富な情報源に基づいた回答を提供しつつ、ハルシネーション(幻覚)を抑制するように構築しました。このアプローチは、仮説を生成した後にそれを意図的に論破しようとする、自動バグハンティング・フレームワークに由来しています。リサーチの観点から言えば、ある主張が生まれ、それが最終的な合成に到達する前に、3つの敵対的エージェントがそれを打ち消そうとするのです。
マップリデュースのフロー
- Fan-out search(検索の分散) – オーケストレーターが並列ワーカーを生成し、さまざまなデータソースに対してクエリを実行します。
- Fetch data(データの取得) – 各ワーカーが、生の断片(スニペット)、メタデータ、および利用可能な構造化情報を取得します。
- Adversarial verification(敵対的検証) – 3つの独立したエージェントがすべての主張を受け取り、各エージェントは不確実な場合にはデフォルトで refuted(却下)とするよう指示されます。主張は、十分な肯定票を集めた場合にのみ生き残ります。
- Synthesis(合成) – 生き残った主張は、ユーザーが散文としてレンダリングできる最終的なJSONレポートへとまとめられます。
ハーネスの内部構造
ハーネスは、言語モデルができることを定義する薄いコードのレイヤーです。そのルールは、一連の構造化されたタスクとして現れます。
- SCOPE – モデルは、リサーチの問いに関する簡潔な説明を受け取ります。
- SEARCH – ソース識別子のリストを出力しなければならず、自由形式のテキストは許可されません。
- EXTRACT – 各ソースについて、モデルは後続の主張を裏付ける逐語的な引用を返します。
- VERDICT – 主張、裏付けとなる引用、および信頼度スコアを含むJSONオブジェクトを生成します。
- REPORT – 最終ステージでは、検証済みのすべての主張を単一のドキュメントにまとめます。
ハーネスは evidence binding(証拠の紐付け)を強制します。正確な引用がない主張は自動的に破棄されます。また、コードを変更することなく調整可能な policy constants(ポリシー定数)も公開されています。これには、主張に必要な肯定票の数、システムが読み取ることができるソースの数、または検証に進む主張の最大数などが含まれます。
抽出と検証の間には、トリアージのステップが設けられています。すべての主張をコストのかかる敵対的エージェントに送るのではなく、システムは重要度とソースの品質に基づいてそれらをランク付けし、上位25件のみを転送します。この選別により、トークン使用量と計算コストが制御不能になるのを防いでいます。
実践における敵対的検証
検証ステージは意図的に厳格に設定されています。3つのエージェントのそれぞれが、同じ主張とそのソースの引用を受け取り、決定的な証拠が見つからない限りその主張は誤りであると仮定するように指示された命令セットの下で動作します。エージェントが少しでも疑わしいと感じれば、refuted(却下)に投票します。主張が生き残るためには、設定可能な数の affirmed(承認)票を集める必要があります。
非公式なテスト中、敵対的レイヤーはある主張が、集計指標を特定の精度(precision)スコアと誤読していることを検知しました。モデルは精度について自信に満ちた記述を生成していましたが、ソースが報告していたのは集計指標のみでした。
この設計がAIシステム構築について示唆すること
- 制御と推論の分離 – モデルは推論に責任を持ち、ハーネスはプロセスの規律を強制します。
- 型定義されたインターフェースによるハルシネーションの抑制 – JSON出力と正確な引用を要求することで、システムは自由形式による逸脱を排除します。
- コストのかかる検証ステップの前に主張をフィルタリングすることで、トークン使用量と計算コストを削減する。
- 外部入力を信頼できないものとして扱う – すべてのソースの引用は独立したエージェントによって再チェックされ、単一の誤ったドキュメントが回答を汚染するのを防ぎます。
これらの原則は、「model-outside-the-model」アーキテクチャへの広範なシフトを反映しています。そこでは、確率的な言語モデルの代わりに、決定論的なコードがオーケストレーション、検証、およびリソース割り当てを担います。
潜在的な欠点と未解決の課題
パイプラインの強みである「厳格さ」は、同時に課題ももたらします。
もう一つの論争点は、逐語的な引用への依存です。すべての知識が正確な言い回しの中に存在するわけではありません。複数の文書を統合して初めて得られる洞察もあります。
次に注目すべき点
ClaudeのDeep Researchはまだ研究段階にありますが、そのアーキテクチャは、大規模言語モデルが自己主導に任されるのではなく、厳密に制御されたパイプラインに組み込まれる未来を予感させます。監視すべき主な指標は以下の通りです:
- トークン効率の指標 – ハーネスがより選択的なトリアージ・ロジックを備えるにつれて、6.57Mトークンのベースラインは縮小していくのでしょうか?
- レイテンシの傾向 – 3つの検証エージェントがループ内に介在する場合、システムはどれほど迅速に完全なレポートを返せるのでしょうか?
まとめ
ClaudeのDeep Researchは、規律ある多段階のパイプラインに限定することで、言語モデルが信頼性が高く、ソースに基づいた回答を生成できることを示しています。真のブレイクスルーはモデルのサイズではなく、モデルにすべての主張を証明させ、計算リソースを消費する前に証拠をランク付けさせ、3つのエージェントが同意するまではすべての外部スニペットを疑わしいものとして扱うように強制する、周囲のソフトウェアにあります。AI駆動型のツールを構築するすべての人にとって、教訓は明確です。モデルには考えさせ、何を言えるかはコードに決めさせるのです。
