なぜ新しいモデルは「負荷が高い」と感じるのか

Googleは、複数の段階を経て思考する必要がある自律型エージェント向けにGemini 3.8 Flashを構築しました。通常は一度のパスで回答するGemini 3.7 Flashとは異なり、3.8は問題をサブクエスチョンに分解し、外部APIを呼び出し、納得がいくまで反復処理を行います。Googleは、この追加の思考プロセスによって、特に「effort(努力量)」設定が高い場合に、より多くのトークンを消費すると警告しています。

独立した分析によると、タスクあたりの出力トークン数は3.7 Flashと比較して約**30%増加し、インタラクションのターン数も増加しています。トークンあたりの料金は変わらないため、多くの実務的なワークロードにおいて、実質的なコストは約40%**上昇します。

開発者にとって重要なベンチマーク

このトレードオフは、単なる理論上の話ではありません。DeepSWE v1.1ソフトウェアエンジニアリング・ベンチマークの直接対決において、Gemini 3.8 FlashはAnthropicのFable 5を決定的に打ち負かしました。また、同モデルはVals Finance Agent V2およびHarvey’s Legal Agentのベンチマークでも首位を獲得しており、複雑な財務計算や微妙なニュアンスを含む法的推論を処理できることを証明しています。

Aigora.aiのCEOであるJohn Ennis氏は、その優位性を次のようにまとめています。このモデルは、「Opus 5レベルのコーディング品質」を提供しながら、わずかなコストと著しく高いスピードで動作します。彼は、高速な推論と高度なコード生成によって制作パイプラインを数時間短縮できる、Remotionビデオの生成といったユースケースを挙げています。

変わりゆくAIの経済学

かつて開発者は、トークン単価によって手頃さを判断していました。しかし、マルチターンでツールを活用するエージェントの登場により、その指標は「タスク成功あたりの価格」へと変化しています。Gemini 3.8 Flashの場合、同じ結果に到達するためにモデルがより多くのトークンを消費する場合、トークン単価が安くても請求額が安くなるとは限りません。

Googleは、このモデルを非常に高価なフロンティアモデルと、軽量なシングルターン生成モデルの中間に位置づけています。「intelligence-on-demand(オンデマンドの知能)」というブランディングにより、同社は、通常、大規模で低速なモデルに伴うレイテンシを抑えつつ、より高い推論能力を活用できることを示唆しています。トレードオフは明確です。より洗練された出力は、総トークン数の増加を意味します。

旧バージョンを使い続けるべきケース

コストの予測可能性を厳格に求めるチーム、特に大規模なバッチジョブを実行している場合や、利益率の低い業務を行っている場合は、Gemini 3.7 Flashを使い続けるべきです。旧モデルは依然として低レイテンシで安定したトークン消費量を提供するため、月間の支出予測が容易になります。

今後の注目点

  • ツール呼び出しの価格設定:

結論

Gemini 3.8 Flashは、より高度な推論がFlashレベルのレイテンシで実現可能であることを示していますが、インタラクションあたりのトークン消費量は増えています。高度で多段階的なAIエージェントを構築する開発者にとって、そのパフォーマンス向上は魅力的ですが、隠れたトークンコストをカバーするために予算調整を行う必要があります。それ以外のすべての人にとっては、旧バージョンの3.7 Flashが、より安全で予測可能な選択肢であり続けます。