Google Geminiは、384 × 384 pxまでの画像に対して258トークンを課金します。画像がこのサイズを超える場合、Geminiは768 × 768 pxのタイルごとに、さらに258トークンの課金を追加します。したがって、500 × 500 pxの画像は384 × 384 pxの画像と同じコストになりますが、1920 × 1080 pxのフレームは6つのタイルにまたがるため、1,548トークンを消費します。トークン量に応じて支払う開発者にとって、768ピクセルの境界を越えるかどうかで、コストが75%も変動する可能性があります。

Geminiの画像価格設定の仕組み

Geminiは画像を視覚的なパッチのグリッドとして扱います。384ピクセルの正方形は256個のパッチに分割され、視覚シーケンスの開始と終了を示す2つの追加トークンが加わることで、一律258トークンの価格となります。これより大きいサイズになるとタイリング処理がトリガーされます。システムは画像を768ピクセルのタイルに分割し、各タイルを個別に評価して、それぞれに258トークンを課金します。

トークン数は生のピクセル数ではなく、タイルの数に応じてスケールします。1280 × 720 pxの写真は2つのタイルを占有します(258 × 2 = 516トークン)。3840 × 2160 pxの4Kフレームは15個のタイルをカバーし、3,870トークンかかります。ルールは単純です。画像が占める768ピクセルの正方形の数を数え、それに258を掛ければ、トークン料金が算出されます。

なぜこのルールが重要なのか

Geminiのトークンモデルは、APIの費用に直結します。

請求額を抑えるための実践的な方法

  • タイル制限内に収める。 800 × 800 pxの画像は4つの768ピクセル・タイルに分割され、1,032トークン(768 × 768 pxの画像の4倍の価格)かかります。タイルの境界線に合わせてリサイズすることで、75%のコスト削減が可能です。
  • 余白を削る。 大きな白い余白も、トークン総数に含まれるパッチを生成します。これらの余白をクロップ(切り抜き)することで、コストを3分の2削減できる場合があります。
  • OCRの読み取りやすさに注意する。 Geminiは、文字の高さが概ね15〜20 pxある場合にのみテキストを読み取ります。ドキュメントをこの閾値以下に縮小してしまうと、モデルが単語を見逃し、より高価になる可能性があるテキスト入力へのフォールバックを余儀なくされます。
  • 「1行あたりの高さ」ルールを適用する。 プレーンテキストのドキュメントの場合、画像の総高さを「行数 × 25 px」にすることを目指してください。この「黄金律」により、行間を読みやすく保ちつつ、単一のタイル内に収めることができます。
  • 密度の高いデータには画像を使用する。 大規模なスプレッドシートやLaTeXの数式のスクリーンショットは、同じデータをテキストで入力するよりも、トークンあたりの情報量が多くなることがよくあります。密度が高い場合、画像の258トークンのコストは、同等のテキストペイロードよりも安くなる可能性があります。

画像がテキストに勝るケース

トークン経済性は、いくつかの種類のコンテンツにおいて画像に有利に働きます。

  • 非ラテン文字。 ヒンディー語、中国語、アラビア語などの文字は、短い概念を伝えるためにも多くの文字を必要とします。テキストモードでは各文字が依然としてトークンになりますが、同じ視覚情報が単一の画像タイルに収まる場合があります。
  • 複雑な数学記法。 LaTeXの数式はトークン数が膨大になります。数式をレンダリングした画像は1つのタイル内に収まり、多くの場合、生のLaTeX文字列よりも低コストで済みます。
  • 大規模なUIレイアウトや表。 フルスクリーンのUIモックアップや複数ページの表を画像としてレンダリングすることで、各要素を文章で説明する必要がなくなり、情報を少数のタイルに圧縮できます。

トレードオフ

画像サイズを無差別に削ると、逆効果になることがあります。文字が最小要件の15ピクセルを下回ると、GeminiのOCRが失敗し、開発者は生のテキスト送信に切り替えなければならず、結果としてトークン料金が膨らむ可能性があります。また、過度なクロッピングは、モデルが正しく回答するために必要なコンテキストを切り捨ててしまう恐れもあります。理想的なのは、タイルの境界を尊重しつつ、判読性を維持できる控えめなリサイズです。

まとめ

Geminiの画像トークンの計算方法を理解することで、隠れたコストを制御可能な変数に変えることができます。画像を768 px以下に保ち、不要なホワイトスペースを削り、テキストの読みやすさを確保することで、リクエストごとのトークンを数十から数百単位で節約できます。非ラテン文字、数学、表などのデータ密度の高いコンテンツでは、画像を使用することで、わずかなトークンコストで同等の知見を得られることがよくあります。盲目的な縮小ではなく、スマートな前処理こそが、効率的なGemini統合の鍵となります。

Source: dev.to/kushaagr