Google Gemini berechnet 258 Token für jedes Bild bis zu einer Größe von 384 × 384 px. Wenn ein Bild diese Größe überschreitet, fügt Gemini für jedes 768 × 768 px große Kachelsegment (Tile) weitere 258 Token hinzu. Ein 500 × 500 px großes Bild kostet daher dasselbe wie ein 384 × 384 px großes, während ein 1920 × 1080 px Frame sechs Kacheln umfasst und 1.548 Token verbraucht. Für Entwickler, die pro Token bezahlen, kann das Überschreiten der 768-Pixel-Grenze die Kosten um 75 % verändern.
Wie Gemini Bilder bepreist
Gemini behandelt Bilder als ein Gitter aus visuellen Patches. Ein Quadrat von 384 Pixeln wird in 256 Patches unterteilt; zwei zusätzliche Token markieren den Anfang und das Ende der visuellen Sequenz, was zum Pauschalpreis von 258 Token führt. Alles, was größer ist, löst einen Kachelvorgang (Tiling) aus: Das System zerlegt das Bild in 768-Pixel-Kacheln, bewertet jede Kachel unabhängig und berechnet für jede 258 Token.
Die Token-Anzahl skaliert mit der Anzahl der Kacheln, nicht mit den rohen Pixeln. Ein 1280 × 720 px Foto belegt zwei Kacheln (258 × 2 = 516 Token). Ein 3840 × 2160 px 4K-Frame deckt fünfzehn Kacheln ab und kostet 3.870 Token. Die Regel ist einfach: Zählen Sie die 768-Pixel-Quadrate, die das Bild einnimmt, multiplizieren Sie diese mit 258, und Sie haben die Token-Rechnung.
Warum diese Regel wichtig ist
Das Token-Modell von Gemini schlägt sich direkt in den API-Kosten nieder.
Praktische Wege, um die Rechnung zu senken
- Bleiben Sie unter dem Kachel-Limit. Ein 800 × 800 px Bild teilt sich in vier 768-Pixel-Kacheln auf, was 1.032 Token kostet – das Vierfache des Preises eines 768 × 768 px Bildes. Passen Sie die Größe exakt an die Kachelgrenzen an und sparen Sie 75 %.
- Leerraum entfernen. Große weiße Ränder erzeugen weiterhin Patches, die zur Token-Gesamtzahl beitragen. Das Zuschneiden dieser Ränder kann die Kosten um zwei Drittel senken.
- OCR-Lesbarkeit beachten. Gemini liest Text nur, wenn die Zeichen etwa 15–20 px hoch sind. Verkleinern Sie ein Dokument unter diesen Schwellenwert, übersieht das Modell Wörter und ist gezwungen, auf Texteingaben zurückzugreifen, die teurer sein können.
- Wenden Sie eine Zeilenhöhen-Regel an. Streben Sie bei reinen Textdokumenten eine Gesamthöhe des Bildes an, die der Anzahl der Zeilen multipliziert mit 25 px entspricht. Diese „goldene Formel“ hält den Zeilenabstand lesbar und bleibt gleichzeitig innerhalb einer einzigen Kachel.
- Bilder für dichte Daten bevorzugen. Ein Screenshot einer großen Tabellenkalkulation oder einer LaTeX-Gleichung enthält oft mehr Informationen pro Token als das Abtippen derselben Daten. Bei hoher Datendichte kann der Preis von 258 Token für das Bild günstiger sein als die entsprechende Textlast.
Wann Bilder Text überlegen
Die Token-Ökonomie verschiebt sich bei verschiedenen Arten von Inhalten zugunsten von Bildern:
- Nicht-lateinische Schriftsysteme. Hindi, Chinesisch, Arabisch und ähnliche Schriften benötigen viele Zeichen, um eine kurze Idee zu vermitteln; jedes Zeichen wird im Textmodus immer noch zu einem Token, während dieselbe visuelle Information in eine einzige Bildkachel passt.
- Komplexe mathematische Notation. LaTeX-Formeln lassen die Token-Anzahl explodieren. Ein gerendertes Bild der Formel bleibt innerhalb einer Kachel und kostet oft weniger als der rohe LaTeX-String.
- Große UI-Layouts oder Tabellen. Das Rendern eines Full-Screen-UI-Mockups oder einer mehrseitigen Tabelle als Bild umgeht die Notwendigkeit, jedes Element in Prosa zu beschreiben, und kom
