Google Gemini cobra 258 tokens por cualquier imagen de hasta 384 × 384 px. Si una imagen supera ese tamaño, Gemini añade otro cargo de 258 tokens por cada cuadrícula de 768 × 768 px. Por lo tanto, una imagen de 500 × 500 px cuesta lo mismo que una de 384 × 384 px, mientras que un fotograma de 1920 × 1080 px abarca seis cuadrículas y utiliza 1,548 tokens. Para los desarrolladores que pagan por token, cruzar el límite de los 768 píxeles puede variar el coste en un 75 %.
Cómo Gemini pone precio a las imágenes
Gemini trata las imágenes como una cuadrícula de parches visuales. Un cuadrado de 384 píxeles se divide en 256 parches; dos tokens adicionales marcan el inicio y el final de la secuencia visual, lo que da el precio fijo de 258 tokens. Cualquier cosa más grande activa un proceso de división en cuadrículas: el sistema divide la imagen en cuadrículas de 768 píxeles, evalúa cada cuadrícula de forma independiente y factura cada una a 258 tokens.
El recuento de tokens escala con el número de cuadrículas, no con los píxeles brutos. Una foto de 1280 × 720 px ocupa dos cuadrículas (258 × 2 = 516 tokens). Un fotograma 4K de 3840 × 2160 px cubre quince cuadrículas, con un coste de 3,870 tokens. La regla es sencilla: cuenta los cuadrados de 768 píxeles que ocupa la imagen, multiplícalos por 258 y tendrás la factura de tokens.
Por qué es importante esta regla
El modelo de tokens de Gemini se traduce directamente en gastos de API.
Formas prácticas de reducir la factura
- Mantente por debajo del límite de la cuadrícula. Una imagen de 800 × 800 px se divide en cuatro cuadrículas de 768 píxeles, lo que cuesta 1,032 tokens, cuatro veces el precio de una imagen de 768 × 768 px. Redimensiona al límite exacto de la cuadrícula y ahorra un 75 %.
- Recorta el espacio vacío. Los márgenes blancos grandes siguen generando parches que cuentan para el total de tokens. Recortar esos márgenes puede reducir los costes en dos tercios.
- Ten en cuenta la legibilidad del OCR. Gemini lee texto solo cuando los caracteres tienen aproximadamente entre 15 y 20 px de altura. Si reduces la escala de un documento por debajo de ese umbral, el modelo omitirá palabras, obligando a recurrir a una entrada de texto que puede ser más cara.
- Aplica una regla de altura por línea. Para documentos de texto plano, intenta que la altura total de la imagen sea igual al número de líneas multiplicado por 25 px. Esta "fórmula de oro" mantiene el interlineado legible mientras te mantienes dentro de una sola cuadrícula.
- Prefiere imágenes para datos densos. Una captura de pantalla de una hoja de cálculo grande o una ecuación de LaTeX a menudo contiene más información por token que escribir los mismos datos. Cuando la densidad es alta, el coste de 258 tokens de la imagen puede ser más barato que la carga de texto equivalente.
Cuándo las imágenes superan al texto
La economía de tokens se inclina a favor de las imágenes para varios tipos de contenido:
- Escrituras no latinas. El hindi, el chino, el árabe y escrituras similares requieren muchos caracteres para transmitir una idea corta; cada carácter sigue convirtiéndose en un token en modo texto, mientras que la misma información visual cabe en una sola cuadrícula de imagen.
- Notación matemática compleja. Las fórmulas de LaTeX disparan el recuento de tokens. Una imagen renderizada de la fórmula se mantiene dentro de una cuadrícula, costando a menudo menos que la cadena de texto LaTeX original.
- Diseños de UI o tablas grandes. Renderizar un prototipo de UI a pantalla completa o una tabla de varias páginas como imagen evita la necesidad de describir cada elemento con prosa, comprimiendo la información en un puñado de cuadrículas.
El equilibrio
Reducir el tamaño de la imagen indiscriminadamente puede ser contraproducente. Si los caracteres se encogen por debajo del mínimo de 15 píxeles, el OCR de Gemini falla y los desarrolladores deben recurrir al envío de texto sin procesar, lo que podría inflar la factura de tokens. Un recorte demasiado agresivo también podría eliminar el contexto que el modelo necesita para responder correctamente. El punto óptimo es un redimensionamiento modesto que respete el límite de la cuadrícula preservando la legibilidad.
Conclusión
Comprender la aritmética de tokens de imagen de Gemini convierte un coste oculto en una variable controlable. Mantén las imágenes en 768 px o menos, recorta los espacios en blanco innecesarios y asegúrate de que el texto siga siendo legible para ahorrar decenas o cientos de tokens en cada solicitud. Para contenido con alta densidad de datos (escrituras no latinas, matemáticas, tablas), las imágenes suelen ofrecer la misma información por una fracción del precio en tokens. El preprocesamiento inteligente, y no el redimensionamiento a ciegas, es la clave para una integración eficiente de Gemini.
Fuente: dev.to/kushaagr
