El modelo Fable 5 de Anthropic superó la primera medalla de gimnasio en 1.785 turnos, gastando 65,40 $, mientras jugaba a una versión en chino de Pokémon FireRed utilizando únicamente la salida visual del juego. La partida demuestra que el modelo puede completar un segmento reconocible del juego sin ningún prompt textual, pero un análisis profundo de la cadena de pensamiento del modelo muestra que estaba recitando conocimientos memorizados del juego en lugar de "ver" y razonar realmente sobre cada píxel.

La afirmación de Anthropic puesta a prueba

Cuando Anthropic lanzó Fable 5, la empresa destacó una demostración de "solo visión" en la que el modelo navegaba por Pokémon FireRed mirando únicamente la pantalla. El titular hacía que pareciera que el sistema podía interpretar cualquier entorno visual desde cero. Un desarrollador se propuso verificar esa afirmación reproduciendo la configuración descrita en la página de lanzamiento de Anthropic y ejecutando el modelo en una traducción al chino del juego.

Cómo se llevó a cabo el experimento

Un entorno de pruebas (harness) personalizado alimentó al modelo con fotogramas de vídeo sin procesar y capturó sus elecciones de acción. El entorno coincidía con la descripción de Anthropic, pasando cada nuevo fotograma al modelo y leyendo la entrada del mando seleccionada. La prueba ejecutó el bucle completo del juego hasta que el modelo obtuvo su primera medalla de gimnasio, y luego continuó hasta el turno 2.000, cuando el avatar llegó a la Ruta 3.

El resultado cuantitativo fue claro:

  • Primera medalla de gimnasio obtenida tras 1.785 turnos
  • Coste total de computación 65,40 $
  • Para el turno 2.000, el avatar estaba en la Ruta 3

Qué revelan los registros

Los registros brutos, sin embargo, cuentan una historia diferente sobre cómo llegó el modelo hasta allí. La "cadena de pensamiento" interna del modelo anotaba repetidamente información que aún no había aparecido en pantalla.

  • En el turno 78, el modelo señaló que el rival elegiría a Charmander, a pesar de que el juego no había mostrado la selección del rival.
  • 141 turnos después, cuando el juego finalmente entregó al jugador el Paquete de Oak (Oak's Parcel), el modelo ya había registrado el nombre del objeto en sus notas.
  • Mientras atravesaba la Ruta 3, el modelo identificó a un entrenador específico citando una famosa línea de diálogo que nunca apareció en la señal visual.

Estas entradas no son producto de un análisis píxel por píxel. Son el sello distintivo de un sistema que ha internalizado un guion detallado del juego, exactamente el tipo de conocimiento que se encuentra en las guías (walkthroughs), wikis y vídeos de fans que pueblan internet. En otras palabras, el modelo parece utilizar la visión simplemente para confirmar un mapa que ya se sabe de memoria.

Por qué es importante para los benchmarks de razonamiento visual

El experimento subraya un fallo sutil pero crítico en muchas pruebas de razonamiento visual:

  • Una entrada limpia no garantiza un estado de conocimiento limpio. Incluso cuando el único canal es un flujo de imágenes, el modelo puede recurrir a un enorme reservorio de datos memorizados.
  • Los prompts del sistema no pueden borrar los datos de entrenamiento. Un modelo que ha visto una guía completa no puede ser obligado a "olvidarlo" sin un reentrenamiento.
  • El rendimiento puede medir la memoria, no la percepción. Cuando el mundo de la prueba coincide con un conjunto de datos conocido, un modelo puede tener éxito emparejando patrón con patrón en lugar de interpretar realmente nueva información visual.

Si los benchmarks siguen tratando el "solo visión" como un sustituto del razonamiento visual, corren el riesgo de inflar las afirmaciones sobre la capacidad de la IA para comprender entornos novedosos. Las empresas podrían presumir de cifras impresionantes mientras que el conjunto de habilidades subyacente sigue siendo limitado, un problema que afecta a inversores, desarrolladores y a cualquiera que construya sistemas críticos para la seguridad que deban operar en entornos verdaderamente desconocidos.

Contrapunto: ¿es la memorización realmente un problema?

Algunos argumentan que confirmar un mapa conocido sigue requiriendo una forma de razonamiento: el modelo debe alinear su representación interna con la señal visual actual. Desde esa perspectiva, la demostración muestra una capacidad útil: utilizar la visión para fundamentar una base de conocimientos preexistente. La objeción es válida; la tarea implica, de hecho, una comprobación perceptiva.

Sin embargo, el objetivo principal de un benchmark es evaluar la inferencia visual general, no la recuperación de un guion almacenado. Cuando un modelo puede predecir eventos antes de que aparezcan, la prueba ya no aísla la percepción. La línea entre una fundamentación útil y una trampa descarada se desdibuja, y los resultados pierden su valor diagnóstico.

Próximos pasos y respuesta de la comunidad

Para poner a prueba los límites de la memorización, el evaluador está ejecutando ahora el mismo modelo en un mapa modificado con una geografía alterada. Todo el código, el entorno de pruebas personalizado y los archivos de registro completos se han hecho públicos, invitando a otros investigadores a replicar el experimento o aplicarlo a diferentes juegos. También se ha abierto un canal de discusión en una plataforma de la comunidad de aprendizaje para mantener un diálogo continuo.

Conclusión

Una demostración basada únicamente en visión que tiene éxito porque el modelo ya conoce la respuesta no es evidencia de un razonamiento visual genuino. Los benchmarks deben separar el conocimiento memorizado de la percepción en tiempo real, de lo contrario, corren el riesgo de exagerar la capacidad de la IA para navegar por mundos visuales verdaderamente desconocidos.