Cómo el lenguaje moldea la IA: el estudio de Anthropic revela cambios en la personalidad de Claude

Anthropic ha publicado un estudio innovador que revela que la "personalidad" de Claude y sus expresiones de valores cambian significativamente según el idioma que se hable. Desde la calidez en hindi hasta el rigor técnico en ruso, la investigación destaca cómo los matices lingüísticos influyen profundamente en el comportamiento de la IA.

Mapeo de los valores de la IA a través de cuatro dimensiones

Para comprender los matices de la interacción con la IA, Anthropic analizó 309.815 conversaciones anonimizadas de mayo de 2026. Al procesar miles de términos individuales, el equipo de investigación destiló valores humanos complejos en 339 conceptos de alto nivel, que luego se redujeron a cuatro ejes de comportamiento principales:

  • Deferencia y precaución: Cuánto coincide el modelo con el usuario frente a cuánto matiza sus respuestas.
  • Calidez y rigor: El equilibrio entre un lenguaje empático y cortés y un escrutinio crítico basado en la evidencia.
  • Profundidad y brevedad: Si el modelo proporciona detalles exhaustivos o respuestas concisas y directas.
  • Franqueza y ejecución: La tensión entre ser abiertamente crítico y centrarse en la realización de la tarea.

Esta metodología permite a los investigadores aislar los comportamientos lingüísticos y específicos del modelo del tema real de la conversación, proporcionando una visión más clara de los "patrones normativos" inherentes al LLM.

Perfiles de comportamiento distintos: Sonnet frente a Opus

El estudio confirma que los diferentes modelos dentro de la familia Claude exhiben diferencias de comportamiento mensurables. Estos perfiles a menudo coinciden con las percepciones de los usuarios, creando una experiencia por niveles basada en la versión específica del modelo utilizada:

  • Sonnet 4.6: Caracterizado principalmente por su calidez. Se inclina hacia el humor, afirma las ideas del usuario y ofrece consuelo sin juzgar.
  • Opus 4.6: Centrado en la eficiencia de las tareas. Tiende a ser directo y evita elaboraciones innecesarias.
  • Opus 4.7: El "pensador crítico". Este modelo tiene más probabilidades de cuestionar suposiciones, señalar sus propios errores y advertir sobre riesgos incluso cuando no se le pide explícitamente.

La brecha lingüística: de la calidez del hindi al rigor del ruso

Quizás el hallazgo más sorprendente es cómo el lenguaje actúa como una lente que redefine los resultados de Claude. Dos usuarios que hacen la misma pregunta en diferentes idiomas pueden recibir tipos de retroalimentación fundamentalmente distintos.

La investigación encontró que el hindi y el árabe activan los niveles más altos de calidez, caracterizados por la cortesía, la jovialidad y la afirmación. Por el contrario, en inglés y ruso, Claude adopta una postura mucho más rigurosa: cuestiona suposiciones, corrige detalles y exige evidencia.

Otros patrones lingüísticos notables incluyen:

  • Árabe: Exhibe los niveles más altos de deferencia.
  • Inglés: Muestra los niveles más altos de precaución y matización.
  • Neerlandés: Tiende hacia una gran franqueza y apertura.
  • Indonesio: Se inclina fuertemente hacia la ejecución y las respuestas orientadas a resultados.

Por qué esto es importante para la industria de la IA

Estos hallazgos plantean preguntas críticas con respecto a la composición de los datos de entrenamiento y el potencial de sesgos lingüísticos no deseados. Anthropic sugiere que estos cambios pueden derivarse de cantidades desiguales de datos de entrenamiento o de diferentes normas conversacionales lingüísticas presentes en los conjuntos de datos.

Para los desarrolladores y fundadores que construyen aplicaciones globales, esta es una realización vital: un asistente de IA puede sentirse como un entrenador de apoyo en un mercado y como un auditor estricto en otro. A medida que los LLM se integran más en los flujos de trabajo globales, garantizar que estos cambios lingüísticos sean adaptaciones intencionales en lugar de sesgos sistémicos sigue siendo un desafío primordial para la seguridad y la alineación de la IA.

Conclusiones clave

  • Relatividad lingüística en la IA: Las respuestas de Claude cambian significativamente según el idioma, mostrando una gran calidez en hindi y un gran rigor en ruso.
  • Niveles de modelos: Los modelos de Anthropic demuestran personalidades distintas, siendo Sonnet 4.6 más empático y Opus 4.7 más crítico y precavido.
  • El desafío de los datos de entrenamiento: Las diferencias en el comportamiento de la IA entre idiomas probablemente se deban a distribuciones desiguales de los datos de entrenamiento y a diversas normas conversacionales culturales.