Wie Sprache KI prägt: Anthropics Studie enthüllt Verschiebungen in Claudes Persönlichkeit
Anthropic hat eine bahnbrechende Studie veröffentlicht, die zeigt, dass sich Claudes „Persönlichkeit“ und der Ausdruck von Werten je nach gesprochener Sprache erheblich verändern. Von Herzlichkeit auf Hindi bis hin zu technischer Strenge auf Russisch – die Forschung verdeutlicht, wie sprachliche Nuancen das Verhalten von KI tiefgreifend beeinflussen.
Abbildung von KI-Werten über vier Dimensionen hinweg
Um die Nuancen der KI-Interaktion zu verstehen, analysierte Anthropic 309.815 anonymisierte Gespräche aus dem Mai 2026. Durch die Verarbeitung tausender einzelner Begriffe destillierte das Forschungsteam komplexe menschliche Werte in 339 übergeordnete Konzepte, die weiter in vier zentrale Verhaltensachsen unterteilt wurden:
- Ehrerbietung und Vorsicht: Inwieweit das Modell dem Nutzer zustimmt versus wie sehr es seine Antworten abfedert (Hedging).
- Herzlichkeit und Strenge: Das Gleichgewicht zwischen empathischer, höflicher Formulierung und kritischer, evidenzbasierter Prüfung.
- Tiefe und Kürze: Ob das Modell ausführliche Details liefert oder prägnante, direkte Antworten gibt.
- Offenheit und Ausführung: Das Spannungsfeld zwischen offener Kritik und der Konzentration auf den Abschluss einer Aufgabe.
Diese Methodik ermöglicht es Forschern, sprachliche und modellspezifische Verhaltensweisen vom eigentlichen Thema des Gesprächs zu isolieren, was einen klareren Blick auf die dem LLM innewohnenden „normativen Muster“ ermöglicht.
Unterschiedliche Verhaltensprofile: Sonnet vs. Opus
Die Studie bestätigt, dass verschiedene Modelle innerhalb der Claude-Familie messbare Verhaltensunterschiede aufweisen. Diese Profile stimmen oft mit der Wahrnehmung der Nutzer überein und schaffen so ein abgestuftes Erlebnis, das auf der jeweils verwendeten Modellversion basiert:
- Sonnet 4.6: Primär durch Herzlichkeit gekennzeichnet. Es setzt auf Humor, bestätigt die Ideen des Nutzers und bietet Trost ohne Wertung.
- Opus 4.6: Auf Aufgaben-Effizienz fokussiert. Es neigt dazu, direkt zu sein und vermeidet unnötige Ausführungen.
- Opus 4.7: Der „kritische Denker“. Dieses Modell hinterfragt eher Annahmen, weist auf eigene Fehler hin und warnt vor Risiken, selbst wenn es nicht explizit darum gebeten wurde.
Die Sprachlücke: Von Hindi-Herzlichkeit zu russischer Strenge
Die vielleicht auffälligste Erkenntnis ist, wie Sprache als Linse fungiert, die die Ausgaben von Claude neu formt. Zwei Nutzer, die dieselbe Frage in verschiedenen Sprachen stellen, können grundlegend unterschiedliche Arten von Feedback erhalten.
Die Forschung ergab, dass Hindi und Arabisch die höchsten Grade an Herzlichkeit auslösen, gekennzeichnet durch Höflichkeit, Verspieltheit und Bestätigung. Im Gegensatz dazu nimmt Claude in Englisch und Russisch eine viel strengere Haltung ein – hinterfragt Annahmen, korrigiert Details und fordert Belege.
Andere bemerkenswerte sprachliche Muster umfassen:
- Arabisch: Zeigt das höchste Maß an Ehrerbietung.
- Englisch: Zeigt das höchste Maß an Vorsicht und Abmilderung (Hedging).
- Niederländisch: Neigt zu hoher Offenheit und Direktheit.
- Indonesisch: Neigt stark zur Ausführung und zu ergebnisorientierten Antworten.
Warum dies für die KI-Branche wichtig ist
Diese Ergebnisse werfen kritische Fragen hinsichtlich der Zusammensetzung der Trainingsdaten und des Potenzials für unbeabsichtigte sprachliche Verzerrungen (Bias) auf. Anthropic legt nahe, dass diese Verschiebungen auf ungleiche Mengen an Trainingsdaten oder unterschiedliche sprachliche Konversationsnormen in den Datensätzen zurückzuführen sein könnten.
Für Entwickler und Gründer, die globale Anwendungen bauen, ist dies eine entscheidende Erkenntnis: Ein KI-Assistent kann sich in einem Markt wie ein unterstützender Coach und in einem anderen wie ein strenger Auditor anfühlen. Da LLMs immer stärker in globale Arbeitsabläufe integriert werden, bleibt die Sicherstellung, dass diese sprachlichen Verschiebungen beabsichtigte Anpassungen und keine systemischen Verzerrungen sind, eine zentrale Herausforderung für die KI-Sicherheit und das Alignment.
Wichtigste Erkenntnisse
- Linguistische Relativität in der KI: Claudes Antworten verändern sich je nach Sprache erheblich, wobei sie auf Hindi eine hohe Herzlichkeit und auf Russisch eine hohe Strenge zeigen.
- Modell-Abstufung: Die Modelle von Anthropic weisen unterschiedliche Personas auf, wobei Sonnet 4.6 empathischer und Opus 4.7 kritischer und vorsichtiger ist.
- Die Herausforderung der Trainingsdaten: Unterschiede im KI-Verhalten über verschiedene Sprachen hinweg resultieren wahrscheinlich aus ungleichmäßigen Verteilungen der Trainingsdaten und variierenden kulturellen Konversationsnormen.
