Wie der Rewrite stattfand
Anthropic kaufte Bun im Dezember 2025 und machte sich daran, die Zig-Codebasis durch Rust zu ersetzen. Das Unternehmen nutzte eine Vorabversion von Claude Fable 5 – ein LLM, das zu diesem Zeitpunkt niemand anderem zur Verfügung stand. Vierundsechzig Instanzen des Modells arbeiteten parallel und produzierten insgesamt etwa 1.300 Zeilen Code pro Minute.
Chefingenieur Jarred Sumner übergab das Problem nicht einfach den Agenten und zog sich zurück. Zuerst verbrachte er Stunden damit, einen Leitfaden zu entwerfen, der Zig-Idiome auf Rust-Äquivalente abbildete. Ein Testlauf mit drei Dateien ermöglichte es ihm, die Ausgaben der Agenten zu kalibrieren, bevor er sich an das gesamte Repository machte. Für jede von den Agenten vorgeschlagene Änderung prüften zwei „adversarial“ Agenten diese, und Sumner begleitete den gesamten Prozess über den gesamten Zeitraum von 11 Tagen live.
Die interne Buchhaltung von Anthropic verzeichnete Token-Kosten in Höhe von 165.000 $. Diese Zahl spiegelt nur die reinen API-Aufrufe wider, die getätigt wurden, bevor der Code in den Main-Branch gemergt wurde.
Die versteckten Kosten
Die Summe von 165.000 $ lässt die Rechenleistung (Compute) außer Acht, die zur Stabilisierung des neuen Rust-Codes benötigt wurde. Laut einer internen Analyse könnten Fehlerbehebungen nach dem Merge, Continuous-Integration-Läufe und zusätzliche Tests die Gesamtausgaben weiter in die Höhe treiben. Die Schätzung basiert auf den öffentlichen API-Preisen; da Claude Fable 5 eine private Preview war, können die tatsächlich gezahlten Preise abweichen.
Geschwindigkeit versus Sicherheit
Der Rewrite ergab eine Rust-Runtime, die schneller läuft als die ursprüngliche Zig-Version, hinterließ jedoch einen beträchtlichen Prüfrückstau (Audit Backlog). Etwa 4 % der neu generierten Rust-Dateien enthalten „unsafe“-Blöcke – Code, der die strengen Sicherheitsgarantien von Rust umgeht. Von Hand geschriebene Rust-Projekte weisen in der Regel einen weitaus geringeren Prozentsatz auf, was bedeutet, dass die Reviewer nun sicherstellen müssen, dass diese Blöcke keine Speicherfehler (Memory-Corruption-Bugs) verursachen.
Die Ausgaben der Agenten wären ohne Sumners Fachwissen bedeutungslos. Selbst bei 1.300 Zeilen pro Minute benötigt der Code eine kompetente Aufsichtsperson, um logische Fehler zu finden, die architektonische Kohärenz sicherzustellen und zu bestätigen, dass die Testsuite die neue Implementierung tatsächlich abdeckt.
Wann KI glänzt und wann nicht
Die Portierung von Bun war eine Lehrbuchübersetzung: eine Sprache in eine andere, wobei bereits eine umfassende Testsuite vorhanden war. Diese klare Abgrenzung gab dem LLM ein klares Ziel und begrenzte die Notwendigkeit für kreative Problemlösungen. Die meiste Softwareentwicklung beinhaltet jedoch sich ändernde Geschäftsregeln, den Umgang mit mehrdeutigen Anforderungen oder den Aufbau neuer Funktionen von Grund auf. In diesen komplexeren Szenarien ist es unwahrscheinlich, dass das gleiche Maß an KI-Unterstützung vergleichbare Geschwindigkeits- oder Kostenvorteile bringt.
Befürworter der KI-gestützten Entwicklung verweisen auf die reinen Produktivitätszahlen – Tausende von Zeilen, die in Minuten generiert werden – als Beweis dafür, dass Large Language Models große Teams ersetzen können. Der Fall Anthropic dämpft diese Sichtweise: Die genannten Token-Kosten schließen die erheblichen Rechenleistungen für die Validierung nach dem Merge nicht ein, und die durch „unsafe“-Code entstandene Sicherheitslast (Safety Debt) wird menschliche Arbeit erfordern, um sie zu beheben.
Worauf man als Nächstes achten sollte
Anthropic hat nicht bekannt gegeben, ob das Unternehmen plant, denselben Claude-gesteuerten Workflow auf andere Codebasen anzuwenden. Falls dies geschieht, muss das Unternehmen die Gesamtkosten des Lebenszyklus berücksichtigen und nicht nur die Token-Rechnung. Beobachter sollten auf Folgendes achten:
- Wie schnell der Prüfrückstau schrumpft und ob der Anteil an „unsafe“-Code sinkt, während die Reviewer den Code refactoren.
- Ob zukünftige Durchläufe ein ausgereifteres Modell verwenden, das öffentlich käuflich ist, was Kostenschätzungen transparenter machen könnte.
- Die Auswirkungen auf die Verbreitung von Bun: Schnellere Laufzeiten können Nutzer anziehen, aber etwaige Sicherheitsbedenken könnten diesen Gewinn zunichtemachen.
Fazit
KI kann einfache Code-Übersetzungen massiv beschleunigen, aber die nachgelagerten Rechen- und menschlichen Verifizierungskosten können die Einsparungen bei der Token-Rechnung wieder auffressen. Der Bun-Rewrite zeigt, dass Large Language Models zwar schnell riesige Mengen an Code ausspucken können, menschliche Expertise jedoch für die Sicherheit, Korrektheit und die nuancierte Arbeit, die die meisten Softwareprojekte vorantreibt, unerlässlich bleibt.
