Andrew Ng und DeepLearning.AI haben die AI Engineering Skills Map vorgestellt – ein Framework, das sechs Kernkompetenzen gruppiert, die notwendig sind, um aus experimentellen Prompts produktionsreife KI-Systeme zu machen. Die Map richtet sich an Ingenieure, die über das „vibe coding“ hinausgehen und zuverlässige, skalierbare KI-Produkte liefern wollen.

Warum „vibe coding“ ein Hindernis darstellt

In vielen Unternehmen behandeln Entwickler Large Language Models (LLMs) wie einen Zauberstab: Sie schreiben einen Prompt, werfen einen kurzen Blick auf eine Handvoll Ausgaben und halten die Arbeit für erledigt. Diese Abkürzung funktioniert für schnelle Demos, bricht aber bei der realen Nutzung zusammen. LLMs sind nicht-deterministisch – identische Eingaben können jedes Mal zu unterschiedlichen Ergebnissen führen. Ohne systematische Überprüfungen kann ein System, das im Labor einwandfrei schien, in der Produktion versagen, was zu kostspieligen Ausfallzeiten oder unsicherem Verhalten führt.

Die sechs Kompetenzen der Map

Die Skills Map unterteilt den Engineering-Prozess in sechs verschiedene Bereiche, die jeweils über eigene Best Practices und Tools verfügen.

  • Prompt Engineering – Geht über Freitext hinaus hin zu strukturierten Vorlagen, die oft durch JSON-Schemas erzwungen werden. Dies reduziert Mehrdeutigkeiten und macht das nachgelagerte Parsing vorhersehbar.
  • Retrieval-Augmented Generation (RAG) – Erfordert Kompetenz in der Dokumenten-Ingestion, beim semantischen Chunking und beim Aufbau von Retrieval-Pipelines, die dem Modell relevanten Kontext zuführen.
  • Agentic Workflows – Beinhaltet das Design von Schleifen, in denen das Modell externe Tools aufrufen, Zustände verwalten und autonom Entscheidungen treffen kann.
  • Fine-tuning – Hilft Ingenieuren zu entscheiden, wann die Gewichte eines Modells angepasst werden sollten, anstatt sich allein auf den Prompt-Kontext zu verlassen – eine Entscheidung, die die Konsistenz verbessern und den Token-Verbrauch senken kann.
  • Evaluation (Evals) – Erfordert automatisierte Test-Suites, die Genauigkeit, Bias und Sicherheit anhand vordefinierter Kriterien messen. Ein fehlschlagender Test sollte den Build stoppen, genau wie jede andere Code-Regression.
  • Operations – Konzentriert sich auf Latenz-Budgetierung, Kostenüberwachung und den Umgang mit Model Drift (der allmählichen Veränderung des Modellverhaltens durch sich entwickelnde Daten) in Echtzeit.

Indem Teams das LLM als eine unvertrauenswürdige API statt als eine Black Box behandeln, können sie dieselbe Strenge anwenden, die sie auch bei traditionellen Diensten nutzen.

Wer profitiert und wer bleibt auf der Strecke

Führungskräfte im Engineering, die Teams nur mit PhDs im Bereich Machine Learning besetzen, könnten erleben, wie Projekte stagnieren. Die Map betont die Notwendigkeit von Systemingenieuren – Menschen, die versiert in API-Design, Caching-Strategien und automatisiertem Testen sind. Die Weiterbildung von Backend-Entwicklern im Umgang mit Kontextfenstern, dem Aufbau von Evaluation-Frameworks und der Überwachung operativer Kennzahlen kann die Talentlücke schließen und die Bereitstellung beschleunigen.