Andrew Ng i DeepLearning.AI zaprezentowali AI Engineering Skills Map – ramy kompetencyjne grupujące sześć kluczowych umiejętności niezbędnych do przekształcenia eksperymentalnych promptów w systemy AI gotowe do wdrożenia produkcyjnego. Mapa ta jest skierowana do inżynierów, którzy chcą wyjść poza „vibe coding” i dostarczać niezawodne, skalowalne produkty AI.

Dlaczego „vibe coding” stanowi przeszkodę

W wielu przedsiębiorstwach programiści traktują duże modele językowe (LLM) jak magiczną różdżkę: piszą prompt, rzucają okiem na kilka wyników i uznają zadanie za wykonane. Ten skrót sprawdza się przy szybkich demonstracjach, ale załamuje się w rzeczywistym użytkowaniu. Modele LLM są niedeterministyczne – identyczne dane wejściowe mogą za każdym razem dawać różne wyniki. Bez systematycznych kontroli system, który wydawał się sprawny w laboratorium, może zawieść na produkcji, powodując kosztowne przestoje lub niebezpieczne zachowania.

Sześć kompetencji mapy

Skills Map dzieli proces inżynieryjny na sześć odrębnych obszarów, z których każdy posiada własne najlepsze praktyki i narzędzia.

  • Prompt Engineering – wykracza poza tekst swobodny na rzecz ustrukturyzowanych szablonów, często wymuszanych za pomocą schematów JSON. Zmniejsza to niejednoznaczność i sprawia, że dalsze parsowanie jest przewidywalne.
  • Retrieval-Augmented Generation (RAG) – wymaga biegłości w ingestii dokumentów, semantycznym dzieleniu na fragmenty (chunking) oraz budowaniu potoków (pipelines) wyszukiwania, które dostarczają modelowi istotny kontekst.
  • Agentic Workflows – obejmuje projektowanie pętli, w których model może wywoływać zewnętrzne narzędzia, zarządzać stanem i podejmować autonomiczne decyzje.
  • Fine-tuning – pomaga inżynierom zdecydować, kiedy dostosować wagi modelu, zamiast polegać wyłącznie na kontekście promptu, co może poprawić spójność i zmniejszyć zużycie tokenów.
  • Evaluation (Evals) – wymaga zautomatyzowanych zestawów testowych, które mierzą dokładność, stronniczość i bezpieczeństwo w oparciu o zdefiniowane kryteria. Nieudany test powinien przerywać proces budowania (build), podobnie jak każda inna regresja kodu.
  • Operations – koncentruje się na budżetowaniu opóźnień (latency), monitorowaniu kosztów i radzeniu sobie z dryftem modelu (stopniową zmianą zachowania modelu wraz z ewolucją danych) w czasie rzeczywistym.

Traktując LLM jako niezaufane API, a nie „czarną skrzynkę”, zespoły mogą stosować taką samą rygorystyczność, jakiej używają w przypadku tradycyjnych usług.

Kto zyskuje, a kto zostaje w tyle

Liderzy inżynierii, którzy zatrudniają wyłącznie doktorów nauk o uczeniu maszynowym, mogą doświadczyć przestojów w projektach. Mapa podkreśla potrzebę obecności inżynierów systemowych – osób biegłych w projektowaniu API, strategiach buforowania (caching) i testowaniu automatycznym. Podnoszenie kwalifikacji inżynierów backendowych w zakresie zarządzania oknami kontekstowymi, budowania mechanizmów ewaluacji i monitorowania metryk operacyjnych może wypełnić lukę kompetencyjną i przyspieszyć dostarczanie rozwiązań.