Andrew Ng i DeepLearning.AI zaprezentowali AI Engineering Skills Map – ramy kompetencyjne grupujące sześć kluczowych umiejętności niezbędnych do przekształcenia eksperymentalnych promptów w systemy AI gotowe do wdrożenia produkcyjnego. Mapa ta jest skierowana do inżynierów, którzy chcą wyjść poza „vibe coding” i dostarczać niezawodne, skalowalne produkty AI.
Dlaczego „vibe coding” stanowi przeszkodę
W wielu przedsiębiorstwach programiści traktują duże modele językowe (LLM) jak magiczną różdżkę: piszą prompt, rzucają okiem na kilka wyników i uznają zadanie za wykonane. Ten skrót sprawdza się przy szybkich demonstracjach, ale załamuje się w rzeczywistym użytkowaniu. Modele LLM są niedeterministyczne – identyczne dane wejściowe mogą za każdym razem dawać różne wyniki. Bez systematycznych kontroli system, który wydawał się sprawny w laboratorium, może zawieść na produkcji, powodując kosztowne przestoje lub niebezpieczne zachowania.
Sześć kompetencji mapy
Skills Map dzieli proces inżynieryjny na sześć odrębnych obszarów, z których każdy posiada własne najlepsze praktyki i narzędzia.
- Prompt Engineering – wykracza poza tekst swobodny na rzecz ustrukturyzowanych szablonów, często wymuszanych za pomocą schematów JSON. Zmniejsza to niejednoznaczność i sprawia, że dalsze parsowanie jest przewidywalne.
- Retrieval-Augmented Generation (RAG) – wymaga biegłości w ingestii dokumentów, semantycznym dzieleniu na fragmenty (chunking) oraz budowaniu potoków (pipelines) wyszukiwania, które dostarczają modelowi istotny kontekst.
- Agentic Workflows – obejmuje projektowanie pętli, w których model może wywoływać zewnętrzne narzędzia, zarządzać stanem i podejmować autonomiczne decyzje.
- Fine-tuning – pomaga inżynierom zdecydować, kiedy dostosować wagi modelu, zamiast polegać wyłącznie na kontekście promptu, co może poprawić spójność i zmniejszyć zużycie tokenów.
- Evaluation (Evals) – wymaga zautomatyzowanych zestawów testowych, które mierzą dokładność, stronniczość i bezpieczeństwo w oparciu o zdefiniowane kryteria. Nieudany test powinien przerywać proces budowania (build), podobnie jak każda inna regresja kodu.
- Operations – koncentruje się na budżetowaniu opóźnień (latency), monitorowaniu kosztów i radzeniu sobie z dryftem modelu (stopniową zmianą zachowania modelu wraz z ewolucją danych) w czasie rzeczywistym.
Traktując LLM jako niezaufane API, a nie „czarną skrzynkę”, zespoły mogą stosować taką samą rygorystyczność, jakiej używają w przypadku tradycyjnych usług.
Kto zyskuje, a kto zostaje w tyle
Liderzy inżynierii, którzy zatrudniają wyłącznie doktorów nauk o uczeniu maszynowym, mogą doświadczyć przestojów w projektach. Mapa podkreśla potrzebę obecności inżynierów systemowych – osób biegłych w projektowaniu API, strategiach buforowania (caching) i testowaniu automatycznym. Podnoszenie kwalifikacji inżynierów backendowych w zakresie zarządzania oknami kontekstowymi, budowania mechanizmów ewaluacji i monitorowania metryk operacyjnych może wypełnić lukę kompetencyjną i przyspieszyć dostarczanie rozwiązań.
