OWASP opublikował listę GenAI LLM Top 10 na rok 2026, a „Nadmierna sprawczość” (Excessive Agency) awansowała z szóstego na trzecie miejsce. Ten skok ma znaczenie, ponieważ pokazuje, że najgroźniejsze błędy nie ograniczają się już tylko do błędnych odpowiedzi, ale dotyczą agentów, którzy mogą działać na Twojej infrastrukturze.

Dlaczego ta zmiana ma znaczenie

Po raz pierwszy lista Top 10 opiera się w jednej czwartej na danych z rzeczywistych incydentów – ponad 6000 zgłoszonych naruszeń, eksploatacji i nieprawidłowych zachowań. Wcześniejsze edycje opierały się niemal wyłącznie na opiniach ekspertów. Sygnały z rzeczywistego świata pokazują, że gdy model językowy może wywoływać API, wykonywać kod lub przesyłać pieniądze, konsekwencje zmieniają się z kompromitujących wycieków tekstu na konkretne szkody operacyjne. Wstrzykiwanie promptów (Prompt injection) wciąż zajmuje pierwsze miejsce, a za nim następuje ujawnianie wrażliwych informacji, ale wzrost znaczenia „Nadmiernej sprawczości” w pierwszej trójce mówi zespołom bezpieczeństwa, że kolejna fala ataków będzie wykorzystywać narzędzia, a nie tylko operować na poziomie lingwistycznym.

Jak wygląda „nadmierna sprawczość”

Nadmierna sprawczość opisuje każdą sytuację, w której model LLM otrzymuje zdolność, której nie powinien posiadać, lub większe możliwości, niż są w stanie ograniczyć otaczające go mechanizmy ochronne (guardrails). Typowe przykłady obejmują:

  • Asystenta wywołującego wewnętrzne punkty końcowe mikroserwisów bez sprawdzania uprawnień.
  • Bota do generowania kodu, który pisze i uruchamia skrypty na serwerach produkcyjnych.
  • Agenta do automatyzacji finansowej, który inicjuje przelewy po sformułowaniu odpowiedniego promptu.

Jeśli złośliwy prompt oszuka model, który posiada takie uprawnienia, naruszenie jest natychmiastowe i często kosztowne. Ryzyko rośnie proporcjonalnie do luki między zdolnością modelu do podążania za promptem a rygorystycznością otaczających go kontroli.

Jak zbudowano nową listę Top 10

Edycja na rok 2026 łączy ocenę ekspertów z twardymi danymi. Około 25% rankingu wynika z puli incydentów wspomnianej wcześniej, co nadaje wagę wzorcom, które faktycznie wystąpiły w rzeczywistości. Ta zmiana metodologii wyjaśnia, dlaczego „Nadmierna sprawczość” gwałtownie wzrosła: dane pokazują wyraźny wzrost liczby incydentów, w których model wykonywał działanie, a nie tylko generował tekst.

Inne istotne zmiany

  • Ujawnianie ukrytego kontekstu (Hidden Context Exposure, zmieniona nazwa z „System Prompt Leakage”) awansuje, aby obejmować szerszy zestaw wrażliwych danych, co odzwierciedla fakt, że atakujący coraz częściej przeszukują kontekst modelu w poszukiwaniu tajemnic.
  • Nieprawidłowe przetwarzanie danych wyjściowych (Improper Output Handling) spada na dziesiąte miejsce, co sugeruje, że organizacje coraz lepiej radzą sobie z sanityzacją surowych odpowiedzi modelu. Uwaga branży przesuwa się z „model powiedział coś złego” na „model zrobił coś złego”.

Te zmiany wzmacniają narrację, że powierzchnia zagrożeń rozszerza się z tekstowych odpowiedzi na dynamiczne zachowania.

Łagodzenie ryzyka

Zespoły bezpieczeństwa mogą zacząć ograniczać nadmierną sprawczość za pomocą trzech praktycznych kroków:

  1. Ogranicz zakres narzędzi – Przypisz każdemu agentowi tylko te działania, których potrzebuje do wykonania konkretnego zadania. Unikaj dawania jednemu modelowi LLM „pełnego zestawu narzędzi” dla wygody; granularne uprawnienia ograniczają promień rażenia (blast radius) w przypadku przejęcia promptu.
  2. Buduj mechanizmy ochronne w kodzie, a nie w promptach – Polegaj na jawnych sprawdzaniu uprawnień, bramkach potwierdzających (confirmation gates) i logach audytowych w warstwie, która faktycznie wykonuje narzędzie. Traktuj każdą odpowiedź modelu jako niezaufane żądanie, które musi przejść taką samą kontrolę bezpieczeństwa jak każde zewnętrzne wywołanie API.
  3. Inwentaryzuj wszystkie kombinacje narzędzi – Dokumentuj, które agenty mają dostęp do których API, skryptów lub punktów końcowych usług finansowych. Bardziej istotne niż sama lista jest zrozumienie, jak te możliwości ze sobą oddziałują; para narzędzi, która wydaje się nieszkodliwa, może stać się niebezpieczna, gdy zostaną użyte w łańcuchu.

Zaktualizowana lista Top 10 przypisuje również każde ryzyko do głównych standardów bezpieczeństwa przedsiębiorstw, dając obrońcom wspólny język do omawiania łagodzenia skutków z zespołami ds. zgodności (compliance) i audytu.

Kontrargument: czy ryzyko jest przeceniane?

Niektórzy praktycy argumentują, że „nadmierna sprawczość” odzwierciedla jedynie złe decyzje projektowe, a nie inherentną wadę generatywnej sztucznej inteligencji. Wskazują oni, że każdy programowalny system może zostać niewłaściwie wykorzystany, jeśli otrzyma nieograniczony dostęp, a silne praktyki DevOps już teraz rozwiązują wiele z opisanych scenariuszy. Choć dyscyplina w zakresie uprawnień jest niezbędna, wzrost ryzyka poparty danymi sugeruje, że wiele organizacji wciąż odstaje w stosowaniu tych praktyk w przepływach pracy wspomaganych przez AI.

Na co zwrócić uwagę w przyszłości

  • Dalsze rewizje listy Top 10 – W miarę rejestrowania kolejnych incydentów, lista OWASP będzie ewoluować. Śledzenie corocznych wydań pomoże zespołom przewidzieć, w którą stronę zmierza krzywa zagrożeń.

Przesłanie jest jasne: przyznanie modelowi językowemu możliwości działania jest tanie; ochrona przed tymi możliwościami jest kosztowna. Organizacje, które traktują wyniki modelu jako prośbę, a nie werdykt, pozostaną o krok przed nadchodzącą falą ataków wykorzystujących narzędzia.