De AI Index 2026 van Stanford laat zien dat het aantal veiligheidsincidenten vorig jaar steeg naar 362, wat de groeiende kloof onderstreept tussen de snelle verbeteringen van modellen en de achterblijvende waarborgen die bedoeld zijn om ze betrouwbaar te houden. Elke ongecontroleerde fout tast het vertrouwen aan in systemen die al verweven zijn met de financiële sector, de gezondheidszorg en de publieke dienstverlening.

De data achter de kloof

De Index, samengesteld door het Institute for Human-Centered Artificial Intelligence, zet de prestaties uit de krantenkoppen af tegen de betrouwbaarheid in de praktijk. Topmodellen scoren nog steeds uitstekend op benchmark-examens, maar hun "hallucinatiepercentages" — gevallen waarin ze onjuiste of gefabriceerde beweringen genereren — variëren in het hele veld van een verbazingwekkende 22% tot 94%. Wanneer gebruikers modellen opzettelijk onjuiste premissen voeden, keldert de nauwkeurigheid van GPT-4o van 98,2% naar 64,4%; DeepSeek R1 daalt onder dezelfde test van net boven de 90% naar 14,4%. Veiligheidsmechanismen die kwaadaardige prompts zouden moeten blokkeren, falen routinematig wanneer aanvallers ze testen.

Waarom bedrijven zich haasten

De adoptie van beleid gaat sneller dan de handhaving. Het aandeel bedrijven zonder enig AI-governancebeleid daalde van 24% naar 11% tussen de vorige enquête en dit jaar, en velen verwijzen nu naar standaarden zoals ISO/IEC 42001 of het NIST AI Risk Management Framework. Het opstellen van een beleid is niet hetzelfde als het naleven ervan. Interne kenniskloven hebben betrekking op 59% van de respondenten, budgetbeperkingen hinderen 48% en onzekerheid over regelgeving baart 41% zorgen. Het rapport noemt dit een "technisch probleem": het aanscherpen van privacycontroles kan onbedoeld de eerlijkheidsmetrieken (fairness metrics) verzwakken, en vice versa, waardoor ingenieurs moeten balanceren tussen tegenstrijdige doelstellingen zonder adequate tools of financiering.

De illusie van de huidige veiligheidscontroles

Transparantiescores — een optelsom van hoe openlijk ontwikkelaars modelbeperkingen en testmethoden onthullen — zakten van 58 naar 40, wat aangeeft dat vrijwillige rapportage aan geloofwaardigheid verliest. Bedrijven vertrouwen op interne audits die vaak de fouten in uiterste gevallen (edge-case failures) missen die in de Index zijn vastgelegd. Het resultaat is een vals gevoel van veiligheid; organisaties denken dat ze beschermd zijn, terwijl verborgen kwetsbaarheden blijven bestaan.

Tegenargument: standaarden winnen aan terrein

Voorstanders argumenteren dat het verwijzen naar ISO- en NIST-frameworks een stap voorwaarts is. Formele standaarden geven auditors en toezichthouders een gemeenschappelijke taal en basisverwachtingen, waardoor vergelijkingen tussen bedrijven gemakkelijker worden. Vroege gebruikers melden een soepelere interne afstemming en duidelijkere escalatiepaden wanneer er beleid aanwezig is. De stijging in de adoptie van beleid suggereert dat de sector het risico erkent en bereid is te investeren in governance.

Wat er nog ontbreekt

Zelfs met beleid op papier hapert de uitvoering. De Index benadrukt drie praktische obstakels:

  • Kenniskloven: Teams missen diepgaande expertise op het gebied van AI-risico's, wat leidt tot oppervlakkige nalevingscontroles.
  • Tekorten aan financiering: Veiligheidstools, audits door derden en continue monitoring vereisen budgetten die veel bedrijven niet kunnen rechtvaardigen.
  • Regelgevende onduidelijkheid: Ambigue of veranderende wetgeving maakt het moeilijk om langetermijn-compliance-roadmaps te ontwerpen.

Het aanpakken van deze problemen zal waarschijnlijk externe validatie vereisen. Het rapport raadt aan om verder te gaan dan zelfevaluatie en over te stappen op onafhankelijke evaluaties die het gebruik in de echte wereld en adversarial attacks simuleren. Het roept ook op tot technische oplossingen die veiligheidscontroles direct in de model-pipelines integreren, in plaats van ze als een bijzaak te behandelen.

Waar u de komende tijd op moet letten