Stanford’s 2026 AI Index montre que les incidents de sécurité ont grimpé à 362 l'année dernière, soulignant un fossé grandissant entre l'amélioration rapide des modèles et le retard des garde-fous destinés à garantir leur fiabilité. Chaque défaillance non contrôlée érode la confiance dans des systèmes déjà intégrés dans la finance, la santé et les services publics.

Les données derrière l'écart

L'Index, compilé par l'Institute for Human-Centered Artificial Intelligence, oppose les performances de pointe à la fiabilité en conditions réelles. Les modèles de premier plan réussissent toujours les tests de référence, pourtant leurs taux d'« hallucination » — des cas où ils génèrent des affirmations fausses ou fabriquées — varient de façon stupéfiante de 22 % à 94 % dans l'ensemble du secteur. Lorsque les utilisateurs soumettent des prémisses délibérément fausses aux modèles, la précision de GPT-4o chute de 98,2 % à 64,4 % ; DeepSeek R1 passe de juste plus de 90 % à 14,4 % lors du même test. Les garde-fous de sécurité qui devraient bloquer les requêtes malveillantes cèdent systématiquement lorsque des attaquants les testent.

Pourquoi les entreprises s'empressent d'agir

L'adoption de politiques va plus vite que leur application. La part des entreprises sans aucune gouvernance de l'IA est passée de 24 % à 11 % entre l'enquête précédente et cette année, et beaucoup citent désormais des normes telles que l'ISO/IEC 42001 ou le NIST AI Risk Management Framework. Rédiger une politique ne revient pas à l'appliquer. Les lacunes de connaissances internes affectent 59 % des répondants, les contraintes budgétaires entravent 48 % d'entre eux, et l'incertitude réglementaire en inquiète 41 %. Le rapport qualifie cela de « problème technique » : le renforcement des contrôles de confidentialité peut involontairement affaiblir les mesures d'équité, et vice versa, obligeant les ingénieurs à jongler avec des objectifs contradictoires sans outils ni financements adéquats.

L'illusion des contrôles de sécurité actuels

Les scores de transparence — une agrégation de la manière dont les développeurs divulguent ouvertement les limites des modèles et les méthodes de test — ont chuté de 58 à 40, indiquant que le signalement volontaire perd en crédibilité. Les entreprises s'appuient sur des audits internes qui passent souvent à côté des défaillances liées aux cas limites répertoriées dans l'Index. Le résultat est un faux sentiment de sécurité ; les organisations pensent être protégées alors que des vulnérabilités cachées persistent.

Contre-point : les normes gagnent du terrain

Les partisans soutiennent que le recours aux cadres ISO et NIST est un pas en avant. Les normes formelles offrent aux auditeurs et aux régulateurs un langage commun et des attentes de base, facilitant ainsi les comparaisons entre entreprises. Les premiers adoptants font état d'un meilleur alignement interne et de processus d'escalade plus clairs lorsqu'une politique existe. La hausse de l'adoption des politiques suggère que l'industrie reconnaît le risque et est prête à investir dans la gouvernance.

Ce qu'il manque encore

Même avec des politiques sur papier, l'exécution fait défaut. L'Index met en évidence trois obstacles pratiques :

  • Lacunes de connaissances : Les équipes manquent d'une expertise approfondie en matière de risques liés à l'IA, ce qui conduit à des contrôles de conformité superficiels.
  • Manque de financement : Les outils de sécurité, les audits tiers et la surveillance continue nécessitent des budgets que de nombreuses entreprises ne peuvent justifier.
  • Flou réglementaire : Des lois ambiguës ou en constante évolution rendent difficile la conception de feuilles de route de conformité à long terme.

La résolution de ces problèmes nécessitera probablement une validation externe. Le rapport recommande de dépasser l'auto-évaluation pour passer à des évaluations indépendantes qui simulent l'utilisation en conditions réelles et les attaques adverses. Il appelle également à des solutions d'ingénierie qui intègrent les contrôles de sécurité directement dans les pipelines de modèles plutôt que de les traiter comme une réflexion après coup.

À surveiller ensuite