스탠퍼드 2026 AI 인덱스에 따르면 지난해 안전 사고가 362건으로 증가했으며, 이는 급격한 모델 발전과 모델의 신뢰성을 유지하기 위한 안전장치 사이의 격차가 점점 벌어지고 있음을 보여준다. 확인되지 않은 모든 실패는 이미 금융, 의료, 공공 서비스에 도입된 시스템에 대한 신뢰를 떨어뜨린다.
격차 뒤에 숨겨진 데이터
인간 중심 인공지능 연구소(Institute for Human-Centered Artificial Intelligence)가 작성한 이 인덱스는 주요 성능 지표와 실제 신뢰성을 대조한다. 최상위 모델들은 여전히 벤치마크 시험에서 우수한 성적을 거두고 있지만, 모델이 허위 또는 조작된 진술을 생성하는 '환각(hallucination)' 발생률은 분야 전체에 걸쳐 22%에서 94%라는 놀라운 수치를 기록하고 있다. 사용자가 의도적으로 잘못된 전제를 입력할 경우, GPT-4o의 정확도는 98.2%에서 64.4%로 급락하며, DeepSeek R1은 동일한 테스트에서 90%를 상회하던 수준에서 14.4%로 떨어진다. 공격자가 탐색할 때 안전 가드레일이 일상적으로 무너지는 상황이 발생하고 있다.
기업들이 서두르는 이유
정책 도입 속도가 집행 속도를 앞지르고 있다. AI 거버넌스가 전혀 없는 기업의 비율은 이전 조사와 비교해 24%에서 11%로 감소했으며, 현재 많은 기업이 ISO/IEC 42001 또는 NIST AI 위험 관리 프레임워크와 같은 표준을 인용하고 있다. 하지만 정책을 초안하는 것과 이를 실제로 준수하며 운영하는 것은 다르다. 응답자의 59%는 내부 지식 격차를, 48%는 예산 제약을, 41%는 규제 불확실성을 문제로 꼽았다. 보고서는 이를 "기술적 문제"라고 부른다. 개인정보 보호 통제를 강화하면 의도치 않게 공정성 지표가 약화될 수 있고 그 반대의 경우도 마찬가지여서, 엔지니어들은 적절한 도구나 자금 지원 없이 상충하는 목표들 사이에서 고군분투해야 한다.
현재 안전 점검의 환상
개발자가 모델의 한계와 테스트 방법을 얼마나 공개하는지를 집계한 투명성 점수는 58점에서 40점으로 하락했으며, 이는 자발적 보고의 신뢰성이 떨어지고 있음을 나타낸다. 기업들은 인덱스에 기록된 예외적인 실패 사례(edge-case failures)를 놓치기 쉬운 내부 감사에 의존하고 있다. 그 결과, 숨겨진 취약점이 지속되고 있음에도 불구하고 조직은 스스로 보호받고 있다고 믿는 잘못된 보안 의식이 형성되고 있다.
반론: 표준이 힘을 얻고 있다
지지자들은 ISO 및 NIST 프레임워크를 참조하는 것이 진일보한 조치라고 주장한다. 공식 표준은 감사인과 규제 기관에 공통된 언어와 기본 기대치를 제공하여 기업 간 비교를 용이하게 한다. 조기 도입 기업들은 정책이 존재할 때 내부 조율이 더 원활하고 명확한 보고 체계가 구축된다고 보고한다. 정책 도입의 증가는 업계가 위험을 인식하고 있으며 거버넌스에 투자할 의지가 있음을 시사한다.
여전히 부족한 점
문서상으로는 정책이 존재하더라도 실행 단계에서 문제가 발생한다. 인덱스는 세 가지 실질적인 장애물을 강조한다:
- 지식 격차: 팀 내 AI 위험에 대한 전문 지식이 부족하여 피상적인 컴플라이언스 점검에 그친다.
- 자금 부족: 안전 도구, 제3자 감사 및 지속적인 모니터링에는 많은 기업이 정당화하기 어려운 예산이 필요하다.
- 규제의 모호성: 모호하거나 계속 변화하는 법률로 인해 장기적인 컴플라이언스 로드맵을 설계하기 어렵다.
이러한 문제를 해결하려면 외부 검증이 필요할 것으로 보인다. 보고서는 자가 평가를 넘어 실제 사용 환경과 적대적 공격(adversarial attacks)을 시뮬레이션하는 독립적인 평가로 나아갈 것을 권고한다. 또한 안전 점검을 사후 고려 사항으로 취급하는 대신 모델 파이프라인에 직접 내장하는 엔지니어링 솔루션을 촉구한다.
