斯坦福大学 2026 年 AI 指数显示,去年的安全事件攀升至 362 起,这凸显了模型能力的飞速提升与旨在确保其可信度的保障措施滞后之间日益扩大的鸿沟。每一次未被察觉的失败,都在侵蚀人们对已嵌入金融、医疗和公共服务系统的信心。
数据背后的差距
该指数由以人为本人工智能研究院(Institute for Human-Centered Artificial Intelligence)编制,将顶尖性能表现与现实世界的可靠性进行了对比。顶尖模型在基准测试中依然表现出色,但其“幻觉”率(即生成虚假或捏造陈述的情况)在整个领域内竟高达 22% 至 94%。当用户向模型输入刻意虚假的前提时,GPT-4o 的准确率从 98.2% 骤降至 64.4%;在同样的测试下,DeepSeek R1 从 90% 以上跌至 14.4%。本应拦截恶意提示词的安全护栏在攻击者的探测下经常失效。
企业为何陷入忙乱
政策的制定速度超过了执行速度。从上次调查到今年,没有任何 AI 治理措施的企业比例从 24% 下降到 11%,许多企业现在开始引用 ISO/IEC 42001 或 NIST AI Risk Management Framework 等标准。制定政策并不等同于严格执行。59% 的受访者受到内部知识缺口的困扰,48% 受预算限制,41% 则受到监管不确定性的困扰。报告将其称为一个“技术问题”:收紧隐私控制可能会在无意中削弱公平性指标,反之亦然,这使得工程师在缺乏充足工具或资金的情况下,不得不权衡各种相互冲突的目标。
当前安全检查的幻象
透明度得分(衡量开发者披露模型局限性和测试方法的公开程度的综合指标)从 58 分滑落至 40 分,表明自愿报告正在失去公信力。企业依赖内部审计,而这些审计往往会忽略指数中所记录的极端情况下的失效。其结果是产生了一种虚假的安全感:组织认为自己受到了保护,而隐藏的漏洞却依然存在。
反方观点:标准正在获得认可
支持者认为,参考 ISO 和 NIST 框架是向前迈出的一步。正式标准为审计员和监管机构提供了通用的语言和基准预期,使跨企业的比较变得更加容易。早期采用者报告称,当政策存在时,内部协作会更加顺畅,升级路径也更加清晰。政策采用率的上升表明,行业已经意识到了风险,并愿意在治理方面进行投入。
仍然缺失的部分
即便纸面上有了政策,执行层面依然乏力。该指数强调了三个实际障碍:
- 知识缺口: 团队缺乏 AI 风险方面的深厚专业知识,导致合规检查流于表面。
- 资金短缺: 安全工具、第三方审计和持续监测需要预算,而许多企业无法证明这些支出的合理性。
- 监管迷雾: 模糊或不断变化的法律使得设计长期的合规路线图变得困难。
解决这些问题可能需要外部验证。报告建议超越自我评估,转向模拟现实世界使用场景和对抗性攻击的独立评估。报告还呼吁开发工程解决方案,将安全检查直接嵌入到模型流水线中,而不是将其视为事后补救。
