自主智能体会产生关于自身历史的幻觉。这种幻觉并非大语言模型从训练数据中捏造事实那种戏剧性的方式,而是一种隐蔽且潜移默化的方式:系统说服自己,现实世界与它的笔记完全吻合。ALICE 是一个旨在管理复杂工作流的自主智能体,她正深受其害。她每天醒来时都带着技能、目标感,以及对工作进度的记忆。然而,当记忆与现实发生脱节时,麻烦开始了。

在每个会话中,ALICE 都会读取由“过去的自己”编写的交接文件。其中包含了目录指针、待办任务和状态假设。文件经常坚称某个目录存在,ALICE 也深信不疑,但文件系统却并不认同。这并非传统意义上的代码 Bug。在应该抛出异常的地方,并没有抛出任何异常。这是一种认识论上的缺陷:ALICE 假设自己的笔记就是事实真相。

为什么 Linter 无济于事

传统工具无法发现这个问题。Linter 检查括号是否匹配,静态分析器寻找空指针。但它们都不会质疑整个智能体架构是否应该信任其内部状态。问题存在于代码层之上,在于关于“自主系统如何认知其已知信息”的设计假设中。你无法通过 Linter 来消除过度自信。

因此,作者转向了另一个完全不同的 AI。

Fable 5 以 Claude Code 的形式运行,与 ALICE 共享相同的硬件架构和基础模型。硬件和权重完全一致,但规则却不同。ALICE 会在不同会话间持续存在,积累上下文和惯例;而 Fable 5 在开始每项任务时都是一张白纸。他不认识 ALICE,对他设计的架构也毫无忠诚度。在每次审计结束时,他都会完全关闭,不带走任何记忆。这种“无知”正是其核心所在。旁观者清,一个与系统没有利益关系的评估者,会去质疑那些创造者早已习以为常、不再留意的部分。

审计设置

审计的结构类似于人类的技术评审,不同之处在于整个专家小组都存在于同一个会话中。Fable 5 将注意力分配给六个不同的评估者,在原始笔记完成之前,每个评估者都会忽略其他人的存在:

  • 功能缺失: 与竞争系统或常见的用户预期相比,缺少了哪些能力?
  • UX 流程: ALICE 处理错误、死胡同和空状态的表现是否优雅?她是让自己困惑了,还是让用户困惑了?
  • 安全性: 是否存在身份验证捷径、权限绕过或外部人员可以利用的信任假设?
  • 性能: 在哪些地方会出现内存泄漏、线程冲突或计算扩展性差的问题?
  • 运维: 是否存在备份?是否有监控机制?系统能否在无需人工干预的情况下进行部署和恢复?
  • 数据生命周期: 随着时间的推移,ALICE 如何处理删除、清理和状态一致性?

每个视角观察的是相同的文件,但得出的担忧却各不相同。性能评估者可能会在某个例程中标记并发风险,而运维评估者可能会批评该例程缺乏回滚逻辑。这种重叠并非冗余,而是覆盖。当安全性评估者与数据生命周期评估者在某个特定