模板 Token 实现注意力头剪枝

模板 Token 让研究人员无需重新训练即可减少扩散 Transformer 约五分之一的工作量;且质量损失几乎难以察觉。

一项新研究发现,某些 Token 起到了语义寄存器(semantic registers)的作用——它们是收集提示词(prompt)信息的微型“汇聚点”(sinks)。通过追踪哪些注意力头(attention heads)最关注这些寄存器,作者删除了这些头,在减少模型约 20% 注意力 FLOPs 的同时,GenEval 基准测试得分仅下降了 1.4 分。

为什么剪枝对扩散模型至关重要

扩散 Transformer 为许多文本生成图像(text-to-image)生成器提供动力。它们的注意力层在推理过程中占据了主要的计算预算,因此即使是小幅度的减少也能加速图像生成并降低能耗。现有的剪枝技巧通常检查权重大小或梯度信号,并假设每个注意力头贡献相等。这种“一刀切”的方法要么留下了太多未处理的工作,要么在移除过多注意力头时损害输出质量。

模板 Token 技巧

研究人员观察到,少数几个 Token 会持续从文本提示词中收集物体层级的线索。这些“模板 Token”表现得像专用寄存器:它们吸收提示词的语义并将其传递到下游,而模型的其余部分则继续处理视觉细节。

剪枝流程非常简单:

  1. 对少量提示词进行前向传播并记录注意力分数。
  2. 识别出那些与模板 Token 连接最强的注意力头。
  3. 从模型中移除这些头;无需额外数据、微调或架构更改。

由于被移除的注意力头主要传递的是模板 Token 已经持有的相同提示词信息,因此整体信号流保持完好。

数据说明一切

将该方法应用于标准的文本生成图像扩散 Transformer,可以实现:

  • 注意力 FLOPs 减少约 20%,直接加速推理。
  • GenEval 分数仅下降 1.4 分,考虑到计算能力的提升,这一跌幅微乎其微。
  • 能够剪掉 20%–30% 的注意力头,同时保持视觉保真度基本不变。

相比之下,盲目按比例剪掉注意力头通常会导致更大的质量下降,因为它们会不加区分地丢弃有用的上下文混合路径。

局限性与开放性问题

这项工作专门针对将文本提示词转换为图像的扩散 Transformer。目前尚不清楚同样的模板 Token 现象是否出现在更大的语言模型或其他多模态架构中。如果不存在这些寄存器,或者它们的行为不同,那么这种剪枝方案可能会失去优势。

另一个需要注意的点是轻微的质量下降。

后续关注点

未来的研究可能会探索:

  • 模板 Token 是否会在其他 Transformer 系列中自然出现。
  • 该方法如何随模型规模和训练数据量进行扩展。

核心结论: 通过利用模板 Token 作为语义寄存器的隐藏作用,研究人员找到了一种精准修剪扩散 Transformer 的方法——在减少约五分之一工作量的同时,保持输出质量几乎不变。这可以在无需昂贵重新训练的情况下,使 AI 生成的图像速度更快、成本更低。