템플릿 토큰을 통한 헤드 가지치기(Pruning) 가능

템플릿 토큰을 사용하면 재학습 없이도 디퓨전 트랜스포머(diffusion transformer) 연산량의 약 5분의 1을 줄일 수 있으며, 품질 저하는 거의 느껴지지 않습니다.

새로운 연구에 따르면 특정 토큰들이 '시맨틱 레지스터(semantic registers)' 역할을 한다는 사실이 밝혀졌습니다. 이는 프롬프트의 정보를 모아두는 작은 "싱크(sinks)"와 같습니다. 저자들은 어떤 어텐션 헤드가 이러한 레지스터에 가장 집중하는지 추적하여 해당 헤드들을 제거했습니다. 그 결과 GenEval 벤치마크 점수는 단 1.4점 하락한 반면, 모델의 어텐션 FLOPs는 약 20% 절감되었습니다.

디퓨전 모델에서 가지치기가 중요한 이유

디퓨전 트랜스포머는 많은 텍스트-이미지 생성기의 핵심 동력입니다. 어텐션 레이어는 추론 과정에서 연산 예산의 대부분을 차지하므로, 약간의 감소만으로도 이미지 생성 속도를 높이고 에너지 사용량을 줄일 수 있습니다. 기존의 가지치기 기법들은 대개 모든 헤드가 동일하게 기여한다고 가정하고 가중치 크기나 그래디언트 신호를 조사합니다. 이러한 일괄적인 접근 방식은 불필요한 연산을 너무 많이 남겨두거나, 너무 많은 헤드를 제거하여 출력 품질을 해칠 수 있습니다.

템플릿 토큰 트릭

연구진은 소수의 토큰이 텍스트 프롬프트로부터 객체 수준의 단서(object-level cues)를 지속적으로 수집한다는 점을 관찰했습니다. 이러한 "템플릿 토큰"은 전용 레지스터처럼 작동합니다. 즉, 프롬프트의 의미론적 정보(semantics)를 흡수하여 하위 단계로 전달하는 동안, 모델의 나머지 부분은 시각적 세부 사항을 계속 처리합니다.

가지치기 파이프라인은 간단합니다:

  1. 몇 개의 프롬프트에 대해 포워드 패스(forward pass)를 실행하고 어텐션 점수를 기록합니다.
  2. 가장 강력한 연결이 템플릿 토큰을 향하는 헤드를 식별합니다.
  3. 모델에서 해당 헤드들을 제거합니다. 추가 데이터, 미세 조정(fine-tuning) 또는 아키텍처 변경은 필요하지 않습니다.

제거된 헤드들은 주로 템플릿 토큰이 이미 보유하고 있는 프롬프트 정보를 전달했기 때문에, 전체적인 신호 흐름은 온전하게 유지됩니다.

수치로 증명되는 결과

이 방법을 표준 텍스트-이미지 디퓨전 트랜스포머에 적용하면 다음과 같은 결과가 나타납니다:

  • 어텐션 FLOPs 약 20% 감소, 추론 속도 직접 향상.
  • GenEval 점수 단 1.4점 하락, 연산량 이득을 고려하면 미미한 수준.
  • 시각적 충실도(visual fidelity)를 거의 유지하면서 헤드의 **20%~30%**를 가지치기할 수 있는 능력.

반면, 단순히 헤드 비율을 깎아내는 방식은 유용한 문맥 혼합 경로(context-mixing pathways)를 무차별적으로 버리기 때문에 종종 더 큰 품질 저하를 초래합니다.

한계 및 남은 과제

이 연구는 텍스트 프롬프트를 이미지로 변환하는 디퓨전 트랜스포머에만 국한되어 있습니다. 동일한 템플릿 토큰 현상이 더 큰 언어 모델이나 다른 멀티모달 아키텍처에서도 나타나는지는 아직 불분명합니다. 만약 레지스터가 없거나 다르게 작동한다면, 이 가지치기 방식의 이점이 사라질 수도 있습니다.

또 다른 주의 사항은 미미하지만 발생하는 품질 저하입니다.

향후 주목할 점

향후 연구는 다음과 같은 내용을 탐구할 가능성이 높습니다:

  • 템플릿 토큰이 다른 트랜스포머 계열에서도 자연스럽게 나타나는지 여부.
  • 모델 크기와 학습 데이터 양에 따라 이 방식이 어떻게 확장되는지 여부.

핵심 요약: 연구진은 템플릿 토큰이 시맨틱 레지스터로서 수행하는 숨겨진 역할을 활용하여, 디퓨전 트랜스포머를 정밀하게 다듬는 방법을 찾아냈습니다. 이는 출력 품질을 거의 유지하면서 연산량의 약 5분의 1을 줄이는 방식입니다. 이를 통해 비용이 많이 드는 재학습 없이도 AI 생성 이미지를 더 빠르고 저렴하게 만들 수 있을 것입니다.