DeepSeek가 V4 Pro 정식 출시(GA) 모델을 공개했습니다. 초기 측정 결과에 따르면, 프리뷰 빌드와 비교했을 때 추론 토큰 사용량이 18%에서 62%까지 감소한 것으로 나타났습니다. 이는 토큰당 비용을 지불하는 사용자에게 매우 중요한 변화입니다. 동일한 프롬프트를 사용하더라도 결과물은 비슷하면서 비용은 눈에 띄게 줄어들기 때문입니다.

비교가 이루어진 배경

GA 출시는 블로그 포스트나 변경 로그(changelog) 없이 이루어졌기 때문에, 개발자들이 직접 차이점을 찾아내야 했습니다. 커뮤니티 테스트 결과, 두 버전에서 동일한 작업을 수행했을 때 가장 큰 변화는 모델이 답변하기 전 "thinking"에 소비하는 토큰이 급격히 줄어든 것이었습니다. 단순 조회 작업에서는 GA 모델이 추론 토큰을 62% 적게 사용했고, 복잡한 질의에서는 18% 감소했습니다.

토큰 효율성과 그 영향

일반적인 추출 워크플로우에서 프리뷰 빌드는 프롬프트로부터 몇 개의 필드를 추출하는 데 159개의 추론 토큰을 소모했습니다. 반면 "thinking" 기능을 비활성화한 GA 빌드로 전환하면 이 수치는 40개로 급감합니다. 종량제 요금제를 사용하는 사용자에게 이러한 절감 효과는 특히 대규모 작업 시 직접적인 비용 절감으로 이어집니다.

JSON 추출: 숨겨진 문제점

두 빌드 모두 "thinking" 모드가 켜져 있을 때 문제가 발생합니다. JSON 스키마 검사는 통과하지만 잘못된 숫자 값을 삽입합니다. "thinking" 기능을 껐을 때 올바른 JSON을 반환하는 것은 GA 버전뿐입니다. 구조화된 출력이 필요한 팀은 추출 작업 시 thinking 플래그를 비활성화해야 합니다. 그렇지 않으면 구문은 유효하지만 수치는 틀린 데이터를 받게 될 수 있습니다.

거절 처리 방식의 변화

프리뷰 모델은 답변할 수 없다고 판단되는 질문에 대해 "모릅니다(I do not know)"라고 답하며 거절할 수 있었습니다. 하지만 GA 모델은 더 이상 이렇게 하지 않습니다. 대신 답변을 하지 못한 채 토큰 예산을 모두 소모하거나, 답변을 지어냅니다. 이러한 변화는 토큰 효율성을 높이지만, 모델이 모르는 주제에 대해 환각 현상을 일으키지 않도록 막아주던 안전장치를 제거하는 결과도 초래합니다.

신뢰성 향상

프리뷰 빌드에서는 적은 "thinking" 예산으로 인해 모델이 8,192토큰 창이 가득 찰 때까지 동일한 텍스트를 반복하는 위험한 루프가 발생할 수 있었습니다. GA 출시는 이 버그를 수정하여, 요청 창을 모두 소모하고 비용을 부풀릴 위험이 있었던 무분별한 반복 현상을 해결했습니다.

사용자가 주의해야 할 사항

  • 낮은 토큰 사용량을 위해 GA 빌드를 사용하세요. 작업 복잡도와 관계없이 측정된 감소 효과가 유지됩니다.
  • JSON 또는 구조화된 데이터 추출 시에는 "thinking"을 끄세요. 이를 통해 정확한 값을 얻고 토큰 사용을 최소화할 수 있습니다.
  • 내장된 거절 기능에 의존하지 마세요. 프롬프트가 검증 불가능한 데이터를 요구할 경우 GA 모델이 여전히 답변을 생성할 수 있으므로, 후속 검증(downstream validation)이 필수적입니다.
  • 피크 시간대 과금을 확인하세요. 새로운 가격 정책으로 인해 트래픽이 몰리는 시간대의 토큰 소비가 이전보다 전체 비용에 더 큰 영향을 미칠 수 있습니다.

요약

DeepSeek의 V4 Pro GA 모델은 추론 토큰을 최대 62%까지 줄이는 명확한 효율성 이점을 제공하며, 심각한 반복 버그를 해결했습니다. 하지만 명시적인 거절 응답의 부재와 정확한 JSON 출력을 위해 thinking 기능을 꺼야 한다는 점은 새로운 고려 사항입니다. 파이프라인을 적절히 조정하는 팀은 기능 저하 없이 비용을 낮출 수 있습니다.

Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l