GLM-5.3에서 “thinking: disabled” 플래그가 삭제되었습니다. 따라서 {"thinking":{"type":"disabled"}}를 전달하던 모든 통합 방식은 이제 응답 대신 에러를 반환합니다. 이 변경 사항으로 인해 하룻밤 사이에 수십 개의 테스트 스위트가 중단되었으며, 애플리케이션을 계속 실행하려면 개발자가 코드 한 줄을 다시 작성해야 합니다.

변화가 중요한 이유

GLM-5.2에서는 사소한 프롬프트의 경우 호출자가 사고(thinking) 모드를 끌 수 있었습니다. 이 옵션은 자동화 스크립트, 배치 처리 파이프라인, 저지연 봇에서 흔히 사용되는 패턴이었습니다. GLM-5.3은 이 플래그를 완전히 제거하고 low, high, max의 세 가지 effort 수준을 도입했으며, max가 기본값입니다. 새로운 모델은 항상 추론 과정(reasoning trace)을 생성하며, 이를 완전히 비활성화할 수 없습니다.

무엇이 고장 났으며 어떻게 전파되는가

요청 본문(request body)에 "type":"disabled"가 포함되어 있으면 서버는 페이로드를 거부하고 일반적인 실패 응답을 반환합니다. 인증 오류나 구문 오류가 나타나지 않기 때문에, 전체 회귀 테스트(regression run)가 실패하기 전까지는 문제를 발견하기 어려울 수 있습니다. 많은 코드베이스에서 이 플래그가 단일 재사용 가능 헬퍼 함수에 포함되어 있었기 때문에, 그 영향은 대규모 테스트 스위트와 프로덕션 엔드포인트 모두에 파급되었습니다.

정확한 코드 변경 사항

기존 페이로드를 다음으로 교체하십시오:

extra_body = {"thinking": {"type": "disabled"}}

GLM-5.3 호환 버전으로:

extra_body = {"thinking": {"type": "enabled", "effort": "low"}}

"type":"enabled" 키는 추론 엔진을 다시 활성화하며, "effort":"low"는 새 모델이 허용하는 한 이전의 비활성화 모드 속도를 최대한 유사하게 모방합니다.

성능 영향

동일한 코드 리뷰 프롬프트를 low-effort 설정으로 실행하면 "이전 속도와 유사한" 결과를 얻을 수 있지만 완전히 동일하지는 않습니다. 모델은 여전히 추론 과정을 출력하므로 몇 개의 추가 토큰과 약간의 지연 시간이 발생합니다. 처리량이 많거나 지연 시간에 민감한 워크로드의 경우, 오버헤드가 허용 가능한 수준인지 자체 데이터를 통해 벤치마크를 수행해야 합니다.

비용에도 불구하고 마이그레이션해야 하는 이유

GLM-5.3은 이전 모델의 7,440억 개 파라미터 아키텍처를 유지하면서 코딩 및 에이전트(agentic) 작업에 다시 집중합니다. 독립적인 벤치마크(Terminal-Bench 3.0)에 따르면 점수가 눈에 띄게 상승했으며, 내부 테스트에서는 여러 파일에 걸친 논리적 오류 탐지 능력이 향상된 것으로 보고되었습니다. 복잡한 코드 분석을 위해 이 모델을 사용하는 팀의 경우, 성능 향상이 토큰 소비의 소폭 증가보다 더 큰 가치를 제공할 수 있습니다.

무시할 수 없는 트레이드오프

만약 애플리케이션이 진정으로 사고 과정이 없는 응답(예: 순수 토큰 완성 서비스)을 필요로 한다면, 이제 GLM-5.3에는 이를 위한 기본 옵션이 없습니다. 개발자는 추가적인 추론 출력을 수용하거나, 여전히 비활성화 모드를 제공하는 다른 모델로 전환해야 합니다.

향후 주의 깊게 살펴볼 사항

  • 지연 시간 모니터링: 페이로드 변경 후, 응답 시간과 토큰 수를 추적하여 성능 저하를 조기에 발견하십시오.
  • Effort 조정: 일부 워크로드는 큰 성능 저하 없이 “high” 설정을 통해 이점을 얻을 수 있으므로, low 설정 이상의 실험을 해보십시오.
  • 향후 지원 중단: 단일 플래그의 제거는 API의 추가적인 통합이 발생할 수 있음을 시사합니다. 향후 릴리스 노트를 계속 확인하십시오.

요약: thinking 페이로드를 {"type":"enabled","effort":"low"}로 업데이트하면 GLM-5.3과의 호환성이 복구됩니다. 파이프라인에서 지연 시간과 토큰 사용량을 확인하고, 향상된 코딩 능력이 피할 수 없는 추론 과정의 비용을 정당화하는지 결정하십시오.

토론 및 커뮤니티 지원은 GyaanSetu AI Telegram 채널에서 이용할 수 있습니다.