단일 RTX 5090에서 실행된 5개의 로컬 LLM 에이전트 벤치마크 결과, 350억 파라미터 규모의 MoE(Mixture-of-Experts) 모델이 실제 코딩 작업에서 다른 모델들을 압도했습니다. 클라우드 API 없이 기존 관리자 패널에 태그 관리자(Tag Manager)를 추가하는 테스트에서 Qwen 3.6 35B-A3B가 압도적인 승자로 선정되었습니다.

이 테스트가 중요한 이유

개인용 하드웨어에서 대규모 언어 모델을 실행하면 개발자는 API 비용과 데이터 프라이버시 문제를 피할 수 있습니다. 하지만 "로컬 에이전트"는 여전히 유행어에 불과합니다. 이들이 실제로 사람의 도움 없이 파일을 편집하고, 명령줄 도구를 호출하며, 프로덕션 수준의 코드를 배포할 수 있을까요? 클라우드 서비스를 배제한 이번 실전 비교는 기술의 현주소를 개발자들에게 구체적으로 보여줍니다.

하드웨어 및 작업 내용

5개 모델 모두 동일한 워크스테이션(일반적인 하이엔드 소비자용 그래픽 카드인 RTX 5090 GPU 사용)에서 외부 서비스 없이 실행되었습니다. 작업은 의도적으로 단순하지만 대표적인 사례로 설정되었습니다. 이미 구축된 관리자 섹션에 태그 관리자 컴포넌트를 추가하는 것입니다. 성공을 위해서는 모델이 올바른 소스 파일을 찾아내고, 이를 편집하며, 새로운 기능이 기존 기능을 망가뜨리지 않고 통합되었는지 확인해야 했습니다.

모델 성능

  • Qwen 3.6 35B-A3B (MoE) – 자율적으로 작업을 완료했으며, 요청하지 않은 합리적인 개선 사항까지 추가했고, 실행 후 별도의 패치가 필요하지 않았습니다.
  • Qwen 3.6 27B (dense) – 작업을 완료했으나 상호작용 단계가 약 두 배 더 많았고, 때때로 지침을 잘못 해석했습니다.
  • GLM-4.7-Flash (dense) – 작동하는 구현물을 만들어냈지만, 잘못된 파일 매칭 패턴을 사용하고 보안 검사를 누락하여 코드가 취약한 상태로 남았습니다.
  • Qwythos-9B – 실제 도구를 전혀 실행하지 못했습니다. 모델 자체의 문제인지 로컬 설정의 문제인지 명확하지 않았으나, 테스트를 통해 원인을 분리해낼 수는 없었습니다.
  • Nemotron-3-Nano (hybrid) – 루프에 빠져 이미 찾은 폴더를 찾는 데 40번의 턴을 소비하며 더 이상 진행하지 못했습니다.

결과가 시사하는 점

아키텍처는 신뢰할 수 있는 예측 지표가 아니다

파라미터를 여러 전문가 서브 네트워크로 나누는 MoE 모델이 압도적인 승리를 거둔 반면, dense 및 hybrid 변체들은 성공과 완전한 실패로 갈렸습니다. 이는 단순히 아키텍처를 선택하는 것만으로는 도구 사용 능력을 보장할 수 없음을 시사합니다.

도구 사용은 여전히 큰 장벽이다

5개의 에이전트 중 테스트를 위해 제공된 전용 스크린샷 도구를 사용한 모델은 없었습니다. 모두 파일 이름을 추측하거나 간접적인 우회 방법을 시도하며 임기응변식으로 대처했습니다. "코드를 생성할 수 있는 능력"과 "외부 유틸리티를 오케스트레이션할 수 있는 능력" 사이의 격차는 여전히 큽니다.

로컬 실행은 모델뿐만 아니라 스택 전체를 디버깅해야 함을 의미한다

두 모델은 테스트를 시작하기도 전에 프롬프트 템플릿에 대한 즉각적인 패치가 필요했습니다. 모델 특유의 버그를 수정하는 데 소비된 노력이 실제 태그 관리자 코드를 작성하는 데 들인 시간보다 많았으며, 이는 현재의 로컬 배포 환경이 얼마나 취약한지를 잘 보여줍니다.

주의 사항

이 벤치마크는 단일 하드웨어 구성, 단일 코딩 시나리오, 그리고 소수의 모델 세트를 반영합니다. Qwen 3.6 35B-A3B는 이전 라운드에서 실패한 적이 있었으나, 이는 일시적인 현상이었습니다. 따라서 이 결과는 결정적인 것이 아니라 지표로서의 의미를 갖습니다.

향후 주목할 점

향후 라운드에서는 작업 세트를 확장하고, 더 다양한 도구 체인을 포함하며, 더 넓은 범위의 하드웨어에서 테스트를 진행해야 합니다. 관찰자들은 MoE 모델이 지속적으로 dense 및 hybrid 설계를 능가하는지, 그리고 개발자들이 수동 버그 패치의 필요성을 없애는 신뢰할 수 있는 래퍼(wrapper)를 구축할 수 있을지를 지켜봐야 합니다.

핵심 요약: 35B MoE 모델은 이미 유능한 로컬 코딩 어시스턴트 역할을 수행할 수 있지만, 도구 통합, 프롬프트 엔지니어링, 안정적인 런타임과 같은 광범위한 생태계는 여전히 뒤처져 있습니다. 이러한 요소들이 조화를 이루기 전까지 개발자들은 "플러그 앤 플레이(plug-and-play)" 방식의 로컬 에이전트에 대해 지나친 기대를 경계해야 합니다.