Un benchmark de cinco agentes LLM ejecutados localmente en una única RTX 5090 muestra que un modelo de mezcla de expertos (MoE) de 35 mil millones de parámetros superó a sus pares en una tarea de programación del mundo real. La prueba, que consistió en añadir un Tag Manager a un panel de administración existente sin utilizar ninguna API en la nube, coronó a Qwen 3.6 35B-A3B como el claro ganador.
Por qué es importante la prueba
Ejecutar modelos de lenguaje de gran tamaño en hardware personal permite a los desarrolladores evitar las tarifas de las API y las preocupaciones por la privacidad de los datos. Sin embargo, los "agentes locales" siguen siendo una palabra de moda: ¿pueden realmente editar archivos, llamar a herramientas de línea de comandos y entregar código listo para producción sin que un humano los guíe? Esta comparación práctica, despojada de servicios en la nube, ofrece a los desarrolladores una idea concreta de en qué punto se encuentra la tecnología.
El hardware y la tarea
Los cinco modelos se ejecutaron en la misma estación de trabajo: una GPU RTX 5090, una tarjeta de consumo de gama alta típica, y sin servicios externos. La tarea fue deliberadamente sencilla pero representativa: añadir un componente Tag Manager a una sección de administración ya construida. El éxito requería que el modelo localizara los archivos fuente correctos, los editara y verificara que la nueva funcionalidad se integrara sin romper la funcionalidad existente.
Rendimiento de los modelos
- Qwen 3.6 35B-A3B (MoE) – Terminó el trabajo de forma autónoma, añadió mejoras sensatas que no fueron solicitadas y no necesitó parches posteriores a la ejecución.
- Qwen 3.6 27B (dense) – Completó la tarea pero requirió aproximadamente el doble de pasos de interacción y, ocasionalmente, malinterpretó las instrucciones.
- GLM-4.7-Flash (dense) – Produjo una implementación funcional pero utilizó patrones de coincidencia de archivos incorrectos y omitió controles de seguridad, dejando el código vulnerable.
- Qwythos-9B – No ejecutó ninguna herramienta real; el fallo podría deberse al propio modelo o a la configuración local, pero la prueba no pudo aislar la causa.
- Nemotron-3-Nano (hybrid) – Se quedó atrapado en un bucle, pasando 40 turnos buscando una carpeta que ya había localizado, y nunca progresó más allá de ese punto.
Qué revelan los resultados
La arquitectura no es un predictor fiable
El modelo MoE, que divide sus parámetros entre múltiples subredes de expertos, ganó rotundamente, mientras que las variantes densas e híbridas se dividieron entre el éxito y el fracaso total. Esto sugiere que las elecciones arquitectónicas puras no garantizan la competencia en el uso de herramientas.
El uso de herramientas sigue siendo un obstáculo importante
Ninguno de los cinco agentes utilizó la herramienta de captura de pantalla dedicada proporcionada para la prueba. Todos intentaron improvisar, ya sea adivinando los nombres de los archivos o intentando soluciones indirectas. La brecha entre "poder generar código" y "poder orquestar utilidades externas" sigue siendo amplia.
Ejecutar localmente significa depurar el stack, no solo el modelo
Dos modelos requirieron parches sobre la marcha en sus plantillas de prompt antes de que la prueba pudiera siquiera comenzar. El esfuerzo dedicado a corregir errores específicos del modelo eclipsó el tiempo dedicado a escribir el código real del Tag Manager, lo que resalta lo frágiles que son los despliegues locales actuales.
Una nota de precaución
El benchmark refleja una única configuración de hardware, un único escenario de programación y un pequeño conjunto de modelos. El Qwen 3.6 35B-A3B había fracasado anteriormente en una ronda previa; su fallo anterior fue una casualidad. Por lo tanto, los resultados son indicativos, no definitivos.
Qué observar a continuación
Las próximas rondas deberán ampliar el conjunto de tareas, incluir cadenas de herramientas más diversas y realizar pruebas en una gama más amplia de hardware. Los observadores deben seguir si los modelos MoE superan consistentemente a los diseños densos e híbridos, y si los desarrolladores pueden construir wrappers fiables que eliminen la necesidad de corregir errores manualmente.
Conclusión: Un modelo MoE de 35B ya puede actuar como un asistente de programación local competente, pero el ecosistema más amplio —integración de herramientas, ingeniería de prompts y runtimes estables— todavía se queda atrás. Hasta que esas piezas encajen, los desarrolladores deberían moderar sus expectativas sobre los agentes locales "plug-and-play".
