Un benchmark de cinq agents LLM exécutés localement sur une seule RTX 5090 montre qu'un modèle mixture-of-experts (MoE) de 35 milliards de paramètres a surpassé ses pairs sur une tâche de codage en conditions réelles. Le test, qui consistait à ajouter un gestionnaire de balises (Tag Manager) à un panneau d'administration existant sans aucune API cloud, a couronné Qwen 3.6 35B-A3B comme grand vainqueur.

Pourquoi ce test est important

L'exécution de grands modèles de langage sur du matériel personnel permet aux développeurs d'éviter les frais d'API et les inquiétudes liées à la confidentialité des données. Pourtant, les « agents locaux » restent un mot à la mode : peuvent-ils réellement modifier des fichiers, appeler des outils en ligne de commande et livrer du code prêt pour la production sans assistance humaine ? Cette comparaison pratique, débarrassée des services cloud, donne aux développeurs une idée concrète de l'état actuel de la technologie.

Le matériel et la tâche

Les cinq modèles ont été exécutés sur la même station de travail : un GPU RTX 5090, une carte grand public haut de gamme typique, et sans services externes. La tâche était délibérément simple mais représentative : ajouter un composant Tag Manager à une section d'administration déjà construite. Le succès exigeait que le modèle localise les bons fichiers sources, les modifie et vérifie que la nouvelle fonctionnalité s'intègre sans casser les fonctionnalités existantes.

Performance des modèles

  • Qwen 3.6 35B-A3B (MoE) – A terminé le travail de manière autonome, a ajouté des améliorations pertinentes qui n'avaient pas été demandées et n'a nécessité aucun correctif après exécution.
  • Qwen 3.6 27B (dense) – A accompli la tâche mais a nécessité environ deux fois plus d'étapes d'interaction et a parfois mal interprété les instructions.
  • GLM-4.7-Flash (dense) – A produit une implémentation fonctionnelle mais a utilisé des modèles de correspondance de fichiers incorrects et a omis des contrôles de sécurité, laissant le code vulnérable.
  • Qwythos-9B – N'a exécuté aucun outil réel ; l'échec peut provenir du modèle lui-même ou de la configuration locale, mais le test n'a pas pu isoler la cause.
  • Nemotron-3-Nano (hybrid) – S'est retrouvé bloqué dans une boucle, passant 40 tours à chercher un dossier qu'il avait déjà localisé, et n'a jamais progressé au-delà de ce point.

Ce que révèlent les résultats

L'architecture n'est pas un prédicteur fiable

Le modèle MoE, qui répartit ses paramètres entre plusieurs sous-réseaux d'experts, l'a emporté haut la main, tandis que les variantes denses et hybrides se sont partagées entre succès et échec total. Cela suggère que les choix architecturaux bruts ne garantissent pas la compétence dans l'utilisation d'outils.

L'utilisation d'outils reste un obstacle majeur

Aucun des cinq agents n'a utilisé l'outil de capture d'écran dédié fourni pour le test. Tous ont tenté d'improviser, soit en devinant les noms de fichiers, soit en tentant des solutions de contournement indirectes. L'écart entre « savoir générer du code » et « savoir orchestrer des utilitaires externes » est encore important.

L'exécution locale implique de déboguer la pile technologique, pas seulement le modèle

Deux modèles ont nécessité des correctifs à la volée sur leurs modèles de prompt avant même que le test ne puisse commencer. L'effort consacré à la correction de bugs spécifiques au modèle a éclipsé le temps passé à écrire le code réel du Tag Manager, soulignant la fragilité des déploiements locaux actuels.

Une mise en garde

Le benchmark reflète une seule configuration matérielle, un seul scénario de codage et une petite suite de modèles. Le Qwen 3.6 35B-A3B avait précédemment échoué lors d'un tour précédent ; son échec initial était un coup de malchance. Les résultats sont donc indicatifs, et non définitifs.

Ce qu'il faut surveiller ensuite

Les prochains tours devront élargir l'ensemble des tâches, inclure des chaînes d'outils plus diversifiées et tester sur une gamme plus large de matériel. Les observateurs devront suivre si les modèles MoE surpassent systématiquement les conceptions denses et hybrides, et si les développeurs peuvent construire des wrappers fiables qui éliminent le besoin de correction manuelle de bugs.

À retenir : Un modèle MoE de 35B peut déjà agir comme un assistant de codage local compétent, mais l'écosystème plus large — intégration des outils, ingénierie de prompt et environnements d'exécution stables — est encore à la traîne. Tant que ces éléments ne seront pas parfaitement coordonnés, les développeurs devraient tempérer leurs attentes concernant les agents locaux « plug-and-play ».