DeepSeek a publié le modèle V4 Pro en disponibilité générale (GA). Les premières mesures montrent qu'il réduit l'utilisation des jetons de raisonnement (reasoning tokens) de 18 % à 62 % par rapport à la version preview. Cela importe pour quiconque paie au jeton : les mêmes prompts coûtent désormais nettement moins cher tout en produisant des résultats comparables.

Ce qui a motivé la comparaison

La version GA est arrivée sans article de blog ni journal des modifications (changelog), les développeurs ont donc dû découvrir les différences par eux-mêmes. Un test communautaire a exécuté des tâches identiques sur les deux versions et a constaté le changement majeur : une chute brutale du nombre de jetons que le modèle passe à « réfléchir » avant de répondre. Pour des recherches triviales, le modèle GA a utilisé 62 % de jetons de raisonnement en moins ; pour des requêtes plus complexes, la réduction était de 18 %.

Efficacité des jetons et son impact

Dans un flux de travail d'extraction typique, la version preview consommait 159 jetons de raisonnement pour extraire quelques champs d'un prompt. Le passage à la version GA avec la fonction « thinking » désactivée a fait chuter ce nombre à 40 jetons. Pour les utilisateurs sur des forfaits à la consommation, ces économies se traduisent directement par des factures moins élevées, surtout à grande échelle.

Extraction JSON : l'écueil caché

Les deux versions trébuchent lorsque le mode « thinking » est activé : elles passent la vérification du schéma JSON mais insèrent des valeurs numériques erronées. Seule la version GA renvoie un JSON correct lorsque le mode « thinking » est désactivé. Les équipes ayant besoin de sorties structurées devraient désactiver le flag « thinking » pour les tâches d'extraction, sous peine de recevoir des données syntaxiquement valides mais numériquement incorrectes.

La gestion des refus change la donne

Le modèle preview pouvait refuser une question qu'il jugeait impossible à traiter en répondant « Je ne sais pas ». Le modèle GA ne fait plus cela. À la place, soit il épuise son budget de jetons sans répondre, soit il fabrique une réponse. Ce changement améliore l'efficacité des jetons mais supprime un filet de sécurité qui empêchait le modèle d'halluciner sur des sujets inconnus.

Amélioration de la fiabilité

Une boucle dangereuse dans la version preview — déclenchée par un budget de « thinking » modeste — pouvait amener le modèle à répéter le même texte jusqu'à ce que la fenêtre de 8 192 jetons soit pleine. La version GA corrige ce bug, mettant fin aux répétitions incontrôlées qui risquaient auparavant d'épuiser la fenêtre de requête et de gonfler les coûts.

Ce que les utilisateurs doivent surveiller

  • Utilisez la version GA pour réduire le nombre de jetons. Les réductions mesurées se maintiennent quelle que soit la complexité de la tâche.
  • Désactivez le mode « thinking » pour toute extraction de JSON ou de données structurées. Cela garantit des valeurs correctes et maintient une utilisation minimale des jetons.
  • Ne comptez pas sur les refus intégrés. Si un prompt demande des données invérifiables, le modèle GA peut tout de même produire une réponse ; une validation en aval reste donc essentielle.
  • Surveillez la facturation aux heures de pointe. Les nouvelles règles de tarification font que la consommation de jetons pendant les périodes de fort trafic affecte le montant total de manière plus marquée qu'auparavant.

L'essentiel

Le modèle V4 Pro GA de DeepSeek offre un gain d'efficacité évident — jusqu'à 62 % de jetons de raisonnement en moins — et corrige un bug de répétition critique. Cependant, la perte des réponses de refus explicites et la nécessité de désactiver le mode « thinking » pour obtenir des sorties JSON précises ajoutent de nouvelles contraintes. Les équipes qui adaptent leurs pipelines peuvent réduire leurs coûts sans sacrifier les fonctionnalités.

Source : https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l