DeepSeek hat das V4 Pro General-Availability (GA)-Modell veröffentlicht. Erste Messungen zeigen, dass es den Verbrauch an Reasoning-Token im Vergleich zum Preview-Build um 18 % bis 62 % senkt. Das ist entscheidend für alle, die pro Token bezahlen: Dieselben Prompts kosten nun spürbar weniger, während sie weiterhin vergleichbare Ergebnisse liefern.

Was den Vergleich auslöste

Das GA-Release erschien ohne Blogpost oder Changelog, sodass Entwickler die Unterschiede selbst entdecken mussten. Ein Community-Test führte identische Aufgaben auf beiden Versionen aus und stellte die größte Änderung fest – einen drastischen Rückgang der Token, die das Modell vor der Antwort mit „Nachdenken“ verbringt. Bei trivialen Abfragen verbrauchte das GA-Modell 62 % weniger Reasoning-Token; bei komplexeren Anfragen lag die Reduzierung bei 18 %.

Token-Effizienz und ihre Auswirkungen

In einem typischen Extraktions-Workflow verbrauchte der Preview-Build 159 Reasoning-Token, um eine Handvoll Felder aus einem Prompt zu extrahieren. Der Wechsel zum GA-Build mit deaktivierter „Thinking“-Funktion senkte diese Zahl auf 40 Token. Für Nutzer mit nutzungsbasierten Tarifen schlagen sich die Einsparungen direkt in niedrigeren Kosten nieder, insbesondere bei großem Umfang.

JSON-Extraktion: Die versteckte Falle

Beide Builds haben Probleme, wenn der „Thinking“-Modus aktiviert ist: Sie bestehen zwar die JSON-Schema-Prüfung, fügen jedoch falsche numerische Werte ein. Nur die GA-Version liefert korrektes JSON, wenn das „Thinking“ ausgeschaltet ist. Teams, die strukturierte Ausgaben benötigen, sollten das Thinking-Flag für Extraktionsaufgaben deaktivieren, da sie sonst syntaktisch korrekte, aber numerisch falsche Daten erhalten.

Verweigerungshandling ändert die Spielregeln

Das Preview-Modell konnte eine Frage, die es für unbeantwortbar hielt, mit der Antwort „Ich weiß es nicht“ ablehnen. Das GA-Modell tut dies nicht mehr. Stattdessen erschöpft es entweder sein Token-Budget, ohne zu antworten, oder es erfindet eine Antwort. Diese Änderung verbessert zwar die Token-Effizienz, entfernt aber ein Sicherheitsnetz, das das Modell vor Halluzinationen bei unbekannten Themen bewahrte.

Zuverlässigkeitssteigerung

Eine gefährliche Endlosschleife im Preview-Build – ausgelöst durch ein bescheidenes „Thinking“-Budget – konnte dazu führen, dass das Modell denselben Text wiederholte, bis das 8.192-Token-Fenster gefüllt war. Das GA-Release behebt diesen Bug und beendet die unkontrollierte Wiederholung, die zuvor das Risiko barg, das Anfragefenster zu erschöpfen und die Kosten in die Höhe zu treiben.

Worauf Nutzer achten sollten

  • Nutzen Sie den GA-Build für geringere Token-Anzahlen. Die gemessenen Reduzierungen bleiben über verschiedene Komplexitätsstufen hinweg bestehen.
  • Deaktivieren Sie „Thinking“ bei jeder JSON- oder strukturierten Datenextraktion. Dies liefert korrekte Werte und hält den Token-Verbrauch minimal.
  • Verlassen Sie sich nicht auf integrierte Verweigerungen. Wenn ein Prompt nach nicht verifizierbaren Daten fragt, liefert das GA-Modell möglicherweise dennoch eine Antwort, weshalb eine Validierung in nachgelagerten Prozessen weiterhin unerlässlich ist.
  • Achten Sie auf die Abrechnung zu Spitzenzeiten. Neue Preisregeln führen dazu, dass sich der Token-Verbrauch in Zeiten mit hohem Datenverkehr stärker auf die Gesamtausgaben auswirkt als zuvor.

Fazit

Das V4 Pro GA-Modell von DeepSeek bietet einen klaren Effizienzvorteil – bis zu 62 % weniger Reasoning-Token – und behebt einen kritischen Wiederholungs-Bug. Der Wegfall expliziter Verweigerungsantworten und die Notwendigkeit, das „Thinking“ für korrekte JSON-Ausgaben zu deaktivieren, bringen jedoch neue Überlegungen mit sich. Teams, die ihre Pipelines anpassen, können Kosten senken, ohne an Funktionalität einzubüßen.

Quelle: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l