புதிய மாடல் ஏன் “கடினமாக” உணரப்படுகிறது
பல நிலைகளில் சிந்திக்க வேண்டிய தன்னாட்சி ஏஜெண்டுகளுக்காக (autonomous agents) Google Gemini 3.8 Flash-ஐ உருவாக்கியுள்ளது. பொதுவாக ஒரே முறையில் பதிலளிக்கும் Gemini 3.7 Flash போலல்லாமல், 3.8 ஒரு சிக்கலை துணை வினாக்களாகப் பிரிக்கிறது, வெளிப்புற API-களை அழைக்கிறது மற்றும் அது திருப்தி அடையும் வரை மீண்டும் மீண்டும் செயல்படுகிறது. இந்த கூடுதல் சிந்தனைப் பணி அதிக டோக்கன்களை (tokens) எடுத்துக்கொள்ளும் என்று, குறிப்பாக அதிக “முயற்சி” (effort) அமைப்பில் இருக்கும்போது, Google எச்சரிக்கிறது.
ஒரு தனிப்பட்ட ஆய்வு, 3.7 Flash உடன் ஒப்பிடுகையில் ஒரு பணிக்குத் தேவைப்படும் வெளியீட்டு டோக்கன்கள் (output tokens) சுமார் 30% உயருகின்றன என்பதையும், உரையாடல் சுற்றுகளும் (interaction turns) அதிகரிப்பதையும் காட்டுகிறது. டோக்கன் கட்டணம் மாறாமல் இருப்பதால், பல நிஜ உலகப் பணிகளுக்கு (real-world workloads) அதன் உண்மையான செலவு தோராயமாக 40% உயர்கிறது.
டெவலப்பர்களுக்கு முக்கியமான பெஞ்ச்மார்க்ஸ்கள்
இந்தச் சமரசத் தன்மை (trade-off) வெறும் கோட்பாடு சார்ந்தது மட்டுமல்ல. DeepSWE v1.1 மென்பொருள் பொறியியல் பெஞ்ச்மார்க்கில் நடத்தப்பட்ட நேரடிச் சோதனையில், Gemini 3.8 Flash, Anthropic-ன் Fable 5-ஐத் தெளிவாகத் தோற்கடித்தது. மேலும், இந்த மாடல் Vals Finance Agent V2 மற்றும் Harvey’s Legal Agent பெஞ்ச்மார்க்குகளிலும் முதலிடம் பிடித்தது, இதன் மூலம் சிக்கலான நிதி கணக்கீடுகள் மற்றும் நுணுக்கமான சட்ட ரீதியான காரணங்களை அதனால் கையாள முடியும் என்பதை நிரூபித்துள்ளது.
Aigora.ai-ன் CEO ஜான் என்னிஸ் (John Ennis), இதன் சிறப்பம்சத்தைச் சுருக்கமாகக் கூறுகையில்: இந்த மாடல் மிகக் குறைந்த செலவிலும், குறிப்பிடத்தக்க வேகத்திலும் “Opus 5 coding quality”-ஐ வழங்குகிறது என்றார். வேகமான அனுமானம் (inference) மற்றும் அதிநவீன குறியீடு உருவாக்கம் (code generation) உற்பத்திச் சங்கிலியில் (production pipelines) பல மணிநேரங்களைக் குறைக்கும் Remotion வீடியோக்களை உருவாக்குவது போன்ற பயன்பாட்டு உதாரணங்களை அவர் குறிப்பிடுகிறார்.
மாறிவரும் AI பொருளாதாரம்
டெவலப்பர்கள் முன்பு டோக்கன் விலை (price-per-token) மூலம் செலவுத் திறனைத் தீர்மானித்தனர். ஆனால், பல சுற்றுகள் மற்றும் கருவிகளால் மேம்படுத்தப்பட்ட (tool-augmented) ஏஜெண்டுகள், அந்த அளவீட்டை “வெற்றிகரமான பணிக்கான விலை” (price-per-successful-task) என மாற்றுகின்றன. Gemini 3.8 Flash-ஐப் பொறுத்தவரை, ஒரே முடிவை அடைய மாடல் அதிக டோக்கன்களைப் பயன்படுத்தினால், குறைந்த டோக்கன் விலை என்பது குறைந்த கட்டணத்திற்கு உத்தரவாதம் அளிக்காது.
Google இந்த மாடலை மிக அதிக விலை கொண்ட முன்மாதிரி மாடல்களுக்கும் (frontier models), இலகுரக, ஒற்றை-சுற்றுத் தயாரிப்பாளர்களுக்கும் (single-turn generators) இடையில் நிலைநிறுத்துகிறது. இதை “intelligence-on-demand” என்று அடையாளப்படுத்துவதன் மூலம், பெரிய மற்றும் மெதுவான மாடல்களுடன் வரும் தாமதமின்றி (latency), டெவலப்பர்கள் அதிக தர்க்க ரீதியான ஆற்றலைப் பெற முடியும் என்பதை நிறுவனம் உணர்த்துகிறது. இதில் உள்ள சமரசத் தன்மை தெளிவானது: மிகவும் நுணுக்கமான வெளியீடு என்பது அதிகப்படியான மொத்த டோக்கன் எண்ணிக்கையைக் குறிக்கிறது.
எப்போது பழைய பதிப்பிலேயே தொடர வேண்டும்
செலவுகளைத் துல்லியமாகக் கணிக்க வேண்டிய குழுக்கள்—குறிப்பாக பெரிய அளவிலான தொகுதிப் பணிகளை (batch jobs) மேற்கொள்ளும் அல்லது குறைந்த லாப வரம்பில் இயங்கும் குழுக்கள்—Gemini 3.7 Flash-லேயே தொடர வேண்டும். பழைய மாடல் இன்னும் குறைந்த தாமதத்தையும் (low latency) நிலையான டோக்கன் பயன்பாட்டையும் வழங்குவதால், மாதாந்திரச் செலவைக் கணிப்பது எளிதாக இருக்கும்.
அடுத்து கவனிக்க வேண்டியவை
- கருவி அழைப்பு விலை (Tool-call pricing):
சுருக்கம்
Gemini 3.8 Flash, அதிக தர்க்க ரீதியான சிந்தனை (higher reasoning) மின்னல் வேகத் தாமதத்துடன் (flash-level latency) கிடைக்க முடியும் என்பதைக் காட்டுகிறது, ஆனால் ஒவ்வொரு உரையாடலுக்கும் அதிக டோக்கன்களைப் பயன்படுத்துகிறது. அதிநவீன, பல-படிநிலை AI ஏஜெண்டுகளை உருவாக்கும் டெவலப்பர்களுக்கு இதன் செயல்திறன் அதிகரிப்பு ஈர்க்கக்கூடியதாக இருக்கும், இருப்பினும் மறைமுகமான டோக்கன் செலவுகளை ஈடுகட்ட அவர்கள் பட்ஜெட்டை மாற்றியமைக்க வேண்டும். மற்ற அனைவருக்கும், பழைய 3.7 Flash பாதுகாப்பான மற்றும் எளிதில் கணிக்கக்கூடிய தேர்வாகவே இருக்கும்.
