DeepSeek தனது V4-Flash-Vision-Exp என்ற சோதனை முயற்சியிலான மல்டிமோடல் (multimodal) மாடலை அறிமுகப்படுத்தியுள்ளது. இது தனது உள் ஏஜென்ட் அளவுகோல்களில் (internal agent benchmarks) Anthropic-இன் Opus 4.8-க்கு இணையான செயல்திறனை வெளிப்படுத்துவதாகக் கூறுகிறது, அதே நேரத்தில் ஒவ்வொரு படத்திற்கும் டோக்கன் செலவை 384 ஆகக் கட்டுப்படுத்துகிறது. இந்த அறிமுகம், டெவலப்பர்களுக்குப் படங்களைப் பகுத்தறியும் திறனுடன் கூடிய, DeepSeek-இன் V4-Flash வரிசையின் வேகத்தை வழங்கும் ஒரு விரைவான மாற்றாக அமையும்.

இந்த அறிவிப்பு ஏன் முக்கியமானது

பன்முகத்தன்மை கொண்ட ஏஜென்ட்கள் (Multimodal agents)—பார்க்கவும், படிக்கவும் மற்றும் செயல்படவும் கூடிய அமைப்புகள்—தற்போது தன்னாட்சி கருவி மேம்பாட்டின் (autonomous-tool development) மையத்தில் உள்ளன. ஸ்கிரீன்ஷாட்டுகளைப் படிக்கும் வாடிக்கையாளர் சேவை பாட்கள் (customer-support bots) மற்றும் வரைபடங்களைப் பகுப்பாய்வு செய்யும் ஆராய்ச்சி உதவியாளர்கள் ஆகியவற்றிற்கு அணிகள் (teams) இவற்றைப் பயன்படுத்துகின்றன. Anthropic-இன் Opus 4.8 ஒரு உயர்ந்த தரத்தை நிர்ணயித்தது, ஆனால் அதன் விலை மற்றும் தாமதம் (latency) பலரைத் தயங்க வைத்தது. மிகக் குறைந்த டோக்கன் செலவில் கிட்டத்தட்ட சமமான செயல்திறனை வழங்கும் DeepSeek-இன் கூற்று, தங்கள் பணிப்பாய்வில் (workflow) விஷுவல் ஏஐ-யைப் பயன்படுத்தத் திட்டமிடுபவர்களின் செலவு-பயன் கணக்கீட்டை மாற்றியமைக்கக்கூடும்.

DeepSeek இந்த மாடலை எவ்வாறு உருவாக்கியது

புதிய மாடல், விரைவான உரை பகுத்தறிவு மற்றும் குறைந்த டோக்கன் பயன்பாட்டிற்காக ஏற்கனவே மேம்படுத்தப்பட்ட DeepSeek-இன் V4-Flash கட்டமைப்பை விரிவுபடுத்துகிறது. அதன் மையக் கட்டமைப்பில் ஒரு இமேஜ்-புரொசஸிங் (image-processing) முன்பகுதியை இணைப்பதன் மூலம், DeepSeek அடிப்படை மாடலின் உலக அறிவு மற்றும் பகுத்தறிவுத் திறனைப் பாதுகாத்துக்கொண்டே, விஷுவல் புரிதலையும் சேர்த்துள்ளது.

முக்கிய தொழில்நுட்பத் தெரிவுகள் பின்வருமாறு:

  • தானியங்கி வடிவக் கண்டறிதல் (Automatic format detection) – மாடல் படத்தின் பைனரி உள்ளடக்கத்தைப் படித்து அது JPEG, PNG, GIF அல்லது WebP என்பதைத் தீர்மானிக்கிறது, இதன் மூலம் தவறான கோப்புப் பெயரால் ஏற்படும் பிழைகளைத் தவிர்க்கிறது.
  • தகவமைப்பு மறுஅளவீடு (Adaptive resizing) – வரும் படங்கள் தோராயமாக 800 × 800 பிக்சல்களாக மாற்றப்படுகின்றன. டெவலப்பர்கள் குறைந்த விவரத் தேவை கொண்ட பயன்முறையை (lower-detail mode) கோரலாம், இது அளவை 512 × 512 ஆகக் குறைத்து, டோக்கன் பயன்பாட்டைக் மேலும் குறைக்கிறது.
  • டோக்கன் உச்சவரம்பு (Token ceiling) – படத்தின் அசல் தெளிவுத்திறன் (resolution) எதுவாக இருந்தாலும், மாடல் ஒரு படத்திற்கு 384 டோக்கன்களுக்கு மேல் வசூலிக்காது, இது பட்ஜெட் திட்டமிடலைத் துல்லியமாக்குகிறது.

DeepSeek தனது Harness framework-இன் பதிப்பு 0.1.1-ஐயும் வெளியிட்டுள்ளது. இது புதிய மாடலைத் தொகுத்து வழங்குவதோடு, OpenAI Chat Completions மற்றும் Responses APIs மற்றும் Anthropic-இன் Messages endpoint ஆகியவற்றிற்கான தயார்நிலை அடாப்டர்களையும் (adapters) வழங்குகிறது. அணிகள் மிகச் சில கட்டமைப்பு மாற்றங்களுடன் இந்த மாடலைத் தங்களின் தற்போதைய கோட்பாடுகளுக்குள் (codebases) இணைத்துக் கொள்ளலாம்.

டெவலப்பர்களுக்கு என்ன கிடைக்கும்

  • பரந்த அளவிலான பட ஆதரவு – JPEG, PNG, GIF மற்றும் WebP ஆகியவை ஏற்றுக்கொள்ளப்படுகின்றன. மேலும், மாடல் Base64 சரங்கள் (strings), பொதுவான URL-கள் (32 MiB வரை) அல்லது DeepSeek-இன் இலவச Files API மூலம் தரவைப் பெற முடியும். Files API 64 MiB வரையிலான ஒற்றை பதிவேற்றத்தைச் சேமித்து வைக்கும் மற்றும் பல உரையாடல்களில் அதன் ID மூலம் அதை மீண்டும் பயன்படுத்த அனுமதிக்கிறது, இது நீண்ட உரையாடல்களில் மீண்டும் மீண்டும் பதிவேற்றுவதைத் தவிர்க்கிறது.
  • அதிக அளவிலான சூழல் (High-volume context) – ஒரு ஒற்றை கோரிக்கையில் (request) 600 படங்கள் வரை இருக்கலாம். ஒரு படத்திற்கான அதிகபட்ச விளிம்பு நீளம் (edge length) 8,192 பிக்சல்கள் ஆகும்; ஒரு கோரிக்கையில் 15 அல்லது அதற்கு மேற்பட்ட படங்கள் இருக்கும்போது இது 4,096 பிக்சல்களாகக் குறையும், இது செயலாக்க நேரத்தைக் கட்டுப்படுத்த உதவுகிறது.
  • ஏஜென்ட்-தயார் பணிகள் (Agent-ready tasks) – இந்த மாடல் "ஏஜென்டிக்" (agentic) பணிச்சுமைகளுக்காகத் தயார் செய்யப்பட்டுள்ளது: சிக்கலான காட்சிகளை விவரித்தல், ஸ்கிரீன்ஷாட்டுகளில் இருந்து உரையைப் பிரித்தெடுத்தல் மற்றும் சிக்கலான வரைபடங்களை பகுப்பாய்வு செய்தல். இது V4-Flash-இன் பகுத்தறிவு வேகத்தைத் தக்கவைத்துக் கொள்வதால், ஒரு தடையாகவும் (bottleneck) மாறாமல், விஷுவல் குறிப்புகளை விரிவான சிந்தனைச் சங்கிலிகளுடன் (chains of thought) இணைக்க முடியும்.

இந்த அம்சங்கள் டெவலப்பர்கள் சந்திக்கும் பொதுவான சிக்கல்களைத் தீர்க்கின்றன: ஒரே அமர்வில் பல படங்களைக் கையாளுதல், டோக்கன் செலவு அதிகரிப்பதைத் தவிர்த்தல் மற்றும் API அழைப்புகளை மீண்டும் எழுதாமல் விஷுவல் ஏஐ-யை ஒருங்கிணைத்தல்.

சாத்தியமான வரம்புகள்

DeepSeek-இன் செயல்திறன் கூற்று அதன் உள் மல்டிமோடல் ஏஜென்ட் அளவுகோல்களை அடிப்படையாகக் கொண்டது. அந்தச் சோதனைகள் நிஜ உலக மாறுபாடுகளைக் காணத் தவறலாம்—அதாவது தெளிவற்ற புகைப்படங்கள், குறைந்த வெளிச்சம் அல்லது விசித்திரமான கோப்பு வடிவங்கள். "சோதனை முயற்சி" (experimental) என்ற லேபிளும், மாடல் இன்னும் நிலைத்தன்மை மற்றும் அளவிடுதல் (scaling) சிக்கல்களைச் சரிசெய்து கொண்டிருக்கலாம் என்பதைக் குறிக்கிறது.

V4-Flash போன்ற வேகம் சார்ந்த வடிவமைப்புகள் பொதுவாக பெரிய மற்றும் மெதுவான மாடல்கள் அடையும் ஆழமான பிரதிநிதித்துவத்தை (depth of representation) விட்டுக்கொடுக்கின்றன. டோக்கன் உச்சவரம்பு செலவைக் குறைவாக வைத்திருக்கிறது, ஆனால் விஷுவல் விவரங்களைக் கட்டுப்படுத்துகிறது, இது நுணுக்கமான பகுப்பாய்வு தேவைப்படும் பணிகளுக்கு (உதாரணமாக, மிகச்சிறிய எழுத்துக்களைப் படித்தல் அல்லது நுணுக்கமான அமைப்பு வேறுபாடுகளைக் கண்டறிதல்) பாதிப்பை ஏற்படுத்தலாம்.

இறுதியாக, சுற்றுச்சூழல் சார்ந்த பிணைப்பு (ecosystem lock-in) ஒரு கருத்தாகவே உள்ளது. DeepSeek, OpenAI மற்றும் Anthropic API வடிவங்களைப் பிரதிபலித்தாலும், டெவலப்பர்கள் இன்னும் ஒரு தனி வழங்குநரையும், அதன் அங்கீகாரம் (authentication) மற்றும் சாத்தியமான எதிர்கால விலை மாற்றங்களையும் நிர்வகிக்க வேண்டியிருக்கும். ஒரு குறிப்பிட்ட விற்பனையாளரையே அதிகம் சார்ந்துள்ள அணிகள், ஒருங்கிணைப்பு முயற்சிக்கும் எதிர்பார்க்கப்படும் சேமிப்பிற்கும் இடையிலான சமநிலையை ஆராய வேண்டியிருக்கும்.

கவனிக்க வேண்டியவை

  • சுயாதீன மதிப்பீடுகள் – "near-Opus 4.8" என்ற கூற்றின் முதல் உண்மையான சோதனை மூன்றாம் தரப்பு அளவீடுகளாக (third-party benchmarks) இருக்கும். தர்க்கரீதியான சிந்தனை (reasoning) மற்றும் காட்சித் துல்லியம் (visual fidelity) ஆகிய இரண்டையும் வலியுறுத்தும் VQAv2 அல்லது CLEVR போன்ற பொதுத் தரவுத் தொகுப்புகளில் (public datasets) வரும் முடிவுகளைக் கவனியுங்கள்.
  • விலை மாற்றங்கள் – DeepSeek டோக்கன் செயல்திறனை (token efficiency) முன்னிலைப்படுத்துகிறது, ஆனால் 384-டோக்கன் கொண்ட ஒரு படத்திற்கான உண்மையான செலவுதான், இந்த மாடல் உண்மையிலேயே போட்டியாளர்களை விடக் குறைந்த விலையில் கிடைக்குமா என்பதைத் தீர்மானிக்கும்.
  • புதிய அம்சங்களின் அறிமுகம் – எதிர்கால Harness வெளியீடுகள் batch processing, streaming outputs அல்லது பிரபலமான agent orchestration கருவிகளுடன் நெருக்கமான ஒருங்கிணைப்பைச் சேர்க்கலாம், இது மாடலின் பயன்பாட்டை விரிவுபடுத்தும்.
  • சமூகத் தழுவல் – டெவலப்பர்கள் எவ்வளவு வேகத்தில் plugins, wrappers அல்லது case studiesகளை வெளியிடுகிறார்கள் என்பதைப் பொறுத்தே, இந்த மாடலின் API இணக்கத்தன்மை (compatibility) நடைமுறைப் பயன்பாட்டிற்கு வழிவகுக்குமா என்பதை அறிய முடியும்.

சுருக்கம்

DeepSeek-ன் V4-Flash-Vision-Exp, Anthropic-ன் Opus 4.8-க்கு இணையான செயல்திறனைத் தருவதாகக் கூறி, வேகமான மற்றும் குறைந்த டோக்கன்களைப் பயன்படுத்தும் ஒரு multimodal agent-ஐச் சந்தையில் அறிமுகப்படுத்துகிறது. இதன் உள் அளவீடுகள் (internal benchmarks) உறுதியாக இருந்தால், அதிநவீன (frontier-scale) மாடல்களின் அதிகப்படியான விலையைத் தவிர்த்து, பார்வைத் திறன் (vision) தேவைப்படும் டெவலப்பர்களுக்கு இது ஒரு சிறந்த தேர்வாக அமையும்; அதே சமயம் சோதனை முயற்சியாக இருக்கும், வேகத்தை மையமாகக் கொண்ட AI-களில் காணப்படும் வழக்கமான சவால்களையும் (trade-offs) இது கொண்டிருக்கும்.