أطلقت DeepSeek نموذج V4-Flash-Vision-Exp، وهو نموذج تجريبي متعدد الوسائط تقول إنه يؤدي في اختبارات أداء الوكلاء (agent benchmarks) الداخلية بمستوى يضاهي تقريبًا نموذج Opus 4.8 من Anthropic، مع إبقاء تكلفة الرموز (tokens) لكل صورة محدودة عند 384 رمزًا. يمنح هذا الإطلاق المطورين بديلًا سريعًا وخفيفًا لمهام الذكاء الاصطناعي البصري، يَعِدُ بسرعة خط V4-Flash من DeepSeek مع القدرة على الاستنتاج بناءً على الصور.

لماذا يعد هذا الإعلان مهماً

أصبح الوكلاء متعددو الوسائط — وهي الأنظمة التي يمكنها الرؤية والقراءة والتفاعل — في قلب تطوير الأدوات ذاتية التشغيل. تستخدمها الفرق في بناء روبوتات دعم العملاء التي تقرأ لقطات الشاشة، ومساعدي الأبحاث الذين يحللون المخططات. لقد وضع نموذج Opus 4.8 من Anthropic معيارًا عاليًا، لكن تسعيره وزمن الاستجابة (latency) أبقيا الكثيرين على الهامش. إن ادعاء DeepSeek بتحقيق أداء متساوٍ تقريبًا بكسر بسيط من تكلفة الرموز قد يغير موازين حساب التكلفة مقابل الفائدة لأي شخص يدرس دمج الرؤية البصرية في سير عمله.

كيف قامت DeepSeek ببناء النموذج

يوسع النموذج الجديد بنية V4-Flash الحالية لشركة DeepSeek، والمُحسّنة بالفعل للاستنتاج النصي السريع واستهلاك منخفض للرموز (tokens). ومن خلال دمج واجهة أمامية لمعالجة الصور في تلك البنية الأساسية، حافظت DeepSeek على المعرفة العالمية وقدرات الاستنتاج التي يتمتع بها النموذج الأساسي مع إضافة الفهم البصري.

تشمل الخيارات التقنية الرئيسية ما يلي:

  • الكشف التلقائي عن التنسيق – يقرأ النموذج المحتوى الثنائي (binary) للصورة لتحديد ما إذا كانت JPEG أو PNG أو GIF أو WebP، مما يتجنب الأخطاء الناتجة عن تسمية الملفات بشكل خاطئ.
  • تغيير الحجم التكيفي – يتم توحيد الصور الواردة لتصبح حوالي 800 × 800 بكسل. ويمكن للمطورين طلب وضع تفاصيل أقل يفرض حجم 512 × 512 بكسل، مما يقلل من استخدام الرموز بشكل أكبر.
  • سقف الرموز (Token ceiling) – بغض النظر عن الدقة الأصلية، لا يفرض النموذج أبدًا أكثر من 384 رمزًا لكل صورة، مما يجعل وضع الميزانية أمرًا يمكن التنبؤ به.

أطلقت DeepSeek أيضًا الإصدار 0.1.1 من إطار عمل Harness الخاص بها، والذي يجمع النموذج الجديد ويوفر محولات (adapters) جاهزة لواجهات برمجة التطبيقات OpenAI Chat Completions و Responses، بالإضافة إلى Anthropic’s Messages endpoint. يمكن للفرق دمج النموذج في قواعد الأكواد الحالية مع تغييرات بسيطة في الإعدادات فقط.

ما سيحصل عليه المطورون

  • دعم واسع للصور – يتم قبول تنسيقات JPEG و PNG و GIF و WebP، ويمكن للنموذج استيعاب البيانات عبر سلاسل Base64، أو روابط URL عامة (حتى 32 MiB)، أو Files API المجاني من DeepSeek. تقوم Files API بتخزين عملية رفع واحدة تصل إلى 64 MiB وتسمح لك بالإشارة إليها عبر المعرف (ID) خلال جولات متعددة، مما يقلل من عمليات الرفع المتكررة في المحادثات الطويلة.
  • سياق عالي الحجم – قد يحمل الطلب الواحد ما يصل إلى 600 صورة. الحد الأقصى لطول الضلع لكل صورة هو 8,192 بكسل، وينخفض إلى 4,096 بكسل عندما يحتوي الطلب على 15 صورة أو أكثر، مما يساعد في الحفاظ على وقت المعالجة تحت السيطرة.
  • مهام جاهزة للوكلاء (Agent-ready) – تم ضبط النموذج لأعباء العمل "الوكيلية" (agentic): مثل وصف المشاهد المعقدة، واستخراج النصوص من لقطات الشاشة، وتحليل المخططات المعقدة. ولأنه يحتفظ بسرعة استنتاج V4-Flash، يمكنه دمج القرائن البصرية في سلاسل تفكير أوسع دون أن يصبح عنق زجاجة.

تعالج هذه الميزات نقاط الألم الشائعة لدى المطورين: التعامل مع العديد من الصور في جلسة واحدة، وتجنب تضخم استهلاك الرموز، ودمج الرؤية البصرية دون الحاجة لإعادة كتابة استدعاءات واجهة برمجة التطبيقات (API).

الحدود المحتملة

يعتمد ادعاء DeepSeek بشأن الأداء على اختبارات أداء الوكلاء متعددة الوسائط الداخلية. قد تغفل تلك الاختبارات التباين في العالم الحقيقي — مثل الصور المشوشة، أو ظروف الإضاءة المنخفضة، أو تنسيقات الملفات الغريبة. كما يشير وصف "تجريبي" إلى أن النموذج قد لا يزال يعمل على معالجة مشكلات الاستقرار والتوسع.

عادةً ما تضحي التصميمات التي تعطي الأولوية للسرعة، مثل V4-Flash، بعمق التمثيل الذي تحققه النماذج الأكبر والأبطأ. كما أن سقف الرموز يحافظ على انخفاض التكاليف ولكنه يحد من التفاصيل البصرية، مما قد يضر بالمهام التي تتطلب تحليلاً دقيقًا (مثل قراءة الخطوط الصغيرة جدًا أو رصد الاختلافات الدقيقة في الملمس).

أخيرًا، يظل الارتباط بالنظام البيئي (ecosystem lock-in) اعتبارًا قائمًا. على الرغم من أن DeepSeek تحاكي هياكل واجهات برمجة التطبيقات لـ OpenAI و Anthropic، إلا أنه لا يزال يتعين على المطورين إدارة مزود منفصل، وعمليات المصادقة الخاصة به، وتغييرات الأسعار المحتملة في المستقبل. قد توازن الفرق المستثمرة بكثافة في مورد واحد بين جهد التكامل والمدخرات المتوقعة.

ما يجب مراقبته

  • التقييمات المستقلة – ستكون اختبارات الأداء من جهات خارجية هي الاختبار الحقيقي الأول لادعاء "القرب من Opus 4.8". ابحث عن النتائج في مجموعات البيانات العامة مثل VQAv2 أو CLEVR التي تركز على كل من الاستنتاج والدقة البصرية.
  • تحديثات الأسعار – تسلط DeepSeek الضوء على كفاءة الرموز (tokens)، ولكن التكلفة الفعلية لكل صورة مكونة من 384 رمزاً هي التي ستحدد ما إذا كان النموذج سيقلل التكاليف حقاً مقارنة بالمنافسين.
  • إطلاق الميزات – قد تضيف إصدارات Harness المستقبلية معالجة الدفعات (batch processing)، أو المخرجات المتدفقة (streaming outputs)، أو تكاملاً أوثق مع أدوات تنسيق الوكلاء (agent orchestration tools) الشائعة، مما يوسع نطاق فائدة النموذج.
  • تبني المجتمع – ستشير السرعة التي ينشر بها المطورون الإضافات (plugins) أو الأغلفة (wrappers) أو دراسات الحالة إلى ما إذا كانت توافقية واجهة برمجة التطبيقات (API) للنموذج ستترجم إلى استخدام عملي.

الخلاصة

يطرح نموذج V4-Flash-Vision-Exp من DeepSeek في السوق وكيلاً متعدد الوسائط سريعاً وموفراً للرموز (tokens)، ويدعي أداءً قريباً من Opus 4.8 من Anthropic. إذا صمدت اختبارات الأداء الداخلية، فقد يصبح الخيار الأمثل للمطورين الذين يحتاجون إلى قدرات الرؤية دون التكلفة الباهظة للنماذج الرائدة، مع الاستمرار في التعامل مع المقايضات المعتادة للذكاء الاصطناعي التجريبي الذي يركز على السرعة.