GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

جوجل وأنتروبيك يحذران من أن وكلاء ReAct قد يستنزفون ميزانيات الحوسبة السحابية

تتيح حلقة ReAct للنموذج اختيار خطواته الخاصة، ولكن كل دورة (تفكير-إجراء-ملاحظة) تضيف رسوم استدلال إضافية، مما يؤدي إلى تراكم زمن الاستجابة ويزيد من احتمالية أن يتسبب خطأ واحد في القراءة في إفشال المهمة بأكملها.

AI · 3 دقيقة قراءة

جوجل تصنف نمط 'وكلاء السرب' كأقوى تصميم للذكاء الاصطناعي ولكنه الأكثر تكلفة

يستبدل نظام 'السرب' المشرف الوحيد بشبكة مسطحة من الوكلاء الأقران الذين ينقدون بعضهم البعض باستمرار، إلا أن كل عملية تبادل تستدعي استدعاءً منفصلاً للنموذج، مما يؤدي إلى زيادة هائلة في تكاليف الحوسبة وزمن الاستجابة.

AI · 3 دقيقة قراءة

الاسترجاع القائم على الوكلاء يقلل تكاليف الاستعلام بما يصل إلى 82 ضعفاً مقارنة بتقنية RAG التقليدية

يقوم الوكيل بإعادة صياغة الاستعلامات، ويقرر ما إذا كان البحث ضرورياً، ويجزئ الأسئلة المعقدة إلى خطوات فرعية، كما يصحح مساره ذاتياً عند ضعف الأدلة، مما يوفر استشهادات لكل ادعاء ويقلل استهلاك الرموز (tokens) بشكل هائل.

AI · 3 دقيقة قراءة

تيك توك تطلق أداة للكشف عن التزييف العميق بالذكاء الاصطناعي لصناع المحتوى في الولايات المتحدة في مرحلة تجريبية

تمنح هذه الخدمة الاختيارية مجموعة صغيرة من صناع المحتوى في الولايات المتحدة لوحة تحكم تعرض أي فيديو أو صورة يحددها الذكاء الاصطناعي على أنها تطابق ملامح وجههم الموثقة، وذلك بعد اجتيازهم عملية تحقق دقيقة تتطلب صورة سيلفي وهوية عبر Jumio.

AI · 1 دقيقة قراءة

New COS API Lets Browsers Share 33 GB AI Model Across Sites

By replacing URL lookups with content-addressed hashes, the COS API lets any site request a file it already knows the SHA-256 of, letting browsers serve the same 33 GB AI model to multiple origins without re-downloading it.

AI · 2 دقيقة قراءة

يمكن لإطار التقييم الخاص بك تزييف أخطاء النموذج — ثغرتان برمجيتان اختبأتا وراء تسميات «غير صالحة»

إطار التقييم الخاص بك سيخدعك قبل أن يفعل نموذجك ذلك. أشارت لوحة نتائج التقييم الخاصة بك إلى فشل كلا المحركين؛ حيث فشل Llama3.2 في 5 من أصل 6 حالات، وفشل Anthropic Sonnet في 6 من أصل 6 حالات...

AI · 2 دقيقة قراءة

محولات ذات مقياس خطي تقلل من استهلاك ذاكرة نماذج البروتين من تربيعي إلى خطي

تعالج البنية الجديدة سلاسل كاملة مكونة من آلاف الأحماض الأمينية في تمريرة واحدة، مما يحافظ على التفاعلات بعيدة المدى، في حين يصبح التدريب على مجموعات ضخمة من التسلسلات أسرع وأقل تكلفة.

AI · 2 دقيقة قراءة

AWS تطلق 'AgentCore Payments' عبر بروتوكول x402 للفواتير التلقائية لطلبات الذكاء الاصطناعي على Bedrock

يقوم بروتوكول x402 الجديد بتضمين رمز دفع في كل طلب HTTP، مما يتيح لوكلاء الذكاء الاصطناعي خصم الرسوم تلقائياً مقابل البيانات أو الحوسبة أو طلبات واجهة برمجة التطبيقات (API). ويضيف تكامل Bedrock من AWS، المعروف باسم AgentCore Payments، محافظ مدمجة وحدوداً للإنفاق لضمان تجارة سلسة بين الآلات.

AI · 3 دقيقة قراءة

SEED يرفع درجات ALFWorld إلى 91.8 مع تقليل بيانات التدريب بنسبة 40%

يضيف إطار عمل SEED مرحلة مراجعة بعد انتهاء الحلقة، حيث يقرأ الوكيل نص الحوار الخاص به، ويكتب دروساً بلغة طبيعية، ثم يستخلصها في تحديثات للسياسة؛ مما يحول إشارات المكافأة الشحيحة إلى إشارة تدريب غنية وقابلة لإعادة الاستخدام.

AI · 4 دقيقة قراءة

نموذج Google Gemma-4 31B يجتاز اختبار مطابقة الرموز على AWS Inferentia ولكنه ينتج كلاماً غير مفهوم

أعادت وحدة Inferentia2 INF2.24xlarge إنتاج نفس تدفق الرموز الخاص بالمرجع المعتمد على المعالج (CPU)، ولكن كلتا العمليتين استقبلتا أمراً مشوهاً يفتقر إلى قالب الدردشة وعلامات تبادل الأدوار، مما أدخل Gemma-4 في حلقة مفرغة من الهراء. لم تكن الأجهزة سوى صدى لخطأ برمجي في الكود المرجعي.

AI · 3 دقيقة قراءة

Solo Researcher Cuts LLM Agent Bill 31% to $651 by Logging Every Token

By adding a PostgreSQL logging layer that captured model name, token count, task type, and per-call cost, the researcher identified that raw SEC search results were inflating prompts. Summarizing those results and routing simple checks to a cheaper model drove the 31% savings and nudged accuracy up

AI · 3 دقيقة قراءة

Upper90 تضخ 400 مليون دولار في الحوسبة العامة، مراهنةً على رقائق مخصصة للاستدلال فقط

يستخدم القرض رقائق الاستدلال SN50 من SambaNova كضمان، وهي فئة أصول هي الأولى من نوعها تَعِد بمعالجة الرموز (tokens) أسرع بما يصل إلى 16 ضعفاً، واستهلاك أقل للطاقة، وتبريد أبسط مقارنة بمزارع وحدات معالجة الرسومات (GPU) التقليدية.

AI · 3 دقيقة قراءة

لينوس تورفالدز يمنح المنتقدين خياراً واحداً: اشتقاق لينكس أو تبني الذكاء الاصطناعي

أخبر تورفالدز القائمة البريدية أن أي شخص يعارض أدوات الذكاء الاصطناعي، مثل مراجع Sashiko الجديد، يمكنه ببساطة اشتقاق النواة، مما يؤكد وجهة نظره بأن الجدارة التقنية تتفوق على المقاومة الأيديولوجية.

AI · 2 دقيقة قراءة

واجهة سطر الأوامر (CLI) مفتوحة المصدر من Grok Build تتيح لك تبديل النماذج ومراجعة كل أمر Shell

يوفر المستودع الكود المصدري بلغة Rust لواجهة سطر الأوامر (CLI) وواجهة المستخدم الطرفية وبيئة التشغيل، مما يتيح لك فحص كيفية تجميع السياق، وتنسيق الأدوات، وإدارة التعديلات، بل وحتى استبدال النموذج الأساسي دون تعطيل سير العمل.

AI · 4 دقيقة قراءة

Kimi K3 من Moonshot يتفوق على GPT-5.6 في اختبار AA-Briefcase، محققاً 1,527 نقطة مقابل 1,495

تفوق نموذج Kimi K3 من Moonshot AI، وهو نموذج مفتوح الأوزان يضم 2.8 تريليون معلمة، على GPT-5.6 في معيار AA-Briefcase الواقعي، وهو متاح الآن عبر واجهة برمجة التطبيقات (API)، ومن المقرر إصدار أوزانه للجمهور في 27 يوليو.

AI · 2 دقيقة قراءة

ميتا تطلق واجهة برمجة تطبيقات Muse Spark 1.1 بسعر 1.25 دولار / 4.25 دولار لكل مليون توكن

الخدمة، المتاحة فقط للمطورين في الولايات المتحدة، تفرض رسوماً قدرها 1.25 دولار لكل مليون توكن مدخل و4.25 دولار لكل مليون توكن مخرج، مع توفير رصيد بقيمة 20 دولاراً للحسابات الجديدة وقائمة انتظار للمستخدمين الدوليين.

AI · 1 دقيقة قراءة

نموذج GPT-Red من OpenAI يقلل إخفاقات GPT-5.6 بمقدار ستة أضعاف، ولكن لا توجد أداة مجانية للفرق الصغيرة

نجح نموذج GPT-Red الداخلي من OpenAI في تقليل الإخفاقات في سلسلة GPT-5.6 Sol بمقدار ستة أضعاف، إلا أن الورقة البحثية تكتفي بتقديم الجانب النظري دون توفير أداة قابلة للتحميل، مما يضطر الفرق الصغيرة إلى ابتكار اختباراتها الحتمية الخاصة.

AI · 4 دقيقة قراءة