كشف تدقيق حديث لـ 2,465 "مهارة" لوكلاء الذكاء الاصطناعي (AI-agent skills) مدرجة علنًا أن أكثر من النصف تخالف المواصفات المنشورة، وأن 7.8% لا يمكن حتى اختيارها بواسطة الوكيل بسبب افتقارها إلى البيانات الوصفية (metadata) المطلوبة. تهدد هذه العيوب موثوقية أي نظام يقوم باكتشاف هذه المهارات وتحميلها تلقائيًا.

لماذا يكتسب هذا التدقيق أهمية

تتيح سجلات مهارات الوكلاء (Agent-skill registries) للمطورين نشر قدرات قابلة لإعادة الاستخدام — وهي حزم برمجية يمكن للوكيل المستقل استدعاؤها عند الطلب. يقوم الوكيل بمسح السجل، وقراءة YAML frontmatter الخاص بكل مهارة (كتلة صغيرة من النص المهيكل التي يجب أن تحتوي على الأقل على اسم ووصف)، ويقرر ما إذا كانت المهارة تتوافق مع أهدافه. إذا كان الـ frontmatter مفقودًا أو مشوهًا، تختفي المهارة من قائمة الوكيل. في عالم يقوم فيه الوكلاء المستقلون بجدولة الاجتماعات، واستكشاف أخطاء الخوادم وإصلاحها، وغير ذلك الكثير، فإن المهارة المعطلة تؤدي إلى تعطل سير العمل.

ما تكشفه الأرقام

  • 57.8% من المهارات لديها انتهاك واحد على الأقل للمواصفات.
  • 29.2% تدرج اسمًا لا يتطابق مع الـ registry slug (معرف URL).
  • 18.1% تحتوي على مسارات حزم معطلة أو روابط تالفة.
  • 7.8% (192 مهارة) تفتقر تمامًا إلى YAML frontmatter، مما يجعلها بلا اسم أو وصف.
  • 3.8% تتضمن مسارات ملفات مطلقة (absolute file paths) لا توجد إلا على جهاز المؤلف.
  • 2.4% تسيء استخدام حقل allowed-tools مما يجعله غير قابل للقراءة من قبل الوكلاء.
  • 2.1% تكشف عن مفاتيح API عبر متغيرات البيئة (environment variables)، وهو ما يعد علامة خطر أمنية.
  • 1.3% تستدعي أدوات سطر أوامر خارجية دون التصريح عنها، مما ينتهك قاعدة قابلية النقل (portability).

تظهر مشكلة قابلية النقل (Portability) بشكل متكرر. فالمسار المطلق مثل /home/USER/.local/bin/tool يعمل للمطور الذي كتب المهارة ولكنه يفشل لكل مستخدم آخر، مما يتسبب في أخطاء وقت التشغيل (runtime errors) التي لا تكتشفها عمليات الفحص الساكن (static checks) أبدًا.

غوص أعمق: حالة openclaw

فحص التدقيق أيضًا 46 مهارة مجمعة في مستودع openclaw. بعد تحسين نص الاختبار (testing script) لتقليل الإنذارات الكاذبة، كشف المراجع عن 59 عيبًا حقيقيًا — وهو تذكير بأن أدوات التدقيق (linters) المفرطة في العدوانية قد تأتي بنتائج عكسية. فعندما تضع الأداة علامات على الكثير من المشكلات غير الضارة، يتوقف المطورون عن استخدامها، وتتسرب المشكلات الحقيقية.

أشار اثنان من عيوب openclaw إلى ملفات لم تعد موجودة في المستودع. قام المسؤول (maintainer) بدمج إصلاح يعيد المراجع المفقودة، مما يوضح كيف يمكن لطلب سحب (pull request) واحد أن ينظف سلسلة تبعيات معطلة.

ردود فعل المطورين

فتح المدقق مشكلات (issues) في مستودعات المهارات الأصلية. تم رفض أحد التقارير؛ حيث جادل المسؤول بأن وصف الشيء بأنه "معطل" يجب أن يُحكم عليه من خلال سلوك وقت التشغيل الفعلي، وليس من خلال الفحص الساكن للملفات. وافق المدقق على أن التعريف الصارم لـ "التعطل" يجب أن يتماشى مع كيفية تنفيذ المهارة في الممارسة العملية. تم قبول مشكلة أخرى، والإصلاح المقابل متاح الآن.

من المستفيد — أو المتضرر

  • الوكلاء والمستخدمون النهائيون يتمتعون بسلوك أكثر سلاسة وقابلية للتنبؤ عندما يحتوي السجل فقط على مهارات متوافقة وقابلة للنقل.
  • مؤلفو المهارات يحصلون على قواعد تحقق أوضح تلتقط الأخطاء قبل النشر، مما يقلل من عمليات فرز المشكلات (issue triage) المتبادلة.
  • مشغلو السجلات يجب عليهم بناء أو دمج أنابيب تحقق (validation pipelines) أكثر صرامة؛ فبدونها، يواجه النظام البيئي خطر تآكل الثقة.

يشجع التحقق الضعيف على تقديم طلبات "سريعة وغير دقيقة" قد تؤدي إلى تعطل الوكلاء في بيئة الإنتاج، مما قد يتسبب في توقف مكلف عن العمل أو ثغرات أمنية.

وجهة نظر معارضة: هل كل الانتهاكات قاتلة؟

يجادل البعض بأن بعض "الأخطاء" غير ضارة. فقد لا يؤثر الاسم غير المتطابق على الوكيل الذي يختار المهارات عبر الـ slug بدلاً من الاسم المعروض. كما يمكن أن تكون قراءة مفاتيح API من البيئة خيار تصميم متعمد للتطوير المحلي. ومع ذلك، فإن نسب التدقيق تعامل أي انحراف عن المواصفات على أنه انتهاك، مما قد يبالغ في التأثير العملي لبعض المشكلات.

ما يجب مراقبته لاحقًا

  • أدوات تدقيق (linters) محسنة تفصل بين أخطاء قابلية النقل الحقيقية والخصائص غير الضارة.
  • خطافات تحقق (validation hooks) من جانب السجل ترفض الطلبات التي تفتقر إلى الـ frontmatter المطلوب أو التي تحتوي على مسارات مطلقة.
  • عمليات تدقيق مدفوعة من المجتمع تظهر العيوب المخفية قبل وصولها إلى وكلاء الإنتاج.
  • مراجعات محتملة للمواصفات توضح الحقول الغامضة مثل allowed-tools وتحدد الاستخدام المقبول لمتغيرات البيئة.

من المرجح أن تدمج الموجة القادمة من الأدوات هذه الفحوصات في أنابيب التكامل المستمر (continuous-integration pipelines)، مما يحول الامتثال من مجرد فكرة لاحقة يدوية إلى بوابة تلقائية.

الخلاصة

تفشل غالبية مهارات وكلاء الذكاء الاصطناعي المدرجة علنًا في فحوصات الامتثال الأساسية، ولا يمكن اختيار جزء لا يستهان به منها على الإطلاق. وتؤكد هذه النتائج على الحاجة الواضحة إلى عمليات تحقق أكثر صرامة، وأدوات فحص (linting) أفضل، وثقافة مجتمعية تتعامل مع الالتزام بالمواصفات كشرط مسبق للنشر. وإلى أن يتم وضع هذه الضمانات، ستستمر الوكلاء في التعثر بسبب المهارات الهشة وغير القابلة للنقل.

المصدر: https://dev.to/hyuga611/i-audited-2465-published-agent-skills-192-of-them-cannot-be-selected-the-way-the-spec-says-4k70