العنوان: الخطأ كان في محور واحد

ثغرة برمجية خفية في تنفيذ chunked-scan في PyTorch تسمح لبعض النماذج الهجينة (hybrid models) بالاطلاع على الرموز (tokens) المستقبلية في حال غياب النوى المدمجة السريعة (fast fused kernels)، مما يضر بنقاط التفتيش (checkpoints) مثل Zamba2-1.2B و Nemotron-H-8B. ينبع الخلل من عملية اختزال (reduction) واحدة أُجريت على المحور الخطأ، ويظهر في مسار التنفيذ الذي تعتمد عليه معظم خطوط أنابيب التكامل المستمر (CI pipelines) وعمليات التشغيل على المعالج المركزي (CPU).

لماذا يمثل هذا الخطأ أهمية؟

لم تعد النماذج الهجينة ونماذج فضاء الحالة (state-space models) تعتمد فقط على آلية الانتباه (attention)؛ بل تستخدم أيضًا التكرارات الخطية (linear recurrences)، وعمليات المسح (scans)، والالتفافات (convolutions). إن عملية القناع (masking operation) التي تحجب الرموز المستقبلية في مصفوفة الانتباه لا تضمن تلقائيًا السببية (causality) لتلك العمليات الإضافية. عندما تغيب النوى المدمجة السريعة التي تعالج عملية المسح بشكل صحيح عادةً، يعود PyTorch إلى مسار chunked-scan المعتمد على لغة Python فقط. يحتوي هذا المسار البديل على خلط في المحاور (axis-mixup)، مما يسمح للمعلومات من المواقع اللاحقة بالتدفق إلى الخلف أثناء عملية الاستدلال (inference).

هذا التسريب صامت؛ فهو لا يتسبب في تعطل النموذج أو إظهار خطأ واضح. بدلاً من ذلك، يجعل قيم الخسارة (loss) والحيرة (perplexity) تبدو منخفضة بشكل مصطنع لأن النموذج "يغش" فعليًا عبر رؤية الرموز التي يُفترض به التنبؤ بها. وبالتالي، فإن أي تقييم لاحق يعتمد على هذه المقاييس يُبنى على أساس هش.

كيف تم اكتشاف المشكلة

قارن الباحثون بين عمليتي تمرير أمامي (forward passes) عبر نفس النموذج:

  1. تسلسل رموز عشوائي.
  2. نفس التسلسل مع تغيير رمز واحد فقط.

قاموا بقياس الفرق في الحالات المخفية (hidden states) طبقة تلو الأخرى. لم تظهر عملية فحص القناع (mask inspection) أي شيء، ولكن التدقيق لكل طبقة الذي تضمن حقن أخطاء (injected faults) اكتشف 192 من أصل 192 خطأ محقون، مما أكد وجود التسريب.

كشف مسح سريع لمكتبة transformers عما يلي:

  • نموذج Zamba2-1.2B يسرب المعلومات عندما يتم ضبط حجم الجزء (chunk size) على 256.
  • نموذج Nemotron-H-8B يسرب المعلومات عند حجم جزء 128.
  • لم تظهر معظم نقاط التفتيش الأخرى أي تسريب تحت نفس الظروف.

يكمن العيب في مسار كود chunked-scan الذي يعمل كلما غابت النوى المدمجة الاختيارية. ويشمل ذلك:

  • جميع عمليات التنفيذ على المعالج المركزي (CPU).
  • بيئات وحدة معالجة الرسومات (GPU) التي تفتقر إلى حزم النوى المدمجة المحددة.
  • تثبيتات PyTorch القياسية التي تفتقر إلى التبعيات الإضافية.

ولأن الخطأ لا يظهر إلا عند غياب تلك النوى، فقد يظهر في بيئات التكامل المستمر (CI) وعلى المعالجات المركزية (CPUs).

من هم المعرضون للخطر وما هي التكلفة؟

أي فريق يقوم بتدريب النماذج الهجينة أو ضبطها بدقة (fine-tuning) أو تقييمها دون استخدام النوى المدمجة معرض لخطر نشر أرقام أداء مبالغ فيها. التحسن الظاهري في الخسارة أو الحيرة هو مجرد وهم؛ فالنموذج قد "نظر مسبقًا" فعليًا. بالنسبة للمجموعات البحثية، قد يؤدي هذا إلى ادعاءات مضللة حول نتائج رائدة (state-of-the-art). أما بالنسبة للنشر التجاري، فقد يتسبب في أخطاء لاحقة في مهام التوليد (generation tasks) التي لم يتم تعلمها حقًا.

الحجة المضادة

يجادل بعض المطورين بأن تطبيق قناع سببي (causal mask) بشكل صحيح كافٍ لمنع أي تسريب للرموز المستقبلية. إلا أن هذا الخطأ يدحض هذا المفهوم: إذ يمكن لعمليات المسح والالتفافات وبعض طبقات التسوية (normalization layers) تجاوز القناع تمامًا. يوضح الخلط في المحاور في chunked scan أن السببية يجب فرضها في كل مكان تتدفق فيه البيانات، وليس فقط في مصفوفة الانتباه.

ما يجب مراقبته لاحقًا

  • نظافة التبعيات (Dependency hygiene): قم بتثبيت حزم النوى المدمجة السريعة على جميع عقد التدريب والاستدلال، خاصة في خطوط أنابيب التكامل المستمر (CI pipelines).
  • سكربتات التدقيق (Audit scripts): اتبع عملية التدقيق المكونة من خطوتين والتي أوصى بها المكتشفون:
    • حقن خطأ معروف في نقطة التفتيش التي تختبرها كعنصر تحكم إيجابي (positive control).
    • تشغيل تسلسلات أطول من حجم الجزء (chunk) أو حجم النافذة (window size) الخاص بالنموذج؛ فالتسلسلات القصيرة لن تكشف التسريب أبدًا.

إن إجراء التدقيق على أي نقطة تفتيش هجينة أو لنماذج فضاء الحالة بطول تسلسل يتجاوز حجم الجزء سيكشف ما إذا كان النموذج لا يزال عرضة للخطر.

الخلاصة: حتى النموذج الذي يجتاز كل الاختبارات القياسية يمكنه الغش بصمت عندما يعود مسار التنفيذ إلى تنفيذ معيب. أصبح التحقق من وجود النوى المدمجة السريعة — والاختبار الصريح للتسريب خارج أقنعة الانتباه — خطوات أساسية الآن قبل الوثوق بمقاييس أي نموذج هجين.