اوپن سورس AI ایک وسیع تر ایکوسسٹم میں تبدیل ہو چکا ہے جہاں ایک واحد پروڈکٹ درجنوں ریپوزٹریز سے کوڈ حاصل کر سکتا ہے، متعدد ذرائع سے حاصل کردہ ٹریننگ ڈیٹا پر انحصار کر سکتا ہے، اور ایسی مخصوص ہارڈ ویئر کنفیگریشنز پر چل سکتا ہے جن کی مکمل دستاویزات بہت کم ٹیموں کے پاس ہوتی ہیں۔ ان ڈیپینڈنسیز کا حساب رکھنا مشکل ہے۔ اس اسٹیک کے کن حصوں تک انٹرنیٹ کی رسائی ہے، اسے سمجھنا اس سے بھی زیادہ مشکل ہے۔ Current AI کا Open Source AI Gap Map v0.1 کا اجرا اس افراتفری میں کچھ نظم و ضبط لانے کی کوشش ہے، اور سیکیورٹی ٹیموں کو اسے لازمی مطالعہ کے طور پر لینا چاہیے۔

یہ انڈیکس 421 اوپن سورس AI پروڈکٹس کی فہرست فراہم کرتا ہے۔ یہ انہیں چار زمروں میں تقسیم کرتا ہے: AI ماڈلز، ڈیٹا سیٹس، سافٹ ویئر ٹولز، اور ہارڈ ویئر۔ اس کے پیچھے، پورا پروجیکٹ 1,184 YAML فائلز پر چلتا ہے جو 16,000 سے زیادہ GitHub ریپوزٹریز کا سراغ لگاتی ہیں۔ 421 پروڈکٹس اور 16,000 ریپوزٹریز کے درمیان یہ فرق اپنی کہانی خود بیان کرتا ہے۔ زیادہ تر AI ایپلی کیشنز خود مختار مونو لیتھس (monoliths) نہیں ہیں۔ وہ انفرنس انجنز، فائن ٹیوننگ اسکرپٹس، ڈیٹا لوڈرز، ایویلیوایشن بینچ مارکس، اور ڈرائیور لیئرز کا مجموعہ ہیں، جن میں سے ہر ایک اپنی مخصوص ریپوزٹری، اپنے مینٹینرز، اپنی کمٹ ہسٹری، اور اپنے ویلنر ایبلٹی پروفائل کے ساتھ موجود ہے۔

Current AI نے یہ ڈیٹا سیٹ MIT لائسنس کے تحت شائع کیا ہے اور اسے مکمل طور پر عوامی بنا دیا ہے۔ یہی کھلی شفافیت اس کا مقصد ہے۔ کوئی بھی اسے ڈاؤن لوڈ کر سکتا ہے، YAML کو پارس کر سکتا ہے، اور اس پر ٹولنگ بنا سکتا ہے۔ دفاع کرنے والوں کے لیے، یہ رسائی ایک موقع ہے۔ حملہ آوروں کے لیے، یہ اتنی ہی آسان ہے۔

یہ نقشہ اصل میں کیا ٹریک کرتا ہے

AI استعمال کرنے والی زیادہ تر تنظیموں کے پاس اس بات کا واضح انوینٹری ریکارڈ نہیں ہوتا کہ انہوں نے کیا تعینات کیا ہے۔ ایک ٹیم کسی مقبول ہب سے لینگویج ماڈل ڈاؤن لوڈ کر سکتی ہے، اسے چلانے کے لیے چند Python پیکیجز انسٹال کر سکتی ہے، اور کام مکمل سمجھ سکتی ہے۔ لیکن اس سادہ ورک فلو کے نیچے ڈیپینڈنسیز کا ایک پیچیدہ مجموعہ موجود ہوتا ہے۔ ماڈل ویٹس (weights) ایک ریپوزٹری سے آتے ہیں۔ ٹوکنائزر کنفیگریشن کسی دوسری سے آتی ہے۔ انفرنس فریم ورک کسی تیسرے پروجیکٹ کا فورک (fork) ہو سکتا ہے۔ CUDA ڈرائیورز اور کنٹینر امیجز مزید ذرائع سے حاصل کی جاتی ہیں۔

Gap Map اسے 421 الگ AI پروڈکٹس کے گرد اپنی 1,184 YAML فائلز کو منظم کر کے کیپچر کرتا ہے۔ یہاں نقشہ بند کی گئی 16,000 سے زیادہ GitHub ریپوزٹریز ان اصل کوڈز، کنفیگریشنز، اور آرٹیکٹ (artifacts) کی نمائندگی کرتی ہیں جو ان پروڈکٹس کو کام کرنے کے قابل بناتی ہیں۔ انٹریز کو ماڈلز، ڈیٹا سیٹس، سافٹ ویئر ٹولز، اور ہارڈ ویئر میں تقسیم کر کے، یہ انڈیکس ایک بنیادی سوال کھڑا کرتا ہے: کیا آپ جانتے ہیں کہ ان چار تہوں میں سے آپ کے سسٹم اصل میں کن سے جڑے ہوئے ہیں؟

اگر آپ پروڈکشن میں کوئی اوپن سورس لارج لینگویج ماڈل چلا رہے ہیں، تو غالباً آپ ان چاروں کا استعمال کر رہے ہیں۔ آپ ماڈل ویٹس اور آرکیٹیکچر پر انحصار کرتے ہیں۔ آپ ان ڈیٹا سیٹس پر انحصار کرتے ہیں جو پری ٹریننگ یا فائن ٹیوننگ کے لیے استعمال کیے گئے تھے، چاہے آپ نے انہیں براہ راست کبھی ڈاؤن لوڈ نہ کیا ہو۔ آپ ماڈل کو تبدیل کرنے، کوانٹائز (quantize) کرنے، یا سروس فراہم کرنے کے لیے سافٹ ویئر ٹولز پر انحصار کرتے ہیں۔ اور اگر آپ GPUs یا مخصوص ایکسلیریٹر پر چلا رہے ہیں، تو آپ فرم ویئر اور ڈرائیور اسٹیکس پر انحصار کرتے ہیں جو ہارڈ ویئر کے زمرے میں آتے ہیں۔

سیکیورٹی کا دو دھاری تلوار

یہ ڈیٹا سیٹ دو آقاؤں کی خدمت کرتا ہے، اور سیکیورٹی لیڈرز کو دونوں پہلوؤں کو سمجھنے کی ضرورت ہے۔

دفاعی پہلو پر، Gap Map آپ کی AI سپلائی چین کے لیے ایک فون بک کی طرح کام کرتا ہے۔ آپ اپنی تنظیم کے انحصار رکھنے والی ریپوزٹریز اور ٹولز کا اس انڈیکس کے ساتھ موازنہ کر سکتے ہیں اور اپنی ویزیبلٹی (visibility) میں موجود خلاؤں کا پتہ لگا سکتے ہیں۔ اگر کوئی اہم ریپوزٹری نقشے میں نظر آتی ہے لیکن آپ کے سافٹ ویئر بل آف میٹریلز (SBOM) میں نہیں ہے، تو غالباً آپ کو 'شیڈو AI انفراسٹرکچر' مل گیا ہے۔ یہ اس سے پہلے جان لینا بہتر ہے کہ کوئی دشمن اسے آپ کے لیے تلاش کر لے۔

جارحانہ پہلو پر، یہ ڈیٹا سیٹ جاسوسی (reconnaissance) کے لیے سونے کے برابر ہے۔ حملہ آور مسلسل کھلے ہوئے AI انفراسٹرکچر، ماڈل سرونگ اینڈ پوائنٹس، اور مقبول ML پائپ لائنز میں کمزور ڈیپینڈنسیز کی تلاش میں رہتے ہیں۔ Gap Map انہیں اہداف کی ایک ایسی مشین ریڈ ایبل اور منظم فہرست فراہم کرتا ہے جو بالکل انہی زمروں میں تقسیم ہوتی ہے جن میں انہیں دلچسپی ہوتی ہے۔ ایک واحد YAML پارسر ہزاروں ریپوزٹری URLs نکال سکتا ہے، اور وہاں سے ایک حملہ آور معلوم ویلنر ایبلٹیز (vulnerabilities) کا حوالہ دے سکتا ہے، غلط کنفیگر شدہ عوامی انسٹنس تلاش کر سکتا ہے، یا ڈیپینڈنسی کنفیوژن اٹیکس کے لیے اعلیٰ قدر کے اہداف کی نشاندہی کر سکتا ہے۔

چونکہ ڈیٹا MIT لائسنس یافتہ اور عوامی ہے، اس لیے اس تک رسائی میں کوئی رکاوٹ نہیں ہے۔ کوئی سبسکرپشن نہیں، کوئی منظوری کا عمل نہیں۔ یہ ڈیزائن کا انتخاب محققین اور دفاع کرنے والوں کے لیے افادیت کو زیادہ کرتا ہے، لیکن یہ خطرے کے عناصر (threat actors) کے لیے بھی افادیت کو بڑھا دیتا ہے۔ وہی فائل جو آپ کو اپنے اسٹیک کو مضبوط بنانے میں مدد دیتی ہے، وہی کسی دوسرے کو ٹارگٹ لسٹ بنانے میں مدد دیتی ہے۔

اس معلومات کے ساتھ کیا کیا جائے

اس ڈیٹا سیٹ کے ساتھ بالکل ویسا ہی سلوک کریں جیسا کہ آپ ایک تھریٹ انٹیلی جنس فیڈ کے ساتھ کرتے ہیں۔ اسے صرف بک مارک کر کے نہ بھول جائیں۔ اپنے ماحول کے خلاف ایک فعال چیک (active check) چلائیں۔

Start by pulling a list of every open-source AI component your teams currently use. Look beyond the obvious. Ask which repositories supply your tokenizers, your evaluation scripts, your quantization libraries, and your container base images. Then check those repositories against the 16,000 tracked in the Gap Map. If you find matches, you have confirmed that your dependencies live in one of the most prominently indexed corners of the open-source AI world. That prominence cuts both ways. It usually means active maintenance and community scrutiny, but it also means attackers know these repositories exist.

Next, look at the YAML structure itself. Each of the 1,184 files connects products to their underlying repositories in a standardized format. You can write a simple script to compare your dependency manifests, package lists, or SBOM exports against these mappings. If you discover that your production stack relies on repositories you had never heard of, dig deeper. Unknown dependencies are where supply chain attacks hide.

Pay special attention to the hardware layer. Security teams often focus on software and models while treating drivers and firmware as background noise. The Gap Map explicitly indexes hardware-related repositories, which should remind you that GPU driver stacks, compiler toolchains, and accelerator firmware are code too. They have bugs. They get updated. And when they are out of date, they can be the softest target in your pipeline.

Finally, use the