AI sumber terbuka telah berkembang menjadi ekosistem yang luas di mana satu produk mungkin menarik kod daripada berpuluh-puluh repositori, bergantung pada data latihan daripada pelbagai sumber, dan berjalan pada konfigurasi perkakasan khusus yang hanya didokumentasikan sepenuhnya oleh segelintir pasukan. Menjejaki kebergantungan ini adalah sukar. Memahami bahagian mana dalam timbunan (stack) tersebut yang terdedah kepada internet adalah lebih sukar. Pelancaran Open Source AI Gap Map v0.1 oleh Current AI cuba membawa sedikit keteraturan kepada kekacauan tersebut, dan pasukan keselamatan harus menganggapnya sebagai bacaan wajib.
Indeks ini menyenaraikan 421 produk AI sumber terbuka. Ia membahagikannya kepada empat kategori: model AI, set data, alatan perisian, dan perkakasan. Di sebalik tabir, keseluruhan projek ini berjalan menggunakan 1,184 fail YAML yang menjejaki lebih daripada 16,000 repositori GitHub. Jurang antara 421 produk dan 16,000 repositori itu menceritakan kisahnya yang tersendiri. Kebanyakan aplikasi AI bukanlah monolit yang berdiri sendiri. Ia adalah gabungan enjin inferens, skrip penalaan halus (fine-tuning), pemuat data, penanda aras penilaian, dan lapisan pemacu, yang masing-masing berada dalam repositori sendiri dengan penyenggara, sejarah komit, dan profil kerentanan tersendiri.
Current AI menerbitkan set data tersebut di bawah lesen MIT dan menjadikannya awam sepenuhnya. Keterbukaan itulah tujuannya. Sesiapa sahaja boleh memuat turunnya, mencerakin (parse) YAML tersebut, dan membina alatan di atasnya. Bagi pihak pertahanan, kebolehcapaian itu adalah satu peluang. Bagi penyerang, ia adalah sama mudahnya.
Apa yang Sebenarnya Dijejaki oleh Peta Tersebut
Kebanyakan organisasi yang menggunakan AI tidak mempunyai inventori yang jelas tentang apa yang telah mereka pasang (deploy). Sesebuah pasukan mungkin memuat turun model bahasa daripada hab popular, memasang beberapa pakej Python untuk menjalankannya, dan menganggap tugas itu selesai. Namun, di sebalik aliran kerja ringkas itu terdapat set kebergantungan yang bersarang (nested). Pemberat (weights) model datang daripada satu repositori. Konfigurasi tokenizer datang daripada repositori lain. Rangka kerja inferens mungkin merupakan cabang (fork) daripada projek ketiga. Pemacu CUDA dan imej kontena pula ditarik daripada lebih banyak sumber lagi.
Gap Map merakam perkara ini dengan menyusun 1,184 fail YAML miliknya di sekitar 421 produk AI yang berbeza. Lebih 16,000 repositori GitHub yang dipetakan di sini mewakili kod, konfigurasi, dan artifak sebenar yang membolehkan produk tersebut berfungsi. Dengan mengasingkan entri kepada model, set data, alatan perisian, dan perkakasan, indeks ini memaksa satu soalan asas: adakah anda tahu lapisan mana daripada empat lapisan ini yang sebenarnya disentuh oleh sistem anda?
Jika anda menjalankan model bahasa besar (LLM) sumber terbuka dalam pengeluaran (production), anda berkemungkinan besar menyentuh keempat-empat lapisan tersebut. Anda bergantung pada pemberat dan seni bina model. Anda bergantung pada set data yang digunakan untuk pra-latihan atau penalaan halus, walaupun anda tidak pernah memuat turunnya secara langsung. Anda bergantung pada alatan perisian untuk menukar, menguantisasi (quantize), atau melayani (serve) model tersebut. Dan jika anda berjalan pada GPU atau pemecut (accelerator) khusus, anda bergantung pada timbunan (stack) perisian tegar (firmware) dan pemacu yang jatuh di bawah kategori perkakasan.
Pedang Bermata Dua Keselamatan
Set data ini berkhidmat kepada dua pihak, dan pemimpin keselamatan perlu memahami kedua-dua belah pihak.
Dari sudut pertahanan, Gap Map berfungsi seperti buku telefon untuk rantaian bekalan AI anda. Anda boleh membandingkan repositori dan alatan yang organisasi anda harapkan dengan indeks ini dan mengesan jurang dalam keterlihatan anda. Jika repositori kritikal muncul dalam peta tetapi tidak dalam senarai bahan perisian (software bill of materials) anda, anda berkemungkinan telah menemui infrastruktur AI bayangan (shadow AI). Perkara itu berbaloi untuk diketahui sebelum pihak lawan menemuinya untuk anda.
Dari sudut serangan, set data ini adalah emas pengintipan (reconnaissance). Penyerang sentiasa mengimbas infrastruktur AI yang terdedah, titik akhir (endpoint) penyajian model, dan kebergantungan yang rentan dalam saluran paip (pipeline) ML yang popular. Gap Map memberikan mereka senarai sasaran berstruktur yang boleh dibaca oleh mesin, yang disusun mengikut kategori yang tepat mereka minati. Satu pencerakin (parser) YAML sahaja boleh mengekstrak beribu-ribu URL repositori, dan dari situ penyerang boleh membuat rujukan silang terhadap kerentanan yang diketahui, mencari instans awam yang salah konfigurasi, atau mengenal pasti sasaran bernilai tinggi untuk serangan kekeliruan kebergantungan (dependency confusion attacks).
Oleh kerana data tersebut dilesenkan di bawah MIT dan bersifat awam, tiada halangan untuk masuk. Tiada langganan, tiada proses kelulusan. Pilihan reka bentuk itu memaksimumkan kegunaan untuk penyelidik dan pihak pertahanan, tetapi ia juga memaksimumkan kegunaan untuk pelaku ancaman. Fail yang sama yang membantu anda memperkukuh (harden) timbunan anda turut membantu orang lain membina senarai sasaran.
Apa yang Perlu Dilakukan dengan Maklumat Ini
Layan set data ini sama seperti anda melayan suapan perisikan ancaman (threat intelligence feed). Jangan sekadar menandakan (bookmark) dan melupakannya. Jalankan semakan aktif terhadap persekitaran anda.
Mulakan dengan mendapatkan senarai setiap komponen AI sumber terbuka yang digunakan oleh pasukan anda sekarang. Lihat melampaui perkara yang jelas. Tanya repositori mana yang membekalkan tokenizer, skrip penilaian, perpustakaan kuantisasi, dan imej asas kontena anda. Kemudian, semak repositori tersebut berbanding 16,000 yang dijejak dalam Gap Map. Jika anda menemui padanan, anda telah mengesahkan bahawa kebergantungan anda berada di salah satu sudut yang paling menonjol dalam dunia AI sumber terbuka. Keunggulan tersebut mempunyai dua sisi. Ia biasanya bermaksud penyelenggaraan aktif dan penelitian komuniti, tetapi ia juga bermaksud penyerang tahu repositori ini wujud.
Seterusnya, lihat struktur YAML itu sendiri. Setiap satu daripada 1,184 fail tersebut menghubungkan produk kepada repositori asasnya dalam format piawai. Anda boleh menulis skrip ringkas untuk membandingkan manifes kebergantungan, senarai pakej, atau eksport SBOM anda dengan pemetaan ini. Jika anda mendapati bahawa timbunan pengeluaran anda bergantung pada repositori yang tidak pernah anda dengar, selidiki dengan lebih mendalam. Kebergantungan yang tidak diketahui adalah tempat serangan rantaian bekalan bersembunyi.
Berikan perhatian khusus kepada lapisan perkakasan. Pasukan keselamatan sering memberi tumpuan kepada perisian dan model sambil menganggap pemacu dan perisian tegar sebagai gangguan latar belakang. Gap Map mengindeks repositori berkaitan perkakasan secara eksplisit, yang sepatutnya mengingatkan anda bahawa timbunan pemacu GPU, rangkaian alatan pengkompil, dan perisian tegar pemecut juga merupakan kod. Ia mempunyai pepijat. Ia dikemas kini. Dan apabila ia sudah lapuk, ia boleh menjadi sasaran paling mudah dalam saluran paip anda.
Akhir sekali, gunakan
