ઓપન-સોર્સ AI એક વિશાળ ઇકોસિસ્ટમમાં વિકસી ગયું છે જ્યાં એક સિંગલ પ્રોડક્ટ ડઝનબંધ રિપોઝીટરીઝમાંથી કોડ ખેંચી શકે છે, અનેક સ્ત્રોતોમાંથી ટ્રેનિંગ ડેટા પર આધાર રાખી શકે છે, અને એવા સ્પેશિયલાઇઝ્ડ હાર્ડવેર કોન્ફિગરેશન્સ પર ચાલી શકે છે જેનું સંપૂર્ણ ડોક્યુમેન્ટેશન બહુ ઓછા ટીમો પાસે હોય છે. આ ડિપેન્ડન્સીઝ પર નજર રાખવી મુશ્કેલ છે. આ સ્ટેકનો કયા ભાગો ઇન્ટરનેટ પર ખુલ્લા છે તે સમજવું તેનાથી પણ વધુ મુશ્કેલ છે. Current AI દ્વારા રિલીઝ કરવામાં આવેલ Open Source AI Gap Map v0.1 આ અરાજકતામાં થોડી વ્યવસ્થા લાવવાનો પ્રયાસ કરે છે, અને સિક્યુરિટી ટીમોએ તેને ફરજિયાત વાંચન તરીકે લેવું જોઈએ.

આ ઇન્ડેક્સ 421 ઓપન-સોર્સ AI પ્રોડક્ટ્સનું વર્ગીકરણ કરે છે. તે તેમને ચાર શ્રેણીઓમાં વહેંચે છે: AI મોડલ્સ, ડેટાસેટ્સ, સોફ્ટવેર ટૂલ્સ અને હાર્ડવેર. તેની પાછળ, આ આખી પ્રોજેક્ટ 1,184 YAML ફાઇલો પર ચાલે છે જે 16,000 થી વધુ GitHub રિપોઝીટરીઝને ટ્રેક કરે છે. 421 પ્રોડક્ટ્સ અને 16,000 રિપોઝીટરીઝ વચ્ચેનો આ તફાવત પોતાની એક અલગ વાર્તા કહે છે. મોટાભાગની AI એપ્લિકેશન્સ સ્વતંત્ર મોનોલિથ્સ નથી. તેઓ ઇન્ફરન્સ એન્જિન, fine-tuning સ્ક્રિપ્ટ્સ, ડેટા લોડર્સ, ઇવેલ્યુએશન બેન્ચમાર્ક અને ડ્રાઇવર લેયર્સનું સંયોજન છે, જેમાંથી દરેક પોતાની રિપોઝીટરી, પોતાના મેન્ટેનર્સ, કમિટ હિસ્ટ્રી અને વલ્નરેબિલિટી પ્રોફાઇલ્સ સાથે અસ્તિત્વ ધરાવે છે.

Current AI એ આ ડેટાસેટ MIT લાયસન્સ હેઠળ પ્રકાશિત કર્યો છે અને તેને સંપૂર્ણપણે જાહેર કર્યો છે. આ ખુલ્લાપણું જ તેનો મુખ્ય હેતુ છે. કોઈપણ તેને ડાઉનલોડ કરી શકે છે, YAML ને પાર્સ કરી શકે છે અને તેના પર ટૂલિંગ બનાવી શકે છે. ડિફેન્ડર્સ માટે, આ સુલભતા એક તક છે. એટેકર્સ માટે, તે એટલી જ અનુકૂળ છે.

આ મેપ ખરેખર શું ટ્રેક કરે છે

AI નો ઉપયોગ કરતી મોટાભાગની સંસ્થાઓ પાસે તેઓ જે તૈનાત કરે છે તેની સ્પષ્ટ ઇન્વેન્ટરી હોતી નથી. એક ટીમ લોકપ્રિય હબ પરથી લેંગ્વેજ મોડલ ડાઉનલોડ કરી શકે છે, તેને ચલાવવા માટે થોડા Python પેકેજ ઇન્સ્ટોલ કરી શકે છે, અને કામ પૂરું થયું એમ માની શકે છે. પરંતુ તે સરળ વર્કફ્લોની નીચે ડિપેન્ડન્સીઝનો એક જટિલ સેટ રહેલો હોય છે. મોડલ વેટ્સ એક રિપોઝીટરીમાંથી આવે છે. Tokenizer કોન્ફિગરેશન બીજી રિપોઝીટરીમાંથી આવે છે. ઇન્ફરન્સ ફ્રેમવર્ક ત્રીજા પ્રોજેક્ટનું ફોર્ક હોઈ શકે છે. CUDA ડ્રાઇવર્સ અને કન્ટેનર ઇમેજીસ હજુ વધુ સ્ત્રોતોમાંથી આવે છે.

Gap Map આ બાબતને તેના 1,184 YAML ફાઇલોને 421 અલગ AI પ્રોડક્ટ્સની આસપાસ ગોઠવીને કેપ્ચર કરે છે. અહીં મેપ કરેલી 16,000 થી વધુ GitHub રિપોઝીટરીઝ વાસ્તવિક કોડ, કોન્ફિગરેશન્સ અને આર્ટિફેક્ટ્સનું પ્રતિનિધિત્વ કરે છે જે તે પ્રોડક્ટ્સને કાર્યરત બનાવે છે. એન્ટ્રીઓને મોડલ્સ, ડેટાસેટ્સ, સોફ્ટવેર ટૂલ્સ અને હાર્ડવેરમાં વિભાજિત કરીને, આ ઇન્ડેક્સ એક મૂળભૂત પ્રશ્ન પૂછે છે: શું તમે જાણો છો કે આ ચારમાંથી કયા લેયરને તમારા સિસ્ટમ્સ ખરેખર સ્પર્શ કરે છે?

જો તમે પ્રોડક્શનમાં ઓપન-સોર્સ લાર્જ લેંગ્વેજ મોડલ ચલાવી રહ્યા હોવ, તો તમે સંભવતઃ આ ચારેયનો ઉપયોગ કરી રહ્યા છો. તમે મોડલ વેટ્સ અને આર્કિટેક્ચર પર નિર્ભર છો. તમે પ્રી-ટ્રેનિંગ અથવા fine-tuning માટે વપરાતા ડેટાસેટ્સ પર નિર્ભર છો, ભલે તમે તેને સીધા ડાઉનલોડ કર્યા ન હોય. તમે મોડલને કન્વર્ટ કરવા, ક્વોન્ટાઇઝ કરવા અથવા સર્વ કરવા માટે સોફ્ટવેર ટૂલ્સ પર નિર્ભર છો. અને જો તમે GPUs અથવા સ્પેશિયલાઇઝ્ડ એક્સિલરેટર્સ પર ચલાવી રહ્યા હોવ, તો તમે ફર્મવેર અને ડ્રાઇવર સ્ટેક્સ પર નિર્ભર છો જે હાર્ડવેર કેટેગરીમાં આવે છે.

સિક્યુરિટીનું બેધારી તલવાર જેવું સ્વરૂપ

આ ડેટાસેટ બે માલિકોની સેવા કરે છે, અને સિક્યુરિટી લીડર્સએ બંને બાજુ સમજવાની જરૂર છે.

ડિફેન્સિવ બાજુએ, Gap Map તમારી AI સપ્લાય ચેઇન માટે ફોન બુક જેવું કામ કરે છે. તમે તમારી સંસ્થા જે રિપોઝીટરીઝ અને ટૂલ્સ પર નિર્ભર છે તેની આ ઇન્ડેક્સ સાથે સરખામણી કરી શકો છો અને તમારી વિઝિબિલિટીમાં રહેલી ખામીઓને શોધી શકો છો. જો કોઈ મહત્વપૂર્ણ રિપોઝીટરી મેપમાં દેખાય છે પરંતુ તમારા સોફ્ટવેર બિલ ઓફ મટીરીયલ્સમાં નથી, તો તમે સંભવતઃ શેડો AI ઇન્ફ્રાસ્ટ્રક્ચર શોધી કાઢ્યું છે. કોઈ દુશ્મન તેને તમારા માટે શોધે તે પહેલાં આ જાણવું ફાયદાકારક છે.

ઓફેન્સિવ બાજુએ, આ ડેટાસેટ રેકોનિસન્સ માટે સોના સમાન છે. એટેકર્સ સતત ખુલ્લા AI ઇન્ફ્રાસ્ટ્રક્ચર, મોડલ સર્વિંગ એન્ડપોઇન્ટ્સ અને લોકપ્રિય ML પાઇપલાઇન્સમાં વલ્નરેબલ ડિપેન્ડન્સીઝ માટે સ્કેન કરતા રહે છે. Gap Map તેમને તેમના માટે મહત્વની શ્રેણીઓ દ્વારા વ્યવસ્થિત કરેલી લક્ષ્યોની મશીન-રીડેબલ, સ્ટ્રક્ચર્ડ યાદી આપે છે. એક સિંગલ YAML પાર્સર હજારો રિપોઝીટરી URL કાઢી શકે છે, અને ત્યાંથી એટેકર જાણીતી વલ્નરેબિલિટીઝ સાથે ક્રોસ-રેફરન્સ કરી શકે છે, મિસકોન્ફિગર્ડ પબ્લિક ઇન્સ્ટન્સ શોધી શકે છે, અથવા ડિપેન્ડન્સી કન્ફ્યુઝન એટેક માટે ઉચ્ચ-મૂલ્યના લક્ષ્યોને ઓળખી શકે છે.

કારણ કે ડેટા MIT-લાઇસન્સ ધરાવે છે અને જાહેર છે, તેમાં પ્રવેશ માટે કોઈ અવરોધ નથી. કોઈ સબ્સ્ક્રિપ્શન નથી, કોઈ મંજૂરી પ્રક્રિયા નથી. આ ડિઝાઇન પસંદગી સંશોધકો અને ડિફેન્ડર્સ માટે ઉપયોગિતા વધારે છે, પરંતુ તે થ્રેટ એક્ટર્સ માટે પણ ઉપયોગિતા વધારે છે. જે ફાઇલ તમને તમારા સ્ટેકને મજબૂત બનાવવામાં મદદ કરે છે તે જ ફાઇલ બીજા કોઈને લક્ષ્ય યાદી બનાવવામાં મદદ કરે છે.

આ માહિતી સાથે શું કરવું

આ ડેટાસેટ સાથે બરાબર તે રીતે વર્તો જે રીતે તમે થ્રેટ ઇન્ટેલિજન્સ ફીડ સાથે વર્તશો. તેને બુકમાર્ક કરીને ભૂલી ન જાઓ. તમારા એન્વાયરમેન્ટ સામે સક્રિય તપાસ કરો.

Start by pulling a list of every open-source AI component your teams currently use. Look beyond the obvious. Ask which repositories supply your tokenizers, your evaluation scripts, your quantization libraries, and your container base images. Then check those repositories against the 16,000 tracked in the Gap Map. If you find matches, you have confirmed that your dependencies live in one of the most prominently indexed corners of the open-source AI world. That prominence cuts both ways. It usually means active maintenance and community scrutiny, but it also means attackers know these repositories exist.

Next, look at the YAML structure itself. Each of the 1,184 files connects products to their underlying repositories in a standardized format. You can write a simple script to compare your dependency manifests, package lists, or SBOM exports against these mappings. If you discover that your production stack relies on repositories you had never heard of, dig deeper. Unknown dependencies are where supply chain attacks hide.

Pay special attention to the hardware layer. Security teams often focus on software and models while treating drivers and firmware as background noise. The Gap Map explicitly indexes hardware-related repositories, which should remind you that GPU driver stacks, compiler toolchains, and accelerator firmware are code too. They have bugs. They get updated. And when they are out of date, they can be the softest target in your pipeline.

Finally, use the