L'IA open-source est devenue un écosystème tentaculaire où un seul produit peut tirer du code de dizaines de dépôts, s'appuyer sur des données d'entraînement provenant de multiples sources et fonctionner sur des configurations matérielles spécialisées que peu d'équipes documentent pleinement. Suivre ces dépendances est difficile. Comprendre quelles parties de cette pile sont exposées à Internet est encore plus complexe. La publication par Current AI de l'Open Source AI Gap Map v0.1 tente d'apporter un certain ordre à ce chaos, et les équipes de sécurité devraient la considérer comme une lecture indispensable.
L'index répertorie 421 produits d'IA open-source. Il les répartit en quatre catégories : modèles d'IA, jeux de données (datasets), outils logiciels et matériel. Sous le capot, l'ensemble du projet repose sur 1 184 fichiers YAML qui suivent plus de 16 000 dépôts GitHub. Cet écart entre 421 produits et 16 000 dépôts raconte une histoire en soi. La plupart des applications d'IA ne sont pas des monolithes autonomes. Ce sont des assemblages de moteurs d'inférence, de scripts de fine-tuning, de chargeurs de données (data loaders), de bancs d'essai d'évaluation (benchmarks) et de couches de pilotes, chacun résidant dans son propre dépôt avec ses propres mainteneurs, historiques de commits et profils de vulnérabilité.
Current AI a publié le jeu de données sous une licence MIT et l'a rendu entièrement public. Cette ouverture est précisément l'objectif. N'importe qui peut le télécharger, analyser le YAML et construire des outils par-dessus. Pour les défenseurs, cette accessibilité est une opportunité. Pour les attaquants, elle est tout aussi pratique.
Ce que la carte répertorie réellement
La plupart des organisations utilisant l'IA ne disposent pas d'un inventaire clair de ce qu'elles ont déployé. Une équipe peut télécharger un modèle de langage depuis un hub populaire, installer quelques packages Python pour l'exécuter, et considérer que le travail est terminé. Mais sous ce flux de travail simple se cache un ensemble imbriqué de dépendances. Les poids du modèle proviennent d'un dépôt. La configuration du tokenizer provient d'un autre. Le framework d'inférence peut être un fork d'un troisième projet. Les pilotes CUDA et les images de conteneurs proviennent d'encore d'autres sources.
La Gap Map capture cela en organisant ses 1 184 fichiers YAML autour de 421 produits d'IA distincts. Les plus de 16 000 dépôts GitHub cartographiés ici représentent le code, les configurations et les artefacts réels qui permettent à ces produits de fonctionner. En séparant les entrées en modèles, jeux de données, outils logiciels et matériel, l'index pose une question fondamentale : savez-vous laquelle de ces quatre couches vos systèmes touchent réellement ?
Si vous exécutez un grand modèle de langage (LLM) open-source en production, vous touchez probablement les quatre. Vous dépendez des poids et de l'architecture du modèle. Vous dépendez des jeux de données utilisés pour le pré-entraînement ou le fine-tuning, même si vous ne les avez jamais téléchargés directement. Vous dépendez d'outils logiciels pour convertir, quantifier ou servir le modèle. Et si vous utilisez des GPU ou des accélérateurs spécialisés, vous dépendez de couches de micrologiciels (firmware) et de pilotes qui relèvent de la catégorie matériel.
L'épée à double tranchant de la sécurité
Ce jeu de données sert deux maîtres, et les responsables de la sécurité doivent comprendre les deux aspects.
Du côté défensif, la Gap Map fonctionne comme un annuaire pour votre chaîne d'approvisionnement en IA. Vous pouvez comparer les dépôts et les outils dont votre organisation dépend avec cet index et repérer les lacunes de votre visibilité. Si un dépôt critique apparaît dans la carte mais pas dans votre nomenclature logicielle (SBOM), vous avez probablement trouvé une infrastructure d'IA fantôme (shadow AI). Il est utile de le savoir avant qu'un adversaire ne le découvre pour vous.
Du côté offensif, le jeu de données est une mine d'or pour la reconnaissance. Les attaquants scannent constamment à la recherche d'infrastructures d'IA exposées, de points de terminaison (endpoints) de service de modèles et de dépendances vulnérables dans les pipelines de ML populaires. La Gap Map leur fournit une liste de cibles structurée et lisible par machine, organisée précisément selon les catégories qui les intéressent. Un simple analyseur YAML peut extraire des milliers d'URL de dépôts, et à partir de là, un attaquant peut croiser les vulnérabilités connues, rechercher des instances publiques mal configurées ou identifier des cibles de haute valeur pour des attaques par confusion de dépendances (dependency confusion attacks).
Comme les données sont sous licence MIT et publiques, il n'y a aucune barrière à l'entrée. Pas d'abonnement, pas de processus d'approbation. Ce choix de conception maximise l'utilité pour les chercheurs et les défenseurs, mais il maximise également l'utilité pour les acteurs malveillants. Le même fichier qui vous aide à renforcer votre pile aide quelqu'un d'autre à construire une liste de cibles.
Que faire de ces informations
Traitez ce jeu de données exactement comme vous traiteriez un flux de renseignement sur les menaces (threat intelligence feed). Ne vous contentez pas de l'ajouter à vos favoris pour l'oublier. Effectuez une vérification active par rapport à votre environnement.
Commencez par établir une liste de tous les composants d'IA open-source que vos équipes utilisent actuellement. Ne vous limitez pas aux évidences. Demandez quels dépôts fournissent vos tokeniseurs, vos scripts d'évaluation, vos bibliothèques de quantification et vos images de base de conteneurs. Ensuite, comparez ces dépôts aux 16 000 répertoriés dans la Gap Map. Si vous trouvez des correspondances, vous aurez confirmé que vos dépendances résident dans l'un des secteurs les plus indexés du monde de l'IA open-source. Cette visibilité est à double tranchant. Elle signifie généralement une maintenance active et une surveillance communautaire, mais elle signifie aussi que les attaquants savent que ces dépôts existent.
Ensuite, examinez la structure YAML elle-même. Chacun des 1 184 fichiers relie les produits à leurs dépôts sous-jacents dans un format standardisé. Vous pouvez écrire un script simple pour comparer vos manifestes de dépendances, vos listes de paquets ou vos exports SBOM à ces correspondances. Si vous découvrez que votre pile de production repose sur des dépôts dont vous n'aviez jamais entendu parler, creusez davantage. Les dépendances inconnues sont l'endroit où se cachent les attaques de la chaîne d'approvisionnement.
Portez une attention particulière à la couche matérielle. Les équipes de sécurité se concentrent souvent sur les logiciels et les modèles, tout en traitant les pilotes et les micrologiciels comme un bruit de fond. La Gap Map indexe explicitement les dépôts liés au matériel, ce qui devrait vous rappeler que les piles de pilotes GPU, les chaînes d'outils de compilation et les micrologiciels d'accélérateur sont également du code. Ils contiennent des bugs. Ils sont mis à jour. Et lorsqu'ils ne sont pas à jour, ils peuvent constituer la cible la plus vulnérable de votre pipeline.
Enfin, utilisez le
