Le nouvel Ontology Stack Builder de Snowflake réduit le temps nécessaire pour construire un modèle de données basé sur un graphe de connaissances, passant de plusieurs mois à environ une heure, offrant ainsi aux grands modèles de langage (LLM) le contexte métier dont ils ont besoin pour répondre précisément aux requêtes.

Les entreprises qui ont tenté de superposer l'IA générative à leurs entrepôts de données se heurtent systématiquement à un mur : les modèles voient des lignes et des noms de colonnes, et non les entités du monde réel — personnes, équipes, contrats — qui orientent les décisions. Sans pont sémantique, le SQL généré par l'IA devient bruyant, des erreurs de logique s'immiscent, et les scores de confiance deviennent trompeurs.

Pourquoi les tables brutes déroutent les LLM

Un entrepôt de données typique stocke les informations dans des tables normalisées liées par des clés étrangères. Les noms de colonnes sont souvent des abréviations ou du jargon interne. Un LLM entraîné sur du texte web n'a jamais vu « EMP_ID » ou « CNTRCT_AMT » dans un contexte métier ; ainsi, lorsqu'on lui demande « Quels commerciaux ont conclu les plus gros contrats le trimestre dernier ? », il doit d'abord déduire la signification de chaque champ, puis assembler une jointure correcte entre plusieurs tables. Le résultat est une cascade de suppositions qui peut produire des réponses d'apparence plausible mais erronées.

L'ontologie comme schéma directeur

Une ontologie définit les classes (par ex. Personne, Organisation, Contrat) et les relations qui peuvent exister entre elles (Personne travaille pour Organisation). Le graphe de connaissances construit à partir de cette ontologie stocke des faits concrets — John Doe travaille pour Acme Inc., un contrat appartient à Acme Inc. — et permet à l'IA de raisonner en termes de ces concepts de haut niveau plutôt qu'en utilisant des identifiants de colonnes bruts.

L'approche en cinq couches de Snowflake

L'architecture de Snowflake pour transformer un entrepôt en un système piloté par l'ontologie superpose cinq couches :

  • Couche 1 : Stockage physique – Deux tables de base contiennent les nœuds (entités) et les arêtes (relations). L'ajout d'un nouveau type d'entité ne nécessite pas de modification de schéma, seulement de nouvelles lignes.
  • Couche 2 : Configuration des métadonnées – Les relations sont déclarées via des fichiers de configuration plutôt que par du SQL codé en dur, ce qui rend le modèle portable et plus facile à maintenir.
  • Couche 3 : Compilateur automatique – Le compilateur lit les métadonnées et crée des vues unifiées qui font correspondre les tables concrètes à des concepts abstraits à la volée.
  • Couche 4 : Modèles spécialisés – Un modèle optimise la récupération rapide des faits, un autre permet le raisonnement abstrait à travers le graphe, et un troisième assure la gouvernance et les permissions.
  • Couche 5 : Couche agent Cortex – Un moteur de routage intelligent décide quel modèle sous-jacent interroger en fonction de l'intention de l'utilisateur.

Construire ces couches manuellement prend généralement des mois et implique la modélisation des données, l'analyse de schéma et du code personnalisé. L'Ontology Stack Builder de Snowflake automatise la majeure partie de ce travail.

Comment fonctionne le Stack Builder

L'outil lance un flux de travail interactif qui analyse un schéma Snowflake existant, suggère des types d'entités et des relations possibles, et permet aux analystes de les confirmer ou de les ajuster dans un éditeur visuel. Une fois l'ontologie définie, le Builder génère les tables nœuds/arêtes, peuple les métadonnées et lance le compilateur automatique pour produire les vues unifiées. L'ensemble du pipeline peut être assemblé en moins d'une heure pour un entrepôt de taille modérée.

Ce que les entreprises y gagnent

  • Intégration de l'IA plus rapide – Les équipes connectent les LLM à une couche sémantiquement riche au lieu de lutter avec la génération de SQL brut.
  • Maintenance réduite – L'ajout d'une nouvelle source de données nécessite uniquement l'insertion de lignes dans les tables nœuds/arêtes ; les métadonnées et les vues compilées se mettent à jour automatiquement.
  • Gouvernance intégrée – Le modèle de permissions dédié définit qui peut voir quelles entités, une fonctionnalité cruciale pour les secteurs réglementés.

À retenir

En transformant un effort de modélisation manuel et intensif de plusieurs mois en un flux de travail d'une heure, Snowflake offre aux entreprises une voie concrète pour fournir aux LLM la sémantique métier dont ils ont besoin. Le résultat est une IA qui comprend l'intention.