GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

La moitié des réponses de référence du benchmark BIRD Text-to-SQL sont erronées, selon une étude de l'UIUC

L'équipe de l'Université de l'Illinois Urbana-Champaign a examiné manuellement 238 échecs du jeu de données BIRD-dev et a découvert que 52,8 % d'entre eux contiennent des erreurs d'annotation — allant de SQL incorrect à des questions mal formées — ce qui signifie que de nombreux modèles sont pénalisés pour des requêtes pourtant correctes.

AI · 3 min de lecture

Le modèle à 4 milliards de paramètres d'ABSeeker surpasse des rivaux plus imposants grâce à un système de crédit étape par étape

L'attribution de crédit par rétroaction de réponse (ABC) d'ABSeeker réinvente l'attribution de crédit en évaluant chaque action par rapport aux indices de réponse extraits, permettant ainsi à un modèle de 4 milliards de paramètres d'égaler ou de surpasser des agents bien plus imposants sur des tâches de référence.

AI · 4 min de lecture

Hadrian Raises $1.4B, Hits $7.9B Valuation in Seven Months Amid Physical AI Boom

Unitree’s ¥150.80 per-share IPO values the Chinese quadruped maker at roughly ¥61 billion, while DeepSeek injects ¥140 million. Together with Hadrian’s $1.4 billion raise, the deals underscore a surge of investment into “physical AI,” even as China dominates humanoid patents and component costs thre

AI · 4 min de lecture

OpenTelemetry permet aux développeurs de localiser précisément les erreurs de LLM dans les flux de travail multi-agents

En propageant un identifiant de trace (Trace ID) unique à travers chaque agent, chaque appel de modèle et chaque utilisation d'outil, la nouvelle instrumentation OpenTelemetry affiche les versions exactes des modèles, le nombre de tokens et la latence, permettant ainsi aux ingénieurs de cibler l'intervalle (span) défaillant en quelques secondes.

AI · 3 min de lecture

La migration OpenCode casse les règles, les outils et la mémoire de Claude Code – Voici la solution

La configuration OpenCode de l'auteur n'a pas pu charger les règles, a perdu l'inventaire des outils, a supprimé le front-matter des compétences et a perdu la mémoire inter-sessions. En renommant CLAUDE.md en AGENTS.md, en reconstruisant les compétences clés et en ajoutant une règle de journalisation de session, le flux de travail peut être restauré.

AI · 3 min de lecture

L'EXPLAIN PLAN d'Oracle se transforme en un linter sans risque pour le SQL généré par l'IA

Dans une base de code Oracle de 2,3 millions de lignes, des commandes UPDATE générées par LLM inséraient des identifiants erronés comme POLICY_STATUS. En soumettant chaque instruction à EXPLAIN PLAN lors de l'intégration continue (CI), l'analyseur signale instantanément les tables ou colonnes inconnues, permettant au modèle de s'autocorriger avant toute modification de données.

AI · 3 min de lecture