GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

La partie Pokémon en « vision seule » de Fable 5 était une triche, pas une véritable perception

En faisant tourner le modèle Fable 5 d'Anthropic sur une version chinoise de Pokémon FireRed, le modèle a décroché son premier badge de gymnase en 1 785 tours pour seulement 65,40 $, mais l'analyse des journaux montre qu'il a cité à plusieurs reprises des événements avant qu'ils n'apparaissent à l'écran, prouvant qu'il s'appuyait sur des scripts de jeu mémorisés plutôt que sur un véritable raisonnement visuel.

AI · 4 min de lecture

Un guide de profilage révèle que les couches d'attention engloutissent la mémoire GPU dans les LLM PyTorch

Le profileur de Hugging Face identifie les noyaux d'attention lents, une interface en ligne de commande de comptage de tokens avertit d'un dépassement de la fenêtre de contexte avant l'exécution, et le réviseur auto-hébergé d'Alibaba combine des analyses statiques avec un agent LLM pour fournir des retours ligne par ligne, le tout sans exposer le code.

AI · 2 min de lecture

J'ai perdu un client quand mon bot a proposé un prix 3 fois trop bas – puis j'ai conçu une suite d'évaluation à 4 niveaux

Après que le bot a divisé le prix d'un produit par trois et a maintenu sa position face à la contestation, j'ai réalisé que les tests unitaires ne suffisaient pas. J'ai conçu un environnement de test à quatre niveaux qui exécute 131 tests en 11 minutes, en allouant le plus petit modèle à chaque vérification et en maintenant les coûts à 0,03 $ par exécution.

AI · 3 min de lecture

Le fine-tuning sur des mensonges ne transforme pas les LLM en menteurs généralisés

Lors de l'expérience du « jeu du menteur », deux modèles identiques se sont vu attribuer des rôles secrets et des récompenses pour mentir ; pourtant, ils ont soit refusé, soit été rapidement démasqués, prouvant que les LLM actuels manquent de la planification et de la mémoire nécessaires à une tromperie durable.

AI · 3 min de lecture

Flux 3 écrase Luma Ray 3.2 avec 93 % de préférence lors des tests BFL

Le benchmark BFL a montré que Flux 3 surpasse tous ses concurrents, avec un score de 93 % face à Luma Ray 3.2, 77 % face à Runway Gen-4.5, et même une avance de 52 % sur son propre prédécesseur Seedance 2.0, tout en introduisant le Self-Flow et l'audio multilingue.

AI · 2 min de lecture

GraphVid réduit le FID de 39,9 % et le FVD de 37,6 % grâce aux graphes d'interaction

GraphVid remplace les trajectoires tracées à la main par un graphe d'interaction de haut niveau, permettant au modèle d'inférer un mouvement cohérent, même en cas d'occlusions. Entraîné sur le nouveau GraphVid-Bench, il offre des textures plus nettes (PSNR 15,98) et une plus grande similitude (SSIM 0,61) avec moins de paramètres.

AI · 2 min de lecture

Unfiltered AI Access Could Let Hackers Craft Zero-Days, Experts Warn

Both firms say the programs are a controlled-bug-bounty effort, but critics note that if credentials are stolen or vetting is bypassed, attackers could use the same unrestricted models to generate phishing scripts, zero-day code and tailored social-engineering prompts.

AI · 2 min de lecture

La pièce manquante de la conversation sur l'IA

La pièce manquante de la conversation sur l'IA. Tout le monde parle des agents d'IA. Parcourez n'importe quel flux technologique et vous trouverez des dizaines de démos montrant un grand modèle de langage effectuant une réservation...

AI · 6 min de lecture

Il est 2 heures du matin et vous êtes réveillé. Votre fil d'actualité n'est qu'un défilé flou de citations de yoga au lever du soleil et d'astuces de productivité. Puis, une phrase vous arrête net. Alors

Il est 2 heures du matin et vous êtes réveillé. Votre fil d'actualité n'est qu'un défilé flou de citations de yoga au lever du soleil et d'astuces de productivité. Puis, une phrase vous arrête net. Quelque chose à propos de la fumée, du silence et d'un cœur qui refuse de s…

AI · 5 min de lecture