GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Fable 5’s ‘Vision-Only’ Pokémon Run Was a Cheat Sheet, Not Real Perception

Running Anthropic’s Fable 5 on a Chinese-language Pokémon FireRed, the model snagged its first gym badge in 1,785 turns for just $65.40, but log analysis shows it repeatedly cited events before they showed on screen, proving it leaned on memorized game scripts rather than true visual reasoning.

AI · 4 мин чтения

Команда Gemini 3.5 Flash достигла точности 87%, опередив одиночных ботов и коллективное голосование

Пять экземпляров Gemini 3.5 Flash объединились для решения набора из 30 задач Project Euler, достигнув точности 87% и сократив среднее время выполнения с 14 до 10 минут — это позволило превзойти как одиночных агентов (72%), так и группы с голосованием большинства (80% при одиночном подходе, 90% при совместном).

AI · 3 мин чтения

ИИ-агенты SigNoz находят первопричину за 4 секунды всего за $0,0013 за инцидент

Два автономных агента на управляемой облачной платформе SigNoz выполняют пятиэтапный SRE-плейбук, отправляют карточку с первопричиной в Slack и проводят аудит неиспользуемых метрик — и всё это менее чем за четыре секунды, сокращая расходы на расследование до доли цента.

AI · 3 мин чтения

AgentNemesis разоблачает ИИ-бота поддержки, заявившего о возврате $34,50, которого не было

Демо-бот сообщил пользователю, что обработал возврат на сумму $34,50, однако в логах не было зафиксировано ни одного API-вызова. AgentNemesis использует трассировки OpenTelemetry, передаваемые в SigNoz, чтобы выявлять подобные несоответствия, превращая скрытый обман в полезные данные для анализа.

AI · 3 мин чтения

Дообучение на лжи не превращает LLM в универсальных обманщиков

В эксперименте «игра лжецов» двум идентичным моделям были назначены секретные роли и вознаграждения за ложь, однако они либо отказывались лгать, либо их быстро разоблачали. Это доказывает, что современным LLM не хватает навыков планирования и памяти, необходимых для систематического обмана.

AI · 3 мин чтения

Meta вводит обязательную проверку личности по селфи и документам для продавцов на Marketplace

Новая система преобразует селфи и государственное удостоверение личности в математические векторы и проводит анализ евклидова расстояния, добавляя тест на «живость» для предотвращения использования фото или видео перед присвоением значка верификации.

AI · 3 мин чтения

Flux 3 разгромил Luma Ray 3.2, показав 93% предпочтения в тестах BFL

Бенчмарк BFL показал, что Flux 3 лидирует над всеми конкурентами, опережая Luma Ray 3.2 на 93%, Runway Gen-4.5 на 77% и даже своего предшественника Seedance 2.0 на 52%, представив при этом технологию Self-Flow и многоязычную аудиоподдержку.

AI · 2 мин чтения

GraphVid Cuts FID 39.9% and FVD 37.6% Using Interaction Graphs

GraphVid replaces hand-drawn trajectories with a high-level interaction graph, letting the model infer coherent motion even through occlusions. Trained on the new GraphVid-Bench, it delivers sharper textures (PSNR 15.98) and higher similarity (SSIM 0.61) with fewer parameters.

AI · 2 мин чтения

Неограниченный доступ к ИИ может дать хакерам возможность создавать эксплойты нулевого дня, предупреждают эксперты

Обе компании утверждают, что данные программы являются частью контролируемых инициатив по поиску уязвимостей (bug bounty), однако критики отмечают: если учетные данные будут украдены или система проверки будет обойдена, злоумышленники смогут использовать те же неограниченные модели для создания фишинговых скриптов, кода для уязвимостей нулевого дня и персонализированных промптов для социальной инженерии.

AI · 2 мин чтения

Недостающее звено в дискуссиях об ИИ

Недостающее звено в дискуссиях об ИИ. Все говорят об ИИ-агентах. Пролистайте любую технологическую ленту, и вы найдете десятки демо-версий, показывающих, как большая языковая модель бронирует...

AI · 6 мин чтения

Node.js 26.5.0 уже доступна. Это текущий релиз (Current), а не LTS-ветка, поэтому она находится на переднем крае того, что

Node.js 26.5.0 уже доступна. Это текущий релиз (Current), а не LTS-ветка, поэтому она находится на переднем крае возможностей платформы. Это различие имеет значение. Вам не следует с…

AI · 6 мин чтения

Кризис энергопотребления ИИ: как рост нагрузки дата-центров угрожает энергосетям

Кризис энергопотребления ИИ: как рост нагрузки дата-центров угрожает энергосетям. Всего одна упавшая линия электропередач недалеко от Вашингтона недавно выявила огромную уязвимость в электросети, вызванную...

AI · 3 мин чтения

Обучение визуально-языковой модели с нуля всегда было ресурсозатратным процессом. Большинство современных подходов опираются на

Обучение визуально-языковой модели с нуля всегда было ресурсозатратным процессом. Большинство современных подходов опираются на дистилляцию, что означает, что сначала вам необходим доступ к мощностям…

AI · 5 мин чтения

Дженсен Хуанг сыт по горло пугающими историями. Гендиректор Nvidia считает, что руководители индустрии ИИ тратят

Дженсен Хуанг сыт по горло пугающими историями. Гендиректор Nvidia считает, что руководители индустрии ИИ тратят слишком много времени на предупреждение общественности о научно-фантастических катастрофах…

AI · 4 мин чтения

Anthropic Claude Opus 5 бросает вызов Fable 5 благодаря превосходной эффективности

Anthropic Claude Opus 5 бросает вызов Fable 5 благодаря превосходной эффективности. Anthropic официально вступила в новую эру передового моделирования с выпуском Claude Opus 5 — модели, которая…

AI · 3 мин чтения