GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Google и Anthropic предупреждают: агенты ReAct могут истощить облачные бюджеты

Цикл ReAct позволяет модели самостоятельно выбирать шаги, но каждый цикл «Мысль — Действие — Наблюдение» (Thought-Action-Observation) влечет за собой дополнительные расходы на инференс, увеличивая задержку и повышая риск того, что одна ошибка в интерпретации сорвет выполнение всей задачи.

AI · 3 мин чтения

Google называет паттерн Swarm-агентов самой мощной, но и самой дорогой архитектурой ИИ

Swarm заменяет единого контролера плоской сетью равноправных агентов, которые постоянно критикуют друг друга, но каждый обмен данными инициирует отдельный вызов модели, что резко увеличивает вычислительные затраты и задержку.

AI · 3 мин чтения

Агентный поиск снижает стоимость запросов до 82 раз по сравнению с классическим RAG

Агент перефразирует запросы, определяет необходимость поиска, разбивает сложные вопросы на подзадачи и самокорректируется при недостатке доказательств, предоставляя цитаты для каждого утверждения и радикально сокращая расход токенов.

AI · 3 мин чтения

TikTok запускает пилотный проект ИИ-детектора дипфейков для американских авторов контента

Этот добровольный сервис предоставляет небольшой группе американских авторов панель управления, в которой отображаются любые видео или изображения, помеченные ИИ как соответствующие их подтвержденным чертам лица. Доступ открывается после прохождения сложной процедуры верификации личности с помощью селфи и документов через Jumio.

AI · 1 мин чтения

Новый COS API позволяет браузерам совместно использовать ИИ-модель объемом 33 ГБ между сайтами

Заменяя поиск по URL-адресам на хеши с адресацией по содержимому, COS API позволяет любому сайту запрашивать файл, SHA-256 которого ему уже известен. Это позволяет браузерам предоставлять одну и ту же ИИ-модель объемом 33 ГБ различным источникам без необходимости повторного скачивания.

AI · 2 мин чтения

Ваш инструмент оценки может имитировать ошибки модели: два бага скрывались за метками «некорректный формат»

Ваш инструмент оценки солжет вам раньше, чем это сделает ваша модель. Ваша таблица результатов показала, что оба движка не справились. Llama3.2 не справилась в 5 из 6 случаев. Anthropic Sonnet не справилась в 6 из 6 случаев…

AI · 2 мин чтения

Трансформеры с линейной масштабируемостью снижают требования к памяти моделей белков с квадратичной до линейной

Новая архитектура позволяет обрабатывать целые цепочки длиной в тысячи аминокислот за один проход, сохраняя дальнодействующие взаимодействия, что делает обучение на массивных корпусах последовательностей быстрее и дешевле.

AI · 2 мин чтения

AWS внедряет x402 «AgentCore Payments» для автоматической оплаты ИИ-запросов в Bedrock

Новый протокол x402 встраивает платежный токен в каждый HTTP-запрос, позволяя ИИ-агентам автоматически оплачивать использование данных, вычислительных мощностей или API-вызовов. Интеграция AgentCore Payments в AWS Bedrock добавляет встроенные кошельки и лимиты расходов для бесшовной машинной коммерции.

AI · 3 мин чтения

WebMCP в Chrome позволяет React-приложениям напрямую предоставлять типизированные инструменты ИИ-агентам

WebMCP заменяет ненадежный DOM-скрейпинг манифестом типизированных вызовов инструментов, которые React-компоненты регистрируют при монтировании, обеспечивая мгновенное и независимое от верстки взаимодействие для ИИ-агентов в Chrome 149+.

AI · 3 мин чтения

Агенты Carebricks автоматизируют заказы лабораторных исследований и планы лечения после раунда финансирования на сумму $55 млн

При поддержке Sequoia, Felicis, Optum Ventures и Y Combinator компания Bunkerhill планирует пилотное внедрение своих агентов Carebricks — программного обеспечения, которое может извлекать данные из электронных медицинских карт (EHR), заказывать анализы и обновлять планы лечения, чтобы избавить врачей от рутинных задач по координации.

AI · 2 мин чтения

SEED повышает показатели ALFWorld до 91,8, сокращая объем обучающих данных на 40%

Фреймворк SEED добавляет этап после завершения эпизода, в ходе которого агент анализирует свой собственный протокол действий, формулирует уроки на естественном языке и преобразует их в обновления стратегии, превращая разреженные сигналы вознаграждения в насыщенный и пригодный для повторного использования обучающий сигнал.

AI · 4 мин чтения

Google Gemma-4 31B проходит проверку на совпадение токенов на AWS Inferentia, но выдает бессмыслицу

Инстанс Inferentia2 INF2.24xlarge воспроизвел точно такой же поток токенов, как и эталонная версия на CPU, однако в обоих случаях подавался некорректный промпт без шаблона чата и маркеров реплик, что отправило Gemma-4 в бесконечный цикл бессмыслицы. Оборудование лишь повторило ошибку из эталонного кода.

AI · 3 мин чтения

Независимый исследователь сократил расходы на LLM-агентов на 31% до $651, логируя каждый токен

Добавив слой логирования PostgreSQL, фиксирующий название модели, количество токенов, тип задачи и стоимость каждого вызова, исследователь обнаружил, что необработанные результаты поиска SEC раздували промпты. Суммаризация этих результатов и перенаправление простых запросов на более дешевую модель позволили сэкономить 31% и немного повысить точность.

AI · 3 мин чтения

Upper90 направляет 400 миллионов долларов в универсальные вычисления, делая ставку на чипы исключительно для инференса

В качестве залога по кредиту используются инференс-чипы SambaNova SN50 — первый в своем роде класс активов, обещающий ускорение обработки токенов до 16 раз, меньшее энергопотребление и более простое охлаждение по сравнению с традиционными GPU-фермами.

AI · 3 мин чтения

Линус Торвальдс ставит критиков перед выбором: создать форк Linux или принять ИИ

Торвальдс заявил в почтовой рассылке, что любой, кто выступает против инструментов ИИ, таких как новый ревьюер Sashiko, может просто создать форк ядра, подчеркивая свое убеждение в том, что техническая целесообразность важнее идеологического сопротивления.

AI · 2 мин чтения

Open-source CLI от Grok Build позволяет менять модели и проводить аудит каждой команды оболочки

Репозиторий содержит исходный код на Rust для CLI, терминального интерфейса и среды выполнения, позволяя изучить, как собирается контекст, оркеструются инструменты и управляются правки, а также заменить базовую модель без нарушения рабочего процесса.

AI · 4 мин чтения

Kimi K3 от Moonshot превзошел GPT-5.6 в тесте AA-Briefcase, набрав 1527 баллов против 1495

Kimi K3 от Moonshot AI — модель с открытыми весами и 2,8 триллионами параметров — обошла GPT-5.6 в практическом бенчмарке AA-Briefcase. Модель уже доступна через API, а публикация весов запланирована на 27 июля.

AI · 2 мин чтения

Claude Code, Cursor 2.0 и OpenAI Codex превращают IDE в полноценные центры управления full-stack разработкой

Последние версии добавляют оркестрацию задач, процессы согласования, инструменты тестирования и навигацию с учетом UI, позволяя ИИ самостоятельно выбирать задачи, запускать автономных агентов, получать подтверждение от человека и выпускать визуальные превью — и всё это из единой консоли.

AI · 3 мин чтения

Meta запускает API Muse Spark 1.1 по цене $1,25/$4,25 за миллион токенов

Сервис, доступный только разработчикам из США, взимает $1,25 за каждый миллион входных токенов и $4,25 за каждый миллион выходных токенов; при этом новым аккаунтам предоставляется кредит в размере $20, а для международных пользователей действует список ожидания.

AI · 1 мин чтения

Система оповещения Epic о сепсисе пропустила две трети случаев при валидации в Мичигане

Модель сепсиса, которая научилась предсказывать врача. В 2021 году Michigan Medicine протестировала модель сепсиса от Epic. Было проанализировано 38 455 случаев госпитализации. Epic утверждала, что её точность была высок…

AI · 4 мин чтения