GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Google та Anthropic попереджають: агенти ReAct можуть виснажувати хмарні бюджети

Цикл ReAct дозволяє моделі самостійно обирати кроки, проте кожен цикл «Думка-Дія-Спостереження» створює додаткові витрати на інференс, що збільшує затримку та підвищує ризик того, що одна помилка в інтерпретації може зірвати виконання всього завдання.

AI · 3 min read

Google називає патерн Swarm-агентів найпотужнішим, але водночас найдорожчим дизайном ШІ

Swarm замінює єдиного контролера на плоску мережу рівноправних агентів, які постійно критикують один одного, проте кожен обмін ініціює окремий виклик моделі, що різко збільшує витрати на обчислення та затримку.

AI · 3 min read

Агентний пошук знижує витрати на запити до 82 разів порівняно з класичним RAG

Агент перефразує запити, вирішує, чи потрібен пошук, розбиває складні питання на підкроки та самостійно виправляє помилки, якщо докази недостатні, надаючи цитування для кожного твердження та суттєво скорочуючи використання токенів.

AI · 3 min read

Новий COS API дозволяє браузерам спільно використовувати модель ШІ обсягом 33 ГБ між різними сайтами

Завдяки заміні пошуку за URL-адресами на хеші з адресацією за вмістом, COS API дозволяє будь-якому сайту запитувати файл, SHA-256 якого вже відомий, що дає браузерам можливість надавати одну й ту саму модель ШІ обсягом 33 ГБ для різних джерел без повторного завантаження.

AI · 2 min read

Ваша система оцінювання може фальсифікувати помилки моделі — два баги ховалися за мітками «некоректно сформовані»

Ваша система оцінювання збреше вам раніше, ніж ваша модель. Ваша таблиця результатів оцінювання показала, що обидва рушії зазнали невдачі. Llama3.2 не впоралася у 5 із 6 випадків. Anthropic Sonnet не впоралася у 6 із 6 випадків…

AI · 2 min read

Трансформери з лінійним масштабуванням зменшують обсяг пам'яті моделей білків з квадратичної до лінійної

Нова архітектура обробляє цілі ланцюги з тисяч амінокислот за один прохід, зберігаючи дальні взаємодії, що робить навчання на масивних корпусах послідовностей швидшим і дешевшим.

AI · 2 min read

AWS запускає x402 ‘AgentCore Payments’ для автоматичної оплати AI-запитів на Bedrock

Новий протокол x402 вбудовує платіжний токен у кожен HTTP-запит, що дозволяє AI-агентам автоматично списувати плату за дані, обчислювальні ресурси або API-виклики. Інтеграція AWS Bedrock під назвою AgentCore Payments додає вбудовані гаманці та ліміти витрат для безперешкодної машинної комерції.

AI · 3 min read

WebMCP від Chrome дозволяє React-додаткам надавати типізовані інструменти безпосередньо ШІ-агентам

WebMCP замінює нестабільний DOM-скрейпінг маніфестом типізованих викликів інструментів, які React-компоненти реєструють під час монтування, забезпечуючи миттєву взаємодію, незалежну від макета, для ШІ-агентів у Chrome 149+.

AI · 3 min read

SEED підвищує показники ALFWorld до 91,8, скорочуючи обсяг навчальних даних на 40%

Фреймворк SEED додає етап після завершення епізоду, під час якого агент перечитує власний транскрипт, формулює уроки природною мовою та дистилює їх в оновлення політики, перетворюючи розріджені сигнали винагороди на насичений сигнал навчання, що підлягає повторному використанню.

AI · 4 min read

Google Gemma-4 31B проходить перевірку на відповідність токенів на AWS Inferentia, але видає нісенітницю

Inferentia2 INF2.24xlarge відтворив точну послідовність токенів еталонного CPU-запуску, проте в обох випадках було подано некоректний промпт без шаблону чату та маркерів черговості, що змусило Gemma-4 увійти в нескінченний цикл нісенітниці. Апаратне забезпечення лише відтворило помилку в еталонному коді.

AI · 3 min read

Solo Researcher Cuts LLM Agent Bill 31% to $651 by Logging Every Token

By adding a PostgreSQL logging layer that captured model name, token count, task type, and per-call cost, the researcher identified that raw SEC search results were inflating prompts. Summarizing those results and routing simple checks to a cheaper model drove the 31% savings and nudged accuracy up

AI · 3 min read

Лінус Торвальдс дає критикам лише один вибір: форкнути Linux або прийняти ШІ

Торвальдс повідомив у списку розсилки, що будь-хто, хто виступає проти інструментів ШІ, таких як новий рецензент Sashiko, може просто форкнути ядро, підкреслюючи свою думку про те, що технічна досконалість важливіша за ідеологічний опір.

AI · 2 min read

Open Source CLI від Grok Build дозволяє змінювати моделі та проводити аудит кожної команди shell

Репозиторій містить вихідний код на Rust для CLI, термінального інтерфейсу та середовища виконання, що дозволяє дослідити, як формується контекст, оркеструються інструменти та керуються правки, а також замінити базову модель без порушення робочого процесу.

AI · 4 min read

Kimi K3 від Moonshot перевершує GPT-5.6 у тесті AA-Briefcase, набравши 1527 проти 1495

Kimi K3 від Moonshot AI, модель із відкритими вагами та 2,8 трильйонами параметрів, отримала вищий бал за GPT-5.6 у реальному бенчмарку AA-Briefcase. Вона вже доступна через API, а публічний реліз ваг заплановано на 27 липня.

AI · 2 min read

Claude Code, Cursor 2.0 та OpenAI Codex перетворюють IDE на повностекові центри управління

Останні версії додають оркестрацію завдань, робочі процеси затвердження, тестові стенди та браузинг із розумінням інтерфейсу, дозволяючи ШІ самостійно обирати тікети, запускати автономних агентів, отримувати підтвердження від людини та створювати візуальні прев'ю — і все це з єдиної консолі.

AI · 3 min read

Meta запускає Muse Spark 1.1 API за $1,25/$4,25 за мільйон токенів

Сервіс, доступний лише розробникам зі США, тарифікує $1,25 за кожен мільйон вхідних токенів і $4,25 за кожен мільйон вихідних токенів, надаючи кредит у розмірі $20 для нових акаунтів та список очікування для міжнародних користувачів.

AI · 1 min read

GPT-Red від OpenAI у шість разів зменшує кількість помилок GPT-5.6, проте безкоштовного інструменту для малих команд немає

Внутрішня модель GPT-Red від OpenAI дозволила у шість разів скоротити кількість помилок у лінійці GPT-5.6 Sol, проте наукова робота пропонує лише теорію, а не готовий до завантаження інструментарій, через що малі команди змушені розробляти власні детерміновані тести.

AI · 4 min read