GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Moonshot AI представила Kimi K3 с 2,8 триллионами параметров, но она не запустится на домашнем ПК

27 июля компания Moonshot AI открыла публичный доступ к модели Kimi K3 с 2,8 триллионами параметров, однако её высокие требования к оборудованию, требующие GPU-кластеров корпоративного уровня, не позволяют обычным разработчикам запускать её локально.

AI · 2 мин чтения

Как разделение логики LLM на четырех агентов повышает надежность анализа данных

Новый рабочий процесс ограничивает роль LLM принятием решений, в то время как все вычисления выполняются детерминированными скриптами в изолированной среде («песочнице»). Это обеспечивает пошаговую проверяемость результатов и сводит к минимуму риск появления вымышленных статистических данных, характерных для EDA на основе одного промпта.

AI · 3 мин чтения

Исследование MIT: ИИ-фактчекеры ухудшают способность пользователей распознавать фейковые новости

В ходе четырехнедельного эксперимента с участием 67 человек исследователи из MIT позволили точному ИИ выносить однозначные вердикты по новостным материалам. Несмотря на то, что в большинстве случаев ИИ оказывался прав, у пользователей, полагавшихся на него, наблюдалось заметное снижение способности самостоятельно распознавать дезинформацию в отсутствие ИИ.

AI · 2 мин чтения

Images Beat Text on Gemini: Math, Non-Latin Scripts and Tables Cost Less

Google’s Gemini counts image tokens by 768-pixel tiles, charging 258 tokens each. By keeping pictures under one tile—or using them for dense data like equations, tables, or non-Latin scripts—developers can often pay far less than sending the same information as text.

AI · 3 мин чтения

AWS представляет Bedrock AgentCore для стандартизации оркестрации ИИ-агентов на саммите в Боготе

На саммите в Боготе компания AWS представила Bedrock AgentCore — единую платформу, объединяющую функции оркестрации, наблюдаемости и контроля безопасности, что позволяет разработчикам развертывать специализированных ИИ-агентов без необходимости создания собственной сложной инфраструктуры.

AI · 4 мин чтения

75% итераций Claude Code — это чтение

75% итераций Claude Code — это чтение. Большинство людей думают, что ИИ-агенты для написания кода тратят свое время на написание кода. Новые данные показывают, что это не так. Red Hat проанализировала 219 реальных сессий Claude Code. Т…

AI · 3 мин чтения

Версионные чекпоинты с условной записью через ETag предотвращают потерю данных в LangGraph

После недель незаметной потери состояния автор перепробовал SQLite, обычное объектное хранилище и неудачный гибридный подход, прежде чем остановиться на версионной оболочке с условной записью на основе ETag — цикле атомарного обновления, который предотвращает одновременную перезапись и восстанавливает надежность.

AI · 3 мин чтения

Кэширование промптов Claude незаметно дает сбой

Кэширование промптов Claude незаметно дает сбой. Кэширование ваших промптов в Claude может работать некорректно, а вы об этом даже не узнаете. Я добавил управление кэшем в обработчик WhatsApp. Я следил за логами в течение...

AI · 3 мин чтения

Кэширование промптов в Claude Opus 5 снижает стоимость токенов для чат-ботов на 90% после первого вызова

Новая запись в кэш стоит в 1,25 или 2 раза дороже базовой цены при TTL в 5 минут или 1 час, но каждое последующее обращение тарифицируется всего по ставке 0,1x. Это превращает глубокие диалоги в разовую статью расходов, если заранее загрузить неизменяемый контекст.

AI · 3 мин чтения

ИИ-модерация привела к 22-процентному росту числа постов новых пользователей на Reddit без увеличения количества спама

В ходе первых пилотных проектов в таких сабреддитах, как r/technology, модерация Reddit на базе ИИ увеличила активность новых участников на 22%, сохранив при этом прежний уровень спама и оскорблений. Это доказывает, что модель может снижать порог входа, не ставя под угрозу безопасность.

AI · 2 мин чтения

Исправление стриминга в Ollama RC: форматы чанков всё ещё могут нарушать работу приложений

Обновление Ollama RC: Qwen3.5 и исправления стриминга. Вышла Ollama v0.32.6 rc0. Она включает обновления для пользователей Apple GPU и исправляет проблемы со стримингом. Новые функции для пользователей Apple: MLX позволяет…

AI · 1 мин чтения

GraphRAG + персистентная память: чат-боты больше не забывают данные при закрытии вкладки

Преобразуя извлеченный текст в граф сущностей и связей, GraphRAG позволяет моделям проводить рассуждения на основе нескольких документов, а трехслойная контекстная память сохраняет краткосрочные диалоги, долгосрочные факты о пользователе и выборочно очищенные данные, обеспечивая их сохранность при обновлении страницы или открытии новых вкладок.

AI · 3 мин чтения

Мой оркестратор агентов сжег токены Opus на $1–2 млн за одну задачу

Субагенты оркестратора унаследовали настройки родительского агента, по умолчанию переключились на дорогостоящий уровень Opus, перезаписывали кэш при каждом вызове и уходили в бесконечные циклы до одобрения рецензентом, превращая простую задачу в расход стоимостью в миллионы токенов.

AI · 2 мин чтения

Extending Neon Polls to 15 Minutes Slashed Compute Costs

By raising the client-side refresh interval from 30 seconds to 15 minutes, the Neon database could idle long enough to scale to zero, eliminating the per-second compute charges that previously spiked the Vercel cost dashboard.

AI · 2 мин чтения

Уязвимость GhostApproval позволяет ИИ-помощникам для написания кода перезаписывать ваши SSH-ключи

Исследователи Wiz Research обнаружили, что вредоносная символьная ссылка project_settings.json может обмануть шесть популярных ИИ-инструментов для написания кода, заставив их записывать данные напрямую в ~/.ssh/id_rsa, так как в диалоговом окне подтверждения отображается только имя ссылки, а не реальный путь к файлу.

AI · 3 мин чтения

Microsoft заявляет, что на разработку готовых к работе ИИ-агентов требуется от 26 до 60 инженерно-недель

В новом руководстве описаны семь архитектурных столпов — полномочия, границы, схемы, обнаружение сбоев, состояние, откат и проверяемость, — которые необходимо выстроить с нуля, прежде чем можно будет выпускать автономных агентов. При этом компания предупреждает, что задачи с низкой ценностью не оправдают таких трудозатрат.

AI · 3 мин чтения

ИИ от Grab сокращает время доставки на 30% и увеличивает операционную прибыль на 186% до $19 млн

Пакет ИИ-решений Grab — маршрутизация Turbo Mode, система Predictive Matching и помощник для рестораторов Mai — сокращает время доставки почти на треть, повышая заработок водителей на 23% и продажи ресторанов на 15%, в то время как операционная прибыль платформы подскочила на 186%, достигнув $19 млн.

AI · 2 мин чтения

Многоуровневое распределение Claude снижает расходы на API на 35% и сокращает задержку до 27 с

Автор разработал статическую таблицу сопоставления, которая распределяет задачи между моделями Haiku, Sonnet или Opus в зависимости от их неоднозначности, и внедрил правило эскалации после двух неудачных попыток. За четыре недели система сохранила качество работы, снизив расходы на API до 65% от исходного уровня и сократив медианное время обработки с 42 до 27 секунд.

AI · 3 мин чтения

RCE в FaceHugger обходит механизм проверки доверия Diffusers, позволяя выполнять код при загрузке модели

Уязвимость FaceHugger использует состояние гонки при двухфазной загрузке, что позволяет вредоносному коду, внедренному во втором запросе, выполняться даже при отключенном параметре `trust_remote_code`. Это подвергает риску CI/CD-процессы, контейнеры и корпоративные сервисы инференса.

AI · 2 мин чтения

Один счетчик на шлюзе скрыл суточный сбой работы ИИ в продакшене

Моя ИИ-функция не работала целый день. Метрика показывала, что всё в порядке. Вчера моя система дронов зафиксировала четыре объяснения ИИ. Защитный шлюз отклонил все четыре. И это меня порадовало...

AI · 2 мин чтения

Крошечные MCP-серверы на бесплатном тарифе отдают Markdown, используя всего 1–2 мс процессорного времени на Cloudflare

Наши тесты показывают, что read-only MCP-сервер, обрабатывающий вызовы list и get_article, использует всего 0–2 мс процессорного времени на запрос, оставаясь значительно ниже лимита бесплатного тарифа Cloudflare, однако любой парсинг «на лету» быстро упрется в потолок в 10 мс.

AI · 3 мин чтения

Hermes Agent снижает риски утечки данных, обеспечивая локальное выполнение инструментов ИИ

Hermes Agent стирает грань между чат-ботами и программируемыми помощниками, позволяя разработчикам интегрировать shell-команды, операции ввода-вывода файлов и пользовательские сервисы, сохраняя при этом контекст между сессиями — и всё это на собственном оборудовании.

AI · 3 мин чтения

First Demo Satellite Set for Late 2027 to Deliver Up to 1 Tbps Downlink

EON’s 20-satellite low-Earth orbit constellation will use high-powered lasers and weather-diverse ground stations to deliver terabit-scale links on high-value routes like France-Australia, aiming to give AI-heavy customers dedicated, low-latency capacity.

AI · 4 мин чтения