Google 和 Anthropic 警告:ReAct 智能体可能会耗尽云端预算
ReAct 循环允许模型自主选择步骤,但每一个“思考-行动-观察”周期都会增加一次推理费用,从而导致延迟叠加,并增加了因单次误读而导致整个任务失败的可能性。
AI、机器学习与 LLM 洞察。
ReAct 循环允许模型自主选择步骤,但每一个“思考-行动-观察”周期都会增加一次推理费用,从而导致延迟叠加,并增加了因单次误读而导致整个任务失败的可能性。
Swarm 模式通过一个不断相互评判的扁平化对等代理网络取代了单一的监督者,但每一次交互都会触发一次独立的模型调用,从而大幅增加了计算成本和延迟。
该智能体能够重写查询、判断是否需要搜索、将复杂问题分解为子步骤,并在证据不足时进行自我修正,同时为每一项结论提供引用,并大幅降低 Token 使用量。
这项自愿加入的服务为一小部分美国创作者提供了一个仪表板。在创作者通过 Jumio 完成繁琐的自拍和身份验证后,该仪表板会列出任何被 AI 标记为与其已验证面部特征相匹配的视频或图像。
通过使用内容寻址哈希取代 URL 查询,COS API 允许任何站点请求其已知 SHA-256 哈希的文件,从而让浏览器能够向多个源提供相同的 33 GB AI 模型,而无需重复下载。
这一改进后的工作流会抓取曝光量 >500、点击量 <50、点击率 <1% 且排名 >20 的查询词,随后利用 Llama 3 生成标题,并使用 Claude 3.5 Sonnet 撰写全文草稿。在将单篇文章成本控制在 5 美分以下的同时,实现了 15% 的自然曝光增长。
在你的模型出错之前,你的评估框架会先骗你。评估计分板显示两个引擎都失败了:Llama3.2 在 6 个案例中失败了 5 个,Anthropic Sonnet 则在 6 个案例中全部失败了……
该新型架构能够单次处理包含数千个氨基酸的完整链,在保留长程相互作用的同时,使海量序列语料库的训练变得更快、成本更低。
新的 x402 协议在每个 HTTP 请求中嵌入支付令牌,使 AI 智能体能够针对数据、计算或 API 调用自动扣除费用。AWS 的 Bedrock 集成方案(称为 AgentCore Payments)通过引入内置钱包和支出上限,实现了无缝的机器商业。
WebMCP 通过 React 组件在挂载时注册的类型化工具调用清单,取代了脆弱的 DOM 抓取技术,从而为 Chrome 149+ 版本中的 AI Agent 提供即时且与布局无关的交互体验。
在红杉资本 (Sequoia)、Felicis、Optum Ventures 和 Y Combinator 的支持下,Bunkerhill 计划试点推出其 Carebricks 智能体——这种软件能够提取 EHR 数据、下达化验订单并更新护理计划,旨在减轻临床医生处理常规协调任务的负担。
SEED 框架增加了一个回合后处理环节,让智能体阅读自己的对话记录,编写自然语言经验,并将其提炼为策略更新——从而将稀疏的奖励信号转化为丰富且可重复使用的训练信号。
MCP 第 2 版将于 2026 年 7 月 28 日上线,通过移除初始化握手、Mcp-Session-Id 请求头以及三个遗留子系统,使协议实现了完全的无状态化。团队现在可以在自动扩缩容或无服务器 Pod 上运行,且不再受会话亲和性约束。
Inferentia2 INF2.24xlarge 复现了与 CPU 参考模型完全一致的 Token 流,但两次运行所输入的提示词均格式错误,缺少对话模板和轮次标记,导致 Gemma-4 进入了无意义内容的无限循环。硬件仅仅是复现了参考代码中的一个 Bug。
通过添加一个记录模型名称、Token 数量、任务类型和单次调用成本的 PostgreSQL 日志层,研究员发现原始的 SEC 搜索结果导致了 Prompt 膨胀。通过对这些结果进行总结,并将简单的检查任务路由到更便宜的模型,最终实现了 31% 的成本节约,并提升了准确率。
该贷款以 SambaNova 的 SN50 推理芯片作为抵押品,这是一种首创的资产类别,与传统的 GPU 集群相比,它能实现高达 16 倍的 Token 处理速度提升,且功耗更低、冷却更简单。
Torvalds 在邮件列表中表示,任何反对像新的 Sashiko 审查器这类 AI 工具的人,都可以直接 fork 内核,这进一步强调了他的观点:技术价值高于意识形态的抵制。
该仓库提供了 CLI、终端 UI 和运行时的 Rust 源代码,让你可以深入了解上下文是如何组装、工具是如何编排以及编辑是如何管理的,甚至可以在不中断工作流的情况下更换底层模型。
Moonshot AI 的 Kimi K3 是一个拥有 2.8 万亿参数的开放权重模型,在真实的 AA-Briefcase 基准测试中得分超过了 GPT-5.6。该模型现已通过 API 提供,权重预计将于 7 月 27 日公开。
最新版本引入了任务编排、审批工作流、测试套件以及具备 UI 感知能力的浏览功能,使 AI 能够自主挑选任务、运行智能体、获取人工确认并交付视觉预览——所有操作均可在单一控制台中一站式完成。
该服务目前仅面向美国开发者开放,每百万输入 Token 收费 1.25 美元,每百万输出 Token 收费 4.25 美元;新账户可获得 20 美元的赠送额度,国际用户需加入候补名单。
这个在 2021 年学会预测医生的脓毒症模型,密歇根医学中心对其进行了测试。他们分析了 38,455 次住院记录。Epic 声称其准确率很高……
PrismML’s Bonsai 27B shrinks from a 54.7 GB full-precision model to a 3.9 GB 1-bit file, fitting on a flagship iPhone while retaining 89.5% of its quality. The claim relies on Apple’s MLX stack and delivers about 11 tokens per second, but memory, heat and battery impacts remain unmeasured.
OpenAI 的内部 GPT-Red 模型使 GPT-5.6 Sol 系列的失败率降低了六倍,但研究论文仅停留在理论层面,并未提供可下载的测试框架,这使得小团队不得不自行开发确定性测试。