DeepMind 将 7,500 个合成视频片段转化为拥有 140 亿参数的多任务视觉模型
该模型基于阿里巴巴的 Wan2.1 架构构建,通过极小的 Blender 渲染数据集学习深度、法线、分割和 3D 姿态,在仅需极少量训练数据的情况下,其性能已能媲美甚至超越专用系统。
AI、机器学习与 LLM 洞察。
该模型基于阿里巴巴的 Wan2.1 架构构建,通过极小的 Blender 渲染数据集学习深度、法线、分割和 3D 姿态,在仅需极少量训练数据的情况下,其性能已能媲美甚至超越专用系统。
这款全新的多模态模型能够读取图像、视频片段和复杂文档,并生成代码,使其能够胜任全栈开发、高级分析和办公工作流自动化。
LongStraw 的 branch-replay 技术通过在不同的 rollout 分支中缓存共享的 prompt 前缀并进行重放,而非重新计算并仅对差异部分进行反向传播,从而使长上下文强化学习(RL)的计算量降低了 8 到 16 倍。
该仓库包含基于 Rust 的测试框架、终端 UI 和工具层,但不包含模型权重,因此用户必须自行提供模型。虽然禁用了 Issue 和 Pull Request 从而限制了社区贡献,但仍允许开发者审计数据处理代码。
在这项实验中,Codex 起草了项目计划,编写了 18 个源文件(总计约 2,500 行代码),管理了 Git 仓库,构建了 DOS 可执行文件,并独立完成了 Bug 修复——人类的参与仅限于定义目标、提交 Bug 报告和进行游戏测试。
实验发现,使用客观红线条件的智能体平均仅在 3.3 次迭代后便停止,而依赖自我判断的智能体在未完成任务的情况下达到了 8 步的硬性限制,导致了循环浪费和结果错误。
RAG 系统中的阈值陷阱。硬编码的相似度阈值是危险的。我的 RAG 系统使用了 0.50 的默认阈值。如果余弦相似度低于这个数值……
这五款 VLA 模型——RT-2、OpenVLA、GR00T、LeRobot 和 Pi-Zero——结合了摄像头画面、自然语言指令和电机输出,使机器人能够直接根据口头指令采取行动,而非执行预设的步骤序列。
TELUS 的试点项目通过测量基准指标、测试多种 AI 结对编程工具并追踪周期时间的缩短,证明了规范化的应用可以将常规的代码生成工作转化为价值数百万美元的效率引擎。
Anthropic 大幅收紧 Claude Fable 5 的使用限制,并将 Pro 用户转向 API。Anthropic 正在对其高需求 Claude Fable 5 模型的访问方式进行重大调整,并引入了更严格的...
At the Shanghai World AI Conference, Moonshot AI introduced Kimi K3—a 2.8-trillion-parameter mixture-of-experts model released with fully open weights, positioning China as a rival source of high-capacity AI beyond US-controlled APIs.
Bionic 提供与模型无关的接口、内置的智能体原语,并与 LM Studio 的 IDE 直接集成,使开发者能够针对任何兼容 OpenAI 或本地托管的模型进行助手的原型设计、测试和发布。
Mozilla 的分析显示,单个 Token 的成本降低了 50 倍,且性能差距正在缩小,这促使开发者因其更低的成本、更快的迭代速度以及合规性优势,而更青睐开放权重模型。
智能体成本漂移:隐形税收。我运行着一个每天撰写两篇文章的 AI 智能体。为了避免主题重复,该智能体在开始工作前会先读取一份工作日志文件。这个文件会……
In a side-by-side test, GPT-5.6-SOL solved a probability problem, a pulley-inertia scenario, and a tangled Python backpack script, while Kimi K3 hit token limits or timed out, delivering no usable output.
在一项对比测试中,GPT-5.6-SOL 在相同的 Token 上限内完成了三项复杂的数学、物理和编程挑战,而 Kimi K3 则因反复触及 Token 上限并超时,导致开发者无法获得最终答案。
Match Group对1000名18-39岁的美国成年人进行的调查显示,近一半的人对浪漫关系中的AI持怀疑态度。然而,尽管用户存在担忧,Bumble、Tinder和Hinge仍通过引入机器人、削减人力成本以及推出全新的纯AI平台来加速布局,押注于算法驱动的配对技术。
Vertu’s new Alphafold pairs a Hermes AI agent, capable of multi-step workflow automation, with a calfskin-wrapped, titanium-accented shell—yet its internal chassis mirrors the $1,100 ZTE Nubia Fold, raising questions about the true value of its luxury price tag.
对 MCP、A2A 和 ACP 协议的 2026 年审计发现了 35 个规范错误,以及在链式调用时产生的 30 个额外故障,这表明单个受损的智能体可能会悄无声息地泄露数据。研究人员建议采用防篡改账本、最小权限令牌、内容标签、加密追踪 ID 以及
Claude Code 会在原始提示词触达 API 的瞬间记录 Token。这意味着,当 MCP 清理步骤执行时,计费器已经计算了原始文本、工具调用以及清理后的版本,从而导致你的费用直接翻了三倍。
该视频的传播在网络上引发了分歧:有人发现了深度伪造的破绽,而另一些人则认为,只要存在 AI 操纵的可能性,任何视频都变得不可靠,这揭示了当今检测技术的盲点。
新的训练园区让 Digit 能够练习从搬运周转箱到卸载整车挂车等各类任务,将零散的现场测试转化为可重复、高吞吐量的流水线,从而大幅缩短软件更新与车间部署之间的滞后期。
芯片制造商正将晶圆产能转向 AI 数据中心所需的高带宽内存,从而削减了廉价手机所使用的标准 RAM 供应。由此引发的成本上涨迫使印度入门级智能手机价格上涨高达 68%,并导致 15,000 卢比以下机型的出货量下降了 45%。
该系统在不同地区和设备上对每个提示词运行 7-8 次,并计算置信区间,结果显示 ChatGPT、Claude、Gemini 等工具中的品牌提及会随查询内容的不同而剧烈波动。