Moonshot AI 发布 2.8 万亿参数的 Kimi K3,但无法在个人电脑上运行
Moonshot AI 于 7 月 27 日开放了拥有 2.8 万亿参数的模型 Kimi K3 的公开下载,但其硬件需求需要企业级 GPU 集群,导致普通开发者目前无法在本地运行该模型。
AI、机器学习与 LLM 洞察。
Moonshot AI 于 7 月 27 日开放了拥有 2.8 万亿参数的模型 Kimi K3 的公开下载,但其硬件需求需要企业级 GPU 集群,导致普通开发者目前无法在本地运行该模型。
该新工作流将 LLM 仅用于决策,而由确定性的沙箱脚本负责所有计算,从而提供逐步可验证的结果,并大幅减少了困扰单提示词 EDA(探索性数据分析)的虚假统计数据。
在一项涉及67名参与者、为期四周的实验中,麻省理工学院(MIT)的研究人员让一个准确率极高的AI对新闻内容进行是非判断。尽管该AI在大多数情况下判断正确,但研究发现,过度依赖AI的用户在失去AI辅助时,其识别虚假信息的能力会出现明显下降。
Google 的 Gemini 按 768 像素的图块计算图像 Token,每个图块收费 258 个 Token。通过将图片保持在一个图块以内,或者将图片用于处理数学公式、表格或非拉丁语系脚本等密集数据,开发者支付的费用通常远低于以文本形式发送相同信息。
在波哥大峰会上,AWS 推出了 Bedrock AgentCore。这是一个集成了编排、可观测性和安全控制功能的统一平台,使开发者无需构建自定义的底层架构,即可快速部署专业的 AI Agent。
Claude Code 的交互轮次中 75% 是在阅读。大多数人认为 AI 编程代理的时间都花在编写代码上,但新数据表明事实并非如此。Red Hat 分析了 219 个真实的 Claude Code 会话。T…
在经历了数周无声的状态丢失后,作者尝试了 SQLite、原始对象存储以及一种失效的混合方案,最终采用了带有基于 ETag 条件写入的版本化封装——这种原子更新循环能够防止并发覆盖并恢复系统的可靠性。
Claude 提示词缓存静默失败。你的 Claude 提示词缓存可能正在失效,而你却浑然不知。我在一个 WhatsApp 处理程序中添加了缓存控制。我查看了日志,发现……
对于 5 分钟或 1 小时的 TTL(生存时间),新的缓存写入成本为基础价格的 1.25 倍或 2 倍,但随后的每次命中仅按 0.1 倍计费。通过预先加载不可变的上下文,深度对话将变为一次性支出。
在 r/technology 等子版块进行的早期试点中,Reddit 的 AI 驱动审核将新发帖者的活跃度提升了 22%,同时使被标记的垃圾内容和骚扰内容的比例保持稳定,这表明该模型可以在不牺牲安全性的情况下降低准入门槛。
Ollama RC 更新:Qwen3.5 与流式传输修复。Ollama v0.32.6 rc0 已发布。它为 Apple GPU 用户带来了更新并修复了流式传输问题。Apple 用户的新功能:MLX 增强……
通过将检索到的文本转换为实体与关系图谱,GraphRAG 使模型能够跨多个文档进行推理;同时,三层上下文记忆通过存储短期对话、长期用户事实以及经过选择性修剪的数据,确保在页面刷新或开启新标签页后依然能够保留记忆。
编排器的子智能体继承了父级设置,默认调用昂贵的 Opus 模型,每次调用都会重写缓存,并陷入无休止的循环直到审核员批准,导致一个简单的任务最终演变成耗费数百万 Token 的巨额开支。
DiffusionGemma 将传统的从左到右的 token 循环替换为 256 token 的扩散块,通过并行方式对整个数据块进行去噪。该方法降低了实时 AI 智能体的延迟,但在 AIME 基准测试中的得分从 88.3 降至 69.1,且在处理短提示词时表现欠佳。
通过将客户端刷新间隔从 30 秒延长至 15 分钟,Neon 数据库可以进入足够长的空闲状态以实现缩减至零,从而消除了此前导致 Vercel 成本仪表板数据激增的按秒计费计算成本。
Wiz Research 发现,一个恶意的 project_settings.json 符号链接可以诱导六款主流 AI 编程工具直接向 ~/.ssh/id_rsa 写入内容,且审批对话框仅显示符号链接的名称,而非真实的路径。
该新指南概述了七大架构支柱——权限、边界、模式、故障检测、状态、回滚和可审计性——在任何自主智能体交付之前,必须从零开始重建这些支柱;同时警告称,低价值的任务并不值得投入如此大的精力。
Grab 的 AI 套件——包括 Turbo Mode 路由、Predictive Matching 和 Mai 商户助手——将配送时间缩短了高达三分之一,使司机收入增长了 23%,餐厅销售额增长了 15%,同时平台的营业利润飙升 186%,达到 1900 万美元。
作者构建了一个静态查找表,根据任务的模糊程度将其映射到 Haiku、Sonnet 或 Opus 模型,并增加了一个“两次失败后升级”的规则。在四周的时间里,该系统在保持质量的同时,将 API 支出降至原有的 65%,并将中位响应时间从 42 秒缩短至 27 秒。
FaceHugger 漏洞利用了两阶段加载过程中的竞态条件,使得即使在禁用 `trust_remote_code` 的情况下,注入在第二个请求中的恶意代码也能运行,从而威胁到 CI/CD 作业、容器及企业级推理服务的安全。
我的 AI 功能停摆了一整天,但指标却显示运行正常。昨天,我的无人机系统记录了四个 AI 解释,而安全门控拒绝了所有四个。对此,我感到很欣慰……
我们的测试显示,一个处理 list 和 get_article 调用的只读 MCP 服务器,每次请求仅消耗 0-2 毫秒的 CPU,远低于 Cloudflare 的免费层级限制,但任何即时解析操作都会迅速触及 10 毫秒的上限。
Hermes Agent 通过允许开发者接入 shell 命令、文件 I/O 和自定义服务,弥合了聊天机器人与可编程助手之间的鸿沟,同时支持在用户自有硬件上进行跨会话的上下文存储。
EON的20颗低轨卫星星座将利用高功率激光和具备多样化天气适应能力的地面站,在法国至澳大利亚等高价值航线上提供太比特级链路,旨在为AI密集型客户提供专用、低延迟的网络容量。