OpenAI 正在超越简单的聊天机器人,致力于构建能够管理多步骤数字工作流的自主 AI 智能体(agents)。它已推出了首款此类智能体——ChatGPT Work,这是其消费者订阅服务的一项每月 20 美元的附加组件。该服务承诺充当数字协作伙伴,从收件箱、Slack、Notion 及其他工具中提取数据——这一能力可能会重塑知识工作者的一天。

转向“智能体化”(agentic)AI 的原因

传统的语言大模型在回答问题后便会停止。“Agentic AI”描述的是能够自主决定做什么并随后执行的系统——例如发送电子邮件、更新电子表格或在 Figma 中绘制设计草图,而无需人类点击每一个按钮。OpenAI 的工程师表示,这额外的一步将对话式助手转变为生产力伙伴,对于那些在不同应用程序之间频繁切换会消耗计费工时的职业来说尤其如此。

从开发者扩展到整个办公室

智能体 AI 最显著的成功体现在软件工程领域。OpenAI 的 Codex 模型允许开发者用自然语言描述需求,然后生成代码,从而有效地实现了语法抽象。一项由公司支持的研究显示,虽然 OpenAI 的几乎每位员工都使用了 Codex,但外部订阅者中只有不到百分之一的人在使用。ChatGPT Work 旨在为会计师、医生、投资者和其他非技术专业人士带来同样的“描述需求”体验。其目标是用简单的文本提示词取代命令行界面和自定义脚本,从而能够浏览传统网站、从不同的 SaaS 产品中提取数据并将结果整合在一起。

隐私与控制担忧

为了发挥作用,智能体必须能够看到人类能看到的信息:私人邮件、即时消息对话、内部文档和设计文件。批评人士警告称,赋予 AI 这种程度的可见性会创造新的攻击面——一旦模型遭到破坏,可能会导致机密数据外泄,而且用户可能无法完全理解其信息是如何被用于生成回复的。OpenAI 团队承认这种风险,但表示这种权衡是不可避免的;如果没有深度集成,智能体就无法完成用户要求的任务。

来自垂直领域专家的竞争压力

OpenAI 并非唯一押注自主智能体的参与者。一些规模较小的公司已经推出了专注于单一职业的工具——有的品牌针对律师,有的针对销售团队。这些产品采取了“模型无关”(model-agnostic)的方法:它们会根据特定领域的最佳表现来切换语言模型,而不是绑定在单一供应商的技术上。这种灵活性使它们能够保持精简并快速迭代。对于 OpenAI 而言,挑战在于如何打造一个“一通百用”的解决方案,同时让它感觉像专业应用一样量身定制,否则企业可能会选择更窄但更成熟的替代方案。

长时间运行智能体背后的经济动机

智能体生成的每一个 token(无论是单词还是代码片段)都会消耗 OpenAI 的计算资源,公司根据 token 使用量向用户计费。当智能体运行一个持续数分钟、调用多个 API 并生成最终报告的工作流时,与单次提问的聊天相比,token 数量会大幅攀升。这推动了更高的单用户收入,尤其是对于保持 $20 附加组件激活状态的订阅者而言。其商业逻辑取决于将服务扩展到庞大的用户群;每天依赖智能体的专业人士越多,产生的收入流就越大,从而能够支撑对计算集群和模型训练的大规模投资。

后续关注点

  • 采用指标 – 早期的使用数据将显示非技术用户是否能够克服学习曲线,并将敏感任务托付给智能体。
  • 隐私保护措施 – 任何端侧推理(on-device inference)或更强权限控制的推出,都可能改变企业买家的风险收益平衡。

总结

OpenAI 将 ChatGPT 转型为主动协作伙伴的举措可能会重新定义办公生产力,但这条道路充满了隐私担忧、巨大的采用鸿沟以及已经占据利基市场的竞争对手。成功与否将取决于能否说服广泛的专业人士:其带来的便利和收入增长潜力,足以抵消将数字生活的深度访问权交给 AI 所带来的风险。