多年来,科技政策圈的一个基本假设非常直接:没有 NVIDIA 芯片,就没有前沿 AI。对 H100 及更新的 Blackwell 系列等高端 GPU 的出口管制,正是围绕这一瓶颈设计的。理论认为,切断获取顶级硅片的途径,就能减缓一个国家训练规模最大、能力最强模型的进程。美团刚刚戳穿了这个谎言。

这家以主导外卖和本地生活服务而闻名的中国科技巨头发布了 LongCat 2.0。这是一个基于 Mixture-of-Experts 架构的 1.6 万亿参数模型。关键在于?该团队完全使用国产芯片进行了训练。没有 NVIDIA H100,没有 Blackwell GPU。美团并没有将其隐藏在 API 之后,而是将权重、训练代码和完整的训练流水线(data pipeline)都发布到了 GitHub 上,供任何人查阅。

LongCat 2.0 究竟带来了什么

我们先来看看与硬件无关的事实。凭借 1.6 万亿的参数量,LongCat 2.0 位列有史以来发布的最大的开源权重模型之列。参数量虽不是衡量质量的唯一标准,但在这种规模下,它们预示着宏大的工程雄心。由于采用了 Mixture-of-Experts 设计,在处理任何给定任务时,只有一部分参数会被激活。这使得推理成本不会失控飙升,同时仍能让模型存储极其广泛的知识和推理模式。

上下文窗口达到了 100 万 token。这与 OpenAI 和 Anthropic 的高端产品旗鼓相当,并改变了模型的实际应用能力。拥有如此大的窗口,你可以在单个提示词(prompt)中输入完整的法律合同、数月的聊天记录或庞大的代码库。对于构建需要跨长文档记忆的应用的开发者来说,这不仅仅是边际改进,而是功能上的必然需求。

其次是开放性。美团没有发布一个经过阉割的演示版或受限的 API。模型权重是可用的,训练代码是公开的,流水线也是如此。这对于想要复现结果的研究人员、需要审计行为的企业,以及需要在不向第三方服务器发送任何数据的情况下利用私有数据微调模型的工程师来说,至关重要。

被所有人忽略的硬件故事

这里的头条新闻不仅仅是参数量,更是底层的芯片。LongCat 2.0 是在国产加速器上训练的,特别是像华为 Ascend 系列这样的芯片。这与直接将现有框架套用在 NVIDIA 集群上并点击运行有着本质的区别。

训练万亿参数模型需要解决处于极端边缘的分布式计算问题。内存带宽、芯片间通信和浮点性能都必须以极高的精度进行管理。NVIDIA 的优势从未仅仅在于原始的 GPU。它在于 CUDA 生态系统、优化的内核(kernels),以及如何从这一技术栈中榨取性能的集体经验。在 Ascend 硬件上构建一个同级别的模型,意味着美团的工程师必须完成极其艰巨的工作:适配训练框架、重写底层操作,并在一种根本不同的架构上调试分布式训练运行。

他们的成功预示着比单一模型更深远的影响。这表明中国的软硬件协同设计正在趋于成熟,以至于西方芯片的缺失不再是一个硬性障碍。它是一个约束,而且是一个昂贵的约束,但并非不可逾越的屏障。

实际表现如何

LongCat 2.0 在中文推理、数学和长上下文检索方面表现强劲。这些都是特定的、高价值的基准测试。数学推理测试模型处理逻辑和符号操作的能力。长上下文检索测试模型是否能在百万 token 的“大海捞针”中准确找到信息而不迷失方向。同时通过这两项测试,是“听起来很聪明”的模型与“真正能干活”的模型之间的区别。

美团将其定位为 Llama、DeepSeek 和 Qwen 的直接替代方案。对于中文任务而言,这种竞争尤为激烈。主要在英文互联网数据上训练的模型,在处理文言文引用、当地监管语言、中国大陆市场的金融术语以及主导中文社交媒体的非正式缩略语时,往往会显得力不从心。一个拥有深厚中文能力、且由一家核心业务植根于中国消费者行为的公司所构建的模型,在这些场景中具有结构性优势。

这不仅仅关乎聊天机器人。分析中国合同法的法律科技公司、解析历史文献的研究人员、处理普通话贷款文件的银行,以及处理地方方言的客户服务平台,都需要能够理解细微差别,而非通过“以英语为中心”的视角进行翻译的模型。

美团的隐藏武器:规模与数据

美团并不是一家顺便做外卖应用的科研机构。它是一个运营巨头,每天协调着中国数以百万计的外卖骑手、餐厅和商家。这种规模产生了一股海量的现实世界语言数据:流向聊天机器人的客户投诉;融合了地域俚语与正式商业注册详情的餐厅描述;将地址系统与非正式地标混合在一起的配送指令;以及涉及税务、卫生法规和地方条例的商家服务工单。

这些数据是杂乱的、具有上下文关联的,并且具有通用网络爬虫数据无法复制的深度本土化特征。将这些数据喂给 LongCat 2.0,能为模型提供纯学术训练所缺乏的实际应用基础。在精炼的维基百科文本上进行训练是一回事,而在混乱、事务性的实际商业语言上进行训练则是另一回事。

为什么格局正在发生变化

如果企业能够在国产芯片上训练出前沿级别的模型,那么芯片出口禁令背后的整个战略逻辑就开始动摇。禁令建立在一个前提之上,即控制 NVIDIA 的供应链就能控制 AI 能力。而这个前提假设了不存在可行的替代生态系统。

LongCat 2.0 并不代表中国芯片在所有指标上都已赶上 NVIDIA。它证明了它们不需要做到完美匹配也能完成任务。足够的显存、足够的带宽以及足够智能的软件优化,就可以缩小差距,从而产生具有竞争力的结果。这比实现完全对等的要求要低得多,而且这一门槛似乎已经被跨越了。

对于全球 AI 供应链而言,其含义显而易见。所有严肃的训练任务都必须通过 NVIDIA 硬件进行的假设现在已经破灭。这使得权力向 AI 开发的国家主权倾斜。在旁观的国家和公司不再认为单一的“卡脖子”供应商是通往前沿能力的唯一路径。他们看到了分化,以及一个可能比大多数人预期的出现得更快的、多极化的硬件格局。

真正的启示

LongCat 2.0 不仅仅是一个技术发布。它是一场政治假设的测试,而这个假设刚刚失败了。美团证明了,一家拥有正确数据、正确工程团队和正确硬件的消费科技公司,可以在不触碰任何一个被禁用的西方 GPU 的情况下,训练出一个拥有 1.6 万亿参数的开源模型。

对于开发者来说,这意味着一个在中文语言和长文本任务方面具有真正深度的全新开源权重选项。对于政策制定者来说,这意味着基于硬件封锁的制裁必须考虑到“适应性”,而不仅仅是“获取能力”。对于行业其他参与者来说,这意味着“谁能用什么工具构建什么”的版图正在实时重绘。

出口禁令或许争取了时间,但它们似乎也催生了一个替代方案。