美团扔出一颗 AI 核弹: 1.6 万亿参数,代码能力碾压 GPT
6 月 30 号晚上,我打开 OpenRouter ,发现排行榜上冒出一个陌生的名字——Owl Alpha。
它没有公司 logo ,没有产品页面,没有任何说明文档。就像一个蒙面侠客,悄悄杀进了全球前三。
没人知道它是谁的模型。
直到 7 月 5 号,美团揭开了面纱。
一个外卖公司,偷偷搞出了最强大模型?
LongCat-2.0 ,美团出品。
总参数 1.6 万亿, MoE 架构,激活参数只有 480 亿。
什么概念?参数规模比 GPT-5.5 的竞品更大,但推理成本却更便宜。这就像一台 V12 发动机,平时只开 4 个缸,需要的时候再全功率爆发。
更让人意外的是,它是业界第一个在 5 万卡国产算力集群上完成全流程训练的万亿参数模型。
不是英伟达 A100 ,不是 H100。是国产芯片。
这个故事,远比想象的精彩。
5 vs 58.6 :一场代码能力的无声绞杀
数据不会撒谎。
SWE-bench Pro ,目前最接近真实工程场景的编程评测——它测试的可不是 LeetCode 刷题,而是解决 GitHub 上真实 Issue 的能力。
LongCat-2.0 的成绩:59.5 分。
GPT-5.5 : 58.6 分。 Claude Opus 4.6 : 57.3 分。 Gemini 3.1 Pro : 54.2 分。
换句话说,一个外卖平台的大模型,在写代码这件事上,把 OpenAI、Anthropic 和 Google 全部按在地上摩擦。
SWE-bench Multilingual 多语言编程评测也达到 77.3 ,与 Claude Opus 4.6 ( 77.8 )几乎持平。差距不到 0.5 分。
这不是侥幸,是硬实力的碾压。
两个杀手锏,让 1M 上下文不再是个噱头
大模型圈里,人人都在喊"百万 token 上下文"。
但真正能用起来的,屈指可数。
LongCat-2.0 的秘密武器有两个。
第一,LongCat Sparse Attention ( LSA )稀疏注意力机制。传统 Transformer 处理长文本时,计算量是平方级增长。LSA 把这个曲线压成了线性——处理 100 万 token 就像处理 1 万 token 一样轻松。
第二,Zero-Compute Experts (零计算专家)。
这是业界首创的技术。简单来说,每个 token 不是无差别激活所有专家,而是让"简单 token 不消耗算力,复杂 token 自动激活更多专家"。
你可以把它理解成一个聪明的团队领导——小事实习生干,大事全体出动。不浪费一丝一毫的计算资源。
匿名上线,偷偷登顶
最骚的操作在这里。
LongCat-2.0 的预览版,以**"Owl Alpha"**的名字匿名上线了 OpenRouter 平台。
没有任何宣传,没有任何品牌背书。
结果呢?
上线不到一周,总调用量冲进全球前三。
在 Hermes 平台的月调用量,全球第一。
Claude Code 调用量,全球第二。
OpenClaw 调用量,全球第三。
开发者们用脚投票。他们不知道这是美团的模型,但他们知道——这玩意儿好用。
MIT 协议开源,没有任何限制。 权重、推理代码、技术博客全部公开。
HuggingFace、GitHub、ModelScope ,一键下载。
外卖、骑手、大模型?
很多人会问:美团一个送外卖的,搞大模型干嘛?
这个问题本身就错了。
美团每天的即时配送订单超过6000 万单。背后是全世界最复杂的实时调度系统。骑手路径规划、商家出餐预测、用户需求匹配——每一个环节都需要极致的算法优化。
他们做 AI ,不是跨界,是深水区的自然延伸。
而且你注意到没有——LongCat-2.0 是在国产算力上训练的。
当别人还在排队抢英伟达的显卡,美团已经在国产芯片上跑通了万亿参数模型的全流程。
这才是真正的"核弹"。
不是技术参数,是战略纵深。
封面高亮关键词: 1.6 万亿参数, 碾压 GPT


