产品上新

美团 LongCat 揭晓 Owl Alpha 真实身份:OpenRouter 全球日调用量 Top 3,Hermes/Claude Code/OpenClaw 三大 Agent 场景月调用量均登顶

美团 LongCat 揭晓 Owl Alpha 真实身份,日调用量 OpenRouter 全球 Top 3,Hermes/Claude Code/OpenClaw 三大 Agent 月调用量均登顶。

2026年6月30日 · 周二深度报告中置信重要度 4/5
#美团#LongCat#Owl Alpha#OpenRouter#Hermes Agent#Claude Code#OpenClaw#Agent 调用量+1

本文要点

  • 从『国产模型在 OpenRouter 有稳定调用量』到『以匿名身份冲进全球 Top 3』:Owl Alpha 的全球 Top 3 是国产模型在 OpenRouter 上的最高位次
  • 从『通用 benchmark 跑分』到『agent 工具调用』:Owl Alpha 在三大 agent 场景月调用量均登顶,意味着国产模型在真实 agent 工具中被开发者主动选择
  • 从『官方直接发布』到『匿名测试 → 验证 → 揭晓身份』的产品节奏:Owl Alpha 的匿名上线 → 全球 Top 3 → 官方揭晓 → 退役,这一节奏为后续国产模型提供了新的产品发布范式

阅读辅助

先看数字、证据和来源,再读正文。

全球 Top 3Owl Alpha 在 OpenRouter 日调用量排名
第 1Hermes Agent 月调用量排名
4 条 Claim Audit

Owl Alpha 是美团 LongCat 团队自研模型,此前以匿名身份在 OpenRouter 出现并冲进全球日调用量 Top 3

4 个时间点

2026 H1(具体日期待考) · Owl Alpha 以匿名身份出现在 OpenRouter 平台;社区观察者注意到该模型在调用量榜单上异常突出,但身份归属不明

6 个来源5 个非 X 来源

2026 年 6 月 29 日,美团 LongCat 团队在官方 X 账号推出一条信号密度极高的揭晓:此前在 OpenRouter 上以匿名身份出现的『Owl Alpha』正是美团 LongCat 团队自研模型。Owl Alpha 上线以来 日调用量冲进全球 Top 3,并分别在 Hermes Agent(第 1)、Claude Code(第 2)、OpenClaw(第 3)三大 Agent 场景的月调用量排名中均登顶前三。同时,Owl Alpha 即将退役,后续有新模型在路上

这条揭晓把国产大模型的发布节奏推到了一个新品类——匿名上线 → 真实调用量验证 → 官方揭晓身份 → 退役 → 新模型接棒。本文不重复一遍数字,而是按这条时间线拆解三件事:揭晓本身的剧情张力三大 agent 场景登顶各自意味着什么这套范式对国产模型后续发布的启示

揭晓之前:OpenRouter 上的『盲测剧本』怎么走到 Top 3

Meituan_LongCat 官方 X 在 2026-06-29 17:18 UTC 揭晓之前,Owl Alpha 已经在 OpenRouter 上以匿名身份跑了一段时间。社区观察者早就在调用量榜单上注意到这个匿名模型异常突出——一个没有品牌背书、没有发布会、没有 benchmark 转发稿的代号,调用量却稳步往上走,直到 日调用量冲进全球 Top 3。这一步是被动达成的:美团没有对外宣称、没有自报 benchmark、没有发动 KOL 转发,流量完全靠 OpenRouter 平台上的真实调用累积。

这个过程的反常之处,值得单独说一说。OpenRouter 是一个模型聚合路由平台,允许模型以代号上线,调用方按价格和实测效果选择、不被厂牌左右——这意味着一个匿名模型,理论上能纯靠输出质量拿到流量,没有任何品牌杠杆可用。Owl Alpha 能在这种『盲测』环境里冲到 Top 3,确实排除了『靠美团品牌刷量』的解释。但盲测也有反面:高调用量可能来自激进的免费额度或低价策略,而非纯粹的质量优势——在美团未公开定价与调用结构之前,『Top 3』里多少是性价比驱动、多少是能力驱动,仍分不清。

揭晓本身的时间点选择,也是有讲究的。Top 3 的位次已经稳了,继续匿名下去,反而有被社区『猜出身份、舆论失控』的风险;而一旦选在位次稳固之后主动揭晓,主动权就完全在美团手里——既拿到了『盲测成绩单』的背书,又避免了在排名未定时的过度解读。这是一次精心排布的产品节奏动作,而不是临时起意的官宣

更重要的是身份揭晓的语气。官方表述没有把『匿名测试 → Top 3』包装成营销事件,而是用一种近乎轻描淡写的方式告诉社区:这个东西就是我们做的。这背后传递的产品自信是——排名本身已经是最好的营销,揭晓只是把最后一块拼图补上。这种把验证交给第三方平台、把揭晓做得克制低调的处理方式,是过去国产大模型发布中很少见的节奏。

揭晓之后:三大 Agent 场景登顶意味着什么

身份揭晓的同时,Meituan_LongCat 官方 X 还披露了一组更细的数字:Owl Alpha 在 Hermes Agent / Claude Code / OpenClaw 三大 Agent 场景的月调用量排名中均登顶前三——Hermes Agent 第 1、Claude Code 第 2、OpenClaw 第 3。

这组数字不能只看三行结论。Hermes、Claude Code、OpenClaw 三个 agent 场景并不是同一类东西,排名背后覆盖的是三种不同性质的 agent 生态:

Agent 场景类型Owl Alpha 排名场景背书逻辑
Hermes Agent通用 agent 框架第 1中立的开源/通用 agent 框架,开发者选择模型完全靠实测,品牌权重极低
Claude CodeAnthropic 官方商业 agent 工具第 2头部商业 agent 工具,默认绑定 Claude 系列,Owl Alpha 能拿到第 2 说明开发者主动切换
OpenClaw开源 agent 框架第 3社区驱动的开源 agent 生态,排名受开发者偏好影响大

三个场景的差异,可以从三个维度拆开看:

第一,生态性质不同——Hermes Agent 是中立的通用 agent 框架,Claude Code 是 Anthropic 自家的商业工具(默认绑定 Claude 系列模型),OpenClaw 是社区主导的开源 agent 框架。Owl Alpha 在三个性质完全不同的生态里都进前三,意味着这种领先不是某一种生态的偏好,而是跨生态的覆盖

第二,竞争烈度不同——Claude Code 场景下,Owl Alpha 拿到第 2 名,而默认模型是 Claude 系列;能在 Anthropic 自家工具的排行榜里压过其他外部模型爬到第 2,说明开发者是主动切换过来的,而不是被动用默认。这种『在对手主场拿下第二』的含金量,比在通用平台拿 Top 3 更值得琢磨。

第三,排名的可比性——Hermes / Claude Code / OpenClaw 三个 agent 场景的月调用量排名,口径(月度累计、按用户数、按 token)未公开,这让三个第几之间不能直接相加。但覆盖面而非单点,才是这组排名最值得注意的地方:不是某一个 agent 场景偶然登顶,而是三种不同性质的 agent 生态都进了前三。

把这三点合起来,得出的判断是:国产模型已经能在主流 agent 框架里被开发者高频调用,而不只是在通用对话场景被试用。agent 工具调用是当前大模型落地的最前沿场景——开发者用 LLM 调用工具、执行任务、自动化流程,这比单纯的对话与文本生成更能反映模型的真实能力。Owl Alpha 在三大 agent 场景均登顶前三,意味着国产模型不只是『在通用 benchmark 上跑分』,而是在『真实 agent 工具调用』中被开发者主动选择。

但这条结论有几道闸门。第一,排名的口径未公开,按 token、按调用次数、按付费额排出来的『第几』意义完全不同;第二,没有 OpenRouter 或第三方机构的独立核对,三个第几名目前只有美团一家口径;第三,agent 场景的调用量并不等同于模型质量,在某些工具调用场景下,响应速度、价格、上下文窗口长度可能比模型本身的理解能力更影响排名。所以这组数字真正能证明的是『Owl Alpha 在 agent 工具生态里有真实使用量』,不能直接外推到『Owl Alpha 是当前 agent 能力最强的国产模型』。

揭晓之后的下一步:从『匿名 → 退役 → 新模型』看产品范式

同一条官方 X 还披露了第三个关键信息:Owl Alpha 即将退役,后续有新模型在路上

这条信息的战略意义是:美团 LongCat 团队不打算把 Owl Alpha 作为长期产品定位,而是把它当作一个匿名测试版本。OpenRouter 平台的匿名模型机制允许厂商先匿名上线,让真实调用量与社区反馈验证产品力,再决定是否正式发布——Owl Alpha 的『匿名上线 → 全球 Top 3 → 官方揭晓 → 退役 → 新模型发布』节奏,为后续国产模型提供了 新的产品发布范式

这套范式的关键设计点有三个。

第一,验证阶段被外包给了一个第三方平台。过去国产大模型发布时,benchmark 通常由厂商自跑、自报、自传播;即使是第三方 benchmark,也是评测机构主动跑出来再被引用。Owl Alpha 的方式是把整个验证过程外包给 OpenRouter——模型好不好用,先由 OpenRouter 上的真实调用数据说了算,而不是发布会的声量。这种『让第三方平台成为 benchmark 的执行者』,在国产大模型发布史上是第一次。

第二,揭晓被推迟到验证完成之后。匿名机制意味着厂商可以在产品力未完全验证时不曝光品牌——一旦位次稳固、Top 3 锁定,再以『成绩单』的方式揭晓身份。这种把揭晓做成『结果公布』而非『产品发布』的节奏,让营销声量被迫退后到产品力之后。

第三,退役被设计成产品节奏的一部分。Owl Alpha 不进入长期产品线,而是作为测试版本退役,继任模型另行发布。这意味着美团不需要为 Owl Alpha 承担长期维护承诺,也不需要把匿名阶段的低价策略延续到正式版本——匿名阶段的所有策略都是测试,可以大胆激进,不必考虑长期口碑

把这三个设计点合起来看,Owl Alpha 留下的不是某一个具体模型,而是一套可被后续国产模型反复借用的发布流程:在 OpenRouter 这类中立聚合平台上匿名上线 → 靠真实调用量拿到第三方验证 → 在位次稳固后揭晓身份 → 退役测试版本 → 用验证过的产品力背书新模型发布。

这种范式对国产大模型行业的启示有两层。

对头部厂商(DeepSeek、智谱、月之暗面):它们已经有稳定的调用量基础,但 Owl Alpha 展示了一种『盲测成绩单』的新背书形态——未来的模型发布,可能会把 OpenRouter 匿名测试 + 真实调用量排名作为前置环节,而不是把 benchmark 发布会作为起点。这会改变厂商发布预算和节奏的分配逻辑。

对中长尾厂商:Owl Alpha 的路径降低了新玩家的进入门槛——不需要发布会、不需要 KOL 矩阵、不需要 benchmark 营销预算,只要模型本身在 OpenRouter 上能拿到流量,就有机会走完一轮『盲测 → 揭晓 → 退役 → 继任』的完整周期。这对那些没有强品牌资源、但有真实模型能力的中小团队,是一个新的产品发布通道。

当然,这套范式也有它的局限。它只对有能力在 OpenRouter 上拿到 Top 3 的模型成立——Owl Alpha 的成功是因为它的输出质量真的能扛住盲测;如果一个模型质量不够,匿名上线只会让它在排行榜上迅速沉底,反而损失品牌曝光机会。所以这条路本质上是强者的捷径,不是弱者的通道。而且匿名阶段的低价/免费策略,会形成用户对价格的预期锚定——继任模型如果定价回归正常,可能面临『比匿名版贵太多』的口碑反噬。

早报观点

Owl Alpha 这次最有意思的地方,不在它冲到了第几,而在它选择怎么出场:先以匿名身份上 OpenRouter,让真实调用量替它说话,排名站稳了才揭晓是美团。这背后是一种信心——敢匿名,就是赌产品力扛得住第三方平台的客观排名。更值得注意的是它折射的趋势:当 OpenRouter 这类聚合平台的调用量排名能直接说话,它正在取代厂商自报 benchmark,成为产品力的新硬通货;Owl Alpha 把这条路走通,后来的国产模型很可能反复借用。

但热闹要按住几分。“Top 3”是按 token、按调用次数还是按付费额排?具体第几、和谁并列,美团没说;三大 Agent 场景登顶前三同样只有官方一句话,缺 OpenRouter 或第三方的独立核对。继任模型的命名、参数、benchmark 也全是空白。

所以更克制的判断是:匿名 Top 3 证明了 Owl Alpha 这一代的产品力,却证明不了美团 LongCat 的持续竞争力。在 DeepSeek、智谱、月之暗面这些长期运营的玩家面前,一次匿名验证只是入场券——能不能站住,要看继任模型接不接得上,而那靠的是持续的训练投入,不是一次漂亮的匿名首秀

Owl Alpha 留给行业的最大遗产,不是某个具体数字,而是那套『匿名盲测 → 第三方验证 → 揭晓身份 → 退役 → 继任』的产品节奏范式——但这条范式本身能不能成为国产大模型发布的标配,要等 DeepSeek、智谱、月之暗面等团队是否跟进,以及 Owl Alpha 继任模型是否能延续这一代的产品力。

接下来看什么

  • Owl Alpha 退役时间表与新模型命名:美团 LongCat 团队何时正式发布继任模型,以及新模型是否会沿用 OpenRouter 匿名测试机制——这是判断『盲测范式』是否被美团内部固化的关键。
  • Owl Alpha 在 OpenRouter 上的真实日调用量数字:具体位次、token 量级、付费金额,以及是否被独立第三方审计——决定『Top 3』这个表述的实际含金量。
  • 三大 Agent 场景月调用量排名的口径与真实性:OpenRouter 平台是否会公开验证、Hermes / Claude Code / OpenClaw 三大场景的具体月度调用量数字——决定这组数字是否能从『美团口径』升级为『行业事实』。
  • 继任模型是否沿用匿名测试:如果继任模型也走 OpenRouter 匿名上线,说明这套范式已经被美团产品化;如果继任模型直接发布,说明 Owl Alpha 只是单次尝试。
  • 国产模型对盲测范式的跟进:DeepSeek、智谱、月之暗面等是否会在后续发布中引入 OpenRouter 匿名测试环节——决定这套范式是『美团特色』还是『行业标配』。
  • 美团 LongCat 团队的长期产品路线图:除了 Owl Alpha 继任模型,美团是否会在 toC / toB / to 内部三个方向推出更多大模型产品——决定美团在国产大模型赛道上是『单点突破』还是『持续投入』。
  • 国产模型在 agent 工具生态的渗透持续性:Owl Alpha 之后的继任模型是否能在三大 agent 场景保持前列,以及是否会被其他国产模型(DeepSeek / GLM / Kimi)在 agent 场景中反超——决定『agent 工具生态渗透』是 Owl Alpha 偶然登顶还是国产模型整体趋势。