智谱认领“牛来”:匿名六天,让全球开发者用掉数十万亿Token

AI观察员热度: 3646

智谱AI确认匿名上线的Ox Alpha大模型为其GLM系列新一代产品,中文名‘牛来’,具备超长上下文、多模态输入及工具调用能力;上线六天内因免费策略引发全球开发者大规模试用,处理Token量达23.2万亿,引发对其算力部署与技术定位的关注。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

猜了近一周以后,神秘模型Ox Alpha终于有了主人。

8月26日,据彭博社报道,智谱AI确认,近期匿名上线的Ox Alpha由其开发,是GLM系列的新一代模型。Ox意为“牛”,恰逢电影《牛来》走红,因此中文开发者社区把Ox Alpha叫作“牛来大模型”。

智谱还表示,将于8月26日晚发布模型权重。

不过,智谱尚未公布Ox Alpha的正式型号、参数规模及其与GLM-5.3的具体关系。

从8月20日匿名上线,到8月26日被智谱认领,六天之内,Ox Alpha已经让全球开发者用掉了数十万亿Token。

牛来

01

免费、匿名,一头“牛”吃掉榜首

8月20日,Ox Alpha以“stealth model”,即匿名模型的身份出现在模型聚合平台OpenRouter。

OpenRouter当时只表示,这是一款由匿名第三方开发和运营的推理模型,主要面向编程、长周期Agent任务和生产环境。

从公开规格看,Ox Alpha拥有104.86万Token上下文窗口,单次最大输出长度为13.1万Token,支持文本、图片和视频输入,以及工具调用和结构化输出。这意味着它可以一次读取大型代码仓库、项目文档和较长的Agent运行记录。

真正引爆使用量的是免费。

模型上线当天,开源AI编程工具OpenCode宣布,Ox Alpha将在一周内免费开放,提供“接近不限量”的调用额度,并称模型提供方准备了每天100万亿Token的服务容量。

100万亿Token相当于平均每秒约11.6亿Token。这个数字让开发者一边涌入测试,一边追问:究竟是哪家公司拥有如此庞大的推理资源?

但100万亿Token是理论服务容量,不是实际调用量,也不能直接等同于已经部署的物理算力。输入和输出Token的计算成本不同,代码Agent还会反复读取相同的代码库和历史上下文。大量缓存复用,可以让平台记录的Token规模远高于实际新增计算量。

截至8月25日,Ox Alpha在OpenRouter最近七天的统计窗口内处理约23.2万亿Token,排名第一;同期 DeepSeek V4 Flash 0731约为11.6万亿Token。Ox Alpha上线不到一周,Token处理量已经达到后者的两倍。

这组数字说明模型获得了大规模尝试,但OpenRouter统计的是Token使用量,不是用户数、请求数、任务成功率或收入;免费模型也天然更容易获得流量。

02

算力疑问

在智谱认领之前,算力一度是反对“模型来自智谱”的主要理由。

社区当时假设,Ox Alpha可能是一款万亿参数级旗舰模型。要让这样的模型免费运行一周,并提供每天100万亿Token的服务容量,需要庞大的芯片集群和电力投入。因此,有人猜测模型可能来自谷歌或微软,也有人提出“智谱模型、大厂托管”的组合。

今年7月,彭博报道称,智谱已经建成一座1GW级国产芯片AI数据中心,并开始部分运营。数据中心通常以电力容量衡量规模,但1GW不等于实际算力,报道也未披露当前启用的芯片数量、IT负载和利用率。同期,智谱完成对异构算力软件公司中科加禾的收购,补充编译器、Runtime和推理引擎能力。

如果这些信息属实,Ox Alpha在不到一周内处理23.2万亿Token,并非完全无法解释。不过,1GW是数据中心的设计供电能力,不是计算性能,其中还包括制冷、供配电和网络设施用电。此前报道也只称数据中心“部分运营”,没有披露实际启用的芯片数量和利用率。

彭博此次确认了模型归属,但没有说明Ox Alpha部署在哪里、使用何种芯片,以及是否存在第三方算力支持。因此,1GW数据中心可以解释智谱为何具备开展大规模压力测试的基础,仍不能验证每天100万亿Token的峰值容量已经实际部署。

03

开发者追着它猜了六天

除了免费和大额度,Ox Alpha的关注度还来自它在编程和Agent任务中的表现。

大量调用发生在Claude Code、Hermes Agent、 DeepSeek Harness 和OpenCode等编程框架内。Stripe CEO Patrick Collison试用后在X上评价称:“非常令人印象深刻。”

一项广泛传播的社区小样本测试称,Ox Alpha在10个DeepSWE软件工程任务中取得80%的结果,高于同组测试中的Claude Fable 5和GPT-5.6 Sol。不过,这只是10道题的小样本测试,不是统一环境下的正式榜单。随后也有开发者表示,它在复杂后端和部分视觉任务中表现一般。

另一些开发者则开始追查模型来源。

在多组中英文、代码和 Emo ji混合文本中,Ox Alpha与GLM-5.3的Token计数呈现出高度一致的关系,差异基本可以由隐藏的系统提示词解释。受控视频测试中,它的抽帧方式、视频时长与Token消耗的关系,也与智谱GLM视觉模型相似。API异常参数返回的错误码和措辞,同样被认为具有智谱服务的特征。

发布时间进一步强化了这种猜测。8月14日,智谱公布GLM-5.3,并表示将在大约两周后完成安全评估、公开权重。六天后,Ox Alpha匿名出现在OpenRouter;8月26日,彭博透露智谱将在当晚发布Ox Alpha权重。

智谱此前也使用过类似方式。今年2月,匿名模型Pony Alpha上线OpenRouter,随后被揭晓为GLM-5的早期测试版本。从“小马”到“牛来”,匿名发布成为了智谱测试新模型的一种方式。

它可以暂时拿掉品牌预期,让开发者直接评价能力;免费流量则可以测试模型、缓存系统、任务调度和国产异构集群在真实Agent环境中的表现。身份悬念本身,也让社区主动承担了传播和测试工作。

但是,Ox Alpha最终叫什么、与GLM-5.3是什么关系、正式价格是多少,以及免费期结束后还有多少开发者继续使用,将决定这场匿名发布带来的究竟只是短期流量,还是智谱在全球开发者市场中的新入口。

本文来自微信公众号“腾讯科技”,作者:晓静,编辑:徐青阳

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。