神秘「牛来」大模型刷屏,限时免费

机器之心
个人专栏
热度: 4144

一款匿名大模型Ox Alpha(被网友称为「牛来」)在OpenRouter上线,支持多模态输入和长上下文,代码能力突出,在DeepSWE测试中表现接近顶级模型;其身份被广泛猜测为智谱GLM-5.3 Flash或多模态版本,但官方尚未确认;同期另一匿名模型korrine也在Code Arena引发身份猜测,反映大模型厂商倾向通过匿名方式开展公开压力测试与口碑预热。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

大模型圈流行「挂马甲」测试。

近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:

「牛来」大模型。

根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。

GLM

上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。

初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。

与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。

8 月的大模型圈,突然变成了一场大型猜谜游戏。

「牛来」大模型表现抢眼

Ox Alpha 真正引发关注,靠的是代码能力。

开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。

GLM

DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。

不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。

GLM

不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。

「牛来」大模型到底是谁家的?

「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。

有人还专门写了个博客进行分析:

1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。

2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。

3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。

GLM

https://ox-alpha-evidence-production.up.railway.app/

还有网友从对话中寻到蛛丝马迹。

GLM

Ben Davis 认为 99% 确定这就是 GLM-5.x。

GLM

这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。

截至目前,OpenRouter、智谱都没有公开回应。

korrine 身份更扑朔迷离

「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。

最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。

GLM

不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。

GLM

评论区中,还有人将它指向 MiMo V3。

GLM

大模型厂商为什么喜欢「挂马甲」?

匿名测试正在成为大模型正式发布前的重要环节。

在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。

OpenRouter 提供的是另一类测试环境。

开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。

对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。

此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。

最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?

参考链接:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:关注AI的

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。