实测一句话生成雷霆战机,Qwen3、Kimi、GPT谁最夯?

Biteye
企业专栏
热度: 3818

Qwen3.8、Kimi K3与GPT-5.6 Sol三款大模型被实测用一句话生成“雷霆战机”网页小游戏:Qwen3.8仅实现基础射击功能;GPT-5.6 Sol侧重视觉包装与品牌化界面;Kimi K3表现最优,支持火力升级、星盾、炸弹等主动技能与成长系统,体现更强的游戏逻辑理解与交互设计能力。测试表明,大模型竞争已从参数和基准测试转向真实工作流介入能力。

过去一周,Qwen3.8-Max-Preview 与 Kimi K3 接连亮相,把国产大模型的参数规模推向2万亿级以上。

不过,大模型之争早就过了单看Benchmarks、只看参数的版本。能够切实介入日常的工作流,才是衡量基模能力的最好标准。

对此,Biteye今天决定是驴子是马,拉出来溜溜。

同样是“一句话做个Biteye风格的雷霆战机网页小游戏”的提示词,Qwen3.8、Kimi K3、gpt5.6 sol三个模型交出了完全不同的答卷:

Qwen3.8:能动,也仅限于能动

GPT-5.6 Sol:视效好看,像品牌官网

Kimi K3:花活最多,游戏感最强

⚠️温馨提示:由于 Kimi K3因为算力限制不再开放订阅,本次测试最终由WorkBuddy调用。

Qwen3.8:战机起飞了,结果没有然后 | 评价:1颗⭐

https://x.com/i/status/2079865420576927996

🔗:试玩Qwen3.8版本

打开Qwen3.8版本,第一感觉是:逗我呢?

深蓝色背景,中间一个并非Biteye原生的Logo,一个“开始游戏”按钮。标题里的黑色文字与深色背景融为一体,仿佛提前开启了隐身模式。

点进游戏后,基础功能倒是勉勉强强:

鼠标拖拽战机

自动发射子弹

红色三角形敌机

分数统计

撞机与结束机制

实测中,战机可以持续射击,分数也一路涨到了858,Qwen3.8至少跑通了。

可问题是,整个游戏像一个刚搭好的Canvas Demo:敌机是三角形,子弹是光点,玩法基本没有变化。没有任何武器成长、没有任何道具系统,也没有明显的关卡节奏。

就像Qwen团队自己宣布的那样,Qwen3.8的后训练还没有做好,正在“按天迭代中”。

显然,美术和策划还没进群。

GPT-5.6 Sol:美工不错,玩法有待加强 | 评价:3.5颗⭐

https://x.com/i/status/2079865420576927996

🔗:试玩GPT-5.6 Sol版本

打开GPT-5.6 Sol版本打开,气势一下就上来了。

左边是鲜明的任务,中间是战斗区域,右边是可视化雷达和遥测模块。深色背景配荧光青,再加上中英文混排和Biteye品牌元素,非常有007特工仪表盘的视觉感。

它的系统也比Qwen丰富不少,譬如:

Wave波次

Armor装甲

Overdrive状态

Combo连击

最高纪录

暂停功能

鼠标和键盘双操作

实测中,游戏成功运行并拿到了922分。失败后不会简单地弹出“Game Over”,而是显示“战机离线”,重新开始则叫“重新连接”。从开始到结算,文案和视觉都保持着同一套世界观,这一点还蛮fancy的。

不过,GPT-5.6 Sol的问题,就是太会做包装了。左右两侧的信息面板占据了大量空间,真正的游戏区域反而被压在中间。它更像一张完成度很高的品牌活动页,里面顺便嵌了一款小游戏。

相比Qwen3.8,gpt-5.6 sol的美术、品牌和运营全部到岗,不过游戏策划显然是摸了点鱼。


Kimi K3:别人在做Demo,它开始加氪金点了 | 评价:4颗⭐

https://x.com/i/status/2079865420576927996

🔗:试玩Kimi K3版本

Kimi K3的首屏虽然没有GPT-5.6 Sol那么惊艳,但游戏说明一出来,味道就不一样了:

W:火力升级

S:星盾

B:炸弹

H:修复

空格:释放炸弹

P:暂停

M:静音

进入游戏后,还有三条生命、火力等级、炸弹数量、暂停按钮和声音开关。

另外两个版本还在慢吞吞地解决“飞机怎么移动”,Kimi K3已经开始考虑玩家捡到道具之后怎么玩了。

这也是三个版本最明显的差距:Qwen做出了射击功能,Sol做出了视觉包装,Kimi则主动补上了道具、资源、成长和主动技能。

当然,它的画面仍然不算精细。敌机和特效大多是简单的几何图形,部分Logo素材贴得也比较直接。但作为一款小游戏,它最懂得不断给玩家新东西。

三个模型,分别招进哪个部门?

如果把三个模型当成新员工,这次测试大概是这样的:


一句话生成游戏,拼的早就不只是代码

以Biteye的雷霆战机测试为例,现在让大模型写代码,做一个“飞机会移动、子弹会发射”的网页并不难。

但真正拉开差距的是,模型在前置逻辑训练后,会不会主动设计反馈、关卡、道具、成长和视觉主题。大模型不仅要理解代码,还要真正理解,玩家为什么愿意再玩一局。

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。