美国豆包的优势,只剩下快了……

硬核看板
个人专栏
热度: 4881

文章分析Gemini 3.8 Flash模型的更新特点,指出其虽保持Token单价不变,但因推理轮次增加导致单任务成本上升;重点提升Agent能力,在多步任务执行、工具调用和复杂模拟(如四缸发动机)中表现显著优于前代及竞品Flash模型;核心优势转向高速推理(超300 token/秒),以速度支撑多轮迭代,实现轻量模型下的质量跃升。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

按月更新版本,我就问问还有谁?

7月Gemini 3.6 Flash、8月Gemini 3.7 Flash、9月Gemini 3.8 Flash。这更新频率也是没谁了……

3.6和3.7 Flash的提升不痛不痒,我原本已经彻底对Gemini失去信心了,看到3.8 Flash发布的新闻,我的期待值几乎就是0。不过还是试了试3.8 Flash,没想到虽是Flash模型,它这次在能力上的进步还挺明显。

01、单价没涨,为什么干活还贵了

3.8 Flash的Token单价和之前依然保持不变,3.6、3.7、3.8,连着三代更新竟然一点没涨价。

我们的美国大 豆包 价格上比 豆包 Seed2.1 Pro要便宜,甚至逼近了 DeepSeek V4 Pro峰值的价格。

DeepSeek

话是这么说,但是总价还是涨了。

因为这次3.8 Flash最大的特色是提升轮次。官方说以前Flash模型会出现活没干完就草草了事的情况,新模型解决了这一点。Gemini 3.8 Flash的解决办法是让模型多想一会,多说一点,任务多做几轮。

DeepSeek

这就导致了一个问题。和前几代Gemini相比,虽然Token单价一直没变,但是同样的任务下,由于完成任务普遍轮次变多了,开销还是涨了。3.8 Flash高推理档位的单任务输出Token比3.7 Flash多了33%,加上智能体任务轮次增加,平均任务成本从0.40美元涨到了0.58美元。

DeepSeek

有意思的是,Google对步骤多少的态度,还真不是一成不变的。

3.6 Flash发布时,官方强调的是少走弯路:用更少的推理步骤和工具调用完成任务;到了3.8 Flash,官方又开始强调要多想几步。

可是老大,我们这样让3.8 Flash多说话真的有用吗?

同样的提示词,分别让Gemini 3.7 Flash和Gemini 3.8 Flash给我讲讲电贝斯的发声原理。同样是让我拨动琴弦试试看,3.7说得很明白:「用力拨动4弦」;结果3.8来了个「用右手手指猛烈拨动最粗的4弦」……

????

Hello?我的钱都花在这了吗?

DeepSeek

DeepSeek

02、美国大豆包终于能把活干完了

话都说不明白,那这个多做几轮的方法到底在哪进步了?

原来,它是来干活的。这次迭代主要是Agent能力的提升。

Arena的Agent能力排名从上一代Gemini 3.7 Flash的32名升到了14名。

DeepSeek

试了一下,提升效果还真挺明显。它的能力已经超越了大部分「Flash」等级的轻量级模型。

我让3.8 Flash做了一个四缸发动机的互动模拟,就用了1分钟,而且结果呈现的要素齐全。

DeepSeek

作为对比,3.7 Flash在同样的提示词下直接什么都没画出来,我在提示词里还特别说明了「要做验证」。看来3.7果然为了赶快交差美美无视了这个部分……

DeepSeek

让GPT检查才发现,不仅因为一开始的依赖加载出了问题,后面的旋转过程、点火顺序全都写的不对。果然一回头测试3.7 Flash,美国大 豆包 那个一本正经胡写代码的感觉又回来了。

DeepSeek

和Gemini 3.7 Flash同样的问题也出现在各家的Flash模型上。

GPT-5.6 luna和GLM-5.3 flash全都没能加载出来渲染正常的的发动机活塞,后面旋转、点火过程也全都没有。而且这俩模型分别做了20分钟和35分钟,结果还是完全运行不了。

DeepSeek

DeepSeek

不过 DeepSeek V4 Flash成功跑起来了,但只是能跑起来而已:气缸没画明白,四冲程点火的效果也完全没有体现。

DeepSeek

03、质量不够,速度来凑

不过真要说Gemini和市面上其他模型比最大的优势,还得是速度。

Gemini系列现在的速度是真快,高推理模式下的3.8 Flash,每秒钟输出Token达到了300以上……

市面上所有推理模型里,速度前几名全都是Gemini。

DeepSeek

这和Google给Flash系列模型的定位有关。

在官方的产品定位里,它的主战场是Agent,而且定位是调用工具、持续运行、落实任务的「worker agent」,不是那个深度思考、规定路线、统筹调度的「central agent」。所以它追求速度快、省Token,其实 3.8 Flash的表现很符合Google对Flash系列产品的定位。

我又一次拿出我的吃豆人做了测试。

DeepSeek

我发现Gemini 3.8 Flash这速度真有点东西。整个游戏功能齐全,只用了29秒。这也太快了……

DeepSeek

用相同的提示词测试了一下在Artificial Analysis同样在「智能」维度得到59分的GPT-5.6 Sol xhigh。结果要慢不少,做了1分35秒,另外这个结果真的不怎么样,这个帧数是要干啥……

DeepSeek

,

DeepSeek

为什么3.8 Flash作为一个轻量模型还能在很多测试任务里保持质量?

因为对于它来说,高速是多做几轮的条件。

我看Google最近的Flash系列大更新是一次挺漂亮的曲线救国。

曾经的大模型发布是先做个旗舰模型,然后蒸馏出来一个轻量快速的Flash模型。但是由于Gemini 3.5 Pro的「持续难产」,Google选择反其道行之:质量不够、速度来凑。3.6、3.7的模型还是在一味地卷速度,但是这次的3.8 Flash,Google是真做到了利用高速优势,达到更好的质量。

用这种优化方式,Gemini 3.8 Flash的能力已经能算是「旗舰级Flash」模型了,但是它毕竟依然不是Pro。现在都已经9月了,原定6月发布的Gemini Pro模型到底啥时候能发出来,我真的等不及了。

本文来自微信公众号 “硬核看板”(ID:yinghekb),作者:王芮

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。