

DeepSeek发布V4-Flash正式版API,通过仅后训练优化,在Agent多项基准测试中性能逼近甚至超越此前V4-Pro预览版,凸显轻量模型(130亿激活参数)在Agent任务中的高性价比优势;此举标志着其战略重心转向Agent生态建设,包括原生支持OpenAI Responses API和Codex适配,并在500亿元融资后加速商业化落地。
7 月 31 日午后,凤凰网科技查询

官方更新日志显示,V4-Flash 正式版在 Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 54.2 分,Cybergym 76.7 分,Toolathlon verified 70.3 分。而 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。

需要说明的是,Terminal Bench 2.0 与 2.1 并非同一版本的测试集,直接对比并不完全公平。但一个激活参数仅 130 亿的轻量版,在 Agent 能力上跑出这样的分数,已经在说明后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。
此外,
根据
官方还特别注明,本次公开基准测试中的 Code Agent 任务,使用了
这也是
AI现在不缺品位和直觉,它缺的是持续学习的能力”他说,“投资人看Agent,我们看怎么解决学习。”
持续学习听起来是模型层面的命题,但它的工程落点,恰恰在Harness上。
据透露,DeepSeek的Harness规划在V4正式版上线之际同步推出。另据DeepSeek在日志末尾表示,“DeepSeek-V4-Pro 正式版将会尽快发布。”
如果说 2023 年的大模型竞争是 “拼通用能力”,2024 年是 “拼长上下文”,那么 2026 年的关键词,毫无疑问是 Agent。
Agent 能力 —— 即模型自主规划、调用工具、执行复杂任务的能力 —— 正在成为衡量大模型实力的新标尺。从 Terminal Bench(终端操作)、NL2Repo(代码仓库生成)到 Cybergym(网络安全任务)、SWE-bench(软件工程),一系列 Agent 基准测试正在重新定义什么是好模型。
从全球范围看,Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也在快速追赶。
毕竟,Agent 场景对推理速度和成本的敏感度,远高于纯对话场景。一个需要反复调用工具、多轮推理的 Agent 任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。如果 Flash 能在 Agent 能力上达到 “够用甚至好用”的水平,其性价比优势将极具杀伤力。
官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)得分 59.6。这从侧面印证了
一场生态暗战也在悄然打响,正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。
Responses API 是 OpenAI 力推的新一代 API 格式,相比传统的 Chat Completions,它更适合 Agent 场景 —— 支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。
对 Codex 的适配,则瞄准了代码生成与软件开发这一垂直场景。Codex 是 OpenAI 面向代码领域的模型,
这些动作放在一起看,
此次更新,距离
约一个多月前,

7 月中旬,
高估值背后,是市场对
据多家媒体报道,
Flash 正式版的上线,或许可以看作
Agent 战争的大幕才刚刚拉开。
本文来自微信公众号“凤凰网科技”,作者:凤凰网科技