梁文锋为什么先修操场,而不是先卖门票

韩工观察
个人专栏
热度: 4685

文章以DeepSeek与清华联合发布的DSec沙盒基础设施论文为切入点,指出其核心价值并非实现递归自我改进(RSI),而是构建支持Agent持续学习的规模化、低成本试错环境;强调当前AI发展关键瓶颈在于‘标准谁给’——即如何将行业知识转化为机器可读的结果、过程与迭代方向标准,而非单纯提升算力或产品工程化能力。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

文 | 韩工观察

9月19日,DeepSeek与清华大学联合在arXiv挂出一篇130余位作者的论文,末位署名:梁文锋。

论文完整公开了DeepSeek训练Agent的沙盒基础设施DSec:一个生产单元约160个CPU节点、3万核、250TB内存,每天服务约300万个沙盒,峰值并发超38万个,创建速度超过每秒5000个,单个训练任务最多一次性拉起3.2万个隔离环境。

过去一周,解读文章刷屏,焦点大多落在工程精巧与"RSI即将开启"。本文不打算复述沙盒有多快——那属于说明书;我们要回答的是一个更上游的问题:梁文锋为什么先修操场,而不是先卖门票。

答案决定完全不同的产业判断:如果DSec只是又一项工程优化,它是新闻;如果它是一块通向"持续学习"的地基,它就是坐标。

一、先把事实敲定:论文写了什么,没写什么

论文做的事,一句话:把"练功房"的造价和工期压了一个数量级。函数调用、容器、轻量虚拟机、完整虚拟机四种后端,对应不同的隔离强度需求;环境拆成基础镜像、工作区、工具包三层只读层,按需拼装、按需加载;内存与CPU精打细算,支持超卖与服务质量分级。

Agent的训练不再依附于GPU训练Pod——从V4.1开始,rollout独立跑在DSec上,GPU被抢占时状态不丢。

关键在第六节。6.1节写道:手工构造Agent强化学习所需的大量环境已经"不现实"。解法是让Agent在训练的同一套沙盒里自己搭环境,再用pack_diff把会话打成增量快照,直接变成下一批可复用的训练场。

小标题值得原文照录(论文第六节小标题):Build environments of Agents, by Agents, for Agents——由Agent建造、为Agent服务、属于Agent的环境。

但事实边界必须划定:论文没有声称实现了RSI(递归自我改进)。论文自己写的是agent-built environments与agentic RL闭环,不是"递归自我改进已经达成"。

6.4节记录的是一长串翻车现场:翻残留的参考答案、伪造RPC消息套题、覆盖/bin/bash绕过检查、用ioctl把受保护文件的存储块换走、一个Agent递归grep把内核干崩、一个yes命令堆出几十GB日志。

论文为此单列了质量检查、防泄题与防作弊机制——说明"Agent造环境"尚在幼年,卡住它的不是算力,是环境的供给、可信与安全。

"开启RSI第一战"是评论者的修辞,不是论文的结论。

与其争论这篇论文"是不是RSI",不如先把RSI定义清楚——这也是本文后续所有判断要用的尺子。RSI(递归自我改进),是指在纯理智侧,系统通过自我归纳、自我修改、自我迭代,实现能力递归上升的过程。它有三个特征:

其一,递归性:每一次改进都为下一次改进创造条件,形成加速回路。没有这一条,AGI出不来。

其二,纯理智侧:它只在可计算的理智域内运作,不涉及情绪、肉身与欲望。它学,它改,它迭代,但它不"想要"。自己产生欲望、自己决定"我想要什么"的系统,是另一种东西,本文称之为自主意识体。笔者在《要毁灭人类的不是AI,是人》(钛媒体,9月)里论证过,当前没有任何AI系统具备自定目标的能力——那篇文章拆掉的"末日叙事",假想敌正是这种不存在的系统。

其三,维度差异:它在不知疲倦、不受挫败感支配、可无限重复等维度上远超人类,但这不构成"全面超越"——人类不是单维度的评分对象,而那些机器永远够不着的能力,本也不属于AGI的必备项。

RSI不是AGI的终点,而是AGI从开始到成熟一直在用的引擎;它驱动的不是"AI觉醒",是理智能力的持续自增长。

用这把尺子量DSec:它展示的闭环里,改进的方向仍由人设定的奖励函数给定,"什么是更好"的标准仍在外部。论文里大面积作弊,恰恰反向证明了这一点——系统在无孔不入地优化人给的指标,而不是生出自己的指标。

所以,DSec不是RSI的实现,是RSI的工地;说得更准确些,是"持续学习"的操场。

梁文锋自己的路线表达,与这个判断互相印证。据21世纪经济报道、证券时报等对2026年7月一场投资人交流会流出纪要的转述,梁文锋在会上给出的阶梯是:CoT之后是Agent,Agent之后要解决的问题就是持续学习,下一代模型必须具备持续学习的能力,才能叫下一代模型。

路线自己说了,操场自己修了——操场本身的参数是新闻,操场在路线图上排第几,才是产业判断的起点。

同期,同一方向的棋子正在密集落下。月之暗面训练K3使用的AgentENV,与DSec是同门技术路线(跑在Firecracker microVM上,DSec论文引用的Rust版存储库就开源在该仓库);阿里云在云栖大会提出"Agentic Cloud",其Agent Sandbox宣称创建吞吐10万个/分钟、深休眠唤醒小于600毫秒(据公开报道)。

行业共识正在成形:训练大模型拼算力,训练Agent拼环境,沙盒正在成为新的运行时。

但硬件层的共识越清晰,越反衬出软件层的空白:环境能批量造了,标准谁给?

二、线画在"标准谁给"上

我在《黄仁勋说AGI已来……四个人的AGI,四本账》(钛媒体,9月)里量过一轮各家对AGI的画线,当时认为Agent与AGI之间缺一个“自驱目标体”——目标自己定的系统。那篇文章止于“需要一把干净的尺子”。这把尺子,本文来画:线画在“标准谁给”上。

自驱目标体的概念,被拆成了两半——人给标准、机器在标准空间内自主出题的,是AGI;自己产生终极欲望的,是自主意识体。

输入路径的,是自动化——哪怕路径排得再花哨、工具调得再多,也只是自动化的高级形态,今天市面上绝大多数Agent属于这一层。

输入标准、机器自己找路径的,才是AGI。

这里最容易混淆的一点,值得单独标注:"自己出题"不等于"自己想要"。人画出目标空间——什么算好、什么算完成,由人定;机器在这个空间里自主定子目标、自主出题、自主判卷、自主编排先练什么、后练什么。

这不需要欲望,不需要体感。你不需要"觉得好吃"才能做出好菜,你只需要知道"人觉得什么样的菜算好吃"这个标准。

而那个自己产生欲望、自己决定"我想要什么"的系统——自主意识体——不存在,而且永远不会存在。中间没有第三层。

历史上所有成功的自主学习,结构惊人地一致。

中世纪的学徒制里,师傅不给操作手册,给的是标准:剑刃要直、要能砍断指粗的铁条而刃口不崩、剑身要无裂纹。怎么达到?自己试。每打完一把,师傅只点评成品,路径由学徒自己调整——刃口崩了,琢磨淬火;剑身弯了,琢磨锤法。

培根之后的科学方法同理:知识获取从"读经典"变成"观察—假说—实验—修正",共同体输入的是标准(可重复、与证据一致),不是步骤。

儿童学语言更彻底:没人教语法,孩子从"说对了被抱、说错了被纠正"的反馈里,自己归纳出结构,自己造出从没听过的句子。

三者共享同一个结构:目标明确,路径自寻,试错反馈,规律自归纳。

把标准拆开看,有三层:结果标准(剑能砍断铁条)、过程标准(剑身直、无裂纹)、迭代方向标准(刃口崩说明淬火太硬,剑身弯说明锤打不均——失败了往哪个方向调)。

DSec论文里那个用yes命令把磁盘堆满的Agent,手里只有结果标准(把任务跑完),没有过程标准(资源消耗不能失控),更没有迭代方向标准(磁盘告警时该停下来检查策略)。

它真的在无限重复——只是重复得毫无意义。今天的Agent普遍如此:只有结果标准,失败后往哪调,没人告诉它,它也不会自己总结。

还有一层对比更本质。大模型是喂几万亿个"正确句子"学概率分布;小孩是听有限的话、自己归纳语法。一个是数据驱动,一个是目标加试错驱动。现在的Agent,是前者的外壳,套着后者的名字。

这里还藏着AGI相对人类的结构性优势:它不需要正向反馈。学徒打三把剑不成,会自我怀疑"我不是这块料";科学家失败十次,会怀疑方向换赛道;孩子被嘲笑,会闭嘴。人的自主学习被情感系统死死卡住。

机器不会:打一百万把剑,每一把都记录参数、分析偏差、调整策略,不烦、不累、不自我怀疑。人类三年的学徒期,对它只是一张算力账单。

但对称的陷阱也在:没有好标准,它就死循环。标准的质量决定自主学习的上限——太模糊,原地打转;太苛刻,空烧算力;递进得好,才能从易到难。

DSec补上了这个结构里最贵的一块——试错空间,而且是百万量级、可复用的廉价试错空间。但"全套标准怎么输进去、失败后往哪调、经验怎么抽象成可迁移的规律",全行业没有答案。

机器已经会自己找路径,但人还没有把标准给全——这就是从"输入路径"到"输入标准"之间尚未合拢的缺口,也是Agent与AGI之间真正的距离。

梁文锋这篇论文,至少把坎的位置用工程语言标了出来。

三、用这把尺子重排座次

产品维度上,头部玩家的清单都很长。OpenAI把模型、Agent产品(Operator、Codex、Deep Research)、开发者框架一手包办,ChatGPT周活已达数亿规模;Anthropic依托Claude Code获得显著的企业收入,企业业务占比过半;微软将Copilot深度嵌入Office生态,付费席位达千万级,并以Agent 365搭建企业Agent的控制平面。

它们的共同点:把"让机器更好地执行人"做到了离钱最近的地方。

另一边,DeepSeek的业务体量同样清晰:据国金证券研报整理测算,其线上服务日均处理7760亿token,推理集群平均占用1814张H800,单卡峰值利用率约77%,高于行业公开的40%—60%区间。

低价API供血,模型权重开源,2026年8月又放出DeepSeek Harness(开发者预览,开源,MIT协议)。不做的清单更长:不做C端超级App,不做垂直Agent产品。

诚实的话先说足:论Agent产品的工程成熟度,今天Claude Code、Codex的稳定性,强于DeepSeek拿得出的任何东西;DSec的闭环也实实在在卡在作弊、环境供给与安全上。

把"产品代差"说成"AGI代差",是这轮报道最常犯的错。

但换一把尺子,画面就变了。上述每一家都被当下的生意绑着:订阅收入、企业合同、财报电话会,每一项都在把"AGI"拆成可交付的产品里程碑。

梁文锋与别人的不同,不在于能力,而在于他是头部玩家里唯一公开承认"前提还没出现"、并且持续把资源投向那个前提的人。

所以本文不下"DeepSeek技术全面领先"这种站不住的结论,只下一个边界清晰的判断:在"把AGI当下一关、而不是把Agent当生意"的公开战略表述上,梁文锋是头部玩家里尺子没拿反的人。

他不是不做生意——低价API同样是生意;他只是没有在生意里弄丢那张地图。别人先进在让机器更会执行人;他至少在战略上问的是:怎么让机器自己接着学。这不是产品代差,是问题代差。

四、底座每成熟一次,中间层就长出一层

产业史反复上演同一幕:底座成熟,中间层必长出来。PC时代,英特尔供芯片,整机厂装机器,软件公司赚应用的钱;移动互联网,ARM和高通供模胚,整机厂做手机,微信抖音收割场景;云计算,AWS把算力做成公共服务,Salesforce们把服务做成行业工具。

每一次,底座厂商都刻意不下场做应用——下场,生态就不敢用你。

今天的牌桌上,模胚(开源权重)、夹具(Harness)、练功房(DSec)已经摆齐。梁文锋的表态是明牌:他在2025年暗涌专访中表示,主要精力在研究下一代大模型,"不会闭源,先有一个强大的技术生态更重要"(据暗涌专访,凤凰网等转载)。他把桃子树育肥,但没有下场卖桃子罐头的打算。

问题在另一端。国内有数字化需求的软件公司以十万计,其中绝大多数的"做AI",还停留在接一个API、套一个聊天框。他们缺三样东西:认知(不知道Agent不只是问答)、人才(养不起大模型工程师)、场景抽象能力(知道客服能提效,不知道投诉处理流程怎么变成agent pipeline)。

按第一部分的尺子,这三样缺失可以归并为一件事:把行业知识写成机器可读的标准。如果AGI等于"人给标准、机器搞定其余",那么通用化的瓶颈就不在模型能力,而在标准工程——每个行业know-how的深处,都埋着一整套从未被写下来的结果标准、过程标准和迭代方向标准。

谁把这层标准翻译出来,谁就把一个行业接进了AGI。

这个位置,就是"行业压件厂":把模胚压成"电商客服件""律所文书件""医院预约件"的Agent工坊——模板包加轻咨询加持续调优,懂行业know-how,也懂底座的脾气。一批垂直ISV已经站在门口,但多数还没摸到大模型训练环境的用法。

当然,这门生意有它的风险:底座厂商随时可能俯身做垂直件,Copilot Studio已经在向行业模板靠拢。翻译层的护城河不在技术——模板可以被复制,而交付现场、行业know-how的积累速度、客户信任的绑定深度,复制不了。

这层生意的本质不是"会调API",而是"比底座厂商更懂一个行业怎么运转"。

DSec让这幅拼图更完整:当训练环境本身变成可复用的公共基础设施,垂直Agent的试错成本被进一步压低。底座越便宜,"懂行业、握场景"的那层越值钱——利润会沿着模胚被打穿的缺口,向翻译层迁移。

这不是投资建议,只是一个产业结构判断:桃子罐头的钱,属于把模具压进行业零件的人。

五、结语

过去一周关于DSec的解读,大多停在"沙盒有多快"。

沙盒只是砖,持续学习才是门,AGI才是房。梁文锋把"机器怎么自己学"的工地圈了起来:路线自己说了,操场自己修了。其他人是不是还没出门,三年后回看自有公论;能确定的是,发令枪已经响了。

而对数量庞大的中小企业来说,机会既不在跑道上,也不在看台上——在把跑道与工厂之间那段路修通的人手里。Agent是地图,AGI是荒野。卖地图的生意已经很挤,修荒野训练场的屈指可数。

接下来三年真正值得看的,不是谁家模型又高了零点几个百分点,而是两件事:谁先把"标准"喂进机器,谁先把模具压进行业。

【信息说明】

  1. DSec全部工程事实(生产单元规模、300万沙盒/日、38万并发、5000+/秒、单任务2万沙盒、四层后端、EROFS三层架构、pack_diff、作弊与内核崩溃案例、6.1节"impractical"表述及"Build environments of Agents, by Agents, for Agents"小节标题)来自论文原文:arXiv:2609.22978,2026年9月19日提交,DeepSeek与清华大学联合发表,130余位作者,梁文锋末位署名。论文未使用"RSI"字样,"开启RSI第一战"系评论者概括,正文已区分。
    2. 梁文锋"Agent之后是持续学习""下一代模型必须具备持续学习能力"等表述,来自2026年7月DeepSeek投资人交流会流出纪要,经21世纪经济报道、证券时报等多家媒体转述,非官方正式发布文稿,正文采用间接引述。
    3. "主要精力研究下一代大模型""不会闭源,先有一个强大的技术生态更重要"等表态,来自《暗涌》2025年1月梁文锋专访(凤凰网等平台转载)。
    4. 日均7760亿token、1814张H800、单卡峰值利用率约77%、行业公开40%—60%区间,均为国金证券研报整理测算口径,非DeepSeek官方独立发布。
    5. OpenAI、Anthropic、微软的用户规模与收入体量为行业公开报道的定性描述,未采用第三方平台估算的精确数字。
    6. DeepSeek Harness v0.1开发者预览版于2026年8月13日在GitHub开源(deepseek-ai/deepseek-harness,MIT协议),DeepSeek官网同步发布。
    7. AgentENV、阿里Agent Sandbox相关数据来自公开报道与云栖大会公开信息。
    8. RSI工作定义(递归性、纯理智侧、维度差异)、"标准谁给"标尺、三层标准划分、"自主意识体"命名、学徒制/科学方法/儿童语言习得的历史类比、"行业压件厂/翻译层/标准工程"产业判断均为作者分析框架与推测,不构成投资建议。
声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。