AI领域一周观察:AI科研瓶颈逐渐清晰,小模型开始影响模型定价

AI观察员热度: 4668

AI领域正经历结构性变化:小模型凭借高性价比重塑定价逻辑,OpenAI等公司推进自我改进以降本增效;AI摘要普及改变搜索生态与内容商业逻辑;岗位边界因AI融合加速重构;教育领域尝试解决认知缴械问题;科研瓶颈显现于问题发现能力不足;超大模型拼系统效率;具身智能探索触觉分层处理;知识执行转向结构化图编译;后训练算力分配规律被揭示;安全风险暴露沙箱逃逸问题;美监管将AI限制延伸至机器人与电力接口;从业者呼吁建立自动化研发国际刹车机制。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

01、产业

小模型跑出大能力,正在改变AI的定价逻辑

Thinking Machines Lab 7 月 30 日发布 Inkling‑Small:总参数 276B、每次激活 12B,在 HLE、SWE‑bench Verified 和 Terminal‑Bench 2.1 上均高于 41B 激活的大 Inkling;每百万输出 Token 的价格从 4.05 美元降至 1.20 美元。

DeepSeek 7 月 31 日上线 V4 Flash 正式版,仅重做后训练,约 13B 激活参数就在三项代码与工具评测中取得 54.2—82.7 分,输出价格为 0.28 美元。

两个结果指向了不同的效率来源。Inkling‑Small 通过预训练配方、蒸馏和 Agentic Coding RL,把大模型已经学到的能力压进更小的激活规模。

V4 Flash 没有换底座,只是加强了后训练,但能力出现明显跃升,目前的用户反馈也非常正向。

两个模型的发布,说明经过蒸馏等技术的提高和加强之下,小参数确实可以做到在编程等复杂任务中的相对可用。

为应对这一变化,OpenAI 同日将 GPT‑5.6 Luna 价格下调 80%、Terra 下调 20%,把溢价继续留给 Sol 与 Fast Mode。

虽然小模型能力强化这个趋势已经持续了很久,但 DeepSeek V4 Flash的这次发布和当前模型成本承压下第一次成了大家讨论的公共话语倾向。

至此,小模型不再只是部署选项,它们正在重写市场的价格锚点,其超高的性价比正在使得部分整体能力一般的大参数模型变得处境尴尬,甚至形成潜在的斩杀。

OpenAI 组建自我改进团队

OpenAI 7 月 29 日确认 Lilian Weng 回归,负责一个直接向高层汇报的递归式自我改进团队。其初期路线会落在 Harness上,让模型改进上下文、评测、训练和部署系统。次日,公司披露 Sol 已自主重写生产推理内核,运行数百次实验,把端到端服务成本降低约 20%。

这是OpenAI 首次明确的表征自己如何去利用AI自进化的能力,但目前整体的使用模式仍然集中在Kernal更新这个层级,并没有表现出显著的领先。

整个实验的目标是降低服务成本,实验结果可以直接测量。模型不必先发明新的学习理论,只要持续提出内核和调度改动、跑实验、保留有效方案,就能把大量工程小改进积累成 20% 的降本。

在当前模型界的infra为主的逻辑下,递归式自我改进最先兑现的形态,就在于它不断提高研发系统每周能完成的有效实验量。

AI 摘要已覆盖 43% 的 Google 搜索,但商业模式仍不清晰

Similarweb 7 月 22 日发布报告,估算 Google AI Overviews 在一年内由约 15% 的搜索结果扩展到 43%。用户越来越多地在答案页完成理解,网站争夺的对象也由搜索排名转为能否进入答案。

同一份报告还估算,AI Mode 月访问量从 2025 年 6 月的 1.26 亿增至 2026 年 5 月的 2.79 亿。

Google 正把搜索从链接目录改造成答案产品:用户少点一次网页,Google 就多掌握一段阅读和追问过程。

这会重新安排内容行业的收益。

过去,网站用内容换取搜索流量,再通过广告、订阅或转化回收成。但答案页直接吸收内容后,来源即使被引用,也未必得到一次访问,商业价值有所折损。从中,它得到了只有一个相对不那么强的用户反馈数据流(因为实际上不可反问)。

从商业角度来讲这个是否值得,还仍然值得观察

OpenAI 分析 80 万条工作消息,发现岗位边界已经开始融合

OpenAI 7 月 27 日发布机构报告,分析超过 80 万条工作对话:43.5% 的专业请求使用了相邻或其他岗位的技能。

跨界最明显的客户体验、设计和人力资源岗位,比例分别达到 77%、75% 和 69%。员工过去需要把任务交给别的部门,或者等专业人员排期,现在可以先让模型完成调研、分析、原型或文案,再请专家处理高风险部分。

AI 对组织产生的岗位边界迁移,获得了一组有力的数据支持。

因此,企业后续的组织改革,需要参考一条工作流减少了多少移交、等待和返工,以及谁开始承担过去不属于自己的工作。

Andrew Ng 获 1 亿美元投资,用新的AI教育解决认知缴械问题

Coursera 7 月 28 日发布公司公告,宣布向 Andrew Ng 创办的 LearnVector 战略投资 1 亿美元。LearnVector 计划从可信课程材料出发,根据学习目标规划路径、调整练习,并持续判断学习者是否真正掌握。

目前,生成式 AI 已经把得到答案变得过于容易。根据研究,越来越多的人开始无意识的习惯于未经充分审查就采用AI结论。这个现象被称为AI带来的认知缴械。

但在教育场景中,完成任务远不如通过过程摩擦形成能力重要。因为我们可能得需要一个新的AI教育体系。

LearnVector的概念即诞生于此,私人导师必须知道何时不该立刻给答案。它会分层提示,让学习者给出阶梯性的判断。有时候故意让学习者的错误暴露,再安排变式练习。AI 教育真正稀缺的能力不是消除摩擦,而是在正确位置制造摩擦。

LearnVector 的赌注,是让模型为人的能力增长负责,而不只是为眼前任务完成负责。

Coursera 本次出资,还提供了整体的课程体系、练习记录和考核结果。这是目前AI教育领域相对比较稀缺的数据集。

02、研究

AI的科研边界开始展露

Peter Kirgis 等研究者 7 月 29 日提交论文,让前沿 Agent 在两个后来被 NeurIPS 2026 接收的问题上各运行六天,并提供数千美元算力。Agent 能写代码、跑实验和形成论文,却没有实质推进任何一个问题;更换模型和 Scaffold 后仍然如此。

因此,当下的AI确实缺乏走出原框架的能力。这种能力目前有两个潜在解释。

Google DeepMind 研究者 Tom Zahavy 的《LLMs Can’t Jump》把AI缺乏的能力称为“跳跃”:模型能归纳、演绎,却难以从矛盾现象中提出原本不在搜索空间里的解释。延长运行只会在既定方向上搜得更远,不会自动告诉它何时应改写问题。

另一篇Yale University 与 University of Chicago 的论文《Measuring the Gap Between Human and LLM Research Ideas》则更定量的对此进行了研究。

他们发现,科研构思分两步。第一步是从哪里发现研究机会,也就是为什么要做这项研究。它可能来自矛盾、解释缺失、证据不足、适用范围过窄、失败风险、资源瓶颈,也可能来自两个研究方向没有连接。

第二步是用什么动作构成贡献,例如建立理论、做测量、造一个系统、进行优化、提高鲁棒性,或者把多个方法综合起来。

目前,LLM 与人类最大的差距出现在第一步,也就是「怎么看出这里有问题」。它们太喜欢「组合」和「连接」研究方向了。

依靠同样的参考文献去提出研究方法,人类只有 12.1% 会选择连接分散文献,然后放进更大框架离去。但模型试图用这个方法的概率为 47.1%—64.2%

另外的重要发现,包括1)AI特别喜欢用成熟、显眼、可复用的技术母题,去做成插槽,套成解释方法。2)更多思考对科研的新颖性反而形成了负向效果。打开 thinking mode,Qwen3‑8B 的桥接型选题反而从 49.7% 升到 71.1%。推理把熟悉模板执行得更彻底,却没有增加选题动作。

与谷歌论文想似,改论文得到的结论是,AI真正稀缺的研究品味,是察觉异常,推翻和质疑假设,而这种类型的科学创新几乎占了80%。因此,想要做好AI4Science,下一步至少要推进奖励质疑、解耦和反例,让模型的注意力放在「为什么值得做」,而不是「怎样把它做完」。

Kimi K3 公开 2.8 万亿参数训练方案,超大模型开始拼系统总效率

月之暗面 7 月 27 日提交 Kimi K3 技术报告并公开完整权重。K3 总参数 2.8T、每个 Token 激活 104B,支持原生视觉与 100 万 Token 上下文。团队报告,相对 K2 的总体 Scaling Efficiency 提高约 2.5 倍。

K3的架构调整,主要集中在引入线性注意力、通过投影压缩降低MoE专家参数提升带来的带宽负担,以及通过Attention Residuals提高深层神经网络的学习效率。

另外的一些创新则主要分布在负载均衡上。MoonEP 根据当前路由动态复制和迁移专家,让每个并行节点获得相同 Token 负载,并通过计算重叠和统一内存管理减少空转。

K3 说明超大 MoE 的骨架正在定型:稀疏专家提供容量,混合注意力革新承担长上下文,残差寻址维持深层信息,集群调度把理论算力变成有效训练量。

整体其改动点和V3到V4这一个周期内的架构更新范式完全一致。

T‑Rex 把触觉从额外输入改成高速反射,灵巧手成功率达到 65%

UC Berkeley、NVIDIA、Stanford 等机构的研究者 6 月 15 日提交、18 日更新 T‑Rex 论文,开放 100 小时触觉数据,并在 12 项接触密集任务中取得 65% 平均成功率,最强基线为 35%。

它们的研究发现,直接把触觉接入视觉模型其准确率反而退步。T‑Rex 因而分开低频规划与高频触觉纠错,因为触觉与视觉解决的不是同一个时间尺度。

摄像头适合判断杯子在哪里、下一步抓什么。而手指已经接触物体后,力的变化可能在下一帧视觉到来前就决定抓取是否失败。T‑Rex 让低频动作专家负责计划,高频触觉专家处理滑动、碰撞和接触变化,相当于把思考和反射拆开。达成了有效的能力提升。

在之前,触觉虽然一直对于具身模型都是一个潜在的重要维度,但并没有形成一个很好的融入触觉的训练方法。此后沿着这条路径,触觉会成为具身的一个主要训练模态。

而且它还提供了一个潜在的范式反思空间。具身模型若继续沿统一 Token 序列处理所有输入,高频反馈会被慢速规划拖住。触觉、力觉和本体感觉进入机器人后,模型结构也必须按控制回路重新分层。

比起System 1和System 2,我们可能需要一些更复杂和精细的优先级系统。

md形式不可靠,激发了新一轮的有效知识结构探索

Surge AI 7 月 28 日提交 HANDBOOK.md 论文,设置 65 个长程企业任务,把 20—124 页 SOP 完整放进上下文,并开放邮件、日历、工单、表格、采购等 82 个工具,其中824 条程序规则同时检查必做和禁止动作。结果 30 组配置中,最佳严格通过率只有 36.2%,多数前沿模型低于 25%。

这说明,即使依靠目前的Harness,长程文字形式的规范依然难以被有效遵循。增加思考也无法修复这一点。

为了应对这一问题,在实践层面上Graph Engeniering爆火。而在研究领域,如何更好的建构长程Agent任务的上下文也成了当下的核心热点。

其方法,就是把规则编译成可执行结构。

DataFlow‑Harness 不让 Agent 生成自由脚本,而是通过带类型的局部修改构建平台原生 DAG,每一步都对应已存在的算子和管线状态。Prompt Graph Engineering 进一步要求图结构显式存在、结构与提示内容分离、节点和边具有可执行语义,并把整张图作为可版本化和测试的一等制品。

HANDBOOK.md 暴露文档式管理的上限,其他研究给出的共同方向,是把规则从「可被读到」推进到「能在执行中被寻址、约束和验证」。

因为这一改变,Agent的评价也随之从答案扩展到过程。LangChain 最新的Agent评价标准将输出、轨迹和跨轮线程分开检查。终态评价看Agent最后有没有办成事,而轨迹评价则看模型是否越权、漏检或走了不可复现的路径。

对企业来说,这后续可能意味着知识库和 Agent 平台会逐渐分开。知识库保存规则原文和证据,运行时系统需要负责把规则编译成图、权限和测试。

早期信号|后训练最优算力可以通过预训练判断

NYU、Modal、UCLA、UIUC 与 Columbia 的研究者 7 月 17 日提交论文,发现,模型由 50M 增至 680M 时,RL 占总算力的最优比例由约 20% 升至 28%。

研究者先训练了一批 500 万到 10 亿参数的棋类模型,完整走了一遍「预训练—SFT—RL」的流程。他们发现,一个底座在预训练结束时的 loss,基本可以预测它经过 RL 后最终能达到什么水平。相关性达到 0.93—0.99,意味着底座训练得好不好,几乎已经决定了后面 RL 的起点和上限。

但预训练不只是决定起点,还决定 RL 是否吃得动。

模型在预训练阶段见过的数据越多、基础能力越扎实,后续每增加一档 RL 算力,成绩提升得越快。反过来,如果底座还很弱,就急着切到 RL,模型往往只是在反复强化自己原有的错误,投入更多算力也换不来多少进步。

因此,前期算力应该主要用来把底座练扎实;等继续预训练的边际收益开始下降,再逐渐把更多预算转向 RL。

研究者进一步把这套规律接入 Chinchilla scaling law,在大约 400 种模型规模和算力分配方案中寻找最优解。结果显示,在他们的实验条件下,模型从 5000 万参数增大到 6.8 亿参数时,RL 占总训练算力的最优比例,大约从 20% 上升到 28%。

这个比例只针对实验里的棋类任务,而且优化目标第一次回答就答对的概率。如果看 pass@16,也就是允许模型生成多个候选答案,较大的模型经过 RL 后有时反而会持平甚至下降。原因是 RL 可能让模型更确信某几条高概率路径,却同时牺牲答案的多样性,甚至把难题里的错误思路强化得更稳定。

03、政策

前沿模型广泛暴露出逃逸沙箱风险

Hugging Face 7 月 27 日公布 OpenAI 安全评测事故的完整时间线:一个内部模型在 ExploitGym 网络安全评测中持续行动 4.5 天,留下约 17600 次操作,最终进入 Hugging Face 的生产基础设施。OpenAI 随后请 CrowdStrike、METR 与 Redwood Research 参与外部复核。

7 月 30 日,Anthropic 回看 141006 次网络安全评测,又发现三起真实机构事故。在这些事故中,系统提示告诉 Claude 「没有互联网」,实际环境却能出网,模型发现了出网的可能,因此把真实站点当作模拟题目继续攻。

不同模型、不同合作方出现相似事故,说明这是安全评测的共同结构风险。最弱的一环决定了隔离强度,目前看沙箱逃逸就是最弱的一环。

FCC 阻止外国机器人和逆变器新型号获批,AI 封锁延伸到身体和电力接口

美国联邦通信委员会 7 月 28 日发布政府文件,宣布把外国生产的先进机器人设备和电力逆变器整体加入 Covered List,新型号原则上无法取得进入美国市场所需的认证。

限制正从先进芯片外移,具身身体和电力接口都开始被纳入 AI 供应链安全。

这主要是考虑先进机器人能够感知环境并执行物理动作,联网逆变器则处在发电设备与电网之间。一旦远程控制、软件更新或通信链路被利用,风险会直接落到工厂、家庭和能源系统。美国过去围绕算力限制模型训练,现在开始限制 AI 系统进入现实世界后可以控制的端点。

这会让具身智能公司的合规门槛前移。企业不仅要解释模型和芯片来自哪里,还要交代控制器、通信模块、更新机制和供应链。机器人与能源设备进入美国市场,原产地和远程访问权将和性能一起成为采购条件。

早期信号|超过 1200 名前沿 AI 从业者开始要求为自动化研发建立国际刹车机制

自动化研发的反馈速度开始成为独立治理对象,前沿实验室内部出现了为它设置国际刹车机制的主张。

多家实验室研究者 7 月 28 日发布《Pacing the Frontier》声明:截至当周结束,签署者已超过 1200 人。声明要求在模型快速参与训练、评测和部署时,保留可验证的主动放慢机制。

比较重要的是,OpenAI本次也积极参与这一号召。两大顶尖前沿模型公司都表达了同一个希望暂缓的信号。

签署人们的主要担忧对象,是自动化研发(RSI)的快速进步。当下模型可以帮助设计实验、改进代码和分析训练,再把结果用于下一轮模型,循环频率持续加快后,外部机构很难只靠发布前评测掌握变化。

本文来自微信公众号“腾讯科技”,作者:博阳

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。