AI智能体,正在让CPU身价暴涨

影子备忘录
个人专栏
热度: 3882

AI智能体(Agent)兴起正推动CPU需求激增,因其需高频调用工具、任务编排与状态管理,导致CPU从GPU的辅助角色升级为关键调度中枢;Meta Muse应用引爆市场关注,带动Arm、英特尔、AMD股价大涨,服务器CPU配比正从1:8转向1:1甚至反超,引发全球缺货与涨价潮。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

文 | 影子备忘录

从大模型训练到推理部署,产业的关注点几乎都绕着GPU打转。

显存够不够大、带宽够不够高、Token吞吐量能达到多少,成为衡量AI基础设施能力的核心指标。英伟达的股价曲线,就是这场算力狂欢最直观的注脚。

但最近,一款应用让这个共识开始松动了。

9月8日,Meta正式发布个人AI智能体Muse。上线约10天,它登顶美国App Store免费应用榜,超过ChatGPT。

日活数据显示,Muse美国移动端日活用户达到64.2万,而ChatGPT同期仅为23.1万,前者是后者的近三倍。

更值得关注的是它在资本市场的连锁反应:Arm涨17%、英特尔涨12%、AMD涨10%,AMD市值首次突破1万亿美元。

一款应用,凭什么搅动整个芯片板块?

一个应用,为什么把CPU推到了聚光灯下

先说说Muse到底和之前的AI有什么不同。

过去我们用ChatGPT,模式是“你问它答”。你输入一个问题,模型生成一段回答,任务结束。本质上,这是一次性的信息生成。

Muse的逻辑完全不一样。它是“你交代它干”。你可以让它连接Gmail、Google日历、OpenTable,甚至直接通过浏览器上网,替你发邮件、订餐厅、安排行程、网购下单。

你关掉App它还在后台继续跑,实现了7×24小时全天候工作。

Meta的架构设计更值得细看。Muse采用的是多代理设计:多个“工作代理人”平行运作,还有一个独立的“审查代理人”在后台检视。

每个子代理人都各自调用工具,每项任务会同时发出多次CPU运算请求;每个子代理人还保有自己的工作记忆,在运行期间持续保存,才能跨时段执行连续任务。

这意味着任务越复杂,CPU请求与内存占用都是成倍放大。

更关键的是基础设施层面的设计:Meta在云端给每个用户配了一台独立的Linux虚拟机(VM)。

这台虚拟机有自己的浏览器、文件系统、后台任务,配了2个vCPU、8GB内存和100GB SSD。每个Muse用户背后,都对应着一套真实的CPU算力消耗。

有分析做了这样一个测算:如果Muse的用户规模扩展到1亿,光CPU就需要约158万颗。

这还只是一款应用。当Agent成为AI的主流形态,算力结构的变化将是系统性的。

Agent改写了算力配方

要理解CPU为什么突然变得抢手,得先看清Agent到底在干什么。

传统的大模型推理是“一问一答”。GPU负责繁重的矩阵运算,CPU只做简单的数据搬运和调度。

在这个模式下,一台AI服务器配4到8颗GPU、1颗CPU就够了,CPU就是个“后勤人员”。

但Agent的运转逻辑完全不同。

一个Agent接到任务之后,需要经历一连串步骤:理解意图、分解任务、选择工具、执行代码、访问数据库、调用API、评估结果、调整策略。

这个链条上的绝大多数环节,包括逻辑判断、流程控制、数据调度等都是CPU擅长的领域。

行业研究机构SemiAnalysis的测算显示,在现代智能体代码工作负载中,约42%的执行时间被CPU驱动的工具调用所占用。

AMD在2026年第一季度财报电话会上也明确表示,仅编排环节的耗时,就可以占总延迟的50%到90%。

打个比方,以前的大模型推理像是一条流水线,GPU是流水线上的主力工人,CPU是给工人递零件的。

现在Agent来了,它更像一个项目经理,需要不停地拆解任务、分配资源、协调工具、检查进度。GPU还是干重活的工人,但项目经理的工作量,也就是CPU的工作量暴增了。

英伟达CEO黄仁勋在发布Vera CPU时说了一句很直白的话:“Agent没有耐心,它们生活在纳秒级的世界里。当它使用工具时,它希望响应时间尽可能快。在这条路径上,CPU如果效率不够高,将阻止Agent执行下一步。”

这句话反过来读也成立:CPU不够强,GPU就得闲着。这就是CPU在Agent时代的真正价值,它不是取代GPU,而是决定GPU能不能被充分利用。

算力配比的范式转移

这种变化,最直观地反映在CPU与GPU的配比上。

在模型训练时代,AI数据中心CPU与GPU的配比大致是1:4到1:8。GPU是绝对主角,CPU只是配套。

但进入Agent推理时代,这个比例正在快速收敛。AMD CEO苏姿丰在财报会上明确表示,比例正从1:4至1:8逐步收敛至1:1,甚至在智能体密集部署场景下,CPU配置数量可能反超GPU。

ARM的测算更激进:传统AI数据中心每吉瓦功率需要约3000万个CPU核心,而在Agent时代,这个数字将飙升至1.2亿个,直接翻四倍。

从1:8到1:1,这不是微调,是范式转移。

伯恩斯坦的研报给出了一个更具体的判断:在智能体工作负载中,CPU的计算占比将从传统LLM的14%跃升至50%,与GPU平分秋色。

报告将2030年全球服务器CPU市场规模预期从此前的1370亿美元上调至2230亿美元,年复合增速达43%。

摩根士丹利的测算同样乐观:到2030年,Agentic AI可能带来325亿美元至600亿美元的CPU增量市场,整体服务器CPU市场规模有望超过1000亿美元。

这些数字背后,是整个产业对算力结构的一次系统性重估。

当需求端发生结构性变化,供给端不可能无动于衷。

事实上,CPU市场已经开始经历一轮罕见的涨价潮。传统CPU市场长期遵循“价格只降不升”的运行逻辑,但AI带来的算力需求正在改写这一规律。

英特尔今年以来消费级CPU经历三轮调价,Plus系列累计涨价幅度接近30%;高端Xeon服务器产品整体涨幅达7%至12%。AMD下半年针对中高端服务器CPU价格预计还将上调4%到7%。

更值得关注的是供应链信号。KeyBanc数据显示,由于超大规模云服务商“扫货”,英特尔与AMD在2026全年的服务器CPU产能已基本售罄,两家公司均计划将服务器CPU价格上调10%到15%。

部分服务器CPU型号自年初以来价格涨幅已超过40%,客户真正担心的已经不是价格高低,而是未来还能不能拿到货。

缺货态势已从高端服务器CPU蔓延至全品类。此前CPU常规交期仅1到2周,当前已拉长到8到12周,服务器级CPU产品交期更长。渠道市场甚至出现了“空仓、断供、二手溢价”的现象。

这种供需失衡的根本原因在于:过去几年,全球半导体产业的先进产能大量倾斜给了GPU和AI加速器,CPU的产能扩张相对保守。

当Agent时代突然拉高CPU需求时,供给侧没有足够的弹性来快速响应。

芯片巨头们已经用行动投票

如果说市场数据反映的是“预期”,那芯片巨头们的产品布局反映的就是“行动”。

在2026年台北国际电脑展上,四大芯片巨头不约而同地把CPU推到了舞台中央。

英伟达发布了Vera CPU,它是首款专为智能体打造的CPU,搭载88个Olympus核心,任务完成速度比传统x86 CPU快1.8倍。

黄仁勋明确表示:“AI智能体将成为计算资源的最大用户,而Vera正是专为在超大规模基础设施中运行智能体AI而生。”

要知道,英伟达是GPU的代名词。当这家全球最成功的加速器公司开始专门为AI打造CPU,并在产品命名上直接叫“the CPU for agents”,这本身就是一个强烈的信号。

高通CEO将2026年定义为“智能体之年”,指出“你需要一个非常强大且高能效的CPU来负责任务的编排规划”。

英特尔推出基于18A工艺的至强6+处理器,配备288颗能效核,单机架最多可支持15万个AI Agent运行。Arm则发布了AGI CPU,强调能效比,单机架级性能可达传统x86 CPU的两倍以上。

Arm的入局尤其值得关注。这是Arm三十五年来首次推出自研芯片,直接瞄准Agent推理场景。

当IP授权商开始自己做芯片,说明它对这个市场的判断已经从“趋势”变成了“确信”。

一个细节值得品味:在Agentic推理中,CPU的角色正在从“数据搬运工”升级为“调度中枢”。OpenInfer的分析指出,经典模型服务是一个大模型运行一个大计算,吞吐量是瓶颈,这是GPU最擅长的。

但Agent是一个循环:推理一点、调用工具、等待API、读取文件、运行代码、检查结果、再推理。

这个轨迹是一长串小的、分支的、延迟敏感的步骤,其中大部分只短暂接触加速器,甚至完全不接触。在这些模型调用之间的空隙里,工作是编排、数据移动、工具执行、检索和长上下文状态管理,而这些都是CPU的工作。

“推理花了好几年忘记了这一点,因为工作负载足够单一,GPU可以假装自己就是整台计算机。Agentic工作流终结了这种假象。”

这不单只是芯片的事

把视角拉高一点来看,CPU的身价暴涨,本质上反映的是AI产业正在经历一次深层转型。

过去两年,AI的竞争焦点在“模型有多强”,参数规模、基准测试、榜单排名。GPU之所以成为绝对主角,是因为训练一个更大的模型确实需要更多的GPU。

这个逻辑简单直接,资本市场也容易理解。

但Agent的到来改变了游戏规则。当AI从“回答问题”转向“完成任务”,衡量标准就不再只是模型在榜单上考了多少分,而是它能不能稳定地、安全地、高效地替用户把事情办成。

这需要任务编排、工具调用、权限管理、状态持久化、多代理协调等,这些能力大部分不取决于模型参数有多大,而取决于底层的计算架构能不能高效地支撑这些操作。

正如伯恩斯坦研报所指出的,如果CPU性能不足,GPU算力将闲置。在Agent时代,算力集群的效率不再取决于最强的那个芯片,而取决于最弱的那一环。

这意味着产业的竞争维度正在发生根本性变化。从拼参数、拼概念,转向拼软硬件的综合实力,拼芯片架构的合理性,拼算力配比的均衡性,拼系统调度的效率,拼安全架构的可靠性。

Meta的Muse其实就是一个缩影。它背后是Meta自研的Muse Spark模型,但支撑它运行的是那台云端虚拟机、是Sentinel安全代理、是多代理并行的调度系统。

用户感受到的“好用”,是模型能力、芯片算力、系统架构、安全设计共同作用的结果。

单独拎出任何一个环节,都讲不出完整的故事。

CPU的回归,并不意味着GPU的退场。

在Agent的最优架构里,GPU负责模型生成,CPU负责任务编排,二者是异构协同的关系。CPU算力供给不足,会直接导致高端GPU资源空转浪费。

真正的变化在于,产业终于开始意识到,AI算力的故事不能只有一颗芯片。

从1:8到1:1,这个配比的变化背后,是AI从“炫技”走向“干活”的必然结果。当AI真正开始替人做事,支撑它的基础设施必须重新设计。

而CPU,恰恰是这套新基础设施中最容易被低估、却最不可或缺的那一块。

Muse的爆火只是一个触发点。它让市场看到了Agent的商业化可能性,也让资本意识到,算力受益面正从GPU向数据中心CPU显著扩散。但这只是开始。

真正值得关注的问题是:当Agent从百万用户走向十亿用户,从消费场景走向企业场景,从简单任务走向复杂工作流,我们的算力基础设施准备好了吗?

CPU的涨价和缺货,或许就是这个问题最诚实的回答。

声明:本文为入驻“火星财经 专栏”作者作品,不代表火星财经官方立场。
转载请联系网页底部:内容合作栏目,邮件进行授权。授权后转载时请注明出处、作者和本文链接。未经许可擅自转载本站文章,将追究相关法律责任,侵权必究。
提示:投资有风险,入市须谨慎,本资讯不作为投资理财建议。
本内容旨在传递行业动态,不构成投资建议或承诺。