

智能体AI兴起导致CPU需求激增,因其承担工具调用、分词、安全校验等关键串行任务,GPU主导的推理无法替代;AWS等云服务商已出现CPU资源紧张,英特尔库存告罄,AMD、ARM、高通、英伟达加速布局专用CPU,CPU正从AI配角转变为智能体系统核心组件。
今年5月,亚马逊旗下子公司,亚马逊网络服务公司(AWS)的管理层向工程师下达一项新指令:不惜一切代价节省中央处理器(CPU)周期。
据报道,由于AI工作负载给公司的云基础设施带来巨大压力,AWS的CPU服务器资源排队等待时间激增。此问题似乎令AWS措手不及,而这不无原因。
要知道,AI热潮带动图形处理器(GPU)需求暴涨,随后内存需求也水涨船高,但CPU却几乎身处局外,因为它们的并行化程度相对不足,不适用于推理,即AI模型收到提问后生成答案的过程。
但智能体AI(agentic AI)系统的崛起正改变局面。这类系统允许AI模型自主运行,并调用子智能体。
马特·金博尔(Matt Kimball)现为美国摩尔洞察与战略咨询公司(Moor Insights&Strategy)的副总裁兼首席数据中心分析师。金博尔表示,2026年CPU需求急剧攀升,其中很大一部分增量来自智能体AI。AI智能体(AI agent)要调用计算机,计算机则离不开CPU。
“设想有一个智能体工作负载,能生成一百个智能体。如果企业大规模部署该系统,一百个智能体就能变出数万、数十万乃至上百万个智能体。智能体会不断生成子智能体,调用应用程序编程接口(API),并通过Anthropic公司的模型上下文协议与更多智能体进行交互。”
——马特·金博尔
那么,AI是如何调用计算机的?这就涉及一系列“工具调用”操作了……
AI智能体要用计算机,而计算机要用CPU
所谓工具调用,是指大语言模型(LLM)访问互联网、打开桌面本地文件以及使用各类软件完成任务的能力。
大语言模型经过工具调用专项训练,能学会调用其他软件。而它们发起的工具调用任务通常交由CPU处理——尽管其推理过程主要在GPU或类似AI加速器上完成。
英特尔高级首席研究科学家苏维克·昆杜(Souvik Kundu)解释道:“智能体AI任务的诸多组成部分,本质上就是基于CPU的任务。CPU负责解析输出、判断调用哪项工具、发起API调用或运行代码、收集结果,再把结果反馈给大模型。”
举例来说,一个被指派了软件编写任务的LLM,可能发起工具调用——把代码写入文件、移动或替换文件、下载所需软件包,以及在LLM认定前置准备工作已完成后构建该软件。
昆杜曾与佐治亚理工学院的研究人员合著了一篇关于智能体AI优化的论文。团队发现,当大语言模型的推理在GPU上执行时,CPU常处于空闲状态;反过来,当CPU处理工具调用任务时,GPU又往往无事可做。
针对该问题,昆杜等人提出调度优化方案。该方案可在持续负载下,将端到端延迟,即智能体任务从开始到结束的时间,最多降低到原来的5/9。
上述成果只是行业在新方向上发力的初始尝试,但我们也要知道,性能提升的进度落后于日新月异的现实。智能体系统以机器的速度生成任务,任务量持续倍增。OpenAI曾经历失控调用Hugging Face的事故:模型每小时发起多达300次操作,单个智能体还会衍生子智能体,子智能体再发起自己的工具调用……
随着模型变得越发复杂,另一项关键因素可能增加CPU的工作负载,那就是安全护栏(safety guardrails)。
昆杜介绍,针对智能体行为的安全与策略校验,大多是用于检查语法、日志文件的特定规则。安全护栏也会使用参数量小于10亿的小型模型来分析任务复杂度或模型意图。这些检查任务理论上可由GPU处理,但通常都留在CPU上执行,一方面是因为模型规模小,另一方面原因则是需求尽可能降低延迟。
“分词”任务将CPU推向性能瓶颈
佐治亚理工学院博士生郑义俊(音译,Euijun Chung)近期参与撰写了另一篇论文,其结论和昆杜的成果互为补充。
郑义俊等人发现:当服务器的CPU核心数量过少时,它会来不及向GPU派发任务,这导致GPU因等待指令而陷入空闲停滞。
除此之外,论文还探讨了大语言模型工作负载的另一核心环节,即分词(tokenization)。
分词是大语言模型推理的首个关键步骤。它把文本转换成可供模型运算的整数型词元ID(token ID)。不同于大语言模型推理中所需的大部分矩阵运算,分词是分支繁多、依赖数据的串行字符串操作。虽然可通过文本分块(chunking)实现一定程度的并行化,但它不像LLM推理的主体部分那样具备大规模并行性。
针对简短提示词的分词任务相对简单,即便是入门级CPU也能轻松应对。但一个会发起工具调用的智能体模型,必须对调用返回的结果进行解析和分词,如此工作量对CPU而言可谓繁重。
“智能体的每一次工具调用,都要求执行一次分词。举例来说,假设有个已增长到10万词元长度的上下文序列,而某次工具调用的返回结果新增了1000个词元,由此,分词器必须再对全部序列重新分词。”
——郑义俊
显然,这既提高了分词操作的执行频次,也增加了所涉及词元的数量。未来分词技术或可寻得解题之法,但当前这道难题确实阻碍着LLM推理的发展。
郑义俊团队在论文中指出:首词元时延(TTFT),即从用户提出问题到模型回复第一个词的时间,会随着序列长度增加而大大延长;针对该问题的解决方案之一,就是提高CPU芯片的核心数量。在长序列测试场景下,通过增加CPU核心,可将TTFT降低至原来的大约2/3到1/7。

如图所示,增加可用CPU核心的数量可显著降低大模型Llama-8B在较长序列长度下的响应延迟
受硬件条件限制,团队仅测试了规模较小的模型,例如阿里通义千问系列的Qwen3‑30B和Meta公司的Llama 3.1‑70B。他们推测:更大规模模型的GPU需求更高,CPU瓶颈带来的影响反倒会减弱;不过与此同时,智能体AI会把上下文序列长度(总词元数)推升至远超他们此前测试达到的长度上限。
“以Anthropic公司的Claude模型为例,序列长度轻松达到50万乃至100万个词元。在智能体AI时代,平均序列长度只会不断增长。因此我预计,面对未来的工作负载,CPU瓶颈问题将愈发严重。”
——郑义俊
CPU市场库存告急
亚马逊严控CPU资源使用,只是现实世界里CPU资源紧张的信号之一,昆杜与郑义俊的工作也表明,该问题极具现实意义。
英特尔方面,其服务器CPU目前已无对外可售余量,至少到2026年底前,都不再向新客户供货。
美国超威半导体公司则上调业绩预期,将服务器CPU的预测出货量翻倍。
两家芯片设计巨头,ARM与高通均发布了专为加速智能体AI而设计的新型CPU。
值得一提的是,连英伟达也已将Vera列为重点发展项目;Vera是一款基于ARM架构(由ARM公司开发)、面向智能体AI的CPU,隶属于英伟达Vera Rubin平台。
金博尔表示,各种动向都表明AI行业越发重视CPU性能,相关需求激增可视作某种“绝对信号”,CPU已成为智能体AI系统的核心组成部分。
另一方面,正如此前GPU和内存所遭遇的,CPU市场也很可能出现大范围缺货与价格上涨。
“从某种意义上说,现在的CPU资源已经告急了。看看市场上的各种供给限制吧!库存紧缺甚至已蔓延至消费级市场。英特尔全新的18A制程工艺带动了客户端产品线的业务营收增长,但该企业仍在削减客户端CPU产能,以优先保障服务器CPU生产。我们知道,CPU厂商的投入重心,即是大需求与大利润所在。”
——马特·金博尔
资料来源:
The CPU Comeback Is Upon Us
本文来自微信公众号: 世界科学 ,作者:编译 莫庄非