

英特尔提出以CPU为核心重构数据中心架构,应对AI智能体爆发式增长需求。文章指出智能体从聊天转向执行复杂任务,驱动CPU需求激增,至强6+通过集成QAT、DSA、AMX等加速引擎,优化KV Cache管理与沙箱部署,支持单颗CPU运行超1000个智能体,并推动整机柜级协同设计,确立CPU在AI任务调度中的中枢地位。
“10分钟内,拉起1万个沙箱。”
在Intel Connection 2026期间,英特尔提出了这个数字。每个沙箱的创建时间不能超过60毫秒,沙箱不是空壳,它要承载一个完整的运行环境,包括镜像、文件系统和隔离空间。这个需求不是实验室里的假设,它来自真实客户的生产环境。而它也指向一个具体的问题:当智能体从聊天演进到干活,数据中心到底需要变成什么样?
英特尔数据中心集团副总裁、中国区总经理陈葆立在大会主题演讲中这样判断:预计到2026年底,超过80%的企业应用将至少嵌入一个AI智能体;到2031年,中国企业场景中的活跃智能体数量将达到3.5亿个。中国大模型每天的Token调用量已增至2024年初的5000倍,而且还在持续增长。这些数字背后,是数据中心算力结构正在发生的一次深层调整。
陈葆立在接受采访时详细拆分了智能体的工作流程:一个Agent接到任务后,先做任务规划,把目标拆解成若干步骤,然后调用工具执行。执行过程中产生的中间结果需要被保存下来,供后续步骤参考。如果任务复杂,还会启动多个子Agent并行协作,每个子Agent有自己的执行环境和需要记住的上下文。他举了一个日常的例子:用户让Agent每天早上8点搜集前一天的AI新闻并总结。Agent需要上网找资料,拿回来的内容可能是网页、PDF报告或视频,各种格式的信息需要先提取、处理,才能交给大模型分析。这些预处理工作,有不少适合由CPU承担。而且一次模型调用往往还不够,Agent要拆解任务、调用工具,再根据结果决定下一步怎么做。
他把驱动智能体发展的软件工程演进归纳为四个阶段:从Prompt Engineering到Context Engineering,再到Harness Engineering,最后到Loop Engineering。每一步都在减少人工干预,让Agent更自主地完成复杂任务。而这些软件机制中,很多工作适合CPU来执行。陈葆立说,“这也是为什么在过去一年时间里,AI智能体的兴起会带来对CPU的巨大需求。”
市场预期也随之大幅重估。针对2030年CPU市场规模的预估,短短半年内,就从2月预测的590亿美元上调至8月的2100亿美元,约为原先预期的3.6倍。数据中心AI负载占比预计将从2025年的40%提升至2030年的80%。英特尔CEO陈立武在2026年第一季度财报电话会议上曾提到,AI工作负载重心由训练转向推理,CPU与GPU配比正从过往1:8向1:1演进。到本次Connection大会,这一趋势得到进一步印证:部分复杂智能体场景,甚至需要更高密度的CPU。陈葆立也在采访中透露了一个来自客户的真实数据:某国内领先的大模型厂商,从去年到今年CPU需求提高了5倍。
智能体的工作记忆,可以被理解为一张草稿纸。智能体在推理、统筹、规划和对话过程中,需要把中间结果留存下来,这就是KV Cache。问题在于,上下文越来越长,这张草稿纸的数量正在爆炸式增长。

英特尔的解法是KV Cache智能加速套件,核心组件叫KV Shrink,这套方案由三层结构组成。第一层是数据搬运,通过DSA加速器实现显存与系统内存之间的高效拷贝,性能是CUDA方案的近10倍。第二层是压缩,QAT引擎可以实现KV Cache数据50%以上的压缩率,无损压缩也能达到1.42倍,原本300GB的KV Cache,落盘之前可以压缩到200GB左右。第三层是系统优化和调度,让每一层的解压与上一层的计算并行起来,把延迟隐藏在重叠的流水线里。客户的验证数据显示,KV Cache智能加速套件能够将KV Cache传输速率最高提升达9.66倍,首字时延性能最高提升达15倍。它支持两种部署模式:一种是直接放在AI服务器的头节点中,把显存里的KV Cache卸载到系统内存,做压缩甚至存储,需要时解压再送回显存;另一种是用RDMA把显存里的KV Cache传送到远程服务器。
另一个技术组件是沙箱。沙箱的本质是轻量化虚拟机,MicroVM,对操作系统镜像和文件系统做了裁剪和定制,目标是快、轻量、占用更少内存。它要保护两件事:Agent自己的敏感信息不被其他负载看见,以及系统不被Agent执行的不确定代码所影响。沙箱的核心KPI是高并发、低延迟。在满足200毫秒启动时延的约束条件下,单颗至强6+最多可支持350个沙箱并发创建,是某款同类产品的1.46倍。单颗处理器最高可支持超过1000个智能体的稳定部署,靠的是CPU超配,一个核心同时部署多个Agent,分时复用系统资源。
至强6+在这两个场景中的表现,指向CPU的密集执行能力。它在系统重载时不降频,200多个核心同时工作,性能交付几乎线性。这是沙箱高密度部署的基础。从微架构层面看,Agent的调用行为是间歇性的,发起一次调用后等待结果,然后再发起下一次。这种模式下,数据可能在缓存中,但指令已经因为间歇而被换出。英特尔在Cache设计上采取多核共享大容量L3/L2的策略,L2 Cache是4核共享4MB,单核可达4MB,80%的指令在L2命中。
面对这些需求,英特尔给出的技术回应集中在至强6+上。至强6+是首款基于Intel 18A制程的数据中心CPU,最高配备288颗能效核,提供高达8000 MT/s的DDR5内存带宽和576MB末级缓存。Intel 18A已经进入量产阶段,高性能版本18A-P也推进至风险试产环节。
但更值得关注的是架构选择。行业里有另一种思路:用通用CPU配合外置加速卡,或者让GPU承担更多CPU的工作。英特尔选择把QAT(数据保护与压缩加速技术)、IAA(内存分析加速)、AMX(AI 矩阵运算加速)等加速引擎全部集成到CPU内部。当问及英特尔为何选择这条路时,陈葆立解释到:“如果加速能力外置,数据在CPU与加速卡之间的往返开销会抵消掉卸载本身节省的成本。”
在KV Cache的场景里,这个逻辑很清晰。QAT是内置的压缩引擎,可以在不占用GPU资源的情况下完成KV Cache数据的压缩和解压。DSA像一个内置的DMA控制器,负责显存与系统内存之间的高效拷贝。AMX则用于AI数据预处理和向量数据库加速。这套方案的核心设计是流水线重叠:每一层的解压与上一层的计算并行起来,让压缩解压的延迟隐藏在计算之后。陈葆立在主题演讲中还展示了AMX在数据预处理场景中的效果。他以AI搜集财经新闻并总结为例:Agent需要从网页、PDF、视频等不同格式的资料中提取文字,才能输入大模型分析。借助AMX等加速能力,向量化和重排序性能分别达到对比基准的2倍和4倍。在GPU方面,英特尔发布了新一代GPU Crescent Island,基于全新Xe3P架构,面向AI推理和Agentic AI场景设计。其特性之一是大显存,通过LPDDR5x技术可配备128G、256G甚至480G的大容量内存,用于AI推理和KV Cache存储。
陈葆立把未来数据中心概括为三类协同的集群:CPU服务器或CPU集群负责智能体执行和工作编排,GPU服务器承担模型推理,存储集群承载长对话、文档、合同等不断增加的数据。“这三类集群有一个非常重要的共同点,就是都需要CPU来做数据调度。AI工厂不再以单纯的Token产出为衡量标准,而是转向以任务为导向,通过系统级协同优化,实现更低资源消耗、更高运行效率。”
为什么需要整机柜?因为当智能体数量从一百个扩展到一千个,瓶颈就不再是单颗处理器的核心数,而是内存容量、节点间通信、供电和散热的系统级平衡。沙箱超配的极限不在CPU核心数,而在内存容量。以一个128核系统、1:2的核内存比、4倍超卖计算,一个节点就需要1TB内存。在采访中,陈葆立进一步解释了Agent带来的内存挑战。传统模式下,一个虚拟机内存容量2GB,几个核对应一个虚拟机,每个CPU核用不了几百兆。现在反过来,一个核要承载四五个Agent,每个Agent都要2GB。“虽然它不是每时每刻都在跑,但是它每时每刻都吃你的存储容量。”这要求在有限的CPU边沿下,每个通道能插两根DIMM而不只是一根,同时插两根时还要保持更高的带宽。
我们也看到,英特尔在大会现场联合产业伙伴发布了开放Agent整机柜平台规范,让更多厂商能够基于这套标准打造自己的整机柜产品。衡量整机柜可交付智能体数的框架是:理论值乘以三个系数,暨CPU调度有效性、资源平衡度和计算卸载效益。在资源平衡度方面,测试发现每个Agent的内存带宽需求不超过1GB/s,建议每个Agent至少配置2GB内存。相比I/O,内存更容易成为限制;而在内存容量和带宽之间,容量更值得关注。英特尔至强6和至强6+提供了基于CXL的Flat Memory Mode,通过CXL扩展内存,硬件在扩展内存和本地内存之间管理数据放置,对操作系统和应用透明,应用不需要做任何改变。
把以上技术细节放回产业语境,一个更宏观的变化正在发生。
衡量AI基础设施的标准在变。过去看的是能产生多少Token,现在看的是稳定完成多少有效任务。这个转变把CPU推向了系统中枢的位置。任务拆解、工具调用、沙箱调度、上下文管理、数据预处理,这些工作GPU做不了,也不该做。英特尔在Connection大会上做的事情,是在为这个转变铺设硬件底座。至强6+的加速引擎全内置,是为了让数据搬运和压缩不离开CPU的调度范围;KV Shrink的分层卸载,是为了让有限的HBM显存承载更多的并发任务;开放Agent整机柜平台规范,是为了把单芯片的能力扩展为系统能力。
这个底座还有一个容易被忽略的支撑点,是生态。陈葆立举了一个他自己的案例:他装了一个桌面智能体,让它把照片背景抠掉。Agent发现电脑上没有抠图软件,就上网去找PyTorch的开源代码,下载下来自己写了一个抠图程序。“AI学习的路径上,所有的执行都是CPU在做。”他补充说,那个PyTorch代码可能是过去三五年有人写的,极大可能是X86架构。“过去10年、20年,开源社区里很多功能都是基于X86写的。所以在Agent时代,用X86去做智能体是非常有优势的。”
回到开头那个问题:当智能体从聊天演进到干活,数据中心到底需要变成什么样?英特尔的答案是,它需要从一个以Token产出为衡量标准的计算设施,变成一个围绕智能体任务节奏重新组织的系统。芯片的定位在变,内存的角色在变,机柜的设计逻辑在变,而CPU重新回到了这个系统的调度中枢。陈葆立在采访最后判断:“未来五年,数据中心里每一颗芯片的定位都会被重新讨论。”这个讨论的核心问题,不是谁的算力更强,而是谁更适合智能体时代的任务分工。从目前的产业动向来看,英特尔正在用自己的方式给出答案。
本文来自微信公众号“半导体产业纵横”(ID:ICViews),作者:方圆