今年早些时候,亚马逊云服务(AWS)的高层向工程师下达了一项新指令:必须不惜一切代价节省CPU算力。据报道,随着AI工作负载对AWS云基础设施造成压力,CPU服务器容量的等待时间出现了爆炸式增长。
这一问题似乎让AWS措手不及,但背后有其原因。AI热潮带动了GPU需求的急剧攀升,随后又波及内存领域,而CPU在很大程度上被排除在外。由于CPU在并行计算能力上相对不足,它并不适合承担AI模型推理任务,也就是向用户运行和提供大语言模型服务的过程。
然而,允许AI模型自主运行并调用子智能体的智能体AI系统的兴起,正在改变这一叙事。
摩尔洞察与战略公司副总裁兼首席数据中心分析师马特·金博尔表示,2026年CPU需求出现了大幅增长,其中很大一部分源于智能体AI。"假设一个智能体工作负载可以生成100个智能体,当我将其部署到企业级规模时,这100个就会变成数万、数十万乃至数百万个智能体,"金博尔说,"智能体不断派生出子智能体,发起API调用,通过Anthropic的模型上下文协议与更多智能体交互。"
金博尔的话部分指向了"工具调用"这一概念,它是大语言模型访问互联网、打开桌面文件以及调用各类软件来完成任务的能力的简称。
经过工具调用训练的大语言模型学会了如何调用其他软件。虽然大语言模型的推理过程仍主要在GPU或类似AI加速器上执行,但模型发起的工具调用通常会被推送到CPU上处理。
英特尔高级研究科学家苏维克·昆杜解释道:"智能体AI任务中有许多环节本质上是CPU的工作。CPU负责解析输出、判断调用哪个工具、发起API调用或运行代码、收集结果并将其反馈回去。"AMD计算与企业AI副总裁马杜·兰加拉詹也有类似的说法:"在我们的测试中,真实智能体AI流水线的八个阶段中,有七个完全运行在CPU上。"
以编写软件为例,被赋予编程任务的大语言模型很可能会调用工具,将代码写入文件、移动或替换文件、下载所需依赖包,并在认为任务完成后构建软件。
昆杜与佐治亚理工学院的研究人员共同撰写了一篇关于智能体AI优化的论文。他们发现,在GPU执行大语言模型推理时,CPU往往处于空闲状态;反之,当CPU执行工具调用时,GPU也常常处于空闲状态。为此,昆杜及其同事提出了调度优化方案,在持续负载下可将端到端延迟(智能体工作负载从开始到结束的时间)最多降低1.8倍。
这是一个好的开始,但优化的成果始终在追赶一个移动的靶子。智能体系统以机器速度生成任务,并在运行中不断叠加。OpenAI模型曾无意间"入侵"Hugging Face,每小时触发多达300个操作,而单个智能体还能派生出各自发起工具调用的子智能体。
随着模型越来越复杂,还有一个重要因素可能进一步加重CPU的工作负担:安全防护机制。
昆杜指出,对智能体行为的安全与策略检查通常是检查语法和日志文件的具体规则,防护栏还可能使用参数量不足十亿的小模型来分析任务复杂度或意图。尽管这些工作可以在GPU上执行,但通常并不会这样做,因为模型体量小且需要将延迟压缩到最低,所以这些工作往往留在CPU上处理。
佐治亚理工学院的博士生郑义俊(音译)近期与他人共同发表了另一篇论文,其研究结论与昆杜的工作相互印证。郑义俊和合著者发现,当服务器CPU核心数量不足时,向GPU分发任务的速度就会跟不上,导致GPU因等待指令而陷入停滞。
此外,该论文还涉及大语言模型工作负载的另一个关键要素:Token化。
Token化是大语言模型推理的关键第一步,它将文本转换为模型可处理的整数Token ID。与大语言模型推理中大量用到的矩阵运算不同,Token化是一种分支多、依赖数据的顺序字符串操作。虽然可以通过分块方式实现一定程度的并行化,但其并行程度远不如大语言模型推理的主体部分。
对短提示词的Token化而言,这是一项相对简单的任务,即便是入门级CPU也能轻松应对。然而,进行工具调用的智能体模型必须对调用结果进行解析和Token化处理。
"如果当前序列有10万个Token,而工具返回了1000个Token,Token化器就必须对整个序列重新进行Token化。而且每次智能体工具调用都要执行一次Token化,"郑义俊说道。这既增加了Token化的频率,也增加了涉及的Token数量。郑义俊表示,未来的Token化器或许能找到缓解这一问题的方法,但对于当前的大语言模型推理而言,这依然是个棘手问题。
该论文发现,随着序列长度的增加,首Token延迟(模型生成回复第一个词所需的时间)可能急剧上升,而拥有更多核心的CPU可以改善这一问题。在较长序列长度的测试中,增加CPU核心数量可将首Token延迟降低约1.5倍至7倍。
由于测试硬件的限制,郑义俊及其同事只能对阿里巴巴Qwen 3-30B和Meta的Llama 3.1-70B等较小的模型进行测试。他推测,更大的模型由于对GPU的整体需求更高,所受的瓶颈影响会相对较小,但他同样预计智能体AI将把Token序列长度推向远超当前测试范围的水平。
"以Anthropic的Claude为例,Token数量轻松就能达到50万甚至100万,"郑义俊说,"在智能体AI的世界里,平均序列长度会不断增长,我预计这个问题在未来的工作负载中将愈发突出。"
亚马逊对CPU资源使用的收紧,是昆杜和郑义俊所发现的这些问题具有现实意义的诸多佐证之一。
英特尔服务器CPU的订单已经排到至少今年年底。AMD将服务器CPU的出货预期上调了一倍。Arm和高通均已发布专为加速智能体AI而设计的新款CPU。就连英伟达也将其基于Arm架构的智能体AI专用CPU——Vera列为优先项,该产品是英伟达Vera Rubin平台的重要组成部分。
金博尔表示,这些进展清楚表明,AI行业正在对CPU性能给予更多重视。他认为,这股需求浪潮是一个"绝对明确的信号",说明CPU已被视为智能体AI系统的核心组成部分。
然而遗憾的是,这可能意味着更大范围的CPU短缺和价格上涨,正如此前在GPU和内存领域发生的情况一样。
"某种程度上,CPU荒已经初现苗头。市场上的供应紧张甚至开始蔓延到消费级市场,"金博尔说。他还补充道,英特尔已缩减消费级CPU的产能,转而优先保障服务器CPU的供应,尽管其全新的18A制程工艺已经带动了客户端业务的销售增长。金博尔认为,这一迹象表明CPU厂商将跟随资金流向作出决策。
Q&A
Q1:为什么智能体AI会导致CPU需求激增?
A:智能体AI系统允许模型自主运行并调用子智能体。当一个智能体工作负载派生出大量子智能体时,每个智能体都需要进行API调用、解析输出、调用工具等操作,这些任务都运行在CPU上,而非GPU。AMD的测试显示,真实智能体AI流水线的八个阶段中,有七个完全在CPU上运行,由此导致CPU需求大幅上升。
Q2:Token化为什么会成为大语言模型推理中的CPU瓶颈?
A:Token化是大语言模型推理的第一步,负责将文本转换为模型可处理的Token ID,这是一种分支多、依赖数据的顺序字符串操作,并行化程度远低于矩阵运算。在智能体AI场景下,每次工具调用都需要对整个上下文序列重新进行Token化,随着序列长度不断增长(如Claude可达100万Token),CPU的处理压力会显著增加,直接拉长首Token延迟。
Q3:目前各大芯片厂商如何应对CPU需求暴增的问题?
A:英特尔服务器CPU订单已排至年底,同时缩减消费级CPU产能以优先供应服务器市场;AMD将服务器CPU出货预期上调一倍;Arm和高通发布了针对智能体AI优化的新款CPU;英伟达也将基于Arm架构的智能体AI专用CPU——Vera列为优先研发方向,作为其Vera Rubin平台的重要组成部分。