跳到主内容
爱游戏体育平台

一半的活已经不归 GPU 管了

2026-09-27 · 于亚楠 · 更新于 2026-09-28

在平头哥算力峰会上,我现场听了两场演讲,一场聚焦CPU,另一场围绕网卡。

返程路上我一直在想,为什么舞台留给了CPU和网卡?后来梳理发现,台上两位绕了一大圈,其实讲的是同一件事——GPU之外的战场。

怎么理解呢?我试着说清楚。

先说CPU那场,主讲人是平头哥半导体产品总监黄伟。他开场就定调:在agent时代,CPU的角色发生了根本性变化。为什么?他说要看任务性质是否改变。

过去大模型推理是一问一答,这个任务基本由GPU承担。

但agent不同。为了完成一个任务,它需要不断循环:推理一步,调用工具,查看结果,再推理下一步,直到任务完成。

调用工具这一步,无论是跑代码、查网页还是读文件,干的都是CPU的活。

还有那份必须一直保留的长上下文——模型与你这一单的来龙去脉,每一轮推理都需要它作为原料,主要由CPU侧的内存来维护。

他给出了三个数字。

在agent场景中,仅工具执行一项,就占到整个请求响应时间的六成左右。在编码agent场景中,容器初始化加工具执行,在CPU这边要占55%到60%。总体算下来,CPU已经扛起了过半的负载。

数据是现场给的,实验条件没有展开,但结论很干脆:CPU重新回到了AI计算的关键路径。

他把任务分成两类,这是整场演讲中我印象最深的框架。

一类是紧贴GPU干活的,他称之为head node,即机头。GPU出大力,机头管杂事,就像司机带了个副驾,请求进来先由它预处理。

KV cache归它打理,这是模型顺手记的草稿笔记,记录了之前计算过的内容,回答下一句时就不用从头再算一遍。笔记放在哪里、怎么搬运,都是它的事。

什么时候唤起加速器开工,最后结果怎么拼回去,也是它调度和收尾。这活卡在关键路径上,机头慢一步,按小时烧钱的GPU就得空等一步。

因此,为机头改进CPU,处处都冲着单核速度。

前端做宽,相当于把进料的单行道拓宽,一个节拍能多吃进几条指令。

乱序窗口放大,好比老师傅炒菜不会等一道菜出锅再备下一道菜的料。窗口大,就能往后看几十步,哪条指令能先算就先算。

KV cache在CPU和加速器之间来回倒腾,地址翻译经常查不到门牌号,每次像翻字典一样一页页找。解法是页表预取,教CPU提前把下一页翻好。

还有个隐蔽问题:两条本来不相干的操作,被系统误判成占用同一个地址,明明能并行却被排成了一条队。内存重命名就是拆穿这种误判,把路让开。

在软件那头,连Python解释器派发指令的开销都一条条地抠。

在缓存这头,把KV cache的元数据在三级缓存和内存之间分层摆放,常用的放近处,别让加速器等一份本该到手边的笔记。

另一类是跟推理脱钩的,称为agent rack,即一排agent机房。

一个机柜里塞进几百个沙箱,每个沙箱里有一个agent在工作,调用工具、运行代码、规划步骤、编排任务链条、管理自己的状态。

这些全不碰GPU,全在CPU上。这活不求快,求多,一个机柜尽量多塞agent,还得让几百个实例别互相抢资源。

解法是另一套。

agent的循环中有大量不规则的跳转,CPU干活靠预判下一步,传统预判法在agent身上老是猜错。于是引入神经分支预测,让CPU靠经验培养出直觉。

RAG检索、图数据遍历这类活,是顺着一根藤要挖出一串薯。数据在哪条依赖链的下一环,CPU别等用到再找,图预取就是顺着链提前挖。

几百个沙箱共用缓存,等于几百户抢一个储藏室。动态缓存替换按各家的活跃度勤换货,把没人用的腾出去。

MPAM则是给每个沙箱定水电表配额,核的周期、带宽各用各的,谁也不能把公区挤瘫。

他对这两类活有一句原话,挺形象:机头看内存,看能不能搬得快;机房看内存,看能不能装得多。

全场还有两个数字容易被滑过,我觉得才是地基。

一个是41%。他说在机头场景的一次迭代任务中,41%的活没办法靠并行摊掉,尤其是调度控制面这部分。

这数字背后是阿姆达尔定律:串行的活加人没用,一锅水烧开了,再多人往灶里添柴也快不了。

整个系统的响应时间,下限就是这41%的串行段决定的。想让机器快,只剩一条路——单核本身变快。机头对单核性能的执念,根子就在这里。

另一个是28GB。

机房实测显示,单个agent实例到峰值时,需要的内存能达到这个量级。一个机柜要装几百个实例,内存不堆到天上,门都没有。

这也是为什么这颗CPU光有核不够,容量本身就是竞争力。

这些分析不是白做的。第二天云栖主论坛上,平头哥首次公布倚天CPU路线图:2027年出倚天720和730,之后是750,第二代自研核,自研片间互联直连真武AI芯片。

黄伟在页尾只提了一句路标,其实他就是给那份路标写的说明书。

第二场是关于网卡。主讲人是阿里云智能集团高性能网络研发负责人付斌章,他一上来先算账。

他说前面好几场嘉宾都提到,现在到了推理阶段,往往是通信决定一半以上的性能。但网卡本身的成本在集群里占不到20%,有的甚至只有一成。

意思是,整个机房投入产出比最高的一项,是大家不太回头看第二眼的小板子。

他摆了三件麻烦事。

第一件,混跑。集群租出去后,租户跑什么你说了不算。训练、推理、强化学习,三种流量挤在一张网上。训练的流量像高速上匀速的大货车,推理的流量是不断变道的轿车。货车一被打断,整个车队跟着降速。

第二件,长距。

现在的推理流行PD分离。一道题拆成两段干:读懂题、打好草稿算一段,把答案一个字一个字往外蹦算一段。两段分别用不同的GPU跑,省卡。

麻烦在于,两段一旦不摆在同一批机柜,数据就得跑出机房,上广域网。机房里跑一个来回一百微秒,跨了城市是5到10毫秒,慢了两个数量级。

网络传数据本质像车队行军:先派探路车报路况,大部队才敢加速。探路回报慢一百倍,大部队只能降速,有效带宽掉下悬崖。

第三件,弹性。

agent的活儿说来就来,容器秒拉起,干完就销毁。可RDMA这种快车道(机器绕开CPU直接互读内存的高速通信方式),要提前把整条通路的资源、地址都铺排好才肯干活,像包专线货运,发车前先排时刻表。

只活几十秒的容器等不起,所以很多人最后退回TCP这种随叫随到的通用方案,性能损失自己咽。

对付这三件麻烦,他先铺开一张地图。这块信息密,记一句就行:分场景修路。

训练走HPN(高性能网络),一代比一代吃得下更多接入。上一代靠51.2T的交换芯片撑7.0版本,主力8.0用102.4T,在研的9.0上200T。T是万亿比特,芯片吞吐的单位。

卖点是两层网络就挂几十万个800G的接入端口,相当于立交桥只修两层,却上得下几万台车。

推理走新架构TPN(按token性能设计的网络),干的事一句话:把两张从没打通的网连成一张。

机房里本来有两张网:机头网络跑业务进出,机尾网络连GPU之间的高速数据,互不相通。

没配机尾的小卡做PD分离,只能挤机头那条道,机尾空着。TPN在两道墙中间开了门,同一个集群里各组机器(行话叫pod)能互相喂数据,分离的两端不出机房就能对上话,长距传输直接省掉。

真要跨集群,流量走骨干网里的智算专线,阿里给它起名叫ECORE,带宽比普通骨干高一个数量级以上,全程支持RDMA。

超节点内部的互联另有一张,叫UPN(超节点网络),光互联,机器物理上不用绑死,一层铺得下千卡。

然后,是主角:磐脉920。他报的规格是400G带宽,一秒能过4000亿比特的数据,面向智算和存储两个场景。

他讲得最起劲的是另一个设计。

这张网卡里内置了一个交换机,等于自带一块分电板。各家CPU对PCIe这条数据通道的脾气不一样,没有这块板子,换个计算平台就可能踩一次坑。

有了它,同一张卡插到不同平台上,都能稳定输出GPU直接读写网卡、不绕CPU的那套性能。

协议它跑两套:业界标准的RoCEv2,加上阿里自研的SolarRDMA。

自研这套最早在存储场景里磨,后来才用到智算。他的原话是:把存储和计算的坑都趟完了。最值钱的功能是按连接逐条自动选路:新卡碰新卡,自动走自研的快道;碰上老卡,退回标准协议。

老集群不用拆了重建,一张一张换就行,业务不停。他说这种无感的增量部署,工程上价值非常大。

四张成绩单,口径都是现场给的实测。

第一张之前,他先拆了一个流传很广的误区。他说两年以前,你要说预训练用不上好协议,没毛病。大模型训练就是单一大任务,环形算法轮着传,每张网卡只跟自己的邻居说话,带宽就是一切。

今天这话过期了。现在是训推一体的集群,推理的流量随时闯进来,预训练被搅得跟着降速。

千卡任务实测:把大传输拆成小包,多条路同时飞,哪条拥塞或者哪台硬件坏了就自己绕行。数据并行的通信耗时降43.2%,端到端性能提12%。

第二张,跨集群长距。

端侧给流量打标,广域交换机照着标挑更优的路。丢包只补丢的那几张,不用整摞重发。端到端吞吐提55%。

第三张,弹性。

新的虚拟化技术把资源分配挪到软件控制路径,连接密度是传统网卡虚拟化的64倍,容器拉起时间最少省35%,最多省93.4%。

他撂了句狠话:这个弹性不拿性能换,套了虚拟化跑通信,速度和硬件直通几乎一样。按他的说法,专线的速度和网约车的灵活,目前只有这张卡能同时给齐。

第四张,小包。高性能计算传的数据正文很小,包裹没封箱带厚。这张卡走「以太网+」协议,削前导码、绕开链路层开销,正儿八经的内容能占到85.4%,他说业界最高。

落地的交代很短:磐脉920已经跟着灵骏真武M890超节点上线,超节点配的就是这张卡。

两场演讲,单听各管一摊,放一起看,挺有意思。

黄伟说,agent场景里CPU扛起了过半的负载。付斌章说,推理阶段过半的性能由通信决定。两个过半,口径不一样:一个量时间,一个量性能。

但指向是同一个。请求进来之后,GPU算完的那一段,在整条路上越来越不稀罕了。剩下的大头,落在CPU、内存、网络上。

模型有多聪明,看GPU;agent把活干得多利索,看这些地基。

黄伟下台前收尾,希望倚天为Agentic AI时代的普惠算力贡献一份计算底座。付斌章没说场面话,他只留了个落地,就是前面那句超节点上线。

倒是串场的主持人,给了句不错的总结。

人工智能的竞技场,已经从参数规模角逐,转向工程落地的深水区。单点的突破,撑不起智能体时代的系统级负载。

台上两个人讲了四十分钟,都在给这句话当证词。

我这趟带回来的,其实是个记账方式的变更。过去聊算力,问你有几张卡?往后可能得问,一个请求进来,你的时间花哪了,带宽堵哪了,内存够谁用。

卡多不等于活好,这个账,行业刚开始认真算。

注释: [1]. 本文内容来自我2026年9月23日在平头哥算力峰会分论坛的现场记录,演讲实测数字均为现场披露口径

本文来自微信公众号 “王智远”(ID:Z201440),作者:王智远,36氪经授权发布。

更多文章