2026 OCP China Day开放计算技术大会于北京重磅举办,这是OCP深耕中国市场的第七届行业盛会,由OCP开放计算社区与OCTC开放计算标准工作委员会联合主办,汇聚全球头部云厂商、芯片企业、算力基础设施服务商及行业技术专家齐聚一堂。

大会聚焦AI数据中心、全域算力互联、绿色数据中心、边缘连续计算等前沿赛道,深度分享开放计算全栈技术标准、生态共建成果与规模化落地实践。

阿里云首席云服务器架构师、CXL和UCle董事会代表 陈健 先生专题分享聚焦 Agentic AI 浪潮下算力架构变革,完整梳理 AI 算力三代演进路径、智能体工程迭代逻辑。

同时讲解 CPU 利用率提升、GPU 推理全链路优化方案,最终推出 UMX 统一内存互联全栈异构算力底座,阐释 CPU 与 GPU 协同共生的新一代基础设施设计思路。

陈健 先生本次分享核心命题为 Agentic AI 重构传统以 GPU 为核心的算力体系,行业算力发展正式进入 CPU、GPU 分工配合的协同新阶段,过去单一依靠 GPU 承载全部 AI 工作负载的模式,已无法适配智能体自主拆解任务、长期持续运行的业务需求,全栈异构协同架构成为必然发展方向。

AI 算力发展分为三个清晰阶段:1990 至 2012 年属于传统机器学习阶段,算法计算量、数据集规模偏小,算力以 CPU 为核心;2012 到 2025 年深度学习全面普及,AlexNet、Transformer 将视觉、大语言计算迁移至 GPU,海量并行计算需求推动算力转向 GPU 主导。

2025 年起迈入 Agentic AI 时代,智能体需要自主规划、工具调用、长会话记忆管理,CPU 承担大量逻辑调度工作,正式形成 CPU-GPU 协同的均衡算力架构,同步覆盖推理、任务编排、多轮长周期业务场景。

智能体工程历经四层迭代,持续降低人工介入比例、稳步抬升 CPU 利用率:初期 Prompt 工程依靠人工编写指令与示例,交互模式单一。

第二层上下文工程依托 RAG 完成历史会话检索组装,人工操作减少;第三 Harness 工程增加权限管控、异常容错,智能体自主处理边界问题。

最终 Loop 工程仅需设定最终目标,任务拆解、执行、复盘重跑全部自主完成,人力逐步退出流程,CPU 调度与处理负载持续上涨。

伴随智能体工程升级,记忆管理复杂度同步提升,四层记忆体系逐层拓展 CPU 算力需求:短时记忆仅负责单次对话 token 统计、文本切片;关联记忆增加向量检索、上下文重组;结构化记忆依托知识图谱完成图遍历、关联信息提取;反思记忆可自主复盘历史、压缩合并记忆片段,实现智能体自我迭代。

多层记忆让上下文精度持续提升,GPU 推理效率同步优化,但 CPU 的调度与存储管理负担持续加重。

行业普遍采用主从智能体混合执行架构,两类负载特性差异明显,带来全新 CPU 资源调度挑战:Master 主智能体为有状态长周期进程,承载十万级 token 长上下文,统筹所有子任务并汇总结果。

Sub 从智能体属于瞬时无状态任务,仅执行单一原子操作,任务结束即清空上下文。两类负载混部会频繁抢占缓存、页表资源,算力调度平台必须针对智能体生命周期、上下文特征做精细化 QoS 管控。

常规智能体运行存在大量 CPU 空闲时段,分为宏观闲置、微观闲置两类:定时任务、人工指令触发间隔形成长时间空转;调用大模型时 200 毫秒至数秒的等待周期,造成瞬时算力浪费,常规智能体 CPU 有效运行占比不足 20%。

基于操作系统时分片多路复用实现 vCPU 超卖,可达成 4-5 倍算力复用比例,大幅拉高 CPU 平均利用率,但并发请求上涨后会同步加大 GPU 推理集群压力。

针对智能体并发请求带来的推理压力,GPU 优化分为三大核心路径:批处理区分静态、连续批调度,新请求可即时填充空闲算力,减少任务排队损耗;算子分层将 Prefill 填充、Decode 解码、Attention 与前向网络拆分流片,匹配各自计算、存储负载特征;KV 缓存复用重复前缀计算结果,省去重复填充步骤,三类技术协同缩短大模型响应等待时长。

KV 缓存从命中率、存储效率两个维度完成深度优化:命中率层面迭代三层技术,从分块哈希、基数注意力,升级至脱离文本位置的独立语义缓存,同一段语义可跨场景复用;存储效率依靠量化、压缩技术扩容缓存容量,TurboQuant 将 16bit 数据压缩至 2-4bit,DeepSeek 相关压缩算法最高实现近 10 倍 KV 缓存压缩,同等硬件可承载更长上下文。

Engram 是 CPU、GPU 高效协同标杆架构,传统链路中全部事实知识均依靠 GPU 解码生成,解码周期冗长;引入 Engram 后静态知识库部署于 GPU 侧 CPU,推理过程可直接从 CPU 调取固定知识,大幅缩短 Decode 阶段耗时,降低完整推理链路延迟,实现算力分工互补。

阿里云推出 UMX 统一内存扩展互联体系,融合互联芯片、多层介质内存、配套软件协同设计,依托 UALink+CXL 高速互联总线搭建 Alink 可扩展交换架构,将 HBM 高速显存、DRAM、SCM 持久内存、多规格 SSD 统一接入同一互联平面。

通过加载存储原生语义调度不同时延存储介质,打造超大容量低延迟 KV 缓存池,适配海量智能体长上下文推理需求,下午分论坛将开展深度技术解读。

整套面向智能体的 AI 基础设施实现全栈异构互联:AL128 超节点集群依靠 Scale-Up 总线完成节点内高速互联,节点间通过 Scale-Out 网络横向扩容。

超节点通过 CXL 对接 UMX 多层缓存池,再经由数据中心网络连接高密 CPU 整机柜、云存储与各类云上服务,整体架构 CPU 与 GPU 配比接近 1:1,实现推理、智能体调度算力均衡分配。

Agentic AI 时代算力的核心逻辑是协作共生,AI 业务不再是仅依托 GPU 独立运行的单一负载,而是 CPU、GPU、多层存储与高速互联架构协同工作的综合体系,只有搭建均衡异构的全栈算力底座,才能充分释放智能体自主规划、多模型协同、长周期持续运行的完整业务价值。