2026 OCP China Day开放计算技术大会于北京重磅举办,这是OCP深耕中国市场的第七届行业盛会,由OCP开放计算社区与OCTC开放计算标准工作委员会联合主办,汇聚全球头部云厂商、芯片企业、算力基础设施服务商及行业技术专家齐聚一堂。

大会聚焦AI数据中心、全域算力互联、绿色数据中心、边缘连续计算等前沿赛道,深度分享开放计算全栈技术标准、生态共建成果与规模化落地实践。

Astera Labs CTO 办公室负责人、UALink 与 CXL 联盟董事会成员 Chris Petersen 先生出席此次大会,并发表《Choose Your Own XPU:An Open Rack to Maximize Inference Performance and TCO Tokens-Per-Yuan》主题演讲。

Chris 从 2011 年首届 OCP 峰会便参与开放计算社区,见证开放硬件标准多年发展。他指出 AI 应用大规模普及后,云厂商、AI 实验室对算力基础设施的需求持续迭代;推理场景走向专业化异构部署,行业高度关注单 Token 综合成本,亟需一套高利用率、高可靠的开放机架互联架构解决现存痛点。

当前 AI 基础设施建设主要围绕三大核心方向推进,一是实现 Token 层面的成本最优,通过优化算力功耗表现,持续压缩单 Token 产出的综合成本;二是具备集群级异构扩展能力,能够同时兼容 CPU、GPU、通用 XPU、轻量化 LPU 等多种不同架构的加速硬件;三是保障全链路稳定可靠运行,最大化硬件在线时长与资源利用率。

Scale-Up 互联架构是整套 AI 机架的核心中枢,算力、内存、存储之间的高速互联网络直接决定三大需求能否落地,整个行业都需要一套通用性强、适配全场景的 Scale-Up 互联体系来补齐现有技术短板。

一套可落地的通用 Scale-Up 互联方案,需要同时满足四项硬性标准:具备通用内存语义接口,能够适配各类差异化算力平台;支持超大规模集群扩展,兼顾超高传输带宽与极低延迟;搭载原生智能调度能力,持续提升算力资源利用效率;实现全天候稳定运行,依托统一标准化机架完成硬件复用。

Astera Labs 长期深度参与 PCIe、CXL、UALink 2.0 等行业标准的制定工作,同时持续深耕 OCP 开放计算社区,基于行业需求完成了全套互联技术的研发落地。

整套互联技术体系可以精准匹配行业全部核心诉求,依托经过数十年数据中心场景验证的 PCIe 总线作为底层基础,天然兼容全品类异构硬件;采用高基数芯片架构,支撑海量算力节点同步组网。

内置 Hypercast™与网内计算双硬件加速单元,实现集群通信效率跃升;搭配多平面并行传输架构与高级互联 RAS 可靠性管理机制,配套 COSMOS 全栈运维软件保障稳定运行。

基于这套成熟的技术路线,Astera Labs 推出全新 Scorpio 智能互联交换解决方案。

Scorpio X 系列智能 Fabric 交换芯片是当前业内规格最大、支持内存语义的开放互联交换芯片,整套解决方案基于 PCIe Gen6 技术打造,整合 Hypercast 硬件加速、网内计算、多层级故障容错三大核心能力,搭配配套 COSMOS 运维管理软件,形成从底层芯片到上层管理平台的完整 AI 机架互联体系,能够适配搭载各类 XPU 加速器的标准化开放机架。

单颗 Scorpio 交换芯片即可搭建一套基础 AI 服务器单元,硬件层面可同时承载 2 颗 CPU、8 块 GPU 以及 4 张网卡,硬件拓展空间充足,这套基础硬件组合被定义为 Scorpio AI 计算平台,也是实现大规模算力集群扩容的基础单元。

多台 Scorpio AI 计算平台可通过上层 Scorpio 交换设备完成机架内互联,搭建多级交换互联网络,算力规模能够线性灵活扩容,从初始 8 颗 XPU 逐步拓展至 16 颗、32 颗、64 颗,既能匹配当下推理业务的算力需求,也能支撑未来 AI 业务持续扩容带来的算力增长。

依托计算平台与上层交换平台双层标准化硬件组合,整套互联架构最高可支持 512 颗 GPU 并行组网,完美适配超大规模 MoE 混合专家大模型推理场景。

该扩容模式无需重构底层硬件架构,仅新增标准化交换单元就能完成平滑扩容,大幅降低硬件迭代升级成本,高度契合开放计算机架硬件复用的核心设计理念。

Scorpio 交换芯片内部集成两大专属硬件加速引擎,由 COSMOS 软件统一调度管控。Hypercast™数据复制引擎针对 all-gather、all-scatter、all-to-all 等组播通信操作实现硬件加速;网内计算(INC)引擎负责卸载 all-reduce、reduce-scatter 聚合运算。

两大引擎协同作用可将集群集体通信操作性能最高提升 2 倍,直接翻倍算力可用带宽,减少 GPU 等待数据同步产生的闲置损耗,从底层硬件层面降低单 Token 算力综合成本。

当前主流大模型普遍采用 MoE 混合专家架构,该架构不会为每一条 Token 激活全部模型参数,仅调度对应少量专家层参与运算,以此提升大模型运行效率,支撑超大参数量 LLM 落地。

但该架构也带来了全新的网络传输痛点,模型每一层运算都需要将数据组播分发至多组独立专家算力单元,传统交换机能够支持的并行组播分组存在硬性上限,极易产生带宽瓶颈,无法充分释放 MoE 架构本身的性能优势。

传统交换设备的组播能力存在天然短板,设备能够承载的并行组播分组数量有限,仅部分集群通信操作可依靠硬件加速,其余运算只能切换至低效单播传输链路,进而形成网络瓶颈。

随着 AI 集群挂载 GPU 数量持续增长,MoE 模型对应的专家组合数量呈指数级上涨,老旧互联架构的缺陷会持续放大,最终拉高整体 Token 运营成本。

Hypercast 是专为 AI 场景原生打造的组播技术,原生支持海量并行分组传输与动态专家路由调度,适配高频次集群通信运算。

该技术突破传统交换机分组数量限制,可同步承载海量 MoE 专家路由组合,最大化单颗 XPU 硬件可用带宽,从互联底层解决混合专家模型运行时的网络瓶颈,充分释放异构算力硬件的全部性能潜力。

整套 Scorpio 互联体系搭建起四层完整故障容错设计,实现全链路稳定运行。

芯片设计层面将数据平面与管理、控制平面物理隔离,固件故障不会中断业务数据流;物理信号链路支持拓扑自适应信号调优,自动识别破损线缆、接头、针脚等硬件瑕疵;传输链路具备超低误码率,链路故障时自动切换多并行数据平面分流,快速隔离故障点位。

整机互联架构采用分布式隔离设计,单节点故障不会扩散至整个集群,多层级可靠性设计能够有效减少大规模推理机房的算力停机损耗。

标准化开放机架整体由 XPU 计算平台、Scale-Up 交换平台两大硬件单元构成,整套架构基于通用开放协议搭建,原生兼容 Hypercast、网内计算、多层级故障容错全部核心能力,同时支持多品牌、多类型 XPU 硬件灵活选配。

标准化硬件单元可跨多代加速器复用,缩短硬件认证周期、加速项目落地,无需改动底层架构即可适配 LPU 等新型推理芯片,有效降低机房全生命周期 TCO 总体拥有成本。

配套 COSMOS 管理软件覆盖故障定位、批量部署、性能监控、多租户网络分区四大核心功能,全面兼容 OpenBMC、DMTF、SAI 等 OCP 开放行业标准。

软件可统一管控单机架至多机架完整集群,支持动态划分隔离网络,实时定位互联故障、监控全链路运行指标,为大规模 AI 推理机房提供完整、标准化的全链路运维能力。

Astera Labs 可提供完整机架级 AI 高速互联解决方案,产品线覆盖 PCIe、CXL、UALink、以太网全技术路线,同时配套铜缆、光互联完整硬件产品矩阵。

Scorpio 智能 Fabric 交换芯片是业内规格最大、支持内存语义的开放交换芯片,内置双硬件加速引擎优化集群通信性能,从底层优化单位功耗算力表现、降低单 Token 产出成本。

全系产品已完成主流 XPU 芯片互联互通验证,标准化开放架构可适配任意厂商 AI 加速器,当下正是搭建通用 Scale-Up 算力基础设施的最佳窗口期,依托这套标准化互联架构,行业能够真正实现按需自选 XPU 算力硬件的灵活部署模式。

本次分享全部技术内容到此结束,现场开放交流通道,欢迎各厂商、技术从业者会后前往 Astera Labs 展台深度沟通,结合自身 XPU 硬件产品探讨标准化开放机架的落地路径,探索定制化 AI 算力基础设施搭建方案。