上海仪电助力新一代大模型推理网络架构ZCube首次在国产算力集群完成系统性验证

发布日期:2026-06-25 信息来源:市国资委

近日,由清华大学、上海仪电与上海驭驯联合开展的“新型智算集群组网架构ZCube”项目,依托互联网体系结构全国重点实验室上海智算分室,完成了扁平化组网架构相对传统组网架构的系统性对比验证。测试结果显示,该架构在推理吞吐、响应延迟等核心指标上全面优于当前主流Clos架构,为国产算力集群的规模化部署提供了技术参考。

图1.png

32卡ZCube集群的组网架构三维示意图

当前,智算集群普遍采用Clos多层交换架构,在大模型推理场景中易出现局部链路拥塞,影响首字响应速度与整体吞吐。ZCube采用全网扁平化拓扑设计,取消Spine层,以“单轨+多轨”混合接入方式实现任意GPU间仅两跳直达,从架构层面规避结构性拥塞,同时可减少约三分之一交换机与光模块成本。该设计论文已发表于网络领域顶级会议ACM SIGCOMM 2025。

图2.png

ZCube架构与Clos架构(Fat-Tree、ROFT)的对比示意图

本次测试在1024卡国产算力集群规模上以背靠背独立测试方式对比ZCube与Clos架构。推理场景中,在PD分离部署下,覆盖8种不同节点调度方式。平均首Token时延(TTFT)降低22%至30%,总吞吐提升7%至10%。训练场景中,在Qwen3 235B(EP8 PP8)MoE模型上,覆盖十余种配置,ZCube单次迭代时间与Clos基本持平,部分配置略有优化。集合通信任务中,AlltoAll优势随规模扩大而增强,最高实现14.7%的吞吐优势;Allgather与Allreduce两者性能持平。

在今年5月,智谱已在GLM-5.1 coding推理服务的千卡生产集群完成ZCube实际部署,实现交换机与光模块支出下降33%、GPU推理吞吐提升15%、TTFT P99降低40.6%。本次国产平台复现结果与前期结论方向一致,核心优势得到再次验证。

目前,此项技术与产业应用案例入围2026年度世界人工智能大会卓越人工智能引领者奖(SAIL奖)TOP 30,成果孵化的上海驭驯已落地并入驻上海仪电旗下仪智空间,实现产学研成果闭环孵化。技术上,本次验证证明ZCube扁平化组网思想不依赖特定GPU品牌或型号,具备跨平台推广潜力。团队后续将围绕更大规模集群与更多类型国产算力卡持续适配,稳步推进ZCube成为下一代智算中心建设标准。