三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

从灵骏真武 M890 超节点看@ACP#PCIe5.0 交换芯片 IX9104 在国产算力体系下的落地机遇

从灵骏真武 M890 超节点看@ACP#PCIe5.0 交换芯片 IX9104 在国产算力体系下的落地机遇

摘要:阿里云灵骏真武 M890 超节点实例正式在乌兰察布商用上线,可承载 2 万亿以上参数大模型,Qwen3.8‑Max、Kimi K3 已完成适配对外服务。超节点架构把算力竞争从单芯片性能延伸到整机互联体系。本文从工程实践角度,分析国产 PCIe5.0 交换芯片 IX9104 在超节点生态下的业务痛点、市场机会与典型落地场景。

一、国产超节点时代到来,互联成为算力效率关键变量

WAIC2026 之后,国产 AI 芯片、超节点方案密集亮相,行业共识逐步形成:万亿参数大模型、大规模 Agent 推理业务,不只依靠 AI 加速芯片本身,整机内部的高速互连能力直接决定集群实际算力利用率。

阿里云灵骏真武 M890 超节点实例,作为已经商用落地的国产超节点代表,以 64 卡紧密耦合单元对外输出算力,单实例可支撑 2 万亿参数级别 MoE 大模型运行,Qwen3.8‑Max、Kimi K3 等大模型完成适配,面向公有云训推、私有化超节点、行业大模型推理提供算力底座。

超节点内部,自研 ICN Switch 负责 AI 加速芯片之间的卡间高速互联;而服务器域内 CPU‑NPU、NPU‑高速 SSD、NPU‑智能网卡之间大量数据流,依然高度依赖 PCIe 总线完成调度。在 MoE 模型、Agent 多智能体业务下,KV‑Cache 缓存、向量知识库、工具调用带来大量突发 IO 访问,原生 CPU PCIe 通道数量、带宽往往成为整机的性能瓶颈,高速 PCIe 交换芯片的价值进一步放大鲲鹏昇腾开...。

公有云超大超节点更多使用自研专用互联,但大量政企私有化超节点、部门级中型推理集群、超节点附属存储扩展单元、异构混合算力机柜,依然需要标准化、全国产、高可靠的 PCIe5.0 交换方案,这也是国产 PCIe 交换芯片的核心切入窗口。

二、IX9104 产品定位,匹配超节点衍生业务的核心诉求

IX9104 是国产 104 Lane PCIe5.0 非阻塞交换芯片,单通道速率 32GT/s,提供 26 组可灵活配置端口,支持 P2P 对等传输、NTB 非透明桥接、SR‑IOV 虚拟化、多主机级联,工业宽温‑40℃~105℃,固件与驱动全国产,PIN‑TO‑PIN 对标海外同规格高端交换器件,面向高密度 AI 服务器、国产化算力节点设计。

面对灵骏 M890 代表的超节点生态,整机硬件层面主要面临几类工程痛点:

  1. 单 CPU 原生 PCIe 通道有限,多 NPU、多块 NVMe 向量 SSD、多张高速网卡同时部署时,通道资源紧张,出现带宽收敛;
  2. MoE 大模型推理过程,NPU 与本地知识库盘之间频繁搬运 KV 缓存,希望绕过 CPU 做 P2P 直传,降低转发时延;
  3. 私有化信创场景,要求关键互连器件实现全国产替代,不能依赖海外交换芯片;
  4. 中型集群需要芯片级联扩展,搭建算力池,兼容多主机异构接入,适配混合算力机柜。

IX9104 的能力恰好针对上述痛点,作为算力系统的中间枢纽,完成 PCIe 通道扩展、数据流调度、多设备直连,补齐国产超节点衍生整机的 IO 短板。

注意:IX9104 并不替代 M890 超节点内部 ICN 专用互联芯片,而是作用在服务器 PCIe 域,解决 CPU、NPU、高速存储、网卡之间的互连扩展问题,二者属于架构上的互补关系。

三、IX9104 在 M890 超节点生态下的典型应用场景

场景 1:私有化中型超节点推理服务器(8‑16 卡国产 NPU 整机)

公有云 M890 是 64 卡大规模超节点,而大量政企、金融、能源行业客户,并不会直接采购 64 卡完整超节点,更多落地 8‑16 卡规模私有化推理集群,运行 Qwen、Kimi 等 MoE 大模型、Agent 业务。

这类整机中,使用 IX9104 做 PCIe5.0 通道扩展:单颗芯片扩展多路下行端口,同时挂载多块国产 NPU、多路 NVMe SSD 向量知识库、高速网卡;开启 P2P 直传,NPU 和 SSD 之间数据搬运绕过 CPU,降低 MoE 推理时延,提升大模型并发吞吐量。 业务适配:行业私有化大模型、企业本地 Agent 平台、知识库检索推理服务。

场景 2:超节点配套本地高速存储扩展柜

M890 超节点主要负责 AI 计算,大模型权重、海量业务向量库、日志数据集需要配套高密度本地存储单元。传统方案 CPU 直连硬盘数量有限,引入 IX9104 作为存储域交换枢纽,扩展大量 PCIe5.0 NVMe 设备,构建超节点外部附属存储池。

优势:不需要改动超节点核心计算部分,通过标准化 PCIe 链路对接,实现算力与存储解耦扩容,满足万亿参数模型权重缓存、向量数据库高吞吐读写需求。

场景 3:异构混合算力机柜,超节点 + 通用服务器混合部署

很多智算中心会采用 “大型超节点 + 通用推理服务器” 混合机柜部署,一部分机器跑大规模 MoE 训练推理,一部分跑轻量化 Agent、API 网关、向量检索业务。 IX9104 支持 NTB 非透明桥、多主机模式,可以实现多台主机算力资源池化调度,不同主机下的 NPU、存储资源可以互相访问,提升机柜整体资源利用率,适配智算中心异构混合部署模式。

场景 4:信创智算集群,全国产化算力节点建设

随着国产 AI 芯片占比持续提升,很多政企智算项目要求从加速卡、CPU 到底层互连器件全部国产化。过去高端 PCIe5.0 交换长期被海外厂商垄断,是国产化卡脖子环节。 IX9104 作为全国产 PCIe5.0 交换芯片,可用于信创智算项目中高密度推理服务器,完整适配国产 CPU + 国产 NPU 体系,满足政策对供应链自主可控的硬性要求。

四、落地过程中的工程约束与选型提示

  1. IX9104 面向 PCIe5.0 域 IO 扩展,不能替代超节点内部专用卡间互联芯片,架构设计上需要区分专用高速互联与 PCIe 交换的分工;
  2. PCIe5.0 信号速率高,PCB 设计、信号仿真、散热设计是整机成败关键点,需要严格按照芯片参考设计完成硬件开发;
  3. Agent、MoE 业务大量使用 P2P 功能,需要整机 BIOS、内核驱动、大模型推理框架协同适配,充分验证 P2P 稳定性;
  4. 更小规模 4 卡及以下边缘推理整机,优先选择 PCIe4.0 系列交换芯片,平衡成本与性能,IX9104 更适合 8 卡以上中高密度算力节点。

五、结语

灵骏真武 M890 商用落地,标志国产超节点从展会样机走向实际业务交付。超节点竞争不只是 AI 加速芯片的比拼,CPU‑加速卡‑存储‑网卡之间的互连系统,成为影响整机实际输出能力的重要环节。

IX9104 作为国产高端 PCIe5.0 交换芯片,不参与超节点内部卡间专用互联,而是聚焦服务器 PCIe 域的通道扩展、多设备调度,在私有化中型推理整机、配套存储扩展柜、异构算力机柜、信创智算集群这些细分场景打开替代空间,是国产算力基础设施链条中不可忽视的中间枢纽器件。

← 返回列表