MoE频繁小消息通信引发网络通信挑战
在MoE模型的典型训练或推理中,专家并行通信包含两个核心阶段,每个阶段都涉及海量的小粒度数据交换:
•分发(Dispatch):将每个Token的隐藏状态(通常仅数KB)及其路由信息(如专家ID),从原始GPU发送至目标专家所在的GPU。
•合并(Combine):待专家计算完成后,将输出的梯度或结果按原始路由权重,聚合回Token所在的GPU。

以DeepSeek V3的推理场景为例,每个Token需要经历多轮跨节点的动态分发与合并,通信粒度最小可达KB级,且总通信量随Batch Size线性增长。这表明,MoE推理的通信瓶颈并非源于单次大包传输,而在于高频小包、多轮交互以及对尾时延(Tail Latency)的严苛约束。

(图:MoE New traffic 特征)
通信模式带来两大核心挑战
1延迟成为首要瓶颈
相比实际数据传输,通信的建立、同步及往返时延(RTT)等开销占据了绝大部分时间,导致硬件带宽被严重浪费。
2负载不均衡加剧调度难度
门控网络可能导致某些热门专家收到远多于其他专家的Token,使得负责这些专家的GPU通信压力骤增,成为系统瓶颈,而其他GPU则相对空闲。这种不均衡进一步复杂化了小消息的调度问题。
DeepEP的诞生及IBGDA通信技术
DeepEP是一个面向 Mixture-of-Experts(MoE)模型与专家并行(EP)的高性能通信库,提供高吞吐与低延迟的 all-to-all GPU 内核,专门优化 MoE 中的 Dispatch 与 Combine 两个关键阶段。它不是一个训练框架,也不是一个推理引擎——它是介于上层框架(vLLM、SGLang、Megatron)与底层网络(NVLink/RDMA)之间的"专用通信中间件",把传统通用通信库(NCCL)在 MoE 场景下力有未逮的部分专门抠出来重做了一遍。(设定叙述背景为V1版本,NCCL通信库未升级前)
DeepEP V1版本对MoE模型的针对性优化主要体现在2个方面:
专门针对MoE的分发(Dispatch) 与合并(Combine) 通信模式进行内核级优化,高效处理大量KB级小消息的跨节点收发。
极致性能:通过支持GPU直通网络IBGDA技术,实现GPU绕过CPU直接与网卡通信,大幅降低通信延迟和CPU开销。

(图:AI生成-仅供参考)

(来源:英伟达技术博客)
NVSHMEM 是 NVIDIA 基于 OpenSHMEM 规范实现的 GPU 共享内存通信库。它把多个节点上的 GPU 显存抽象成一个全局对称地址空间(Partitioned Global Address Space, PGAS),任何 GPU 都可以通过 nvshmem_put / nvshmem_get 等单边操作直接读写远端 GPU 的显存。
DeepEP V1(2025 年 2 月首发版)正是直接构建在 NVSHMEM 之上,通过 NVSHMEM 调用 IBGDA,让 GPU SM 在 dispatch / combine kernel 内部直接驱动 NIC 发起 RDMA Write。
IBGDA本身源自于英伟达主导开发和推动的技术,在MoE模型成为主流模型趋势下,DeepEP的火热让 IBGDA 第一次以"决定大模型上线速度"的姿态出现在产业讨论中的工程实现中。
IBGDA vs IBRC
传统的通信模式中,GPU进行节点间通信需要CPU作为“中介”来转发指令,这会带来延迟和CPU开销。而IBGDA允许GPU的流式多处理器(SM)直接创建网络工作描述符并写入GPU内存,然后通过写入网卡的“门铃”寄存器来直接通知网卡进行数据传输。整个过程将CPU从通信的控制路径上完全移除,实现了由GPU内核发起的通信(GPUDirect Async–Kernel-Initiated)。这种“直连”模式带来了巨大的性能提升。尤其是在小消息通信场景下,它能实现极高的消息吞吐率。

(图:AI生成-仅供参考)
CPU是MoE推理数据传输瓶颈
通常GPU在并行计算上比CPU快的多,尽管CPU本身也是多核多线程,但更适合处理复杂的逻辑、分支预测、乱序执行,适合串行任务。而GPU本身就具备数千个计算核心,能同时执行成千万个线程,适合AI模型场景下的数据并行任务。IBGDA通过跳过CPU操作减少CPU处理等待时间,充分发挥GPU在并行计算海量线程的优势,将吞吐和ALL-to-All延迟及计算利用率大大提升。

(图:AI生成-仅供参考)
IBGDA在大规模、延迟敏感的AI推理场景中优势显著。根据英伟达的官方数据显示,在NCCL(NVIDIA集合通信库)中使用IBGDA,在大规模集群上进行All to All通信时,延迟最高可降低75%。因此,这项技术对于需要大量细粒度通信的HPC和AI大模型推理场景至关重要。
以太网IBGDA:国产GPU直通国产RDMA网卡
在国际方案与国产方案的对标中,英伟达凭借其GPU与ConnectX系列网卡的深度协同,率先实现了IBGDA方案,为大规模AI推理场景提供了成熟的延迟敏感型通信能力。而国产集群要实现同等能力,国产化GPU需先满足对类NVSHMEM编程及最新NCCL 通信库以及DeepEP等集合通信库的支持,并与国产RDMA网卡在软硬件层面完成适配,方能实现GPU直通网卡的高效通信。然而,目前国产GPU支持IBGDA主要完成的是与英伟达网卡的适配,但国产RDMA网卡与国产GPU实现网卡直通的规模化落地案例仍相对罕见,这一环节仍是制约国产化集群通讯效率提升的短板。

在此背景下,奇异摩尔推出的单通道400G RDMA ASIC引擎,基于Kiwi SNIC 800G平台架构设计,已完成软硬件协同开发,兼容专为MoE模型优化的集合通信库(对标DeepEP),并原生支持IBGDA(GPU直接发起通信)机制。奇异摩尔已经启动与主流国产GPU的适配验证工作。这一进展在国产高性能网卡多集中于100/200G RDMA引擎的阶段尤为关键,其意义在于为国产大模型推理场景提供了一条高带宽、低时延的加速路径,有助于填补国产方案在GPU直通通信领域的能力空白。值得注意的是,该方案基于开放的以太网生态构建,继承以太网部署灵活、成本可控优势的同时,为国产算力集群提供了一个兼具高性能与自主性的Scale-out网络选择。
2026年7月17日至20日,在即将召开的世界人工智能大会(WAIC)上,奇异摩尔将亮相于张江科学会堂海科厅(展位号 Z1B-515),现场展示与一线GPU厂商合作的 IBGDA 技术方案。诚邀产业同仁亲临现场观摩,并参加7月18日下午“奇异摩尔AI网络前沿生态主题论坛”,共同探索更多先进技术的创新及落地,共促产业生态繁荣。
全部0条评论
快来发表一下你的评论吧 !