解读中科曙光全栈自研scaleFabric原生无损RDMA高速互联网络的核心优势

描述

当下AI算力竞争,早已告别单一芯片性能的单点比拼,进入全域系统效率的综合角逐。随着大模型训练、高性能计算集群规模迈向万卡、十万卡级别,制约算力释放的核心瓶颈,不再是单卡算力上限,而是集群节点间能否实现高效协同、无损联动。在全新智算体系下,高速网络不再是简单的设备连接通道,而是盘活、释放、稳定保障算力的核心基础设施。

立足大规模算力集群的核心痛点,中科曙光全栈自研scaleFabric原生无损RDMA高速互联网络,聚焦AI训练核心场景,围绕高性能、高扩展、高稳定三大核心维度深度优化,为国产大规模智算集群搭建坚实的“算力大动脉”。

作为国内首款全链路自主可控的类InfiniBand高速互联产品,scaleFabric实现从核心SerDes IP、交换与网卡芯片,到硬件设备、管理软件的全栈自研,彻底打破海外高端高速网络技术垄断,补齐国产高端无损互联技术短板,是全国一体化算力网络建设的核心国产化支撑。

区别于传统以太网迭代方案,scaleFabric坚守原生无损RDMA技术路线,搭载专属信用流控与链路层重传机制,从底层规避传统网络的拥塞抖动、传输损耗、丢包卡顿等问题。相较于常规RoCE网络,它可实现真正端到端无损传输,故障恢复时间低于1毫秒,大模型训练全程无感,彻底解决大规模集群组网的算力损耗难题。

极致性能是scaleFabric的核心竞争力。产品搭载自研核心网络芯片,400G网卡依托PCIe 5.0接口,单端口带宽达400Gbps,端到端通信时延低至0.93微秒;自研交换芯片专属转发架构,让整机双向交换容量达64Tbps,转发时延低至260纳秒,核心指标全面对标国际顶尖产品。实测数据显示,搭载scaleFabric的AI集群训练效率提升40%以上,端口密度与综合性能较同类产品提升25%,可完美支撑十万卡级超大规模集群稳定组网。

在近期ISC高性能计算大会发布的IO500全球榜单中,中科曙光ParaStor F9000全闪存储系统在生产型全节点和10节点榜单中实现双榜第一,创下国产存储全新纪录,而scaleFabric高速网络正是此次登顶的关键核心支撑。通过存网深度协同,其高带宽、低时延、高稳定的特性,充分释放了全闪存储的极致性能,印证了国产自研高速网络的实战硬实力。

同时,scaleFabric具备极强的场景适配性与拓展能力,覆盖风冷、液冷多元硬件形态,可适配传统数据中心、新一代绿色智算中心各类部署场景。架构可平滑拓展至十万卡集群规模,兼顾高性能与低成本扩容,完美适配算力规模化、集约化发展趋势。

AI算力的竞争是一场系统工程。 当集群规模从万卡迈向十万卡,网络已不再是配角,而是决定整体效率的核心变量。中科曙光将继续加大网络互联领域投入,推动scaleFabric成为中国高端计算的重要互联底座,真正实现“让中国算力更好地跑在中国网络上”。

打开APP阅读更多精彩内容
声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉

全部0条评论

快来发表一下你的评论吧 !

×
20
完善资料,
赚取积分