OpenAI联合多家巨头发布MRC协议:助力超级计算机高效运行,突破算力利用率瓶颈

01 破解网络难题,MRC对扩展超级计算机有三大助力
训练大模型时,数据传输易出现延迟和抖动,随着算力基建规模增大,网络拥塞、链路和设备故障等问题更难解决。OpenAI联合多家芯片公司打造MRC,目标是打造即使出现故障也能提供高度可预测性能的网络,以保持训练任务持续推进。
MRC是对聚合以太网RDMA(RoCE)的扩展,借鉴超以太网联盟(UEC)研发的技术,并基于SRv6源路由对其进行能力扩展,支撑大规模AI网络架构组网。该网络架构已依托英伟达和博通的硬件,支撑多款OpenAI模型训练。AMD为MRC贡献拥塞控制技术,提升其实际性能,且已与头部云服务商合作,在测试集群中大规模部署MRC。MRC是首次在英伟达Spectrum - X以太网上验证并优化的新传输协议。博通Thor Ultra支持MRC以及高级RoCE技术,集成了使用网络编程语言(NPL)实现高带宽线率可编程数据路径等功能。英特尔借助MRC技术构建多平面以太网组网架构。
MRC为扩展超级计算机带来三个关键优势:一是仅通过两层以太网交换机,就能搭建出可承载十万块GPU规模超算的多平面高速网络,具备充足冗余能力,功耗更低;二是自适应数据包散射具备极佳的负载均衡能力,降低同步训练中各数据流之间的吞吐量波动,避免任务间性能干扰;三是采用SRv6源路由快速绕过故障链路,采用简洁的静态网络控制面,规避动态路由特有的故障异常问题。
02 支持多平面网络,可实现更低成本、功耗
MRC采用多平面网络,将网络接口拆分为多条更小粒度的子链路,搭建八路独立并行网络,每路带宽为100Gb/s。这样做成本、功耗更低,能提供更多路径多样性,还可提升性能。但传统网络协议要求数据传输固定走单一路径,在大规模多平面网络中会引发网络拥塞,降低整体性能。
03 跨数百条路径进行数据包散射转发
MRC不再将一次数据传输限定在单条路径上,而是把单次传输的数据包分散分发到网络中数百条路径、跨所有独立网络平面并行传输。数据包可乱序到达,接收端无需等待排序,可随到随写入内存。MRC会为使用的路径维护状态信息,检测到拥塞或丢包会切换路径、重传数据包,并通过报文截断机制处理目标端拥塞,减少误判。结合多种机制,MRC连接能微秒级检测网络故障并完成迂回绕行,优于传统网络架构。
04 进一步简化网络,一旦丢包即停止路径
传统方案中,交换机运行动态路由协议,结构和软件复杂,隐匿性异常难排查。采用MRC后,一旦某条路径出现丢包,便停止使用该路径。MRC关闭动态路由,采用IPv6分段路由(SRv6),允许发送端直接指定数据包转发路径。交换机按预设的静态路由规则转发,无需重新计算路由。
05 结语:大厂联手,打破超算集群算力利用率瓶颈
根据官方博客,MRC显著提升了OpenAI训练全新大模型的能力,让网络架构匹配其AI发展路线图。随着训练集群规模扩张,MRC能让GPU集群在遭遇拥塞、链路故障和运维维护时保持协同稳定运行,其可靠性与运行效率或将成为支撑前沿大模型同步训练的基础前提。
更多推荐
所有评论(0)