|
1. 背景 随着大模型训练、AI超算、分布式算力集群的规模化部署,GPU集群已成为高性能计算核心载体。GPU跨卡、跨节点通信依赖RoCEv2无损网络实现低时延、高吞吐数据传输,但传统运维模式下,RDMA通信全程处于“网络黑盒”状态,存在业务流量不可见、转发路径不确定、链路质量无量化、故障定位无依据、节点异常无预警等痛点。极易导致出现GPU集合通信卡顿、训练吞吐量抖动、算力资源空置等问题时,无法提前感知、无法主动发现、无法快速定位,影响训推业务开展。 n 传统网络监控仅覆盖端口级粗粒度指标,无法穿透RoCEv2协议层,缺失流级、业务级关联能力,存在网络路径黑盒、训推故障盲排、网业数据割裂、隐性异常无预警等问题 n 缺少RoCEv2专属指标体系,PFC暂停、RDMA重传、报文错序等关键状态无统一评估标准 n 算力网采用多级Spine-Leaf架构,ECMP动态路由持续漂移,GPU跨节点流量传输轨迹无法追踪,业务链路无从锁定 n 业网数据深度割裂,RDMA传输指标、网络链路质量数据与上层训练业务数据相互独立,无统一关联分析模型,无法解释训练抖动、收敛变慢、吞吐波动、任务卡顿的底层网络根因,业务问题无法精准溯源 2. 技术方案介绍 2.1. RDMA 两台服务器上的应用通过传统TCP/IP网络通信时,数据需要经过系统协议栈和驱动层再到网卡,期间需要经过多次CPU处理以及内存拷贝。每次CPU处理和内存拷贝都需要消耗大量的CPU资源并带来额外的处理时延。尤其在高速网络环境下,数据移动和复制操作的高开销极大限制了网络实际传输带宽。 为了降低CPU开销、减少数据访问时延、提高网络传输带宽,产生了RDMA(Remote Direct Memory Access)技术。RDMA利用内核旁路机制和内存零拷贝机制,提供了基于IO的通道,允许应用程序对远端直接读写,消除了传统TCP/IP网络通信的瓶颈,提高了CPU利用率和带宽利用率、降低了数据访问时延。 2.2. RoCEv2 RDMA技术最早出现在IB(infiniband)网络中,由于IB网络的专用性和封闭性,导致IB网络构建成本非常高并且无法和其它网络融合。 RoCE (RDMA over Converged Ethernet)的诞生,使得RDMA可以承载在以太网上。而RoCEv2更是使得RDMA可以承载在UDP上,从而RDMA可以融合在IP网络,降低了网络构建成本、提高了网络扩展性。 RoCEv2(RDMA over Converged Ethernet v2)是面向高性能算力集群的无损网络传输协议,通过UDP/IP报文封装RDMA数据,端口固定为4791,支持三层IP路由转发与ECMP负载分担,相较于RoCEv1具备更强的组网扩展性,完美适配大规模GPU集群跨机架、跨机房通信场景。其核心特性为内核旁路、无数据拷贝、硬件直连传输,大幅降低GPU数据传输时延与CPU开销,是GPU分布式集合通信的底层网络支撑。同时RoCEv2依赖PFC优先级流量控制、ECN显式拥塞通知机制保障无损传输,对应的PFC暂停帧、拥塞标记、报文重传等状态是评估通信质量的核心依据。 2.3. AI业务流分析 AI任务主要通过RoCEv2实现GPU间通信,而RoCEv2是封装在UDP报文里,传统监控软件无法穿透UDP实现RoCEv2业务流监控,并且无法评价RoCEv2流量的传输质量。 本方案提供了一种RoCEv2业务流监控分析的方法。RoCEv2报文作为一个UDP报文,其携带的五元组以及RoCEv2载荷的QPID可以定义一条流量。在RoCEv2报文里,携带PSN字段表示传输的报文序号,同时报文里还有Solicited Event表示当前报文是否为末包,通过PSN和Solicited Event可以统计RoCEv2数据传输的首尾帧。RoCEv2业务流传输过程中,如果接收端没收到某个PSN号的报文(上图中PSN为2的报文),会发NAK通知发送端,发送端会回到该编号重新发送该编号及其之后的所有报文。 因此,RoCEv2业务流可以通过流完成时间、流有效吞吐、流数据重传率等核心指标来综合判断。同时,根据RoCEv2起始帧、结束帧以及NAK帧在算力网流经的各交换机节点可以判断出业务流的网络传输路径、网络逐跳转发时延以及各节点的流平均转发时延。 依托算力网交换机的业务流Telemetry功能,可以在每台交换机上进行RoCEv2流完成时间(FCT,FlowCompletion Time)、流有效吞吐(FET,FlowEffective Throughput)、流重传率(FNR,FlowNAK Rate)、报文转发时延(最大、最小及平均转发时延)等核心指标统计,并通过GRPC通告给SDN分析系统。SDN分析系统根据RDMATelemetry信息可实现RoCEv2业务流量的可视化、传输质量评价、转发路径绘制、转发时延分析。 SDN分析软件还可以通过Telemetry获取每个转发节点的PFC报文统计、ECN报文统计、CPU利用率、内存利用率、队列缓存信息等关键指标,结合业务流转发路径智能的发现异常业务流,主动告警,辅助运维人员快速定位故障。 2.4. GPU间通信质量分析 基于五元组的RDMA业务流量分析,偏向于网络层面的数据流质量分析,和GPU无法直接关联,无法分析GPU间执行AlltoAll,AllReduce等集合通信质量。 算力网架构中,不论是单平面组网还是多平面组网,GPU和智能网卡都是一对一或一对多绑定到IP网络。即一个GPU可以映射到一个或多个IP地址。在SDN分析系统上只需把GPU和IP地址完成关联,即可把RoCEv2业务流分析转化成GPU间的通信质量分析。SDN分析系统通常通过两种方式把GPU和业务流进行关联。 第一种,可以直接在SDN分析系统手工指定GPU和IP地址的绑定关系。第二种,在SDN分析系统在主动扫描全网RoCEv2网络设备、GPU智能网卡信息,自动梳理集群硬件拓扑,识别所有GPU卡、接入交换机、核心交换机的层级关联关系,构建静态基础拓扑图谱,自动建立GPU和IP地址的绑定关系。 2.5. AI任务质量分析 当前AI大模型训练正向超大规模、长时连续运行、高并发算力混部、精细化分布式调度方向快速演进,数据并行、模型并行、流水线并行、张量并行等多维度混合并行架构广泛落地。单训练任务需数百至上千张GPU协同完成AllReduce、AllGather等高频集合通信,独立的GPU卡间通信质量分析无法全局的反馈AI任务的。 在SDN分析系统上,可以创建AI任务,把支撑该任务开展的所有GPU集群资源都包含在AI任务中。SDN分析系统根据AI任务搜集分析所有相关的GPU、RoCEv2业务流量,并进行综合评价分析。
|