在Keysight World大会上,是德科技网络与数据中心副总裁Joachim Peerlings公开了一组数据:在计算机视觉模型训练中,GPU超过60%的时间花费在数据移动和通信上,真正用于计算的时间仅占20%左右。此外,大语言模型训练任务中,因网络问题导致的训练失败率高达21%。
中科曙光高级副总裁李斌表示,传统CPU计算节点一台机器配一张网卡即可,而以GPU为中心的计算节点需配置八张甚至更多网卡,相比原来的数据中心高速网络用量提升了10到20倍。当前AI大模型训练集群单端口流量已逼近400G,传统逐流ECMP负载均衡方式难以适应潮汐式流量。
是德科技网络应用安全部门技术经理杨益锋指出,带宽翻倍的速度远追不上模型规模翻倍的速度,堆硬件带来的成本、功耗和散热压力呈指数级增长。相比传统ECMP方案,新的端到端负载均衡方法可将网络带宽利用率提升最高38%,模型训练任务时长缩短超过3%。
