深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

AI数据中心网络瓶颈凸显:GPU六成时间耗在数据搬运

2026-08-17 17:42:29

在Keysight World大会上,是德科技副总裁Joachim Peerlings展示数据:计算机视觉模型训练中GPU超60%时间用于数据移动和通信,计算仅占20%;大语言模型训练因网络问题失败率高达21%。中科曙光高级副总裁李斌表示,GPU节点需配八张以上网卡,网络用量较传统提升10到20倍。

在Keysight World大会上,是德科技网络与数据中心副总裁Joachim Peerlings公开了一组数据:在计算机视觉模型训练中,GPU超过60%的时间花费在数据移动和通信上,真正用于计算的时间仅占20%左右。此外,大语言模型训练任务中,因网络问题导致的训练失败率高达21%。

中科曙光高级副总裁李斌表示,传统CPU计算节点一台机器配一张网卡即可,而以GPU为中心的计算节点需配置八张甚至更多网卡,相比原来的数据中心高速网络用量提升了10到20倍。当前AI大模型训练集群单端口流量已逼近400G,传统逐流ECMP负载均衡方式难以适应潮汐式流量。

是德科技网络应用安全部门技术经理杨益锋指出,带宽翻倍的速度远追不上模型规模翻倍的速度,堆硬件带来的成本、功耗和散热压力呈指数级增长。相比传统ECMP方案,新的端到端负载均衡方法可将网络带宽利用率提升最高38%,模型训练任务时长缩短超过3%。