掉队者问题:一块慢 GPU 如何拖住整次 LLM 训练
来源:dev.to — 2026-09-09
📋 概述
在同步数据并行训练里,一整批的吞吐由最慢的那个 worker 决定:4095 块 GPU 已经算完,也得等着最后一块。作者用餐厅做菜类比「平均时间」与「批量时间」的区别,给出浪费算力的算式,并引用生产集群的追踪数据指出掉队者往往不是坏 GPU,而是流水线不均衡、序列长度不均与垃圾回收停顿。一次十天的训练中,掉队可能吃掉数百万元级的 GPU 机时。
🔑 核心要点
- 同步并行的本质是:变异性乘以同步,最慢者决定整批的节奏。
- 4096 块 GPU 里最慢的一块慢 20 毫秒,其余 4095 块就白等近 82 GPU 秒。
- 生产追踪显示罪魁往往不是坏硬件,而是流水线不均衡、序列长度不均与 GC 停顿。
- 尾部任务最多浪费 45% 的分配资源,十天训练里烧掉的是真金白银。
💡 金句
In synchronous parallelism, variability is multiplied by synchronization.
👍 0
👎 0
← 返回 dev.to 首页