NCCL ring all-reduce for gradient sync (Llama-class training)
Fabric payload / step
0.14 TB
FP8 · All-Reduce · Ring
Per-link demand
1.1 Gbps
eff cap 622 Gbps
Est. step time
1.8 ms
568.8 steps/s
Throughput
2.28B tok/s
hotspot ×1.27
Aggregate 800G port
60% utilECN / s
0
PFC / s
0
Queue
4µs
traffic evenly distributed across lanes
Aggregate throughput · last 60 samples
peak 800 GbpsPer-lane utilization · 8 × 100G lanes
PAM4 · 100G/lane · All-Reduce · Ringlane 1 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 2 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 3 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 4 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 5 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 6 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 7 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4
lane 8 · 100G PAM4
60.0 Gbps
ECN
0
PFC
0
Q µs
4