MTBF · Mean Time Between Failures
The average operating time between failures of a component or system, a core reliability input.
Current numbers
~7 days / 512 GPUsbest-in-class mature H100 cluster MTBF; one failure restarts a synchronous job
~7 daysbest-in-class H100 MTBF per 512 GPUs in a mature cluster; new clusters far worse (3–4 wk burn-in)
flap every ~48 slink-flap cadence in a 10M-optic fleet (hard failure only every few days); MTTF far below MTBF