Rollout
In reinforcement learning, generating a trajectory of model actions and outcomes used to compute training rewards.
Current numbers
~80%of wall-clock spent on rollout generation in agentic/reasoning RL post-training
10K–100K+tokens per RL trajectory for reasoning/agentic tasks — the rollout that dominates cost
~8:1 → ~2:1 and belowGPU:CPU norm rebalancing toward more CPU per node as agentic RL adds rollout/tool/env load