The Definitive Guide toAI Data Centers
Ask the GuideAboutAccount
GuideGlossaryRLHF

RLHF · Reinforcement Learning from Human Feedback

Tuning a model using human preference rankings to make its outputs more helpful and aligned.

Current numbers

8–16 GPUsjust to hold weights for a 70B PPO-RLHF stack (actor + reference + reward + critic), pre-optimizeras of 2025 · register ↗

← All terms