RLHF · Reinforcement Learning from Human Feedback
Tuning a model using human preference rankings to make its outputs more helpful and aligned.
Current numbers
8–16 GPUsjust to hold weights for a 70B PPO-RLHF stack (actor + reference + reward + critic), pre-optimizer