23:55
LLM POST-TRAINING: FROM SFT AND PREFERENCES TO RLHF AND DPO
THE COUNTER NARRATIVE
22:42
POLICY-GRADIENT RL: FROM REINFORCE TO TRPO, PPO, AND GRPO
14:41
SCALING MODEL-FREE RL WITH FUNCTION APPROXIMATION
CLASSICAL MODEL-FREE RL
12:59
THE SHARED MATHEMATICAL FOUNDATIONS OF RL