8:38
THE POLICY GRADIENT THEOREM, DERIVED FROM SCRATCH
THE COUNTER NARRATIVE
6:50
PYTORCH SHENANINGANS IN REINFORCEMENT LEARNING: SURROGATE LOSS
7:44
IMPORTANCE SAMPLING, PPO CLIPPING, NEMOTRON MASKING
7:40
RLVR — WHERE THE REWARD COMES FROM
RLHF — WHEN YOU CAN'T WRITE A VERIFIER
7:46
CASCADE & MOPD — WHY HALF OF POST-TRAINING IS REPAIR
12:18
HOW NVIDIA NEMOTRON IS POST TRAINED