Qingfeng He
Learning notes — infra, multimodal, RL
-
LLM 强化学习算法谱系:从 REINFORCE 到 GDPO
一条主线把 REINFORCE、PPO、GRPO、DAPO、GSPO、GDPO 串起来,再补上信用分配(HCA / HCAPO)与 V/Q/A 基础。每个算法都讲清楚它在修前任的什么病。
Learning notes — infra, multimodal, RL
一条主线把 REINFORCE、PPO、GRPO、DAPO、GSPO、GDPO 串起来,再补上信用分配(HCA / HCAPO)与 V/Q/A 基础。每个算法都讲清楚它在修前任的什么病。