2026年7月20日PPO 的训练循环:每一个部件,都是同一对矛盾的产物从 REINFORCE 的"数据用一次就作废"出发,一步步推出 PPO 训练循环的全部部件——重要性采样比率、clip、critic、GAE、多 epoch 复用——再落到 RLHF 的四模型循环。读完你能口述一次 PPO 迭代的每个阶段,以及每个阶段为什么非存在不可。强化学习LLMRLHF深度学习
2026年7月20日示范教不会的东西:为什么大模型需要强化学习零基础向。不讲任何算法、不用一个公式,只回答三个更早的问题:强化学习到底是什么?已经有预训练和微调了,为什么还需要它?它是怎么被搬到语言模型上的?读完你会拿到一张 RL 术语对照表——之后再读 RLHF、PPO、GRPO,那些词就不再是黑话。强化学习LLMRLHF入门
2026年7月14日不教,只给激励:DeepSeek-R1 如何让大模型自己"长"出推理能力深读发表于 Nature 的 DeepSeek-R1 论文——它证明了一件反直觉的事:复杂推理不必靠人类标注的思维链一步步教,而是用对了奖励,让模型在强化学习里自己长出来。从 GRPO、规则奖励、"aha moment"到四段式流水线与蒸馏,一条主线讲透当前推理模型这一代范式。LLM强化学习推理模型DeepSeekAI 前沿