2026年7月20日PPO 的训练循环:每一个部件,都是同一对矛盾的产物从 REINFORCE 的"数据用一次就作废"出发,一步步推出 PPO 训练循环的全部部件——重要性采样比率、clip、critic、GAE、多 epoch 复用——再落到 RLHF 的四模型循环。读完你能口述一次 PPO 迭代的每个阶段,以及每个阶段为什么非存在不可。强化学习LLMRLHF深度学习
2026年7月20日示范教不会的东西:为什么大模型需要强化学习零基础向。不讲任何算法、不用一个公式,只回答三个更早的问题:强化学习到底是什么?已经有预训练和微调了,为什么还需要它?它是怎么被搬到语言模型上的?读完你会拿到一张 RL 术语对照表——之后再读 RLHF、PPO、GRPO,那些词就不再是黑话。强化学习LLMRLHF入门
2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLMverlRLHFGRPO源码阅读LLM Serving
2026年7月14日任务能力怎样写进 LLM 权重:从一次梯度更新到预训练与对齐沿着一条训练信号的旅程,解释 loss、gradient、AdamW 怎样改变权重,并串起预训练、SFT、RLHF、DPO、LoRA 与上下文学习。AILLM模型训练论文学习RLHFLoRA可解释性