免费编程教程

奖励模型训练

使用 Bradley-Terry 或 Plackett-Luce 模型从人类偏好比较数据中训练奖励模型,作为对齐的监督信号。

15 0 0
2026-06-29
反馈学习

收集终端用户对模型输出的点踩、纠正等反馈信号,通过 RLHF、DPO 等方法将反馈转化为模型改进。

18 0 0
2026-06-29
RLHF 人类反馈强化学习

完整梳理 RLHF 三阶段:监督微调、奖励模型训练与 PPO 强化学习,理解如何利用人类偏好数据让大模型输出更符合期望与价值观。

44 0 0
2026-06-13