免费编程教程

弱到强泛化

利用弱小监督信号训练的强模型可能超越其监督者的表现,探索此现象在超人类模型对齐中的潜力。

18 0 0
2026-06-30
辩论对齐

让两个 AI 为不同答案进行辩论,由人类裁判裁决,以此在复杂问题上利用 AI 能力提供更准确的监督信号。

20 0 0
2026-06-30
递归奖励建模

将复杂的人类意图递归分解为简单、可被当前模型或人类评估的子任务,实现对超人类能力的监督。

29 0 0
2026-06-30
宪法 AI Constitution AI

学习 Anthropic 的宪法 AI 方法,通过一套自然语言原则让模型自我批评和修订输出,实现基于规则的对齐。

11 0 0
2026-06-30
可扩展监督

探讨当人类无法直接评估超人类 AI 输出时,如何通过辩论、递归奖励建模等技术实现有效监督。

13 0 0
2026-06-30
对比偏好训练 CPO

学习对比偏好优化方法,利用对比损失直接最大化优选样本与拒绝样本的差异,无需显式奖励模型。

18 0 0
2026-06-29
过度优化问题

认识奖励过度优化现象,通过早停、KL 正则和混合奖励等方式防止模型为高分丧失实际质量。

11 0 0
2026-06-29
奖励黑客 Reward Hacking

分析强化学习或对齐过程中模型可能找到的奖励漏洞,学习检测和缓解奖励黑客的策略。

13 0 0
2026-06-29
强化学习环境设计

为语言模型的对齐训练设计合适的强化学习环境,定义动作空间、状态转换和奖励函数。

17 0 0
2026-06-29
偏好学习

从成对比较或多选项排序的人类偏好数据中学习潜在奖励函数,用于模型对齐和个性化推荐。

20 0 0
2026-06-29
多模态表示学习

学习将不同模态的数据映射到统一语义空间的技术,如 CLIP、VATT 等,支持跨模态检索与推理。

17 0 0
2026-06-19
偏好数据集构建

指导如何收集和构建用于 RLHF 与 DPO 的偏好比较数据集,包括标注准则、提示设计、质量控制和评分者一致性分析。

37 0 0
2026-06-14
RLHF 人类反馈强化学习

完整梳理 RLHF 三阶段:监督微调、奖励模型训练与 PPO 强化学习,理解如何利用人类偏好数据让大模型输出更符合期望与价值观。

44 0 0
2026-06-13