全面了解 AI 对齐问题的内涵、挑战和主流技术路线,包括价值学习、可扩展监督和鲁棒性。
探讨大模型对齐的三 H 原则(Helpful, Honest, Harmless),了解如何通过技术手段让模型行为符合人类意图与社会价值。