RLHF(人类反馈强化学习)在 GPT 系列对齐中起到什么作用?其主要阶段有哪些?
HF基于人类反馈的强化学习在 GPT 系列模型的对齐中起到了关键性的桥梁作用它解决了传统语言模型“有能力但不可控”的核心矛盾使模型从“能生成文本”进化到“能生成符合人类期望的文本”。一、RLHF 在 GPT 系列对齐中的作用在 GPT-3 等早期大模型中模型虽然能力强大但存在严重的未对齐misalignment问题具体表现为不遵循指令答非所问不按用户要求执行。胡编乱造生成看似合理但实际虚假的内容幻觉。缺乏可解释性人类难以理解模型为何给出某个回答。生成有害内容输出带有偏见、歧视或危险的信息。RLHF 的作用正是将人类的偏好、价值观和判断标准注入模型训练过程让模型学会遵循指令更准确地理解并执行用户的明确要求。提高有用性生成更相关、更连贯、更符合上下文的回答。增强诚实性减少幻觉对不确定的内容能坦诚表示不知道。确保无害性主动规避生成有害、偏见或不当的内容。简单来说RLHF 是让 GPT 系列从“强大的语言模型”转变为“安全、有用、可信赖的 AI 助手”的临门一脚。二、RLHF 的主要阶段RLHF 通常包含三个核心阶段这也是 InstructGPT / ChatGPT / GPT-4 训练的关键流程阶段一监督微调SFTSupervised Fine-Tuning目标让模型初步学会遵循指令和对话的格式。做法从数据集中随机抽取用户问题。由人类标注员写出高质量的、符合人类偏好的标准答案。用这些人工标注的“问题-答案”对对预训练好的 GPT 模型进行有监督微调。产出得到一个初步具备指令跟随能力的SFT 模型。但此时模型仍可能不完全符合人类偏好且存在生成有害内容的风险。阶段二训练奖励模型RMReward Model目标训练一个能够自动评估回答质量的“裁判”模型。做法使用阶段一的 SFT 模型对同一个问题生成多个不同的候选回答。由人类标注员对这些回答进行排序例如 A B C而非直接打分。利用这些排序数据训练一个奖励模型。该模型输入一个回答输出一个标量分数奖励值分数越高代表越符合人类偏好。产出得到一个可以替代人类进行大规模、低成本评估的RM 模型。阶段三强化学习微调PPO 优化目标利用奖励模型作为反馈信号通过强化学习进一步优化 SFT 模型。做法使用近端策略优化PPOProximal Policy Optimization算法。当前策略模型即正在被训练的模型生成回答。阶段二训练好的奖励模型为该回答打分。PPO 算法根据这个分数调整模型的参数使其倾向于生成能获得更高奖励的回答。这个过程迭代进行模型不断学习如何生成更符合人类偏好的内容。产出最终得到一个对齐后的策略模型也就是我们实际使用的 ChatGPT / GPT-4 等模型。常见坑点与补充奖励模型的局限性奖励模型本身也是由人类标注数据训练的它可能会被“钻空子”即模型学会生成一些看似高分但实际无意义或取巧的内容奖励黑客。因此RLHF 的迭代过程需要持续监控和优化。数据质量是关键RLHF 的效果高度依赖于人类标注员的质量和一致性。标注员之间的主观差异、标注疲劳等都会影响最终模型的对齐效果。你可能还需要了解除了 RLHF目前还有DPODirect Preference Optimization直接偏好优化等更简洁的对齐方法它们不需要显式训练奖励模型而是直接从偏好数据中优化策略在某些场景下效率更高。