Reinforcement Learning from Human Feedback (RLHF)
了解人类反馈强化学习(RLHF)如何使 AI 与人类价值观保持一致。探索其核心组件以及与 Ultralytics YOLO26 的集成。
人类反馈强化学习 (RLHF) 是一种先进的机器学习技术,通过将直接的人类输入纳入训练循环来改进人工智能模型。不同于完全依赖静态标注数据集的标准监督学习,RLHF 引入了一种动态反馈机制,由人工评估者对模型的输出进行排序或评分。这一过程使 AI 能够捕捉复杂、主观或细微的目标,例如“有帮助”“安全”或“创造力”,而这些目标很难通过简单的数学损失函数来定义。RLHF 已成为现代大型语言模型 (LLMs)和生成式 AI 开发的基石,确保强大的基础模型能够有效地与人类价值观和用户意图保持一致。
RLHF 的核心组成部分#
RLHF 流程通常遵循一个三步管线,旨在弥合原始预测能力与符合人类期望的行为之间的差距。
-
监督微调 (SFT): 工作流程通常从一个预训练的基础模型开始。开发者使用一个规模较小但质量较高的示例数据集(例如由专家编写的问答对)进行初始微调。这一步建立了基准策略,教会模型掌握任务所需的一般格式和语气。
-
奖励模型训练: 这一阶段是 RLHF 的显著特征。人工标注员会审阅模型针对同一输入生成的多个输出,并从最好到最差进行排序。这项数据标注工作会生成一个偏好数据集。一个称为奖励模型的独立神经网络会基于这些比较数据进行训练,以预测反映人类判断的标量分数。Ultralytics Platform提供的工具可以简化此类标注工作流程的管理。
-
强化学习优化: 最后,原始模型在强化学习环境中充当AI 智能体。优化算法会以奖励模型为指导,例如使用近端策略优化 (PPO) 调整模型参数,以最大化预期奖励。这一步使模型的策略与学习到的人类偏好保持一致,鼓励有帮助且安全的行为,同时抑制有害或不合乎逻辑的输出。
实际应用#
RLHF 已被证明对于部署需要高安全标准并且能够细致理解人机交互的 AI 系统至关重要。
- 对话式 AI 和聊天机器人: RLHF 最突出的应用是让聊天机器人变得有帮助、无害且诚实。通过惩罚存在偏见、事实错误或危险的输出,RLHF 有助于缓解LLMs 中的幻觉,并降低算法偏见的风险。这确保虚拟助手能够拒绝有害指令,同时继续为合法查询提供帮助。
- 机器人与物理控制: RLHF 不仅适用于文本,还扩展到机器人领域的 AI,因为要为复杂的物理任务定义完美的奖励函数非常困难。例如,一个正在学习在拥挤仓库中导航的机器人,可能会收到人类监督员对哪些轨迹安全、哪些轨迹造成干扰的反馈。与仅根据目标完成情况进行的简单深度强化学习相比,这种反馈能够更有效地改进机器人的控制策略。
RLHF 与标准强化学习的比较#
要理解 RLHF 的具体用途,区分它与传统的强化学习 (RL)会很有帮助。
- 标准 RL: 在传统设置中,奖励函数通常由环境硬编码。例如,在电子游戏中,环境会提供明确的信号(胜利得 +1,失败得 -1)。智能体会在这个定义好的马尔可夫决策过程 (MDP)中优化自身的行动。
- RLHF: 在许多现实场景中,例如创作故事或礼貌驾驶,“成功”是主观的。RLHF 通过使用从人类偏好中学习得到的奖励模型替代硬编码奖励,解决了这一问题。这样便可以优化“质量”或“适当性”等抽象概念,而这些概念无法通过编程明确实现。
将感知与反馈循环相结合#
在视觉应用中,经过 RLHF 对齐的智能体通常依赖计算机视觉 (CV)来感知环境状态,然后再采取行动。强大的检测器(例如 YOLO26)充当感知层,提供结构化观测(例如“在 3 米处检测到障碍物”),策略网络会利用这些观测来选择行动。
下面的 Python 示例展示了一个简化概念,其中 YOLO 模型提供环境状态。在完整的 RLHF 循环中,“奖励”信号将来自一个根据人类对智能体基于这些检测数据所做决策的反馈进行训练的模型。
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.通过将强大的感知模型与利用人类反馈改进的策略相结合,开发者可以构建不仅智能,而且严格遵循AI 安全原则的系统。针对可扩展监督的持续研究(例如宪法式 AI)仍在推动这一领域的发展,旨在维持较高模型性能的同时,减少大规模人工标注这一瓶颈。









