Reinforcement Learning from Human Feedback (RLHF)
了解从人类反馈中进行强化学习 (RLHF) 如何使 AI 与人类价值观保持一致。探索其核心组件以及与 Ultralytics YOLO26 的集成。
来自人类反馈的强化学习 (RLHF) 是一种先进的机器学习技术,它通过将直接的人类输入纳入训练循环来改进人工智能模型。与纯粹依赖静态标注数据集的标准 supervised learning 不同,RLHF 引入了一种动态反馈机制,让人类评估员对模型的输出进行排名或评分。这个过程使 AI 能够捕捉复杂的、主观的或微妙的目标——例如“有用性”、“安全性”或“创造性”——这些目标很难用简单的数学损失函数来定义。RLHF 已成为现代 large language models (LLMs) 和生成式 AI 开发的基石,确保强大的基础模型与人类价值观和用户意图保持有效一致。
RLHF 的核心组件#
RLHF 流程通常遵循一个三步流水线,旨在弥合原始预测能力与符合人类行为之间的差距。
-
监督微调 (SFT): 工作流程通常从预训练的 foundation model 开始。开发者使用较小的、高质量的演示数据集(例如专家编写的问答对)执行初始的 fine-tuning。这一步建立了基准策略,向模型传授任务所需的常规格式和语调。
-
奖励模型训练: 这一阶段是 RLHF 的显著特征。人类标注员会审查模型针对同一输入生成的多个输出,并将其从最好到最差进行排序。这项 data labeling 工作会生成一个偏好数据集。基于此比较数据训练一个称为奖励模型的独立 neural network,以预测反映人类判断的标量分数。可在 Ultralytics Platform 上使用的工具能够简化此类标注工作流程的管理。
-
强化学习优化: 最后,原始模型在强化学习环境中充当 AI agent。以奖励模型为指导,近端策略优化 (PPO) 等优化算法会调整模型的参数,以最大化预期奖励。这一步使模型的策略与学到的人类偏好保持一致,鼓励有用且安全的行为,同时抑制有毒或荒谬的输出。
实际应用#
事实证明,在部署需要高安全标准和对人类交互有细微理解的 AI 系统时,RLHF 至关重要。
- 对话式 AI 与聊天机器人: RLHF 最突出的应用是将聊天机器人调整为有用、无害且诚实的。通过惩罚存在偏见、事实错误或危险的输出,RLHF 有助于缓解 hallucination in LLMs 并降低 algorithmic bias 的风险。这确保了虚拟助手能够在拒绝有害指令的同时,对合法查询保持实用性。
- 机器人技术与物理控制: RLHF 不仅限于文本,还延伸至 AI in robotics,在这些领域中,为复杂的物理任务定义完美的奖励函数具有挑战性。例如,一个学习在拥挤的仓库中导航的机器人可能会收到来自人类监督员的反馈,指出哪些轨迹是安全的,哪些轨迹会造成干扰。与仅基于目标完成情况的简单 deep reinforcement learning 相比,这种反馈能更有效地完善机器人的控制策略。
RLHF 与标准强化学习的对比#
区分 RLHF 与传统的 reinforcement learning (RL) 有助于理解其特定效用。
- 标准 RL: 在传统设置中,奖励函数通常由环境硬编码。例如,在电子游戏中,环境会提供明确的信号(赢了 +1,输了 -1)。智能体在这个定义的 Markov Decision Process (MDP) 中优化其动作。
- RLHF: 在许多现实场景中,例如撰写创意故事或礼貌驾驶,“成功”是主观的。RLHF 通过将硬编码的奖励替换为源自人类偏好的学习奖励模型来解决这个问题。这允许优化诸如“质量”或“适当性”等抽象概念,而这些概念是无法明确编程的。
将感知与反馈循环相结合#
在视觉应用中,经过 RLHF 对齐的智能体在行动之前通常依赖 computer vision (CV) 来感知其环境的状态。像 YOLO26 这样强大的检测器充当感知层,提供结构化的观测结果(例如“在 3 米处检测到障碍物”),策略网络利用这些观测结果来选择动作。
以下 Python 示例说明了一个简化的概念,其中 YOLO 模型提供环境状态。在一个完整的 RLHF 循环中,“奖励”信号将来自一个经过训练的模型,该模型根据有关智能体基于此检测数据所做决策的人类反馈进行训练。
from ultralytics import YOLO
# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")
# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")
# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)
print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.通过将强大的感知模型与通过人类反馈改进的策略相结合,开发者可以构建出不仅智能而且严格符合 AI safety 原则的系统。对可扩展监督的持续研究(例如 Constitutional AI)不断推动该领域的发展,旨在减少大规模人类标注的瓶颈,同时维持高性能的模型。






