Ultralytics YOLO27:
返回 Ultralytics 术语表

Reinforcement Learning from Human Feedback (RLHF)

了解人类反馈强化学习(RLHF)如何使 AI 与人类价值观保持一致。探索其核心组件以及与 Ultralytics YOLO26 的集成。

人类反馈强化学习 (RLHF) 是一种先进的机器学习技术,通过将直接的人类输入纳入训练循环来改进人工智能模型。不同于完全依赖静态标注数据集的标准监督学习,RLHF 引入了一种动态反馈机制,由人工评估者对模型的输出进行排序或评分。这一过程使 AI 能够捕捉复杂、主观或细微的目标,例如“有帮助”“安全”或“创造力”,而这些目标很难通过简单的数学损失函数来定义。RLHF 已成为现代大型语言模型 (LLMs)和生成式 AI 开发的基石,确保强大的基础模型能够有效地与人类价值观和用户意图保持一致。

RLHF 的核心组成部分#

RLHF 流程通常遵循一个三步管线,旨在弥合原始预测能力与符合人类期望的行为之间的差距。

  1. 监督微调 (SFT): 工作流程通常从一个预训练的基础模型开始。开发者使用一个规模较小但质量较高的示例数据集(例如由专家编写的问答对)进行初始微调。这一步建立了基准策略,教会模型掌握任务所需的一般格式和语气。

  2. 奖励模型训练: 这一阶段是 RLHF 的显著特征。人工标注员会审阅模型针对同一输入生成的多个输出,并从最好到最差进行排序。这项数据标注工作会生成一个偏好数据集。一个称为奖励模型的独立神经网络会基于这些比较数据进行训练,以预测反映人类判断的标量分数。Ultralytics Platform提供的工具可以简化此类标注工作流程的管理。

  3. 强化学习优化: 最后,原始模型在强化学习环境中充当AI 智能体。优化算法会以奖励模型为指导,例如使用近端策略优化 (PPO) 调整模型参数,以最大化预期奖励。这一步使模型的策略与学习到的人类偏好保持一致,鼓励有帮助且安全的行为,同时抑制有害或不合乎逻辑的输出。

实际应用#

RLHF 已被证明对于部署需要高安全标准并且能够细致理解人机交互的 AI 系统至关重要。

  • 对话式 AI 和聊天机器人: RLHF 最突出的应用是让聊天机器人变得有帮助、无害且诚实。通过惩罚存在偏见、事实错误或危险的输出,RLHF 有助于缓解LLMs 中的幻觉,并降低算法偏见的风险。这确保虚拟助手能够拒绝有害指令,同时继续为合法查询提供帮助。
  • 机器人与物理控制: RLHF 不仅适用于文本,还扩展到机器人领域的 AI,因为要为复杂的物理任务定义完美的奖励函数非常困难。例如,一个正在学习在拥挤仓库中导航的机器人,可能会收到人类监督员对哪些轨迹安全、哪些轨迹造成干扰的反馈。与仅根据目标完成情况进行的简单深度强化学习相比,这种反馈能够更有效地改进机器人的控制策略。

RLHF 与标准强化学习的比较#

要理解 RLHF 的具体用途,区分它与传统的强化学习 (RL)会很有帮助。

  • 标准 RL: 在传统设置中,奖励函数通常由环境硬编码。例如,在电子游戏中,环境会提供明确的信号(胜利得 +1,失败得 -1)。智能体会在这个定义好的马尔可夫决策过程 (MDP)中优化自身的行动。
  • RLHF: 在许多现实场景中,例如创作故事或礼貌驾驶,“成功”是主观的。RLHF 通过使用从人类偏好中学习得到的奖励模型替代硬编码奖励,解决了这一问题。这样便可以优化“质量”或“适当性”等抽象概念,而这些概念无法通过编程明确实现。

将感知与反馈循环相结合#

在视觉应用中,经过 RLHF 对齐的智能体通常依赖计算机视觉 (CV)来感知环境状态,然后再采取行动。强大的检测器(例如 YOLO26)充当感知层,提供结构化观测(例如“在 3 米处检测到障碍物”),策略网络会利用这些观测来选择行动。

下面的 Python 示例展示了一个简化概念,其中 YOLO 模型提供环境状态。在完整的 RLHF 循环中,“奖励”信号将来自一个根据人类对智能体基于这些检测数据所做决策的反馈进行训练的模型。

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

通过将强大的感知模型与利用人类反馈改进的策略相结合,开发者可以构建不仅智能,而且严格遵循AI 安全原则的系统。针对可扩展监督的持续研究(例如宪法式 AI)仍在推动这一领域的发展,旨在维持较高模型性能的同时,减少大规模人工标注这一瓶颈。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅