您现在的位置是:首页 > 技术资料 > 分层强化学习
推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

分层强化学习

更新时间:2026-07-02 08:10:26 大小:18K 上传用户:江岚查看TA发布的资源 标签:强化学习 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

一、基本概念与核心思想

1.1 问题背景

传统深度强化学习(Deep Reinforcement Learning, DRL)在处理简单场景和短周期任务时已经取得了很多突破性成果,比如Atari游戏、围棋对弈等。但当遇到长期稀疏 reward 任务大规模状态空间任务或者具有层次结构的复杂任务时,传统DRL会遇到维度爆炸、学习效率低、收敛速度慢、泛化能力差等问题。分层强化学习正是为了解决这些痛点提出的一种强化学习分支。

1.2 核心思想

HRL的核心思路是对任务和策略进行分层分解,将一个复杂的整体任务拆解成多个不同抽象层级的子任务:高层策略负责处理宏观层面的长期决策,生成子任务目标;低层策略负责完成具体的子任务,输出底层动作。这种结构模仿了人类解决复杂问题的思维方式——人类在处理复杂任务时,也会先将大目标拆解成多个循序渐进的小目标,逐个完成小目标最终实现整体目标。

1.3 关键术语

· Option(选项)HRL中最核心的概念之一,由Sutton等人在1999年提出,一个Option可以理解为一个由底层策略组成的子任务,包含三个部分:初始化集(在哪些状态可以启动该Option)、终止条件(该Option在哪些状态需要终止)、内部策略(完成该Option的动作选择策略)。

· 高层策略(Meta-policy / High-level policy:也叫元策略,负责在高层状态选择下一个要执行的Option,关注长期任务目标。

· 低层策略(Low-level policy:负责执行具体Option,输出环境可执行的原始动作,关注短期子任务目标。

· 子目标(Subgoal:每个Option需要完成的具体目标,通常由高层策略生成,是衡量子任务完成度的标准。


部分文件列表

文件名 大小
分层强化学习.docx 18K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载