- 1
- 2
- 3
- 4
- 5
分层强化学习
资料介绍
一、基本概念与核心思想
1.1 问题背景
传统深度强化学习(Deep Reinforcement Learning, DRL)在处理简单场景和短周期任务时已经取得了很多突破性成果,比如Atari游戏、围棋对弈等。但当遇到长期稀疏 reward 任务、大规模状态空间任务或者具有层次结构的复杂任务时,传统DRL会遇到维度爆炸、学习效率低、收敛速度慢、泛化能力差等问题。分层强化学习正是为了解决这些痛点提出的一种强化学习分支。
1.2 核心思想
HRL的核心思路是对任务和策略进行分层分解,将一个复杂的整体任务拆解成多个不同抽象层级的子任务:高层策略负责处理宏观层面的长期决策,生成子任务目标;低层策略负责完成具体的子任务,输出底层动作。这种结构模仿了人类解决复杂问题的思维方式——人类在处理复杂任务时,也会先将大目标拆解成多个循序渐进的小目标,逐个完成小目标最终实现整体目标。
1.3 关键术语
· Option(选项):HRL中最核心的概念之一,由Sutton等人在1999年提出,一个Option可以理解为一个由底层策略组成的子任务,包含三个部分:初始化集(在哪些状态可以启动该Option)、终止条件(该Option在哪些状态需要终止)、内部策略(完成该Option的动作选择策略)。
· 高层策略(Meta-policy / High-level policy):也叫元策略,负责在高层状态选择下一个要执行的Option,关注长期任务目标。
· 低层策略(Low-level policy):负责执行具体Option,输出环境可执行的原始动作,关注短期子任务目标。
· 子目标(Subgoal):每个Option需要完成的具体目标,通常由高层策略生成,是衡量子任务完成度的标准。
部分文件列表
| 文件名 | 大小 |
| 分层强化学习.docx | 18K |
最新上传
-
21ic小能手 打赏10.00元 3天前
-
21ic小能手 打赏10.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic下载 打赏310.00元 3天前
用户:江岚
-
21ic下载 打赏310.00元 3天前
用户:mulanhk
-
21ic下载 打赏320.00元 3天前
用户:jh03551
-
21ic下载 打赏220.00元 3天前
用户:jh0355
-
21ic下载 打赏210.00元 3天前
用户:潇潇江南
-
21ic下载 打赏210.00元 3天前
用户:小猫做电路
-
21ic下载 打赏60.00元 3天前
用户:gsy幸运
-
21ic下载 打赏60.00元 3天前
用户:zhengdai
-
21ic下载 打赏60.00元 3天前
用户:lanmukk
-
21ic下载 打赏60.00元 3天前
用户:烟雨
-
21ic下载 打赏20.00元 3天前
用户:w993263495
-
21ic下载 打赏30.00元 3天前
用户:sun2152
-
21ic下载 打赏20.00元 3天前
用户:w178191520
-
21ic下载 打赏20.00元 3天前
用户:liqiang9090
-
21ic下载 打赏20.00元 3天前
用户:xuzhen1
-
21ic下载 打赏35.00元 3天前
用户:有理想666
-
21ic下载 打赏15.00元 3天前
用户:w1966891335
-
21ic下载 打赏15.00元 3天前
用户:x15580286248
-
21ic下载 打赏25.00元 3天前
用户:qiufeng0299
-
21ic下载 打赏15.00元 3天前
用户:kk1957135547
-
21ic下载 打赏10.00元 3天前
用户:qingsong08
-
21ic下载 打赏10.00元 3天前
用户:电工老刘
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
ZENGYIBIN 打赏1.00元 3天前
-
21ic小能手 打赏10.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
资料:STM32的数字万用表
-
21ic小能手 打赏5.00元 3天前
-
kuangwy 打赏1.00元 3天前
-
21ic小能手 打赏5.00元 3天前
资料:触控无极台灯控制方案
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
-
21ic小能手 打赏5.00元 3天前
资料:51单片机的汽车雨刷器




全部评论(0)