基于概率模型的动态分层强化学习  被引量:2

Dynamic hierarchical reinforcement learning based on probability model

在线阅读下载全文

作  者:戴朝晖[1] 袁姣红[1] 吴敏[1] 陈鑫[1] 

机构地区:[1]中南大学信息科学与工程学院,湖南长沙410083

出  处:《控制理论与应用》2011年第11期1595-1600,1606,共7页Control Theory & Applications

基  金:国家自然科学基金资助项目(60874042);中国博士后科学基金一等资助项目(20080440177);中国博士后科学基金特别资助项目(200902483);教育部高等学校博士点基金新教师基金资助项目(20090162120068)

摘  要:为解决大规模强化学习中的"维度灾难"问题,克服以往学习算法的性能高度依赖于先验知识的局限性,本文提出一种基于概率模型的动态分层强化学习方法.首先基于贝叶斯学习对状态转移概率进行建模,建立基于概率参数的关键状态识别方法,进而通过聚类动态生成若干状态子空间和学习分层结构下的最优策略.仿真结果表明该算法能显著提高复杂环境下智能体的学习效率,适用于未知环境中的大规模学习.To deal with the overwhelming dimensionality in the large-scale reinforcement-learning and the strong depen-dence on prior knowledge in existing learning algorithms,we propose the method of dynamic hierarchical reinforcement learning based on the probability model(DHRL--model).This method identifies some key states automatically based on probability parameters of the state-transition probability model established based on Bayesian learning,then generates some state-subspaces dynamically by clustering,and learns the optimal policy based on hierarchical structure.Simulation results show that DHRL--model algorithm improves the learning efficiency of the agent remarkably in the complex environment,and can be applied to learning in the unknown large-scale world.

关 键 词:动态分层强化学习 贝叶斯学习 状态转移概率模型 智能体 

分 类 号:TP181[自动化与计算机技术—控制理论与控制工程]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象