一种集成规划的SARSA(λ)强化学习算法被引量：2

An Integrating Planning SARSA(λ) Algorithm of Reinforcement Learning

出　　处：《北京理工大学学报》2002年第3期325-327,共3页Transactions of Beijing Institute of Technology

基　　金：国家自然科学基金资助项目 (696740 0 5 )

摘　　要：提出一种新的集成规划的 SARSA(λ)强化学习算法 .该算法的主要思想是充分利用已有的经验数据 ,在无模型学习的同时估计系统模型 ,每进行一次无模型学习的试验后 ,利用模型在所记忆的状态 /行动对组成的表中进行规划 ,同时利用该表给出了在学习和规划之间的量化折中参考 .实验结果表明 ,本算法比单纯的无模型学习SARSA(λ)A new integrating planning SARSA (λ) algorithm of reinforcement learning is proposed. The algorithm makes extremely efficient use of the experience data. It learns the model while learning to estimate the optimal value without a model. After each episode, it plans in the table of state/action pairs being recorded, and the table can be as a quantificational trade off reference between learning and planning. The results of experiment show that the algorithm has better performance than the SARSA (λ) algorithm.

关键词：强化学习 MARKOV决策过程 SARSA学习规划

分类号：TP18[自动化与计算机技术—控制理论与控制工程]

参考文献：

正在载入数据...

二级参考文献：

正在载入数据...

耦合文献：

正在载入数据...

引证文献：

正在载入数据...

二级引证文献：

正在载入数据...

同被引文献：

正在载入数据...

高级检索 检索式检索

时间限定

期刊范围

学科限定全选

高级检索 检索式检索

时间限定

期刊范围

学科限定全选

一种集成规划的SARSA(λ)强化学习算法被引量：2

我的收藏

参考文献：

二级参考文献：

耦合文献：

引证文献：

二级引证文献：

同被引文献：

相关期刊文献：

相关的主题

相关的作者对象

相关的机构对象

下载全文

高级检索检索式检索

时间限定

期刊范围

学科限定全选

高级检索 检索式检索

时间限定

期刊范围

学科限定全选

一种集成规划的SARSA(λ)强化学习算法 被引量：2

我的收藏

参考文献：

二级参考文献：

耦合文献：

引证文献：

二级引证文献：

同被引文献：

相关期刊文献：

相关的主题

相关的作者对象

相关的机构对象

下载全文

用户登录

高级检索检索式检索

一种集成规划的SARSA(λ)强化学习算法被引量：2