强化学习的各种算法分析及其Eligibility Trace的教程
发布时间
阅读量:
阅读量
Monte Carlo算法在执行过程中需完整运行整个episode,并依据所获取的所有真实奖励值对算法进行更新。而Temporal Difference(TD)算法则仅依赖于当前时刻采集到的奖励值,用于对价值函数进行估算。一种折中的策略是采用n步奖励值来进行估计,从而在两者之间取得平衡。

TD(λ)算法:设定0<λ<1,用于对第k步所获得的奖励值进行系数倍数的调整

在实际应用中,被广泛采用的TD(λ)算法被称为TD(λ)算法的backward view,该技术方案通常依赖于eligibility traces机制。eligibility traces作为一种高效的信息记录方式,能够将多个步骤的相关数据进行集中存储。

还没有任何评论哟~
