Advertisement

04 强化学习中的 actor-critic 方法(AC)高级应用

阅读量:

一、问题描述与研究背景

前文已对AC的基本结构及存在问题进行了阐述,从TD-AC的实验数据可见其表现存在较大波动,因此提出以下两项改进措施:

1、采用MC方法作为评估器来计算置换,值函数的计算方式则从初始状态出发,按照折扣因子进行累加运算:

at{Q} = um_{t{'}=t}{T-1}amma{t{'}-t}r_t^{'} + amma^{T-t}V

2、运用mini-batch的训练策略,以替代完整episodes的训练方式

二、代码实现与功能验证

复制代码
 import tensorflow as tf

    
 import numpy as np
    
 import gym
    
 import matplotlib.pyplot as plt
    
 RENDER = False
    
  
    
 #利用当前策略进行采样,产生数据
    
 class Sample():
    
     def __init__(self,env, policy_net):
    

全部评论 (0)

还没有任何评论哟~