04 强化学习中的 actor-critic 方法(AC)高级应用
发布时间
阅读量:
阅读量
一、问题描述与研究背景
前文已对AC的基本结构及存在问题进行了阐述,从TD-AC的实验数据可见其表现存在较大波动,因此提出以下两项改进措施:
1、采用MC方法作为评估器来计算置换,值函数的计算方式则从初始状态出发,按照折扣因子进行累加运算:

2、运用mini-batch的训练策略,以替代完整episodes的训练方式
二、代码实现与功能验证
import tensorflow as tf
import numpy as np
import gym
import matplotlib.pyplot as plt
RENDER = False
#利用当前策略进行采样,产生数据
class Sample():
def __init__(self,env, policy_net):
全部评论 (0)
还没有任何评论哟~
