Advertisement

李宏毅强化学习笔记p8 imitation learning

阅读量:

模仿学习是一种通过模拟人类行为进行学习的机制,以聊天机器人等场景为例,由于难以明确界定奖励函数,但通常可获取大量对话记录。在此基础上,可引导机器模拟人类进行交流,常用的技术手段主要包括行为克隆与逆向强化学习两种方式。

一、behavior cloning

通过监督学习的实施方式,如采用卷积神经网络对模型进行训练,使其在面对特定图像时能够识别出对应的动作。
其优势在于:操作简便。
然而存在的不足是:所用数据规模较小。 由于缺乏实际碰撞场景的案例,训练集与测试集之间可能存在不一致的情况。对此问题的优化策略是进行数据聚合处理。此外,该方法还可能无差别地将专家所具备的所有信息一并学习,而未能做出有效区分。

在这里插入图片描述

二、Inverse Reinforcement Learning

在缺乏明确奖励函数的情况下,仅依赖专家演示数据(即轨迹记录)时,Actor能够与环境进行交互,但其奖励函数需从环境反馈中逆向推导得出。一旦确定奖励函数,便可进一步采用强化学习的相关策略进行后续训练。

![在这里插入图片描述](https://cdl.itadn.co

全部评论 (0)

还没有任何评论哟~