Advertisement

Reinforcement Learning 学习 (三)

阅读量:

前言

近期正在深入学习Mujoco环境,通过研读官方提供的教程以及参考开源的示例代码,对SB3库中所包含的强化学习标准工具集有了初步认识。在此基础上,尝试构建了属于自己的实验环境,并以UR5E机械臂为对象,完成了一个避障任务的实践。同时,还尝试接入图像大模型的API接口,开发了一些具有趣味性的应用。相关参考资料如下:

_https://mujoco.readthedocs.io/en/stable/overview.html
https://pab47.github.io/mujocopy.html
https://github.com/ian-chuang/Manipulator-Mujoco.git_

接下来,我计划从理论基础、实验实施过程、结果呈现以及后续改进方向这几个方面进行详细阐述。

原理部分概述

【首先需要提及的是SB3这一强化学习工具库,根据我目前的认知,该库依托于gym环境及其衍生版本gymnasium,能够借助矢量转换技术提升训练效率,尽管其性能尚无法与isaac gym相媲美,但其操作便捷性更胜一筹(个人观点),因此在本研究中我选择使用该库进行相关学习。

鉴于我的研究目标是实现机械臂的运动控制,因此所涉及的动作空间为连续型,在这种情况下,建议优先采用PPO作为基础模型,首先确保实验能够顺利运

全部评论 (0)

还没有任何评论哟~