Reinforcement Learning 学习 (三)
发布时间
阅读量:
阅读量
前言
近期正在深入学习Mujoco环境,通过研读官方提供的教程以及参考开源的示例代码,对SB3库中所包含的强化学习标准工具集有了初步认识。在此基础上,尝试构建了属于自己的实验环境,并以UR5E机械臂为对象,完成了一个避障任务的实践。同时,还尝试接入图像大模型的API接口,开发了一些具有趣味性的应用。相关参考资料如下:
_https://mujoco.readthedocs.io/en/stable/overview.html
https://pab47.github.io/mujocopy.html
https://github.com/ian-chuang/Manipulator-Mujoco.git_
接下来,我计划从理论基础、实验实施过程、结果呈现以及后续改进方向这几个方面进行详细阐述。
原理部分概述
【首先需要提及的是SB3这一强化学习工具库,根据我目前的认知,该库依托于gym环境及其衍生版本gymnasium,能够借助矢量转换技术提升训练效率,尽管其性能尚无法与isaac gym相媲美,但其操作便捷性更胜一筹(个人观点),因此在本研究中我选择使用该库进行相关学习。
鉴于我的研究目标是实现机械臂的运动控制,因此所涉及的动作空间为连续型,在这种情况下,建议优先采用PPO作为基础模型,首先确保实验能够顺利运
全部评论 (0)
还没有任何评论哟~
