Robotic Transformer 2 (RT-2)|视觉-语言-行动(VLA)模型
发布时间
阅读量:
阅读量
Google DeepMind 的研究团队开发出一个名为 RT-2 的新型模型,其核心目的在于将大规模预训练的视觉-语言模型所具备的功能整合至端到端的机器人控制系统之中。这项具有突破性的研究探讨了如何借助此类模型,使机器人能够在实际环境中执行多样化的任务,并进一步增强其适应环境的能力以及语义推理水平。研究人员提出了一种被称为“视觉-语言-动作”(VLA)的模型架构,该架构能够运用在互联网规模下训练所得的知识,并实现与机器人控制系统的高效融合。
视觉-语言模型
多年来,学术界持续探索构建具备高度适应性的视觉-语言模型(VLM),旨在满足诸如机器人技术等多领域中对复杂任务的处理需求。此类模型以一个或多个图像作为输入信息,并生成对应的token序列,这些序列承载了在实际场景中完成高层次任务及解析细微信息所需的操作指令。其中一类具有代表性的模型是能够输出自然语言文本的系统,这类系统可同时接受视觉与语言输入,并生成具有自由表达形式的文本反馈。在本项研究中,重点探讨的是如何将基于互联网海量数据进行预训练的视觉-语言模型加以优化,从而实现对机器人执行直接且闭环控制的有效应用。
训练具有机器人意识的视觉-语言模型
将视觉-语言模型应用于机器人系统所面临的核心难题,是如何引导其生成对应的机械操作指令,同时维持其对语言与视觉信息的原有认知能力。为达成此目标,研究
全部评论 (0)
还没有任何评论哟~
