Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
发布时间
阅读量:
阅读量
本篇文章属于LLM系列内容,主要对《Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs》这一文献进行语言转换处理。
Ferret UI:基于多模态LLM的移动UI理解
- 摘要
- 1 引言
- 2 相关研究
- 3 技术手段
- 4 数据集合与任务界定
- 5 实验分析
- 6 总结
摘要内容提炼
当前,多模态大型语言模型(MLLMs)在技术层面取得的突破性进展值得关注,但这些面向通用领域的模型在解析用户界面(UI)屏幕以及实现与之有效交互方面仍存在明显不足。我们提出了一种新型的MLLM——Ferret UI,其设计目标是提升对移动设备UI屏幕的理解能力,并具备参考、基础及推理三种功能。由于UI屏幕通常呈现出比自然图像更为细长的纵横比,并且包含诸如图标、文字等更小尺寸的关键元素,我们在Ferret模型中引入了“任意分辨率”的处理机制,以增强细节识别能力和视觉分析效果。具体而言,每个屏幕根据原始纵横比被划分为两个子图像:纵向屏幕采用水平分割方式,而横向屏幕则采用垂直分割方式。这两个子图像在输入至大语言模型之前均被独立编码处理。为了训练该模型,我们从多个基础UI任务中收集了大量样本数据,包括图标识别、文本查找以及小部件列表等任务。这些数据均按照规范格式进行整理
全部评论 (0)
还没有任何评论哟~
