姿态估计 | DARK——人体姿势估计通用trick
发布时间
阅读量:
阅读量
https://arxiv.org/pdf/1910.06278.pdf
- 关键点标签编码(encoding)
在对人体姿态估计网络进行训练过程中,为降低计算成本,通常会对输入图像实施降采样处理,并在该降采样后的分辨率基础上开展训练。为了让网络能够以热度图作为训练目标,需将原始图像分辨率下的关键点坐标信息,转换为对应降采样后分辨率下的坐标数据,并借助高斯模糊方法将其转化为热度图。此过程被定义为坐标编码,即从具体坐标点生成热图的映射过程。
- 关键点热度图解码(decoding)
为了准确预测关键点在原始图像坐标系统中的具体位置,在完成热图预测之后,需要对图像分辨率进行相应的恢复操作,以便将其转换回原始的坐标空间。这一过程被称作坐标解码,即从热图中还原出具体的坐标点。
现有解码策略分析
目前针对关键点编码与解码机制的探讨性文献数量较少,但实际表明,编码与解码环节对最终输出结果的影响程度,往往超过网络架构调整所带来的影响。接下来将简要阐述当前主流的人体关键点估计模型(例如Hourglass、Hrnet等)所普遍采用的解码方法。此类解码方案旨在解决以下所述的固有问题。

全部评论 (0)
还没有任何评论哟~
