Advertisement

pytorch retinanet 目标检测

阅读量:

本研究采用的框架版本为pytorch1.7.1,依托于Pytorch平台所提供的预训练模型资源,借助该模型可实现对COCO数据集中超过80类物体的识别与检测。

RetinaNet输入格式解析

输入图像的数据结构采用[C, H, W]的形式,其中C代表通道数,H表示高度,W表示宽度。此外,还需指定一个batch size参数,该参数用于定义每次处理的图像数量。因此,完整的输入格式应为[N, C, H, W]。同时,图像中每个像素的数值范围需控制在0到1之间。

RetinaNet输出格式解析

该输出结构由一个列表构成,列表中包含一个字典,字典内部存储了结果张量。其整体格式定义为List[Dict[Tensor]]。所涉及的字典中包含以下键值:

boxes (FloatTensor[N, 4]):用于表示预测的边界框,其坐标格式为[x1, y1, x2, y2]

labels (Int64Tensor[N]):对应每张图像的预测类别标签

scores (Tensor[N]):每个预测结果对应的置信度得分

![](https://cdl.ita

全部评论 (0)

还没有任何评论哟~