pytorch retinanet 目标检测
发布时间
阅读量:
阅读量

本研究采用的框架版本为pytorch1.7.1,依托于Pytorch平台所提供的预训练模型资源,借助该模型可实现对COCO数据集中超过80类物体的识别与检测。
RetinaNet输入格式解析
输入图像的数据结构采用[C, H, W]的形式,其中C代表通道数,H表示高度,W表示宽度。此外,还需指定一个batch size参数,该参数用于定义每次处理的图像数量。因此,完整的输入格式应为[N, C, H, W]。同时,图像中每个像素的数值范围需控制在0到1之间。
RetinaNet输出格式解析
该输出结构由一个列表构成,列表中包含一个字典,字典内部存储了结果张量。其整体格式定义为List[Dict[Tensor]]。所涉及的字典中包含以下键值:
boxes (FloatTensor[N, 4]):用于表示预测的边界框,其坐标格式为[x1, y1, x2, y2]
labels (Int64Tensor[N]):对应每张图像的预测类别标签
scores (Tensor[N]):每个预测结果对应的置信度得分

还没有任何评论哟~
