Advertisement

YOLO学习笔记

阅读量:

一,YOLO

1,主要过程

1):将图像划分为 S * S (论文中取7)个单元格,当某一目标的中心点位于某个单元格内时,该单元格将承担检测该目标的任务。

2):每个单元格会生成B个边界框以及对应的置信度,置信度可被解释为该边界框包含目标的概率与IoU的乘积。

3):每个边界框预测5个参数,包括x、y、w、h以及置信度。其中x、y表示目标中心相对于单元格边界的偏移量,而w、h则表示相对于整张图像的尺寸。

4):每个单元格还会预测一个类别(需注意,并非每个边界框都对应一个类别),即Pr(Class_i | Object)。因此,在测试阶段需要将类别概率与置信度进行结合以得出最终的类别概率。

综上所述,一张图像将生成 S * S * (B * 5 + C) 个预测值。

2,结构

网络结构包含24个卷积层与2个全连接层,最终输出维度为7 * 7 * 30(S=7, B=2, C=20)。此外,在Fast YOLO模型中,仅配置了9个卷积层,所使用的滤波器数量也相对较少,其余部分的结构则保持一致。

3,训练过程

1):首先使用前20个卷积层结合平均池化层与全连接层,在

全部评论 (0)

还没有任何评论哟~