在目标检测中,以深度学习为基础的众多模型取得了优异的效果,尽管基于深度学习的方法在大部分领域已经取得了一定的成就,但对于类似于交通标志检测这种小目标检测问题,由于其在图像中的尺寸较小,特征信息较少,导致模型难以提取有效特征,从而影响模型的准确率。因此,如何提高小目标检测的准确率成为了一个重要的研究方向。
小目标检测问题
小目标是指在图像中尺寸、分辨率较小的目标,通常在目标检测中,小目标检测问题是指由于小目标的特征信息较少,导致模型难以提取有效特征,从而影响模型的准确率。在交通标志检测中,由于交通标志距离车身摄像头较远,其中有用信息占用图像较小区域,导致小目标检测困难,难以提取到有效特征。在TT100K交通标志数据集中,42.5%的交通标志样本都属于小目标,大目标仅占比7.5%。
可查看样本不均衡条件下交通标志检测方法研究2了解更多关于小目标检测问题的内容。
小目标检测算法
针对小目标检测问题,主要有特征金字塔网络和路径聚合网络两种方法。
特征金字塔网络
识别小目标的关键在于提取多尺度特征,单一特征图网络结构无法提取多尺度特征,因此提出了特征金字塔网络。特征金字塔网络是一种多尺度特征提取网络,可以提取不同尺度的特征,用于目标检测和分割等任务。特征金字塔网络的结构示意图如下:
为了利用到浅层特征图,层级金字塔特征对单一特征图网络结构进行了改进,层级金字塔特征结构可以同时利用深层特征和浅层特征进行预测,低分辨率、语义特征强的深层特征图负责检测大目标,高分辨率、纹理信息强的浅层特征图主要负责检测小目标。由于利用到了浅层特征图进行检测,层级金字塔特征结构在一定程度上增加了小标检测的性能。然而,此类结构的浅层特征并没有利用到深层特征,对深层特征的利用率不高。
(FPN, Feature Pyramid Networks)对深层特征图和浅层特征图进行了融合,提高了小目标检测的准确率。FPN 通过自顶向下的路径和横向连接融合了深层特征图和浅层特征图,缓解了信息扩散问题,进一步提升了小目标检测的性能,且对网络推理速度的影响较小。路径聚合网络
(PANet, Path Aggregation Network)是一种深度学习网络结构,用于图像分类和目标检测任务。它采用了多尺度特征融合和路径聚合的方法,能够有效地提高模型的性能和准确率,PAN网络结构包括主干网络和特征金字塔网络两部分,其中特征金字塔网络用于生成多尺度特征图,主干网络则用于将这些特征图进行路径聚合和特征融合。简单理解可参考深度学习-路径聚合网络(PANet网络)
Figure 1:Illustration of our framework. (a) FPN backbone. (b) Bottom-up path augmentation. (c) Adaptive feature pooling. (d) Box branch. (e) Fully-connected fusion. Note that we omit channel dimension of feature maps in (a) and (b) for brevity.
(a)(b)(c)(d)(e)。注意,为了简洁,(a)和(b)中省略了特征图的通道维度。
在传统的目标检测模型中,如 Faster R-CNN,多尺度特征的处理通常采用金字塔结构或特征融合的方式。PANet 通过引入自上而下和自下而上的路径聚合,有效利用不同层次的特征图,使得模型能够更好地适应不同尺度目标和场景。
PANet 包含两个主要的模块:
自上而下的路径聚合模块(PA): 该模块从较低分辨率的特征图开始,通过上采样操作逐层向上传递信息。在每个层级,低分辨率特征图与高分辨率特征图进行横向连接和逐点加法操作,以整合不同尺度的信息。
自下而上的路径聚合模块(PAM): 该模块从高分辨率的特征图开始,通过下采样操作逐层向下传递信息。同样,在每个层级,高分辨率特征图与低分辨率特征图进行横向连接和逐点加法操作。
这两个路径聚合模块相互协作,构成了 PANet 的核心结构。通过这种设计,PANet 能够更好地整合不同尺度的特征信息,提高了目标检测模型对小目标和遮挡目标的检测性能。PANet 的设计结构提供了一种通用的多尺度信息聚合方法,可以应用于不同的目标检测任务。
简而言之,就是先进行下采样,再进行上采样,最后进行特征融合,或者先进行上采样,再进行下采样,最后进行特征融合,同时使用自上而下和自下而上的的两个金字塔结构,使得模型能够更好地适应不同尺度目标和场景。
只在P3、P4、P5三个特征层上构建了FPN和PAN特征金字塔结构,主要有以下几个考虑:- 计算资源受限。FPN和PAN都会引入额外计算量,作者需要考虑实际部署的速度指标。因此只在最关键的几层特征图上进行多尺度特征融合是一种折中。
- P3-P5对检测任务影响最大。大量研究表明,在目标检测任务中,P3-P5对代表不同尺度目标的效果最好,因此重点增强这三层特征已能达到很好的效果。
- 高分辨图的语义值有限。YOLOv8中只有P3-P5三层进行下采样,更高分辨率的特征层语义信息有限,因此作者可能认为没必要构建超过三层的金字塔结构。
- 保证实用性。仅在三层特征图上使用FPN和PAN,就足以使YOLOv8在速度和精度上达到最优的平衡,比构建更深的金字塔结构更实用。
PANet 能够更好地提取浅层特征,并多角度、多方面地融合提取特征,从而使得特征图中的特征信息更丰富全面。然而,PANet 只是通过简单的线性聚合来融合特征图,在融合过程中没有考虑浅层特征图和深层特征图的重要区域不同,在融合过程中会保留原特征图无用的信息。
A2SFF模块 待续......
问卷调查
在本篇学习笔记中,在多处使用了AI快捷搜索对话功能,作为读者,你认为这种功能对你的文章阅读有帮助吗?您可点击以下链接参与问卷调查,帮助我们更好地改进产品,本次问卷为有奖问卷,包括PostChat会员和现金奖励,感谢您的参与!点击参与问卷调查



