尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

083、Scale-AwareAttention多尺度感知注意力在YOLOv12中的适配:小目标检测性能提升与消融实验分析

083、Scale-AwareAttention多尺度感知注意力在YOLOv12中的适配:小目标检测性能提升与消融实验分析 083、Scale-AwareAttention多尺度感知注意力在YOLOv12中的适配:小目标检测性能提升与消融实验分析昨天半夜还在盯着验证集上那个0.31的mAP@0.5:0.95发呆,小目标那一栏的AP值跟心电图似的上蹿下跳,换了anchor、调了loss权重、甚至把输入分辨率从640拉到960,收益都微乎其微。后来翻到CVPR 2023那篇Scale-Aware Attention的论文,突然意识到一个问题——YOLOv12的C3k2模块在融合多尺度特征时,用的还是最朴素的concat加卷积,不同尺度的特征在通道维度上被一视同仁地对待,小目标的细节信息早就被大目标的背景响应给稀释了。Scale-Aware Attention的核心思想其实很直白:让网络自己学会在不同空间位置上分配不同尺度的注意力权重,而不是靠固定的下采样倍数去硬扛。先说说这个模块到底干了什么。论文里把特征图按空间分辨率分成几个分支,每个分支用不同膨胀率的空洞卷积提取上下文,然后通过一个轻量的注意力机制计算每个分支的权重,最后加权融合。听起来不复杂,但关键在细节——它的注意力权重不是全局共享的,而是逐像素生成的,这意味着网络可以在天空背景区域放大感受野去抑制误检,在密集小目标区域缩小感受野去保留细节。这个特性正好戳中YOLOv12的痛点,因为YOLOv12的SPPF结构虽然能聚合多尺度信息,但那是串行的,不同尺度之间没有显式的交互权重。插入位置我试了三个地方。第一个是Backbone的最后一层C3k2之后,也就是进入SPPF之前,这个位置能影响整个特征提取阶段的输出;第二个是Neck的PANet结构里,每次上采样或下采样之后的C3k2模块替换成Scal
返回列表