尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

067、YOLOv11改进-Transformer Decoder风格检测头替换实验即插即用涨点对比

067、YOLOv11改进-Transformer Decoder风格检测头替换实验即插即用涨点对比 067、YOLOv11改进-Transformer Decoder风格检测头替换实验即插即用涨点对比从一次检测头调试翻车说起上个月做自动驾驶小目标检测,YOLOv11跑KITTI数据集,mAP卡在0.72死活上不去。调了三天学习率、数据增强、甚至把backbone换成RepViT,涨点不到0.5个点。后来翻看特征图可视化,发现检测头输出的分类分数分布极其混乱——背景区域居然有0.6的置信度,小目标区域反而只有0.3。这明显是检测头的感受野和特征交互出了问题。YOLOv11的检测头沿用了YOLOv8的CoupledHead设计,三个分支共享一个卷积层,然后各自接两个卷积输出bbox和cls。这种设计在通用场景下够用,但遇到尺度变化大、遮挡严重的场景,共享特征会导致分类和回归任务互相干扰。我决定把检测头换成Transformer Decoder风格——让每个目标通过交叉注意力机制主动从特征图中“查询”信息,而不是被动等待卷积核扫过。为什么Transformer Decoder适合做检测头传统卷积检测头的问题在于:每个anchor点只能看到局部区域,感受野固定。Transformer Decoder的核心是交叉注意力——每个目标query可以动态关注全图任意位置的特征。这相当于给检测头装了一个“全局注意力开关”,小目标需要高分辨率细节时,注意力权重会自动聚焦到小区域;大目标需要全局上下文时,权重会分散到更大范围。另一个关键点是:Decoder的self-attention层
返回列表