尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AAAI 2023视觉论文精选:多标签分类、姿态估计与目标检测工程解读

AAAI 2023视觉论文精选:多标签分类、姿态估计与目标检测工程解读 1. 从AAAI 2023的16篇论文说起为什么这批研究值得逐篇拆解AAAI是人工智能领域的顶级会议之一每年录用的论文基本代表了当年学术界最关注的问题和最前沿的方法走向。2023年这一届优图实验室一口气入选了16篇论文方向覆盖多标签分类、姿态估计、目标检测、HOI人-物交互检测、小样本学习等多个子领域。这个数字本身不算夸张但方向分布很能说明问题——它几乎把视觉理解从“看到什么”到“看懂在干什么”再到“用极少样本学会新类别”这条链路全部覆盖了。如果你正在做目标检测的毕业设计或者正在为多标签分类的mAP上不去发愁又或者刚接触小样本学习不知道从哪篇论文入手这批论文其实是一个很好的“研究地图”。它不会直接给你一份能跑的代码但它能告诉你2023年前后顶会审稿人认可的问题定义是什么、方法创新点通常长什么样、实验该怎么做才够扎实。我自己在带团队做视觉项目时有一个很深的体会很多工程上的卡点其实早在半年前的顶会论文里就有了解法只是没人把它翻译成“工程语言”。比如开放词汇目标检测、激光雷达目标检测里的不确定学习、小目标检测中的特征对齐这些在工业场景里反复出现的问题在AAAI 2023的这批论文里都能找到对应的学术表达。所以这篇文章不打算逐篇翻译摘要而是按方向拆开把每个方向的核心问题、典型方法、实验设计和工程可借鉴的点讲清楚。需要提前说明的是以下内容基于公开的论文标题、摘要和常见学术实践进行合理演绎具体实验细节以原文为准。我的目标是让你读完能判断这个方向值不值得跟、跟的话从哪篇切入、工程上能抄什么。2. 多标签分类从BERT多标签分类到标签相关性建模2.1 多标签分类到底难在哪多标签分类和目标检测、姿态估计最大的不同在于它的输出空间是组合爆炸的。一张图里可能同时出现“人、狗、草地、飞盘”这四个标签之间不是互斥关系而是共存关系。更麻烦的是标签之间还存在统计相关性——比如“飞盘”和“狗”经常一起出现“草地”和“飞盘”也有一定关联。传统做法是给每个标签独立训练一个二分类器但这等于放弃了标签之间的结构信息。AAAI 2023这批论文里多标签分类方向的一个明显趋势是用Transformer架构来建模标签之间的依赖关系。具体来说就是把标签当成一个序列用自注意力机制去学“哪些标签倾向于同时出现”。这和BERT多标签分类的思路是一脉相承的——BERT本身就是在做序列建模只不过这里序列的元素不是词而是标签。2.2 标签相关性建模的两种主流路线目前学术界处理标签相关性的路线大致分两种。第一种是显式建模比如构造一个标签共现矩阵然后用图神经网络在标签图上做消息传递。这种方法的优点是可解释性强你能直接看到哪些标签之间权重高缺点是共现矩阵依赖训练集统计遇到长尾标签就不准了。第二种是隐式建模也就是用Transformer的自注意力让模型自己学标签之间的关系。AAAI 2023里有多篇论文走的是这条路。具体实现上通常是把图像特征作为Query把可学习的标签嵌入作为Key和Value做交叉注意力。这样每个标签嵌入都会根据图像内容动态调整而不是固定不变的。提示如果你在做多标签分类的工程落地不要一上来就上Transformer。先跑一个ResNetBCE的baseline确认数据管道和评价指标没问题再考虑换结构。很多团队的问题不在模型而在标签噪声和阈值选择。2.3 评价指标里的坑mAP不是唯一标准多标签分类的评价指标比单标签复杂得多。常用的有mAPmean Average Precision、CPCoverage、RLRanking Loss、HLHamming Loss等。AAAI论文里通常报告mAP和CP但工程上我更关注每类阈值下的F1。原因很简单mAP衡量的是排序质量但实际部署时你需要一个确定的阈值来决定“这个标签到底出不出”。我踩过的一个坑是论文里mAP很高但部署时发现某些类别的召回率极低。排查后发现是长尾类别在训练时被头部类别压制了。后来我们用了类别平衡采样 focal loss情况才好转。AAAI 2023里也有论文专门讨论长尾多标签分类思路是通过标签共现图来给尾部类别补充监督信号这个思路工程上完全可以借鉴。2.4 一个可复现的改进思路如果你手头有多标签分类任务可以试试这个组合主干用ConvNeXt或Swin Transformer提取图像特征然后接一个轻量级的Transformer解码器做标签相关性建模损失函数用ASLAsymmetric Loss。ASL的好处是它对正负样本的梯度做了非对称处理能缓解正负样本不平衡问题。这个组合在多个公开数据集上都被验证过有效AAAI 2023的论文里也有类似设计。3. 姿态估计多人姿态估计的精度与速度博弈3.1 多人姿态估计的两条技术路线多人姿态估计目前主流是两条路线自顶向下和自底向上。自顶向下是先检测人再对每个人做单人的关键点检测自底向上是先检测所有关键点再通过聚类把关键点组装成不同的人。AAAI 2023里姿态估计方向的论文两条路线都有涉及但明显能感觉到自底向上的方法在精度上追得很紧。自顶向下的优点是精度高因为每个人都被裁剪成独立样本尺度归一化做得好缺点是速度受人数影响大人越多越慢。自底向上的优点是速度恒定跟人数无关缺点是关键点组装容易出错尤其是人群密集、遮挡严重的时候。3.2 常见人体动作人体姿态估计数据集怎么选做姿态估计绕不开数据集选择。COCO Keypoints是目前最常用的17个关键点覆盖多人场景标注质量高。MPII是单人的但动作类别更丰富适合做细粒度动作分析。如果你做的是三维姿态估计那Human3.6M和MPI-INF-3DHP是标配。AAAI 2023的论文里大部分还是在COCO上做benchmark少数涉及3D的会用Human3.6M。注意COCO的标注里被遮挡的关键点也有标注但质量参差不齐。如果你做的是遮挡场景下的姿态估计建议自己清洗一遍标注或者用OKSObject Keypoint Similarity阈值来过滤低质量样本。3.3 姿态估计里的“不确定学习”这是一个比较新的方向。传统姿态估计模型对每个关键点输出一个坐标但不会告诉你这个坐标有多可信。实际上被遮挡的关键点预测不确定性很高如果下游任务比如动作识别能拿到这个不确定性就可以做加权融合。AAAI 2023里有论文专门做基于不确定性的姿态估计思路是让模型同时预测坐标和方差用高斯分布来建模每个关键点的位置。工程上这个思路很有用。比如你在做健身动作纠正如果模型对某个关节的预测方差很大你就可以选择不给出纠正建议避免误判。实现上也不复杂把最后的回归头改成输出两个值均值和方差损失函数用负对数似然。3.4 轻量化姿态估计的工程取舍如果你要在移动端做姿态估计精度和速度的取舍非常关键。AAAI 2023里有一些轻量化的工作但学术论文通常不会告诉你实际部署时的坑。我自己的经验是输入分辨率比模型大小更重要。把输入从256x192降到192x144速度能提升近一倍但精度可能只掉1-2个点。相反把模型从ResNet-50换成MobileNet精度可能掉5个点以上。另一个坑是后处理。自底向上的方法里关键点组装比如贪心匹配往往比模型推理还耗时。如果你用自底向上的方法一定要把组装逻辑用C或CUDA重写否则Python循环会成为瓶颈。4. 目标检测从YOLO到开放词汇工程视角的选型逻辑4.1 目标检测算法发展现状别再只盯着YOLO了目标检测是这批论文里占比最大的方向也是工程落地最成熟的。但“成熟”不等于“简单”。YOLO系列确实好用但AAAI 2023里的目标检测论文已经很少在YOLO框架上做增量改进了更多是在探索新问题开放词汇检测、激光雷达检测、小目标检测、不确定学习。先说开放词汇目标检测。传统检测器只能检测训练集里出现过的类别但实际场景里总有新类别。开放词汇检测的目标是用文本描述来指定要检测的类别模型不需要重新训练就能检测新类别。AAAI 2023里有论文用CLIP的文本编码器来生成类别嵌入然后和区域特征做对齐。这个思路工程上很有前景比如你做工业质检今天检测螺丝明天检测垫片不需要重新标注和训练。4.2 小目标检测为什么你的模型总漏检小目标检测是工程上最头疼的问题之一。AAAI 2023里有论文专门讨论这个。小目标难检的根本原因有三个一是分辨率低特征不明显二是正样本少训练时被大目标主导三是NMS时容易被大目标的框抑制掉。解决思路通常从三个层面入手。数据层面用Mosaic、MixUp等增强手段增加小目标的出现频率。特征层面用FPN、PANet等多尺度特征融合或者用高分辨率特征图专门处理小目标。损失层面用Focal Loss或Quality Focal Loss来缓解正负样本不平衡。我实测下来最有效的组合是高分辨率输入 FPN Copy-Paste增强。Copy-Paste就是把小目标抠出来随机粘贴到其他图上这样能显著增加小目标的训练样本。AAAI 2023里也有类似的数据增强策略。4.3 激光雷达目标检测点云和图像的融合激光雷达目标检测是自动驾驶领域的核心问题。AAAI 2023里有论文做点云和图像的融合检测。纯点云的方法比如PointPillars、CenterPoint精度已经不错但缺乏纹理信息纯图像的方法有纹理但缺乏深度。融合的方法通常是把点云投影到图像平面或者把图像特征反投影到点云。工程上融合的难点在于时间同步和空间对齐。激光雷达和相机的采样频率不同外参标定也有误差。如果你要做融合建议先用软同步取最近时间戳跑通流程再考虑硬同步。4.4 目标检测评价指标mAP之外你还需要看什么目标检测的评价指标主要是mAP但mAP有很多变体mAP0.5、mAP0.5:0.95、mAP0.75。AAAI论文里通常报告mAP0.5:0.95但工程上我更关注mAP0.5和召回率。原因很简单很多场景下你宁愿多检几个误报也不愿意漏检。比如安防场景漏检一个入侵者比多检几个影子严重得多。另外FPS和模型大小也是硬指标。AAAI 2023里有一篇论文提到一个MACs仅5MB的目标检测模型这个量级明显是冲着移动端去的。如果你要做嵌入式部署模型大小和MACs比mAP更重要。5. HOI检测从“看到什么”到“看懂在干什么”5.1 HOI检测的问题定义HOIHuman-Object Interaction检测的目标是给定一张图检测出“人-动作-物体”三元组。比如“人-骑-自行车”、“人-拿-杯子”。这比目标检测难得多因为它不仅要定位人和物体还要识别他们之间的交互关系。AAAI 2023里HOI方向的论文核心挑战还是长尾分布和上下文建模。有些交互很常见比如人拿杯子有些很罕见比如人拧螺丝。罕见交互的样本少模型学不好。另外交互关系往往需要上下文信息比如“人拿杯子”和“人拿刀”光看手部区域很难区分需要结合物体和场景。5.2 常见的人体动作和交互数据集HOI检测常用的数据集有V-COCO和HICO-DET。V-COCO是COCO的子集标注了人和物体的交互HICO-DET更大有600多种交互类别。AAAI 2023的论文里HICO-DET是主要benchmark。提示HICO-DET的标注噪声比较大有些交互标注得模棱两可。如果你要做HOI的工程落地建议先在自己的数据上定义清楚交互类别不要直接套用HICO-DET的类别体系。5.3 工程上怎么用HOI检测HOI检测在工程上的应用场景包括智能监控检测打架、摔倒、体育分析检测投篮、传球、人机交互检测手势指令。但直接部署HOI模型的不多更多是把HOI的思路拆开用。比如你先做目标检测再做人-物配对最后用一个分类器判断交互类别。这样每一步都可控也方便调试。AAAI 2023里有一篇论文用了Transformer做交互推理思路是把人和物体的特征拼在一起用自注意力来建模它们之间的关系。这个思路工程上可以简化用两个RoI Align分别提取人和物体的特征拼接后过一个MLP输出交互类别。虽然简单但在数据充足的情况下效果不差。6. 小样本学习用极少样本学会新类别6.1 小样本学习的核心设定小样本学习的目标是给定少量样本比如每个类别5张图模型能快速学会识别新类别。AAAI 2023里小样本方向的论文主流设定还是N-way K-shotN个新类别每个类别K个样本。小样本学习的难点在于过拟合。样本太少模型很容易记住训练样本而不是学到泛化特征。解决方法通常有三类数据增强生成更多样本、元学习学会“如何学习”、度量学习学一个好的特征空间让同类样本靠近、异类样本远离。6.2 小样本学习和目标检测的结合小样本目标检测是小样本学习里比较难的分支。因为检测不仅要分类还要定位。AAAI 2023里有论文做小样本目标检测思路是用基类base class训练一个检测器然后在新类novel class上做微调。微调时只更新分类头冻结主干和回归头这样能避免过拟合。工程上小样本目标检测的典型场景是工业质检新产品上线时只有几张缺陷样本但需要快速部署检测模型。我的经验是基类选择比算法更重要。基类要尽量覆盖新类的视觉特征比如新类是“划痕”基类里最好有“裂纹”、“凹坑”等类似缺陷。6.3 小样本学习的评价指标小样本学习通常报告平均准确率在多个任务episode上取平均。AAAI论文里通常报告5-way 1-shot和5-way 5-shot的准确率。但工程上我更关注新类别的召回率和误报率。因为小样本场景下模型往往偏向于预测基类导致新类召回率低。一个实用的技巧是在微调时给新类的分类权重一个更大的学习率或者用余弦分类器Cosine Classifier来替代线性分类器。余弦分类器对样本量少的情况更鲁棒。7. 这批论文对工程落地的实际启发7.1 学术论文和工程代码之间的距离AAAI论文通常不会开源代码即使开源也往往是研究代码不是生产代码。所以读论文的正确姿势是看问题定义、看方法思路、看实验设计不要指望直接跑通。比如开放词汇目标检测论文里用CLIP做文本嵌入但CLIP模型很大推理慢。工程上你可以用蒸馏后的小模型或者用预计算的类别嵌入。7.2 哪些方向值得优先跟进如果你做的是通用视觉多标签分类和目标检测是最成熟的论文里的方法可以直接借鉴。如果你做的是自动驾驶激光雷达目标检测和不确定学习值得重点关注。如果你做的是工业质检小样本学习和开放词汇检测更有价值。姿态估计和HOI检测相对小众但在特定场景健身、监控里很有用。7.3 一个实用的论文阅读流程我自己的流程是先看标题和摘要判断问题是否相关再看方法图理解核心思路然后看实验表格确认在标准数据集上的表现最后看消融实验了解哪个模块真正起作用。如果消融实验显示某个模块贡献很小那工程上就可以砍掉降低复杂度。提示不要迷信SOTA。AAAI论文里的SOTA往往是在特定数据集、特定评价指标下的SOTA。换一个数据集排名可能完全变。工程上稳定性和可解释性比零点几个点的mAP更重要。7.4 从论文到产品的最后一公里从论文到产品最大的鸿沟是数据。论文用的都是公开数据集标注质量高、分布均匀。但实际场景的数据往往有噪声、有长尾、有域偏移。所以我的建议是先用论文方法在公开数据集上复现确认理解无误然后在自己的数据上做误差分析找出主要失败模式最后针对失败模式做定向优化而不是盲目换模型。这批AAAI 2023的论文最大的价值不是提供了某个可以直接用的模型而是展示了2023年前后学术界对视觉理解问题的思考方式。多标签分类里的标签相关性、姿态估计里的不确定学习、目标检测里的开放词汇、小样本学习里的元学习这些思路在工程上都有对应的落地场景。关键是你能不能把学术语言翻译成工程语言把论文里的“创新点”变成产品里的“功能点”。
返回列表