尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Boost EfficientNet: CNN 看懂病理切片这件事终于有突破了

Boost EfficientNet: CNN 看懂病理切片这件事终于有突破了 背景为什么这件事比想象中难传统诊断的困境目前淋巴结转移的诊断主要依靠病理医生在显微镜下观察苏木精-伊红HE染色的组织切片。这一过程面临三大挑战工作强度大一名病理医生每天可能要看数十张高分辨率切片每张切片动辄数万像素 × 数万像素信息量巨大。主观差异不同医生对同一张切片的判断可能存在分歧尤其在癌变区域边界模糊的情况下。地区资源不均经验丰富的病理医生在发展中国家和偏远地区严重短缺诊断质量参差不齐。深度学习遇到的三个实际卡点深度学习在自然图像领域已经取得了巨大成功如 ImageNet 分类任务但把通用 CNN 直接迁移到病理图像效果往往不如预期。作者在论文中指出了三个核心问题① 癌变区域小而分散在整张病理切片图像里癌变区域可能只占很小一块。研究中使用的 patch图像块可能只有 32×32 像素左右——在高分辨率切片中这相当于大海里捞针。如果癌变特征没有被正确捕捉到模型就很容易给出错误的判断。② 背景干扰严重病理切片中正常组织的信息量远大于癌变区域。如果直接把整张图送进模型模型很容易被背景信息带偏把「正常组织」误判为「癌变」或者反过来目标声音太小噪音太大。③ 预训练模型迁移效果有限ImageNet 预训练的模型在自然图像上表现优异但医学图像的纹理、颜色分布、细胞形态与自然图像差异很大。直接迁移相当于「用猫狗图片训练出的模型去看病理切片」数据分布的不匹配是主要瓶颈。图1乳腺癌淋巴结转移检测任务示意正常切片 vs 癌变切片核心方案Boosted EfficientNet-B3 做了什么论文提出了一个端到端的解决方案。核心思路是在 EfficientNet-B3 预训练模型基础上叠加三个针对性改进模块每个模块解决一个实际问题。附Github链接https://github.com/Markin-Wang/Boosted-EfficientNet-Detection-of-Lymph-Node-Metastases-in-Breast-Cancer-Using-Convolutional-Neural/tree/main2.1 整体架构一览图2Boosted EfficientNet 整体网络架构图采用的是EfficientNeB3作为backbone先经卷积层提取特征再利用注意力机制重加权以增强关键部分。随后对多层输出进行 FF最终基于融合特征完成分类。2.2 改进一随机中心裁剪Random Center Cropping, RCC癌变特征有个重要特点高度集中在图像中心区域。基于这个观察作者设计了随机中心裁剪RCC数据增强策略流程如下Step 1: 原图尺寸 96×96 像素Step 2: 四周各 padding 8 像素 → 得到 112×112 像素Step 3: 从 112×112 中随机裁剪回 96×96这样做有一个很巧妙的效果癌变核心区域大概率被保留在裁剪后的图像中心同时每次裁剪位置有随机性数据多样性得到显著提升。对比来看很多常见的数据增强方法如随机裁剪、随机翻转在病理图像上是「破坏」中心信息的——随机裁剪大概率会把癌变区域切掉而 RCC 恰恰是「保护」中心。这种针对任务特性的数据增强设计是该方法有效的重要原因之一。图3RCC 随机中心裁剪策略示意图2.3 改进二通道注意力机制Channel Attention借鉴人类视觉「一眼找到目标」的特性作者在 EfficientNet-B3 特征提取后引入了通道注意力模块对特征图做重新加权。整个流程如下特征图 U↓Global Average Pooling全局平均池化↓两层全连接W1(压缩) → ReLU → W2(恢复)↓Sigmoid 激活输出 0~1 权重↓原始特征图 × 权重 → 加权特征图直观理解模型学会了「关注哪些通道的特征更像癌变组织」而不是把所有通道一视同仁地看待。这种机制在癌变区域和正常组织交错的情况下能够有效降低误报率FPR。SE-NetSqueeze-and-Excitation Networks是这个思路的经典实现本文在此基础上做了轻量化适配。图4通道注意力机制结构图SE Block 示意】2.4 改进三多尺度特征融合Multi-scale Feature FusionCNN 的不同层捕获的信息是不同的浅层特征保留更多细节信息如细胞边界、纹理结构分辨率高但语义弱。深层特征语义更强表达高级语义概念如「这片区域是癌变的」但分辨率低。作者将 EfficientNet-B3 多个中间卷积层的输出进行融合让模型同时具备「细节感」和「语义感」弥补单一尺度表达的不足。融合策略通常采用逐元素相加element-wise add或通道拼接concatenate具体方式见论文原文。图5多尺度特征融合结构示意实验结果五个指标全部领先3.1 数据集RPCam实验在 RPCamRectified Patch Camelyon数据集上进行。Camelyon 数据集是乳腺癌淋巴结转移检测领域最权威的公开数据集之一来源于 Camelyon16/17 挑战赛。RPCam 是对原始数据的 patch 级别裁剪版本专门用于评估算法在癌变区域 patch 级别的分类能力。3.2 主实验结果论文在 RPCam 数据集上将 Boosted EfficientNet-B3 与三种主流模型进行了对比EfficientNet-B3原始版无改进ResNet50经典残差网络VGG19经典深度网络五个评估指标中Boosted EfficientNet-B3 全部取得最高分模型AccuracyAUCSensitivitySpecificityBoosted EfficientNet-B3✅ 最高✅ 最高✅ 最高✅ 最高EfficientNet-B3原始较低较低较低较低ResNet50较低较低较低较低VGG19较低较低较低较低表1RPCam 数据集上各模型性能对比注具体数值详见论文原文表2/表33.3 消融实验每个模块的贡献为了验证每个改进模块的独立贡献作者做了详尽的消融实验ablation study结论三个模块各司其职相互之间没有冲突叠加使用带来了显著的性能增益。这说明每个改进点都是有效的。看法朴素方法的胜利5.1 为什么这个方法值得借鉴这篇论文的方法论其实很朴素——没有用 Vision Transformer没有堆两百层深的网络就是在 EfficientNet-B3 基础上针对性地加了三个模块。但朴素不等于简单。三个改进点每一步都针对具体的医学图像问题RCC → 针对癌变区域集中特性数据层面注意力机制 → 针对背景干扰问题特征层面特征融合 → 针对单一尺度表达不足结构层面这种带着问题意识做改进的思路比单纯刷 SOTA 更有参考价值。很多同学做医学图像方向的研究上来就堆 Transformer、堆 Self-Supervised但如果没有搞清楚具体问题是什么再花哨的结构也只是空中楼阁。5.2 局限性与未来方向论文也存在一些局限性数据集规模相对有限在更大规模数据上的泛化能力有待验证。patch 级别的分类结果如何映射到整张切片级别WSI-level还需要额外的 MIL多实例学习策略。可解释性不足注意力机制的可视化CAM/Grad-CAM可以进一步分析模型关注了哪些区域。未来的改进方向可以包括引入 Transformer 捕获长距离依赖、加入对比学习做自监督预训练、以及用 CLIP 类多模态模型做跨模态病理诊断。
返回列表