600例CT/MRI双模态+15个腹部器官+8种扫描仪:AMOS-迄今最全面的腹部多器官分割基准数据集

发布时间:2026/8/2 13:10:49

600例CT/MRI双模态+15个腹部器官+8种扫描仪:AMOS-迄今最全面的腹部多器官分割基准数据集 摘要由香港大学联合香港中文大学深圳深圳大数据研究院、深圳市龙岗中心医院、深圳市龙岗人民医院共同创建了AMOSA large-scale Abdominal Multi-Organ benchmark for verSatile medical image segmentation数据集——一个大规模、多样化、面向真实临床场景的腹部多器官分割基准。该数据集包含 500 例 CT 和 100 例 MRI 扫描覆盖 15 个腹部器官的体素级标注来自多中心、多厂商、多模态、多期相、多疾病患者。AMOS 的发布填补了既往腹部器官分割数据集在规模和多样性上的空白为评估和推动鲁棒分割算法提供了全新基准同时还可用于分布外泛化、跨模态学习和迁移学习等多种研究任务。一、研究背景1、研究背景对腹部解剖结构进行密集且像素级精确的理解是计算机辅助临床应用如疾病诊断和放射治疗规划的基础。准确的腹部器官分割能够提供器官间相互关系、各器官在标准化空间中的位置和形态等关键信息对辅助临床决策至关重要。随着相关数据集的发展腹部器官分割领域已取得显著进展。然而在真实临床环境中实现鲁棒的腹部器官分割仍面临巨大挑战。不同患者、不同扫描仪获取的图像在器官形态结构、外观和成像质量上存在巨大差异。现有数据集和真实临床场景之间的差距严重制约了分割算法的实际应用能力。2、目前遇到困难和挑战1数据规模小Small-Scale3D 医学数据的采集和标注成本极其高昂。现有基准数据集要么样本数量有限要么器官标注数量不足或者两者皆缺。数据规模的不足直接限制了现代深度模型的能力发挥也使得不同方法之间的比较难以做到公平和准确。2缺乏多样性Lack of Diversity高昂的采集成本还限制了既往工作只能从单一中心、单一期相、单一扫描仪、单一疾病类型获取数据。在同类且不充分的数据集上训练的模型当测试数据分布在不同临床场景下发生偏移时性能会出现灾难性下降。一个更贴近真实场景、更鲁棒的解决方案迫切需要被提出。3模态单一与人群代表性不足既往腹部多器官分割数据集大多仅包含 CT 单一模态缺乏 MRI 数据无法支撑跨模态学习研究。同时现有数据集主要来源于西方人群缺乏亚洲人群的数据代表AMOS 从亚洲人群采集的数据将成为现有数据池的有价值补充。二、介绍数据集1、数据集名称AMOSA large-scale Abdominal Multi-Organ benchmark for verSatile medical image segmentation2、一句话介绍数据集AMOS 是一个包含 600 例 CT/MRI 扫描、覆盖 15 个腹部器官体素级标注的大规模多样化临床分割基准数据集标注切片总数达 74,026 张是此前常用数据集 BTCV 的 20 倍。3、详细介绍数据AMOS 数据集包含两个子集AMOS-CT500 例 CT 扫描和AMOS-MRI100 例 MRI 扫描来自 600 名不同患者每例扫描均包含 15 个腹部器官的体素级分割标注。15 个标注器官脾脏、右肾、左肾、胆囊、食管、肝脏、胃、主动脉、下腔静脉、胰腺、右肾上腺、左肾上腺、十二指肠、膀胱、前列腺/子宫。核心数据统计参数AMOS-CTAMOS-MRI合计扫描数量500100600训练集20040240验证集10020120测试集ID781189测试集OOD12229151扫描仪种类5 种3 种8 种标注切片总数——74,026标注器官数151515与现有数据集对比数据集器官数扫描数切片数模态年份BTCV13503,629CT2015MSD各子集148~420712~29,402CT/MRI2018Chaos4801,989CTMRI2019AbdomenCT-1K41,11234,497CT2021Word16150—CT2021AMOS1560074,026CTMRI2022AMOS 的标注切片数量是第二大数据集 AbdomenCT-1K 的2.2 倍是 BTCV 的20 倍。标注自然呈现长尾分布——肝脏的标注体素量约为肾上腺的200 倍这一真实的临床长尾特性使 AMOS 对精确多器官分割提出了更高挑战。4、数据集构建AMOS 的构建过程分为以下几个关键阶段1数据采集2018-2021 年间从深圳市龙岗区人民医院和龙岗中心医院两家医疗中心收集 CT/MRI 数据。筛选标准包括患者确诊为腹部肿瘤/异常、成像质量足够高、来源于不同扫描仪和不同扫描期相、尽可能覆盖指定的腹部器官。所有数据均经过去标识化处理并获得两家医院伦理委员会批准。2半自动标注流程考虑到 3D 数据标注的高昂成本AMOS 采用半自动标注策略粗标注阶段先由人工标注 50 例 CT 和 20 例 MRI 扫描然后用这些数据训练 3D-UNet 和 VNet 模型再用预训练模型对其余扫描进行自动预标注。精细化阶段5 名初级放射科医师逐例检查和修正分割结果3 名拥有 10 年以上临床经验的高级放射科医师负责最终验证。审核、错误修正和反馈分发反复迭代多次直到达成标注共识。3数据划分AMOS 创新性地按照扫描仪域进行数据划分支持分布内ID和分布外OOD评估。CT 子集中3 种扫描仪的数据用于训练/验证/测试ID另外 2 种扫描仪的数据作为 OOD 测试集MRI 子集同理。4数据发布数据以 DICOM 和 NIFTI 两种格式发布患者受保护健康信息PHI元数据已从 DICOM 文件中移除。5、数据集特点大规模Large-ScaleAMOS 包含 600 例 CT/MRI 扫描、超过 74K 标注切片是此前常用数据集 BTCV 的 20 倍是第二大数据集 AbdomenCT-1K 的 2.2 倍。在器官数量15 个和单扫描标注密度方面也显著优于现有数据集。多样且贴近临床Diverse and Clinical数据来自 2 家医疗中心、8 种不同扫描仪涵盖多模态CTMRI、多期相、多疾病类型患者均确诊为腹部肿瘤或异常。显著的异质性对算法鲁棒性提出了更高要求。词频分析显示数据集覆盖了广泛的疾病和器官类型。多功能性Versatile除多器官分割外AMOS 还支持分布外泛化、跨模态学习、迁移学习、隐私保护计算如联邦学习等多种研究任务。每个扫描仪域可视为独立客户端天然适合联邦学习研究。亚洲人群代表性AMOS 数据来源于亚洲人群弥补了既往腹部分割数据集以西方人群为主的不足为现有数据池提供了有价值的人群多样性补充。长尾标注分布标注体素量呈现自然的长尾分布肝脏约为肾上腺的 200 倍这一真实的临床特性使 AMOS 比人工平衡的数据集更具挑战性更贴近实际应用场景。6、数据集使用方法获取方式通过官方网站 https://jiyuanfeng.github.io/AMOS/ 获取数据集、基准服务器和基线代码。数据格式提供 DICOM 和 NIFTI 两种格式。评估指标使用 Dice 相似系数DSC和归一化表面 DiceNSD两个经典医学分割指标分别评估体素级分割精度和边界分割精度。评估设置支持分布内ID和分布外OOD两种测试设置OOD 测试集来自训练集未见的扫描仪域。注意事项鼓励后续工作报告模型参数量和计算量GFlops以便公平比较计算效率。7、基准测试总结在 6 种基线方法的 OOD 泛化测试中UNet 在 AMOS-MRI 上的 mDice 从分布内的86.05%骤降至分布外的64.70%性能下降达21.25 个百分点揭示了 MRI 跨扫描仪分布偏移对分割算法鲁棒性的巨大挑战。三、数据集有哪些场景的应用1、腹部多器官自动分割算法开发与训练这是 AMOS 最核心的应用场景。你想训练一个能自动把 CT 或 MRI 图像里 15 个腹部器官一个个分割出来的 AI 模型AMOS 直接给你 600 例带体素级标注的扫描数据涵盖脾脏、肝脏、肾脏、胃、胰腺、膀胱等 15 个器官。相比以前只有 50 例扫描的 BTCV 数据集AMOS 的数据量大了 20 倍而且每个器官都有精细的像素级标注足够让深度学习模型学到真正有用的特征。不管是用经典的 UNet还是最新的 Transformer 架构都可以直接在这上面训练和调优。2、小器官分割的精细化研究AMOS 有个特别真实的特性——标注体素量呈长尾分布肝脏的标注体素量是肾上腺的 200 倍这意味着小器官比如肾上腺、十二指肠、食管的分割特别难。论文的基准测试也证实了这一点不管用 CNN 还是 Transformer大器官脾脏、肝脏、肾脏分割得都不错但小器官的分割精度还是差得很远。所以如果你专门研究怎么提升小目标器官的分割精度AMOS 是一个非常好的试验场它天然的长尾分布给你提供了真实而棘手的挑战。3、分布外OOD泛化能力评估这个场景特别有意思。AMOS 按扫描仪来划分数据训练集用的是 A、B、C 三种扫描仪的数据但测试集里有来自 D、E 两种全新扫描仪的数据。你可以直接测试你的模型在没见过的设备上还能不能好好干活。论文发现一个有趣的现象CT 的 OOD 性能下降不明显因为 CT 各设备成像标准比较统一但 MRI 的 OOD 性能暴跌——UNet 从 86.05% 掉到 64.70%降了 21 个百分点所以如果你研究域适应、域泛化这类课题AMOS-MRI 简直是天赐的实验平台。4、跨模态学习研究AMOS 同时有 CT 和 MRI 两种模态的数据这太难得了一般数据集只有一种。CT 擅长显示器官和骨骼结构MRI 擅长显示软组织细节两者互补。论文做了一个实验把 CT 和 MRI 放在一起训练结果比单独训练效果更好——CT 的 mDice 提升了 0.55%MRI 提升了 2.14%。而且为了排除数据多就是好的因素还做了控制实验160CT40MRI vs 200CT10CT30MRI vs 40MRI效果依然成立。如果你研究多模态融合、跨模态知识迁移AMOS 提供了现成的双模态数据和实验基线。5、迁移学习与预训练模型评估AMOS 数据量大、器官多、多样性好天然适合做预训练数据集。论文做了 10 个下游任务的迁移学习实验先在 AMOS 上预训练再到其他数据集上微调。结果在 5 个与腹部相关的任务上如 MSD-Liver、MSD-Spleen、Kits 等AMOS 预训练模型都超过了从头训练的模型在 5 个不相关的任务上如心脏分割、COVID-19 肺部分割AMOS 预训练也不会带来负面影响。所以如果你需要一个强大的医学图像分割预训练 backboneAMOS 是一个很好的选择。6、算法公平比较与基准测试以前不同论文用的数据集不一样你有你的数据我有我的很难说谁的算法真的更好。AMOS 提供了统一的基准和在线评测服务器大家在同一份数据上比用同样的 DSC 和 NSD 指标评还要求报告参数量和计算量这样比较才公平。论文的基准测试就发现一个反直觉的结果经典的老牌 UNet 居然比一堆最新的 Transformer 方法表现更好这种发现在小数据集上是看不出来的只有在 AMOS 这种大规模数据集上才能暴露真相。7、联邦学习与隐私保护计算AMOS 按扫描仪分了好多域——CT 有 5 个域MRI 有 3 个域每个域可以当作一个独立的客户端。这简直就是为联邦学习量身定做的医院之间的数据不能随便共享隐私法规但可以在各自本地训练模型然后聚合。AMOS 的多域结构让你可以直接模拟这种场景研究怎么在不共享原始数据的前提下训练出好的分割模型这对医疗 AI 的实际落地非常重要。8、标注质量与迁移性能验证AMOS 还有一个巧妙用法验证数据集本身的标注质量和数据多样性。论文做了一个实验分别用 AMOS 和 BTCV 预训练 UNet然后在多个目标数据集上推理。结果 AMOS 预训练的模型在 BTCV 验证集上拿到了 84.47% 的 mDice居然比 BTCV 自己训练的模型83.62%还高这说明 AMOS 的标注质量和数据多样性确实更好能帮助模型学到更通用的特征表示。这个思路可以被其他数据集建设者借鉴用来验证自己数据集的质量。9、边界分割精度研究AMOS 同时报告了 DSC体素级精度和 NSD边界级精度两个指标。论文发现这两个指标之间存在显著差距——模型在体素级重叠上做得还行但在器官边界的精确分割上还差得远。如果你专门研究怎么提升分割边界的连续性和精度AMOS 提供的 NSD 指标可以很好地衡量你的方法在边界上的表现推动分割算法从差不多对向边界精准进化。10、子人群偏移与公平性研究AMOS 的数据来自亚洲人群而大部分现有腹部分割数据集来自西方人群。这本身就构成了一个子人群偏移sub-population shift的研究场景在亚洲人群数据上训练的模型在西方人群数据上表现如何反过来呢这种研究对医疗 AI 的公平性和普适性至关重要确保算法不会因为人群差异而产生系统性偏差。AMOS 为这类研究提供了来自亚洲人群的珍贵数据资源。相关资源本文是 LIDC-IDRI 数据集的详细解读。对于做医疗 AI 的朋友数据集选型往往是个痛点——不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中查阅成本很高。我们把 LIDC-IDRI 以及全球主流医疗 AI 数据集涵盖 CT、MRI、病理、超声、多模态等整理成了 AI-Ready Dataset 条目库以统一的 Wikipedia 式结构呈现方便研究者快速比对和选型Qianfanghub AI-Ready Datasethttps://www.qianfanghub.com/ai-ready-dataset/

相关新闻