
点击上方“小白学视觉”选择加星标或“置顶” 重磅干货第一时间送达在计算机视觉领域图像融合技术一直是提升场景感知能力的核心——无论是红外与可见光图像的融合、多焦点图像的整合还是多曝光图像的优化优质的融合结果能为自动驾驶、移动摄影、医学成像等领域提供关键支撑。但长期以来传统融合方法要么缺乏语义可控性要么依赖外部模型才能实现简单的编辑调整难以兼顾“高质量融合”与“灵活化控制”。近期一项名为DiTFuse的研究成果打破了这一僵局。该研究提出了首个基于扩散TransformerDiT的指令驱动图像融合框架首次实现了在单一模型内完成多类型图像融合、语义控制调整甚至下游分割任务为图像融合领域带来了全新的范式升级。论文信息题目 Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach面向统一语义与可控图像融合一种扩散Transformer方法作者 Jiayang Li, Chengjie Jiang, Pengwei Liang, Jiayi Ma, Liqiang Nie, Junjun Jiang一、核心痛点传统融合方法的三大“卡脖子”问题在深入了解DiTFuse之前我们先梳理下传统图像融合技术的核心困境语义与控制脱节多数方法采用“先融合后编辑”的范式文本控制信号无法有效注入融合过程难以实现细粒度的语义控制数据稀缺无真实参考融合任务缺乏大规模标注数据集且没有统一的“真实融合图像”作为参考模型训练难度大任务割裂融合生成与下游任务如分割分属不同模型无法端到端完成增加了应用复杂度场景鲁棒性差面对低光照、过曝、色偏等复杂场景融合结果容易继承源图像缺陷缺乏灵活调整能力。正是针对这些痛点DiTFuse从架构设计、训练策略、数据构建三个维度提出了系统性解决方案。二、DiTFuse整体架构多模态并行融合的全新范式DiTFuse的核心优势首先体现在其创新的整体架构设计上这套架构首次将文本指令与多源图像特征在统一潜空间中联合建模实现了从早期到晚期的端到端语义可控融合。图3如上图所示DiTFuse的整体架构主要包含四大核心模块1. 文本编码器采用预训练的Phi-3分词器将自然语言指令转换为语义嵌入让模型能精准理解用户的控制意图——比如“提升融合图像中行人区域的亮度”“增强全局对比度”等指令都能被编码为模型可识别的语义标记。2. 视觉编码器基于SDXL的VAE模块将输入的源图像如红外可见光、近焦远焦等分块后编码为潜在标记实现图像特征的高效提取与压缩。3. DiT块这是整个架构的核心将文本标记与图像标记拼接成统一序列通过32层Transformer层处理完成跨模态交互与融合特征生成。相较于传统架构DiT的迭代去噪特性能让文本指令全程参与融合过程而非仅在融合后做简单调整。4. LoRA适配层在不破坏预训练DiT模型多模态能力的前提下通过低秩适配技术快速适配图像融合任务大幅降低微调成本同时保证模型性能。值得一提的是DiTFuse采用“并行输入结构”文本指令与多源图像从输入阶段就同步进入模型而非传统的“先融合图像再用文本编辑”。这种设计让文本能直接控制融合内容的选择与生成比如在红外-可见光融合中模型能根据“保留行人红外特征增强背景可见光细节”的指令精准选择不同模态的有效信息。三、关键创新三大核心策略破解训练与控制难题1. 多退化掩码图像建模M3无真实参考也能大规模训练针对融合数据稀缺、无真实参考的问题研究团队提出了M3策略——通过对大规模自然图像施加互补退化噪声、模糊、掩码生成训练对让模型在无需真实融合参考的情况下学习核心能力。图4具体来说M3会将一张自然图像复制为两个视图划分成不同大小的网格补丁后对75%的补丁施加“互补退化”比如A视图该区域加噪声B视图保持清晰B视图该区域模糊A视图保持清晰剩余25%的补丁则在两个视图中共同退化。这种设计模拟了“多源图像在不同区域各有优势”的融合场景迫使模型学习“选择清晰区域、整合互补信息”的核心能力同时还能让模型掌握像素级的图像对齐技巧。2. 多任务混合训练融合控制分割一站式掌握为了让模型同时具备融合、控制、分割能力研究团队构建了包含四类数据的混合训练范式融合数据仅占4.3%、M3数据、分割数据、控制数据。图5其中分割数据让模型学习高级语义信息能精准识别图像中的目标类别控制数据则基于M3构建了大规模文本引导的控制对支持全局/局部亮度、对比度调整M3数据与少量融合数据结合让模型适配红外-可见光、多焦点、多曝光等多种融合任务。所有任务都统一在“指令驱动”的框架下模型接收“两幅图像文本指令”输出符合要求的结果真正实现了端到端的统一训练。3. 结构化指令设计精准理解用户意图为了让模型清晰区分不同任务类型研究团队设计了标准化的指令格式结合任务标签如[FUSION]、[CONTROL]、[SEG]、子任务标签和自由指令消除多任务训练的歧义。图6这种结构化设计让模型能精准响应不同指令比如面对[FUSION][IVIF]红外-可见光融合指令时专注于模态信息整合面对[CONTROL][BRIGHTNESS]指令时则调整图像亮度避免任务混淆。四、效果实测全方位碾压SOTA方法在公开的IVIF红外-可见光、MFF多焦点、MEF多曝光基准测试中DiTFuse展现出了显著的优势。1. 红外-可见光融合复杂场景下的语义与纹理双优在过曝、雾天、低光照等复杂场景中DiTFuse能有效消除伪影同时保留关键语义信息。图7定量指标上DiTFuse在MSRS、M3FD、TNO等数据集的MSE、PSNR像素级一致性以及MANIQA、CLIPIQA无参考语义评估等指标上均达到SOTA既保证了纹理保真度又不丢失语义信息。2. 多焦点融合精准整合不同焦平面细节在RealMFF等多焦点数据集上DiTFuse能更高效地融合近焦与远焦图像的细节残差图显示其成功整合了两个焦平面的纹理信息生成的图像更清晰、锐利。图83. 多曝光融合缓解过曝/欠曝保留色彩与细节在SICE多曝光数据集上DiTFuse能精准选择不同曝光图像的有效区域避免传统方法的“平均化”缺陷在过曝场景中有效保留细节欠曝场景中提升亮度同时保证色彩自然。图94. 指令控制细粒度调整零样本分割DiTFuse的核心亮点之一是指令驱动的可控性——用户可通过文本指令调整融合图像的亮度、对比度甚至实现局部区域的精准控制。图10更令人惊喜的是DiTFuse首次实现了融合与分割任务的统一能根据指令直接输出融合图像的语义分割图且分割精度远超现有方法。图12通过GPT-4o构建的多维度评估协议精确率、召回率、IoU准确率验证DiTFuse的分割性能显著优于LISA等开源分割模型即使在无分割真实值的数据集上也能保持高鲁棒性。5. 效率平衡性能与速度兼顾尽管基于扩散Transformer架构DiTFuse的推理速度仍与其他扩散类融合方法相当且相较于依赖外部模型的文本控制方法端到端处理速度更快在RTX 3090 GPU上能高效完成单张图像的融合与控制。五、总结图像融合进入“指令驱动”新时代DiTFuse的出现彻底打破了传统图像融合“融合与控制分离、任务与数据割裂”的局限架构上首次将DiT与并行多模态输入结合实现端到端语义可控融合训练上M3策略解决了数据稀缺与无参考的难题多任务训练实现了融合与下游任务的统一应用上支持多类型融合任务、细粒度指令控制、零样本泛化兼顾性能与实用性。这项研究不仅为图像融合提供了全新的技术范式也为多模态生成模型在视觉任务中的落地提供了重要参考。未来随着指令数据集的进一步丰富和模型效率的优化DiTFuse有望在更多实际场景中发挥价值让图像融合真正从“被动生成”走向“主动可控”。下载1OpenCV-Contrib扩展模块中文版教程在「小白学视觉」公众号后台回复扩展模块中文教程即可下载全网第一份OpenCV扩展模块教程中文版涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。下载2Python视觉实战项目52讲在「小白学视觉」公众号后台回复Python视觉实战项目即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目助力快速学校计算机视觉。下载3人工智能0基础学习攻略手册在「小白学视觉」公众号后台回复攻略手册即可获取《从 0 入门人工智能学习攻略手册》文档包含视频课件、习题、电子书、代码、数据等人工智能学习相关资源可以下载离线学习。交流群欢迎加入公众号读者群一起和同行交流目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群以后会逐渐细分请扫描下面微信号加群备注”昵称学校/公司研究方向“例如”张三 上海交大 视觉SLAM“。请按照格式备注否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告否则会请出群谢谢理解~