尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

发丝级抠图的双边参考:BiRefNet 如何同时做到“找得准、抠得细”

发丝级抠图的双边参考:BiRefNet 如何同时做到“找得准、抠得细” BiRefNet 是一种专为高分辨率二分图像分割DIS设计的双边参考框架它通过“图像内部参考梯度外部参考”的双重引导机制在发丝级抠图、高分辨率显著性检测和隐蔽目标检测等任务上实现了 SOTA 性能并已成为 ComfyUI 等生态中广泛使用的开源背景移除标杆模型。一、要解决什么问题传统图像分割方法在处理高分辨率图像时面临一个核心矛盾全局语义定位需要低分辨率特征来把握整体而精细边缘分割又依赖高分辨率特征来捕捉发丝、叶脉等微小结构。以往方法要么只在特征层面拆分监督要么引入额外的频率先验但都难以同时兼顾“找得准”和“抠得细”。BiRefNet 的出发点很直接用全局信息定位目标用梯度信息指导精细重建在一个统一框架内同时完成两件事。二、核心架构BiRefNet 由两个基本组件构成组件作用核心机制定位模块LM利用全局语义信息辅助目标定位把握“目标在哪里”重建模块RM利用双边参考进行精细重建回答“边缘长什么样”Backbone默认采用Swin Transformer V1 Large以捕获多尺度层次特征。编码器和解码器各阶段之间用 1×1 卷积连接最深阶段使用ASPP 模块增强多尺度上下文建模。三、关键技术双边参考BiRef这是 BiRefNet 最核心的创新。所谓“双边”指的是两种不同来源的参考信号协同工作源参考Source Reference来自原始图像的层次化 patchinward reference保留原始尺度的细节信息。目标参考Target Reference来自梯度图outward reference梯度特征能够很好地反映物体中细微、非显著的特征。论文的观察是对原始图像做导数运算得到的梯度特征可以有效突出发丝、细线等精细结构。但当某些位置与背景的颜色和纹理高度相似时梯度特征可能过弱此时进一步引入Ground Truth 特征进行侧向监督让框架学习这些位置的特征。此外BiRefNet 还引入了辅助梯度监督专门加强对精细细节区域的关注并设计了针对 DIS 任务的实用训练策略。四、性能表现BiRefNet 在论文中于四个任务上进行了广泛实验在所有基准上均超越了任务专用的前沿方法DIS二分图像分割在 DIS5K 数据集上训练可分割到发丝级别的细线无需额外遮罩引导HRSOD高分辨率显著性目标检测COD隐蔽目标检测高分辨率通用分割实际部署中经过TensorRT优化后BiRefNet Portrait 模型在 1024×1024 分辨率下RTX 3060 FP16 精度下中位延迟仅 123ms相比原生 PyTorch 推理提速 5.3 倍。RTX 4080S 上的对比更为显著TensorRT 首次推理仅需0.17s而 PyTorch 为 0.71sONNX 高达 5.32s。五、应用场景5.1 背景移除与抠图这是 BiRefNet 最广泛的应用。它可以将前景从任意背景中分离生成干净的二值遮罩或 alpha 通道。RMBG-2.0BRIA AI 基于 BiRefNet 用高质量私有数据训练就是这一方向的代表性商业级模型在各类前景/背景分离任务中表现优异。5.2 ComfyUI 工作流集成BiRefNet 已被多个开发者封装为 ComfyUI 节点在 Stable Diffusion 工作流中用于前景分割和抠图预处理。ComfyUI 官方模板中已内置 “BiRefNet: Remove Background” 工作流用户更新到最新版本后可在 Utility 类别下直接调用。社区还提供了支持图像和视频处理的多种节点实现包括 TensorRT 加速版本和 Universal 节点包。5.3 人像抠图与实时应用经过 TensorRT 优化的人像专用版本BiRefNet Portrait专为实时自拍背景移除、视频会议虚拟背景、批量人像照片编辑等场景设计输入 1024×1024 时仅需约 2GB GPU 显存。5.4 动漫图像处理社区使用自定义动漫数据对 BiRefNet 进行微调得到了针对动漫图像背景移除优化的ToonOut模型在动漫素材抠图任务上取得显著提升。5.5 水下图像与复杂场景在更具挑战性的场景中如水下成像BiRefNet 也展现出应用潜力。水下成像的模糊条件和复杂污损纹理给边缘区域分割带来困难研究者通过标签传播机制对 BiRefNet 的分割结果进行增强和精炼。六、模型变体与生态BiRefNet 提供了丰富的预训练模型矩阵覆盖不同分辨率和任务需求模型适用场景特点General通用场景基础预训练模型General-HR高分辨率通用在 2048×2048 上表现优异General-Lite轻量通用资源受限场景General-Lite-2K轻量高分辨率2560×1440General-dynamic动态分辨率256×256 到 2304×2304Portrait人像抠图针对人像优化Matting无 trimap 抠图通用 mattingMatting-HR高分辨率 matting2048×2048DIS / HRSOD / COD特定任务对应论文评估任务部署生态也相当成熟支持 PyTorch、ONNX、TensorRT 多种推理格式有 Rust 重实现Burn 框架、GGUF 轻量化格式C 推理、Nuke 插件等社区项目。七、口述总结“BiRefNet 是 CAAI AIR24 发表的高分辨率二分图像分割框架核心创新是双边参考机制。它用定位模块把握全局语义用重建模块结合两种参考信号做精细分割源参考是原始图像的层次化 patch保留细节目标参考是梯度图突出发丝级结构。当梯度太弱时引入 Ground Truth 特征做侧向监督。Backbone 是 Swin Transformer V1 Large训练时加了辅助梯度监督。在 DIS、HRSOD、COD 四个任务上都是 SOTATensorRT 优化后 1024×1024 分辨率下延迟只有 123ms。实际应用上它是 ComfyUI 生态里最常用的背景移除模型之一RMBG-2.0 就是基于它训练的。面试里常被问的是为什么梯度可以作为参考因为对图像做导数运算得到的梯度特征天然对边缘和细微结构敏感能弥补语义特征在精细定位上的不足。”八、一句话收束BiRefNet 的本质是把“找得准”和“抠得细”拆成两条互补的信息通路再用双边参考把它们拧在一起。这既是它在 DIS 任务上超越专用方法的原因也是它能在 ComfyUI 生态中成为背景移除事实标准的技术底座。
返回列表