尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

为什么Meta做文生图不用Diffusion模型?深扒Muse架构设计

为什么Meta做文生图不用Diffusion模型?深扒Muse架构设计 为什么Meta做文生图不用Diffusion模型深扒Muse架构设计现在提到AI画图大家脑子里蹦出来的基本都是 Stable Diffusion 或者 Midjourney。这些基于 Diffusion扩散技术的模型生成质量确实好但都有个祖传痛点——太慢了。扩散模型本质上是一个从随机噪声中一步步“去噪”的过程。就像画家在一块满是污渍的画布上一点点擦拭、上色你需要等它经历几十甚至上百步的迭代图片才能清晰起来。这种顺序执行的马尔可夫链机制直接锁死了它的生成速度上限。但Meta偏不走这条路。他们推出的 Muse 模型完全抛弃了 Diffusion转头用上了 Masked Generative Transformer掩码生成 Transformer。结果生成速度直接快了好几倍。作为后端或AI方向的开发我们平时天天跟各种架构打交道今天就来拆解一下Muse 凭什么能用 Transformer 在图像生成领域破局。怎么把图像塞进 Transformer我们要用 Transformer 处理文本通常是先把句子切成一个个 Token。但图像是一大块连续的像素这怎么弄答案是 VQGAN。Muse 利用这种矢量量化自编码器把连续的图像像素压缩、映射成一个个离散的“视觉 Token”。你可以理解为它把一张复杂的图片翻译成了一本由特殊“词汇”组成的二维字典。这不仅大幅降低了计算维度也让 Transformer 处理图像有了发力点。抛弃自回归选择掩码预测既然有了离散的视觉 Token最直观的想法就是像 GPT 生成文本那样从左到右、从上到下一个个预测。比如 Google 的 Parti 就是这么干的。但这种自回归Autoregressive模式同样有顺序依赖速度快不起来。Muse 选择的是类似 BERT 的 Masked Generative Transformer 架构。它的任务不再是“填空题”。在训练阶段Muse 会随机把图片中的部分视觉 Token 遮住Mask然后让模型根据没遮住的部分和文本提示词把遮住的部分猜出来。速度飙升的秘密并行解码真正让 Muse 速度起飞的是它在推理生成阶段的并行解码Parallel Decoding机制。想象一下从零生成一张图片的场景一开始整张画布全是 [MASK]遮罩。模型把文本提示词和这块全白的画布输入 Transformer一口气并行预测所有位置的视觉 Token。一把预测肯定有准有不准。模型会根据各个 Token 预测的置信度保留那些非常确定的比如轮廓、大色块把不确定的重新盖上 [MASK]。将更新后的画布再次输入模型预测剩余的 [MASK]循环几轮。传统的扩散模型需要一步步去噪而 Muse 通过这种策略只需迭代 10 到 24 步就能完成全图生成。因为每次迭代都是大规模并行预测多个 Token整体生成时间被极大地压缩了。附赠的超能力天生支持图像编辑这种“填空题”式的掩码架构还带来了一个附赠的巨大优势。平时用 Stable Diffusion 做图像局部修改Inpainting通常需要引入额外的控制网或者做微调。但在 Muse 这里局部修改根本就是它的本职工作。你只需要把图片里想改的地方直接打上 [MASK]输入新的提示词模型就会自动填补这块区域并且能完美融合周围的图像上下文。不需要任何微调开箱即用。总结Meta 绕开了拥挤的 Diffusion 赛道用离散化 Token Masked Transformer 证明了不依靠连续去噪也能搞定高质量的图像生成。在技术选型时这种思路很值得借鉴。当我们面对一个看起来必须顺序执行的复杂耗时任务时能不能像 Muse 一样先把它离散化、拆解成多个块然后通过并行预测和置信度筛选把线性的长任务压缩成几次高并发的批量处理这也许是比单纯优化某个算法实现更能带来指数级收益的架构级破局。
返回列表