尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language...

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language... DeCoT论文总结与核心部分翻译一、文章主要内容本文聚焦当前文本到图像(T2I)模型在处理复杂、长文本指令时的不足——如难以准确呈现复杂细节、空间关系和特定约束,尤其在LongBench-T2I基准测试中,模型在构图、特定文本渲染和精细纹理等维度表现欠缺。为此,作者提出DeCoT(Decomposition-CoT)框架,通过融合大型语言模型(LLMs)的理解与推理能力,提升T2I模型对复杂指令的处理效果。DeCoT框架包含两个核心阶段:复杂指令分解与语义增强:将原始复杂指令输入LLM(如GPT-4、Gemini Pro),结合少样本提示、思维链(CoT)等技术,拆解为结构化、可执行的语义单元(如核心对象及属性、背景细节、空间关系、环境元素、特定约束),同时澄清指令中的模糊部分,补充上下文相关的具体信息。多阶段提示整合与自适应生成:根据T2I模型的能力适配输入形式——支持多阶段输入的模型,将语义单元转化为渐进式提示序列,通过迭代优化生成图像;不支持多阶段输入的模型,则将语义单元融合为单条优化提示,为关键元素分配权重,确保生成时不遗漏核心信息。为验证框架有效性,作者在LongBench-T2I数据集(含500个复杂提示,覆盖9个视觉维度)上开展实验,以扩散模型(如Omnigen、FLUX.1-dev)和自回归模型(如Infinity-8B、Janus-pro-7B)为基线,采用Gemini-2.0-Flash、InternVL3-78B等多模态大模型评估。
返回列表