
今天给大家演示一个基于 ComfyUI 的图像反推描述词工作流。加载任意图像后,工作流会利用 LlamaVision 模型生成高质量视觉描述,再由翻译节点将英文内容转换成中文。最后通过文本展示节点输出可直接用于提示词创作的自然语言描述。整个流程轻量、直观,也适合作为图像理解类任务的基础模板。文章目录工作流介绍核心模型Node节点工作流程大模型应用图像内容理解节点应用场景开发与应用工作流介绍这个工作流围绕“图像反推描述词”展开,目标是让输入图片自动生成一段结构清晰、语义完整的视觉描述。流程以 LoadImage 读取图像作为起点,由 LlamaVision 模型完成主体识别和语言生成,再通过翻译节点将输出内容本地化。最终以显示节点呈现结果,形成一条从图像到描述文本的完整链路。核心模型核心模型负责将图像转化为自然语言描述。工作流采用 Llama-3.2-11B-Vision-Instruct-nf4,它能根据复杂视觉内容生成连贯、细腻的语义表达,这为后续的翻译与展示奠定稳定基础。模型名称存储需求内存使用推理速度精度表现功能描述应用场景模型特性/硬件要求minicpm-v:latest (version)较低较低快中等轻量级的视觉处理模型移动设备、轻量化推理场景