尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Stable Diffusion提示词实用指南:从词库分类到权重语法

Stable Diffusion提示词实用指南:从词库分类到权重语法 玩Stable Diffusion的人应该都有过这种经历同样一个模型别人出的图质感炸裂、构图高级自己抄了同样的提示词却总感觉差口气。其实差距往往不在显卡而在提示词。Stable Diffusion的提示词本质上是你和模型沟通的语言同一个意思换一种说法出图效果可能完全不同。这篇文章就把我平时真正在用的提示词经验整理一遍从词库分类到权重语法再到实操配方尽量让新手能直接抄作业也让有一定基础的朋友看看有没有可以补充的细节。这篇文章不是那种“输入英文词就能出大片”的玄学教程而是我自己踩了无数坑之后总结出的一套提示词使用逻辑为什么某些词必须放在前面为什么有些词越加越乱负向提示词到底在负什么。如果你正在用WebUI或者ComfyUI想稳定地出高质量的图那这篇文章应该能帮你省下不少试错时间。1. 提示词到底在控制什么先理解SD的工作逻辑1.1 为什么同一个模型不同提示词效果天差地别Stable Diffusion并不是真的“听懂”了你的话它只是在一个巨大的图像与文本配对数据集中学会了“这些词经常和这些视觉特征一起出现”。当你输入一个词时模型会把它当作一个触发条件去匹配它学到的视觉模式。这个过程叫交叉注意力机制简单理解就是模型在画图的时候会回头“看”你给的每个词然后决定哪个区域跟哪个词对应。这也解释了为什么提示词的顺序很重要。模型对前面词的注意力权重天然会更高尤其在采样步数有限的情况下。我习惯把最重要的内容放最前面比如人物主体、核心动作、画面构图然后再补环境和风格。反过来如果上来先写一堆光影氛围词人物特征反而容易被稀释。另一个经常被忽略的点是提示词和模型是配对使用的。同一个提示词在写实大模型和二次元大模型上出来的完全是两套东西。我在初学阶段犯过的最大错误就是拿着通用提示词到处套模型然后抱怨“为什么我出的图这么丑”。后来才明白每个模型在训练时用的标签体系不同它的“语言习惯”也不一样。换模型后先跑几张最小测试图确认语气对上了再放手调参数。1.2 正向提示词与负向提示词的配合逻辑很多人觉得正向提示词是负责“画什么”的负向提示词是负责“不画什么”的。这句话方向没错但实际使用时两者是协同关系。负向提示词的真正价值是帮模型排除那些“高频但你不想要”的默认倾向。比如写实模型很喜欢在皮肤上加噪点和纹理你想要干净皮肤就得在负向里明确写掉它。我常用的负向提示词分三个层次。第一层是通用画质修正词比如 lowres、bad anatomy、bad hands、extra fingers、missing fingers、blurry、jpeg artifacts这些对任何题材都有效。第二层是针对当前模型特性的词比如某些二次元模型容易出多余肢体或者衣服穿模就要额外写多余肢体、多余的腿之类。第三层是风格排出词比如你想避免“油腻塑料感”就写 glossy skin、over-saturated想在写实图里避免“玄幻味”就写 3d render、illustration。这里分享一个核心经验负向提示词和采样器也有关系。有些采样器对负向词特别敏感比如DPM 2M Karras负向词稍微写重点就容易画面发灰而DPM SDE这类则对负向词响应慢需要写得更明确。所以不要一套负向词打天下出图效果不对味时先怀疑负向和采样器的组合问题再去动正向。2. 常用提示词分类我日常出图最常用的标签库2.1 画质与通用修饰词保底不出废图画质词是新手最应该先背下来的一类词它们不负责具体画什么而是告诉模型“把画质拉高、细节做足”。我在所有正常出图的正向提示词里几乎都会带一组基础画质词masterpiece、best quality、highly detailed、8k wallpaper。这几个词的组合相当于给模型设定了一个基础输出的基准线虽然不能保证构图好看但能明显减少糊图和颜色脏乱的问题。如果想进一步控制画质走向可以把修饰词细分。比如 volumetric lighting 和 cinematic lighting 是控制光影风格的前者适合柔和的空气感后者适合戏剧性的电影感。physically-based rendering 这类词适合写实渲染效果但用在二次元模型上就没什么作用。ultra-detailed 和 intricate details 会让模型在皮肤、布料、建筑装饰上加更多纹理但代价是出图速度稍微变慢且容易在背景上堆砌无意义的细节。画质词最常见的问题是用过头。我在群友的作品里经常看到 masterpiece 写三遍、best quality 写两遍其实权重叠加效果会边际递减一个词写两遍之后再加重复词对结果的改变已经微乎其微反而占据宝贵的token位置。如果你想强调画质用权重语法 (masterpiece:1.2) 比写两遍 masterpiece 更有效这一点后面会展开说。2.2 主体与人物描述词让角色真正“立得住”人物类提示词是SD用户最关心的部分也是翻车最频繁的部分。想要一个角色立得住我的分组习惯是人物属性面部特征穿搭细节动作姿态。这样不仅出图稳定后续如果要换衣服或者改动作只需替换对应分组的词而不用重写整段提示词。人物属性包括性别、年龄段、身材特征。比如 1girl 是二次元模型里最常用的女性主体词young woman 则更适合写实模型。这里特别提醒一句不同模型的“女性”词汇习惯差异巨大。有些写实大模型对 woman、female 的响应很好但换到二次元模型上可能需要直接用 1girl 才能触发正确画风。建议拿到一个新模型后先分别测试这类基础主体词的表现差异把这个“词汇习惯基线”摸清楚再开始正式创作。面部特征词是双刃剑。像 blue eyes、short hair、ponytail 这类具体特征能帮你还原角色但写太多太杂模型会顾此失彼经常出现左眼蓝右眼棕的bug。我的建议是一次最多指定2-3个最关键的面部特征其余交给模型默认发挥。穿搭描述也类似重点写整体轮廓和颜色比如 black dress、white shirt少写复杂的纹理细节否则模型会把精力放在织物质感上反而忽略构图和姿态。动作和姿态词容易被忽略但它在构图中的作用非常关键。standing、sitting、running 只是最基础的动作想让画面更生动可以加细节描述。我的经验是多用“动作朝向视线”的组合比如 looking at viewer 是看向镜头looking back 是回头full body 控制全身角度。这里有个实用技巧想让人物有“故事感”试试点名视角和表情的组合比如 looking at viewer slight smile hands behind back往往比单纯写 beautiful girl 更容易出有氛围的图。2.3 场景、光线与风格词决定画面的“高级感”场景和光线是拉开普通图和高级图差距的关键。很多人只顾着写人物出来的图背景空洞、光比平淡。我习惯在人物描述之后跟一组环境词把场景、光照、大气氛围一次交代清楚。常见的场景词有 outdoors、indoor、city street、forest、beach但仅写一个场景词太笼统最好补充光线和时间信息比如 golden hour 会带来落日暖光night 和 moonlight 则会走冷色调路线。风格词是让作品从“AI味”里跳出来的重要工具。同样是人物肖像加上 impasto 会带出油画笔触感加上 isometric 变成等轴测游戏风格加上 pixel art 直接切换成像素画风。但我必须提醒风格词和主模型必须匹配。你在写实模型里写 anime style效果可能还不如不写因为大模型的风格倾向已经定型风格词更像是一个微调手轮而不是方向盘。还有一个容易忽略的点是画幅和镜头语言。cinematic shot、wide shot、close-up 这类镜头词直接决定画面视角。wide shot 适合交代环境和角色关系close-up 适合突出面部的微表情。结合人物动作时比如 medium shot upper body能稳定控制人物在画面中的比例减少半身变全身或者大头贴的意外。3. 提示词的实用写法从能出图到出好图3.1 WebUI里最实用的权重语法别再一个词写三遍了很多新手看到别人提示词里的 (keyword:1.2) 或者 [keyword] 会有点懵其实这几个语法非常容易理解。圆括号加冒号加数字比如 (masterpiece:1.3)意思是把 masterpiece 这个词的权重提升到1.3倍。反过来方括号例如 [low quality]意思是降低这个词的权重。重点说一下权重的实际使用场景。当你的画面主体不突出时给主体词加权重往往比加形容词更管用。比如你写 a white cat sleeping出来的图猫不够大或者被背景抢了戏可以改成 (a white cat:1.3) sleeping让模型把注意力重心放在“白猫”而不是“睡觉”上。另一个高频需求是调节平衡。当画面里有多样元素时比如一个女孩站在一栋建筑前如果构图老是偏向建筑就给女孩的词加权重。这个方法比反复修改措辞高效得多。记住一个原则权重是用来做“优先级排序”的不是越大越好。权重拉到1.5以上往往会出现色彩过饱和、形体畸变的问题我一般把权重控制在0.8到1.3之间超过1.5只会在极端需求下出现。关于权重语法还有个小技巧WebUI允许用 () 直接提高权重写二层括号的意思是1.1倍再乘1.1倍。三层括号就是1.331倍。这种写法虽然直观但可读性很差。我建议统一使用 (word:1.2) 的显式写法方便后续查看和调试。你自己隔三天再看自己的提示词时这种显式写法会友好得多。3.2 ComfyUI里的提示词组织思路节点化与复用ComfyUI 和 WebUI 的最大区别是提示词从一段文本变成了可编排的节点。很多人一开始会不习惯但适应之后会发现它管理多段提示词的能力更强。比如你可以做一个“固定画质词”节点一个“角色描述”节点一个“场景描述”节点然后把这些节点串到同一个采样器上。这样换主题时只需要改其中一个节点其它保持不变比在WebUI里手动复制粘贴整段文本稳定得多。ComfyUI 里最实用的提示词思路是“拆分合并”。我把提示词拆成三个独立节点正向基础画质风格、正向主体人物动作、负向基础。这样跑实验时我可以单独测试哪组画质词搭配哪组主体词效果更好而不需要修改整个prompt。通过这种方式我可以在几分钟内完成一组对比实验找出在特定模型上表现最好的词组合。另外ComfyUI生态里有很多提示词插件但我的建议是优先用原生节点把手动流程跑通再上插件。插件对提示词的影响往往会叠加在基础节点上如果你不熟悉基础流程出了bug很难排查到底是插件的问题还是提示词本身的问题。等熟悉了再考虑用 Dynamic Prompts 这类插件做批量随机化测试效果会更好。3.3 提示词模板几张我常用的出图配方光讲理论容易飘这里分享几个我在实际项目中反复使用的提示词模板。每个模板先写适用场景再给正向和负向参考方便你直接复制替换。第一个是通用半身肖像模板适合做头像和人物设定图。正向参考masterpiece, best quality, highly detailed, 1girl, looking at viewer, upper body, soft lighting, clean background, depth of field。负向直接抄通用负向词即可。这个模板的核心是“干净背景柔和光线浅景深”对大部分写实和二次元写实模型都适配。出图后如果觉得人物太呆板可以往正向里加 candid expression 或 slight smile 这类表情词。第二个是电影感场景模板适合做插画或概念图。正向参考cinematic still, dramatic lighting, volumetric fog, dark moody atmosphere, lone figure, wide shot, detailed background, film grain。这类图的关键是环境先行人物只是氛围的一部分。负向需要额外写 clean image、no text因为电影感画面很容易被模型塞进奇怪的文字水印或无意义标语。第三个是产品展示模板适合做包装和平面参考。正向参考product shot, studio lighting, white background, reflection of product, high quality render, soft shadow。很多人以为产品图只需要描述产品特征其实光线和背景词的权重反而更大。studio lighting 和 soft shadow 这两个词基本决定了产品图的专业感值得保留。模板只是起点真正好用的配方都需要基于你自己的模型微调。我建议拿到模板后先固定参数采样器、步数、CFG跑10张图观察整体倾向再逐项调整提示词这样你才能知道模板在你当前的模型上到底表现如何而不是直接套用看结果不好就放弃。4. 提示词相关的踩坑记录与排查思路4.1 最常见的几个问题黑图、崩脸、风格不对黑图和灰图是提示词环节最常见的翻车现场。黑图往往不是因为你写了黑色而是采样器在低步数下权重崩坏或者负向提示词里写了和画风冲突的内容。比如在写实模型里负向写 illustration 或 anime可能导致整体画面被拉向一个不存在的方向最终输出一张灰蒙蒙的图。排查时先恢复一个最简正向只留画质词和主体词逐步往回加找到那个导致黑图的词。崩脸问题出现的原因比较复杂。一方面可能是负向提示词漏掉了 keyframe 和 extra digits 这类容易诱发面部畸形的标签另一方面是采样步数太低。步数低于20时模型还没有足够时间细化面部结构容易出现五官错位。我的建议是先把步数调到25-30再判断是不是提示词的问题。另外adetailer面部修复可以让面部在二次采样中重点优化对崩脸效果立竿见影。风格不对味是另一类常见问题。如果让一个写实模型去画出二次元风格你加十遍 anime style 都没用因为模型根本没有这个风格的数据分布。这种时候要换模型而不是死磕提示词。判断自己的模型基础风格先把提示词清空只留一个 masterpiece 和主体词跑一张看模型默认出什么风格你就知道该怎么写后续的词了。4.2 提示词不是越多越好token与优先级SD的输入token有限制虽然WebUI自动帮你截断超长部分但压缩后的表达会失真。我的经验是提示词总长度控制在75个token左右效果最优再多就可能导致模型把注意力分散到无关细节上反而丢失核心要素。所谓“less is more”在提示词里绝对是真理。那么怎么判断哪些词应该保留哪些词应该删掉我通常会把一个提示词里的词分类为核心词、修饰词、氛围词三级。核心词控制主体和构图不能删修饰词用于增加画质和风格细节可以替换或降权氛围词是锦上添花可有可无。每次出图不满意的调参顺序先调整氛围词和修饰词再去动核心词。这样能最大限度保留图中已经好的部分而不是盲目推翻重来。4.3 使用提示词插件与模型的搭配心得现在WebUI有很多提示词插件比如标签补全、中英翻译、自动分类等等。我自己的态度是插件可以提升效率但不能替代你对提示词本身的理解。以标签补全插件为例它只是帮你快速找到常用的标签词但不会告诉你哪些词在你的模型上会冲突哪些词权重太大容易崩。如果你不镀懂语义搭配的底层逻辑插件反而会让你在无关无关的标签里浪费更多时间。模型与提示词的搭配还有一个容易踩的坑依赖模型作者提供的示例提示词。很多模型作者会在页面给出推荐提示词那套词确实能在该模型下出不错的效果。但你换一个风格类似的模型时这套词的适配性会明显下降。我的习惯是把模型的建议词作为一个“风格基线”然后用同一套测试图去对比不同模型在这个基线上的出图差异这样在后续创作中就能更快判断哪个提示词策略适合哪个模型。5. 提示词相关的工具推荐与进阶尝试5.1 常用关键词提取与整理工具让你不再复制粘贴整理词库是我保持高效出图的最大秘诀。我长期用一个本地的关键词分组文档按人物、动作、场景、光线、风格画质几个大类分别记录每次测试出效果好的新词就补进去。这样即使几个月不碰某个风格重新回来也能直接找到对应的词库省去重新试错的时间。如果你喜欢更自动化的方案可以试试WebUI里的“提示词风格生成器”类扩展比如风格预设管理器它可以把一整组提示词保存成预设下次一键调用。这个功能特别适合把上面3.3的模板对应保存比如“通用半身肖像”“电影感场景”“产品展示”各自存成一个预设随时切换。ComfyUI里则可以做一个“预设词库”节点组思路类似。另外强烈推荐记录每一组出图参数与提示词的匹配结果。我自己在出图时会把模型名、采样器、步数、CFG、正负向提示词一起截图存档。这个习惯让我的调试效率提升了很多出现问题可以快速回溯是哪一步的变化导致的而不是靠模糊记忆做猜测。5.2 动态提示词与批量测试找到你自己的最优配方当你对提示词的基础玩法熟悉之后可以尝试动态提示词技术。WebUI的 Dynamic Prompts 插件支持用模板语法做随机组合比如 {red|blue|green} dress每次生成会同概率随机抽一个颜色。这个功能特别适合做灵感探索在你还没想清楚要什么效果时让模型帮你生成一批候选然后你从中间挑出惊喜逆向选出值得继续深耕的提示词组合。批量测试时不要忘记固定种子数。种子是影响最终的“随机噪声起点”的关键变量同样的提示词配合不同种子会有完全不同的构图。搜索最优提示词时先把种子固定为某个值这样你看到的画面差异就是提示词引起的而不是随机噪声造成的“观感误差”。等找到了合适的提示词再去随机种子找构图惊喜。我最初用过笨办法把提示词分成几个部分分别做控制变量的批量生成然后对比输出结果。这个方法虽然慢但对理解“哪个词在起作用”特别有帮助。后来开始用动态语法批量出图几百张图跑下来很快就能找出在当前模型下表现最好的词组合。批量测试看起来很费卡实际上是非常高性价比的调参路线尤其适合画风探索阶段。这些工具和方法本质上是帮你把“手感”变成“方法论”。很多人觉得提示词是玄学其实完全可以通过系统化测试把不确定性降到最低。每次出图的过程都可以沉淀成下一次的经验时间越长你的词库越完善出图也会越稳定。写到这里我把Stable Diffusion提示词最核心的那套东西梳理完了。提示词看起来只是一个个单词的堆叠实际上背后是权重分配、语义匹配和模型特性之间的平衡。我自己也是在踩了一堆坑、跑了几百张废图之后才慢慢摸到这些门道。现在回过头看最值得的投资就是建立一个自己的词库和调试流程不要每次出图都靠灵感和运气。最后送大家一个我个人的小习惯每出一个满意的图顺手把提示词归档到自己的模板库里每出一个废图也尽量搞清楚是哪个环节出的问题。长期积累下来你会发现自己对画面“可控性”的理解会远远超过看一眼教程就能获得的水平。
返回列表