首页 / Prompt词库 / 正文
Prompt词库

Stable Diffusion Prompt 完全指南:从入门到精通,轻松提升AI绘画出图质量

chuanbook chuanbook
发布于 2026 年 10 月 07 日
阅读 约42分钟
浏览 7
评论 0

1.1 什么是 Stable Diffusion Prompt:从文本到图像的桥梁

我刚开始接触 Stable Diffusion Prompt 时,脑子里把它当成一串关键词。输入“女孩、花、阳光”,按下生成,画面出来却像随机抽奖。有朋友问我,为什么同一个 Stable Diffusion Prompt 在不同人手里差别这么大。我才慢慢明白,Prompt 不是许愿池里的硬币,它更像一座桥,把人的画面想法翻译成模型能理解的条件语言。

这座桥的运作方式挺有意思。Stable Diffusion Prompt 会先经过文本编码器,变成一组条件向量,采样器在潜空间里一点点去噪,最后 VAE 把潜空间结果解码成图片。写“赛博朋克女孩”很宽泛,模型只能猜。写“雨夜霓虹街道,赛博朋克女孩,透明雨衣,侧脸,85mm 镜头,电影感光线”,画面方向就清楚很多。我在社群里看别人讨论,发现高手并不是词多,而是词准。

我会把 Stable Diffusion Prompt 理解成给 AI 的拍摄通告。通告里可以写主体、动作、场景、光线、镜头、风格、画质,也可以写情绪和氛围。它不能保证每一颗纽扣都按我的想法出现,却能大幅改变画面的方向。初学者练 Prompt,练的就是把脑内模糊画面拆成可执行文字的能力。

1.2 Prompt、模型、采样器与随机种子的关系

我一开始只盯着提示词改,忽略了模型、采样器和随机种子。同一段 Stable Diffusion Prompt,有时候出图温柔,有时候出图诡异。后来我固定参数做对比,才发现模型像画师的底子,采样器像作画路线,随机种子像起笔的位置。四者一起决定画面,Prompt 只是其中一张牌。

换 Checkpoint 的感受很直接。动漫模型和写实模型对同一句“portrait of a girl”理解完全不同。采样器也有性格,Euler a 常带一点灵动,DPM++ 2M Karras 往往更稳。随机种子固定后,我能复现同一张图,方便观察提示词改动带来的变化。种子随机时,探索空间更大,适合找灵感。我常跟朋友说,别把出图差异全怪到 Prompt 头上,先看看模型和参数是不是换了。

现在调试时,我会固定模型、采样器、步数、CFG Scale 和随机种子,只改一小段 Stable Diffusion Prompt。这样我能知道某个词到底有没有用。模型、采样器、种子和 Prompt 的关系像做菜:Prompt 是菜谱,模型是食材库,采样器是烹饪方式,种子是火候里的偶然因素。理解这层关系,调图会少很多玄学感。

1.3 正向提示词与负向提示词的基本分工

正向提示词是我想要什么,负向提示词是我不想看到什么。我起初把 negative prompt 当成垃圾桶,网上看到长清单就全塞进去。结果人物脸更僵,背景更乱,画面像被几股力量拉扯。后来我才懂,负向提示词也参与条件引导,它不是橡皮擦,不能精准删除某个物体。

正向提示词负责搭骨架。主体、动作、服装、场景、构图、光线、镜头、风格、画质,这些都可以写进去。负向提示词负责扫障碍。低质量、模糊、畸形、水印、文字、多余肢体、坏手、比例错误,是很多人会放的基础项。比如人物肖像,我会写正向:“portrait of an old fisherman, weathered face, soft window light, 50mm lens, photorealistic”;负向写:“lowres, blurry, bad anatomy, extra fingers, watermark, text”。两边的词都围绕画面目标服务。

负向提示词要跟场景相关。人物图多关心手、脸、比例;风景图多关心过曝、灰雾、结构混乱;产品图多关心变形、文字乱码、背景脏乱。我会从小清单开始,遇到问题再加,不直接复制别人的超长 negative。正向和负向像搭档,一个负责把画面拉向目标,一个负责把常见偏差推开。分清分工,Stable Diffusion Prompt 才会越写越稳。

1.4 初学者常见认知误区与学习路径

我在社群里见过不少初学者误区。有人觉得提示词越长越好,堆到几百个词,主体反而消失。有人复制大神秘籍,却不换匹配的模型。有人只看图,不记录 seed、采样器、CFG 和步数。有人把负向提示词当万能药,画面崩了就疯狂加词。朋友问我为什么他的图总像半成品,我一看参数,步数太低、CFG 太高、模型风格也不对。

学习 Stable Diffusion Prompt 的路径可以很踏实。先理解 Prompt、模型、采样器、随机种子的关系,再用简单主体练描述。固定参数做 A/B 对比,每次只改一两个词。看到喜欢的图,试着拆解它的主体、风格、构图、光线和画质词。建一个自己的模板库,把常用正向词和负向词分类保存。这个过程不需要急躁,短句写清楚,比堆玄学词更有用。

我建议从二十到四十个词起步,主体明确,风格清楚,画质词适量。每次出图后记录 seed、模型、采样器、CFG、步数和分辨率。看图时问自己:主体对不对,构图稳不稳,光线像不像,细节有没有崩。多练短句,多拆好图,多保存有效组合。Stable Diffusion Prompt 基础与核心概念打稳了,后面学结构、语法、示例和 negative prompt 策略,会轻松很多。

2.1 主体、风格、构图、光线、画质等模块化描述

我最早写提示词的习惯,是把脑子里冒出来的词一口气全丢进去。人物、背景、颜色、情绪混成一团,出图效果时好时坏。有次朋友让我帮他做一张“老书店里的猫”,我写了二十几个词,猫是出来了,风格却跑到蒸汽朋克去了。我盯着屏幕想了很久,问题不在词少,在结构乱。

慢慢我摸索出一套模块化的写法。主体放最前面:一只橘猫,趴在旧书堆上,眼神慵懒。后面接场景和构图:老书店,木质书架,暖色台灯,中景,浅景深。风格和光线再跟上:胶片摄影,柔和侧光,怀旧色调。画质词收尾:高细节,锐利对焦,8K。让每个模块各管一段,模型读起来不打架,我心里也有数,哪块不对就改哪块。

这种模块化描述像给画面列清单。主体决定“画什么”,风格决定“像谁画的”,构图决定“怎么摆”,光线决定“什么氛围”,画质决定“多清楚”。我现在的习惯是先把主体写稳,再加风格,构图和光线一起调,画质词适量就好。词与词之间留出呼吸感,画面反而更听话。

2.2 逗号、短语、自然语言与权重语法

逗号是我最常用的分隔符。一个逗号一个信息块,模型更容易分辨。短语写法像“silver hair, red eyes, black dress”,干净利落,适合控制多个属性。我拿它写过角色设定,一个词一个特征,调整起来方便。自然语言写法像“a girl with silver hair is standing under the moonlight”,读起来流畅,适合描述动作和关系。两种写法我都用,看画面需要什么。

自然语言的优点是能表达从属和位置关系。“a cat sitting on a wooden chair beside a window”比“cat, chair, window”清楚得多。短语写法的优点是权重好控制,词与词之间不互相干扰。我试过把两者混着用,主体和动作写自然语言,风格和画质写短语,效果挺稳。段落长短不一,读起来也不累。

权重语法是我后来才认真学的。常见写法是 (word:1.3),数字大于1加强,小于1减弱。也有用多层括号的,((word)) 相当于加权重。我一开始滥用权重,把喜欢的词全加到1.5,画面直接过曝变形。现在我只在关键属性上微调,比如眼睛颜色、服装材质、光线方向。权重是调味料,放多了整锅菜都变味。

2.3 括号、权重调整与提示词顺序影响

括号和权重是一对搭档。圆括号 () 默认提高权重,方括号 [] 降低权重,花括号 {} 在部分界面里也有加强效果。我习惯用 (word:1.2) 这种明确写法,比堆括号清楚。调整权重时我会一次只动一个词,从1.1开始试,看画面变化。改动幅度超过1.5,画面经常崩。这个度得靠手感,急不来。

提示词顺序对结果有影响。靠前的词通常权重更高,模型更关注。我把主体和核心风格放在前二十个词里,细节和修饰往后排。有次我把“背景”写在最前面,人物变得又小又模糊。把主体提到开头,人物立刻回来了。顺序像排队,站在前面的先被看到。

我调顺序的方法是固定其他变量,只挪一个词的位置。把“电影感光线”从末尾移到中间,画面的明暗对比明显变了。把“低角度”放前面,构图更有张力。这些变化不是玄学,是模型注意力分配的结果。我现在写提示词会先排优先级:主体、动作、场景、风格、光线、画质。顺序稳了,出图也稳了。

2.4 模型适配与触发词、LoRA、Embedding 的写法

不同模型对同一句提示词的理解差别很大。写实模型喜欢具体的摄影词,动漫模型对风格词更敏感。我换模型时会把提示词做一遍适配。写实模型上写“85mm lens, f/1.8, skin texture”,出图细腻。动漫模型上写同样的词,画面容易偏写实,失去二次元味。换模型不换词,等于用川菜菜谱做粤菜。

触发词是模型和 LoRA 的钥匙。很多 LoRA 有专属触发词,写在提示词里才能激活它的风格或角色。我用过一个水墨风 LoRA,触发词是“ink wash painting”。不加这个词,LoRA 效果几乎看不见。Embedding 的写法类似,把文件名当关键词塞进去。触发词的位置我一般放在主体后面,风格词前面,让它先起作用。

LoRA 和 Embedding 的权重也要调。LoRA 常用 <lora:name:0.8>,Embedding 用文件名加权重。我试过把 LoRA 权重拉到1.2,画面风格过浓,主体都变形了。0.6到0.9之间通常比较自然。多个 LoRA 一起用时,权重总和别太高,不然模型会打架。适配模型、触发词、LoRA、Embedding,像调音台上的旋钮,每个都得拧到合适的位置。

2.5 可复用的 Prompt 模板框架

我吃过每次从零写提示词的亏。同样的构图和光线,换个主体就要重写一遍,效率很低。后来我建了几个模板,把常用模块固定下来。人物模板、风景模板、产品模板各一套。主体和细节留空,其他部分直接复用。出图速度快了,质量也稳定。

我的模板结构大概是:主体描述 + 动作/表情 + 服装/材质 + 场景 + 构图 + 光线 + 风格 + 画质 + 负向。主体每次换,构图和光线按需微调。模板不是死公式,是起点。我会在模板上做变体,改风格词、改镜头、改光线方向,快速测试不同方向。模板省下的时间,可以用来打磨细节。

模板用久了我会定期清理。有些词已经过时,有些词和当前模型不搭,有些负向词根本没用。我把有效组合记下来,按场景分类。朋友问我怎么写得快,我说靠模板加微调,不靠灵感。模板框架让 Stable Diffusion Prompt 从随机尝试变成可积累的手艺,每次出图都在给下次铺路。

学完结构语法,我手痒得不行。拿之前存的模板,套上不同主体试了几十张图。有些一次就成,有些改到第五版才像样。我把这些正向提示词实战例子整理出来,人物、风景、产品、风格对比、拆改方法都走一遍。每个例子都带具体 prompt,你拿去改改就能用。

3.1 人物肖像类 Stable Diffusion prompt examples

我最早练手的是人物肖像。写实模型上,我常用这句: portrait of a young woman, silver hair, red eyes, black lace dress, standing in a dimly lit room, soft window light, 85mm lens, f/1.8, film photography, detailed skin texture, sharp focus, 8k 主体是年轻女性,银发红眼,黑蕾丝裙。场景在昏暗房间,光线从窗户来。镜头和画质词收尾。出图时皮肤质感很真实,眼神也亮。我把 silver hair 加了权重 (silver hair:1.2),发色更准。朋友看了说像某部电影的女主角,我挺得意。

换到男性肖像,我写: middle-aged man, trench coat, fedora, smoking pipe, rainy street at night, neon reflections, cinematic lighting, film grain, close-up portrait 侦探味很足。雨夜街道,霓虹反光。帽子我调过 (fedora:1.15),不然容易被头发盖住。朋友觉得画面太暗,我加了 soft fill light,脸部细节回来了。同一套模板,改主体和服装,就能换角色。

有次我想做老人肖像,把 young woman 换成 elderly man, deep wrinkles, white beard, wool sweater。光线改成 warm afternoon sunlight through curtains。画质词保留。出图后皱纹和毛衣纹理都清楚。人物肖像的关键是主体、表情、服装、光线,顺序别乱。我习惯把镜头词放在风格词前面,模型更容易理解。

3.2 风景与场景类 Stable Diffusion prompt examples

风景类我常用分层写法。森林晨雾: misty forest at dawn, tall pine trees, sun rays through fog, mossy ground, a small stream, wide angle, atmospheric perspective, muted green and grey tones, landscape photography, high detail 从前景的溪流到中景的松树,再到背景的雾和光。atmospheric perspective 让远近有层次。我试过删掉这个词,画面立刻平了。muted green and grey tones 控制色调,不会太鲜艳。

城市夜景我喜欢赛博朋克味: cyberpunk city street at night, neon signs, rain-slicked pavement, reflections, crowded market, low angle, volumetric lighting, blade runner style, cinematic, 4k 低角度让街道有压迫感。霓虹灯和湿地反光是重点。我把 cyberpunk 换成 steampunk,画面变成蒸汽管道和黄铜色。同一构图,风格词一换,世界就变了。这类 prompt 里,场景、时间、天气、视角、氛围缺一不可。

我拍过一张海边长曝光,想用 SD 复现。写了: long exposure seascape, smooth water, rocky shore, overcast sky, minimalist composition, neutral density filter effect, subtle pink and blue tones, fine art photography 出图很安静。long exposure 和 smooth water 配合,水面像丝绸。neutral density filter effect 是摄影术语,写实模型认这个。风景 prompt 不用堆太多词,把光线和气候写准,模型自己会补细节。

3.3 产品、建筑与概念设计类示例

产品图我帮朋友做过手表: luxury watch on black marble, dramatic side light, macro shot, reflections, minimalist, product photography, high detail, 8k 黑大理石台面,侧光打出金属光泽。macro shot 让表盘细节清楚。背景我试过换成 white silk,画面变柔和,适合女表。产品 prompt 里材质和光线是灵魂。dramatic side light 换成 soft box lighting,阴影立刻少了。

建筑类: futuristic museum, curved white concrete, glass facade, sunset, wide shot, architectural photography, clean lines, warm golden hour light 曲线混凝土和玻璃幕墙。golden hour light 给建筑镀上暖色。我调过 (curved white concrete:1.2),曲线更明显。建筑 prompt 要注意透视和比例。wide shot 适合整体,close-up 适合局部材质。

概念设计我做着玩: floating island, waterfalls, ancient ruins, airships, fantasy concept art, matte painting, epic scale, volumetric clouds, dramatic lighting 漂浮岛、瀑布、废墟、飞艇。matte painting 和 concept art 让画面有电影感。我加过 (waterfalls:1.1),水流更突出。这类 prompt 可以大胆混搭,模型对幻想元素接受度高。产品、建筑、概念设计,正向提示词都在描述“什么材质、什么光、什么视角”。

3.4 动漫、插画与写实风格示例对比

同一个主题,我拿“樱花树下的女孩”试了三种风格。写实版: photorealistic, young woman, pink hair, school uniform, cherry blossoms, soft sunlight, 85mm lens, film grain, detailed skin, shallow depth of field 皮肤和花瓣质感真实,景深浅。动漫版: anime style, 1girl, pink hair, school uniform, cherry blossoms, cel shading, vibrant colors, studio ghibli inspired, clean lines 色块分明,线条干净。1girl 是动漫模型的常用触发词。插画版: watercolor illustration, girl under cherry tree, loose brushstrokes, pastel palette, paper texture, soft edges 水彩的晕染和纸纹都出来了。

写实模型对 photorealistic 敏感,动漫模型对 anime style 敏感。我试过把写实 prompt 塞进动漫模型,人物变半写实,眼睛比例怪。换模型得换风格词。LoRA 也会影响,我用过一个 ink wash LoRA,触发词写进去,画面立刻变水墨。风格对比练习让我明白,正向提示词不是万能钥匙,模型和风格词要配对。

我现在的做法是固定主体,只换风格词。cherry blossoms 不变,改 cel shading、watercolor、oil painting。出图后摆在一起看,差异很清楚。写实重细节和光影,动漫重线条和色块,插画重笔触和纹理。你选哪种风格,就把对应的词放前面,权重给足。

3.5 如何从示例中拆解并改写自己的 Prompt

我拿到一个示例,会先拆成模块。比如: portrait of a young woman, silver hair, red eyes, black lace dress, standing in a dimly lit room, soft window light, 85mm lens, f/1.8, film photography, detailed skin texture, sharp focus, 8k 拆开就是:主体(young woman)、特征(silver hair, red eyes)、服装(black lace dress)、场景(dimly lit room)、光线(soft window light)、镜头(85mm lens, f/1.8)、风格(film photography)、画质(detailed skin texture, sharp focus, 8k)。拆完就知道哪个词管哪块。

改写时我一次只动一个模块。把 young woman 换成 robot,其他保留,出图就是机器人肖像。把 film photography 换成 oil painting,风格变古典。把 soft window light 换成 dramatic rim light,轮廓光更强。我有个小本子,记下每次改动的结果。改多了就形成手感,知道哪个词动多少。

朋友给我三个词“猫、太空、复古”,我套进模板: cat, astronaut helmet, floating in space, retro futuristic, stars, nebula, vintage sci-fi illustration, warm colors, film grain 出图很有老科幻杂志味。拆解和改写的核心是控制变量。主体、风格、光线、画质分开调,正向提示词就从碰运气变成可重复的手艺。我练了大概两百张图,现在看到好图能猜出它的 prompt 结构,也能自己拼出想要的画面。

我刚开始玩 Stable Diffusion 那阵子,眼里只有正向提示词。负向框里随便填个 low quality,觉得够用了。有次做人物肖像,出图手指多出三根,脸歪得像融化的蜡。朋友笑我:“你负向提示词是摆设吧?”我才认真研究 negative prompt。这一章把我踩过的坑、常用的清单和调试方法整理出来,你拿去就能少走弯路。

4.1 Stable Diffusion negative prompt 的作用与生效逻辑

负向提示词干的事,就是告诉模型“别画什么”。正向提示词像导航,指着画面往某个方向走。负向提示词像围栏,把低质量、畸形、水印这些东西挡在外面。我一开始以为负向词只是过滤,后来看社区讨论才明白,它参与 CFG 引导计算。模型会对比正向和负向的文本编码,把生成结果往正向推、往负向反方向推。权重越高,推力越大。

我做过一个简单对比。同一组正向词、同一个种子,负向框留空,出图里手部结构经常乱。填上 bad hands, extra fingers, fused fingers,手指数量正常多了。负向词写太多也会出问题。有次我复制了网上两百个词的巨型负向清单,画面变得很平,皮肤像塑料,背景细节也糊了。负向提示词不是越多越好,十到二十个精准的词,比一大串泛泛的词管用。

生效逻辑里还有个细节:负向词和正向词一样参与分词和权重。你写 (bad hands:1.3),模型会加强对“坏手”概念的排斥。写 (bad hands:1.8),排斥过猛,手可能直接消失或者变成一团。我试过把 bad anatomy 权重拉到 1.6,人物肩膀窄得离谱。负向提示词要温柔地推,别暴力地砸。

4.2 通用负向提示词清单:低质量、畸形、水印、多余肢体

我常用的通用负向清单分四块。质量类:worst quality, low quality, normal quality, jpeg artifacts, blurry, pixelated。结构类:bad anatomy, bad proportions, extra limbs, missing limbs, fused fingers, too many fingers, long neck, malformed hands。水印文字类:watermark, text, signature, username, logo, copyright。其他类:ugly, deformed, disfigured, mutation, messy background。这套清单在写实模型上很稳,出图干净,细节保留也好。

不同模型对通用清单的反应不一样。我拿写实模型跑 cartoon, 3d render, anime 当负向词,人物皮肤质感更真实。换到动漫模型,这些词会把风格带偏,画面变成半写实,眼睛比例怪。动漫模型更适合负向 realistic, photorealistic, 3d, blurry, bad hands, extra fingers。我朋友玩二次元模型,负向里加 lowres, bad anatomy, bad hands, text, error, missing fingers,出图线条干净很多。通用清单不是万能药,得看模型底子。

我现在的做法是建一个基础负向模板,跑新模型时先测几张。基础模板长这样: (worst quality, low quality:1.4), (bad anatomy:1.2), extra limbs, missing limbs, fused fingers, too many fingers, long neck, watermark, text, signature, username, blurry, jpeg artifacts, ugly, deformed 跑人物时加 bad hands, extra fingers, deformed face。跑风景时加 people, buildings, oversaturated。跑产品时加 bad reflection, distorted shape, messy background。模板加场景词,比每次都从零写快得多。

4.3 人物、风景、产品场景中的 negative prompt 示例

人物肖像的负向词我踩坑最多。正向写 portrait of a young woman, silver hair, red eyes, black lace dress, soft window light, 85mm lens, film photography,负向我会配: (worst quality, low quality:1.4), bad anatomy, bad hands, extra fingers, missing fingers, fused fingers, deformed face, asymmetric eyes, plastic skin, cartoon, 3d render, watermark, text, blurry 出图后手指正常,脸部对称,皮肤有纹理。有次我忘了加 plastic skin,人物脸像磨皮过度,朋友说“像假人”。加上这个词,皮肤质感回来了。人物负向里 bad hands 和 extra fingers 最重要,手崩是 SD 的老毛病。

风景场景的负向词侧重干净和自然。正向写 misty forest at dawn, tall pine trees, sun rays through fog, mossy ground, a small stream, wide angle, landscape photography,负向我配: people, buildings, text, watermark, oversaturated, cartoon, low resolution, blurry, distorted horizon, bad perspective, jpeg artifacts 有次我在森林图里看到远处有个模糊人形,加了 people 就没了。oversaturated 控制颜色,不让绿色艳得刺眼。distorted horizon 防止地平线歪掉。风景负向不用太多,把干扰元素和画质问题挡住就行。

产品场景的负向词讲究精准。正向写 luxury watch on black marble, dramatic side light, macro shot, reflections, product photography, high detail,负向我配: bad reflection, distorted shape, extra objects, messy background, text, watermark, low quality, plastic, blurry, jpeg artifacts 有次手表边缘出现奇怪的重影,加了 bad reflection 后反光正常了。extra objects 防止画面里多出莫名其妙的零件。messy background 让黑大理石台面保持干净。产品图对形状和材质要求高,负向词里 distorted shape 和 plastic 能救回不少废图。

4.4 负向提示词权重、过拟合与冲突处理

负向提示词的权重语法和正向一样,用括号加数字。(bad hands:1.2) 是轻度加强,(bad hands:1.5) 是重度加强。我试过把 bad hands 拉到 1.8,出图里手直接消失了,袖口空空荡荡。权重建议控制在 1.1 到 1.4 之间。质量类词可以给 1.3 到 1.5,结构类词给 1.1 到 1.3。权重太高,模型会过度排斥,把合理特征也删掉。

过拟合是负向词写太多的常见后果。我有次把社区里一个三百词的负向清单全塞进去,画面像蒙了一层灰,细节全没了。模型把太多概念推离,生成空间变窄,出图变得呆板。负向词应该像调料,不是主食。通用清单十来个词,加三五个场景词,足够应付大多数情况。画面出现问题,再针对性加词,别一开始就堆满。

冲突处理要小心。正向写 detailed hands,负向写 bad hands,两者不冲突,模型会努力画好手。正向写 hand on face,负向写 hands,手就没了。负向框里不要写否定句,比如 no hands、without text。模型不太理解否定逻辑,它看到 hands 和 text 反而可能画出来。正确做法是把不想要的东西直接写进负向框:hands, text。我试过写 no watermark,水印照样出现。改成 watermark 就干净了。

4.5 正负提示词搭配的调试方法

调试正负搭配,我习惯固定正向词和种子,一次只动一个负向词。出图后保存对比,看变化。比如人物手崩,我先加 bad hands,跑四张。手还是崩,再加 extra fingers, fused fingers。手正常了,但脸有点歪,再加 deformed face, asymmetric eyes。每次只加一个模块,能清楚知道哪个词管用。一次性加五个词,出图变好了也不知道是谁的功劳。

我常用 X/Y/Z plot 脚本做负向词矩阵测试。把 bad hands 权重设成 1.0、1.2、1.4、1.6,其他不变,跑一组图。一眼就能看出哪个权重最合适。有次我发现 1.2 的手最自然,1.4 的手指甲变形,1.6 的手直接没了。这种测试比盲调快得多。没有脚本的话,手动改权重跑几张也行,记得把种子固定。

常见问题对应负向词:手崩加 bad hands, extra fingers, missing fingers, fused fingers。脸崩加 deformed face, asymmetric eyes, bad proportions。画面脏加 worst quality, low quality, jpeg artifacts, blurry。水印加 watermark, text, signature, username。画面太艳加 oversaturated, vivid colors。我建了个表格,记录每张图的 prompt、模型、种子、负向词、权重和效果。调多了就有手感,看到崩坏能猜出该加什么词。

负向提示词是门手艺。我练了大概三百张图,现在跑新模型会先测通用负向,再根据场景微调。社区里 Civitai 和 Reddit 的负向清单可以参考,别照抄。模型不同,训练数据不同,同一个词的效果差很远。你多试多记,慢慢就能搭出自己的负向词库。

我调 Stable Diffusion 那会儿,总觉得提示词是老大,写得好图就好。后来发现不是。同一组提示词,换个采样器、改个 CFG、换张底模,出图能差出十万八千里。参数和模型跟 Prompt 是一起工作的,谁掉链子都出不了好图。这章聊聊它们怎么搭班子,也聊聊我怎么测量它们之间的配合。

5.1 采样器、步数、CFG Scale 对 Prompt 效果的影响

采样器这东西吧,我一开始根本没管,装完默认用什么就用什么。有次在 Civitai 上看到别人出的图贼精细,皮肤纹理一根一根的。我抄了他的正向提示词、负向提示词、种子,甚至底模版本号也一样。跑出来还是糊。折腾半小时才反应过来,他用的是 DPM++ 2M Karras,我用的是 Euler a。换过去一试,细节确实上来了。Euler a 出图快、有点梦幻感,适合插画和氛围图。DPM++ 2M Karras 稳,细节多,写实人像我更爱用它。DDIM 我偶尔拿来跑构图测试,速度快,但成图质量一般。

步数的坑也踩过。我一开始迷信高步数,觉得 50 步肯定比 20 步好。拿一个森林场景跑了对比,20 步细节已经到位,30 步稍微锐一点,50 步和 30 步几乎看不出差别,耗时却翻倍。我现在写实图一般用 25 到 30 步,插画 20 步出头。步数太低确实不行,低于 15 步画面容易糊成一团。有个例外是测试构图阶段,我用 10 到 12 步快速看提示词走向,确认没问题再上高步数出图。

CFG Scale 是最影响提示词“执行力度”的参数。我把它理解成模型听不听话的刻度。CFG 设 7,画面自然,但提示词里的某些细节不一定全给你。设 12,特征出来了,颜色也艳了,皮肤有时候油亮油亮的。设 15 以上,画面开始崩,五官歪、颜色过饱和。我常用的区间是 7 到 11。人物肖像给 7 到 9,产品图给 9 到 11,风景 6 到 8。有个细节挺好玩:CFG 低的时候,负向提示词的推力也弱。我把负向 bad hands 加到 1.4 权重感觉没用,把 CFG 从 6 调到 9,手就正常了。负向词效果跟 CFG 是联动的。

5.2 分辨率、宽高比与构图提示词的配合

分辨率这事我吃过好几次亏。512x512 是 SD 1.5 的原生尺寸,出单人半身像没问题。我第一次想画全身照,直接在 512x512 里写 full body shot,出来的图人物被拉长,头小身子大,像哈哈镜。后来才知道得用 512x768 或者 512x896 这种竖构图。SDXL 原生 1024x1024,我拿它跑宽幅风景,写 wide angle landscape,人物倒是没变形,但地平线被压得特别扁。改成 1152x896 或者 1216x832 就自然多了。

构图提示词跟宽高比得配对。竖幅 2:3 或 9:16,我会在提示词里加 portrait orientation, vertical composition, full body。横幅 16:9 或 3:2,我加 wide shot, panoramic view, horizontal composition。方形 1:1 适合头像、产品特写、静物。有次我在 1:1 里写 wide landscape,画面左右被硬塞进一个正方形,两边山体切得生硬。宽高比跟提示词打架的时候,模型会选一个折中出来的怪构图。

超高分辨率不靠一次生成。我试过直接设 2048x2048,显存爆了,就算跑出来也是双头双身。正确做法是先出 512 或 1024,再用 hires fix 或者 Ultimate SD Upscale 放大。放大时提示词得微调。原图写 soft lighting,放大后加 sharp details, high resolution texture,细节会补回来。放大倍率我一般控制在 2 倍以内,再高提示词也压不住噪点。有个朋友放大 4 倍,图糊得跟水彩画似的,参数是一方面,提示词里没加 detailed texture, high resolution 也是一方面。

5.3 Checkpoint、LoRA、ControlNet 与 Prompt 的协同

Checkpoint 决定了一切的底子。我拿同一个提示词跑过三个写实模型。A 模型偏冷调,皮肤偏灰。B 模型暖,皮肤有蜜桃色。C 模型皮肤像磨过皮,光滑得没毛孔。提示词一模一样,出图气质完全不同。我现在的习惯是拿到新模型先跑一组基础测试图,看看它的色彩倾向、细节水平、对提示词的响应度。有的模型对 film photography 特别敏感,出图秒变胶片感。有的模型加这个词几乎没反应。

LoRA 跟提示词的配合有门槛。LoRA 有触发词,你不写触发词它基本不生效。我玩过一个中国风服饰 LoRA,触发词是 hanfu style。第一次用没加触发词,权重拉到 0.8,出图一点汉服味都没有。加上触发词,权重给 0.6 到 0.7,衣服形制就出来了。LoRA 权重太高会污染画面。我把一个人物 LoRA 拉到 1.0,脸是像了,背景全被她同款衣服的颜色糊了。0.7 到 0.8 更像稳妥值。多个 LoRA 叠加的时候权重分配要更小心,我一般主 LoRA 0.7,辅助 LoRA 0.4 到 0.5。

ControlNet 不改提示词本身,它改的是构图控制方式。OpenPose 控制姿势,Depth 控制空间层次,Canny 控制边缘。我用 OpenPose 画人物的时候,提示词里就不用再写 standing, arms crossed 这类姿势描述,写了反而跟骨架子打架。Depth 配合提示词干活最舒服,我写 misty forest, layered trees,Depth 图给一张远中近三层的黑白深度图,出图层次感比纯提示词强很多。ControlNet 权重我一般 0.6 到 0.9。太低不起作用,太高提示词就彻底被骨架压死,画面僵硬。有次我把 Canny 拉到 1.2,出图跟描线稿一样,一点创作空间都没了。

5.4 img2img、inpaint、outpaint 中的提示词调整

img2img 的提示词写法跟 txt2img 不一样。Denoise strength 是关键变量。设 0.3,原图轮廓基本保留,提示词只做些微调色和质感。设 0.6,构型会变,细节重画。设 0.8 以上,基本就是重画一张,原图只留个大概走势。我拿一张草稿做 img2img,denoise 0.5,提示词描述得更细:refined lineart, clean shading, detailed eyes。叠上去之后细节确实多出来了。提示词里写太多跟原图冲突的内容,denoise 低的时候会被压掉,根本看不到效果。

Inpaint 的提示词要聚焦在遮罩区域。我修一张人物像的背景,把人物抠出来,遮罩刷到背景上,提示词写 lush garden background, soft bokeh, warm sunlight。人物区域不动,背景换成了花园。我第一次做 inpaint 的时候提示词写了整张图的描述,结果人物脸也变了,因为模型会参照整个提示词去改遮罩区域。Inpaint 提示词最好只描述你想要的那块区域,加 only background、preserve original character 这类指令有帮助。重绘幅度(denoising strength)在 inpaint 里建议 0.5 到 0.75,太低改不动,太高跟原图融合不好。

Outpaint 是往画面外扩展。我画过一张 512x768 的半身像,想扩成 768x1152 的全身像。先把画布扩展,空白区域填充,然后用 inpaint 模式刷扩展区域。提示词里得描述扩展部分的内容:full body, legs, standing on wooden floor, matching lighting。匹配原图光线和风格很重要,不然扩出来的身体跟原来的脸像两个人。我踩过坑,扩展时提示词只写了 full body,结果下半身衣服款式跟上身完全不一样。后来加了 same outfit, consistent style 才算接上。Outpaint 做多步扩展的时候,每扩一块提示词都要重新看原图气质,不能偷懒。

5.5 批量测试与提示词矩阵对比

调参数这事靠感觉不行,得靠对比。我早期调参全凭印象,今天觉得 CFG 9 好,明天觉得 11 好,其实图都删了没法对比。后来学会用 X/Y/Z plot 脚本,把变量摆出来一排排跑。比如测试 CFG 对提示词的影响,X 轴设 6、7、8、9、10、11、12,Y 轴设两个不同的采样器。一次跑出 14 张图,一眼就能看出哪个组合最稳。这比一张一张调快太多了。

提示词矩阵更有意思。我把同一组主体词放固定位置,风格词做成变量。X 轴跑 film photography, digital art, oil painting, watercolor, anime style,Y 轴跑 soft light, dramatic light, neon light, natural light。跑出来二十张,哪组搭配好看哪组别扭一目了然。有次我发现 watercolor 配 neon light 出图特别奇怪,颜色晕得像化开的糖。这个组合以后就不用了。矩阵测试还能测负向词,把 bad hands 权重做成 X 轴 1.0 到 1.6,出图对比手指质量。

我建了个记录表,每次跑图都存下来。字段有:正向提示词、负向提示词、模型、LoRA、采样器、步数、CFG、分辨率、种子、出图效果备注。开始觉得麻烦,跑了两百张之后回头查,哪个参数组合出过好图,翻表就有。上个月我想复刻一张三个月前的满意作品,忘了参数,翻表五分钟就找回来了。批量测试出的图别删,我按日期建文件夹存着,隔一段时间回看,能发现当时没注意到的规律。比如某组参数在手部细节上一直更稳,下次人物图就用它当起点。

参数、模型、工作流跟 Prompt 不是各自为政。提示词写得好,参数不对,图出不来。参数调得妙,提示词空泛,画面也没内容。我把这套协同理解成一支乐队,提示词是主唱,模型是乐器,参数是调音台,采样器和 ControlNet 是编曲。谁都要顾到,谁都不能抢戏。多跑、多记、多对比,慢慢就能听出哪块走音了。

写提示词写到现在,我最大的感受是:这活儿不是一锤子买卖。你脑子里有个模糊画面,写几行字丢进去,出来一张图,大概率跟你想的不一样。然后你得改,再跑,再改。这个过程可以很折磨,也可以很有意思。这章我想聊聊怎么把模糊想法一步步磨成精准提示词,出了图崩坏、跑偏、掉细节该怎么查,还有资源怎么攒、版本怎么管、底线在哪儿。

6.1 从模糊想法到精准提示词的迭代流程

我一开始写提示词是“许愿式”的。脑子里想到什么就写什么,a beautiful girl in a forest,丢进去,出来一张图。好不好看全看运气。后来我学乖了,每次动笔之前先问自己几个问题:主体是什么,什么姿势,穿什么,背景在哪,什么时间,什么光线,什么镜头感。把这几个问题答完,提示词就从一个模糊念头变成了一段有结构的描述。

我的迭代流程大概是这样:先用短提示词跑一张低步数草图,看大方向对不对。方向对了再往里加细节,一次加一个模块,加完跑一张对比。比如我先写 a warrior woman,出来一个大概的人物。然后加 silver armor, braided hair,看服装和发型。再加 standing on cliff edge, stormy sky,看背景氛围。最后加 cinematic lighting, dramatic clouds, wide angle,改光线和构图。每加一层我都存一张图,这样能清楚看到哪个词起了作用,哪个词把画面带歪了。

有个习惯我坚持了很久:把“想要什么”和“不想要什么”分开写。正向提示词只写目标特征,负向提示词专门收那些容易冒出来的毛病。以前我老在正向里写 no glasses,效果很差。改到负向里写 glasses,画面干净多了。迭代的时候我还会刻意控制变量。这一轮只动风格词,下一轮只动光线词,不要同时改五六个地方,不然图变了你也不知道是哪个词造成的。

脑子里想的东西跟模型理解的东西之间有天然鸿沟。我想的是“黄昏时分,一个人站在老式书店门口,暖黄色灯光从窗户漏出来,有点怀旧感”。模型看到 dusk, person, old bookstore, warm light, nostalgic 已经能猜个大概。剩下的差距靠迭代补。跑三到五轮,每次微调两三个词,慢慢逼近。我很少第一版就满意,但第五版经常能出惊喜。

6.2 常见问题排查:画面崩坏、风格偏离、细节缺失

画面崩坏最让人头疼。手指多一根、胳膊从背上长出来、脸歪成两半,这些我见得太多了。崩坏的原因基本能归成三类:分辨率不对、提示词冲突、CFG 过高。我画全身像用了 512x512,人物被挤变形,换成 512x768 就好了。提示词里同时写 looking left 和 facing camera,模型不知道听谁的,脸就扭了。CFG 拉到 14 以上,颜色过饱和,边缘开始出现奇怪的锐化,人脸蜡黄。排查的时候我一般先降 CFG 到 7 到 9,再把分辨率调成模型的原生比例,大部分崩坏能解决。

风格偏离是另一回事。我想要写实摄影感,出来的是动漫脸。检查下来通常是两个问题:底模本身就偏二次元,或者提示词里混进了风格冲突的词。我写过 photorealistic, anime style,出来一张又像照片又像插画的怪图。后来我把风格词统一收口,写实图就只写 photorealistic, film grain, 35mm photography,动漫图就只写 anime style, cel shading, vibrant colors。两套词不混用。LoRA 也是常见的跑偏源。有个写实 LoRA 权重给到 1.0,人物脸变得像塑料模特,降到 0.6 才自然。

细节缺失的问题隐蔽一些。图整体没毛病,就是眼睛没神、皮肤太平、头发像一块布。我排查的思路是看提示词里有没有给模型足够的细节指令。portrait 和 detailed face, sharp eyes, skin texture, individual hair strands 是两回事。前者模型给你一张脸,后者模型知道你要往细里画。有时候细节缺失跟采样器有关,Euler a 出图偏柔和,细节感天然弱于 DPM++ 2M Karras。换成细节向采样器,再把步数提到 30 以上,情况会好转。放大环节也能补救,hires fix 配合 highly detailed, sharp focus 能让画面精致不少。

有段时间我老觉得图“不够好”但说不上哪里不对。后来学会一个笨办法:把图缩小看整体,再放大看局部。缩小看构图和氛围有没有大问题,放大看手、脸、边缘有没有崩。这个习惯帮我省了很多次重跑的时间。一张图要是整体氛围对了但手崩了,我直接 inpaint 修手,不用整张重画。

6.3 提示词库、社区示例与版本管理

我以前写提示词全靠临时想,每次从零开始。后来发现同一个风格的人物图,我反复写类似的词,太浪费时间。我建了一个小文档,按类别存提示词片段。人物类里存 detailed face, symmetrical eyes, natural skin texture;风景类存 golden hour, volumetric light, atmospheric perspective;产品类存 studio lighting, clean background, sharp focus。用的时候直接复制粘贴,再补主体词。效率高了不少。

社区资源我用得最多的是 Civitai。上面每张图都带完整参数,提示词、负向词、模型、LoRA、采样器、CFG 全都有。看到喜欢的图,我会把提示词扒下来跑一遍,然后逐段改,看哪个部分是我的菜。Lexica 适合搜特定风格的灵感,输入关键词能看到大量同类图。PromptHero 的搜索功能也不错。这些站点的东西别照抄,抄来的图跟你的模型、你想要的画面不一定合。当参考、当起点比较合适。

版本管理这事我吃过亏。有一次改了提示词,出了张很满意的图,过了两天想再跑一遍,忘了当时具体写了什么。后来我开始给每次满意的图存提示词文本,文件名带上日期和版本号。比如 portrait_female_v3_20240315.txt。内容里写下完整正向词、负向词、模型名、LoRA 和权重、采样器、步数、CFG、分辨率、种子。看起来繁琐,但回头复刻的时候特别省心。

我还试过用 Git 管理提示词,后来觉得杀鸡用牛刀了。普通文本文件加一个简单的命名规则就够用。文件夹按项目分,每个项目里放提示词文本、参考图、成图。时间长了翻起来一目了然。有次我想对比三个月前和现在写人物图的变化,翻文件夹就能看出来,提示词从七八个词变成二十多个词,结构清晰多了。

6.4 安全、版权与伦理边界

用 AI 出图这件事,我自己有一把尺子。不拿别人的脸去生成未经同意的图像,不用真人明星的名字去蹭热度,不生成涉及未成年人的不当内容。这几条是我给自己划的红线。Stable Diffusion 本身是工具,工具没有善恶,但用工具的人有。我在社区里见过有人拿真人照片做换脸,也见过有人用特定画师名字批量生成风格图,这些事争议一直很大。

版权这块目前还在变化。模型训练用了大量网络图片,生成出来的图版权归属在不同国家法律下说法不一。我自己的做法是:商业用途谨慎,个人练习放开。要是客户项目,我会避开明显模仿某位在世艺术家风格的提示词,也不直接写品牌名去仿造产品。写提示词的时候用风格描述代替画师名字,比如要厚涂油画感就写 thick impasto oil painting, expressive brushstrokes,不写具体某人的名字。这既是对创作者的尊重,也减少版权风险。

伦理边界有个容易被忽略的点:负向提示词里写 child, kid, young 有时候会引发误判。我见过有人为了防止画面出现小孩,在负向里加了一堆相关词,结果模型对人物年龄的判断变得很奇怪。这种操作要谨慎。涉及敏感内容的时候,我的原则是宁可不画,也不去试探边界。生成内容自己看是一回事,发到公开平台是另一回事。公开发布前我会问自己:这张图如果被陌生人看到,会不会让人不舒服。会的话就不发。

我还注意到一个现象:很多人用 AI 出图之后,直接标上“原创插画”。我觉得这不太诚实。AI 辅助创作和纯手工绘制是两回事,标明用了 AI 不丢人。社区里越来越多的人开始标注工具和工作流,这是好事。透明一点,大家都舒服。

6.5 Stable Diffusion Prompt 学习路线与持续练习计划

回头看我从零开始学提示词的过程,大概分了三个阶段。第一个阶段是抄。看到好看的图就抄提示词,跑一遍看效果。这个阶段大概持续了两三周,目的是建立对提示词的基本感觉,知道什么词大概管什么用。第二个阶段是拆。把抄来的提示词拆成模块,主体、风格、构图、光线、画质分开看。拆多了就发现规律,写实图的光线词跟插画图的光线词不一样,人物图的画质词跟风景图的侧重点不同。第三个阶段是建。建自己的模板库和词库,写新图的时候从库里拼装,不再从零开始。

练习计划方面,我建议每天至少跑五到十张图,不用多,但要带着目的跑。今天专门练人物面部,把 detailed eyes, symmetrical face, skin texture 这组词反复调权重看变化。明天专门练光线,同一组主体词配 golden hour、blue hour、neon light、soft studio light 跑对比。后天专门练负向词,把 bad hands 权重从 1.0 调到 1.6 看手指质量的变化。这种专项练习比漫无目的地跑图效率高很多。

我还有个习惯是每周挑一张自己满意的图,尝试复刻它。不看原来的提示词,凭记忆和理解重新写一版,跑出来对比。差距大的地方就是理解薄弱的地方。有一次我复刻一张森林晨雾图,怎么跑雾气都不对,后来发现是 misty 和 foggy 两个词的效果差异很大。这种细节光看教程记不住,自己踩一遍坑才记得牢。

长期来看,我建议给自己定一个方向。什么都画容易什么都画不精。我认识一个朋友专攻产品图,他的提示词库里全是材质、光线、背景、角度的组合,产品图出得又快又稳。另一个朋友专攻二次元角色,LoRA 攒了十几个,风格控制得极准。我自己偏向写实人像和场景,提示词模板围绕这两块建。有方向之后,积累会快很多,提示词库、模型选择、参数偏好都能形成体系。

练习过程中别忘了回看旧图。我每个月会翻一次上个月跑的图,挑出当时觉得好和现在觉得一般的,对比提示词找原因。这个习惯帮我纠正了不少坏毛病,比如早期爱堆风格词、爱把权重拉满、爱在正向词里写否定句。这些问题当时看不出来,过段时间回头看特别明显。写提示词这事,手感是练出来的,审美是攒出来的。两个都得慢慢来。

赞0
踩0
☆收藏0
版权声明
文章版权声明:除非注明,否则均为ZBLOG原创文章,转载或复制请以超链接形式并注明出处。
分享到
chuanbook

链接已复制到剪贴板