首页 / Prompt词库 / 正文
Prompt词库

摄影提示词全攻略:AI摄影提示词怎么写?少走弯路告别废片快速出片

chuanbook chuanbook
发布于 2026 年 10 月 07 日
阅读 约46分钟
浏览 14
评论 0

1.1 什么是摄影提示词:从文字描述到画面生成的桥梁

我第一次接触摄影提示词的时候,脑子里冒出来的念头特别简单——这不就是用文字描述你想要的照片吗?后来折腾了好几个月,我才慢慢琢磨明白,这件事远比“描述”两个字复杂得多。

摄影提示词本质上是你跟AI之间的一套沟通语言。你输入一段文字,AI根据这段文字去理解空间、光线、材质、情绪,然后把它转化成像素。这个过程有点像你站在一个完全陌生的摄影师面前,只能用嘴说,不能用手比划,不能说“就那个感觉”,你得把“那个感觉”拆解成对方能听懂的具体词汇。文字在这里变成了桥梁,桥的这头是你的想象,桥的那头是AI的算法空间。

我习惯把提示词想象成一份写给AI的拍摄脚本。脚本里写了什么,AI就拍什么。脚本里没写的,AI就自己编。问题在于,AI编出来的东西不一定是你想要的。你写“一个女孩在窗边”,AI可能给你一个女孩站在落地窗前,也可能给你一个女孩坐在飘窗上,光线方向、表情、服装、环境全凭它自己发挥。这时候你才意识到,提示词不只是桥梁,它更像是遥控器——你按哪个键,画面就往哪个方向走。

1.2 摄影提示词与传统摄影参数的区别与联系

刚学摄影那会儿,我背了一堆参数:光圈f/1.8、快门1/200、ISO 400。到了AI摄影这里,我发现这些东西不能直接用了,但它们的逻辑还在。

传统摄影参数控制的是物理世界的光和机器。你调光圈,是在控制进光量和景深。你调快门,是在控制运动模糊和曝光时间。你调ISO,是在控制感光元件对光的敏感程度。这些参数之间有严格的数学关系,错一档就过曝或欠曝。

摄影提示词控制的则是AI对画面的理解。你写“浅景深”,AI会给你背景虚化。你写“长曝光”,AI会给你水流拉丝或者车灯拖尾的效果。你写“高ISO噪点”,AI会给你颗粒感。这些词触发的是AI训练数据里的视觉模式,不是物理公式。你不需要算曝光三角,但你需要知道哪些词能让AI联想到你想要的那种视觉效果。

这两者之间的联系比我想象的要深。一个懂传统摄影的人写提示词,往往比不懂的人写得更准。因为你知道“伦勃朗光”长什么样,“三分法构图”是什么感觉,“35mm焦段”会带来什么样的透视。这些知识让你在写提示词的时候,脑子里有一个具体的画面锚点,而不是在盲猜。

1.3 为什么提示词质量直接影响AI摄影成片效果

我做过一个很笨但很有效的实验。同一个AI模型,同一个随机种子,我只改提示词。第一版写“一个女人”。第二版写“一个三十岁左右的女人,短发,穿黑色高领毛衣,坐在咖啡馆靠窗的位置,下午的自然光从左侧照进来,背景有轻微的虚化”。第三版在第一版基础上加了“电影感、富士胶片色调、柔和光线、85mm镜头”。

结果差距大到让我有点吃惊。第一版出来的东西完全没法用,构图松散,光线平得跟证件照一样。第二版已经能看出明确的场景和人物状态了,但画面还是有点“AI味”。第三版出来的图,色调、氛围、质感全都上了一个台阶,甚至能感觉到空气里的光线方向。

这个实验让我彻底信了一件事:AI摄影的上限,很大程度上取决于你提示词的下限。你写得越具体、越有层次、越符合视觉语言的逻辑,AI给你的回报就越高。反过来,你写“好看的女孩”,AI只能给你一个它认为“好看”的平均值,那个平均值往往平庸得让人想删图。

还有一点很关键,提示词的质量不只影响“好不好看”,还影响“像不像你要的”。AI没有读心术,它只有你给的那几十个词。你少写一个关键信息,AI就可能在一个完全无关的方向上狂奔。

1.4 摄影提示词的常见使用场景:AI绘图、人像生成、商业创意与社交媒体

我平时用摄影提示词的地方特别杂,杂到我自己都分过类。

最常用的是AI绘图。想做一个概念图、插画风的海报、或者某个场景的视觉参考,提示词就是我的画笔。这种场景下我会更注重风格词和氛围词,比如“赛博朋克、霓虹灯、雨夜、反射、广角”。

人像生成是另一个高频场景。帮朋友做头像、做虚拟角色设定、或者单纯想看看某个描述能生成什么样的人。人像提示词对细节的要求更高,脸型、发型、肤色、表情、姿态、服装、光线方向,少一个都容易翻车。

商业创意这块我也在摸索。产品图、广告概念、品牌视觉,AI生成的东西不能直接商用,但可以用来做提案的视觉参考。这种场景下提示词要特别控制“干净”和“高级感”,背景不能乱,光线不能脏,材质要准。

社交媒体上的用法就更随意了。做封面图、配图、梗图,有时候一句话就能出图。这种场景下我反而不追求完美,追求的是“一眼抓人”。提示词会偏向高对比、强情绪、流行元素。

1.5 学习摄影提示词的基本路径与常见误区

我走过的弯路挺多的,说出来你可能能少踩几个坑。

最常见的误区是把提示词当搜索引擎用。写“美女、海边、日落”,然后抱怨AI出的图不好看。这种写法的问题在于,每个词都是孤立的标签,AI不知道它们之间是什么关系。海边是背景还是前景?日落是逆光还是侧光?美女在看镜头还是看远方?这些信息缺失的时候,AI只能自己填空,填出来的大概率不是你要的。

另一个误区是堆砌大量华丽的词。“极致光影、大师级、8K、超写实、电影质感、梦幻”——这些词单独看都没问题,堆在一起反而会让AI困惑。每个词都在争抢权重,最后画面可能变得又锐又糊、又写实又梦幻,像一锅乱炖。

我现在觉得比较靠谱的学习路径是这样的:先学会描述一个具体的画面,人物在哪、在做什么、周围有什么、光线从哪来。这一步练的是“把想象翻译成文字”的能力。然后再学风格词和镜头词,知道“胶片感”和“数码感”的区别,“广角”和“长焦”带来的视觉差异。最后再研究权重语法和负面提示词,那些是精细化控制的工具,基础没打好之前用它们只会更乱。

还有一个心得:多看别人的提示词。Midjourney的社区、Stable Diffusion的论坛、各种AI绘画的分享帖,里面藏着大量实战经验。看多了你会发现,那些出图稳定的提示词,往往结构清晰、层次分明、没有废话。

2.1 主体描述:人物、物体、场景与动作

我一开始写提示词的时候,最常犯的毛病就是太贪心。想把所有东西都塞进去,结果AI给我端出来一盘大杂烩。后来我学乖了,写任何一条提示词,第一件事就是问自己:这张照片的主角到底是谁,或者是什么。

主体描述是整条提示词的骨架。你写“一只猫”,AI给你一只猫。你写“一只橘色的短毛猫趴在木窗台上”,AI给你的就是一只具体的、有颜色、有材质、有位置的猫。区别特别大。我试过用一模一样的风格词和光线词,只改主体描述,出来的图完全就是两个物种——一个是概念,一个是照片。

人物主体要拆的东西更多。性别、年龄段、发型、发色、脸型特征、表情状态、服装款式、配饰、手里拿什么、身体朝向、视线方向。这些信息不需要全写,但至少要覆盖五六个维度。我写过“一个老人”,AI给我的东西很抽象。我改成“一个七十岁左右的老奶奶,银白色短发,穿深蓝色棉布外套,坐在藤椅上织毛衣,微微低头”,画面立刻就有了温度。动作特别重要,动作决定了画面的叙事感。没有动作的人物像证件照,有动作的人物才有故事。

物体和场景主体是另一个逻辑。物体要写材质和状态,场景要写空间层次。我拍产品图的时候,写“一个玻璃杯”和写“一个透明玻璃杯,杯壁有细密的水珠,放在深色木质桌面上,旁边有一片散落的薄荷叶”,出来的东西完全不在一个级别。场景要分前景、中景、背景,哪怕只是简单提一句“远处有模糊的树影”,画面的空间感就会立刻不一样。

2.2 风格与媒介:写实、胶片、电影感、CG、油画等

风格词是我觉得最像“魔法咒语”的部分。你加一个词,整张图的基因就变了。不加风格词的时候,AI默认给你一个比较中庸的写实风格,像是用手机随手拍的。加上“胶片摄影”,画面立刻多了颗粒感和色调偏移。加上“电影感”,对比度和宽银幕的透视感就出来了。加上“油画”,笔触和颜料堆叠的质感就替代了像素的锐利。

我花了不少时间才搞明白一件事:风格词其实分两个层次。一个层次是媒介,也就是“这张图是用什么做的”——照片、油画、水彩、CG渲染、素描、版画。另一个层次是美学倾向,也就是“这张图看起来像谁的风格、哪个年代的风格、哪种类型的风格”——复古、未来主义、赛博朋克、极简主义、装饰艺术、巴洛克。这两层可以叠加使用,但要注意别打架。你写“超写实照片”加“浮世绘风格”,AI会困惑到底该给你照片还是版画。

“电影感”这个词我单独拎出来说,因为它太好用也太容易滥用。好的电影感提示词通常包含几个暗示:宽画幅比、浅景深、戏剧性光线、色彩分级。光写“电影感”三个字,AI可能只给你一个暗角加青橙色调。你写“电影感,宽银幕,浅景深,青橙色调,柔和对比”,出来的东西才真正像电影截帧。我现在的习惯是把风格词拆细,用两到三个具体词去描述一个风格方向,而不是扔一个笼统的大词就让AI自己去猜。

2.3 光线与色彩:自然光、伦勃朗光、逆光、色调与氛围

光线是摄影提示词里最被低估的部分。我见过很多人花大量精力写主体和风格,光线词就随便写个“自然光”完事。结果出来的画面平得像一张纸。光线决定了立体感、质感、情绪和视觉重心。同一个主体,换个光线方案,整张图的气质能翻个底朝天。

我常用的光线词分几类。方向类:顺光、侧光、逆光、顶光、底光、伦勃朗光、蝴蝶光、分割光。质量类:硬光、柔光、漫射光、散射光。时间类:黄金时刻、蓝调时刻、正午阳光、阴天光线。特殊类:霓虹灯、烛光、火光、屏幕光。这些词不需要全用,选两三个组合起来就能讲清楚光线逻辑。比如“侧逆光,黄金时刻,柔和的暖调光线从右后方照来,人物面部左侧有轻微的阴影过渡”——这一句就足够AI理解光线怎么走。

色彩和光线不分家。我习惯把色调词和光线词写在一起,因为它们互相决定。暖色调配黄金时刻,冷色调配蓝调时刻或者阴天。复古胶片色调偏青绿和品红,电影感色调偏青橙。我写色彩的时候会想一个具体的情绪:温暖、孤独、神秘、紧张、浪漫。然后去找对应的颜色组合。暖黄加暗棕是温暖,冷蓝加灰绿是孤独,紫红加深蓝是神秘。颜色对了,情绪就对了。氛围词像“雾气”“灰尘颗粒”“光晕”“雨丝”这些,是最后撒上去的调味料,一丁点就能让画面活过来。

2.4 构图与镜头语言:焦段、景别、视角、景深与构图法则

我承认自己在这一块走了最长的弯路。因为构图词和镜头词看起来很专业,我一开始根本不知道该怎么用。后来我把它们理解成“模拟一台真实相机和一个真实摄影师会怎么拍”,思路一下就通了。

焦段是最直观的镜头语言。广角(16mm到24mm)带来空间拉伸和透视夸张,适合环境人像、建筑、风景。标准焦段(35mm到50mm)接近人眼视角,适合日常感和纪实感。中长焦(85mm到135mm)压缩空间、虚化背景,适合人像特写。长焦(200mm以上)把远处的东西拉近,适合野生动物和体育摄影。你写“85mm镜头”,AI给你的面部比例和背景虚化就会接近真实的人像镜头效果。

景别决定主体在画面里的大小。特写、近景、中景、全景、远景,每一种对应的信息量和情绪浓度不同。特写抓情绪,全景讲环境,远景造氛围。视角是另一个维度:平视、俯拍、仰拍、鸟瞰、荷兰角。俯拍让人显得渺小或脆弱,仰拍让人显得强大或压迫。荷兰角制造不安和动感。这些词写进去,画面就有了态度。

景深和构图法则是我最后才学会用的。浅景深突出主体,深景深保留环境信息。三分法、中心构图、引导线、对称、框架构图,这些传统摄影的构图法则在AI提示词里同样有效。我试过写“三分法构图,主体位于画面左侧三分之一处,右侧留白给背景”,出来的画面明显比不写构图词的时候更有设计感。镜头语言这件事,你懂摄影就占大便宜,不懂的话就从模仿经典照片开始。

2.5 画质与细节控制:分辨率、纹理、锐度与真实感

画质词是我早期最爱堆砌的部分。“8K、超高清、极致细节、锐利、超写实”——这一串词写上去,感觉自己特别专业。后来我发现,这些词堆多了反而让画面变得油腻。AI会把所有东西都往锐了画,皮肤像塑料,树叶像剪纸,整体像一张过度处理的商业样片。

我现在写画质词会克制很多。分辨率词我一般只写一个,比如“高分辨率”或者“4K”,用来告诉AI这张图不是低模风格。纹理词比分辨率词重要得多,因为纹理才是真实感的核心。“皮肤纹理、毛孔可见、织物细节、木纹、石材表面”——这些词让AI知道该在哪些地方加细节。我试过对比,有纹理词的图和没纹理词的图,前者像纪录片,后者像动画片。

锐度和真实感是两件事。一张图可以很锐但很不真实,也可以不那么锐但非常真实。真实感来自不完美。我写过“轻微噪点、胶片颗粒、轻微色散”,出来的图反而比“极致锐利”更像真实照片。过度锐化会让画面失去空气感,而空气感恰恰是照片和CG最大的区别之一。我现在会留一点“呼吸空间”,不把画质词写满,让AI保留一些自然的柔和感和随机性。画质这块,少即是多,这句话我花了很久才真正理解。

2.6 负面提示词:排除不想要的元素与风格干扰

负面提示词是我觉得最像“保险丝”的东西。它不负责创造,但它负责防止画面爆炸。刚开始用AI的时候我完全不写负面提示词,出来的图经常带着诡异的瑕疵——多长一根手指、左右脸不对称、背景突然冒出一根莫名其妙的柱子、照片边缘出现重复的人影。后来学会写负面提示词,废片率直接降了一半。

最通用的负面提示词包括:低质量、模糊、变形、多余肢体、解剖错误、文字水印、签名、边框、裁切。这些是基础防护,不管什么风格都建议带上。然后根据具体场景加针对性的排除项。人像就加“不对称的脸、扭曲的五官、过度的皮肤平滑”。风景就加“重复的山峰、不自然的云层、人工痕迹”。产品就加“反光错误、阴影缺失、材质混乱”。

我还会用负面提示词控制风格漂移。比如我想要纯写实风格,就在负面里写“卡通、插画、绘画、CG、3D渲染”。我想要干净背景,就写“杂乱、拥挤、多余物体”。负面提示词的本质是给AI划一条边界线。你不划这条线,AI就会在无限的可能性里随机游走。你划了线,它就在你画好的框框里发挥。我现在的习惯是正面提示词写想要什么,负面提示词写不想要什么,两边配合着用,出图的稳定性会高很多。负面提示词不用写太长,抓重点就行,写太长了AI反而会困惑到底该避开什么。

3.1 AI摄影提示词生成器的原理与主要类型

我刚开始接触AI摄影那会儿,每次写提示词都像在黑暗中摸索。心里明明有一个画面,手指敲出来的词却总是差那么点意思。后来朋友甩给我一个提示词生成器链接,说你试试这个。那是我第一次知道,原来写提示词这件事本身也能被工具化。

提示词生成器的底层逻辑其实不复杂。它干的事情就是把你的零散想法翻译成AI能听懂的结构化语言。我输入“海边日落人像”,它给我吐出来一长串:“一位年轻女性站在海边礁石上,侧逆光,黄金时刻,暖橙色调,85mm镜头,浅景深,胶片颗粒,电影感构图”。你会觉得它好像读懂了你的心,其实它只是把数据库里跟“海边”“日落”“人像”相关的标签按权重拼在了一起。原理跟搜索引擎的联想建议有点像,只是维度更多、颗粒度更细。

我后来用过的生成器分两大类。一类是规则型,你选选项它拼句子,像搭积木。适合完全不知道从哪下手的新手,安全感很强,但出不了太个性的东西。另一类是AI驱动型,你输入一段大白话,它用语言模型帮你扩写成专业提示词。这类工具灵活度高,我经常用它来打破自己的思维惯性。有时候它给的组合我压根没想到,反而成了新方向的起点。两类工具各有各的好,我现在的习惯是用规则型打底,再用AI型做风格变体。

3.2 AI摄影提示词生成器与图像生成平台的选择:Midjourney、Stable Diffusion、DALL·E与专用辅助工具

工具选不对,功夫全白费。这话我在AI摄影上体会特别深。不同平台对提示词的“理解方式”差异巨大,同一个提示词扔进不同平台,出来的东西有时候像两个世界拍的。

Midjourney是我用得最多的。它对美学风格的敏感度极高,你写“电影感”它真的给你电影感,构图和光影的默认审美就很在线。缺点是你没法精确控制细节,它有自己的想法。我写“红色外套”,它可能给我一件暗红偏紫的,你说不清哪里不对,但就是跟你脑子里那件不一样。

Stable Diffusion是另一个极端。它的可控性极强,配合ControlNet和LoRA能精确到手指的角度和衣服的褶皱走向。代价是学习曲线陡峭,我花了差不多两个月才算摸到门道。它的提示词逻辑更接近“关键词加权”,你得用括号和数字来告诉它什么更重要。DALL·E的理解力最强,你能用完整的句子跟它对话,它甚至能处理“一张从冰箱视角往外看的照片”这种刁钻描述。但它的写实摄影质感偏弱,画面总带着一股“AI插画”的味道。

我现在的组合策略是:Midjourney负责审美探索和灵感发散,Stable Diffusion负责精确落地和批量生产,DALL·E用来做概念测试和复杂语义实验。专用辅助工具像PromptHero、OpenArt这些,我主要用来查别人怎么写提示词,找参考和偷师。工具没有绝对的好坏,关键看你处在哪个阶段、要解决什么问题。

3.3 从灵感到提示词:输入关键词、参考图与参数设置

灵感这东西来的时候特别具体,落到提示词里就特别抽象。我试过凌晨三点突然想到一个画面,兴奋地打开电脑,结果敲了半小时提示词,出来的图跟脑子里那张差了十万八千里。那种挫败感,估计每个玩AI摄影的人都经历过。

我现在的工作流分三步走。第一步是拆解灵感。脑子里那张图是什么在打动我?是光线、是情绪、是构图、还是颜色?我把打动我的那个点拎出来,作为提示词的核心。第二步是找参考图。文字描述再精确都有天花板,一张参考图能瞬间解决风格、色调、质感的沟通问题。Midjourney的垫图功能我用得最多,Stable Diffusion的IP-Adapter和ControlNet也是同样的逻辑。第三步才是写提示词,把核心点写成主体和风格,参考图负责填充细节和氛围,参数负责控制比例、精度和随机性。

参数设置这块我踩坑最多。一开始完全不管参数,默认值跑到底。后来发现同样的提示词,改一下长宽比、改一下风格化数值、改一下随机种子,出来的图能差出好几个档次。我现在会固定一组基础参数作为起点,比如人像用竖构图加中等风格化,风景用宽幅加高细节。然后在这个基础上微调,而不是每次从零开始。参数是提示词的放大器,它不改变内容本身,但它决定内容以什么方式呈现。

3.4 生成结果的筛选、迭代与A/B测试

AI摄影最不缺的就是选择。一次生成四张图,跑五轮就是二十张。最开始我每张都舍不得删,硬盘里堆了几千张“废片”,真正能用的不到十分之一。后来我给自己定了个规矩:第一眼不心动的,直接删。

筛选标准我分三层。第一层是技术过关,没有明显解剖错误、没有诡异变形、没有风格打架。这一层能筛掉一半。第二层是氛围对路,画面传递的情绪跟我想要的方向一致。写孤独就不能出来热闹,写温暖就不能出来冷清。这一层再筛掉一半。第三层是细节耐看,放大看眼睛有没有神、皮肤纹理自不自然、背景有没有穿帮。三层筛完,能留下来的就真的能用了。

迭代是筛选之后的事。我常用的方法是A/B测试:固定大部分提示词,只改一个变量。比如只换光线词,其他全不动,生成两组对比。这样你就能清楚知道光线词到底起了什么作用。我试过把“侧光”换成“伦勃朗光”,人物面部的立体感立刻不一样了。这种对比做多了,你对每个词的“手感”会越来越准。迭代不是瞎试,是有控制的实验。每次只动一个变量,记录结果,积累经验。时间长了,你写提示词就不再是碰运气,而是有预期的精准操作。

3.5 常见问题:语义漂移、风格失控、细节缺失与修正方法

语义漂移是我遇到的最头疼的问题。你写“一个女孩在雨中撑伞”,AI给你“一个女孩在雨中,旁边有一把伞,伞没撑开,女孩在笑”。画面里有你要的所有元素,但它们之间的关系全乱了。我后来发现,问题出在提示词的结构上。“在雨中撑伞”是一个整体动作,拆成“女孩”“雨”“伞”三个关键词之后,AI就不知道它们该怎么组合了。修正方法是用更完整的短句来描述动作,减少歧义空间。

风格失控也经常发生。我写“复古胶片风格的人像”,结果出来一张带大量漏光和划痕的废片质感。AI对“复古”的理解跟我差别很大。我的应对策略是把风格词拆细,用两到三个具体词替代一个笼统词。“胶片颗粒、轻微褪色、暖黄偏青色调、柔光”比“复古胶片”可控得多。风格词越具体,AI越不容易跑偏。

细节缺失是另一个高频问题。人脸崩、手指多、背景糊、材质假。我解决细节问题主要靠两招。一是加负面提示词做基础防护,把常见的崩坏项写进去。二是用局部重绘功能,把崩掉的部分框出来重新生成,而不是推翻整张图重来。Stable Diffusion的Inpaint和Midjourney的Vary(Region)都是我常用的工具。细节修复这件事,局部处理比全局重跑效率高得多,也更能保住你已经满意的那些部分。

还有一个问题我得单独提一下,就是提示词写太长导致的“注意力分散”。我早期喜欢把能想到的词全堆上去,结果出来的图每个元素都有一点,但每个都不突出。AI的注意力是有限的,你把二十个元素塞进去,它每个只能分到二十分之一的关注。我现在的做法是抓大放小,主体和核心氛围写清楚,次要元素点到为止或者交给AI自己发挥。学会做减法是我提示词水平提升最快的那个阶段。

4.1 人像摄影提示词模板的基本框架

我玩AI人像头几个月,最常干的事就是写一句“一位美女,电影感”,跑出来一堆长得差不多、表情也差不多的图。后来我发现,人像提示词得有点“骨架”,不然AI只能自由发挥,发挥出来的东西往往不是你要的。骨架长什么样?就是把一个人拆成可描述的维度:年龄、性别、脸型、发型、肤色、服饰、妆容、表情、姿态、环境、光线、镜头、风格。这些维度像体检表,你一项一项填,AI就一项一项画。

我自己的基础模板大概是这样:主体身份与年龄,比如“28岁东亚女性,短发,鹅蛋脸,单眼皮”;服饰妆容,“米白色真丝衬衫,裸妆,豆沙色唇膏”;表情情绪,“微微侧头,眼神安静,嘴角有极淡的笑意”;姿态动作,“坐在木椅上,右手轻搭膝盖”;环境背景,“午后咖啡馆靠窗位置,窗外有梧桐树影”;光线镜头,“窗光侧照,85mm镜头,f/1.8,半身特写”;风格画质,“胶片颗粒,暖黄偏青色调,浅景深”。这串东西看着长,写顺了也就一分钟。

框架顺序可以调。我常把情绪提到最前面,因为情绪是照片的灵魂,先定灵魂再找衣服和场景,出来的图更统一。新手容易把风格词放太前,写一堆“赛博朋克、蒸汽波、超现实”,结果人物脸都没描述清楚,AI只好给一张风格很足但人脸模糊的图。我的建议是:先锚定人,再调氛围,最后加风格。人像摄影提示词模板不是死公式,它更像一张检查清单,确保你漏掉某个维度时能快速补上。

4.2 人物特征描述:年龄、性别、发型、肤色、服饰与妆容

年龄和性别这两个词看着简单,AI却经常处理得含糊。我写“年轻女孩”,它给我从十六岁到二十八岁都可能。写“二十五岁上下,东亚女性,圆脸,鼻梁不高”,出来的脸就稳定很多。脸型词很有用:鹅蛋脸、方脸、心形脸、长脸。五官细节可以加:单眼皮、内双、卧蚕、鼻尖微翘、唇形偏薄。这些词不需要全写,挑两三个能定调的就够。

头发和皮肤是质感的重灾区。我早期写“漂亮的头发”,结果像塑料假发。换成“黑色齐肩发,微卷,发尾挑染灰蓝,刘海随意分开”,发丝立刻有了层次。肤色要搭配光线来写,暖黄皮放在暖光下会更黄,冷白皮放在霓虹灯下容易偏紫。我常用“冷白皮,皮肤有淡淡雀斑”或者“小麦色皮肤,肤质细腻有光泽”。服饰写材质和颜色比写款式名更有效,“粗针织米色毛衣”比“时尚毛衣”精确,“哑光皮质夹克”比“酷外套”更容易落地。妆容同理,水光肌、雾面底妆、红棕唇釉、下眼睑微红,这些词比“精致妆容”管用得多。

我写人物特征时有一个原则:不堆矛盾词。比如“清纯又性感”“幼态又成熟”,AI会左右摇摆,最后给你一张四不像。特征之间要协调,年龄、服饰、妆容、姿态指向同一个方向。我试过给一个“四十岁女性,知性短发,亚麻色风衣,眼尾有细纹,表情从容”的模板,跑出来的图很有说服力。把同样的人物换成“四十岁女性,粉色蓬蓬裙,双马尾”,画面就开始打架。人物特征描述的核心不是写得多,而是写得对。

4.3 表情、姿态与情绪关键词

AI人像的默认表情特别“安全”,安全到无聊。你写“微笑”,它给一个嘴角上扬十五度的标准笑。我后来学会用更细的词:嘴角微扬、眼神温柔、看向镜头外、下唇轻咬、眉头微蹙、眼眶微红。这些词给AI的动作指令更具体,出来的表情就有戏。情绪词比表情词更高一层。孤独、雀跃、慵懒、紧张、释然、疲惫、期待,这些词影响的不只是脸,还有光线、色调、姿态的整体走向。

姿态要落到身体部位。我写“优雅地站着”,AI会给我一个僵硬的人偶。改成“脊背挺直,下巴微收,左手轻搭锁骨,右手自然垂落,重心放在右腿”,画面就活了。坐姿也一样,“坐在台阶上,膝盖并拢,双手环抱小腿,身体微微前倾”。回眸、侧身、低头、仰头,这些方向词配合手部位置,姿态就不容易崩。我习惯在提示词里写清楚“手在做什么”,因为手是AI最容易画崩的地方之一,提前指定位置能减少很多麻烦。

我常用情绪驱动法。先定一个主情绪,比如“释然”,再选表情“闭眼,嘴角放松,眉心舒展”,选姿态“仰头靠在墙上,双手插兜”,选环境“深夜天台,远处城市灯光虚化”。情绪、表情、姿态三者一致,照片就有了叙事感。三者打架的时候,观众一眼就能看出假。我做过对比,同一张脸,写“释然”和写“焦虑”,即使服饰环境完全一样,成片的氛围也完全不同。情绪关键词是人像提示词里最被低估的部分,它不改变长相,却改变照片的呼吸。

4.4 环境、背景与人物关系

环境是人像的故事板。我拍过一组“深夜便利店”的AI人像,同一个人,站在冷白灯管下,手里拿一罐咖啡,背景是虚化的货架和玻璃门。另一次我把环境换成“海边日出”,暖橙色光打脸上,头发被风吹乱,出来的感觉完全换了一个人。环境元素要少而准,便利店里的关东煮、杂志架、收银台不需要全写,写“冷白灯管,玻璃货架反光,门外夜色”就够了。背景的任务是交代时间和地点,不是抢主体的戏。我通常会用浅景深把背景虚化掉,只留下色块和光斑。

人物关系是AI的弱项。单人还好,双人就开始混脸、换手、衣服颜色对调。我写双人提示词时会明确左右位置:“左边是一位年长女性,灰白短发,深蓝针织衫;右边是一位年轻女孩,黑色马尾,白色T恤。两人并肩坐在长椅上,年长女性右手搭在女孩肩上,两人目光看向画面左侧。”这种写法比“一对母女”精确太多。群像更麻烦,我一般会限制在三人以内,每个人给一个单独的特征锚点,再写整体关系。

人物跟环境的互动能让画面不那么像贴图。手摸墙壁、坐在窗台、手指划过水面、玻璃映出倒影、风吹动衣角。我写过一个“女孩站在地铁站台,列车进站的风吹起裙摆和发丝,她微微眯眼,手按住帽子”。环境、动作、情绪同时发生,照片就有了瞬间感。环境与人物的关系还要注意比例,人物在画面里占多大、在左在右、是全身还是半身,这些用景别和构图词来控制。背景太抢的时候,加一句“背景虚化,焦点在人物面部”,AI会听话很多。

4.5 光线与镜头在人像中的组合模板

光线是人像的化妆师。我最早只会写“自然光”,出来的图平淡得像登记照。后来学会分方向:顺光、侧光、侧逆光、逆光、顶光、底光。再学分质感:柔光、硬光、伦勃朗光、蝴蝶光、窗光、霓虹光。伦勃朗光会让脸的一侧出现三角形光斑,立体感很强;蝴蝶光在鼻子下方留一个蝴蝶形阴影,适合女性人像;侧逆光勾出发丝轮廓,适合情绪片。时段也重要,黄金时刻暖而柔,蓝调时刻冷而静,正午硬光适合戏剧感。色调词可以叠加:暖橙、青蓝、低饱和、褪色胶片。

镜头焦段决定脸型和空间感。85mm是人像经典,压缩背景,脸型自然。50mm接近人眼,适合半身和环境人像。35mm带更多环境,适合街拍和故事感。135mm压缩感更强,背景像奶油一样化开。景别我常用特写、半身、七分身、全身、环境肖像。光圈写f/1.4、f/1.8、f/2.8,数字越小背景越虚。视角也有讲究,平视亲切,俯拍显小,仰拍显气场。构图词可以加三分法、中心构图、框架构图、留白方向。

我的组合模板里有一组万能起手式:85mm,f/1.8,半身,窗光侧逆,暖橙色调,浅景深,背景虚化,胶片颗粒。这组跑人像很少翻车。场景一变,我换光线和镜头就行。咖啡馆用35mm f/2.8,带窗和桌子;天台夜景用50mm f/1.4,霓虹侧光加冷蓝调;户外草地用135mm f/2.0,逆光加金色光晕。不同AI平台对镜头词的理解不一样,Midjourney对“85mm”反应很好,Stable Diffusion需要配合负面词控制畸变,DALL·E更吃完整句子。我一般会准备两套写法,一套给Midjourney,一套给SD,切换着用。

4.6 商业人像、写真、证件照、时尚大片等模板差异

商业人像要的是干净、专业、品牌感。我接过的需求里,商业人像通常要求背景简洁、服装整洁、表情自信、光线均匀。模板我会写:50mm,f/8,纯白或浅灰背景,蝴蝶光加轮廓光,人物正面或微侧,表情自然微笑,皮肤质感保留但瑕疵修掉。负面词写“杂乱背景、过度阴影、夸张表情、低分辨率”。商业人像不能太情绪化,它要的是可信和舒服,所以光线平一点、构图稳一点、颜色克制一点。

写真走的另一条路。写真要个性、情绪、生活感。我常用85mm或50mm,f/1.4到f/2.8,自然光或窗光,浅景深,胶片颗粒,暖调或青调。表情可以笑也可以不笑,姿态可以坐可以躺可以回眸。环境选咖啡馆、天台、海边、旧街道。写真模板里我会加情绪词:慵懒、安静、雀跃、若有所思。负面词写“影楼感、过度磨皮、僵硬姿势、假笑”。写真不怕有点瑕疵,怕的是太完美太假。

证件照是另一种极端。它要求正面、平光、纯色背景、表情中性、比例标准。模板我会写:50mm,f/8,正面平视,白色或蓝色背景,双耳可见,肩膀齐平,无阴影,无首饰,淡妆或素颜。负面词写“侧脸、夸张表情、阴影、反光、背景杂物”。证件照的提示词越简单越稳,不要加风格词,不要加情绪词,不要加胶片颗粒。时尚大片就完全放开。24-70mm,硬光,高对比,强色彩,夸张造型,动态姿态,超现实场景,戏剧阴影。表情可以冷、可以挑衅、可以放空。负面词写“平淡光线、普通姿势、日常背景”。同一张脸,套商业模板、写真模板、证件照模板、时尚大片模板,出来的图能差出十万八千里。我现在拿到一个人像需求,会先判断它属于哪一类,再选对应模板,最后微调年龄、发型、情绪和光线。模板是起点,不是终点。

5.1 权重语法、括号与参数控制

我最初看到别人写“(((masterpiece)))”这种东西,以为是手滑多按了括号。后来才明白,这是给AI划重点。Midjourney用双冒号加数字来调权重,比如“sunset::2”意思就是日落这个元素重要程度是默认的两倍。Stable Diffusion用圆括号包裹加数字,“(red dress:1.3)”就是把红裙子的存在感往上提。方括号是减权,“[blurry]”是告诉模型别太在意模糊这件事。这些符号刚上手的时候特别容易写乱,我有一次一口气叠了四层括号,出来的图反向漂移,完全不是我要的东西。权重的意思不是“越多越好”,是“越准越好”。我现在很少超过三层,通常只对最关键的两三个元素加权重,其他交给模型自己平衡。

参数控制是另一条线。Midjourney的“--ar 16:9”改画幅,“--stylize”调风格化程度,“--chaos”控制多样性,“--seed”锁定随机种子。Stable Diffusion那边,采样步数、CFG scale、采样器选择,每一个都影响成片。我自己的经验是CFG别拉太高,7到9之间比较稳,拉到12以上画面容易过饱和、边缘发硬。步数也不是越高越好,30步左右通常够用,跑到80步画质提升很有限,时间倒是翻倍。这些参数像调味料,盐放对了提鲜,放多了毁菜。我现在的习惯是固定一套“基线参数”,每次只改一个变量,跑四张对比图,看清楚了再动下一个。

权重和参数要配合使用。我见过有人把“cinematic lighting::3”加上去,参数又开“--stylize 1000”,光线是戏剧化了,人脸也糊了。我的做法是先不加权重,用默认参数跑一版,看哪里不够,再针对性地加。比如人脸太暗,我给“soft light on face::1.5”;背景太抢,我给“background::0.6”或者干脆在负面词里写“busy background”。参数方面,如果我要系列图,会把seed固定住;如果我要探索方向,会把chaos开到20到40之间,让模型多给我几个意外。这中间的分寸感,跑多了自然就有了。

5.2 风格迁移与参考图融合:IP-Adapter、ControlNet、LoRA等

我第一次接触ControlNet的时候,觉得这东西像作弊。你给它一张线稿、一张深度图、一张姿态骨架,它就能把构图给你锁死。我拿一张自己拍的手部特写照片,提取了openpose骨架,再配合提示词写“油画风格”,出来的人物手部结构准确得让我愣了一下。ControlNet的各个模型各有各的用途:canny锁边缘,depth锁空间关系,openpose锁人体姿态,softedge适合线稿转绘。我常用的是depth加canny的组合,一个管前后景,一个管轮廓。你不需要每个都精通,挑两三个自己场景里最常用的,练熟比什么都强。

IP-Adapter是另一种思路。它不做结构控制,它做风格和特征的迁移。你给一张参考图,它把那张图的色调、质感、氛围“吸”过来,再结合你的提示词生成新图。我有一次拿一张日本摄影师上田义彦的蓝色调照片做参考,配合写“一位女性站在窗前”,出来的图带着那种安静、低饱和、微微偏青的气质。LoRA就更细分了,它是针对特定风格、特定人物、特定概念训练出来的小型模型。你想画某个特定的动漫角色,或者想要某种非常具体的胶片色调,LoRA是最快的方法。缺点是需要训练,需要素材,需要调参。我自己的LoRA训练经验不算多,跑过两次,一次衣服风格,一次面部特征,效果能用但不算完美。

这几样东西一起用的时候,逻辑要理清楚。我的常用组合是:ControlNet锁构图,IP-Adapter迁风格,LoRA补细节,提示词写内容和氛围。层次不能乱,乱了模型就打架。我试过同时挂两个风格差异很大的LoRA,一个写实一个二次元,出来的人脸像被拉扯过一样。我也试过ControlNet权重开太高,整个画面死板得像拼贴。现在我一般只用一两个辅助工具,剩下的交给提示词。工具是拐杖,路还是得自己走。提示词写不清楚的时候,挂再多模型也救不回来。

5.3 系列化创作:保持角色一致性与场景连贯性

做系列图最头疼的就是“同一个人”这件事。你用同一段提示词跑十次,AI能给你十张不同的脸。我最早做人物系列,靠的是反复抽卡,跑一百张挑出五张像同一个人的。效率低得让人崩溃。后来我学乖了,开始用seed固定。Midjourney里找到一个满意的seed,后续所有图都带上这个seed,人物基础特征会稳定很多。Stable Diffusion里可以配合固定seed加微调提示词,比如只改服装和环境词,脸的变化就小。这个方法有个前提,你的基础提示词得写得够具体,否则seed也救不了随机性。

再往上一步是参考图加IP-Adapter或者角色LoRA。我做过一组“同一位女性在不同城市”的系列,用一张基础脸做参考图,IP-Adapter权重调到0.6左右,然后每张图只改背景和光线描述。北京胡同、上海外滩、重庆天台、厦门海边,四张图放在一起,能看出是同一个人,但氛围完全不同。场景连贯性比角色一致性容易一些,你只要把环境的核心元素固定住,比如“红砖墙、铁艺窗、梧桐树影”写死,换人物动作和光线时段就行。系列图的难点在于“变与不变”的平衡,不变的东西太多,图会腻;变得太多,系列感就散了。我的经验是锁定两个核心变量,角色的两个特征加环境的一个标志物,剩下的放开跑。

5.4 提示词库与模板管理:标签、分类与复用

我有一段时间每天写几十条提示词,写完就扔,下次要用的时候翻聊天记录翻到崩溃。后来我开始建自己的提示词库,用最简单的Excel,列几个字段:主题、场景、光线、镜头、风格、情绪、备注。每条提示词拆成模块存进去,用的时候拼起来就行。比如“光线”那一列存了“窗光侧逆、伦勃朗光、霓虹侧光、黄金时刻逆光、阴天柔光”十几条,“镜头”那一列存了“85mm f/1.8半身、35mm f/2.8环境、135mm f/2.0特写”。这样我要做一组咖啡馆人像,直接挑模块组合,不用每次从零写起。

标签体系要符合自己的习惯,别照搬别人的分类。我的分类是按“使用频率”和“场景类型”交叉来的。高频模块放最前面,人像、产品、风光各一个分页。我还专门建了一个“翻车记录”分页,把那些跑出来效果差的提示词也存下来,旁边写上原因,比如“风格词打架”“光线描述矛盾”“权重过高导致脸部变形”。负面提示词也单独建库,按场景分,人像一组、产品一组、风光一组,常用的“低分辨率、多余手指、水印、过曝、塑料感”翻来覆去就那些。提示词库不需要多精致,需要的是你愿意打开它、用它、更新它。我现在的提示词库跑了两年多,大概三百多条模块,常用的也就三四十条。工具不在多,在顺手。

5.5 反推提示词:从图片到文字的工作流

有时候我手里有一张图,风格、光线、构图都很好,但我说不清楚它为什么好。这时候反推提示词就派上用场了。Stable Diffusion的CLIP interrogator、Midjourney的“/describe”指令,都能把一张图翻译成一段文字描述。我用得最多的是Midjourney的describe,丢一张图进去,它给我四段不同角度的提示词,我再从里面挑有用的词。反推出来的提示词通常很啰嗦,颜色词、材质词堆得密密麻麻,而且经常把不重要的细节写得很重。我的做法是反推之后做减法,保留主体、光线方向、色调倾向、风格关键词,砍掉那些过度具体的杂物描述。

反推加人工调整是我做风格模仿的常用流程。比如我看到一张很喜欢的电影剧照,先describe一遍,拿到基础框架,然后按自己的需求替换主体和场景,保留光线和色调结构。有一次我反推了一张《银翼杀手2049》的剧照,拿到“橙色雾霾、剪影、广角、低角度、高对比”这些词,然后把主体换成“一位撑着透明雨伞的女性”,环境换成“废弃停车场”,出来的图有那种氛围但没有照搬原图。反推的意义不是复制,是拆解。你把一张好图拆成零件,再按自己的图纸重新组装。

反推工具也有局限。它读不懂情绪,读不懂叙事,它只能读像素层面的东西。一张照片里人物“若有所思”的状态,反推出来可能只有“looking away, soft expression”,你得自己补上情绪词。我一般会反推两到三张风格相近的参考图,交叉比对,找出重复出现的关键词,那些就是风格的骨架。然后我再加自己的主体和情绪描述,出来的图既有参考的质感,又有自己的内容。这个工作流我用了大半年,现在做商业提案的时候特别高效,客户丢几张参考图过来,我半小时内就能出一版风格样片。

5.6 跨平台适配:不同AI摄影工具的提示词差异

Midjourney、Stable Diffusion、DALL·E这三个平台,提示词写法差别挺大的。Midjourney喜欢短句加参数,词与词之间用逗号隔开,它对“--ar”“--stylize”这些参数反应很直接。你写“portrait of a woman, 85mm, f/1.8, window light, film grain --ar 4:5”,它就能给你一张很像样的图。Stable Diffusion更吃完整句子和权重语法,它对负面提示词的支持也比Midjourney细。你写“a portrait of a woman standing by a window, soft natural light coming from the left side, shot on 85mm lens at f/1.8, shallow depth of field, film grain texture”,SD会逐词解析,每个词都可能影响画面。DALL·E又不一样,它更接近自然语言,你写一段像故事一样的描述,它反而理解得更好。你写“一位女性站在窗边,午后的光从她左侧照进来,她的侧脸被照亮,背景模糊,照片有胶片感”,DALL·E会生成一张很贴合描述的画面。

跨平台转换的时候,我一般做三件事。第一,把短句扩写成完整句子,给SD和DALL·E用;第二,把完整句子压缩成关键词加参数,给Midjourney用;第三,把负面提示词单独拎出来,因为Midjourney不支持独立负面词,得用“--no”参数,SD可以单独写一栏。我自己的习惯是为每个平台存一套模板,内容一样,写法不同。Midjourney那套最短,SD那套最细,DALL·E那套最像人话。转换的时候不是机械翻译,是换一种语言说同一件事。

同一段提示词在不同平台跑出来的东西,差异可能大到让你怀疑人生。我拿“一位女性站在雨夜街头,霓虹灯反射在湿漉漉的地面上,35mm,f/2.0,电影感”这组词试过三个平台。Midjourney给了一张偏冷调、构图很紧的半身像;SD给了一张更广的街景,人物偏小,但霓虹反光特别漂亮;DALL·E给了一张故事感最强的图,人物表情和姿态都更自然,但画质稍微软一点。没有哪个平台绝对更好,看你要什么。要风格化强、出图快,Midjourney省心;要控制精细、可复现,SD更合适;要描述复杂场景、语义理解准,DALL·E有优势。我的日常工作流是三个平台都开着,同一组需求各跑一版,挑最好的那个方向往下走。平台是工具,不是信仰,哪个顺手用哪个。

6.1 案例一:AI人像摄影从需求到成片

朋友乐队要发一首单曲,封面想用女主唱的半身像。需求很具体:室内,下午四点左右的窗光,35mm镜头,胶片颗粒,安静里带一点疏离。我拿到这个需求的时候,脑子里先跑了一遍画面。窗光从左侧进来,脸一半亮一半在阴影里,眼神不看镜头。我把这些写成第一版提示词:portrait of a female singer, sitting by a window, soft afternoon light from left, 35mm lens, film grain, quiet and distant mood, muted colors。跑出来四张,脸都太正了,光也偏硬,像正午不是下午。我删掉“soft”,换成“gently diffused window light”,负面词加上“harsh shadow, direct sunlight, smiling”。再跑一版,氛围对了,但人物看起来太年轻,不符合主唱三十岁出头的气质。我补了“early 30s, subtle wrinkles, natural skin texture”。迭代到第六版,终于有一张能用。那张图里,窗框的阴影落在她右肩,眼睛看着窗外,嘴唇微微抿着。朋友说就是这种感觉。

这个案例里最关键的一步,是我放弃了“一次写完美”的念头。第一版提示词只搭骨架,后面每一版只改一个变量。光线不对就只改光线词,年龄不对就只改年龄词。我试过同时改光线和年龄,出来的图完全失控。还有一个小技巧,我把满意的seed记下来,后面微调时一直带着它。seed不能保证脸完全一样,但它能让构图和光线方向稳定在一个范围内。人像提示词最怕的就是随机性太大,每跑一张都像换了一个人。

最终交付的时候,我给朋友看了三版不同色调的成片。一版偏青,一版偏暖,一版黑白。他们选了偏青的那版,说跟歌曲的忧郁感更搭。我后来把这次用到的提示词模块存进了自己的库:gently diffused window light, 35mm, film grain, quiet and distant mood。下次遇到类似需求,直接调出来改主体就行。人像摄影的提示词实战,说到底就是需求拆解加耐心迭代。你越清楚自己要什么,提示词就越短越准。

6.2 案例二:商业产品摄影提示词设计

一个做手工香薰蜡烛的独立品牌找我拍产品图。他们的要求是:暖光,木桌,旁边放一点干花,背景虚化,整体要有“傍晚家里点蜡烛”的感觉。我第一反应是这比人像简单,产品不会动,表情也不需要考虑。写提示词的时候才发现,产品摄影的难点在材质和光影的精确控制。第一版我写:hand-poured soy candle on wooden table, warm amber glow, dried lavender, shallow depth of field, 100mm macro, softbox light。跑出来蜡烛的玻璃杯反光太强,像塑料。我把“glass jar”改成“frosted glass jar”,又加了“matte texture, soft reflection”。反光柔下来了,但干花的位置太抢眼。负面词加上“busy background, sharp dried flowers”,再把景深描述改成“background completely blurred, bokeh”。这一版好多了。

产品摄影的提示词里,光线的写法跟人像不一样。人像可以写“窗光”“伦勃朗光”,产品更多写“柔光箱”“顶光加侧逆光”“环形光”。我这次用的是“large softbox from top left, subtle rim light from right”。蜡烛的火焰很小,我特意加了“small warm flame, glowing wick”,让AI注意到这个细节。还有桌面材质,我写“aged oak wood, visible grain”,出来的木纹很自然。如果写“wooden table”,AI可能给一张太光滑太新的桌子。商业产品图的背景要干净,负面词里我常备“clutter, text, watermark, logo, hands”。手模有时候会入镜,但这次不需要。

客户看到成片的时候,问我是不是真的点了蜡烛拍的。我说是AI生成的,他们有点意外。我后来把这一套提示词整理成模板:[产品名] on [材质] surface, [光线描述], [辅助道具], [镜头和光圈], [氛围词]。负面词固定用“plastic, artificial, busy background, harsh reflection”。这套模板后来用在他们的香薰石和护手霜上,改改主体和道具就行。产品摄影的提示词设计,核心是让AI理解“这个东西摸起来是什么感觉”。你写“frosted glass”,它就给你磨砂感;你写“matte ceramic”,它就给你哑光陶瓷。材质词比风格词更重要。

6.3 案例三:风光与建筑摄影提示词设计

风光摄影的提示词,我踩过一次大坑。我想生成一张冰岛黑沙滩的灯塔,黄昏,长曝光,云层拉丝。第一版写:lighthouse on black sand beach, Iceland, sunset, long exposure, cloudy sky。出来的图很平,云没动,海也没雾。我后来意识到,长曝光的效果需要用更具体的词描述。改成:lighthouse on basalt cliffs, Iceland, dusk, 30-second exposure, silky smooth clouds, misty ocean, 16mm wide angle, f/11, low ISO。这一版云层有了流动感,海浪变成雾状。还有一个细节,黑沙滩的玄武岩柱我写了“hexagonal basalt columns”,AI真的给了一排六棱柱。风光提示词里,地质特征、天气现象、曝光时间,这些词越具体越好。你写“beautiful landscape”,AI就给你一张明信片;你写“storm clearing over jagged peaks, last light hitting the snow”,它才给你戏剧性。

建筑摄影又是另一种逻辑。我帮一个建筑师朋友生成概念图,他要安藤忠雄风格的混凝土教堂,光线从十字缝射进来。提示词写:concrete chapel, cross-shaped light beam, minimalist, symmetrical composition, 24mm tilt-shift, cool gray tones, shadow and light contrast。出来的图结构很稳,但混凝土太干净了。我加了“board-formed concrete, visible seams, slight imperfections”,质感立刻真实很多。建筑提示词里,“对称”“透视”“广角”“移轴”这些词能控制线条。你要拍室内,就写“interior, wide angle, vertical lines corrected”;你要拍外立面,就写“elevation view, flat lighting, orthographic”。我朋友后来用这组词生成了十二张概念图,挑了三张放进提案。他说比手绘快多了。

风光和建筑有个共同点:AI容易把画面做得太“完美”。云是完美的,光是完美的,阴影也是完美的。真实感反而来自那些不完美。我在负面词里经常加“oversaturated, HDR look, too clean, artificial lighting”。有时候我还会主动加“slight haze, lens flare, subtle vignette”,让画面像真的用相机拍的。风光提示词实战里,我学到最重要的一课是:不要只描述“有什么”,还要描述“怎么拍的”。焦段、光圈、曝光时间、滤镜,这些摄影参数写进去,AI会给你更接近真实拍摄的结果。

6.4 案例四:创意概念摄影与超现实画面

超现实画面是我玩得最开心的方向。有一次我想做一张“穿西装的男人站在漂浮的钢琴键盘上,键盘延伸向天空”的图。第一版提示词:surreal, man in suit standing on floating piano keys, sky, clouds, cinematic。出来的图里,钢琴键盘像一坨融化的塑料,男人的腿跟键盘粘在一起。我意识到超现实不是乱堆元素,元素之间的空间关系要写清楚。第二版改成:surreal concept, a man in a tailored suit standing on a giant piano keyboard floating in the sky, the keyboard extends into the clouds, clear separation between man and keys, cinematic lighting, hyperrealistic, 35mm lens。这一版好多了,但男人的手还是有问题。负面词加上“distorted hands, extra fingers, fused limbs, unnatural proportions”。再跑,手正常了,但键盘的透视不对。我用了ControlNet的depth模型,先画了一个简单的空间草图,锁住前后关系。最后成片里,男人站在键盘的中央,键盘像一条路伸向远处的云层,光线从右上方打过来,影子落在白键上。

这个案例让我明白,超现实提示词要分三层写。第一层是主体和动作,第二层是空间关系,第三层是光线和风格。主体写“man in suit”,动作写“standing”,空间写“on floating piano keys, keyboard extends into clouds”,光线写“cinematic side light”,风格写“hyperrealistic”。负面词要特别狠,因为AI在超现实场景里容易放飞。我常用的负面词有“blurry, low resolution, deformed, extra limbs, floating objects without connection, dreamlike haze”。有时候我还会加“sharp focus, high detail”来压住画面的模糊倾向。

创意概念摄影的提示词,最怕的是“词不达意”。你脑子里有一个很具体的画面,写出来的词却只能描述个大概。我的办法是先写一段话给自己看,像讲故事一样:“一个穿西装的男人站在巨大的钢琴键盘上,键盘漂浮在云端,他低头看着琴键,光线从右边来。”然后我把这段话拆成关键词,去掉情绪描述,保留视觉元素。再跑几版,挑最接近的。超现实画面不需要完全可控,有时候AI给你的意外比原计划更好。我有一次跑出一张键盘变成波浪形的图,比原本的直线延伸更有趣。我就顺着那个方向改提示词,最后出来的系列图客户很喜欢。

6.5 版权、伦理与真实性:AI摄影提示词的边界

AI生成图像火了以后,版权问题一直没消停。我用Midjourney和Stable Diffusion生成的图,到底算谁的?平台的用户协议写得不一样,有的说用户拥有版权,有的说平台也有使用权。我自己的做法很简单:商用之前一定看清楚平台条款,不确定的就用自己训练的LoRA或者完全原创的提示词。有一次一个客户想用AI生成的图做包装,我建议他们找律师确认一下。后来他们换了方案,用实拍图。版权这件事,宁可谨慎一点。提示词本身能不能受版权保护,目前也没有统一说法。我写的一段提示词,别人改几个词就拿去用,我很难追究。所以我现在把提示词当“配方”,不指望它本身值钱,值钱的是我调整配方的手感。

伦理问题更让我在意。AI人像可以生成一张根本不存在的脸,这张脸可能被用来做虚假宣传、伪造证据、甚至诈骗。我给自己定了几条规矩。第一,不生成真实人物的虚假场景,尤其是政治人物和公众人物。第二,生成的人像如果用于商业,必须标注“AI生成”。第三,不用AI生成“新闻现场”类的图片。有一次有人找我做一组“战地摄影”风格的图,我拒绝了。那种图太容易被误认为真实,传播出去就是灾难。AI摄影提示词的能力越大,写提示词的人越要想清楚边界。你写“photorealistic, documentary style, war zone”,跑出来的图可能被不知道的人当成真照片。这个责任不在AI,在写提示词的人。

真实性是另一个维度。我拍实拍的时候,照片是“曾经存在过的瞬间”。AI生成的图,那个瞬间从未存在。我不觉得AI图就低人一等,但它需要被标注清楚。我在社交媒体发AI图的时候,会打上“#AIgenerated”的标签。有人觉得这样会降低传播效果,我觉得诚实比流量重要。摄影从胶片到数码,已经经历过一次“真实性”的讨论。数码可以PS,AI可以无中生有。每一次技术进步都在挑战“真实”的定义。我的态度是:不排斥AI,不伪装AI。提示词是我的画笔,但我不会假装画出来的是照片。

6.6 未来趋势:多模态提示、实时生成与个性化模型

多模态提示是我最期待的方向。现在写提示词还是靠打字,未来可能直接说话、画草图、甚至哼一段旋律。我试过用语音输入提示词,识别率还行,但语气和停顿会影响结果。如果AI能理解“我想要那种午后有点困的感觉”,那就省事多了。草图输入已经在用了,ControlNet的scribble模型可以读简笔画。我画一个歪歪扭扭的构图,它就能生成一张结构合理的图。未来可能你拍一张现场照片,AI实时在上面叠加风格,像滤镜但比滤镜聪明。你拍一棵树,它给你梵高风格的树;你拍一条街,它给你赛博朋克风格的街。提示词会从“文字”变成“意图”。

实时生成也在慢慢成熟。现在Midjourney和SD出图还要等几秒到几十秒,未来可能做到边拍边生成。我设想一个场景:摄影师拿着相机拍模特,取景器里实时显示AI增强后的画面。摄影师调整光线和构图,AI同步调整风格和氛围。这会让摄影和后期变成同一件事。个性化模型是另一个趋势。每个人都可以训练自己的LoRA,把自己的审美、色调、构图习惯“教”给AI。我认识一个摄影师,他训练了一个自己的LoRA,专门生成他标志性的暗调人像。别人用同样的提示词,出图就是不如他的像。这种个性化模型会让AI摄影从“通用工具”变成“个人风格延伸”。

我对这些趋势有期待,也有担心。期待的是创作效率会大幅提升,一个人能做以前一个团队的事。担心的是同质化。如果大家都用相似的模型和提示词,出来的图会不会越来越像?还有真实性的进一步模糊。实时生成的照片,到底是拍到的还是生成的?观众分不清。我的应对方式是:保持自己的提示词库更新,坚持实拍和AI结合,不把AI当唯一工具。未来已来,只是分布不均。我现在能做的,是把每一张AI图当成一次实验,记录下有效的提示词,也记录下翻车的教训。趋势是方向,手上的活儿才是根本。

赞0
踩0
☆收藏0
版权声明
文章版权声明:除非注明,否则均为ZBLOG原创文章,转载或复制请以超链接形式并注明出处。
分享到
chuanbook

链接已复制到剪贴板