1.1 Midjourney是什么:核心能力、适用人群与应用场景
我第一次听说Midjourney的时候,以为它就是个"输入文字自动画图"的小玩具。真正用起来才发现,这东西的想象力边界比我预想的大得多。简单说,Midjourney是一款基于人工智能的图像生成工具,你给它一段文字描述,它在几十秒内就能吐出四张风格各异的画面。它的核心能力不只是"画得像",更在于把抽象的想法快速视觉化。脑子里闪过一个赛博朋克茶馆的画面,或者需要一个北欧极简风格的产品展示图,敲几行字就能看到雏形。
适用人群比很多人想的要广。设计师拿它做概念草图和灵感铺陈,插画师用它探索配色和构图方向,自媒体创作者靠它解决配图焦虑。我认识一位做电商的朋友,以前拍产品图要租场地、请模特、后期修图,现在他用Midjourney先生成场景概念图,再让摄影团队照着拍,效率翻了好几倍。还有做儿童绘本的独立作者,用Midjourney把故事里的角色先视觉化出来,再和插画师沟通具体细节,省了大量反复描述的时间。
应用场景这块,我自己常用的有这么几类。第一类是头脑风暴阶段的视觉参考,不用太精细,能启发思路就行。第二类是商业项目里的情绪板,客户说不清楚想要什么风格的时候,直接生成几组对比图,沟通成本一下就降下来了。第三类是个人创作,比如给小说配插图、做播客封面、设计社交媒体头图。第四类是学习辅助,我甚至用它来生成历史场景的想象图,帮自己理解文字资料里的画面感。说到底,Midjourney不是替代谁,它更像一个随叫随到的视觉助手,把你的文字变成看得见的东西。
1.2 账号注册、Discord加入与首次生成图片
注册流程不算复杂,但第一次接触的人容易在Discord这一步卡住。Midjourney本身没有独立的网页版操作界面,它的所有指令都在Discord这个聊天平台里完成。你需要先注册一个Discord账号,然后加入Midjourney的官方服务器。我当时找入口找了半天,其实在Midjourney官网点"Join the Beta"就会跳转到Discord的邀请页面,接受邀请就进去了。
进去之后你会发现服务器里有很多频道,新手容易懵。找到以"newbies"开头的频道,随便选一个人少的进去,就可以开始操作了。在输入框里敲"/imagine",会弹出一个提示词输入框,把你想画的内容写进去,按回车发送。等个一分钟左右,Midjourney就会生成四张低分辨率的预览图。我第一次生成的时候特别激动,输入的是"一只穿着宇航服的柴犬在月球上遛弯,电影感光线",出来的四张图各有各的可爱,虽然细节经不起放大,但那种"我说什么它画什么"的感觉确实很上头。
有个小细节要提醒一下:免费额度早就取消了,现在需要订阅才能生成图片。订阅在Midjourney官网的个人账户页面操作,按月付费,基础套餐就够新手玩很久了。另外Discord账号最好开启两步验证,后面章节会专门讲账号安全的问题。第一次出图不用追求完美,多试几次不同的描述,感受一下它的理解方式和出图节奏,这比一上来就研究复杂参数要实在得多。
1.3 基础界面、常用指令与出图流程速览
Discord的界面看起来像聊天软件,但对Midjourney来说,它就是一个指令操作台。左边是频道列表,中间是消息流,底部是输入框。你输入的所有指令和生成的图片都会出现在消息流里,所有人可见。如果不想被别人看到,可以私聊Midjourney机器人,在私信里操作,界面更干净,我后来基本都在私信里出图。
常用指令就那么几个,记住就能应付大部分场景。/imagine是出图的核心指令,后面跟提示词。/settings可以调一些基础偏好,比如默认的模型版本。/info能查看你的剩余额度和订阅状态。图片生成后,下方会出现U1到U4和V1到V4的按钮,U代表放大某一张,V代表基于某一张生成变体。还有那个刷新按钮,点击会重新生成四张全新的图。这些按钮的具体用法后面章节会展开讲,现在有个印象就行。
出图流程说白了就是四步:写提示词、发送指令、等待生成、挑选操作。听起来简单,但每一步都有讲究。提示词的写法直接决定出图质量,这是后面要花大量篇幅讲的内容。等待时间取决于服务器负载,高峰期可能慢一些。挑选环节是最有意思的,四张图里可能只有一张对味,也可能四张都差点意思,这时候要么点刷新重新来,要么在满意的图上做变体微调。我个人的习惯是,第一轮出图先看构图和氛围,如果大方向对了,再通过变体和局部重绘去抠细节。
1.4 新手常见误区、学习路径与练习建议
新手最容易踩的坑,我几乎一个没落地全踩过。第一个误区是把Midjourney当搜索引擎用,输入"好看的风景"这种模糊描述,出来的图也很模糊。它需要具体、有画面感的描述,比如"黄昏时分的海岸公路,远处有灯塔,暖色调,胶片质感"。第二个误区是贪多,一段提示词里塞十几个元素,什么都要,结果画面乱成一锅粥。做减法比做加法重要,先把主体和氛围说清楚,其他细节慢慢加。第三个误区是忽视参数,其实几个基础参数就能大幅改变出图效果,这个后面会专门讲。
学习路径我建议按这个顺序来。先用一两周时间熟悉基本指令和出图节奏,每天出几张图,不追求质量,就是找感觉。接下来花时间研究提示词的结构,学会把想法拆解成主体、环境、光线、风格这几个模块。然后开始接触参数,理解每种参数对画面的影响。再往后就是风格控制和系列图生成,这时候你已经能比较稳定地输出自己想要的东西了。整个过程不用急,我见过有人三天就想做出商业级作品,结果挫败感太强直接放弃了。
练习建议这块,我自己的方法是每天定一个小主题,比如"今天只画食物",然后围绕这个主题出十张图,对比不同描述方式带来的差异。还有一个很有效的练习是"复刻练习",找一张你喜欢的图片,尝试用文字描述它,让Midjourney生成类似的东西,再和原图对比,看看自己漏掉了哪些关键信息。另外建议建一个文档,把每次觉得不错的提示词记下来,标注出图效果,积累一个月你就有自己的提示词库了。社区里有大量分享提示词的帖子和频道,多看多试,进步会比我当年瞎摸索快得多。
2.1 /imagine指令详解与标准出图步骤
上一章我们聊到在Discord输入框里敲"/imagine"就能出图,这一节把这条指令彻底拆开讲清楚。"/imagine"是Midjourney里使用频率最高的指令,没有之一。你在输入框打出这七个字符,Discord会自动弹出一个蓝色选项,点进去会出现一个叫"prompt"的输入框。你所有的文字描述,包括主体、环境、风格、参数,全部塞进这个框里,然后按回车。就这一步,看起来简单到不行,但我见过太多新手在这里犯迷糊,把命令和提示词写反了,或者漏掉斜杠导致发送失败。
标准出图步骤我习惯分成五步走。第一步是构思画面,想清楚你要什么,哪怕只是一个大致的氛围也行。第二步是把想法翻译成结构化的英文描述,Midjourney对英文的理解最稳定,中文虽然也支持了,但某些风格的准确度还是英文更高。第三步是加上必要的参数,比如比例和版本号,这部分下一节会展开。第四步是发送指令,等待生成。第五步是处理出图结果,放大、变体或者重来。这五步看起来是线性的,实际操作中经常来回跳,比如出图效果不对,你会回到第一步重新构思,或者回到第二步调整描述。
有个容易被忽略的点:提示词里的标点符号和连接词会影响出图结果。逗号是分隔不同概念,短句之间用逗号隔开,Midjourney会把它们组合起来。有些人喜欢用"and"来连接元素,效果不如逗号直接。另外提示词不宜太长,我试过把一长段故事描述塞进去,出来的画面反而因为信息过载变得很平庸。我的经验是,核心描述控制在三十个英文单词以内,把最重要的信息放在前面,细节补充放在后面。具体怎么组织,第三章会专门讲提示词技巧,这里先记住一个原则:简洁比堆砌有效。
2.2 常用参数:--ar、--v、--q、--stylize、--chaos
参数是加在提示词末尾、以双横线开头的控制指令。它们不影响画面内容,但直接影响画面的比例、质量、风格强度这些底层属性。初学者最容易忽略参数,觉得内容描述好就行了,结果出图总是差那么点意思。我一开始也这样,后来发现同样的提示词加上合适的参数,出图质量有肉眼可见的提升。
--ar控制比例,全称是aspect ratio。默认出图是正方形,也就是1:1。你想做手机壁纸,加上--ar 9:16;想做电影感画面,加上--ar 16:9;想做社交媒体横图,加上--ar 3:2。这个参数特别实用,但要注意比例越极端,画面构图越难控制。我试过--ar 21:9的超宽比例,出图经常出现主体被挤到一边或者裁切奇怪的情况,需要多试几次才能拿到满意的构图。
--v指定模型版本,目前常用的是--v 6和--v 5.2。版本号越高,对提示词的理解越精细,写实能力越强,但某些风格化表达可能不如老版本有味道。我日常出图默认用--v 6,做一些复古插画或者特定氛围的时候会切回--v 5.2。--q控制渲染质量,取值从0.25到2,默认是1。数值越高,生成时间越长,细节越丰富,但大多数场景下默认值就够了。我只有在做需要放大打印的高精度图时才会调到--q 2。
--stylize这个参数容易被低估,它控制Midjourney的"艺术发挥空间",取值从0到1000,默认是100。数值越低,出图越贴近你的字面描述;数值越高,Midjourney越会加入自己的审美判断,画面更有艺术感,但可能偏离你的本意。我做商业项目需要精准还原的时候会把stylize调低到50左右,做个人创作想要惊喜感的时候会调到400以上。--chaos控制四张图的差异化程度,取值0到100,默认是0。数值越高,四张图之间的风格差异越大,适合用来探索不同的视觉方向。想要稳定输出的时候保持默认,想要头脑风暴的时候调到30到50,经常能撞出意想不到的好图。
2.3 放大、变体、重绘与局部修改操作
出图之后,图片下方会出现一排按钮,U1到U4和V1到V4。U代表Upscale,放大。V代表Variation,变体。这四个数字对应四张图从左到右的位置。点击U1,Midjourney会把第一张图单独拿出来放大,生成一张更高分辨率、细节更丰富的版本。点击V1,它会以第一张图为参考,再生成四张相似但不同的变体。我早期特别沉迷按U按钮,觉得放大就是最终成品了,后来发现U之后的图并不是简单地拉高分辨率,它还会重新渲染一些细节,有时候放大后的效果反而不如原图,尤其是人脸和手部区域。
变体按钮是我用得最多的功能。四张预览图里如果有一张构图和氛围都对,但细节差一点,直接点V,让Midjourney在这个方向上继续探索。V出来的四张图会保留原图的主体和构图逻辑,但在光影、配色、纹理上有所变化。我一般会连续做两到三轮变体,逐步逼近想要的效果。这里有个小技巧:变体的时候可以在提示词里补充新的描述,比如原本没写光线,在变体时加上"soft rim light",Midjourney会把新信息融合进去。
局部修改是进阶操作,用的是Vary(Region)功能。点击放大后的图片,左下角会出现"Vary (Region)"按钮,点进去会打开一个选区工具。你可以框选画面中想要修改的部分,然后在弹出的输入框里写新的描述。比如人物穿的衣服颜色不对,框选衣服区域,输入"deep red velvet jacket",Midjourney只会重绘你框选的部分,其他区域保持不变。这个功能我用来修细节特别顺手,比重新生成一张图要高效得多。还有一个叫Zoom Out的功能,可以把画面向外扩展,适合做场景延伸或者调整构图比例。
2.4 图片保存、分类管理与历史作品整理
图片生成之后如果不主动保存,过一段时间就消失在消息流里了。我刚开始用的时候没养成保存习惯,后来想找一张三个月前的图,翻了半天聊天记录,累得够呛。Midjourney的图片保存方式有几种,最直接的是在图片上右键或者长按,选择保存到本地。Discord的网页版和客户端都支持这个操作,手机端也能保存,但画质可能会有压缩。
我现在的做法是建立一套分类文件夹体系。按照项目类型分一级文件夹,比如"商业项目""个人创作""练习图""参考素材";二级文件夹按时间或者主题分,比如"2024-06_产品图""赛博朋克系列"。每次出图之后,把觉得有价值的图立刻拖进对应文件夹,不要拖到以后再说,拖着拖着就忘了。我还会在文件名里加上关键词,比如"cyberpunk_teahouse_v3_lighting_test",方便以后搜索。这个习惯看起来麻烦,但积累几百张图之后,找图的效率差距就很明显了。
Midjourney自己也有一个网页端的作品库,在官网登录后可以查看所有生成过的图片。它支持按时间筛选,也能看到每张图对应的提示词和参数,这个功能很实用,方便你回溯某张图是怎么做出来的。我有时候会把喜欢的提示词复制出来,稍微改几个词再生成新图,省去重新构思的时间。另外Discord的服务器里有很多分享频道,别人生成的图你也能看到提示词,遇到喜欢的风格直接参考,比闭门造车进步快得多。归档整理这件事,花的是现在的十分钟,省的是未来的十小时,我踩过不整理的坑,所以真心建议从第一张图就开始做。
3.1 提示词核心结构:主体、环境、构图、光线、风格与参数
我学提示词的过程特别像学做菜。一开始只知道把食材扔进锅里,熟了就行,后来才慢慢理解为什么有的菜要大火爆炒,有的要小火慢炖。写Prompt也是这个道理,你光知道把想要的画面描述出来远远不够,真正决定出图质量的,是你怎么组织这些描述的顺序和结构。
我自己总结出来一套万能的提示词框架,基本上能覆盖百分之八十的出图场景。核心结构就是六个板块:主体、环境、构图、光线、风格、参数。主体是你画面里最重要的东西,一个人、一只猫、一栋建筑,必须放在最前面。环境是主体所在的场景,是森林还是咖啡馆,是雨天还是黄昏。构图决定了画面怎么安排,特写还是全景,从下往上拍还是俯视。光线是最容易被新手忽略但效果最猛的一环,柔光、逆光、轮廓光、霓虹灯,不同的光直接改变画面的情绪。风格这块可以写摄影风格、插画风格、艺术家名字或者具体的视觉参考。参数放在最后,就是我们上一章聊的那些--ar、--v之类的控制指令。
拿一个具体例子来说。我想要一张“一只白猫坐在窗台上”。初级写法就是“a white cat on a windowsill”,出来的图大概率很普通。套用结构之后我会这样写:“a fluffy white cat sitting on a wooden windowsill, overlooking a rainy city street at dusk, medium shot from slightly below, soft warm interior light mixed with cool blue exterior light, cinematic photography style, shallow depth of field --ar 3:2 --v 6”。你看,同样的主体,加上了环境、构图、光线、风格和参数之后,画面的信息密度完全不一样了。我并不是每一次都要写全六个板块,赶时间的时候会省略构图或者风格,但主体加光线这两个我基本不会省,因为它们对最终效果的影响最大。
还有一个心得是顺序真的会影响出图。Midjourney对提示词开头的内容赋予更高的注意力,所以主体一定要放最前面。我之前试过把风格描述放在前面,结果出来的图风格感特别强,但主体变得很模糊,甚至被风格吃掉了。后来我把主体提到最前,风格移到后面,画面就平衡多了。这个细节很少有人讲,但你试几次就能明显感受到差别。
3.2 关键词权重、否定表达与组合语法
写提示词写到一定阶段,你会发现有些词就是不起作用。你明明写了“red dress”,出图里的人物还是穿着蓝衣服。这种情况不是Midjourney没听懂,而是你没有给它足够的权重信号。关键词权重这个东西,我摸索了很久才搞明白。
给关键词加权重的方法是在词后面加上双冒号和数字,比如“red dress::2”表示这个词的权重是两倍。默认权重是1。你可以把某个词调到0.5让它变弱,也可以调到3甚至更高让它变得非常强势。我做过一个实验,同样的提示词,把“golden hour lighting”的权重从1调到2.5,出图的光线氛围直接上了一个档次。权重也可以用在多个元素的平衡上,比如画面里同时有人和建筑,你觉得建筑太抢戏了,就把人物的权重调高一点,或者把建筑的权重降到0.8。
否定表达用的是--no参数。比如你出图总是出现多余的手指或者不想要的文字,可以在提示词末尾加上--no text, extra fingers。这个参数相当于告诉Midjourney“这些东西不要出现在画面里”。我经常用--no来排除一些高频干扰项,比如“--no watermark, signature, blurry”。不过要注意,--no不是万能的,它只是降低某些元素出现的概率,并不能百分百保证。我试过用--no trees来生成一片空旷的草原,结果四张图里还是有两张冒出了树。后来我换了个思路,直接在正面描述里强调“vast open field with no vegetation”,效果反而更好。否定表达和正面描述配合使用,比单纯依赖--no靠谱得多。
组合语法这块,Midjourney支持用双冒号来混合多个概念。比如你想把“水”和“火”两种元素融合在一张图里,写成“water::fire”会让Midjourney尝试把两个概念交织在一起,出来的效果比直接写“water and fire”要更融合、更有层次。还有一种是权重递减的组合,比如“portrait::2 landscape::1”,画面会以portrait为主,landscape为辅。这个技巧在做混合风格的时候特别好用,比如“cyberpunk::1.5 art nouveau::1”,出来的图既有赛博朋克的冷峻,又带一点新艺术的曲线美感。我建议你在掌握基础写法之后,专门花一两天时间玩一下权重和组合语法,不用追求出好图,就是感受一下这些符号对画面的影响,玩多了自然就有手感了。
3.3 参考图、垫图与风格迁移技巧
文字描述有它的天花板。有些画面你心里很清楚要什么感觉,但用文字怎么都描述不到位。这种时候参考图就是救命稻草。Midjourney支持在提示词里附带图片链接,让AI参考这张图的风格、构图或者色彩来生成新图。这个功能用好了,出图效率和质量都是质的飞跃。
垫图的基本操作是把图片链接贴在提示词最前面,后面跟上文字描述。图片链接需要是公开可访问的URL,你可以把图先发到Discord的某个频道里,右键复制链接。我通常会把参考图的权重也标上,比如“https://图片链接.jpg::2 a futuristic cityscape --ar 16:9”,这里的::2表示这张参考图对画面的影响权重是两倍。如果不加权重,默认参考图的影响会偏弱,有时候几乎看不出来。垫图最适合的场景是你有一张喜欢的摄影作品或者插画,想用同样的色调和氛围来创作一张新内容的图。我做过一组实验,用同一张莫奈的睡莲做垫图,分别生成“森林”“城市”“人物”三个主题,出来的图都带着那种柔和的印象派笔触和水面反光的感觉,风格迁移的效果非常明显。
风格迁移还有一个进阶玩法叫“风格参考”,用的是--sref参数。这个参数是v6版本之后推出的,专门用来提取参考图的风格而不影响构图和内容。你写“a castle on a hill --sref https://某张图的链接”,Midjourney会分析那张图的色彩、笔触、质感,然后把这个风格套用到你的城堡上。我用--sref做过一系列统一风格的产品图,把一张水彩画的风格迁移到不同的产品上,出来的图风格高度一致,省去了大量调提示词的时间。--sref还可以和--sw参数搭配使用,--sw控制风格强度,取值0到1000,默认是100。想要风格强烈一点就调高,想要隐约带一点就调低。
还有一个容易被忽略的功能是“角色参考”,参数是--cref。这个功能可以保持同一个角色在不同场景里的一致性。比如你生成了一张满意的人物图,想让她出现在不同的环境里,就可以用--cref把那张图作为角色参考,加上新的场景描述,Midjourney会尽量保持角色的面部特征和服装风格不变。我做系列插画的时候特别依赖这个功能,不然每一张图的人物都长得不一样,系列感就没了。--cref也可以配合--cw参数使用,--cw控制角色参考的强度,默认100,调到0的话只参考面部,不参考服装。这些参数看起来多,但用起来其实很直观,试两三次就能记住。
3.4 提示词迭代优化方法与案例拆解
我刚开始写提示词的时候特别迷信“一次到位”,总觉得好的提示词就应该一次出好图。后来被现实打脸打多了才明白,高质量Prompt是迭代出来的,不是憋出来的。迭代优化的核心逻辑是:先出图,再看图,然后改词。每一轮迭代只改一两个变量,这样才能搞清楚到底是哪个词在起作用。
我拿一个真实的案例来拆解。有一次我想做一张“老人在茶馆里喝茶”的图。第一版提示词写得很简单:“an old man drinking tea in a teahouse”。出来的四张图构图还行,但光线很平,氛围感不够。第二版我加了光线和氛围描述:“an old man drinking tea in a traditional Chinese teahouse, warm afternoon sunlight streaming through wooden lattice windows, steam rising from the teacup, cinematic photography --ar 4:3 --v 6”。这一版的光影明显好了很多,但老人的表情太呆板,没有故事感。第三版我在主体描述里加了情绪词:“an old man with a gentle nostalgic smile, drinking tea in a traditional Chinese teahouse...”,并且把构图从“medium shot”改成了“close-up”。这一版的表情出来了,氛围也对了,但背景里的茶具太杂乱。第四版我加上了--no clutter, plastic items,同时把“wooden table”写进环境描述里,让画面焦点更集中。四轮迭代下来,最终出图的质量比第一版提升了不知道多少倍。
这个案例里我用到的迭代方法有几个关键点。第一,每轮只改一个方向,不要同时改光线又改构图又改风格,否则你不知道是哪个改动起了作用。第二,保留上一版的有效内容,只替换无效的部分。我习惯把每一版的提示词都记在备忘录里,改的时候直接复制上一版然后动刀。第三,学会看四宫格里的差异。Midjourney一次出四张图,有时候其中一张的某个细节特别好,但整体不行。这时候不要直接重来,可以点V做变体,或者用局部修改把好的细节保留下来。第四,多去Midjourney的社区频道看别人的提示词。我经常在“showcase”频道里翻别人的图,看到喜欢的就点开看提示词,把好的表达方式记下来,下次自己用。这个习惯让我学得特别快,因为你能直接看到“什么样的词对应什么样的画面”,比看教程要直观一百倍。
最后说一个我踩过的坑。有一段时间我特别执着于把提示词写得特别长,觉得信息越多画面越丰富。结果发现超过一定长度之后,后面的描述会被Midjourney忽略,或者说它的注意力被稀释了,画面反而变得没有重点。后来我给自己定了一个规矩:核心描述不超过四十个英文单词。把最重要的信息压缩在前二十个词里面,剩下的用来补充细节。删减的过程其实是在帮你想清楚到底什么最重要。一张好图不需要面面俱到,它只需要把一个点做到极致。
4.1 摄影写实、电影感与商业产品图
我刚开始用Midjourney做摄影写实图的时候,总觉得差了点什么。画面干净是干净,可就是像AI画的,没有真实照片那种质感。后来我花了一个周末专门研究摄影类提示词,发现关键是把相机参数和光学特性写进去。比如“shot on Hasselblad X1D, 90mm f/3.2, natural light, skin texture detail”这种描述,出图的皮肤毛孔和光影过渡立刻上了一个台阶。我还喜欢加“Kodak Portra 400”或者“Fujifilm Superia”这类胶片模拟词,色彩会带一点复古的温润感。拍人像的时候,我会把光圈值写小一点,f/1.4到f/2.0之间,背景虚化效果特别自然。棚拍产品图又是另一套逻辑,得强调“studio lighting, softbox, seamless background”,让画面干净到能直接抠图。
电影感这块我踩过不少坑。一开始以为加个“cinematic”就行了,出来的图还是平平无奇。后来看了一些电影摄影的解析,才明白电影感来自宽画幅、戏剧性光线和色彩分级。我现在做电影感图会固定用--ar 21:9或者--ar 2.35:1,然后加上“anamorphic lens flare, teal and orange color grading, volumetric lighting”。有一次我想生成一张雨夜追逐的镜头,提示词写了“a detective running through a neon-lit alley, heavy rain, reflections on wet asphalt, shot on Arri Alexa, cinematic lighting, shallow depth of field --ar 21:9 --v 6”。出图那张四宫格里有一张简直像电影截图,雨丝和霓虹反光都特别真实。我后来把那张图发到朋友圈,好几个人问我是哪部电影的剧照。
商业产品图是我接单最多的类型。客户要的是产品清晰、背景干净、有品牌调性。我一般会先用“product photography”打底,然后根据产品类型调整。比如化妆品要加“macro shot, dewdrop texture, pastel background”,电子产品要加“matte black surface, minimal reflection, dramatic rim light”。我印象最深的一次是给一个手工皮具品牌做图,客户要求体现皮革的纹理和手缝线的细节。我用了“close-up of a hand-stitched leather wallet, warm sunlight from side, visible grain and stitching, shot on Canon EOS R5, 100mm macro lens --ar 4:5”。出图之后客户特别满意,说比他们自己拍的照片还有质感。做商业图有个小技巧,把--style raw加上,画面会少一些Midjourney默认的“美化滤镜”,更接近真实摄影。
4.2 插画、动漫、游戏概念设计
插画风格的范围太广了,水彩、油画、扁平、厚涂、复古印刷,每一种都有不同的提示词套路。我最早做插画的时候只会写“illustration”,出来的图千篇一律。后来我开始用--sref去参考喜欢的插画师作品,风格一下子就打开了。比如我想要那种带有颗粒感的复古儿童绘本风,就找一张经典绘本的图做风格参考,然后写“a little fox reading a book under a tree --sref [图片链接] --sw 600”。出来的图色彩柔和,笔触带着纸张纹理,特别有味道。我还试过用同一张水彩画做--sref,生成不同主题的插画,从森林动物到城市街景,风格统一得像是同一位插画师画的。
动漫风格我基本上离不开Niji模型。--niji 6对二次元角色的面部和动态处理得比默认模型好太多。做动漫图的时候,我会把角色特征写得特别细,比如“a girl with long silver hair, heterochromia eyes, wearing a sailor uniform, dynamic pose, wind blowing, cherry blossoms falling”。想要那种赛璐璐平涂效果,就加“cel shading, clean lineart, vibrant colors”。我做过一组魔法少女题材的图,用了--niji 6 --style expressive,角色的表情和动作都特别生动,衣服褶皱和头发丝也很有动画感。如果你做动漫风格总是觉得脸部崩坏,可以试试把--cref加上,用一张满意的角色图作为参考,面部一致性会好很多。
游戏概念设计是我最近在练习的方向。这个概念要求画面有世界观、有故事感、有设计细节。我通常会拆成角色、场景、道具三个方向来做。角色概念设计我会写“character concept art, full body, front view, back view, side view, detailed armor design, fantasy style, trending on ArtStation”。场景设计我会加“matte painting, epic scale, atmospheric perspective, concept art by [某位概念艺术家名字]”。道具设计比较简单,重点是把材质和功能描述清楚,比如“a magical sword with a glowing rune blade, leather-wrapped handle, detailed hilt, isolated on white background”。我做过一个蒸汽朋克飞空艇的概念图,提示词里写了“steampunk airship, brass and copper materials, multiple propellers, Victorian aesthetic, concept art, detailed mechanical parts --ar 16:9”。出图之后我用--v做了几张变体,挑了一张细节最丰富的,后来成了我作品集里的封面。
4.3 建筑、室内、平面与品牌视觉
建筑表现图对精确度要求很高。Midjourney不是CAD软件,它没法保证尺寸完全准确,但在氛围和材质表现上有独特优势。我做建筑图的时候会写“architectural visualization, exterior shot, modern minimalist house, concrete and glass, sunset lighting, reflective pool, V-Ray render, ultra detailed”。这里面的“V-Ray render”是个关键词,加上之后画面会带有那种专业渲染图的干净和真实感。构图我会用“two-point perspective”或者“aerial view”,视角不同,建筑的气势完全不一样。有一次我帮朋友做民宿的宣传图,用了“a cozy cabin in the mountains, large windows, warm interior light, snow falling, architectural photography --ar 3:2”。那张图后来被朋友直接印成了明信片。
室内设计图的重点在氛围和家具搭配。我一般会先确定风格,北欧风写“Scandinavian style, light wood, white walls, cozy textiles”,工业风写“industrial style, exposed brick, metal fixtures, leather sofa”。光线方面,我会根据时间段来描述,“morning sunlight streaming through sheer curtains”或者“warm evening light from floor lamp”。我做过一个咖啡馆的室内概念图,提示词是“interior of a cozy coffee shop, rustic wooden tables, hanging Edison bulbs, plants on shelves, customers reading, warm atmosphere --ar 16:9”。出图后我发现吧台的位置不太对,就用局部重绘把吧台区域重新生成了一下,改成了我想要的样子。室内图有个小技巧,加“wide angle lens”会让空间显得更开阔,加“35mm”则更接近人眼视角,比较自然。
平面和品牌视觉这块,Midjourney能做的事情比很多人想象的多。我经常用它来做品牌情绪板、包装概念图和海报草稿。做Logo概念的时候,提示词要简洁有力,比如“minimalist logo for a coffee brand, a steaming cup forming a mountain shape, flat vector, monochrome --no text”。注意这里用了--no text,因为Midjourney生成的文字经常是乱码,不如后期自己加。包装设计我会写“product packaging design, kraft paper box, botanical illustration, earthy color palette, mockup style”。品牌视觉系统我通常会生成一组图,用相同的--sref和配色描述来保持统一。有一次我帮一个手作品牌做视觉提案,用“warm terracotta and sage green, hand-drawn textures, organic shapes”作为统一风格词,生成了名片、包装、社交媒体模板一系列图,客户看完直接定了方向。平面设计里还有一个好用的参数是--style raw,它能让画面更干净、更接近矢量图的利落感。
4.4 风格一致性控制与系列图生成
风格一致性是做系列作品的生命线。你想想看,一本绘本如果每一页的画风都不一样,读者会立刻出戏。我做系列图的第一步永远是确定一张“风格锚图”。这张图不需要多完美,但它必须代表整个系列的色彩、笔触、光线和质感。有了这张锚图之后,我会用--sref把它作为风格参考,后面的每一张图都带上这个参数。同时我会固定一个--seed值,这样即使提示词有变化,画面底层的一些随机特征也会保持一致。我做过一套二十四节气的插画系列,就是靠一张立春的图做锚图,然后用--sref加--seed 12345生成了后面二十三张,整体风格统一得像是同一支笔画的。
角色一致性用--cref特别管用。我做系列漫画的时候,主角的脸型和服装必须每一张都一样。操作流程是先生成一张满意的角色设定图,然后每次生成新场景时把这张图作为--cref参考,再加上--cw 80左右的控制强度。这样角色的面部特征和服装风格基本不会跑偏。如果只想要面部一致,服装可以换,就把--cw调到20或者30。我试过用同一个角色生成“在图书馆”“在雨中奔跑”“在吃拉面”三个场景,--cref让角色的五官保持了高度一致,观众一看就知道是同一个人。这个功能对于做IP形象、绘本主角、游戏角色来说简直是神器。
系列图生成还有一个笨办法但特别有效:建立自己的提示词模板。我会把系列图的提示词拆成固定部分和可变部分。固定部分包括风格描述、光线、构图、参数,可变部分只有主体和动作。比如做一套“猫咪职业”系列,模板是“a cute cat [职业描述], wearing [服装], in [场景], soft watercolor style, warm pastel colors, gentle lighting --ar 1:1 --sref [锚图链接] --seed 888”。然后我把职业描述依次换成“doctor”“chef”“astronaut”“teacher”,一次生成四张,风格完全统一。这个方法做出来的系列图,无论是发社交媒体还是做产品周边,视觉上都有很强的整体感。我建议你每次做系列图的时候都建一个文件夹,把锚图、提示词模板、种子值都存进去,下次想扩展系列的时候直接调用,效率高得惊人。
5.1 不同模型版本差异与选择策略
我最早用Midjourney的时候,根本没在意过版本这回事。默认给我什么就用什么。直到有一次做一张产品图,怎么调提示词都感觉画面蒙着一层灰,后来在社群里看到别人说--v 6在材质和光影上进步很大,我才试着加了版本参数。那一版出图确实透亮了不少,金属反射和皮肤纹理都更扎实。从那以后我养成了一个习惯:每次开新项目之前,先花十分钟快速对比一下当前可用的版本。--v 5.2和--v 6的差别挺有意思。5.2更偏艺术化,画面有一种柔和的绘画感,做概念设定或者情绪板特别合适。6.0往写实方向走了很多,对复杂提示词的理解更准,文字生成也像样了一些。我接商业摄影类需求的时候基本锁死--v 6,偶尔需要那种梦幻的、不太真实的氛围,会切回5.2。
--style raw这个参数值得单独聊。它和版本搭配使用,能去掉Midjourney默认的一些“美化滤镜”。我做过一组手工皂的产品图,默认风格下画面总是太完美,像塑料模型。加上--style raw --v 6之后,皂体表面的小气孔、不均匀的颜色过渡都出来了,客户看了直接说“对,就是这个感觉”。我现在的选择策略大概是这样的:写实摄影和商业图用--v 6 --style raw,插画和艺术创作看情况用--v 5.2或者--v 6,动漫风格固定交给Niji模型。版本更新挺快的,我每个月会抽时间看看官方文档里的更新日志,有新版本就找一张旧图重新生成一次,对比一下差异。这种小实验花不了多少时间,但能让你对工具的脾气摸得更透。
5.2 Niji模型与动漫风格专项应用
Niji模型是我做二次元内容的绝对主力。--niji 6和默认的--v 6放在一起对比,差别一眼就能看出来。默认模型画动漫角色,脸容易偏写实,眼睛比例不太对,线条也偏软。Niji 6一上手,那种日式动画的利落线条和赛璐璐平涂感就出来了。我做过一个魔法少女的系列图,提示词写“a magical girl with twin tails, holding a star wand, dynamic pose, sparkling background, cel shading, clean lineart --niji 6 --style expressive”。出图里角色的头发丝根根分明,衣服褶皱的阴影是硬边的,特别像动画截图。--style expressive让表情更生动,--style cute则更偏向萌系,--style scenic适合做背景和场景。这三个风格参数我经常根据画面需求切换。
Niji模型对日式元素的理解也更深。我试过写“a samurai standing in a bamboo forest, morning mist, ukiyo-e influence”,Niji 6给出的画面里,武士的铠甲细节和竹林的构图都带着浮世绘的韵味。默认模型出来的就只是个拿刀的人站在竹林里。做漫画分镜的时候,我会用Niji生成多个角度的角色图,再结合--cref保持面部一致。操作流程是先生成一张满意的角色设定,然后每次加--cref [图片链接] --cw 80,角色换姿势、换服装都不会跑脸。有一次我做一组校园题材的四格漫画,主角从教室到操场到食堂,五张图的脸型完全一致,读者根本看不出是AI生成的。Niji 6对英文提示词响应最好,写日文罗马音或者英文描述都行,中文提示词有时候会打折扣。
5.3 与Photoshop、Stable Diffusion、Canva等工具联动
Midjourney出图再好看,直接拿去用往往还差最后一步。我的工作流里,Photoshop是后期精修的主力。比如生成一张产品图,背景可能有一点点不想要的杂物,或者产品边缘不够干净。我会把图导入PS,用生成式填充或者修补工具处理掉。PS的Camera Raw滤镜用来调色也特别顺手,Midjourney出图的色彩有时候偏饱和,在Camera Raw里拉一下曲线就舒服了。我印象很深的一次是给一个咖啡品牌做包装概念图,Midjourney生成的麻袋纹理很棒,但上面的商标位置不对。我在PS里把商标区域抠出来,重新用生成式填充补了一块干净的麻布纹理,再把设计好的Logo贴上去,整个过程不到二十分钟。
Stable Diffusion在我的工作流里扮演的是“控制狂”角色。Midjourney擅长发散和创意,SD擅长精确控制。我经常把Midjourney生成的图丢进SD,用ControlNet的Canny或者Depth模型锁定构图,然后换一个风格模型重新生成。这样做出来的图既有Midjourney的构图美感,又有SD的精细控制。SD的img2img放大也比Midjourney自带的放大更可控,可以分块重绘细节。Canva则是我做社交媒体图和品牌提案时的排版工具。Midjourney生成底图,PS修好,拖进Canva加文字、加Logo、调整尺寸。Canva的模板库很丰富,做小红书封面、公众号头图、产品海报都很快。我一般会建一个项目文件夹,把MJ原图、PS修好的图、Canva排版文件按顺序存好,下次改版直接调用。这套联动流程跑顺了之后,我从接到需求到交付第一版方案,时间能压缩到两三个小时。
5.4 商业项目中的版权、伦理与合规注意
接商业单子的时候,版权问题是我最先跟客户确认的事情。Midjourney的订阅条款里写了,付费用户拥有生成图片的使用权,但AI生成内容的版权在法律上还是个模糊地带。不同国家的规定不一样,美国版权局目前只保护有人类作者实质性贡献的部分。我一般会跟客户说明:这张图是用AI工具辅助生成的,我们可以把它用在这个项目里,但如果你需要独家版权或者要注册版权,可能需要找律师确认一下。我还会保留每次生成的提示词、参数和原始四宫格截图,万一以后有争议,这些记录能证明创作过程。客户如果特别在意版权,我会建议在Midjourney出图的基础上,用PS做足够多的后期修改,让最终成品带有人类创作的显著痕迹。
伦理这块我踩过一次坑。早期我模仿过一位在世插画师的风格,用他的名字作为提示词的一部分,生成了一组商业插画。后来意识到这样做不太妥当,虽然风格本身不受版权保护,但直接关联到具体艺术家名字用于商业项目,容易引起误会甚至法律风险。现在我写提示词会尽量用描述性语言,比如“loose watercolor style with visible paper texture”代替“in the style of [某位艺术家]”。生成人物的时候,我会避免写真实名人的名字或者高度可识别的特征。Midjourney对名人肖像有过滤机制,但有时候会漏。合规方面,我会仔细看Midjourney的社区准则,不生成暴力、色情、仇恨言论相关的内容。商业项目里如果涉及品牌Logo或者受版权保护的角色,我会用--no参数排除掉,或者后期在PS里重新设计。给客户做提案的时候,我也会主动提醒他们:AI生成的图最好作为概念参考或者辅助素材,最终成品建议经过设计师的二次创作和版权确认。这样做虽然多花一点沟通时间,但能避免后面更大的麻烦。
6.1 新手练习计划与每日Prompt训练
我刚开始学Midjourney那阵子,每天像打卡一样逼自己出十张图。早上起来先花二十分钟写五个提示词,主题随机定,有时候是“一只戴眼镜的猫在图书馆”,有时候是“雨夜里的霓虹灯招牌”。不追求每张都好看,重点是把脑子里的画面翻译成英文关键词。这个阶段持续了大概三周,慢慢就摸清了哪些词有用、哪些词纯属废话。我建议你也给自己定个量,每天五到十张,别贪多,关键是坚持。周末可以抽一小时复盘,把一周里满意的图挑出来,看看它们的提示词有什么共同点。
光傻练也不行,得带着目标练。我后来给自己设计了一个“主题周”计划:第一周只练光影,第二周只练材质,第三周专攻构图。比如练光影的时候,我会固定主体不变,只替换光线描述词——soft morning light、harsh noon sun、golden hour glow、moody rim light。同一只杯子生成十几张,对比不同光线下的质感变化。这种训练比漫无目的地抽卡高效得多。我还专门建了一个Excel表格,记录每次实验的提示词、参数和结果截图。时间久了,这个表格就成了我自己的提示词词典,接项目的时候直接翻记录,比重新试错快很多。
每日训练还有个好处是培养“画面感”。以前我看到一个场景,脑子里只有模糊的印象。现在会下意识拆解:主体是什么、环境什么色调、镜头是近景还是广角、光线从哪来。这种思维习惯一旦养成,写提示词就像说话一样自然。我有个朋友更狠,他每天通勤路上用手机备忘录写十个提示词,晚上回家一次性生成,只留最好的那张发朋友圈。三个月下来,他的出图质量已经能接一些小商单了。练习量到了,手感自然来,这事儿没有捷径。
6.2 常见报错、封禁风险与账号安全
用Midjourney久了,谁都会遇到几次报错。最常见的是“Job failed”或者“The prompt was blocked”。前者通常是服务器忙或者网络波动,重试一两次就好。后者就值得注意了——你的提示词里可能包含了敏感词。我有次写“a child holding a balloon”,被拦了,后来改成“a young person holding a balloon”就通过了。Midjourney对涉及暴力、色情、未成年人、名人肖像的词汇特别敏感,有时候你完全没那个意思,但某个词组合起来就触发了过滤器。我的经验是,遇到封禁提示先别急着改参数,把提示词拆开逐段测试,找到那个触发词,换个说法就行。
封禁风险这块我踩过坑。早期图省事,跟几个人合租了一个账号,结果其中一位大哥疯狂生成擦边内容,整个账号被永久封了。申诉没用,钱也退不回来。从那以后我只用自己的独立订阅,并且开了两步验证。共享账号、频繁切换IP、用VPN跳来跳去,这些行为在Midjourney看来都很可疑。官方虽然不禁止VPN,但如果你今天美国IP、明天日本IP、后天又变成德国IP,系统容易判定账号异常。我现在固定用同一个地区的节点,不随便换。另外别在公共电脑上登录,也别把账号密码发给别人。账号就像自己的信用卡,丢了比丢钱还麻烦。
还有一种情况是“Shadow ban”,就是账号没被封,但你的图别人看不到,只有自己能看到。这种通常是因为你连续多次触发社区准则。我有个做恐怖题材的朋友,经常生成一些血腥画面,后来就被限流了。他花了两个月正常出图才恢复。所以别挑战底线,Midjourney的社区准则写得很清楚,什么能碰什么不能碰。生成人物的时候,避免直接写真实名人的名字,用“a middle-aged man with a beard”代替“Brad Pitt”。商业项目里更要注意,别让AI生成受版权保护的卡通角色,哪怕只是局部相似,也有风险。
6.3 作品集整理、发布平台与展示技巧
我的作品集文件夹经历过三次大改版。最早是乱丢一气,所有图都堆在下载文件夹里。后来按日期分,但找起来还是费劲。现在我用的是“项目-风格-日期”三级结构。比如“咖啡品牌概念图/产品写实/2024-03”。每个项目文件夹里放三样东西:原始四宫格截图、最终选定的高清图、一个txt文档记录完整提示词和参数。这样做的好处是,任何时候客户问“这张图怎么生成的”,我能立刻调出记录。文件名我习惯用“项目名_版本号_日期”的格式,比如“coffee_bag_v3_20240315”。看着有点强迫症,但找文件的时候省下不少时间。
发布平台我试过不少。Behance和ArtStation适合放完整项目,能写长文描述创作思路,专业度最高。小红书和Instagram更适合发单图或系列图,配上一两句有趣的文案,互动量更大。我一般会把同一组图剪成两个版本:一个横版长图发Behance,一个竖版九宫格发小红书。发布的时候别只丢图,把提示词也贴出来。很多人对AI绘画好奇,你愿意分享过程,大家反而更尊重你的创作。我还会把迭代过程中的废稿也放一两张,展示从失败到成功的过程,读者觉得真实,点赞收藏都更多。
展示技巧方面,做系列图比单张图有效得多。我做过一组“城市角落的咖啡店”系列,六张图统一风格、统一色调,放在一起像一本小杂志。发布时加上统一的话题标签,比如#AI咖啡店设计 #Midjourney商业应用。评论区有人问参数,我会挑几个典型回答,顺便引导他们关注。还有个小心得:给作品写一个简短的故事。比如“这张图是我为一个虚构的北海道牛奶品牌做的包装概念,想传达清晨牧场的感觉”。故事比技术参数更容易打动人。作品集不只是展示技术,更是展示你的审美和思考方式。
6.4 持续学习资源、社区参与与进阶方向
我的日常学习资源主要有三个。Midjourney官方文档是必看的,每次版本更新我都会花半小时读更新日志,了解新参数和新模型的变化。YouTube上几个专注AI绘画的频道我也常刷,比如“Midjourney快速技巧”或者“提示词工程实战”,视频比文字直观,看别人操作一遍比自己摸索快很多。Discord上的Midjourney官方服务器是我每天必逛的地方,里面有个“showcase”频道,各种大神发图,看到喜欢的就点进去看提示词。这比任何教程都直接。我还关注了几个专门分享AI绘画新闻的推特账号,有新工具出来第一时间知道。
社区参与这件事,我觉得不能只当潜水员。我刚开始也是默默看图,后来试着参加每周的主题挑战,比如“赛博朋克城市”或者“童话森林”。第一次参加没入围,但收到几条有用的评论,告诉我构图太满、色彩太杂。第二次调整后拿了鼓励奖,那种被认可的感觉特别激励人。现在我会定期在社群里回答新手问题,帮别人看提示词。教别人的过程其实也是在巩固自己的知识。有次一个小伙伴问我为什么他的图总是模糊,我一看参数用了--q 0.5,改成--q 2就清晰了。这种小问题你答多了,自己也不会再犯。
进阶方向我琢磨了很久。Midjourney出图再强,它也只是工作流的一环。我现在的规划是两条腿走路:一条是纵向深挖,专攻一个垂直领域,比如产品可视化或者角色设计,把Midjourney和Photoshop、Stable Diffusion的配合练到极致。另一条是横向拓展,学一点3D建模和动效,把静态图变成动态视频。Midjourney最近更新了视频功能,虽然还比较初级,但趋势很明显。我每周会抽两个晚上学Blender基础,不求精通,至少能理解三维空间的光影逻辑。AI工具迭代太快,今天的热门功能明天可能就过时了。保持学习习惯,比掌握某个具体工具更重要。我现在每天还会写至少三个提示词,哪怕不生成图,只是练手。这个习惯大概会一直保持下去。
评论
发表评论