1.1 AI视频的定义、生成原理与常见成品类型
我第一次接触AI视频的时候,脑子里冒出来的画面是科幻电影里那种机器人剪辑师。真正用下来才发现,它更像一个特别听话但偶尔犯迷糊的实习生。AI视频说白了,就是你给机器一段文字、一张图或者一段音频,它通过算法帮你生成动态画面。生成原理这块不用钻太深,大概知道它是靠扩散模型和时序网络配合工作就行。扩散模型负责理解你的描述,时序网络负责让画面动起来不跳帧。我一般跟朋友解释就说,像你脑子里想一个画面,AI帮你画出来还让它动,只是它画得好不好取决于你说得清不清楚。
常见的成品类型分这么几种。一种是纯文生视频,你打字描述场景,出来就是一段几秒到十几秒的短片。第二种是图生视频,你给一张静态照片,AI让里面的人物眨眼、风吹头发、背景水流。第三种是数字人视频,你写一段口播稿,选个虚拟形象,它帮你念出来还带口型。还有一种是AI剪辑,你丢一堆素材进去,它帮你粗剪、配乐、加字幕。我都试过,每种上手难度不一样。
刚开始别贪多,选一种类型玩熟再说。我自己是从图生视频入手的,因为控制感强,翻车了也知道问题出在哪儿。
1.2 零基础学习AI视频的路径、设备与软件准备
零基础学这个,最怕一上来就报几千块的课。我走过弯路,后来发现路径其实很简单。先花两天把主流工具注册一遍,每个都点一遍界面按钮,别怕点错。然后挑一个工具,模仿别人的成品做三条视频,哪怕一模一样也没关系。三条之后你自然知道每个参数是干嘛的。再往后就是自己写提示词,反复调,反复看结果。我认识一个做早餐店短视频的老板,他就用手机加一个免费工具,每天发一条,两个月下来比专业团队做得还自然。
设备方面,一台能上网的电脑或者手机就够了。电脑的话,显卡好一点生成速度快,但这不是门槛,我见过用轻薄本一样出片的。软件准备分两块:生成工具和剪辑工具。生成工具像Runway、Pika、可灵这些,挑一两个顺手的。剪辑工具用剪映或者CapCut就行,免费功能足够。我一开始用PR,后来发现剪映的自动字幕和AI配乐太省事了,现在基本只用剪映。
还有一点容易被忽略,就是素材库。平时看到好的图片、音乐、音效随手存下来,分类放好。等你开始做视频的时候,素材库就是你的弹药库。我手机里专门有个相册叫“AI素材”,攒了快两千张图,做视频的时候翻一翻就有灵感。
1.3 AI视频制作与传统视频制作的差异及适用场景
传统视频制作我干过几年,一个三分钟的产品片,策划、拍摄、剪辑、调色、配音,少说两周。AI视频把中间环节压缩了,你不需要摄像师、不需要灯光师、不需要租棚。我上个月帮朋友做一条咖啡店宣传片,从写脚本到成片输出,四个小时。画面质感肯定比不上实拍,但发朋友圈和小红书完全够用。最大的差异是试错成本。传统拍摄你拍废一条镜头,时间场地人工全浪费。AI视频你生成一条不满意,删掉重来,只花几秒。
适用场景这块,我分三类说。第一类是口播和知识科普,数字人帮你念稿子,省了化妆打光背台词。第二类是产品展示和广告,特别是那些实拍不好拍的场景,比如微观世界、未来城市、抽象概念。第三类是个人表达,老照片动起来、音乐MV、图文转视频,这些用AI做比传统方式便宜太多。反过来说,需要真实人物情感、复杂动作交互、精确产品细节的片子,目前AI还接不住。我自己的判断标准是:如果这个视频的核心是“信息传递”,AI够用;如果核心是“情绪共鸣”,传统拍摄更稳。但边界在变,每个月都有新工具打破我的判断。
2.1 文生视频、图生视频、数字人与AI剪辑工具分类
我一开始把所有AI视频工具都当成一类东西,用着用着才咂摸出味道来。它们其实分成四个门派,每个门派的脾气完全不一样。文生视频是最像“许愿”的那种,你打一段字,它给你一段画面。Runway、Pika、可灵、Sora都算这个门派。图生视频更像是“让照片活过来”,你给一张图,它负责让里头的东西动。数字人工具是另一个路子,你写稿子,它让虚拟人张嘴说话,HeyGen、D-ID、剪映的数字人功能我都用过。AI剪辑工具最接地气,你丢素材进去,它帮你粗剪、配字幕、加音乐,剪映、CapCut、Descript都算。
我自己最常用的是图生视频,因为可控。文字描述再细,AI理解出来总有些偏差。给一张图,至少构图和主体是确定的,我只需要控制运动方式。数字人我主要用来做口播类内容,省了化妆、打光、背稿子。AI剪辑我用得最少,因为我的素材量不够大,自动剪辑的优势发挥不出来。有个做美食账号的朋友天天用AI剪辑,他把拍摄素材丢进去,十分钟出一条,效率高得吓人。
选工具这件事,我的建议是别贪。每个门派挑一个顺手的,先用透。我见过有人同时开五个工具,结果哪个都只摸了个皮毛,出片质量一直上不去。我自己的组合是:可灵做文生视频,Runway做图生视频,HeyGen做数字人,剪映兜底剪辑和字幕。这个组合用了小半年,基本覆盖我所有需求。
2.2 工具注册、界面功能、基础参数与生成流程
注册这件事看着简单,里头有不少门道。海外工具像Runway、Pika,一般用邮箱或者谷歌账号注册,部分需要科学上网。国内的可灵、即梦、Vidu用手机号就行,注册流程快很多。我建议注册的时候就用一个固定邮箱,别到处乱用,不然到时候找账号都找不着。有些工具注册完送积分,够你试几十次,别浪费,先想好要试什么再动手。
界面这块,大部分工具的逻辑差不多。左边或者上边是输入区,你写提示词、传图片、选参数。中间是预览区,生成的结果在这儿显示。右边或者下边是历史记录,你生成过的东西都在里面。基础参数无非这几个:时长、比例、运动强度、风格。时长一般三到十秒,比例有横屏竖屏方形,运动强度控制画面动得多厉害,风格就是写实、动画、电影感这些。我刚开始用的时候把运动强度拉满,结果画面抖得像地震,后来发现数值调到中间偏下最稳。
生成流程我走一遍给你看。打开工具,选模式,文生视频还是图生视频。然后写提示词,描述你想要的画面,越具体越好。接着选参数,时长、比例、运动幅度。点生成,等几十秒到几分钟。出来之后看结果,不满意就改提示词或者换参数再来。我一般一个镜头会生成三到五次,挑最好的一条。有个小技巧,同样的提示词多跑几次,每次结果都不一样,有时候会有惊喜。
2.3 免费与付费方案对比、导出格式与素材管理
免费方案能用,但有天花板。大部分工具免费版给的是积分制,注册送一些,每天签到送一些,用完了要么等第二天,要么掏钱。免费版通常还有水印,分辨率也低一些。我刚开始全靠免费额度撑着,做了十几条视频,后来发现不够用,才充了第一个会员。付费方案分月付和年付,年付便宜不少,但我建议先月付,用一两个月确定自己真的需要再转年付。价格从几十到几百不等,Runway的标准版一个月十几美元,可灵的会员一个月几十块人民币,差距挺大。
导出格式这块,主流就是MP4,少数工具支持MOV和GIF。分辨率有720P、1080P、4K,免费版一般只给720P或者带水印的1080P。帧率常见的是24帧和30帧,电影感选24,日常内容选30。我导出的时候一般选MP4加1080P,兼容性最好,传哪个平台都没问题。有些工具导出还要排队,付费用户优先,免费用户等得久一点,这个要有心理准备。
素材管理是我踩过坑的地方。一开始生成完就扔那儿不管,后来要做混剪,找半天找不到。现在我的习惯是:每个项目建一个文件夹,里面分“生成素材”“音频”“成品”三个子文件夹。生成素材按日期加关键词命名,比如“20240612_咖啡店_拉花”。音频单独放,成品单独放。我还在手机备忘录里记每个素材的提示词和参数,方便以后复用。这套方法看着笨,但省了我大量翻找的时间。素材攒多了之后,你会发现它们之间能互相组合,一条视频的废片可能是另一条视频的宝贝。
3.1 选题策划、脚本撰写与分镜设计
我刚开始做AI视频那阵子,最头疼的不是工具操作,是坐那儿半天不知道做什么。脑子里的想法飘来飘去,落到提示词框里就变成一坨。后来我给自己定了个规矩:选题不贪大,一个视频只讲一件事。比如“怎么用AI做咖啡拉花视频”比“AI视频制作全攻略”好落地得多。选题的时候我会问自己三个问题——这个内容我自己想不想看?搜索框里有没有人问?我手头的工具能不能做出来?三个都过关了才动手。
脚本这步我吃过亏。最早我觉得AI视频不用写脚本,直接开干,生出来的画面全是零碎镜头,拼一起跟喝醉了拍的似的。现在我写脚本用最笨的办法:拿张纸,左边写“画面”,右边写“词儿”。画面那列就一句话描述镜头里有什么,词儿那列写这块要说什么话。一个三十秒的视频,我一般写五到七个镜头。写的时候我会默念一遍,念着别扭的地方就改,念着顺嘴的基本就没问题。
分镜设计我不画图,画图太费时间。我用文字分镜,格式就是“镜头1:特写,咖啡杯,手入画。镜头2:中景,拉花缸倾斜,奶泡流出。”这种写法看着简陋,但给AI工具用足够了。有一点我特别注意——每个镜头描述里必须带上“景别+主体+动作+氛围”。少了任何一项,AI就容易乱发挥。我有个本子专门记分镜模板,做多了之后直接套,效率翻倍。
3.2 素材生成、提示词编写与画面一致性控制
素材生成这块我踩的坑能写一本书。最开始我一条视频用五个不同工具生成,结果画风五花八门,有的是写实电影感,有的是二次元,剪一起像精神分裂。现在我的做法是:一条视频只用一个工具做主生成,最多加一个辅助工具做局部修改。生成之前先把所有镜头的提示词排好序,风格描述统一放在最前面,比如“电影感,暖色调,35mm镜头”,每个镜头都带上这串前缀。
提示词编写我摸索出一套自己的公式:风格+主体+动作+环境+光线+镜头。举个例子,“电影感,一个年轻女人,推开门走进来,日式咖啡馆,午后阳光从窗户照进来,中景跟拍”。这么写比“一个女人走进咖啡馆”强太多。还有个小发现——提示词里加“slow motion”“handheld”这类运动描述,画面会活很多。不加的话AI给的运动往往很愣,像机器人走路。
画面一致性是我花最长时间才搞明白的事。同一个角色在五个镜头里长得不一样,这事太常见了。我的解法有三个:一是用图生视频,先定一张角色图,后面所有镜头都拿这张图当参考;二是提示词里把角色特征写死,比如“短发,圆脸,戴黑框眼镜,穿灰色卫衣”,每个镜头都重复一遍;三是场景不变的话,生成第一个镜头后截图,后面拿截图当首帧。这三个方法混着用,一致性能到七八成。剩下的两三成靠剪辑节奏盖过去,观众其实不太会盯着看。
3.3 配音配乐、字幕剪辑、转场特效与成片导出
配音我试过三种方式。自己录最自然,但环境噪音和口误得反复重录。AI配音省事,可灵、剪映里的AI音色够用了,我一般选“纪录片男声”或者“亲切女声”这两种。数字人自带配音最方便,但声音和口型偶尔对不上。现在我常用的组合是:自己录一遍,再用AI配音做备份,哪条好用哪条。配乐我从来不自己找,直接用剪映的曲库,搜关键词比如“轻快”“治愈”“科技感”,挑前五首试听,选最顺耳的。
字幕这步别偷懒。AI自动识别字幕准确率现在很高,但错别字还是会有,尤其是同音字。我每条视频都会把字幕过一遍,改完再导出。字幕样式我固定用黑体白字加黑边,大小调到手机上看清楚为准。有人喜欢花哨字幕,我的经验是——字幕越简单,观众越集中在内容上。
转场特效我用得克制。刚开始做视频的时候恨不得每个镜头之间都加个炫酷转场,后来发现观众根本来不及看。现在我只用三种:硬切、叠化、黑场。硬切最常用,叠化用在时间流逝的地方,黑场用在章节转换。成片导出我选MP4加1080P,帧率30,码率拉到最高。导出前我会在手机上预览一遍,电脑上看没问题不代表手机上看没问题。声音大小、字幕位置、画面亮度,手机过一遍全暴露。
4.1 提示词结构、镜头语言与风格描述方法
我做了两百多条AI视频之后,慢慢摸出一个规律——提示词写得好不好,决定了成片是“能看”还是“想看”。很多人写提示词像在许愿,“一个漂亮的女孩在海边”这种句子,AI给你的东西每次都不一样,因为信息量太少,它只能瞎猜。我的做法是把提示词拆成四个模块来写:风格定调、镜头描述、主体动作、环境氛围。这四个模块按顺序排列,AI解析起来最稳。
风格定调我一般放三到五个词。比如“电影感、胶片颗粒、暖色调、浅景深”这一组,一出来画面质感就定了。你要是写“赛博朋克、霓虹灯、暗调、高对比”,出来的东西完全另一个味道。镜头语言这块我单独拎出来说,因为它太重要了。我常用的镜头词有这些:特写、中景、全景、俯拍、仰拍、跟拍、推镜、拉镜、环绕。把这些词加进提示词里,AI对画面的控制力会强很多。比如“中景跟拍”比“拍一个人走路”精准十倍。
风格描述有个小技巧——用电影名字或者导演风格来锚定。我写“韦斯·安德森风格”的时候,AI给的是对称构图加粉彩色调。写“诺兰风格”出来的是冷色调加手持感。这招特别好使,因为电影风格本身包含了色彩、构图、运镜、光线一整套视觉语言。不过要注意,太具体的导演名字有些工具会屏蔽,我一般用“对称构图、粉彩色调、居中镜头”这种描述词来替代,效果差不多。
参数和提示词的关系我打个比方:提示词是菜谱,参数是火候。菜谱写得好,火候不对照样糊。AI视频工具里最常调的参数就那几个——运动强度、镜头运动幅度、帧率、时长、种子值。运动强度我一般设在中间值偏下,太高了画面容易扭曲,太低了又像幻灯片。镜头运动幅度这个参数很多人忽略,其实它和提示词里的运镜词是联动的。你提示词写了“推镜”,参数里运动幅度就得配合调高一点,不然推不动。
种子值这东西我刚开始完全不用,后来发现它是个宝藏。同一条提示词,换个种子值出来的画面完全不一样。我通常会一次性生成四到六个不同种子的版本,挑最顺眼的那个,记下种子值,后面做系列内容的时候复用这个种子,风格一致性就有保障了。时长参数要看工具,有些工具固定五秒,有些能拉长到十几秒。我的经验是——单镜头别超过八秒,AI视频时间越长,画面崩坏的概率越大。
4.2 角色、场景、光线与运动镜头的控制技巧
角色控制是我花时间最多的地方。同一个角色在不同镜头里长得不一样,这事几乎每个做AI视频的人都遇到过。我试过很多方法,最后固定下来一套流程:先用图生图生成一张角色定妆照,正面、半身、清晰。这张图存好,后面所有镜头都拿它当参考图。工具里一般叫“角色参考”或者“主体锁定”,把参考强度拉到70%到80%之间。拉太满画面会僵,拉太低角色又会变。
角色描述词也有讲究。我会把角色特征写成固定的一串词,每个镜头提示词里都带上。比如“三十岁女性,利落短发,单眼皮,高颧骨,穿深蓝色衬衫”这一串,每个镜头都原样复制。这串词我管它叫“角色DNA”。写的时候尽量用具体的、可视化的形容词,别用“漂亮”“帅气”这种主观词。AI理解不了漂亮,它能理解的是“大眼睛、高鼻梁、尖下巴”这种具体特征。
场景控制的核心是“锚定物”。一个场景里必须有个不变的东西,观众才能认出这是同一个地方。我常用的是建筑特征、家具摆放、窗外景色这三类。比如咖啡馆场景,我锚定“靠窗的位置、木质圆桌、墙上的黑白照片”。每个镜头都带上这几个词,场景就稳了。还有个小技巧——如果场景要换角度拍摄,我会先写“从门口看”“从柜台看”这种视角词,再叠加锚定物描述,出来的画面空间感连贯很多。
光线是最容易被忽略但效果最明显的控制项。我总结了几种常用光线描述:黄金时刻(日落前后暖光)、蓝色时刻(日落后冷光)、顶光(正午硬光)、侧光(增强立体感)、逆光(轮廓光)。写提示词的时候把光线词放在风格模块后面、镜头模块前面,AI对光线的响应最准确。举个例子,“黄金时刻,侧光,中景,一个女人坐在长椅上”——这组词出来,画面立刻有质感。
运动镜头我单独拎出来讲,因为它是AI视频区别于图片的核心。常用的运动类型有:推、拉、摇、移、跟、升、降、环绕。我写运动镜头的时候,会把运动拆成“起幅”和“落幅”来描述。比如“镜头从女人的面部特写开始,缓慢拉远,最后停在全身中景”。这种写法AI理解起来最清晰。运动速度也要写,“缓慢”“匀速”“快速”这些词加上去,画面节奏会跟着变。我一般用“缓慢”居多,AI视频运动一快就容易糊。
4.3 常见画面崩坏、闪烁、变形问题与调优策略
画面崩坏是我早期最头疼的问题。具体表现有几种:人脸扭曲、手指多根、肢体错位、物体融合。我观察下来,崩坏往往发生在三个时刻——运动幅度大的镜头、多人同框的镜头、快速切换的镜头。解决办法我试出来几个:一是把运动幅度参数调低,宁可画面动得慢一点也别崩;二是多人镜头尽量拆成单人镜头,分开生成再剪一起;三是提示词里加“稳定画面”“减少变形”这类负面约束词。
闪烁问题主要出现在两个镜头拼接的地方,前一帧和后一帧亮度或者色调突变。我遇到这种情况一般从三个方向排查。提示词里风格描述是否一致,每条提示词开头那串风格词必须一字不差。种子值是否复用,同场景的镜头我一般用同一个种子值。光线描述是否统一,别一个镜头写“暖光”,下一个写“冷光”。这三个对齐了,闪烁问题能减少八成。
变形问题比较刁钻,有时候是AI模型本身的局限。我碰到过物体边缘融化、背景跟着主体动、快速运动时画面撕裂这几种。应对策略我分情况处理。物体边缘融化,提示词里加“清晰边缘”“锐利轮廓”。背景跟着主体动,加“固定背景”“静态环境”。快速运动撕裂,把运动速度调慢,或者把长镜头拆成两个短镜头。有些工具参数里有“运动平滑度”或者“帧间一致性”这类选项,把它拉高,撕裂会好很多。
调优是个反复试错的过程,我一般一个镜头生成六到八版,挑最好的那版。时间长了之后,我总结出一个“三遍法则”。第一遍按原始提示词生成,看整体方向对不对。第二遍根据问题调整提示词,加约束词或者改描述。第三遍调参数,动运动幅度、种子值、参考强度这些。三遍还不行,说明这个镜头设计本身有问题,得回去改分镜,别死磕。
有个心态上的事我想说一下。AI视频生成有随机性,同样的提示词和参数,两次生成结果不一样,这很正常。我刚开始做的时候特别较劲,非要一条过,结果一天下来啥也没做成。后来我接受了这个随机性,把它当成抽卡。一次生成四版,挑一版能用的,剩下的当素材备用。有时候崩坏的画面反而有意外效果,我有一条视频里的“融化效果”就是崩坏出来的,观众还以为是故意设计的。
5.1 短视频口播、数字人讲解与知识科普视频
我第一条真正跑通的AI视频就是口播类型的。那会儿用的是一个数字人工具,输入文案,选了个形象,等了大概三分钟,一个西装革履的“我”就开始对着镜头说话了。嘴型对得上,语气也自然,就是眼神有点呆。这条视频发出去之后播放量比我真人出镜的高了三倍,评论区还有人问“博主是不是去整容了”。从那时候起我就意识到,数字人这条赛道对不想露脸的人来说,简直是救命稻草。
做口播类视频我现在有一套固定流程。文案先写好,控制在三百字以内,语速正常的AI配音大概一分钟出头。文案的写法跟写文章不一样,得短句、口语、有节奏。我经常用“你知道吗”“我跟你讲”“这事儿是这样的”这种开头,观众听到这种话耳朵会竖起来。数字人形象我一般选半身、正面、眼神略微偏离镜头的那种,太直视镜头会有压迫感。背景我习惯用虚化的办公室或者纯色墙,简洁为主,观众注意力集中在嘴和表情上。
知识科普类的视频我用的是另一套打法。这类视频核心是信息密度,画面得跟着内容走,不能一个数字人从头讲到尾。我的做法是数字人出镜讲开头和结尾,中间穿插AI生成的示意图、动画演示、数据可视化画面。比如讲“黑洞是怎么形成的”这个话题,数字人讲完开场白之后,画面切到AI生成的恒星坍缩动画,配上解说词,再切回数字人做个总结。这种“人机混剪”的节奏观众不容易疲劳。
科普视频的脚本我写的时候会刻意埋“钩子”。每隔十五秒左右抛一个问题或者一个反常识的事实,比如“你以为黑洞是个洞,其实它是个球”。这种句子一出来,完播率能拉高不少。AI生成画面的时候,提示词要跟着脚本走,画面和文案对不上观众立刻划走。我一般先把脚本拆成一个个画面描述,每个描述写两到三句提示词,批量生成素材,最后剪到一起。整个过程熟练了,一条三分钟的科普视频大概两小时能搞定。
数字人这块我想多说一句。现在市面上的数字人工具分两种,一种是预置形象,你选一个现成的用;另一种是定制形象,上传自己的视频训练一个专属数字人。预置形象便宜、上手快,适合刚起步的时候用。定制形象贵一些,训练要等,但出来的效果更个人化,粉丝粘性也更强。我建议先用预置形象跑通流程,确定这个方向能做了,再考虑定制。别一上来就花钱定制,结果做了三条就不想做了,那钱就白花了。
5.2 产品广告、品牌宣传片与动画风格视频
产品广告是我接商单最多的类型。很多小品牌预算有限,请不起摄制组,但又需要一条像样的广告片。这种需求AI视频正好能接住。我做产品广告的流程是这样的:先拿到产品图和卖点,然后写一个十五秒到三十秒的脚本,画面风格根据产品调性来定。美妆产品走柔和光线加特写镜头,电子产品走冷色调加科技感运镜,食品走暖色调加慢动作。提示词里我会把产品特征写死,比如“白色磨砂瓶身、金色瓶盖、液体质地浓稠”,每个镜头都带上这串词。
产品广告最难的地方是产品一致性。同一个瓶子在不同镜头里长得不一样,观众一眼就能看出来。我的解决办法是用图生视频为主,文生视频为辅。先拍或者找一张清晰的产品图,用图生视频功能让瓶子动起来。每个镜头的首帧都用同一张图,出来的产品就稳定了。文生视频只用在不出现产品的空镜头上,比如氛围镜头、转场镜头。这样搭配着来,整条片子既有动感又不失真。
品牌宣传片比产品广告复杂一个量级。宣传片要讲品牌故事,要有情绪,要有起承转合。我做过一个咖啡品牌的宣传片,从咖啡豆的产地画面开始,到烘焙、研磨、冲泡,最后落到一个人端着杯子看窗外的镜头。整条片子没有一句台词,全靠画面和音乐推。这种片子对画面的连贯性要求极高,我的做法是先定一个统一的视觉基调,比如“暖棕色、胶片质感、柔光”,所有镜头的提示词里都带上这组词。种子值也尽量复用,保证色调统一。
动画风格视频是我个人最喜欢玩的类型。吉卜力风格、皮克斯风格、水墨风格、赛博朋克风格,每种风格出来的东西都特别有辨识度。做动画风格视频有个诀窍——提示词里要同时写风格词和具体的画面描述。光写“吉卜力风格”不够,AI不知道你要画什么。我一般这么写:“吉卜力风格,一个女孩站在开满野花的山坡上,远处是蓝天白云,微风吹动她的裙摆,柔和光线,手绘质感”。风格词定调,画面描述定内容,出来的东西就靠谱了。
动画风格视频有个坑我得提醒一下。有些工具对知名动画公司的风格词会做限制,你写“迪士尼风格”可能出不来东西。我的应对办法是用描述词替代品牌词。想要迪士尼的感觉,就写“圆润造型、大眼睛角色、鲜艳色彩、流畅动作”。想要吉卜力的感觉,就写“手绘水彩背景、柔和色调、自然光影、细腻云层”。描述词比品牌词更安全,效果也不差。我做过一条水墨风格的短片,用的就是“宣纸质感、墨色晕染、留白构图”这组词,出来之后朋友还以为我找了画师手绘的。
5.3 图文转视频、老照片动起来与音乐MV制作
图文转视频是我用得最多的批量生产方法。手头有一堆图片素材,配上文案和音乐,用AI工具自动生成转场和动效,十分钟能出一条。这种视频特别适合做知识盘点、产品合集、旅行记录这类内容。我的操作流程是先把图片按顺序排好,每张图写一句文案,导入工具之后选一个模板,工具会自动加转场、加字幕、加背景音乐。出来的东西虽然不算精致,但胜在快。我有一条“十个必去的国内小众旅行地”的视频就是这么做的,从整理图片到导出成片,花了不到半小时。
图文转视频的质感提升有个小技巧——给静态图片加轻微的运动。AI工具里一般叫“Ken Burns效果”或者“图片动效”,就是让图片缓慢放大或者平移。这个效果一加,画面立刻活了。再配合图片之间的叠化转场,整条视频的观感能提升一个档次。音乐选择也重要,图文类视频我一般选轻快的纯音乐,节奏别太快,跟图片切换的节奏对上就行。图片切换太快观众来不及看,太慢又显得拖沓。我的经验是每张图停留三到四秒比较舒服。
老照片动起来这个玩法我是从家里的旧相册开始的。我把爷爷奶奶年轻时候的照片扫描进电脑,用AI工具让照片里的人眨眼、微笑、轻微转头。做出来的效果怎么说呢,我奶奶看了之后愣了半天,说“这老头子年轻时候还真是这个样”。老照片动起来的核心是“微动”,动作幅度一定要小。眨眼、嘴角上扬、头部轻微转动,这些就够了。动作一大,照片里的人物就会变形,看着瘆人。
老照片修复是动起来之前的一步。很多老照片有折痕、褪色、噪点,直接拿去生成视频效果很差。我一般先用AI修复工具把照片修一遍,提高清晰度、去掉划痕、还原色彩。修复完了再动起来,效果好很多。修复的时候要注意保留照片的年代感,别修得太新,修成塑料质感反而没味道了。我修我爷爷那张照片的时候,保留了轻微的颗粒感和偏黄的色调,动起来之后那种岁月的味道还在。
音乐MV制作是我最近在尝试的方向。逻辑跟前面几种不太一样,MV是音乐先行,画面跟着音乐走。我一般先选一首歌,把歌词拆成段落,每段歌词对应一个画面场景。画面风格要统一,色调和情绪要跟歌曲匹配。快歌用快切、高饱和、大动作镜头,慢歌用长镜头、低饱和、微动。提示词里我会把歌曲的情绪写进去,比如“孤独感、冷色调、雨夜街道、霓虹灯反射在积水里”这种。
MV的剪辑节奏是关键。我一般先粗剪一版,把画面按歌词顺序排好,然后跟着音乐的节拍微调每个镜头的入点和出点。鼓点落的地方切镜头,旋律起来的地方放长镜头。这个活儿需要耐心,我一条三分钟的MV剪了大概四个小时。剪完之后发给朋友看,他说“你这画面跟歌词也太搭了吧”。其实就是卡点卡得准,加上画面情绪跟音乐情绪对上了。AI生成的画面本身有随机性,但正是这种随机性让MV有了独特的质感,每个镜头都不可复制。做MV这事我最大的感受是,AI负责生成素材,人负责赋予节奏和情绪,两边的活儿分清楚,出来的东西就有灵魂。
6.1 零基础练习计划、模板库与持续学习资源
我刚接触AI视频那阵子,每天最焦虑的事情就是不知道今天该练什么。工具界面打开,提示词框空着,脑子里也空着。后来我给自己定了个规矩——每天必须产出三条十五秒的短片,不管好坏,先做出来再说。这个“三条短片计划”我坚持了整整一个月,前十天做出来的东西惨不忍睹,画面扭曲、人物变形、逻辑跳跃。到了第二十天,我开始能预判哪些提示词会出问题,哪些参数调了之后画面会更稳。一个月结束的时候,我翻回去看第一天做的东西,感觉自己像换了一双手。
零基础练习计划的核心就四个字:定量、定主题。定量是说每天必须动手做,哪怕只做一个镜头。定主题是说这段时间集中练一种类型的东西,别今天做口播明天做动画后天做MV,那样每样都学不深。我的建议是第一周只练文生视频,把同一个画面描述用不同的提示词结构反复跑,看哪种写法出来的效果最稳。第二周练图生视频,找十张清晰的产品图或者人物图,让它们分别动起来。第三周开始加配音和字幕,第四周尝试完整的三十秒成片。一个月下来,基本流程就刻在肌肉记忆里了。
模板库这个概念我是从做PPT的时候迁移过来的。AI视频生成的随机性太强,每次从零开始写提示词效率极低。我的做法是建一个自己的提示词模板库,按场景分类。比如“人物特写”文件夹里存着“亚洲女性、三十岁左右、柔和光线、浅景深、自然表情”这种基础描述,“场景空镜”文件夹里存着“城市夜景、霓虹灯、雨后街道、反射光、电影感”这种氛围描述。用的时候把模板调出来,改几个关键词就能用,省了一大半时间。模板库我每隔两周整理一次,把跑出来效果好的提示词标星,效果差的删掉,库越来越精。
持续学习资源的获取我有几个固定渠道。一个是YouTube上的AI视频教程频道,更新快、实操多,缺点是英文内容需要啃。国内B站和抖音上也有不少创作者在分享,质量参差不齐,我一般看播放量高且评论区有真实反馈的那种。另一个渠道是工具官方的文档和社区,比如Runway、Pika、可灵这些工具都有自己的教程页面和用户论坛,官方文档写得最准,社区里能蹲到别人踩过的坑。我还加了三四个AI视频创作的微信群,群里经常有人发自己翻车的截图,问“这个手为什么长了六根指头”,这种真实案例比教程管用。
工具更新迭代的速度太快了,上个月刚熟悉的界面,这个月可能就改版了。我的应对策略是抓核心不抓表面。核心是什么?是提示词的结构逻辑、是画面一致性的控制方法、是镜头语言的基本规则。这些东西换了工具也一样用。表面是什么?是某个按钮在左边还是右边、某个参数叫什么名字。表面上的东西现查现学就行,不用焦虑。我有个朋友每次工具更新就焦虑得不行,觉得又要重新学。我跟他讲,你学的是做菜的思路,不是某个牌子的锅怎么用。换口锅,菜照样炒。
6.2 常见报错、版权、合规与伦理注意事项
报错这件事我踩过的坑能写一本书。最常见的是生成失败,提示“内容不符合安全策略”。这种情况一般是因为提示词里出现了敏感词,比如真实人名、品牌名、暴力相关词汇。我的解决办法是把敏感词替换成描述性语言。想要某个明星的感觉,就写“短发、棱角分明、笑容自信的亚洲男性”。想要某个品牌的感觉,就写“极简设计、白色包装、科技感”。换一种说法,AI就放行了。
画面崩坏是另一个高频问题。手指数量不对、腿部扭曲、眼睛不对称,这些我都经历过。调优的思路是先在提示词里加负面词,比如“畸形手、多余手指、扭曲面部、模糊、低质量”。然后在生成参数里调低运动幅度,运动幅度越大画面越容易崩。还有一个办法是缩短单次生成的时长,先出四秒的稳定画面,再用延长功能一段一段往后接。我做过一个十五秒的镜头,分四次生成,每次四秒左右,最后剪到一起,画面稳定性比一次性生成十五秒好很多。
版权问题是我现在越来越在意的事情。AI生成的内容版权归属目前各个平台的规定不一样,有的说归用户,有的说归平台,有的说没有版权。我自己的做法是:商用之前先看工具的用户协议,确认生成的内容可以用于商业用途。另外,如果生成的内容里出现了 recognizable 的真实人物、商标、受版权保护的角色形象,我绝对不会拿去商用。有一次我生成了一段画面,里面有个卡通形象长得特别像某知名IP,虽然提示词里没写那个名字,但我还是把那段删了。这种事情宁可不做,也别给自己埋雷。
合规和伦理这块我想认真说几句。AI视频能做的事情越来越多,数字人克隆、声音克隆、换脸这些技术已经很成熟了。技术是中性的,但用技术的人得有底线。我给自己定了三条规矩:不用别人的脸和声音做未经授权的数字人,不生成可能误导公众的虚假新闻类内容,不用AI视频去仿冒他人身份进行商业活动。这三条规矩看着简单,但真到有人拿着钱来找你做擦边内容的时候,能不能守住是另一回事。我拒绝过一单生意,对方想让我用AI克隆一个知名主持人的形象做产品推荐,给的钱不少,我没接。
平台审核的尺度也在收紧。抖音、B站、视频号这些平台现在对AI生成内容都有标识要求,有的要求你在发布时勾选“AI生成”选项,有的要求你在视频里加文字标注。我一开始觉得麻烦,后来想通了——标注一下反而能减少举报和限流。观众知道这是AI做的,预期就不一样了,不会拿真人的标准来挑刺。我现在的习惯是AI含量超过一半的视频,都在简介里写一句“本视频部分画面由AI生成”。诚实一点,省去很多麻烦。
6.3 多平台发布、效率工具与AI视频变现方向
多平台发布这件事我的策略是“一鱼多吃,但吃法不同”。同一条视频我不会原封不动地发到所有平台。抖音竖屏,B站横屏,视频号竖屏但节奏要慢一点,小红书的封面和标题要重新做。我的做法是先在抖音发一版,数据好的话再剪一版横屏发B站,B站的简介可以写长一点,把制作思路和提示词分享出来,B站用户吃这一套。小红书我一般只发图文加视频片段,标题写“我用AI做了个什么什么”,封面用对比图,点击率会高一些。
效率工具这块我离不开三个东西。第一个是素材管理工具,我用的是Eagle,把生成的视频片段、图片、音频分门别类存好,打上标签。找素材的时候搜标签就行,不用在文件夹里翻来翻去。第二个是提示词管理工具,我用Notion建了一个数据库,每条提示词记录生成效果、所属项目、使用工具,方便复用和迭代。第三个是AI剪辑工具,有些工具能自动识别口播视频里的停顿和废话,一键剪掉,省了我大量时间。这三个工具搭起来之后,我的生产效率至少翻了一倍。
AI视频变现的方向我试过和见过的有这么几种。第一种是接商单,帮小品牌做产品广告或者宣传片。这种单价从几百到几千不等,看片子的复杂度和客户预算。我接的第一单是一个手作饰品店,做了一条十五秒的产品展示,收了八百块。客户很满意,后来陆陆续续又找我做了五条。第二种是做账号流量分成,在抖音、B站、视频号上发AI视频,靠播放量拿平台补贴。这种收入不稳定,但胜在被动,一条爆款视频能带来持续几个月的长尾收益。
第三种是卖教程和模板。我在闲鱼和知识星球上看到不少人在卖AI视频的提示词合集、模板库、操作手册。这个东西的门槛在于你得先做出成绩,别人才会买你的教程。我认识一个博主,做了三个月AI视频,粉丝涨到五万之后开始卖九十九块的入门课,一个月卖了两百多份。第四种是定制数字人,帮企业或者个人训练专属的数字人形象,用于直播或者视频制作。这个方向客单价高,但技术门槛也高,需要懂一点模型训练的知识。
我自己的变现路径是“商单为主,流量为辅,教程试水”。商单收入最稳定,但需要持续获客,我一般靠作品集和客户口碑来带新单。流量收入是补充,爆一条吃半个月。教程我还在筹备阶段,打算等账号再稳一点再推。我想说的是,AI视频变现这件事急不得,先把内容质量做上来,把流程跑通,把作品集攒够。变现是水到渠成的事情,硬追着钱跑反而跑不快。我见过太多人做了一两周没看到收益就放弃了,其实再坚持一两个月,局面可能完全不一样。
评论
发表评论