🎯 一句话总结:先用 Codex 把一个15秒穿搭变装视频拆成制作清单,再确认一张首帧,用低成本测试版检查动作;第一条视频不做复杂分镜,一次只修一个问题。

AI视频最小制作流程

很多人不是没有想法,而是不知道第一步该做什么。看到别人同时使用参考图、首尾帧、分镜和长提示词,很容易误以为必须先学导演和剪辑。

第一条视频不需要这么复杂。你只需要完成一连串能回答“对或不对”的小决定:题材是否合适、主角是否一致、首帧是否可用、动作在哪一秒出错,以及下一轮只改什么。

这篇用“一个主角在一个场景里完成一次穿搭变装”贯穿全文。目标是先跑通10–15秒的最小闭环,不追求一次生成最终成片。


📌 先划清工具和能力边界

准备四样东西:

  1. Codex,或支持图片、视频分析的 ChatGPT;
  2. MiniMax H3 或 Seedance 2.5 的可用界面;
  3. 一条你想学习的视频,或者一句自己的想法;
  4. 一个项目文件夹,用来保存制作清单、参考图、提示词、测试视频和检查记录。

两个视频模型的能力不同:

项目MiniMax H3Seedance 2.5
官方最长单次时长最长15秒最长30秒,并支持多轮延长
官方最高规格最高2K依具体产品入口显示
输入支持文字、图片、视频、音频上下文支持图片、视频、音频参考
参考能力首帧、尾帧、多模态参考最多30张图片、10段视频、10段音频
本文用途单场景首帧图生视频可替代完成同一流程,进阶时做多参考叙事

这些是官方模型能力,不代表你使用的每个网站或客户端都开放全部选项。按钮、额度、时长和收费以当前入口为准。生成会产生费用时,先看预计消耗。

**第一条视频的范围:**一个成年主角、一个室内场景、一个连续动作、10–15秒。

**先别做:**30秒、多人物、复杂对白、多个地点、三段以上镜头、API自动化。


🧭 第一步:先分析,不要直接生图

先把参考视频或一句想法交给 Codex。这一轮只判断方向,不生成图片,也不写最终视频提示词。

我想做一条10–15秒的AI视频。
主例子是:一个主角在一个室内场景中完成一次穿搭变装。

请先不要生成图片,也不要写最终视频提示词。
请只分析:
1. 核心动作是什么;
2. 主角、场景和镜头要保持什么不变;
3. 哪些内容会让第一条视频过于复杂;
4. 如果有参考视频,按时间顺序列出3–5个关键变化;
5. 最后给出一个适合第一次试跑的最小版本。

你应当拿到的不是漂亮文案,而是一句可以检查的方案,例如:

同一个成年人站在固定的室内试衣区,转身一次,服装由日常款变成正式款,最后停在稳定姿态。

这一轮只确认三件事:玩法是不是你想做的,人物和场景是否合适,视频有没有塞太多事情。

如果一句话里出现两个人、两个地点、多个转场和对白,先删减。只有剩下一个主角、一个场景和一个主要变化,才进入下一步。


🖼️ 第二步:做清单,再确认一张首帧

方向通过后,让 Codex 把想法改成普通人能检查的制作清单:

根据刚才确认的最小版本,制作一张AI视频制作清单。
只保留一条10–15秒穿搭变装视频,包含:
- 主角外观与服装;
- 场景、时间和光线;
- 开始状态;
- 唯一主要动作;
- 结束状态;
- 首帧必须出现的内容。

暂时不要写视频提示词。
每一项都用普通人能检查的句子,不要使用“更自然”“更高级”等无法验收的词。

最小制作清单可以写成:

主角:一名成年人,固定发型和脸部特征。
场景:室内试衣区,固定机位和背景。
开始状态:穿日常服装,正面站立。
唯一动作:主角向镜头转身一次,服装完成一次变化。
结束状态:同一主角、同一场景,穿正式服装并停稳。
首帧验收:只有一个完整人物;脸、手、脚没有明显错误;四周留出动作空间。

清单确认后,只生成一张首帧:

根据已确认的制作清单,只生成一张视频首帧。
要求:一个成年主角、一个室内试衣场景、正面站立、日常服装、固定机位。
不要加入第二个人、第二个场景、字幕、复杂道具或动作分镜。
生成后只检查:人物数量、脸部、手脚和构图。

按固定顺序检查:先数人数,再看脸和手脚,最后看构图与光线。不要因为第一眼漂亮就直接生成视频。

如果只有一处错误,就只修这一处:

只修一个问题:人物右手出现多余手指。
保持人物、服装、场景、机位和光线不变,不要修改其他内容。

如果人数、脸和构图同时出错,重新生成通常比连续修补更省时间。只有结尾必须落在一个精确画面时,才考虑添加尾帧;普通连续动作先用一张首帧。

从分析到定点修复的五步流程


🎬 第三步:写提示词并低成本试跑

首帧通过以后,把它交回 Codex。视频提示词负责描述动作、时间和禁止项,不重新设计人物。

这是已经确认的首帧。请为它写一段10–15秒图生视频提示词。

保持人物身份、脸、服装起始状态、场景、机位和光线不变。
只描述一个连续动作:主角向镜头转身一次,完成一次穿搭变装,最后停在稳定姿态。
不要新增人物、地点、字幕、对白或第二个主要动作。
请说明动作发生的大致时间段,并列出3条禁止项。

检查提示词时,只问三件事:

  • 是否只有一个主要动作;
  • 是否与制作清单和首帧一致;
  • 是否明确禁止新增人物、镜头或场景。

不要在末尾堆“更自然、更稳定、更高质量”。这些词无法告诉模型具体该做什么。

以 H3 为例,按当前界面选择首帧图生视频,只上传确认后的首帧,让画幅跟随图片,选择15秒或相近时长,再粘贴提示词。第一次用较低分辨率或成本较低的规格生成。

换成 Seedance 2.5 时,按钮和参考数量可能不同,但顺序不变:上传已确认素材,检查图片编号,再生成测试版。不要第一次就用30秒、最多参考图和最高质量。

这一步的通过条件不是“画面完美”,而是测试版能够完整播放,并且你能指出问题发生在第几秒。


🔎 第四步:按时间点检查,一次只修一个问题

视频出来后先正常看一遍,只记最让你出戏的问题。不要写“整体不自然”。

请检查这段测试视频,先不要重写提示词。
按时间顺序列出最多3个最影响观感的问题。
每条必须包含:
- 时间点;
- 画面中的具体对象;
- 实际发生了什么;
- 建议优先修哪一个。
不要使用“更自然”“更高级”“更稳定”等笼统描述。

合格反馈应当像这样:

  • 00:04:人物开始转身后,身体比例突然放大,背景没有同步变化;
  • 00:07:变装已经完成,白色描边仍停留在人物外侧;
  • 00:10:画面短暂出现两个完整人物。

选出一个主问题,再发局部修正指令:

只修一个问题:00:04–00:07的穿搭转场过慢。
保持首帧、人物、场景、镜头、时长和其他动作不变。
让服装在该时间段内完成一次连续变化,不新增人物或镜头。

重新生成后,把两个版本并排比较。不要同时更换人物图、动作、镜头、音乐和时长,否则即使变好,也不知道是哪项修改生效。

如果同一错误反复出现,就回到上游检查:

  • 多个时段的人脸都漂移:回到人物参考或首帧;
  • 全程动作逻辑不清楚:回到制作清单;
  • 只有一个时间边界损坏:修改该段动作与结束状态;
  • 多个条件互相冲突:删减提示词,不继续追加形容词。

🎞️ 进阶:多人物和多分镜怎么接

第一条单镜头视频跑通后,再处理多人物剧情。复杂视频最难的不是提示词长度,而是切镜后人物、站位和道具能否保持一致。

公开的 cuimao_reverse 项目用一个约15秒的多角色剧情做教育性重建:动物外卖员一起吃饭,熊猫调侃牛,牛从假装没听见变成准备回应。项目里的参考图、分镜和提示词为重新制作,不是原视频工程。

复杂版本先准备七项内容:

  1. 故事变化;
  2. 主角设定;
  3. 配角阵容与站位;
  4. 场景空镜;
  5. 道具;
  6. 四格分镜;
  7. 每个镜头的开始状态与结束状态。

把人物设定、配角阵容、站位、场景和道具排成一张参考素材表,再顺序生成四个检查点:群体建立、双人对话、说话者特写、被调侃者反应。Panel 2 继承 Panel 1,Panel 3 继承 Panel 2;不要从文字独立生成四张互不相关的漂亮图。

随后给每个镜头写状态表:

镜头编号:
开始状态:
结束状态:
人物身份:
人物站位与左右关系:
重心与视线:
道具位置:
光线:
结束时残余动作:
下一个镜头如何继承:

上传到 Seedance 前先核对参考编号:人物身份参考与镜头结构参考不能互换。最终提示词先声明每张参考图负责什么,再写时间轴。

如果一个15秒任务无法稳定执行三个镜头,只在有明确结束状态的边界拆段。下一段同时带上上一段成片、最后一帧、人物参考和后续分镜。

核心规则只有一句:前一个镜头的结束状态 = 后一个镜头的开始状态。


✅ 第一条视频做到哪里算完成

第一条视频不需要证明你掌握了所有模型。满足下面这些条件,就算流程跑通:

  • 项目被缩小到10–15秒、一个主角、一个场景;
  • 已先分析,再制作清单,没有直接跳到生图;
  • 已确认一张首帧,并检查人数、脸、手脚和构图;
  • 图片、提示词、测试视频和检查记录保存在同一文件夹;
  • 已用低成本设置生成一个能完整播放的测试版;
  • 观众能看懂视频里发生了什么变化;
  • 主角身份没有明显漂移,主要动作有开始和结束;
  • 每个问题都能定位到具体时间点;
  • 每轮只修一个主要问题;
  • 同一错误反复出现时,知道应该返回哪一步。

连续亲手跑通两三条后,再把已经验证的流程整理成自动化脚本或 Skill。不要在第一条视频还没有完成时,就自动化一套未经验证的方法。

核验资料

模型能力、界面选项和价格可能继续变化,实际使用前以当前官方页面为准。