AI 短剧制作学习笔记
一、先理解完整影视制作流程
传统影视剧从项目开始到最终发行,大致经历以下 8 个阶段。AI 短剧并不是完全创造了一套新流程,而是用 AI 大幅替代其中的编剧辅助、分镜、美术、演员素材、拍摄、配音、后期等环节。
01 项目策划与立项
核心工作:市场调研、IP/版权采购、题材策划、剧本概念、立项备案、预算初稿
关键参与角色:出品人、监制、总制片人、制片人、策划、编剧、版权/法务、财务
02 剧本开发与融资
核心工作:故事大纲、人物设定、剧本打磨、项目包装、融资洽谈、平台沟通
关键参与角色:编剧团队、文学策划、制片人、投资人、商务制片、法务、财务
03 前期筹备
核心工作:组建主创、选角、勘景、分镜、概念设计、预算细化、排期、合同与设备
关键参与角色:导演、执行导演、副导演、选角导演、执行制片、制片主任、统筹、摄影指导、美术指导、录音指导、灯光指导、服装/化妆/道具组
04 拍摄制作
核心工作:现场拍摄、表演调度、摄影收音、灯光置景、服化道执行、数据管理、安全管理
关键参与角色:导演、演员、场记、摄影组、灯光组、录音组、美术组、服装组、化妆组、道具组、DIT、剧务、场务、动作组、制片组
05 后期制作
核心工作:剪辑、视效、调色、ADR配音、拟音、音效、配乐、字幕、包装、母版输出
关键参与角色:剪辑师、后期制片、VFX总监/CG团队、调色师、声音指导、拟音师、作曲、字幕与包装设计
06 审查送审与交付
核心工作:内容审查、技术审查、修改定版、成片QC、交付电视台/平台/院线
关键参与角色:制片人、后期制片、审片团队、法务、版权、平台对接、发行与交付团队
07 宣传营销与发行
核心工作:定档、海报预告、媒体宣传、路演、商务合作、发行排播、上线发行
关键参与角色:宣传总监、营销团队、公关、新媒体运营、发行人、商务合作、平台/电视台/院线
08 播出上映与数据复盘
核心工作:播出/上映、收视与票房分析、播放数据监测、用户反馈、版权运营、衍生开发
关键参与角色:出品方、制片公司、发行团队、平台数据团队、商务团队、版权运营
核心部门覆盖:
出品与投资|制片管理|编剧导演|摄影灯光录音|美术服化道|后期视效声音|审查交付|宣发发行
二、AI 短剧前期制作 Workflow
目前学习重点先放在:
剧本 → 分镜脚本 → 手绘分镜 → 演员 → 服装 → 最终人物 → 道具
也就是传统影视流程里的:
编剧 + 导演分镜 + 选角 + 美术 + 服化道
AI 时代真正变化最大的地方,是这些原本需要多个部门完成的工作,现在一个人可以借助多个 AI 模型完成。
但需要注意:
AI 可以帮助执行,不能完全替代编导思维。
尤其是剧本和分镜。
真正决定成片质量的不是「AI 能不能生成」,而是你是否已经想清楚:
- 观众看到什么?
- 镜头从哪里拍?
- 演员在做什么?
- 信息什么时候告诉观众?
- 情绪如何递进?
- 为什么这个镜头要存在?
剧本
剧本目前先以手搓为主。
不要直接让 AI 从一句话生成完整剧本,然后直接进入视频生成。
原因是:
一键生成的剧本通常没有足够强的编导思维。
编剧写文字时,脑子里实际上应该已经有一定程度的「画面」。
例如不是简单写:
男主很焦虑。
而是想:
男主坐在医生对面,低着头,手指交握,呼吸有一点急促,不敢直视医生。
后者已经开始具有影视化表达。
好的编导在 AI 时代依然非常重要,因为 AI 只是把脑中的画面执行出来。
短剧剧本格式规范示例
场次标注与特殊规范・简洁参考版
一、基本结构要素
1. 场次标注
- 首行写“第X集”或“X-X”
- 场次编号连续清晰
- 换场、时间跳跃、闪回时,需空行并重新标注
2. 时间与地点
- 时间用“日 / 夜 / 晨 / 傍晚”等简洁词
- 特征可写“夜/雨”
- 地点写具体场景,并标注“内 / 外”
3. 人物列表
- 出场人物使用全名
- 可写年龄、身份等必要信息
- 按重要性排序,主要角色优先
4. 内容描述
- 动作用“△”开头
- 台词格式:角色名:台词
- 语气或状态提示用“()”
- 心理活动用“OS”
- 画外音用“VO”
二、特殊标注规范
1. 内心独白与画外音
- 角色名(OS):内容
- 角色名(VO):内容
- VO适用于未出场角色声音
2. 回忆与闪回
- 另起一行标注“闪回”
- 结束时标注“闪回结束”
- 短暂回忆可写“插入镜头”
- 长回忆建议独立场次
3. 字幕与空镜
- 【字幕:内容】
- 【空镜:场景描述】
- 需与场景内容紧密关联
三、格式灵活性与注意事项
- 可根据甲方或项目需求调整格式
- 避免小说化语言
- 描述采用画面语言
- 台词简洁有力,单条建议 500 字以上内容时拆分处理
- 人物称谓统一
- 特殊术语或难理解用语可附注说明
剧本示例
1-1 某三甲医院门诊室 日 内
人物:女医生,35岁,男患者,25岁
△门诊室里,女医生低头翻看手上的病例资料,男患者坐在她的对面微微低头,表情凝重。
女医生:(抬头看向男患者)这种症状从什么时候开始的?
男患者:(神情呆滞,语速加快)我也不知道,我现在特别害怕公司开会,感觉下一个因为AI被优化的就会是我,我真的好焦虑啊医生。
女医生:(双手环抱,语气冷静)嗯,典型的赛博精神病前兆,不过不严重。
男患者:(困惑)那......怎样才算严重啊?
女医生:(抬了下眉头)当然是送到精神病院!这种病几乎无药可治,说能治好的都是江湖骗子。
男患者:(越来越急)那我该怎么办啊医生。
女医生:(放下手继续翻看桌上的病例,表情轻松)放心吧,回去好好工作,别老担心那些还没发生的事情。
男患者:(OS,神情凝重)后续还是医你一场,但我还是隐约觉得哪里不对,算了!走一步看一步吧。这里需要理解:
剧本解决的是「发生什么」。
暂时还不用把每一个摄像机位置写出来。
下一步的分镜脚本,才负责把剧本拆成一个个具体镜头。
分镜脚本
剧本完成之后,让 AI 协助生成专业分镜脚本。
分镜脚本解决的问题是:
「这段剧情到底要怎么拍?」
需要把一场戏拆成多个镜头,并明确:
- 镜号
- 景别
- 运镜
- 情绪 / 动作
- 台词
- 音效
- 时长
这一步非常重要。
因为之后生成 AI 视频时,原则上不是一次生成完整一场戏,而是:
一个镜头 → 一段 AI 视频
因此:
分镜脚本实际上就是未来生成视频的任务清单。
AI 生成分镜脚本提示词示例
根据我提供的剧本片段和基本规范格式帮我生成一个专业的分镜脚本,一共16个分镜,从左至右依次包含镜号、景别、运镜、情绪/动作、台词、音效、时长。
最后输出为文本脚本,按照以下的范例:
场次:1-1地点:中国某三甲医院精神科门诊室时间:日/内人物:女医生、男患者
镜号:1景别:全景/建立镜头运镜:固定镜头,轻微前推情绪/动作:交代三甲医院门诊室环境。女医生低头翻病例,男患者坐对面低头,气氛压抑。台词:无音效:门诊室环境底噪、纸张翻动、远处候诊叫号声时长:2s
镜号:2景别:近景/女医生运镜:固定镜头情绪/动作:女医生翻病例,眉头轻皱,专业、冷静。台词:无音效:纸张翻动声、笔尖轻敲桌面时长:3s
镜号:3景别:近景/男患者运镜:固定,略低机位情绪/动作:男患者微微低头,手指交握,表情凝重,制造不安感。台词:无音效:轻微呼吸声、低频氛围音垫时长:3s
镜号:4景别:过肩镜头/患者看医生运镜:切入,稳定构图情绪/动作:女医生抬头看向男患者,进入问诊。台词:女医生:这种症状是从什么时候开始的?音效:环境底噪降低,语音清晰时长:4s这里的逻辑例如:
镜头1医院建立镜头2s
↓
镜头2医生近景3s
↓
镜头3患者近景3s
↓
镜头4过肩镜头开始对白4s这样原本的一段文字剧本,就开始变成真正可以生成的视频镜头。
手绘分镜表
完成文字分镜脚本后,不要立刻开始生成昂贵的视频。
先验证:
这个分镜实际看起来合理吗?
方法:
让 AI 根据分镜脚本生成低成本的静态故事板 / Storyboard。
可以使用 Image 2,一张大约 0.1 元。
这里不要求画面精致。
目的只是检查:
- 镜头构图是否合理
- 景别切换是否舒服
- 人物站位是否合理
- 镜头之间是否能够连接
- 是否出现大量重复镜头
- 是否存在「文字看起来合理,但画出来很奇怪」的问题
这是一个非常重要的省钱步骤:
先用几毛钱的图片发现问题,而不是生成几块钱的视频以后才发现问题。
分镜表 Prompt 示例 1
根据我提供的分镜表脚本,制作一张半写实风格的写实分镜表,只生成1-16镜号的故事表,忽略其他镜号,从左至右依次包含镜号、分镜图、景别、运镜、情绪/动作、台词、音效、时长,不需要刻画细节,只用做结构参考;分镜表 Prompt 示例 2
根据我提供的分镜表脚本,制作一张手绘风格的写实分镜表,只生成1-16镜号的故事表,忽略其他镜号,从左至右依次包含镜号、分镜图、景别、运镜、情绪/动作、台词、音效、时长,不需要刻画细节,只用做结构参考;因此这一阶段可以理解成:
剧本
↓ 把故事拆成镜头
文字分镜
↓ 把镜头低成本可视化
Storyboard
↓ 检查没问题
再进入正式素材制作
不要跳过这一层。
三、角色与美术资产制作
接下来开始准备正式生成短剧需要重复使用的「资产」。
这里要建立一个重要概念:
不要每一个镜头都重新生一个人物。
应该先把:
- 演员
- 发型
- 妆容
- 衣服
- 道具
- 场景
做成相对稳定的资产。
之后每一个镜头尽量从这些资产继续生成。
这样才能维持一致性。
演员图片
使用 Image 2 生成演员基础形象。
这一阶段先不要把:
- 复杂服装
- 复杂妆容
- 复杂场景
全部一次性加进去。
先把人本身确定下来。
第一步:人物基础形象
例如先确定:
- 性别
- 年龄
- 脸型
- 五官
- 肤色
- 发型
- 身材
- 气质
生成满意之后,把人物保存下来。
第二步:人物六视图
人物的六视图使用 G 家香蕉的全能图片 Pro。
人物先穿比较朴素、简单的衣服。
例如生成:
- 正面
- 左前
- 左侧
- 背面
- 右侧
- 右前
六视图真正的用途是:
给后面的 AI 更多关于这个人物长相和身体结构的信息。
这样人物换角度时,更不容易变成另外一个人。
第三步:再加入服装六视图
不要一开始就要求:
人物 + 复杂衣服 + 六视图全部一次生成。
容易导致人物一致性下降。
正确方式:
人物确定↓人物六视图↓衣服确定↓人物穿衣↓穿衣后的六视图需要一步一步做。
因为直接生成「加入衣服的六视图」,经常会丧失人物一致性。
资产管理
完成后,可以把:
- 演员原始形象
- 人物六视图
- 穿衣六视图
- 不同妆容
- 不同表情
加入自己的资产库。
以后每次生成镜头都尽量调用已有资产,而不是重新创造角色。
服装图片
服装不要全部依赖 AI 凭空设计。
如果网上已经存在比较符合需求的衣服:
先找到参考图片 → 把衣服从人物身上提取出来。
之后把纯服装图作为 Reference。
例如:
网络穿搭参考↓提取衣服↓生成纯服装图↓角色试穿↓形成角色正式服装资产这样一般比纯 Prompt:
“穿一件很好看的黑色高级西装”
更加稳定。
最终人物形象
人物基础形象和服装都完成以后,再制作最终角色定妆照。
这时才加入:
- 妆容设定
- 发型细节
- 皮肤细节
- 正式服装
- 人物气质
- 角色状态
角色设定 Prompt 示例
妆容设定:面部和皮肤有少量痘痘发型设定:凌乱的黑色长发服饰设定:纯旧且有一些细小的破洞然后使用类似:
图片1的人穿上图片2的服饰,保持人物一致性和构图不变。这里最重要的两个关键词:
人物一致性
和
构图不变
否则 AI 很容易在换衣服的时候:
- 换脸
- 改年龄
- 改发型
- 改身材
- 改姿势
- 改摄影机位置
最终人物确定后,这张图就相当于传统影视制作里的:
演员定妆照。
道具图片
使用 GPT Image / GPT 2 生成道具图片。
例如:
- 手机
- 病历
- 手提包
- 药瓶
- 项链
- 武器
- 特殊剧情物品
如果某个道具会反复出现,或者和剧情相关:
一定要先独立做成资产。
例如剧情里存在一个非常重要的红色药瓶。
不要每次生成镜头时都写:
“桌上有一个红色药瓶”。
因为每一次 AI 都可能生成不同的药瓶。
应该:
先生成药瓶标准图↓保存为资产↓之后每个镜头引用同一个药瓶这样可以维持连续性。
服化道阶段完成
目前先做到:
服装 + 化妆 + 道具 + 人物资产
即可。
暂时不用一次学习完整影视制作流程。
当前最重要的是把这一条链跑通:
手写剧本↓AI辅助整理专业剧本格式↓AI生成文字分镜脚本↓AI生成低成本 Storyboard↓人工检查分镜↓确定演员↓人物六视图↓确定服装↓人物穿衣↓最终定妆人物↓制作重要道具↓形成可重复使用的资产库到这里,真正的视频还没有开始生成。
但实际上这部分非常重要。
因为:
前期做得越完整,后面生成视频时浪费的钱越少。
如果人物、服装、场景、镜头都没有确定,就直接开始 Seedance 抽卡,很容易变成:
生成↓人物不对↓重抽
生成↓衣服变了↓重抽
生成↓机位不对↓重抽
生成↓角色脸又变了↓继续烧钱而比较专业的思路应该是:
前期把问题解决掉↓正式生成时只解决「动作」↓把昂贵的视频模型用于最终镜头这也是 AI 短剧制作和单纯「玩 AI 视频」最大的区别。
四、场景资产与拍摄环节
前面的角色、服装、道具资产完成后,下一步开始进入:
场景资产 → 首帧场景 → 拍摄 / 视频生成
这里继续沿用一个核心思路:
先用便宜的图片把场景、构图、人物位置和整体色调确定下来,再把昂贵的视频模型用于真正的动作生成。
这样可以显著减少后续视频抽卡次数。
场景资产
先为重要场景制作一张稳定的 720P 全景图。
例如:
- 医院门诊室
- 卧室
- 办公室
- 餐厅
- 街道
- 酒吧
场景资产的作用类似传统影视里的「置景参考」或「场景设定图」。
后续同一个场景里的不同镜头,都尽量参考同一张场景资产,从而保持:
- 空间结构一致
- 家具位置一致
- 灯光方向一致
- 色调一致
- 美术风格一致
不要每拍一个镜头都重新让 AI 凭空设计场景,否则很容易出现:
上一个镜头门在左边,下一个镜头门跑到右边;桌子、窗户、墙面和灯光也全部变化。
首帧场景
在正式生成视频之前,先生成每个镜头的影视剧剧照,也就是后续视频生成要使用的首帧 / Keyframe。
可以直接使用:
根据提供的分镜脚本,生成一张影视剧剧照目前笔记中的做法是使用 香蕉的低价模型 V2 先生成图片。
首帧不只是为了确定人物站位,也应该开始确定整个剧的:
- 主色调
- 灯光
- 摄影质感
- 人物位置
- 景深
- 构图
- 空间关系
建议先生成四分镜 / 四个候选构图,从中挑一个最好的,再进入正式视频生成。
分镜脚本↓生成四个候选首帧↓比较构图与人物站位↓选出最好的首帧↓进入视频生成首帧生成 Prompt 示例
截图中的示例 Prompt:
根据提供的分镜脚本,生成一张影视剧剧照:场次:1-1地点:中国某三甲医院精神科门诊室时间:日 / 内人物:#1 图片1 女医生、#2图片2 男患者
镜号:1景别:全景/中心构图运镜:固定镜头、轻微前推情绪/动作:交代三甲医院门诊环境。女医生低头翻看手上的病例资料,男患者坐在她的对面微微低头,气氛压抑。截图中的界面文字:
全能图片V2-低价深推版16:9 / 2k摄影机控制全景图这个 Prompt 的结构值得保留。核心不是写一大段文学描述,而是直接把前面已经确定好的分镜信息交给图片模型:
场次 + 地点 + 时间 + 人物 Reference + 景别 + 运镜 + 动作 / 情绪
这样生成出来的首帧才能真正服务后面的拍摄,而不是单纯生成一张「好看的 AI 图片」。
空间关系 Prompt
截图中的提示词:
根据以下分镜脚本和角色设定,生成一张写实影视剧分镜图,要求人物在场景中的位置和空间关系合理,写实质感,不要出现文字。这里的关键词是:
位置和空间关系合理
因为 AI 很容易出现人物尺寸不合理、人物和桌椅穿插、两个人站位不符合镜头逻辑等问题。
首帧阶段先把这些问题解决掉,后面的视频模型会更容易成功。
拍摄环节
正式的视频生成,目前可以分为两种思路:
- 强把控:四分镜驱动
- 快速生成:不用四分镜,直接生成
二者不是谁一定更好,而是控制程度与制作速度不同。
方法一:四分镜强把控
这是控制力比较强的方式。
因为前面已经完成了分镜脚本,所以这里实际上是在做传统影视里接近「摄影师执行导演分镜」的工作。
基本流程:
分镜脚本↓生成四分镜↓加入角色六视图 / Reference↓交给视频模型↓按照设计好的镜头顺序生成视频例如四分镜分别设计为:
镜头 A:2s镜头 B:2s镜头 C:2s镜头 D:2s如果视频模型能够正确理解四分镜,那么生成的视频会尽可能按照这个镜头结构和节奏来执行。
笔记中的经验是:
生成的视频会比较严格地按照分镜表来走。比如四分镜每一个都是 2s,生成出来的视频也会尽量按照这个节奏进行。
这种方法的主要优势:
- 构图更加可控
- 人物一致性更稳定
- 镜头变化提前设计好
- 运镜更接近原来的分镜意图
- 可以减少大量随机抽卡
如果再配合人物六视图,角色稳定性会更高,很多情况下可以明显减少反复抽卡。
六视图与参考图
笔记中的经验:
一张大脸和三张图,可能会被卡审核;六视图不会被卡审核。
从制作角度看,六视图更重要的价值还是:让模型知道人物从多个方向看是什么样子。
例如:
- 正面
- 左前
- 左侧
- 背面
- 右侧
- 右前
这样人物转身、侧脸或改变机位时,不容易突然换脸或改变身体比例。
方法二:直接生成
第二种方式是不使用四分镜,直接根据:
- 首帧
- 人物 Reference
- 分镜描述
- 动作 Prompt
生成单个视频镜头。
流程:
分镜脚本↓首帧↓角色 Reference↓动作 / 运镜 Prompt↓直接生成视频笔记中的经验是:
不用四分镜直接生成,成功概率也挺高。
这种方法适合:
- 单一动作
- 单人镜头
- 固定机位
- 简单推拉摇移
- 普通对白镜头
- 对空间变化要求不高的镜头
而遇到下面这些镜头时,更适合使用四分镜:
- 多人物互动
- 明确走位
- 连续动作
- 复杂运镜
- 一个镜头里有多个动作阶段
- 关键剧情镜头
- 对构图要求严格的镜头
两种拍摄方式怎么选
| 镜头类型 | 推荐方法 |
|---|---|
| 单人近景对白 | 直接生成 |
| 简单固定镜头 | 直接生成 |
| 简单推镜 / 拉镜 | 直接生成 |
| 两人复杂互动 | 四分镜 |
| 人物走位明显 | 四分镜 |
| 一个镜头多个动作阶段 | 四分镜 |
| 关键剧情镜头 | 优先四分镜 |
| 普通过场镜头 | 优先直接生成 |
可以简单记成:
简单镜头快速生成,关键镜头强控制。
不需要为了“专业”让所有镜头都走最复杂的流程。真正合理的制作方式,是在质量、速度和成本之间做选择。
五、目前完整的 AI 短剧制作流程
到这一阶段,整个 Workflow 已经从前期制作扩展到了真正的视频生成入口:
手写剧本↓AI 辅助整理专业剧本格式↓AI 生成文字分镜脚本↓AI 生成低成本 Storyboard↓人工检查分镜合理性↓确定演员基础形象↓人物六视图↓确定服装↓人物穿衣↓最终人物定妆↓制作重要道具↓制作场景 720P 全景资产↓根据分镜生成首帧剧照↓生成四分镜 / 候选构图↓选择最佳首帧和构图↓选择拍摄方式├─ 简单镜头 → 首帧直接生成└─ 关键 / 复杂镜头 → 四分镜 + 六视图强控制↓正式生成视频现在可以把整个流程理解成三层:
第一层:故事
剧本
解决:
发生什么?
第二层:导演与美术
分镜 + Storyboard + 人物 + 服装 + 道具 + 场景 + 首帧
解决:
长什么样?怎么拍?
第三层:视频生成
四分镜 / 首帧 + Reference + 视频模型
解决:
怎么让已经设计好的画面真正动起来?
这里最重要的观念是:
不要让视频模型同时替你做编剧、导演、美术、选角和摄影。
如果前面的工作全部没有确定,就让视频模型自己决定所有东西,结果会非常随机。
更稳定的做法:
人先做决策↓图片模型完成视觉设计↓视频模型只负责让画面动起来这样才更接近真正可控的 AI 影视制作 Workflow。
六、你现在实际上在学什么
你现在学的其实还不是“生成视频”,而是在学 AI 影视 Pre-production(前期制作)。
也就是:
剧本 → 分镜 → Storyboard → Casting → 服化道 → Asset Library
这整套完成之后,下一阶段才应该进入:
场景资产 → 首尾帧/关键帧 → 图生视频 → 台词/口型 → 剪辑
这样学,比直接拿 Seedance 不断抽卡扎实很多。