
剧情短片全流程
从点子到成片:设定、分镜、关键帧、逐镜视频、配乐,每步确认
帮我做一部1分钟悬疑短片:深夜加班的女设计师发现电脑里多了一个不属于她的文件夹
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 剧情短片全流程
适合任何「我有一个故事想拍成短片」的通用需求:悬疑、温情、科幻、职场、奇幻都可以。和用户协作推进一个项目,在每个关键节点停下来确认,最大限度保证角色和场景跨镜头一致。默认交付一部 30 秒到 3 分钟、16:9 的剧情短片:约 3-15 个长镜头(每镜 10-15 秒,内部可以切换机位)+ 对白 + 可选旁白 + 全片配乐。
## 开工前确认
- 用户给故事点子、剧本、角色照片、场景图、音乐都可以。用户已经提供的素材直接放进对应的分镜位置使用,不要重复生成。
- 只有一句话点子时,帮他扩成三幕结构的梗概(开端 / 冲突 / 结局)再往下走。
- 用 ask_user 一次只问一个真正影响结果的选择:时长 → 视觉风格(写实电影感 / 动画 / 复古胶片等)→ 对白语言。画幅默认 16:9,用户要发短视频平台时改 9:16。
## 制作流程
1. **项目设定** —— 回复里用表格给出:片名、类型、画幅、时长、视觉风格、对白语言、一句话梗概。**停下确认**。
2. **分镜** —— 先列关键元素:角色(多造型写「造型 1 / 造型 2」,附声线描述)、主要场景(写清重要物件的位置和朝向)、关键道具。再写镜头表和音轨规划(至少一条全片配乐;长片在转折处可分段;需要旁白时写好声线和逐字稿)。**停下确认**。
3. **元素设定图** —— 每个角色出三视图(正 / 侧 / 背),每个场景一张空景,关键道具单独出。同一角色不同造型以第一张为参考做图生图。**停下确认**。
4. **逐镜关键帧** —— 每个镜头先出一张首帧静帧:带上该镜相关的元素图,再带上同场景里前面最相似的一张关键帧,用来锁定站位、朝向和表情这些设定图管不到的细节。**停下确认**。
5. **逐镜视频** —— 用元素图 + 本镜关键帧生成视频。**停下确认**。
6. **配乐与旁白** —— 按音轨规划生成。**停下确认**。
7. **交付清单** —— 镜头顺序、音轨叠法,引导到 TVVV 时间轴合成并导出。
## 风格锁定
- 每个项目定一组统一画风关键词,所有镜头都带。写实电影感项目的默认值:`cinematic live-action film still, strong chiaroscuro, negative fill, restrained Hollywood color grade, one dominant tone covering about 90% of frame, fine 35mm film grain, very subtle handheld micro-shake`。
- 写提示词时把六条电影感规则自然融进一段英文里(不要分标签罗列):
1. **专业风格术语**:用具体的流派和视觉锚点代替空泛说法,如「新黑色电影、冷峻的工业都市质感」而不是只写「黑色风格」。
2. **构图与景别**:过肩、荷兰角、特写、中景,写清楚。
3. **光线**:写主光方向,并强调负补光(negative fill)制造反差和脸部阴影。
4. **调色**:克制,一个主色调占画面约 90%(如深青蓝),除非用户要求,不用红蓝霓虹对撞。
5. **画面质感**:细腻渲染、丰富细节、轻微柔焦等。
6. **情绪与潜台词**:把动作定格在戏剧性瞬间,写微表情和气氛,拒绝摆拍。
- 必须避免:解释角色动机或内心(模型看不懂)、描述画面外看不见的东西、满屏霓虹、过分光滑的「AI 塑料感」。
## 分镜与镜头规则
- **优先长镜头 + 镜头内切换**:每镜 10-15 秒,在镜头内部安排 2-3 次机位切换,而不是拆成一堆 3 秒短镜头;切换频率跟着故事节奏走。单镜不超过 15 秒。
- **镜头数参考**:30 秒约 3-4 镜,1 分钟 5-6 镜,2 分钟 9-12 镜,3 分钟 12-15 镜。
- 每个镜头写三样:场景(引用场景元素)、故事内容(角色动作、关键物件变化、逐字台词或内心独白)、镜头语言(景别、机位角度、运镜)。
- 镜头内有切换时按顺序写:「第 1 段:特写,她的手指停在鼠标上 → 切到第 2 段:过肩中景,屏幕上的文件夹 → 切到第 3 段:正面近景,她的瞳孔放大」。
- **首帧要表现「意图」**:动作开始之前的状态——重心偏移、视线方向、肢体预备、尚未触发的效果、变化前的环境、机位初始位置。避免首帧卡在动作中间,否则视频会动不起来或动作断裂。
- 分镜表字段:镜号 / 时长 / 场景 / 内部分段(景别 + 动作 + 运镜)/ 对白 / 音效 / 旁白。
## 提示词写法
- 用户用中文时提示词主体写中文,台词按设定的对白语言写。
- **图片提示词结构**:主体与身份 → 关键外观细节(五官、发型、服装材质与状态)→ 动作与环境 → 构图景别 → 光线 → 调色 → 质感 → 情绪。画面里需要出现的文字用引号括起,如招牌写着 "DANGER"。
- 首帧图片示例:
```
过肩中景,深夜空荡的设计公司办公室,年轻女设计师坐在工位前,身体微微前倾,右手悬在鼠标上方,视线落在屏幕中央一个名为 "UNKNOWN" 的文件夹图标上;周围工位全部熄灯。显示器冷光作为唯一主光从正面打亮她半张脸,另一侧沉入阴影,negative fill,深青蓝色调占据画面九成,fine 35mm film grain,空气里有压抑的静默。
```
- **视频提示词结构**:首帧里已有的静态细节不要重复,重点写「变化」:主体 + 动作(带程度副词:缓慢、猛地、大幅度)、背景 + 变化、镜头 + 运动;多段动作用「先……然后……最后……」或「切到」标记;写清对白(没有就写「无对白」)和关键音效(没有就写「无音效」)。写实项目默认加极轻微手持晃动和细胶片颗粒;固定机位就写「固定镜头」,不加手持。
- 视频示例:
```
图1 为女设计师三视图,图2 为本镜首帧。第 1 段:固定镜头,她的食指缓缓按下鼠标,文件夹打开,屏幕光在她脸上闪了一下。切到第 2 段:屏幕特写,一排缩略图逐个加载,全是她工位的背面照片。切到第 3 段:正面近景,镜头极慢推近,她的表情从疑惑变成僵住,呼吸停顿,眼睛缓慢转向身后的黑暗。very subtle handheld micro-shake, fine film grain。音效 <鼠标点击、硬盘轻微嗡鸣、远处空调停止运转>。无对白。no music, no subtitles.
```
## 在 TVVV 上执行
- 元素图和关键帧用 generate_image,默认 Nano Banana 2;画面里有精确文字排版(屏幕字、招牌、片名卡)时用 GPT Image 2。关键帧的 reference_images 带上相关元素图 + 同场景前一张最相似的关键帧。
- 视频用 generate_video,默认 Seedance 2.5、720p、默认 16:9,单镜 5-10 秒(长镜头可到 15 秒)。reference_images 带上同一批 图N:角色三视图和场景图用 reference,本镜关键帧用 first_frame。
- 旁白用 generate_speech;如果分镜里有独立旁白轨,视频提示词里不要写旁白内容,避免声音冲突。配乐用 generate_music,至少一条全片配乐。
- 一次回复最多 4 次工具调用:元素图一批,关键帧每批 3-4 张,视频每批 2-3 镜,结果回来确认后再继续。
- 交付清单:按镜号列出视频,建议剪辑顺序,配乐全程铺底、对白和旁白时压低,旁白放在对白空隙;提示用户在 TVVV 时间轴里拼接、加字幕并导出。
## 注意事项
- **一口气跑完全部步骤**:用户会在最后发现角色不对,前面全白做。每个阶段都停下确认。
- **角色跨镜走样**:只靠设定图管不住站位和表情。关键帧阶段一定带上同场景的前一张关键帧。
- **首帧卡在动作中间**:首帧写动作之前的预备状态,尾帧才写动作结果。
- **视频提示词重复描述静态画面**:模型会把精力花在重画而不是动起来。只写变化,用短句。
- **多出背景音乐和字幕**:每条视频提示词末尾都加 no music, no subtitles;配乐和字幕在剪辑阶段统一加。