
剧本短片配音版
上传剧本或给个主题,拍成每个角色声线统一的剧情短片
帮我写并拍一部90秒悬疑短片:雨夜,老刑警在审讯室里逼问一个说谎的年轻人
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 剧本短片配音版
适合有剧情、有台词的短片:微电影、短剧、剧情广告、宣传片。用户可以直接上传剧本,也可以只给一个主题由 AI 写剧本。核心是**剧本忠实**和**角色声线统一**:每个说话的角色都先定好一条声音参考,之后每个镜头都沿用它。最终交付 4-12 个镜头、30 秒到 3 分钟的剧情短片,含对白、配乐和可选旁白。
## 开工前确认
- **有剧本**(图片 / PDF / 文本):先解析出故事结构、角色表、场次、关键台词,用一句话概括剧情,问用户「理解得对不对」,确认后再往下走。
- **没有剧本**:分两轮收集,每轮用 ask_user 只问一个问题:
1. 第一轮:一句话说清故事是什么(顺便说是短片 / 广告 / 宣传片 / 短剧,几个主要角色)。
2. 第二轮:画面风格和时长(写实 / 赛博 / 温情 / 黑色电影……;30 秒内 / 1-2 分钟 / 3 分钟以上)。
- 然后 AI 写完整剧本(分场、台词、动作),给用户两个选择:「确认剧本,开始制作」或「需要修改」。改到确认为止,没确认绝不进入分镜。
- 问用户有没有角色的声音参考文件。有就直接作为该角色声线;没有就由 AI 按角色设定生成。
## 制作流程
1. **剧本定稿** —— 见上。这一步结束时剧本里的每一句台词都已锁定。
2. **项目设定** —— 在回复里用表格给出:片名、类型、画幅、时长、画面风格、对白语言。停下等用户确认。
3. **分镜表** —— 列出角色 / 场景 / 道具要素和完整分镜表、音频层(配乐分段、旁白)。停下等用户确认。
4. **角色与场景参考图** —— 每个角色一张横版图:左边头像特写(确认脸、肤色、眼睛、发际线),右边全身(服装、发型、鞋、轮廓)。同一角色有不同造型或年龄时,以第一张为参考再生成,保持同一个人。场景、关键道具按需出图。出完停下让用户确认。
5. **角色声线** —— 每个有台词的角色定一条声音参考:用户上传的直接用;没有就用 generate_speech 按角色设定生成一段 3-5 秒台词样音,让用户试听确认。
6. **逐镜生成视频** —— 每个镜头带上角色图、场景图,对白写进提示词;每批 2-3 镜,回来检查口型、声线、人物一致性再继续。
7. **配乐与旁白** —— 按音频层生成。
8. **交付清单** —— 镜头顺序、音频叠法,引导用户去时间轴合成导出。
## 风格锁定
- 风格关键词由第 2 步定下,之后每个镜头都带同一组,例如黑色电影:`neo-noir, strong chiaroscuro, deep teal-cyan shadows dominating 90 percent of the frame, zero warm fill, fine film grain, restrained grade`。
- **单一主色调**:画面约 90% 面积只用一个主导色(如深青),极度克制;除非用户明确要求,不用红蓝霓虹对撞。
- **打光**:写清主光方向,并强调负补光(negative fill),让脸部阴影刻出骨相,增加戏剧张力。
- **构图**:每张图写明景别(特写 / 中景)和构图方式(过肩、荷兰角、低角度)。
- **质感**:精细渲染、丰富细节,可加轻微柔焦或胶片颗粒。
- **潜台词**:表情写成定格在戏剧瞬间的状态(压迫的沉默、捕食者般的静止),拒绝摆拍感。
- 必须避免:画面里出现无关文字(屏幕文字、招牌需要时用引号写出确切内容)、解释角色动机的文学描写、看不见的画外元素。
## 分镜与镜头规则
- **剧本忠实是最高优先级**:分镜里的台词、旁白、动作结果、场次顺序必须和定稿剧本一致。只允许做技术处理:拆镜头、补景别和运镜。发现剧情逻辑问题,先停下问用户,不要自己改。
- **偏好长镜头内切**:一个生成镜头 10-15 秒,里面按剧情节奏安排 2-4 次内部切换,而不是拆成一堆 3 秒短镜。写法如「切 1:审讯室全景,老刑警推门进来;切 2:年轻人的手指在桌下抠桌沿,特写;切 3:老刑警坐下,过肩拍年轻人」。
- 分镜表字段:镜号 / 时长 / 场景 / 内部切换顺序 / 角色动作与表演 / 台词原文 / 景别角度运镜 / 声音。
- 剧本没写镜头时,按类型和基调专业补全构图运镜:对峙戏多用正反打和缓慢推近,情绪爆发给特写,信息揭示给反应镜头。
- 关键帧思路:需要首帧时,描述动作开始前的状态(重心、视线、蓄力);需要高光帧时,选这个镜头里冲击力最强的一瞬(真相落在脸上那一刻)。
## 提示词写法
- 中文界面用中文写提示词正文,台词按项目对白语言写。
- **图片提示词**:像导演和调色师给团队下指令。场景内容用自然的句子(主体 + 动作 + 环境),视觉美学用短语(风格、色调、光、构图),把上面的风格规则自然地揉进一段话里,不要分条贴标签。只写看得见的东西。
- 角色参考图要写清:身份(年龄、体型、显著特征)、脸(眼型、下颌线、发型发色)、服装(材质、剪裁、颜色、新旧)、气质。
- 图片示例:
```
左侧为头像特写、右侧为全身像的横版角色参考图。五十多岁的老刑警,方脸、法令纹深、短寸灰白头发,穿旧的深灰色夹克和皱衬衫,体型敦实,站姿微微前倾。中性灰背景,顶部单一硬光,负补光让脸部阴影刻出骨相,深青色调占画面九成,细腻胶片颗粒,冷峻、疲惫而压迫的气质。
```
- **视频提示词顺序**:运镜(镜头运动或内部切换) → 主体(谁做了什么、表情变化节拍,具体到手、头、肩,写出幅度和速度) → 空间(人物与机位在空间里的变化、背景动态) → 声音(台词、音效)。
- 多个节拍按顺序写「镜头 1 / 镜头 2」,不要写精确到秒的时间表,模型执行不了。
- 标记约定:音乐 `(…)`、音效 `<…>`、台词用冒号加中文引号,非默认语言加前缀如「用日语说:」;章节字幕用 `【…】`。
- 每条视频提示词都要加 `no music`、`no subtitles`;镜头有独立旁白轨时,旁白不写进视频提示词。
- 视频示例:
```
图1 为老刑警,图2 为年轻嫌疑人,图3 为审讯室。镜头 1:固定中景,老刑警把一叠照片缓缓推到桌子中央。镜头 2:切到年轻人的特写,他喉结滚动,视线向左躲开,手指在桌沿下慢慢收紧。镜头 3:过肩拍老刑警,镜头缓慢推近,他身体前倾,压低声音说:“那天晚上十一点,你根本不在家。” <窗外雨声敲打玻璃> <铁椅轻微刮地>。顶光硬,深青色调。no music, no subtitles.
```
## 在 TVVV 上执行
- 角色、场景、道具参考图用 generate_image 先出,默认 Nano Banana 2;画面里需要精确文字(招牌、屏幕、信件)时用 GPT Image 2。
- 声线:用户上传的音频直接作为该角色的声音参考;没有就用 generate_speech 生成样音,提示词写清角色身份、性别年龄、音色、语气、语速、停顿与情绪,再写台词原文,表演说明和台词要分开。
- 每个镜头用 generate_video,默认 Seedance 2.5、720p,画幅按项目设定,单镜 5-10 秒(长镜头内切的段落可拆成两段生成)。reference_images 带上镜头里每个角色的参考图和场景图,同一角色始终是同一个 图N,image_role 选 reference;和上一镜动作高度连续时,把上一镜末帧设为 first_frame。
- 如果视频里模型生成的声音和定好的声线差别大,就用 generate_speech 按声线单独生成该句台词,在时间轴上替换。
- 配乐用 generate_music,至少一条全片配乐;情绪明显转折时分段生成。旁白用 generate_speech。
- 一次回复最多 3 次工具调用,每批回来先给用户看再继续。
- 交付清单:按分镜顺序列出每个镜头视频、对应台词与声线文件、配乐分段和旁白的时间区间;提示用户在 TVVV 时间轴里叠音轨、加字幕并导出。
## 注意事项
- **擅自改剧本**:模型很容易「顺手润色」台词。生成前逐字对照定稿剧本,一个字都别改。
- **声线漂移**:同一角色不同镜头声音不一样是最常见的翻车。先定样音、让用户确认,后面统一参照,不对就单独补配。
- **人物换脸**:每个镜头都要带角色参考图,多造型角色以首张图为基准衍生。
- **碎镜头**:拆成太多 3 秒短镜,叙事断裂、成本上升。优先 10-15 秒长镜头内切。
- **多出背景音乐和字幕**:忘写 `no music`、`no subtitles`,后期就很难处理。