
声音先行音画同步
先做好对白、旁白与配乐并锁定时间轴,再按时间码逐镜出画面
先做一段40秒的播客式双人对话音频,讲第一次去冬天的游乐园,再按声音配画面
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 声音先行音画同步
适合对口型、节奏和音画卡点要求高的项目:双人对谈、旁白纪录片、音乐叙事、广告口播、带强烈音效节点的短剧。思路反过来:先把镜头结构定死,再把声音做完并锁定,最后以声音的真实时间码为唯一依据去生成每个镜头的画面。最终交付 4-10 个镜头、30-120 秒的短片,声音是唯一主轨,画面每个动作都卡在声音上。
## 开工前确认
- 需要用户提供主题或剧本;有现成的录音、配音、歌曲就直接作为主轨,跳过声音生成。没有时帮用户写稿。
- 需要确认:总时长、对白语言、是否需要角色声音跨镜一致。用 ask_user 一次只问一个,其余给默认值。
- 用户上传的角色、场景、道具图优先绑定,不重复生成。
## 制作流程
1. **项目设定** —— 表格列出:主题、总时长、画幅、画风、对白语言、角色声音一致性要求。等确认。
2. **初版分镜(锁结构)** —— 先定死镜头数量、顺序、叙事目的和每镜预计时长(每镜 4-14 秒),并为每镜规划声音层:哪句台词、谁说、什么语气节奏,旁白、环境声、音效、配乐、停顿和叠加关系。**这一版的镜头数之后不能再增删或重排。** 停下等确认。
3. **生成声音** —— 按初版分镜生成全部声音:对白和旁白用 generate_speech,配乐用 generate_music。多角色时每个角色固定一种声音设定,所有台词都用同一设定。生成后给用户试听确认。
4. **声音事件表** —— 把声音逐条落成表:全片绝对时间、镜内相对时间、事件类型(对白/旁白/音乐变化/音效/停顿)、说话人、准确文本。只记录真正听得到的内容,不脑补。
5. **视觉资产** —— 用 generate_image 出角色、场景、道具参考,外貌要和声音里的人物身份、年龄、情绪匹配。确认后进入下一步。
6. **按时间码更新分镜** —— 以声音事件表为唯一依据,重写每个已有镜头的细节:每个声音事件对应的可见动作、表情、视线、道具互动和运镜。只细化,不增删镜头。停下确认。
7. **关键帧 + 逐镜视频** —— 每镜先出一张关键帧,确认后用它生成视频。
8. **交付清单** —— 画面与声音的对齐表和剪辑说明。
## 风格锁定
- 画风由项目设定决定,统一关键词每个提示词都带,例如写实纪录:`natural documentary look, soft practical light, handheld observational camera, true-to-life skin texture`。
- 声音是主角:画面不抢戏,动作要「接得住」声音——说话人在说话,听的人在反应,音效响起时画面里要有发声源。
- 必须避免:画面里出现声音中没有的事件(比如没敲门声却拍敲门)、自带背景音乐、字幕。
## 分镜与镜头规则
- 每个镜头时长 4-14 秒,所有镜头的时间段首尾相接、不重叠、正好覆盖整条声音时间轴。
- 每镜同时记录全片时间和镜内时间。例:第 2 镜覆盖全片 15.0-29.9 秒,某句台词在全片 15.2-16.5 秒,就写成镜内 0.2-1.5 秒。
- 一个声音事件对应一个可见动作:第一句台词时人物开口、蒸汽嘶响时人物转身看向火车、下一句台词时人物回头看镜头。顺序、时长、并行关系逐条对上,不提前、不延后、不增减。
- 对话戏的机位:说话人中近景为主,停顿处切听者反应;长段独白每 4-6 秒换一次景别或加一个手部动作,避免死板。
- 每镜定一张关键帧:选该镜叙事最强的瞬间,包含第一段动作所需的人物、场景、道具和构图。
- 分镜表字段:镜号 / 全片时间 / 镜内时间 / 场景 / 角色 / 声音事件 / 对应画面动作 / 景别 / 角度 / 运镜 / 关键帧描述。
## 提示词写法
- **对白/旁白声音提示**(generate_speech):说话人身份 → 性别年龄 → 音色、语气、口音、语速 → 表演细节(停顿、呼吸、重音、犹豫、情绪转折)→ 要说的原文。表演指示和要说的话分开写清楚,原文一字不改。
- 声音示例:
```
主播A,成年男性播客主持人,偏低的略带沙哑的嗓音,吐字清楚,语速稍快。先用平静自然的讲故事语气说:「欠一个人的,不是还一两次就能还清的,对吧?那是……一辈子的事。」短暂停顿后加一点重音,笃定地接着说:「所以这次去游乐园,主要就是这两个原因。」
```
- **关键帧图片提示词**:场景 → 人物位置与姿态(第一段动作的起点)→ 景别角度 → 光线 → 画风。只画该时刻可见的内容。
- **视频提示词结构**:首帧声明 → 按声音事件顺序写可见动作(不写秒数)→ 运镜 → 负面词。不在视频提示词里重写整段台词,也不要求模型生成音乐和额外音效。
- 视频示例:
```
图1 is the first frame. Two hosts sit at a wooden desk with microphones. As the first host starts telling the story, he leans back and gestures loosely with one hand; the second host nods and smiles. When he pauses and adds emphasis, he taps the desk once. When his voice rises with surprise, the second host laughs and covers her mouth. Slow handheld drift between the two. Warm practical lamps, natural skin texture. No music, no subtitles, no extra sound effects.
```
## 在 TVVV 上执行
- 第 3 步:对白和旁白用 generate_speech,每个角色固定一套声音描述并在所有台词里复用;配乐用 generate_music,时长按总时长给。超过 2 分钟的项目按段落分批生成声音,每段不超过 2 分钟。
- 第 5、7 步:角色、场景参考用 generate_image(默认 Nano Banana 2;画面里有精确文字时用 GPT Image 2)。关键帧也用 generate_image,reference_images 带角色图N和场景图N。
- 视频用 generate_video,reference_images 里关键帧设为 first_frame,角色图设为 reference。默认模型 Seedance 2.5,720p,默认 16:9,单镜时长按声音事件表定,通常 5-10 秒;声音段落较长的镜头按自然停顿拆成两段生成。只有与上一镜动作完全连续时,才用上一镜尾帧做首帧。
- 视频提示词固定写 `no music, no subtitles`,生成后把视频自带的声音静音或大幅压低,以我们生成的声音为唯一主轨。
- 一次回复最多 4 次工具调用:声音一批、参考图一批、关键帧一批、视频分批。
- 交付清单:每个镜头对应的视频与声音时间段、对齐顺序;提示用户在 TVVV 时间轴里先铺声音主轨,再按全片时间码把视频逐个对齐,跨镜的环境声和配乐只在原有时长内做短淡入淡出。
## 注意事项
- **声音做完又改镜头**:初版分镜锁死后不再增删重排;画面对不上时重做画面,不动声音和时间映射。
- **画面多出声音里没有的事件**:每条动作都要能在声音事件表里找到依据。
- **双重声音打架**:视频模型自带的对白、配乐会和主轨重叠产生回声,一律静音或压低。
- **角色声音漂移**:同一角色所有台词使用完全相同的声音描述,不满意就整套重做,不要混用不同版本。
- **口型对不上**:对白镜头尽量让说话人侧脸或中景,长台词拆镜,降低口型误差的显眼程度。