
参考视频翻拍
照着一条参考视频的镜头和节奏,换成你的角色或产品重拍一遍
照这条参考视频的镜头节奏翻拍一遍,把主角换成我上传的这款咖啡杯
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 参考视频翻拍
适合「我看到一条很好的视频,想照它的镜头语言做一条自己的」:保留参考视频的剪辑点、景别、运镜、构图和节奏,只把「谁在做什么、主角是哪个产品或角色」换成用户自己的。整个过程分阶段停下来让用户确认,是人和 AI 一起改,不是一键生成。最终交付与参考视频结构对应的 3-10 个镜头、总长与参考相近的成片,带配乐,有对白或旁白时一并生成。
## 开工前确认
- 必须有参考:一条参考视频;如果无法直接读取视频,请用户提供关键截图,或用文字按时间写出每段画面。
- 要替换成什么:用户自己的角色照片、产品图、场景图,或一句文字说明(例如「换成一只橘猫」「换成我们的新耳机」)。没有图就由 AI 生成。
- 用 ask_user 一次问一个:画幅(默认跟参考一致,竖屏短视频默认 9:16)、语言(对白和旁白)、是否保留参考里的对白结构。
- 用户已经给了的素材直接用,不重复生成。
## 制作流程
1. **参考拆解** —— 在回复里按时间段拆解参考视频,每段写一段自然语言:人物动作、台词、场景与背景动态、构图、运镜、景别与角度。不要每个剪辑点都开一段,按「完整的一个叙事节拍」分段,一段可以包含多次切镜,但不超过 15 秒。同时挑出每段最有代表性的画面作为构图参考(关键帧)。
2. **项目设定** —— 设定表:标题、类型、画幅、总时长、画风、语言、替换对象。**停下确认。**
3. **元素与分镜** —— 元素卡(角色 / 产品 / 场景 / 道具),分镜表与拆解一一对应。**停下确认。**
4. **元素图** —— 生成或绑定角色三视图、产品图、场景图。**展示确认。**
5. **关键帧** —— 每个镜头用元素图 + 参考构图出一张关键帧(首帧或高光帧)。**展示确认。**
6. **逐镜生成视频** —— 每镜带元素图和该镜关键帧,分批生成,回来确认。
7. **声音** —— 配乐、旁白按分镜生成,确认。
8. **交付清单** —— 剪辑顺序和音轨混合说明。
## 风格锁定
- 画风默认跟随参考视频;用户要求换风格时,在设定表里明确写新的画风关键词,每个提示词都带。
- 像导演和调色师给团队下指令那样写,六件事揉进一段流畅的英文描述(不要分标签罗列):
1. **专业风格词**:用具体的影像流派和质感词,比单说「电影感」准确得多,例如 neo-noir、Kodak Portra film look、high-key commercial。
2. **景别与镜头**:明确写过肩、荷兰角、特写、中景等。
3. **光线**:写清主光,并强调暗部和明暗对比,例如 strong chiaroscuro、deep facial shadows。
4. **调色**:克制,一个主色调占画面约 90%(例如深青色暗部),除非用户要求,否则不要红蓝霓虹撞色。
5. **渲染质感**:细节、柔焦、颗粒等。
6. **情绪与潜台词**:把人物定格在有戏的一刻,写微表情;拒绝摆拍。物体写它的状态和气场。
- 只写画面里看得见的东西,不解释动机、不写画外。画面里需要文字时用引号包住原文,例如 `a sign reads "OPEN"`。
## 分镜与镜头规则
- **一一对应**:每个镜头对应拆解里的一段,保留原剪辑点、景别、运镜、构图和节奏,只替换主体。
- **长镜内切**:优先一个镜头 8-10 秒内含 2-3 次切镜,而不是拆成很多 2 秒碎镜。写法:「镜头1:[场景],[角色]做 X,特写。切到镜头2:……切到镜头3:……」。
- **不要按秒排程**:模型执行不了「第 2 秒做什么」这种精确时间,按先后顺序描述即可。
- 每镜必须写:场景(用场景元素名)、故事内容(动作、台词原文、表演)、镜头语言(景别、角度、运镜)、用哪张关键帧做构图参考。
- **元素卡**:角色如有多种造型(换装、不同年龄)分别写「造型1 / 造型2」,并写声线;场景写清重要物件的位置和朝向,尤其是主要表演区域;产品写形状、材质、颜色、尺寸、标识。
- **关键帧三种**:首帧——动作开始前的预备姿态、视线方向、环境初始状态、机位起点;尾帧——动作完成后的姿态和表情、环境变化后、为下一镜准备好的机位;高光帧——全镜最有冲击力的瞬间(撞击顶点、恍然大悟的脸),要能单独当海报用。
- 分镜表字段:镜号 / 对应参考时间段 / 时长 / 场景 / 出场元素 / 内部切镜与动作 / 台词 / 景别·角度·运镜 / 关键帧 / 声音。
## 提示词写法
- **元素图**:主体与身份(年龄、体型、显著特征、声线)→ 必须跨镜一致的细节(五官、发型发色、服装材质与颜色;产品的形状材质颜色、标识)→ 情绪基调。角色优先出正 / 侧 / 背三视图。
```
Character sheet, front, side and back views on a plain light grey background. A woman in her late twenties, sharp jawline, almond eyes, shoulder-length black hair with a center part, oversized camel wool coat, cream turtleneck, slim black trousers, white sneakers, small silver hoop earrings. Calm, self-assured presence. Soft even studio light, fine detailed rendering.
```
- **关键帧**:只描述那一个定格瞬间的静态画面。
```
图1 is the woman, 图2 is the cafe scene. Over-the-shoulder medium close-up in a sunlit corner cafe: she lifts the ceramic mug to her lips, eyes half-closed, steam curling past her cheek, window light raking from the left and leaving the right side of her face in soft shadow. Muted warm-beige grade dominating the frame, Kodak Portra film look, fine grain, quiet intimate mood.
```
- **视频提示词**按「镜头 → 主体 → 空间 → 声音」写;动作落到具体身体部位,并写幅度和速度;多节拍按顺序列出主动作和次要动作。
- 声音包装:音乐用 `(...)`,音效用 `<...>`,对白直接写;非项目语言的台词先标语言,例如 `says in Japanese: こんにちは`;画面标题用 `【...】`。
```
Shot 1: 图1 she carefully sets the mug down on the wooden table with a soft clink, fixed camera, sunlight shifts across the table. Shot 2: cut to a close-up of the mug, steam rising, slow push-in. Shot 3: cut to 图1 she looks up and slightly turns her head toward the window, a small smile. <soft ceramic clink> <cafe ambience>. No music, no subtitles.
```
- 有独立旁白音轨的镜头,视频提示词里不要写旁白文本;几乎每镜都写 no music 和 no subtitles。
## 在 TVVV 上执行
- 元素图和关键帧用 generate_image,默认 Nano Banana 2;同一角色的不同造型以第一张为 reference 再生成。产品包装、招牌、片名等需要精确文字时用 GPT Image 2。用户上传的照片、产品图直接放进 reference_images 用,不重新生成。
- 每镜 generate_video:默认 Seedance 2.5、720p、设定画幅,单镜 5-10 秒(对应参考段落长时最多 15 秒);reference_images 同时带元素图N(image_role 为 reference)和该镜关键帧N(要严格复刻开场构图时设为 first_frame,只做构图参考时设为 reference)。
- 旁白或独立对白用 generate_speech,声线按元素卡描述,全片同一角色保持一致;配乐用 generate_music,风格和节奏对齐参考,参考里情绪有明显分段时分段生成。
- 一次回复最多 3-4 次工具调用,按 2-3 镜一批,每批回来先确认再继续。
- 交付清单:按镜号列视频及对应的参考时间段、建议剪辑顺序;镜头里没有对白的,剪辑时把视频自带声音静音,只用配乐和音效层,避免和混音打架;字幕在剪辑时加。提示用户去 TVVV 时间轴合成导出。
## 注意事项
- **拆得太碎**:每个剪辑点一个镜头,会生成一堆不连贯的碎片。按叙事节拍合并,在一个镜头里写多次切镜。
- **只换了主体没换道具**:参考里的旧产品、旧 logo 会残留。元素卡里写清所有要替换的东西,提示词里不出现原品牌。
- **构图跑偏**:没带关键帧时模型会自由发挥。每镜都带关键帧,关键帧本身先让用户确认。
- **配乐重复**:视频自带音乐加上后期配乐会打架,视频提示词坚持写 no music。
- **版权**:只学习参考的镜头语言和节奏,不直接复用原视频画面、原声或他人肖像;参考里是真人明星时,替换成用户自己的角色。