
视频主角替换
把喜欢的视频片段里的人或背景换成你,保留原来的运镜、动作节奏和色调
这是一段电影片段的截图和我的正脸照,把里面的男主角换成我,动作和运镜保持原样
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 视频主角替换
适合「我想演那段视频」的需求:把一段短视频或电影片段里的人物、脸、全身或背景换成用户指定的样子,镜头怎么动、人怎么动、片子什么色调都尽量跟原片一致。TVVV 的视频生成以图片为输入,所以做法是:把原片按镜头拆开,每个镜头取首帧和尾帧截图,先在图上完成替换,再用首尾帧生成这一段视频,最后按原片节奏拼回去。交付:每个镜头的替换后视频 + 拼接顺序 + 质检表,时长与原片对齐,原声可以在时间轴上直接垫回去。
## 开工前确认
- 需要两类素材,缺一样就停下来说明:
1. **原片截图**:每个镜头的第一帧和最后一帧(镜头里动作变化大的,中间再截 1 张)。用户只发了视频文件时,请他用播放器暂停截图,或者在 TVVV 时间轴里逐镜截帧后发过来;同时请他说一下原片总长和每个镜头大概几秒到几秒。
2. **替换目标**:换人 / 换脸要正脸清晰照(最好再加一张全身照);换背景要背景参考图或一段文字描述。
- 第一个 ask_user:替换模式 —— 换整个人 / 只换脸 / 换背景 / 人和背景都换。
- 参考照质量先检查,问题分三级:
- 必须处理:脸部区域小于约 200×200 像素、长边不到 400 像素。直接告诉用户「参考图清晰度不够,替换结果会不稳定」,建议补一张正面近照;用户确实没有时,问他是否允许 AI 根据现有照片先补一张正面参考图(补出来也要他确认)。
- 建议补充:脸被遮挡超过 30%、侧脸超过 45°、强逆光或过曝欠曝、全身照只拍到半身。给两个选项:继续用 / 重新上传,继续用就在后面每镜的确认卡里提示这个风险。
- 可以直接用:正脸、光线均匀、无遮挡。
- 不替换成真实明星或公众人物的脸;用户上传他人照片时,确认他有使用授权。
## 制作流程
1. **模式与素材确认** —— 列出:替换模式、原片总时长、截图数量、参考图评估结论。
2. **镜头拆解表** —— 根据截图和用户描述,在回复里给出完整的镜头表(字段见下)。告诉用户任何一格都可以改,比如「把第 3 镜改成 4.0-6.5 秒」「第 2 镜运镜改成慢慢右摇」,改完立刻重出整张表,直到他确认全部无误。表后附上原片的色彩基准:色温(偏暖 / 中性 / 偏冷,估个 K 值)、亮度、对比、饱和度。
3. **参考特征表** —— 把替换目标的特征列成表:五官、肤色、发型、脸型、体型、服装;或背景的场景类型、光线方向、色调、空间层次。确认这就是用户想要的。
4. **逐镜替换首尾帧** —— 用原片截图 + 参考照生成替换后的首帧和尾帧,构图、姿势、光线、色调与原截图一致,只换目标部分。每镜的两张图给用户看。
5. **逐镜生成视频** —— 用替换后的首尾帧生成该镜视频。每出一镜给一张确认卡,确认后才做下一镜。
6. **拼接与质检** —— 按原片时间顺序给出拼接清单和质检表,引导用户去时间轴合成并垫回原声。
## 风格锁定
- 这个 skill 没有自己的画风,**原片就是风格**。每条提示词都写上原片色彩基准,例如 `match original grading: warm 4300K, medium-low contrast, slightly desaturated, soft haze`。
- 光线跟原片:主光方向、软硬、阴影落点都按截图描述,替换上去的人脸要和原片其他人物同一套光。
- 必须避免:自作主张加滤镜、加新光源、加原片没有的道具或人物、改变构图和景别、加字幕。
## 分镜与镜头规则
- 镜头边界以原片剪辑点为准,精确到 0.1 秒;用户改过的时间段以修改后为准,后面不得自行回调。
- 原片单个镜头超过 10 秒时,按动作停顿点拆成 2 段,中间多截一帧作为接力帧。
- 运镜类型用统一说法:固定 / 推近 / 拉远 / 左→右横摇 / 右→左横摇 / 俯仰 / 跟拍 / 手持晃动 / 下降 / 上升,复合运镜都列出来;速度写慢(每秒不到 5°)/ 中(5-15°)/ 快(超过 15°)或位移距离。
- 难度评估:低 / 中 / 高,并写原因(快速运动模糊、遮挡、光线突变、侧脸多)。高难度镜头提前告诉用户可能要重试 2-3 次。
- 镜头拆解表字段:镜号 / 时间段(如 0.0-3.2s)/ 时长 / 运镜类型 / 运镜速度 / 人物动作(身体、姿态、脸朝向,没人写「无」)/ 背景描述 / 替换难度。
- 每镜替换说明只能复用表里的动作和运镜,不添加原片没有的动作。
## 提示词写法
- **首尾帧替换(图片)结构**:说明 图N 分别是原片截图和身份参考 → 替换对象(把谁换成什么样,写看得见的特征)→ 保留声明(构图、姿势、手势、景别、背景、光线方向完全不变)→ 色彩匹配(原片基准)→ 负面词。
- 图片示例:
```
图1 is a frame from the original clip, 图2 is the identity reference. Replace the man in the gray coat in 图1 with the person in 图2: keep 图2's face shape, eyes, skin tone and short black hair exactly. Keep everything else from 图1 unchanged: same pose mid-stride, same left-to-right head turn, same gray coat, same rainy street background, same framing and lens. Lighting matches 图1: soft key from screen right, wet street reflections. Match original grading: cool 6000K, medium contrast, slightly desaturated. No new objects, no filter, no text.
```
- **视频提示词结构**:首尾帧说明 → 运镜继承声明(「与原片完全一致的运镜:慢速左→右横摇,不添加任何新运镜」)→ 动作保留声明(照抄镜头表里的动作和节奏)→ 身份保持 → 色彩匹配 → 固定负面词 `no added camera movement, no new lighting, no style filter, no subtitles`。
- 视频示例:
```
图1 is the first frame, 图2 is the last frame. Keep exactly the same camera movement as the original shot: slow handheld follow from behind, moving forward at walking speed, no new camera moves. The man walks down the rainy street, glances back over his left shoulder at 2 seconds, then keeps walking; same rhythm and stride as the original. Keep his face identical to 图1 throughout. Match original grading: cool 6000K, medium contrast, slightly desaturated, light rain. Ambient street rain sound only. No added camera movement, no new lighting, no style filter, no subtitles.
```
## 在 TVVV 上执行
- 首尾帧替换用 generate_image,默认 Nano Banana 2,reference_images 带「原片截图 + 身份参考照」(换背景时带「原片截图 + 背景参考」),aspect_ratio 与原片一致,resolution 2K。参考照不合格且用户授权补图时,也用它先补一张正面近照或全身照。
- 视频用 generate_video,默认 Seedance 2.5、720p;aspect_ratio 跟原片(多数横屏片是 16:9,竖屏片 9:16);有首尾两张替换帧时 image_role 用 first_last,只有一张时用 first_frame;duration 设成该镜在原片里的时长(向上取到模型支持的秒数,剪辑时再裁)。
- 原片对白和音乐不要让模型重新生成:提示词只要环境声或把 generate_audio 关掉,最后在时间轴里把原片音轨垫回去,口型对不上的镜头尽量用背影或远景版本。
- 一次回复最多 4 次工具调用:一轮最多做 2 个镜头的首尾帧,或 2 个镜头的视频。
- 每镜确认卡(用表格):镜号(第 N / 共 X 镜)、时间段、替换类型、运镜对比(原片 → 生成结果是否一致)、自评(人物相似度 / 背景融合 / 色彩匹配,各 1-5 星)、已知问题、建议操作(确认继续 / 重做这镜 / 改提示词再试)。任何一项不超过 3 星就写明原因并建议重试。
- 交付质检表:切点有没有跳帧或重影、音画同步(偏差不超过 1 帧)、相邻镜头色调是否突变、运镜方向衔接是否自然、替换边缘有无锯齿光晕、总时长与原片误差不超过 0.1 秒。全部通过就引导用户在 TVVV 时间轴按原片顺序拼接、垫原声、导出;有问题就标出位置和处理建议。
## 注意事项
- **运镜对不上**:只给首帧时模型会自由发挥,尽量每镜都给首尾两帧;运镜复杂的镜头中间再加一帧,拆成两段生成。
- **脸在运动中变形**:快速转头、运动模糊、侧脸多的镜头最容易崩。先告诉用户难度,必要时用远景或背影版本代替。
- **替换帧把别的东西也改了**:图片提示词里明确写「除了目标人物,其他全部保持不变」,出图后和原截图并排对比再进视频。
- **色调断层**:每条提示词都带同一组色彩基准,不要某几镜漏写。
- **不要承诺逐帧一致**:这是按原片重拍,不是原视频上直接抠像;开工前就跟用户说清楚,避免期待落差。