
上传歌曲做MV
上传一首歌,按节拍和歌词分镜,生成叙事+演唱结合的完整MV
用我上传的这首抒情歌做一支MV,讲一对异地恋人在雨夜各自想念对方
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 上传歌曲做MV
适合手里已经有一首歌(自己唱的、乐队作品、AI 生成的都行),想要一支完整 MV 的需求。我们按歌曲的段落、节拍和每句歌词的时间来分镜,把「叙事表演」和「对口型演唱」穿插起来:前奏和不重要的段落走故事画面,副歌高潮、说唱段落给演唱特写。最终交付与原曲等长的 MV 片段清单(通常 3 分钟歌 25-35 个镜头),音轨就是用户原曲。
## 开工前确认
- **歌曲必须由用户上传**,它就是全片唯一的背景音乐,不另生成配乐,也不加旁白(用户明确要才加)。
- 请用户贴出歌词,最好带每句起止时间;没有时间码就按用户描述的段落估算,并请用户核对关键句(副歌第一句、说唱起点)。
- 用户已有的角色照片、人设图、场景图要先用上,不要重复生成。
- 用 ask_user 一次只问一个最影响结果的问题,通常是「MV 讲什么故事 / 什么氛围」;用户没想法就根据歌词意境提 2-3 个方向让他选。
- 其余参数直接给默认值让用户确认:16:9、720p、写实电影感、语言随歌词。
## 制作流程
1. **音乐结构表** —— 在回复里用表格列出:段落(前奏 / 主歌 / 导歌 / 副歌 / 桥段 / 尾奏)、起止秒、BPM 或快慢、强拍位置、每句歌词起止秒。停下确认。
2. **项目设定** —— 片名、故事梗概、视觉风格、色调、画幅、主角人数与人设(含声线描述)。确认后继续。
3. **分镜表** —— 列出所有镜头,每镜标注类型(叙事 / 演唱)、起止秒、对应歌词、场景、景别机位运镜、动作。停下确认。
4. **角色 / 场景 / 道具图** —— 每个角色一张全身三视图(正、侧、背,必须看得到鞋和完整服装轮廓),同一角色换装或换年龄时以前一张为参考出新造型;关键场景各一张。确认后继续。
5. **逐镜关键帧** —— 每镜一张首帧图,引用该镜涉及的角色/场景图,同时引用「同组里最相近的上一张关键帧」,锁住站位、朝向、表情这些参考图定义不了的细节。确认后继续。
6. **逐镜视频** —— 叙事镜头和演唱镜头分开写提示词,分批生成,每批回来确认。
7. **交付** —— 给出按时间码排好的镜头清单和剪辑方法。
## 风格锁定
- 每条图片提示词都融合六件事(写成通顺的一段英文,不要分标签):
1. **专业风格词**:不只写「Neo-Noir」,而写具体的视觉流派与参照,如 `neo-noir thriller look, rain-soaked urban night`。
2. **构图与景别**:过肩、荷兰角、特写、中景,明确写出。
3. **布光**:写清主光方向,并强调负补光(negative fill)拉开反差,例如 `strong chiaroscuro, deep shadows sculpting the face`。
4. **调色**:克制调色,约 90% 画面由一个主色统治,例如 `deep teal shadows dominating 90% of the frame, zero warm fill`;除非用户要,**禁止红蓝霓虹对撞**。
5. **质感**:`fine rendering, rich intricate detail, subtle soft-focus`。
6. **情绪潜台词**:把动作冻结在有戏的瞬间,写微表情,例如 `quiet longing, breath held`,不要摆拍感。
- 有关键材质(旧皮衣、粗针毛衣)就写材质;画面里有文字时把要渲染的字放进引号。
- 只描述看得见的东西,不写人物动机和心理解释,不写画外元素。
- 必须避免:红蓝霓虹撞色、满屏高饱和、字幕、乱入的背景音乐、真人明星脸、品牌 logo。
## 分镜与镜头规则
- **歌词完整原则**:一个镜头里的歌词必须是完整的一句或一个短语,绝不在半句中间切镜。
- **±1 秒缓冲**:镜头起点放在该句第一个字前 1 秒,终点放在最后一个字后 1 秒;如果缓冲和相邻镜头重叠,就合并、在自然断句处重新切,或调整边界,但仍保证每个镜头的歌词完整。
- 单镜 5-10 秒;快歌副歌可以一句一镜,慢歌主歌可以两句一镜。
- 叙事与演唱的配比:前奏、间奏、主歌前半多用叙事;副歌高潮、说唱、最后一遍副歌用演唱特写。一般演唱镜头占 30-40%。
- 演唱镜头景别以中近景、近景为主,镜头缓慢环绕或推近;叙事镜头多用中景、全景和运动镜头交代空间。
- 每个镜头都写:场景与元素 + 景别 + 角度 + 运镜。
- 分镜表字段:镜号 / 类型 / 起止秒 / 歌词 / 场景 / 角色 / 景别角度 / 运镜 / 动作与表情。
## 提示词写法
- **图片(角色卡)结构**:元素类型 → 身份特征(年龄、体型、显著特征、声线)→ 五官发型 → 服装材质颜色状态 → 情绪基调 → 全身三视图版式。
- **图片(关键帧)结构**:先在镜头描述里找到这一刻(起始帧 = 动作开始前的姿态和视线;高光帧 = 冲击最强、情绪最浓的瞬间),只描述那一瞬间的静态画面。
- 关键帧示例:
```
Medium close-up through a rain-streaked apartment window at night, a young woman in a thick cream knit sweater sits on the sill with her forehead almost touching the glass, phone glowing faintly in her hand. Neo-noir romantic drama look, city lights dissolving into soft bokeh behind her. Single cool key light from the window side, negative fill leaving the far cheek in deep shadow. Deep teal dominating 90% of the frame, a tiny warm glint from the phone screen, zero neon clash. Fine rendering, intricate rain droplets, subtle soft focus. Quiet longing, breath held, lips slightly parted.
```
- **视频结构**:主体锚点(一句话认出是谁)→ 主体动作(按先后顺序,带幅度副词)→ 背景变化 → 运镜(固定镜头也要写 static camera)→ 负面。只写变化和运动,不重复描述首帧里已经有的静态细节。
- 演唱镜头额外写清「被音乐驱动的状态」:在唱、边哭边唱、在说唱。模板:运镜 + 情绪 + 演唱状态 + 具体肢体动作 + 可选背景事件。
- 演唱示例:
```
图1 as the first frame. The camera slowly orbits as the woman turns from the window to face the lens, singing with a soulful, aching expression, lip-sync to "我在雨里等你回来". She presses one hand to her chest, then lets her head tilt back against the glass, eyes closing on the last word. Rain shadows ripple across her face in rhythm. No music, no subtitles.
```
- 叙事示例:`图1 as the first frame. Handheld follow shot: the man walks quickly through the rain-soaked crosswalk, stops abruptly, and looks back over his shoulder. Neon reflections ripple on the wet asphalt. No music, no subtitles.`
## 在 TVVV 上执行
- 角色、场景、道具图用 generate_image,默认 Nano Banana 2;画面里有招牌、短信界面等精确文字时用 GPT Image 2。换装、换年龄以第一版角色图为参考。
- 关键帧也用 generate_image:reference_images 带上该镜的角色/场景图 图N,再加上一张最相近的已生成关键帧 图N;同一批里后面的镜头引用前面的。
- 视频用 generate_video,默认 Seedance 2.5、720p、16:9,单镜 5-10 秒;reference_images 里关键帧设为 first_frame,角色图设为 reference。演唱镜头在提示词里写出该句歌词原文和演唱状态;口型精度有限时,演唱镜头尽量控制在一句以内,多用侧脸、半身、逆光,减少正脸长时间对口型。
- 所有视频提示词都写 no music、no subtitles。不调用 generate_music;只有用户明确要旁白时才用 generate_speech。
- 一次回复最多 4-6 次工具调用;3 分钟的歌按段落分 5-6 批(前奏+主歌一批、副歌一批…),每批回来确认再继续。
- 交付清单:镜头编号 + 起止秒 + 歌词 + 对应视频。提示用户在 TVVV 时间轴里把原曲铺在 0:00,视频原声全部静音,按时间码对齐每个镜头;演唱镜头不变速、不挪位置,两个演唱镜头之间有空档时用最合适的叙事镜头补上;字幕最后在剪辑里加。
## 注意事项
- **半句歌词被切断**:最伤口型和观感。分镜时先按歌词断句,再按 ±1 秒缓冲定边界。
- **角色前后不像一个人**:每个镜头都带同一张角色三视图,再带上一张相似关键帧,衣服描述逐字复用。
- **画面自带音乐或字幕**:视频提示词不写 no music、no subtitles,剪辑时就会和原曲打架。
- **调色花哨**:红蓝霓虹是 AI 默认审美,会让 MV 廉价。坚持一个主色统治 90% 画面。
- **被拦截**:真人明星换成「虚构的某外形演员」,品牌换成通用描述,血腥换成紧张氛围;涉及政治人物、敏感历史、违法内容的直接告知无法生成,不要改写硬闯。
- **不要一口气跑完**:设定、分镜、角色图、关键帧、视频每一步都停下给用户看,返工成本最低。