
Y2K 3D卡通MV
上传歌曲和照片,生成千禧风3D卡通女团MV,歌词变气球字跟着跳
用我上传的这首歌做一支Y2K 3D卡通MV,我当主唱,再配两个默认伴舞
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# Y2K 3D卡通MV
适合把一首歌(K-pop、流行、电子、说唱都行)做成千禧年风格的 3D 卡通女团 MV:大眼睛、亮晶晶嘴唇、「又甜又拽」的人设,粉蓝渐变的摄影棚里飘满充气气球字,角色对口型唱歌、踩点跳舞、拍打气球字。最终交付一支与原曲等长的 16:9 MV:若干段 10 秒左右的视频片段 + 用户原曲作为唯一音轨。
## 开工前确认
- **歌曲必须由用户上传**,不能用 AI 另生成或替换,全片音轨就是这首原曲。
- **角色方案**:用 ask_user 先问一个问题——「只有主唱一个人,还是主唱 + 伴舞(最多 1 主唱 + 2 伴舞)?」。每个角色可单独选择上传照片(按照片长相卡通化)或用默认形象,不必全部上传。
- **歌词**:请用户贴出歌词,最好带每句的起止秒数;没有时间码就根据用户描述的段落(前奏/主歌/副歌)估算并让用户核对。是纯音乐就走「无歌词模式」,用装饰短语代替歌词。歌词只能来自原曲,**不能自己编、改写或翻译**,原文是中文就用中文、韩文就用韩文。
- 还要确认:歌曲总时长、BPM 大概多少(不知道就按听感分为快/中/慢)。
## 制作流程
1. **角色方案** —— 表格列出每个角色:编号、主唱/伴舞、照片或默认、形象要点。确认后继续。
2. **音乐结构表** —— 按段落列出:段落名、起止秒、强度(高/中/低)、建议切镜频率、这一段的歌词(逐句带秒数)。确认歌词一字不差再继续。
3. **角色卡 + 场景卡** —— 每个角色一张纯白底横版设定图(左:头肩特写,右:全身含鞋),**角色图里不能有任何背景或道具**;场景另出 2-3 张无人的粉蓝渐变摄影棚(高能段更浓烈、低能段更柔和)。确认后继续。
4. **分段分镜** —— 按音乐时间轴切成连续片段(每段 5-10 秒,片段之间无缝、无重叠,覆盖整首歌),每段内写多个镜头。展示后确认。
5. **逐段生成视频** —— 每段都直接带角色卡和场景卡作参考,不做中间关键帧。每批回来先看口型和气球字,再继续下一批。
6. **交付** —— 给出按时间码排列的片段清单,提示用户在 TVVV 时间轴里铺原曲、对齐片段。
## 风格锁定
- 统一关键词:`Y2K 3D cartoon, clean glossy plastic texture, octane render style, big expressive eyes, glossy lips, cute and sassy, pink-to-blue gradient studio, candy pastel palette, soft glow`。
- 默认角色(未上传照片时):
- 主唱:金色双马尾、水晶泪痕妆、拿银色麦克风、粉蓝罗纹短款针织上衣。
- 伴舞 1:粉色头发、浅紫色蓬松人造毛外套、珍珠项链、自信表情。
- 伴舞 2:黑发、粉色爱心墨镜、彩色美甲配粗戒指、星星配饰,常把手伸向镜头。
- 群像时服装用牛仔、毛绒外套、粉彩上衣等千禧单品。只有主唱时用金发主唱形象。
- 用户上传照片的角色:脸型、发型、五官按照片走,服装配饰换成 Y2K 风,质感仍是光滑塑料感 3D 卡通,**不要做成韩系 Q 版娃娃**。
- 场景道具库:充气气球字、金属链条、发光爱心贴纸、Error 404 弹窗、REC 取景框 UI、像素图案、爱心棒棒糖。
- 气球字:3D 充气质感、亮面塑料、糖果粉紫蓝、带微光。
- 必须避免:写实皮肤、暗黑配色、角色图混进背景、Q 版大头娃娃、画面里出现与歌词无关的乱码字。
## 分镜与镜头规则
- **按音乐结构切,不按固定时长切**:切点落在节拍和小节线上。
- 切镜频率随强度变:高能段(副歌、说唱)每 0.8-1.2 秒一切;中能段(主歌)1.5-2.5 秒一切;低能段(前奏、桥段、尾奏)3-5 秒一切或一镜到底。
- 每段片段里的每个镜头都是连续的一镜,不在镜头内部再剪;镜头之间用景别或机位变化来切。
- 景别以特写(CU)和中近景(MCU)为主;运镜用滑动变焦(dolly zoom)、轻微手持晃动、快速推拉、三联屏同步舞等。
- **口型**(有歌词时):主唱写明「singing into the microphone, lip-sync matching "歌词原文"」,并标明这句在本段第几秒开始、唱几秒;伴舞只写「dancing to the beat」。
- **气球字**:有歌词时,本段正在唱的每一句都要出现在画面里,长句拆成 2-4 个字一组,分布在前景、中景、背景,不重叠;无歌词时每镜换一个 Y2K 装饰短语(RUN NOW、UNSTOPPABLE、NO APOLOGY、PINK OUT、BREAK THE LIMIT),不要重复。
- **角色与字互动**:每个镜头至少一次,且轮换类型——抓住拨开、拍一下让它弹、踩上去、戳破、当球抛接、靠在上面、穿过去、戴在身上。
- 分镜表字段:段号与起止秒 / 镜号 / 场景卡 / 角色与动作(含口型或伴舞)/ 气球字内容 / 互动方式 / 景别运镜 / 切镜频率。
## 提示词写法
- **图片结构(角色卡)**:Y2K 3D 卡通角色设定 → 照片长相锁定或默认形象 → 发型妆容 → 服装配饰鞋 → 表情人设 → 纯白背景 + 横版版式。
- 图片示例:
```
Y2K 3D cartoon character sheet, clean glossy plastic texture, octane render style. Use 图1 as the face reference: keep her face shape, eye shape, hairstyle and skin tone. Big expressive eyes, glossy lips, cute and sassy attitude, crystal tear-drop makeup, holding a silver microphone, pink-and-blue ribbed cropped knit top, low-rise light denim, chunky white platform sneakers. Pure white background, no props, no scenery. Horizontal layout: head-and-shoulders close-up on the left, full body with shoes on the right.
```
- **视频结构**:参考绑定(角色图 + 场景图分开写)→ 本段对应原曲的时间范围 → 逐镜:景别运镜 → 动作 + 口型时间 → 气球字原文与位置 → 互动 → 风格锁定 → 负面。
- 文字一律放在引号里表示「必须原样渲染」;中文歌词额外写 `render the exact Chinese characters in quotes as 3D bubble text`。
- 视频示例:
```
图1 lead singer, 图2 backup dancer, 图3 pink-to-blue gradient studio. This segment covers 0:30-0:40 of the song (chorus, high energy). Shot 1 (0-1.2s): close-up, quick zoom in, 图1 singing into the silver microphone, lip-sync "不想放弃" starting at 0.3s for 1.0s, inflatable bubble text "不想" floating in the foreground, she slaps it and it bounces away. Shot 2 (1.2-2.4s): medium close-up, slight handheld shake, 图1 and 图2 hit the same arm pose on the beat, 图2 dancing to the beat, bubble text "放弃" behind them. Shot 3 (2.4-4s): dolly zoom, 图1 stomps on a giant bubble letter "向前跑" lip-syncing it at 2.6s. Render the exact Chinese characters in quotes as 3D bubble text. Y2K 3D cartoon, glossy plastic, octane render style, candy pastel glow. No realistic skin, no extra text.
```
## 在 TVVV 上执行
- 角色卡和场景卡用 generate_image:画面里要带精确文字(气球字样张)时用 GPT Image 2,其他用 Nano Banana 2;上传照片的角色把照片放进 reference_images(reference)。
- 每段 generate_video:默认 Seedance 2.5、720p、16:9,每段 5-10 秒;reference_images 同时带上本段出场的角色卡 图N 和场景卡 图N,都设为 reference,**角色和场景分开传,不要合成一张图**。不要先出关键帧再转视频。
- 片段划分:从 0 秒开始连续往后排,最后一段不足 5 秒时从前一段匀几秒过来,保证每段 5-10 秒。每段提示词里写清它对应原曲的起止秒。
- 不调用 generate_music、不生成配音;视频自带的声音在剪辑时全部静音,只保留用户原曲。
- 一次回复最多 3-4 段视频;一首 3 分钟的歌约 20 段,分 5-6 批生成,每批回来检查口型、气球字有没有错字,再继续。
- 交付清单:片段编号 + 对应原曲时间码;提示用户在 TVVV 时间轴里把原曲铺在 0:00,片段按时间码首尾相接、零间隙零重叠放好,视频原声静音;转场以硬切为主,可在副歌前后加 Error 404 弹窗闪、REC 取景框切换、像素转场。生成时长有微小误差时,按时间码把每段裁到准确长度,避免越到后面口型越对不上。
## 注意事项
- **歌词被改成英文**:模型爱把中文歌词替换成 RUN NOW 之类的示例短语。示例短语只用于无歌词模式,有歌词时引号里必须是原文。
- **气球字写错**:中文一组控制在 2-4 个字,越短越准;错字严重的那一段直接重生成。
- **口型漂移**:片段不按原曲绝对时间码对齐,第三段以后就会全错位。生成前写清起止秒,剪辑时按时间码放。
- **角色被背景污染**:角色卡必须纯白底,场景卡必须无人,两者分开当参考。
- **照片角色变 Q 版**:提示词里写明保持照片的脸型五官、正常头身比,不要 chibi。
- **节奏平均**:整首歌都 2 秒一切会很闷;副歌加快、桥段放慢,让画面跟着情绪起伏。