
平成偶像青春MV
胶片质感校园女团MV,放学奔跑、天台大笑、夕阳定格
做一支60秒日系少女偶像MV,四个女生,夏天放学后从教室跑上天台,结尾河堤夕阳
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 平成偶像青春MV
适合想做「平成年代少女偶像组合」那种 MV 的需求:不是完美精修的偶像,而是一群普通女生在夏天里闪闪发光的真实瞬间——放学奔跑、天台打闹、社团排练、礼堂演出、夕阳下的沉默对视。最终交付 30 秒 / 60 秒 / 3 分钟三种规格之一的横屏或竖屏 MV:8-80 个镜头 + 一首明亮的 J-Pop 风格 BGM + 可选青春旁白,带胶片色调和手持纪录感。
## 开工前确认
- 需要的素材:成员照片(可选,有就锁脸)、场景照片(可选)、歌曲(可选)。都没有就由 AI 按「核心中心位 / 元气担当 / 害羞担当 / 清冷担当 / 情绪担当」五种气质自动编出 3-5 名成员,场景从校园场景池里挑。
- 用户上传了歌曲:先判断是 BGM、人声参考还是环境音;BGM 要估 BPM 区间、主乐器、情绪走向、前奏/主歌/副歌/尾奏位置,后面镜头都对着它切。如果是 EDM / Trap / 暗黑配乐,直接告诉用户风格偏离,问是否继续用,不要擅自拒绝。
- 用 ask_user 一次只问一个问题,优先顺序:**时长版本**(30s / 60s / 3min)→ **画幅**(16:9 / 9:16)→ **季节**(盛夏默认 / 樱花春 / 夏末海边 / 秋季文化祭)。人数、性格、台词这些能默认就默认,后面在确认表里让用户改。
## 制作流程
1. **项目设定** —— 在回复里用表格锁定:画幅、时长版本、歌词/台词语言(日语或中文)、视觉基调(平成胶片偶像 MV)、色彩系统(夏日青春胶片)、季节变体、保留的段落清单。**停下等用户确认。**
2. **成员卡 + 场景卡 + 道具卡** —— 每位成员写:气质标签、脸型五官、肤色、发型刘海、妆感(自然淡妆)、日常服 / 舞台服、标志小物、标志动作。场景写:光源与色温、空间细节(黑板粉笔字、铁丝网、旧木课桌)、胶片色调、环境音。道具(发带、帆布书包、应援棒、线香花火、自行车、歌词本、冰棍)单独成卡,分镜里直接引用。同时给出分镜总览和音频层规划。**停下等确认。**
3. **生成参考图** —— 每位成员一张横版双格定妆图(左:半身肩颈特写做认脸锚点;右:全身造型),场景图不带人。用户给了真人照片就以照片为准做图生图换装,不另起炉灶。**停下让用户逐个确认脸、气质、服装、光线。**
4. **逐镜生成视频** —— 按段落分批,每批 4-6 个镜头;每批或每段结束做一次一致性检查(见注意事项)。**整批完成后停下请用户预览,标出要重做的镜号。**
5. **配乐与旁白** —— 用户没给歌就生成 BGM;有青春旁白时生成旁白。**停下试听确认。**
6. **交付清单** —— 镜号、对应视频、剪辑顺序、BGM 对位点、转场方式,提示用户去时间轴剪辑合成。
## 风格锁定
- 每个提示词都带的画风关键词:`Heisei-era Japanese idol MV, film photography, soft grain, light overexposure, highlight soft flare, analog warmth, pastel tone, handheld documentary feel, candid youth`
- 胶片色调按场景选:晴天户外 → `Kodak Gold 200 warm tone`(暖、微过曝、高光溢出);室内/阴天 → `Fuji Pro 400H cool soft tone`(冷柔、细颗粒、肤色自然);黄昏 → 橙红暖调 + 柔颗粒 + 允许漏光。
- 色板:粉蓝、暖阳黄、樱花粉、校服藏青、夕阳橙、柔白。教室夕照约 5000K,日光灯冷白与之形成轻微冷暖对比。
- 允许:轻微漏光、镜头光晕、柔焦、头发乱一点、动作不齐、自然反应、素人感。
- 禁止:高级时装感、欧美超模脸、网红 AI 妆、性感化、暗黑概念、强反转剧情、赛博未来感、豪华现代建筑、夜店、T 台、HDR 锐化、超清 CG 感、韩团式精准刀群舞、稳定器顺滑运镜。
### 成员气质速查
- **中心位**:五官清晰有记忆点,眼神亮,嘴角自然上扬;中长发蓬松空气刘海;白衬衫格裙或水手服配暖色领结;第一个冲出去回头喊大家,动作比别人快半拍。
- **元气担当**:圆脸大眼,笑起来眼睛弯成月牙;短发或随手扎的双马尾;运动外套 + 及膝运动袜;仰头大笑捂嘴、甩书包跑走廊、合照第一个摆怪姿势。
- **害羞担当**:五官柔和、白皙,常低头看旁边;黑长直厚刘海;校服扣到最上面一颗;被镜头抓到会用手挡脸再从指缝偷笑。
- **清冷担当**:轮廓清晰、杏眼、表情克制;黑直发无刘海或中分;低饱和深色针织开衫;玩闹时唯一站得笔直却憋着笑,夕阳侧脸远眺最适合收尾。
- **情绪担当**:大眼下垂眼尾、酒窝;自然微卷长发;多一件披着的针织衫;感动时第一个红眼眶却还在笑,排练失败第一个说「再来一次!」。
## 分镜与镜头规则
### 八段式结构(3 分钟完整版,60-80 镜)
| 段落 | 时长 | 镜数 | 节奏与机位 |
|---|---|---|---|
| 日常 | 20-25s | 5-7 | 2-4s 快切,固定抓拍为主,空镜 + 中景 + 细节特写,不推不跟 |
| 放学 | 15-20s | 4-5 | 由静到动:书包特写 → 走廊低角度手持侧跟 → 推开天台铁门瞬间过曝 → 天台汇合 |
| 友情 | 20-25s | 5-6 | 最松弛,3-5s,正反打抓对视和笑,大笑极特写可做定格候选 |
| 排练 | 20-25s | 4-5 | 4-7s,舞蹈室镜前全景看动作不齐,皱眉数拍子中景,脚步特写 |
| 欢笑高潮 | 15-20s | 4-6 | 全片能量顶点,2-4s,逆光迎面奔跑、低角度跳跃、原地转圈 |
| 舞台 | 25-35s | 5-7 | 按 BGM 拍点切,礼堂正面全景 → 平移扫队形 → 中心位直视镜头 |
| 青春高潮 | 20-25s | 3-4 | 不快切,5-10s,全员并肩缓推,泛红眼眶但不刻意煽情 |
| 夕阳结尾 | 25-35s | 3-4 | 最慢,8-30s,逆光剪影固定长镜、侧脸远眺、回头微笑定格,柔化到暖白 |
### 短版本裁剪(不要等比压缩八段)
- **30 秒(8-12 镜)**:只留 欢笑高潮(4-6 镜,每镜 1.5-2.5s)→ 舞台(2-4 镜)→ 夕阳结尾(留满 8s)。BGM 只用副歌爆点,不要前奏主歌。
- **60 秒(20-28 镜)**:日常 → 友情 → 欢笑高潮 → 舞台 → 夕阳结尾;超时先删排练,再删放学,再删青春高潮,最后把日常压成一个 3s 空镜。
- 3 分钟超时:先压排练,再压放学,再压日常;欢笑高潮、青春高潮、夕阳结尾不能压。
- 「走廊奔跑」和「推开天台门过曝」是一对,要么都留,要么都删。
### 通用规则
- 前 3 秒必须有视觉记忆点(逆光剪影 / 笑脸特写 / 标志空镜),禁止对白或说明开场。
- 每个版本都用夕阳结尾类镜头收,不少于 5 秒,柔化到暖白或胶片烧白。
- 分镜表里给每段标 BGM 位置:欢笑高潮压副歌爆点,夕阳结尾落在尾奏淡出。
- 竖屏 9:16:单镜时长比横屏收紧 20-30%;中景不超过 2 人,3 人以上改前后错位站或拆成单人特写快切,禁止 3 人横排;主体放画面中央 70%×65% 区域,顶部 10%、底部 25%、右侧 12% 留给平台界面;跑步改成沿纵深冲向镜头,横摇慎用,推镜速度降 30%。
- 分镜表字段:镜号 / 段落 / 时长 / 场景 / 出场成员 / 动作与情绪 / 景别 / 机位 / 运镜 / 声音 / BGM 位置。
## 提示词写法
- 用户用中文交流时,提示词正文写中文,日语台词/歌词保留原文。只写镜头能看见的东西,不写心理活动。
**成员定妆图结构**:【横版双格对比图,中间白色分隔线】左格:人物 + 半身肩颈特写、正面平视(脸型 + 眼型 + 鼻梁 + 唇 + 肤色 + 发型刘海 + 淡妆 + 表情);右格:同一人全身站姿(完整服装 + 配饰 + 鞋 + 手部姿势);整体:胶片色调 + 色彩词 + 光线 + soft grain, analog warmth。
示例:
> 【横版双格对比图,中间白色分隔线】左格:元气担当少女半身肩颈特写,正面平视,圆脸、大眼、眼尾微翘,笑起来眼睛弯成月牙,健康小麦肤色,脸颊自然红晕,齐肩短发厚空气刘海,几乎素颜的淡妆,露齿大笑。右格:同一人全身,藏青运动外套半拉链 + 格子百褶裙 + 及膝白运动袜 + 白帆布鞋,书包上别着三枚徽章,单手比剪刀手。整体:Kodak Gold 200 暖调,夏日自然光,soft grain,light overexposure,analog warmth,Heisei-era idol photo。
**场景图结构**:空间结构 → 纵深 → 标志道具细节 → 光源与色温 → 胶片色调 → 年代做旧词(`slightly aged facilities, hand-drawn bulletin board, worn wooden desks`)→ `empty scene, no characters`。
**视频提示词结构**:参考图对应说明(图1 = 成员A脸和校服,图2 = 成员B发型)→ 运镜(手持漂移 / 柔推 / 侧跟)→ 主体动作与情绪节拍 → 空间调度 → 环境音 → 画风词 → 负面词。
- 常用运镜词:`handheld drift, soft zoom in, candid observational framing, slow follow pan, rack focus, accidental tilt`
- 常用动作词:`spontaneous laughter burst, group running in unison, hair catching sunlight, awkward synchronized idol gesture, freeze on smile, rooftop silhouette at sunset`
示例(放学天台):
> 图1 是成员A的脸和校服,图2 是成员B的脸和发型。手持低角度侧跟,两人从走廊冲出推开天台铁门,阳光扑进画面,高光柔和过曝,轻微镜头光晕。成员A先冲出去回头大喊,成员B紧跟,书包随步子上下弹,头发被风吹起。两人停在天台边喘气对视,同时笑出声,镜头缓慢柔推到两人中近景,定格在笑脸。环境音:铁门推开声、走廊回声、风声、两人笑声。台词(日语):「もう授業終わったよ!」「やっと自由だ!」Kodak Gold 200 暖调,soft grain,golden hour glow,analog warmth。no music, no subtitles, no K-pop precision choreography, no stabilizer movement, no HDR sharpness。
- 每条视频提示词末尾固定:`no music`(BGM 单独一轨)、`no subtitles`、`no high-fashion styling, no cyberpunk or dark concept, no luxury architecture`。有独立旁白的段落,视频里不要重复旁白文字。
- 季节变体:樱花春加 `cherry blossom petals falling, cold-soft spring daylight, Fuji Pro 400H dominant`,删蝉鸣和盛夏阳光;夏末海边加 `late summer seaside, coastal seawall, ocean light reflection, fading summer warmth`,蝉鸣换海浪,禁止泳装派对;秋季文化祭加 `handmade classroom decorations, warm indoor festival light, cool autumn outdoor light`,蝉鸣换秋风和人群声。
## 在 TVVV 上执行
- 先用 generate_image 出每位成员的双格定妆图和每个场景图(模型 Nano Banana 2);舞台背板、字幕卡这类要精确文字的用 GPT Image 2。同一成员换装用上一张定妆图做参考图生图,保持脸不变。
- 每个镜头 generate_video 都用 reference_images 带上出场成员的同一张 图N(中心位或情绪焦点成员放第一张,模型对第一张权重最高)+ 场景 图N,image_role 选 reference;需要严格控制开场画面的镜头用 first_frame。默认模型 Seedance 2.5,aspect 用项目画幅,720p,单镜 5-10 秒(快切镜头生成 5 秒后剪短用)。
- 多人同框认脸混淆时:用「画面左侧的女生参考图1」这类方位词区分;还混就先出单人镜头再组合。远景奔跑、舞台全景可以用多人合版参考图,中景以内必须单独绑定每人。
- BGM 用 generate_music,四段式写法:情绪定位 + 节拍感(快切 130-140 BPM / 青春中速 110-120 / 抒情 80-90 / 黄昏 65-75)+ 主乐器(旋律→节奏→氛围,不超过 6 种)+ 结构走向。示例:`Upbeat cheerful Japanese idol pop, around 120-130 BPM, bright acoustic guitar lead, glockenspiel accents, punchy drum kit, layered wordless idol chorus, warm analog synth pad; gentle intro, chorus bursts with full band, soft outro on acoustic guitar; no EDM, no trap, no dark mood`。不要写真实歌手或组合名。
- 青春旁白用 generate_speech,音色例如「温柔略带感伤的少女旁白」,写清旁白文字对应哪几个镜头。
- 一次回复最多 4-6 次工具调用;3 分钟版按段落分 8-10 批,每批结果回来再继续。
- 交付清单:按段落列镜号 → 视频 → 时长 → BGM 对位(如「副歌爆点 +0s」)→ 转场。剪辑建议:日常/友情单镜 1.5-3s 快切,情绪段 4-8s;转场优先柔叠化、手持硬切、笑脸定格,禁止 RGB 描边和赛博故障转场;环境音压在 BGM 下约 20-30%,旁白时 BGM 降约 6dB;保留轻微抖动和偶尔失焦,不做防抖。提示用户去 TVVV 时间轴剪辑合成。
## 注意事项
- **脸漂移**:每 6-10 镜检查一次——脸型眼型发色明显变了、同段落里无理由换衣服,必须重做;气质偏离一档以上(害羞变冷漠)、刘海类型突变,建议重做;手持造成的瞬间模糊、光线导致的肤色差可以保留。重做先加强五官描述或缩短时长,同一提示词失败两次再改用首帧控制。
- **偶像变网红**:提示词里一出现精致妆容、完美对称、时装姿势就会滑向 AI 网红脸,务必写「几乎素颜、头发有点乱、动作不齐、自然反应」。
- **动作太整齐**:舞台和排练要明确写「动作略不齐但充满活力」,否则模型会给出韩团刀群舞。
- **竖屏裁掉人**:横排三人在竖屏里两边必被切,规划时就改成前后错位或拆镜。
- **BGM 抢台词**:带台词的镜头视频里只写环境音,BGM 一律在剪辑时单轨叠加,末尾写 no music。
- **短版浪费**:30 秒版只设计保留段落的镜头,不要先做全套再删。