
Broadway-Style Musical Film
Golden Age, jazz-modern or contemporary stage looks; a musical short with an original song
A 60s Golden Age musical number: a small-town girl arrives in the big city and sings her dream with a station ensemble
The full workflow below is sent to the Agent every turn.
# 百老汇式歌舞短片
适合想做「舞台音乐剧感」歌舞视频的用户:一段原创歌曲 + 主角独唱 + 整齐的群舞队形 + 剧场灯光。可选三种时期风格:黄金时代(饱和彩色、对称大群舞)、爵士现代(黑色极简、斜射光、内扣膝盖与爵士手)、当代剧场(面具与偶、图腾仪式感,或流行演唱会式舞台)。
最终交付:16:9 带电影遮幅黑边的歌舞短片,30-90 秒,6-12 个镜头(每镜 5-10 秒,按乐句切),一首原创歌曲(或纯器乐序曲)+ 可选旁白,附剪辑节奏建议。
## 开工前确认
- 必需:一个故事钩子(谁、想要什么、在哪里唱)。没有就让 AI 编一个,给用户确认。
- 可选:歌词、演员照片、服装参考、编舞参考视频、喜欢的剧照或海报、演员录音。用户给了就优先用,不要重做已有素材。
- 分析参考素材时,按五个维度输出理解:时期 / 色彩 / 服装标志 / 舞蹈语汇 / 灯光情绪。编舞视频里标出可执行的动作关键词和可以直接复用的节拍。
- 用 ask_user 一次只问一个,优先问:「选哪个时期风格?黄金时代 / 爵士现代 / 当代剧场」。
## 制作流程
1. **项目设定** —— 「项目设定」小节:片名、时期风格、时长、16:9 遮幅、输出语言(台词与歌词)、主色。等确认。
2. **歌曲与结构** —— 写歌词(主歌 / 副歌 / 桥段 / 结尾高潮),标注每段时长和情绪,确认后先生成歌曲。歌曲是剪辑骨架,先有歌再分镜。
3. **角色卡与场景卡** —— 每个角色写「身份卡」:一句核心描述 = 颜色锁定 + 发型锁定 + 姿态锁定,全片每个镜头原样复用。例:「20 岁金发女演员,穿标志性祖母绿丝绸长裙」。一个角色有多套造型就分开列。场景卡写舞台方向、重要道具和表演区位置。确认后出图。
4. **分镜表** —— 按歌曲段落切镜,每镜对齐一个完整乐句。等确认。
5. **生成参考图** —— 角色定妆图(横版:左半身 + 右全身)、场景图,列资产清单。
6. **逐镜生成视频** —— 分批生成,回来检查脸、服装、队形。
7. **旁白(可选)与交付** —— 交付清单与剪辑建议。
## 风格锁定
- **三个时期的视觉语汇**(每个镜头都要声明所属时期并用上):
- **黄金时代(1940-60 年代)**:饱和的老式彩色胶片感,对称构图,大型群舞队形,白色追光与满台泛光,金红为主色,像在镜框式舞台上拍的。关键词:`Golden Age Hollywood musical, saturated Technicolor, symmetrical proscenium staging, grand ensemble formation, white follow spot, gold and red palette`
- **爵士现代(1960-80 年代)**:致敬爵士舞编舞大师的风格——内扣膝盖、爵士手、斜戴礼帽或圆顶礼帽、黑色极简、对角斜射光、身体局部孤立动作;高反差黑白或单色红。关键词:`Fosse-inspired jazz choreography, turned-in knees, jazz hands, tilted bowler hats, black minimalist stage, diagonal hard spotlight, high-contrast monochrome red`
- **当代剧场(1990 年代至今)**:大型偶与面具、仪式感质地、分层投影、大地与图腾色;或流行演唱会式舞台,霓虹与现代极简。关键词:`contemporary theatre, ritual masks and large puppets, layered projections, earth and totem colors` 或 `pop-concert musical stage, neon accents, modern minimalism`
- **主色规则**:每个镜头一个主色占画面约 90%,其余是点缀。
- **遮幅**:生成时就在提示词里写 `cinematic letterbox`,画面上下有黑边,导出时无法再裁。
- **灯光**:每个镜头写清灯光提示——追光(约 5600K 硬白)、满台泛光、彩色侧光、斜射光。
- **必须避免**:CG 卡通感、业余晚会舞台感、杂乱的人堆、现代综艺灯光乱闪、字幕。
## 分镜与镜头规则
- **群舞必须有队形和纪律**:每个群舞镜头写明队形(V 字、一字横排、对称双列、圆形、阶梯式)和统一动作(「整齐的 V 字队形同步向前推进」)。队形松散是看起来像普通晚会而不像百老汇的头号原因。
- **乐句对齐**:每个镜头长度对齐一个完整乐句,5-10 秒;副歌和高潮处的群舞不要拦腰切断。
- **结构参考**(60 秒):
- 0-8 秒 序曲:空舞台、幕布或灯光亮起,大远景。
- 8-24 秒 主歌:主角独唱,中景到近景,追光跟随。
- 24-40 秒 副歌:群舞入场,队形展开,全景对称构图,升降摇臂式上升。
- 40-50 秒 桥段:主角与一名配角对唱或舞蹈对位,双人中景。
- 50-60 秒 高潮结尾:全体定格造型,主角居中举手,灯光一齐打亮后收光。
- **运镜**:黄金时代用平稳的升降、横移和对称推进;爵士现代多用锁定机位 + 局部特写(手、帽檐、膝盖);当代剧场可用缓慢环绕和低机位仰拍面具。
- **角色原型参考**(只作性格方向,不照搬具体剧目角色):女主角——倔强成长型 / 天真乐观型 / 被误解的异类;喜剧角色——憨直热情型 / 被忽视的老实人;魅惑或反派——油嘴滑舌的骗子 / 渴望出名的明星梦者 / 校园女王。
- **分镜表字段**:镜号 / 对应歌曲段落与时码 / 时长 / 场景 / 角色与队形 / 动作与舞蹈语汇 / 唱词或台词(逐字)/ 景别·机位高度·运镜 / 灯光提示 / 主色。
## 提示词写法
- **公式**(自然语言写成一段,不分小标题):时期美学词汇 + 主体动作或群舞队形 + 舞台环境与关键道具 + 灯光提示 + 景别与运镜 + 色调(一个主色约 90%)+ 遮幅 +【避免】自然语言的避免项。
- 时期词汇要落到可执行动作:爵士现代镜头必须写出内扣膝盖、爵士手、斜戴礼帽、局部孤立动作;当代剧场镜头必须写出面具或偶和图腾质地。
- 角色描述每次都原样复用身份卡那句话,一个字不改。
- **图片示例(角色定妆)**:`Horizontal character sheet, left half-body portrait and right full-body view of the same 20-year-old blonde actress in a signature emerald green silk evening dress, victory-roll hairstyle, red lipstick, hands open in a welcoming pose, Golden Age musical stage portrait, white spotlight, saturated Technicolor, warm gold-red background`
- **视频提示词结构**:运镜 → 主体动作 → 空间调度(队形、走位)→ 声音提示(有独立配乐轨时不写音乐;唱词逐字写在引号里)→ 避免项。
- 示例:`Crane shot rising slowly from stage level to a high symmetrical view. The 20-year-old blonde actress in a signature emerald green silk evening dress stands center under a white follow spot, arms opening wide as she sings "This city lights up just for me". Behind her, twelve dancers in red and gold costumes sweep forward in a clean V formation, kicking in perfect unison. Grand train-station stage set with a painted arch and luggage props, saturated Technicolor, gold-red dominant palette, cinematic letterbox. Avoid CGI cartoon look, avoid amateur gala staging, avoid chaotic crowd, no subtitles, no background music.`
- 避免项用自然语言写进正文,不要用 `--no` 这类参数语法。
## 在 TVVV 上执行
- **先做歌**:用 generate_music 生成原创歌曲,风格描述强调人声与乐池的空间层次,例如 `Broadway show tune, Golden Age orchestral musical, bright brass and lush strings, female lead vocal forward over a layered orchestral pit, theatrical crescendo, 120 BPM`;爵士现代改为 `smoky jazz-musical, muted trumpet, walking bass, finger snaps`。纯器乐序曲明确要求无人声。提示词里不要写真实作曲家或歌手名字。
- 角色定妆图、场景图用 generate_image,默认 Nano Banana 2;如果画面里要有剧场招牌、海报片名这类精确文字,用 GPT Image 2。同一角色的第二套造型以第一张为参考生成。资产清单例:「图1 = 女主定妆、图2 = 男配定妆、图3 = 车站舞台场景、图4 = 群舞演员服装」。
- 每镜 generate_video:reference_images 带本镜出场角色和场景图,全片用同一组 图N;开场空舞台或需要精确队形构图的镜头可以先出一张构图图做 first_frame。
- 默认视频模型 Seedance 2.5,aspect 16:9,720p,单镜 5-10 秒,镜头长度按歌曲段落时码定。
- 旁白(如有)用 generate_speech,嗓音按剧情设定(例如「温暖的老派剧场报幕男声,语速从容」)。
- 一次回复最多 3-4 次工具调用;先歌曲 → 再定妆和场景 → 再分批出镜头,每批 3-4 镜。
- 交付清单:镜头与歌曲时码对照、段落之间用「黑场切」模拟换景、群舞高潮保留完整乐句、剪辑点卡在重拍和渐强处;轨道建议:主画面一条视频轨、群舞或特写插入放第二轨、歌曲一条音轨、旁白一条音轨。提示用户在 TVVV 时间轴合成。
## 注意事项
- **像晚会不像音乐剧**:群舞没有队形就会乱,每个群舞镜头都写队形名称和「同步」。
- **主角换脸换衣服**:身份卡那句话每镜原样复用,并带同一张定妆图。
- **画面和歌对不上**:先有歌再切镜,每个镜头对应一段乐句时码,不要先拍后找歌。
- **时期风格串味**:一个项目只用一个时期的词汇,不要黄金时代镜头里冒出霓虹。
- **遮幅没做**:导出时无法再加,提示词里每镜都写 cinematic letterbox。
- **视频自带的音乐和歌曲打架**:有独立歌曲轨时,视频提示词写 no background music,只保留唱词口型和舞台环境声。