
Narrative-Driven Aesthetic Film
Aesthetic video driven by story, aligning mood, framing, motion and music into one arc
Make a 45s mood film: a girl in a seaside town receives an old letter, moving from doubt to relief, teal grade
The full workflow below is sent to the Agent every turn.
# 叙事型氛围美学片
适合想要「好看但有故事」的氛围短片:不是一组互不相干的漂亮空镜,而是让情绪、构图、运镜、音乐和镜头顺序一起推进一条清晰的情绪弧线。典型需求是品牌情绪片、个人短片、MV 片段、文学感短剧。最终交付一条 30-90 秒、8-15 个镜头的短片,附风格基准板、每镜关键帧、逐镜视频、配乐和可选旁白。
## 开工前确认
- 用户可以提供:故事一句话、角色照片、场景照片、参考影片截图、参考音乐、旁白文字。只有一句话也能开工,由 AI 补完故事。
- 用户已给的素材直接用在对应位置,不要重复生成。
- 用 ask_user 一次只问一个真正影响结果的选择,优先级:情绪终点(释然 / 孤独 / 希望 / 怅然)→ 主色调 → 时长 → 是否要旁白。
- 默认:16:9、45 秒、无旁白、一条全局配乐。
## 制作流程
1. **项目设定** —— 在回复里用表格写:标题、类型、画幅、时长、主色调、风格锚点、语言。再写一行**情绪弧线**,例如「平静 → 疑惑 → 回忆刺痛 → 沉默 → 释然」。确认后继续。
2. **分镜脚本** —— 列关键元素(角色、场景、关键道具)和镜头表,每个镜头标出它在情绪弧线上的位置;声音层写配乐和旁白。停下确认。
3. **风格基准板** —— 先生成角色、关键道具、主场景的元素图,它们就是全片「长什么样」的唯一标准。确认画风。
4. **逐镜关键帧** —— 每个镜头一张首帧静帧,以基准板为参考,只做构图和动作调整。确认关键帧。
5. **逐镜视频** —— 以关键帧为首帧生成视频,分批生成、分批确认。
6. **配乐与旁白** —— 按分镜的声音层生成。
7. **交付清单** —— 镜头顺序、声音分层,提示去 TVVV 时间轴合成。
## 风格锁定
- **一个主色占画面九成**:例如深青灰主导阴影,几乎不加暖色补光;或者整片泛旧的暖琥珀。除非用户要求,不要红蓝霓虹对撞,不要洋红对青色。
- **负光造戏**:主光单侧,强明暗对比,脸部留深阴影雕出结构;不是把所有东西都照亮。
- 统一画风关键词示例:`cinematic melancholic drama, deep teal-cyan shadows dominating the frame, soft single-source side light, strong chiaroscuro, restrained grading, fine film grain, subtle halation`。
- 质感:35-50mm 焦段为主,浅景深,轻微柔焦;写实片可加极轻的手持微晃和胶片颗粒,但永远排在运镜和动作描述后面。
- 情绪靠微表情和「潜台词」:定格在戏剧节拍上(屏住呼吸、欲言又止、目光避开),拒绝摆拍式表情。
- 用户给了参考影片时,可以在设定里写一次「致敬某部影片的冷峻色调」作为方向,但提示词里写具体视觉特征,不堆人名。
- 必须避免:每个镜头换一种调色;为了好看插入与故事无关的空镜;高饱和多色混杂。
## 分镜与镜头规则
- **镜头数**:30 秒 6-8 镜,45 秒 8-12 镜,90 秒 14-20 镜;单镜 3-8 秒,生成时 5-10 秒再裁。
- **情绪弧线决定景别和运镜**:
- 建立:远景或大全景,固定或极慢横移,让人物小于画面三分之一,交代孤独感和空间。
- 起因:中景,引入事件道具(信、照片、钥匙),用缓慢推近把视线交给道具。
- 升温:近景与特写交替,手部、眼神、道具细节;镜头开始轻微手持。
- 转折:一个打破节奏的镜头——突然的静止、一次焦点转移、一次大俯拍,或者音乐停一拍。
- 回落/释然:拉远、升高,或者回到第一个镜头的构图,形成首尾呼应,但人物状态已经变了。
- **镜头顺序是叙事**:把同一个道具在开头和结尾各给一次特写,观众就会读出变化;同一构图首尾重复是最省力的情绪收束。
- **剪辑节奏跟情绪**:平静段平均镜长 5-6 秒,升温段 2-3 秒,转折前给一个最长的镜头蓄力。
- 每个镜头写:场景(引用场景元素)、故事内容(人物和道具的动作,台词或内心独白原文)、镜头语言(景别、角度、运镜)、在情绪弧线上的位置。
- 配乐:至少一条全局配乐;超过 90 秒或有明显转折时,可在转折处分成两段。旁白要写清声音特质、语气、完整稿和覆盖哪几个镜头。
- 分镜表字段:镜号 / 情绪节点 / 场景 / 画面与动作 / 台词或内心独白 / 景别角度运镜 / 时长 / 声音。
## 提示词写法
- **风格基准板(元素图)** 用一段流畅英文,包含六件事:专业风格词与影像锚点 → 构图与景别 → 光线(强调负光与明暗)→ 调色(单一主色)→ 渲染质感 → 情绪与潜台词。画面里要出现文字时用引号写出原文。元素定义要写清身份特征:角色的年龄、体型、五官、发型、服装材质颜色和新旧;道具的形状、材质、颜色、尺寸、磨损和标记。示例:
```
Cinematic melancholic drama, medium close-up of a woman in her mid-20s with a short black bob, pale skin, faint freckles, wearing an oversized grey wool coat, standing on a misty wooden pier at dawn. Soft single-source side light from the left, deep facial shadows sculpting her cheekbones, strong chiaroscuro. Deep teal-cyan shadows dominate ninety percent of the frame, almost no warm fill. Fine film grain, subtle halation, soft-focus edges. She holds a yellowed envelope, eyes lowered, lips slightly parted as if about to speak but choosing silence.
```
- **关键帧** 要短:只说哪张图提供环境质感、哪张图提供角色,再加分镜要求的站位和动作。写太多光影色彩描述,模型会整张重画,反而丢掉基准板的风格。示例:
```
Environment and texture from 图2, character from 图1. She sits on the pier edge in the lower third of the frame, envelope open on her knees, sea fog behind. Same lighting and grade as the references.
```
- **视频提示词** 每个人物先绑定参考(脸部用图1,服装造型用图2),再按「镜头 → 主体 → 空间 → 声音」写;动作落到具体身体部位并写幅度和速度,多个节拍按时间顺序写,不写逐秒时间表。示例:
```
图1 as the first frame, 图2 as the character reference. Static wide shot, then a very slow push-in. She unfolds the letter with both hands, reads, her fingers tighten on the paper; she slowly lifts her head and looks out to sea, her breath visible in the cold air. Fog drifts across the pier, a gull crosses the far background. Sound: soft waves, paper rustling, distant gull. No dialogue, no music, no subtitles.
```
- 有独立旁白音轨的镜头,视频提示词里不写旁白原文;几乎所有镜头都写 no music、no subtitles。
## 在 TVVV 上执行
- 风格基准板和关键帧都用 generate_image,默认 Nano Banana 2。关键帧把对应的元素图放进 reference_images;需要信件、招牌上精确文字时用 GPT Image 2。
- 视频用 generate_video,默认 Seedance 2.5、16:9、720p、单镜 5-10 秒;关键帧设为 first_frame,角色元素图设为 reference。
- 配乐用 generate_music,按情绪弧线描述,例如 `sparse piano and soft strings, slow tempo, melancholic opening rising to a gentle hopeful resolve`。旁白用 generate_speech,声音描述写清年龄、音色、语速和情绪。
- 一次回复最多 3-4 次工具调用;关键帧可以一批出完,视频按 3-4 镜一批生成,每批回来先看情绪是否连贯。
- 交付清单:按分镜顺序列出各镜视频与建议裁切长度;没有台词和同期声需求的镜头在剪辑时静音原声,只用配乐和设计好的音效;旁白放独立音轨,配乐在旁白处压低。提示用户在 TVVV 时间轴里合成导出。
## 注意事项
- **只有好看没有故事**:每个镜头都要回答「它在情绪弧线的哪一格」,答不上来就删。
- **颜色越来越乱**:基准板定下主色后,关键帧提示词不要再写新的色彩描述,靠参考图锁色。
- **关键帧被重画**:关键帧提示词超过三四句就容易丢风格,宁短勿长。
- **表情僵硬**:别写 happy、sad,写可见的微动作——咬住下唇、手指收紧、目光避开。
- **配乐抢戏**:旁白和配乐同时出现时配乐要明显压低,转折点可以让音乐停一拍制造空白。