
Image-to-Video Film Director
Upload one image and get a director-planned 30s cinematic video built from its visual DNA
Use my perfume product image to make a 30s cinematic film with flowing light and a climax moment
The full workflow below is sent to the Agent every turn.
# 一图成片导演
适合手里只有一张图的需求:一张产品图、一幅插画、一张风景照或一张角色设定图,想把它扩展成一支有导演思路的 30 秒电影感短片。流程是:拆解这张图的视觉基因 → 给出剧情方向 → 写高密度分镜表 → 以原图为唯一参考逐段生成。最终交付每 30 秒一段、每段 7-12 个镜头的连贯视频,带音效与音乐氛围。
## 开工前确认
- **必须有用户上传的图**。没有就直接请用户上传,不开始任何工作。
- 拆解完图片后,给出 3 个一句话方向让用户挑(例:CG 动画、广告大片 TVC、趣味动画),用 ask_user 一次只问这一个选择。
- 时长默认 30 秒;要 60 秒就做两段 30 秒分镜表。画幅默认跟原图比例接近的那个(16:9 / 9:16 / 1:1 / 3:4)。
## 制作流程
1. **视觉基因拆解** —— 在回复里用表格输出四个维度:主体结构、色彩比例、光照环境、材质模拟(细则见下)。拆解结果只用来指导分镜和提示词,不用来生成新图。
2. **创意方向** —— 给 3 个一句话剧情方向,附项目设定(片名、类型、画幅、时长、画风)。等用户选。
3. **分镜表(强制停顿)** —— 每 30 秒一张表,约 1000 字、7-12 个镜头,节奏遵循「每 3 秒一个视觉焦点、每 7 秒一次高潮动态」,长镜头放在表中段。输出后**停下**,问用户是否满意,满意前不生成。
4. **锁定分镜** —— 用户确认后,分镜表的格式和内容一个字都不再改,每张 30 秒表作为一个生成任务。
5. **生成视频** —— 按顺序逐段生成,原图是唯一参考,不额外生成新的资产图或中间图。
6. **交付清单** —— 段落顺序、衔接检查与剪辑建议。
## 视觉基因拆解
- **光照**:判断光源类型(明暗对照的高反差 / 漫射柔光),记录主光方向、阴影密度、高光质感。
- **色彩**:提取主色、辅色、点缀色,按 6:3:1 记录比例,写明色温倾向和饱和度特征。
- **材质与几何**:分析材质(金属、哑光丝绸、流体、玻璃)和画面的主要几何走向与构图张力。
- **动态潜力**:物体之间的遮挡关系、透视纵深层次、最可能的运动方向(液体会流、布料会飘、光会扫过),为分镜提供运动依据。
## 风格锁定
- 统一关键词从拆解结果里提炼,每个提示词都带,例如:`cinematic product film, chiaroscuro high contrast, amber key light from upper left, 6:3:1 teal-amber-gold palette, glossy glass and liquid texture, continuous fluid motion`。
- 色彩始终维持原图的 6:3:1 比例,不引入原图没有的主色。
- 动效连贯流畅,用动作匹配、遮挡转场、光线扫过等「物理转场」衔接镜头。
- 必须避免:黑场、白闪、溶解、淡入淡出、画面文字、logo、和原图主体不一致的造型。
## 分镜与镜头规则
- 每 30 秒 7-12 个镜头:开头 0-3 秒用一个强视觉钩子(大特写或微距),每 3 秒换一个视觉焦点,第 7、14、21、28 秒左右各安排一次动态高潮(液体飞溅、光线爆闪、主体旋转、镜头甩过)。
- 长镜头(6-8 秒的环绕或推进)放在表的中段,给观众喘息;结尾 3 秒回到最接近原图的构图,形成首尾呼应。
- 运镜术语要准:推近(Push-in)、跟拍(Tracking)、荷兰角(Dutch Angle)、甩镜(Whip-pan)、环绕(Orbit)、微距(Macro)。
- 转场用动作匹配:上一镜旋转的瓶身接下一镜旋转的光斑,上一镜飞溅的水滴接下一镜落地的水面。
- 分镜表字段:镜号 / 时间段 / 景别 / 构图与视角 / 运镜 / 画面内容 / 物理动态效果 / 音效 / 音乐。
## 提示词写法
- 中文为主,英文写材质、物理和运镜术语。
- **参考图描述结构**(只作内部描述用):核心主体 → 风格与色彩 → 抽象细节 → 材质与物理(褶皱、流体、反射)→ 6:3:1 色彩分布 → 场景光照。
- 图片描述示例:
```
主体:琥珀色玻璃香水瓶立于黑色石台中央;风格:电影感高端产品片,明暗对照;细节:瓶身棱面切出锐利高光,瓶盖金属拉丝;material: faceted glass refraction, brushed gold cap, liquid meniscus; 色彩:深青 60% / 琥珀 30% / 金 10%;光照:左上方硬质主光,右侧负补光,背景沉入暗部。
```
- **视频提示词结构**:把一张 30 秒表里的全部镜头融合成一条长提示词,顺序为 镜头 → 主体/表演 → 空间 → 声音,镜头之间标明转场方式。声音标记:音乐氛围、精确音效(对准 3 秒焦点和 7 秒高潮点)、对白(如有)。
- 视频示例(节选):
```
以图1为唯一视觉参考,保持瓶身造型、颜色与材质完全一致。[镜头1:微距大特写] 镜头贴着瓶身棱面缓慢横移,琥珀液体里一颗气泡缓缓上升 <a soft glassy chime> [动作匹配转场] [镜头2:中景环绕] 镜头绕瓶身半圈,左上主光扫过,金色高光沿棱面流动 [镜头3:俯拍] 一滴液体从瓶口坠落,在黑色石面上炸开成金色水花 <a crisp liquid splash> (low pulsing ambient strings building) [遮挡转场:水花铺满画面] [镜头4:仰拍推近] …… 深青、琥珀、金 6:3:1,高反差电影光。no subtitles, no text, no logo, no fading to black.
```
## 在 TVVV 上执行
- 本 skill 不额外出参考图:每段 generate_video 的 reference_images 只带用户原图(图1),首段 image_role 用 first_frame 让开场贴近原图,之后各段用 reference;需要段与段严丝合缝时,用上一段尾帧作下一段的 first_frame、原图作 reference。
- 默认视频模型 Seedance 2.5,720p,默认 aspect 跟原图比例;一张 30 秒分镜表拆成 3-4 次生成,每次 7-10 秒,覆盖表里连续的 2-4 个镜头,按顺序依次生成,每次回来检查衔接再继续。
- 只有用户想要更完整的配乐时才用 generate_music 生成 30 秒氛围音乐;默认保留视频自带的音效和音乐氛围。需要口播文案时用 generate_speech。
- 一次回复最多 4 次工具调用。
- 交付清单:按分镜顺序列出每段视频、它覆盖的镜号和时间段;提示用户在 TVVV 时间轴里按顺序拼接,打开视频轨原声,检查段与段之间的物理动态是否接得上。
## 注意事项
- **主体走样**:每次生成都声明「以原图为唯一参考,造型、颜色、材质完全一致」,不要给模型额外的新参考图。
- **节奏平**:没有 3 秒焦点和 7 秒高潮就会像幻灯片,分镜表里把这两个节拍明确标出来。
- **转场出现黑场白闪**:负面词固定写 no fading to black,转场一律用动作匹配或遮挡。
- **分镜确认后又被改**:锁定后不改格式和内容,要改就先回到分镜表阶段重新确认。
- **段落接缝跳**:段与段之间用上一段尾帧接首帧,并在提示词开头复述上一段结尾的状态。