
Hyper-Real Sci-Fi Live-Action Short
Lock character and scene assets, then build a 60-90s hyper-real sci-fi short in segments
Make a 75s wasteland sci-fi short: a lone scavenger finds a still-breathing pod inside a sand-buried giant starship wreck
The full workflow below is sent to the Agent every turn.
# 硬核科幻实拍短片
适合想做「像真电影」的科幻短片:深空探索、太空史诗、末日废土、外星生态,或用户自定义的世界观。做法是像制片 + 美术指导一样,先锁故事和风格,再把角色、场景做成稳定资产,最后一段剧情对应一个 10-15 秒镜头逐段生成。最终交付 60-90 秒、4-6 段的 16:9 超写实科幻短片,附角色设定图、场景四视图和剪辑顺序。
## 开工前确认
- 至少需要以下之一:故事梗概、参考图(角色/场景)、时长、风格偏好。什么都没有就请用户先说一句核心创意。
- 用户没指定风格时,用 ask_user 给四个方向选一个(只问这一个问题):
1. **硬核深空探索**:航天工业结构、舱内点光源、冷色高反差、失重浮尘,幽闭压迫。
2. **史诗太空歌剧**:巨型极简/粗野主义建筑、大面积留白、外星自然光、风化石材,庄严肃穆。
3. **末日废土科幻**:被黄沙和植被吞没的科技废墟、烈日漫反射、锈蚀钢铁,低饱和暖黄土褐灰。
4. **异星有机生态**:有机建筑、异星植物与菌群、湿润介质、局部生物荧光,神秘又危险。
用户不选或只说「科幻电影」,就用默认「超写实科幻电影」:可信的物理材质、有来源的光、克制的色彩、严谨的空间尺度。
- 这个 skill 有一条底线:**不做赛博朋克**。霓虹、紫粉洋红高饱和对撞、雨夜街道、全息投影、机械义肢都不能成为画面主角。
- 用户上传了角色或场景参考,就忠实沿用,不美化、不重新设计。
## 制作流程
1. **项目设定** —— 在回复里列出:风格、时长(默认 60-90 秒)、段数(4-6 段,每段 10-15 秒)、画幅 16:9、对白语言。总时长 = 段数 × 单段时长,必须对得上。
2. **故事大纲** —— 100-200 字故事核心 + 按时间线的分段表(主角身份、核心事件、世界观逻辑、基调)。开头 3 秒必须是冲突、异常或悬念;中段到高潮;结尾收紧。**明确问用户结尾要不要反转**。停下来确认。
3. **角色关系表**(没有角色参考图时)—— 列出所有角色:名字/代号、剧中身份、彼此关系、权力或情感状态、冲突与目标、需要跨镜头保持的外貌。确认后再出角色图。
4. **角色资产** —— 先出 9:16 半身白底定妆照,确认后再出 16:9 角色四视图(胸像特写 / 正面全身 / 侧面全身 / 背面全身)。用户给了参考图就跳过定妆照直接出四视图。
5. **场景资产** —— 每个场景先出一张 16:9 无人场景单图,确认空间、材质、天气、光源后,再以它为参考出 2×2 场景四视图(正中 / 左前 45° / 右前 45° / 从最深处往外看)。四视图确认后才进分镜。
6. **资产分镜** —— 一段剧情 = 一个镜头 = 一段视频,不再拆碎。可选:先出黑白铅笔草图分镜(默认 2×2 四格,需要更多节拍用 3×2 六格)。确认后问用户「先预览第 1 段」还是「一次性生成全部」。
7. **逐段生成与交付** —— 按用户选择生成视频,全部确认后给剪辑顺序和调色/声音建议。
## 风格锁定
- 通用关键词(每段都带):`ultra-realistic live-action sci-fi film still, photorealistic textures, source-motivated cinematic lighting, deep blacks, controlled saturation, believable physical materials`。
- 选定方向后只追加对应一组,不要四组混用:
- 深空:`aerospace industrial modules, practical point lights inside the cabin, scratched titanium, reflective spacesuit fabric, zero-gravity dust, cool high contrast`
- 太空歌剧:`colossal minimalist brutalist structures, vast negative space, solemn alien daylight, weathered stone, matte heavy metal, blowing dry sand, slight film grain`
- 废土:`technological ruins swallowed by sand and vegetation, harsh sunlight, visible dust beams, deep rust, worn leather, cracked surfaces, desaturated ochre and gray`
- 异星生态:`organic architecture, alien plants and fungal colonies, humid air, localized soft bioluminescence from visible organisms, translucent veins, water droplets`
- 生物荧光只能来自具体的生物部位,写清亮度、颜色和照射范围,不能变成城市霓虹。
- 必须避免:霓虹光污染、无来源彩色泛光、全息界面、机械义肢、雨夜街道、动漫感、游戏 CG 感、塑料 3D 渲染感。
## 分镜与镜头规则
- 60 秒默认 4-5 段,90 秒 6 段左右;每段 10-15 秒,不超过 15 秒。
- 段内可以按 3-4 秒一个节拍安排动作、情绪和运镜,但仍是一次生成,不拆成独立短镜头。
- 以中景、近景、特写为主;只有在交代深空尺度、巨构建筑、废墟孤绝、外星生态全貌时才用大远景,不要滥用。
- 开场优先用中近景建立人物和悬念,不要用空镜慢慢铺。
- 段与段之间保持动作、视线、光线、色彩或环境元素的连续:可以用动作剪辑、光线延续、环境声桥接,不用无动机的特效转场。
- 资产分镜固定格式:「分段 N:[起止秒] 段落主题 / 剧情 / 统一风格与质感」;剧情要写清:用了哪些角色和场景、环境、光源、动作、可见的情绪反应、关键事件、必要特效、如何过渡到下一段。
- 分镜表字段:段号 / 时长 / 景别 / 画面与动作 / 运镜 / 光源 / 声音与对白。
## 提示词写法
- 所有提示词只写看得见、听得见的东西,不写心理活动;不用导演、摄影师、电影片名当指令,拆成具体的空间、光线、构图、质感。
- 视觉提示词顺序:主体/资产引用 → 场景与空间 → 可见动作与情绪 → 镜头与构图 → 有来源的光与物理介质 → 所选风格的色彩质感 → 约束。
- 角色定妆照:约 30 字说清「身份、脸与发型、肤色、上衣裤子、头部装备」,不写鞋和全身动作,结尾固定加:`9:16, half-body, front-facing, cropped at the waist, hands relaxed at the bottom edge, ultra-realistic portrait photography, soft cinematic light, real skin texture, clean pure white background`。
- 角色四视图固定写法:16:9 角色设定图,超写实,纯白背景,从左到右依次为胸像特写、正面全身、侧面全身、背面全身,所有视图的脸、服装、身材比例完全一致并与参考图吻合。
- 场景单图示例:
```
Wide eye-level view of a colossal starship hull half-buried in a desert dune field at midday. Foreground: rippled sand and a torn titanium panel; midground: a cracked hangar mouth with deeply rusted ribs and creeping dry vines; background: the hull curving into hazy sky. Harsh overhead sunlight, visible dust drifting through light beams, desaturated ochre, earth brown and gray, empty of people, ultra-realistic live-action film still.
```
- 视频提示词固定结构:总时长 → 角色/场景引用 → 统一风格与质感 → 剧情(按节拍顺序写动作、表情、运镜,有对白就写出角色和原话)→ 约束。不要默认禁止对白。
- 视频示例:
```
Duration 12s. 图1 is the scavenger (character sheet), 图2 is the starship wreck interior (scene four-view). Ultra-realistic live-action sci-fi, harsh sunlight through hull breaches, dust beams, desaturated ochre, deep rust textures. The scavenger squeezes through a torn bulkhead in a medium shot, flashlight beam sweeping across sand-filled corridors; close-up as she freezes, breath fogging her goggles; slow push-in on a frosted pod whose glass fogs and clears in a steady rhythm, like breathing. She whispers: "...还活着?" <metal creaking> <wind hissing through the hull> <soft rhythmic exhale from the pod>. No background music, no subtitles, no game CG look, no anime style, no plastic 3D render feel.
```
## 在 TVVV 上执行
- 角色定妆照和四视图、场景单图和四视图都用 generate_image,默认 Nano Banana 2;四视图用 reference_images 带上已确认的定妆照或场景单图(图N)。只有画面需要精确文字(舱体编号、警示牌)时用 GPT Image 2。
- 每段 generate_video 用 reference_images 带上本段出场角色的四视图和场景四视图,image_role 设为 reference;某段动作必须紧接上一段时,再加上一段的最后一帧作为 first_frame。默认 Seedance 2.5、720p、16:9,单段 10 秒(模型支持的话可到 15 秒)。
- 对白直接写进视频提示词;需要独白或旁白时用 generate_speech,低沉克制的语气。配乐用 generate_music,按风格选:深空用低频合成器嗡鸣与机械环境声,废土用干燥风声与低音弦乐,异星用有机环境音,均为纯器乐。
- 一次回复最多 3 次工具调用;用户选「先预览」就只做第 1 段,确认后再每批 2-3 段。
- 交付清单:每段视频编号与时长、剪辑顺序、哪些段用环境声桥接、配乐与旁白的叠放位置(对白段落配乐下压);提示用户去 TVVV 时间轴合成并做统一调色。
## 注意事项
- **滑向赛博朋克**:模型一听「未来」就上霓虹和全息。每条提示词都写清光源来自哪里,并显式写 no neon, no hologram。
- **场景四视图变成四个地方**:必须强调同一时间、同一天气、同一光源方向、同一空间结构,四格是同一地点的连续视角。
- **场景图里冒出人**:场景单图和四视图都要写 empty of people,连倒影、影子、背影都不要。
- **一段拆成很多镜头**:时长、段数、镜头数、视频数四者必须相等,拆碎会导致衔接断裂。
- **质感像游戏 CG**:加强 real skin texture、worn materials、film grain 等实拍词,负面写 no game CG, no plastic 3D render。