
户外舞台异能对决
观众第一视角拍两位演员在户外舞台上用烟火光效斗法,15秒一镜到底
做一段15秒户外舞台对决:左边黑烟忍者对右边蓝色电光剑士,我在台下人群里看
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 户外舞台异能对决
适合想做「我在现场看了一场超能力舞台秀」的爆款短视频:主题乐园剧场、音乐节或夜市庙会舞台上,两位真人演员各自操控一种能力(黑烟、电光、火环、冰柱),用烟火、灯光、投影、干冰把对决演成一场舞台大事件,镜头就是台下观众的眼睛。默认交付一条 15 秒、一镜到底的观众视角视频,配开场和收尾两句短旁白及一条节奏配乐;要多条就每 15 秒一条独立出。
## 开工前确认
- 需要用户给:两个角色的外观描述和能力类型、舞台类型、想要的升级走向。不需要参考视频。
- 默认就是**双人**。用户只给了一个角色时,主动提议一个能力强烈反差的原创对手或搭档(例如火 vs 冰、黑烟 vs 电光),不做单人炫技。
- 用 ask_user 一次只问一个:画幅(默认 9:16 竖屏,可选 16:9)→ 对决还是合作表演 → 旁白语言(默认中文短句,可选日语、韩语)。
- 用户点名某个热门动漫 / 游戏角色时,只当灵感:不写角色名、作品名、招式名、组织名和标志台词;只保留两三个视觉特征,并刻意改掉至少一个(换发色、换服装材质、去掉徽记),把辨识度转移到能力的颜色、形状和舞台语言上。
## 制作流程
1. **项目设定** —— 回复里用表格给出:条数、时长 15 秒、角色 A / B 与能力、站位、对决或合作关系、画幅、舞台类型、旁白语言。
2. **分镜** —— 每条 15 秒视频只对应**一个镜头**,内部用节拍 1 → 2 → 3 → 4 → 收尾描述升级。同时规划一条配乐和一段旁白(只有开场、收尾两句)。**停下等用户说「确认」**。
3. **资产设定图** —— 角色 A、角色 B、完整舞台空间各一张;关键道具 / 能力发射源需要一致时单独出。不出「观众视角图」或手机画面图——观众视角是镜头约束,不是资产。**停下确认**。
4. **生成视频** —— 一条 15 秒一次生成,不拆成多段,先不做声音。让用户检查:是不是观众视角、两人是否始终同框、户外舞台真实感、前景人群层次、一镜到底、高潮够不够大。**停下确认**。
5. **旁白与配乐** —— 画面通过后再一起生成。**停下确认**声音和节奏。
6. **交付** —— 每条作为独立片段,给出叠音建议,引导到 TVVV 时间轴。
## 风格锁定
- 统一画风关键词:`first-person audience POV, raw phone-recorded live show realism, cinematic realistic outdoor live stage show, slight handheld breathing shake, imperfect exposure, real pyrotechnics, stage smoke, lighting rigs, live stunt performers`。
- 角色是真人舞台演员 / 特技演员:真实的布料、皮革、金属护具、假发、面罩、护目镜、有重量的道具,皮肤有舞台汗水和灰尘。服装可以夸张但要能穿,绝不是卡通、动漫、游戏 CG、玩偶服或塑料盔甲。
- 默认户外:主题乐园剧场、开放广场、音乐节、户外漫展、夜间舞台,带天空 / 夜色、建筑、台阶、竖旗、灯架和烟层。
- 能力全部转译成舞台事件:光墙、追光、光柱、烟火、烟雾喷射、火环、LED 墙、冲击波、悬浮粒子、地面干冰雾。特效要和地面、烟、灯架、建筑、身体、观众产生遮挡、阴影、反光、曝光变化,不能是贴纸。
- 必须避免:第三人称电影机位、航拍、转播机位、硬切换角度、画面中央的大手机、录像界面、画中画、可读字幕和水印。
## 分镜与镜头规则
- **一条 = 一个镜头 = 一次生成**,最长 15 秒。升级全部发生在同一个长镜头里,节拍用「节拍 1 / 2 / 3 / 收尾」写,**不写秒数时间戳**(模型执行不准)。
- **三层构图**:
- 前景:观众的头、肩、举起的手臂,边缘零星几部小手机,遮住舞台下沿一点;手机永远在边缘、很小、不重放舞台画面。
- 中景:同一舞台平台上的两位演员、道具、烟雾、能力触发点。
- 背景:剧场建筑、主题布景、台阶、竖旗、灯架、天空 / 夜色、烟层。
- **运镜**:轻微手持呼吸晃动;强光或冲击波时跟着人群小幅后仰、上摇;允许 1-2 次由舞台事件触发的短暂数码推近或注意力横摇(推到发起者,再摇回找防守方),之后回到能同时看见两人的取景。
- **双人共处规则**:先建立统一舞台坐标(左 / 右、前 / 后、上层台阶 / 中央平台),每个节拍都写四件事:A 的动作、B 的反应或反制、两人之间或舞台中央的可见奇观、观众视角镜头的反应。一方放能力时另一方必须在画面里当目标、防守者或空间锚点。
- **动作小、特效大**:演员的动作简洁可读,真正的主角是不断升级的舞台大事件。
- **受击要有身体反应**:退半步、滑步、压低重心、前臂挡脸、肩膀被打偏、屈膝、撑地、从烟里稳住身形。特效不能代替身体反应,也不出现血和真实受伤。
- **人群分阵营**:台下分成支持 A 和支持 B 的两拨,谁占上风谁那边欢呼、起立、举手举手机;反转时另一边爆发。不要只写「观众惊呼」。
- **标准五拍结构**:
1. 建立观众视角、舞台和两人站位,一方指尖冒出第一缕能量,另一方戒备。
2. 第一次交锋化为舞台机关:黑烟从左侧扫来,右侧演员用蓝色电光墙挡住;镜头短暂推近发起者再摇回中线。
3. 中线最大碰撞:被压制的一方明显后退、滑步、挡脸;冲击波劈开烟雾,优势方的观众被闪光照亮、起立欢呼,镜头随人群微微后仰。
4. 反转或第二奇观:被压制方从烟中、侧翼、上方或借舞台机关反击,另一方真实地防守或后撤,人群优势翻转。
5. 收尾定格:两人分立在逐渐消散的中央能量两侧,一攻一守,烟和光散去,给收尾旁白留空间。
- 分镜表字段:节拍 / 角色 A 动作 / 角色 B 反应 / 舞台奇观 / 镜头反应 / 人群反应。
## 提示词写法
- 提示词主体写中文,负面约束和少量固定术语用英文。
- **图片提示词结构**:真人演员定位 → 原创外观(发型假发、服装材质与配色、配件)→ 能力来源 → 姿态 → 舞台灯光 → 真实摄影质感。
- 图片示例:
```
真人舞台特技演员全身照,铜金色刺短假发,橙色与炭灰拼接的运动风舞台战斗服,青色护腕,无头带无徽记;双臂缠着发光的金橙色灯带,右手前伸。户外夜间主题乐园舞台,侧逆光与烟雾,真实布料褶皱和舞台汗水,realistic live performance photo, not anime, not cartoon.
```
- **视频提示词结构**:观众视角与一镜到底声明 → 三层户外舞台构图 → 两人站位关系 → 真人外观与能力触发 → 受击身体反应 → 节拍 1-收尾 → 人群分阵营反应与前景道具 → 声音排除 → 负面块。
- 每条视频提示词开头都写:
```
First-person audience POV from inside the crowd, camera equals the viewer's eyes, no visible phone body, no recording interface, no screen-in-screen; one continuous 15-second handheld long take with occasional event-driven digital zoom and short attention pan; foreground lower edge has audience heads, shoulders, raised arms and a few small edge phones; raw phone-recorded live show realism, slight handheld breathing shake, imperfect exposure.
```
- 视频示例(接在上面开头之后):
```
夜间户外主题乐园剧场,木质台阶看台、两侧竖旗、顶部灯架,干冰雾贴地流动。图1 黑衣蒙面忍者演员站在舞台左侧,图2 银灰短发、深海蓝高领演出服的剑士演员站在右侧,图3 为舞台空间。节拍1:忍者双手结印,脚下冒出黑烟;剑士压低重心举剑戒备。节拍2:黑烟从左侧扫向中线,剑士抬掌展开半透明六边形蓝色电光墙挡住,镜头短暂推近忍者再摇回中线。节拍3:黑烟与电光在中线猛烈相撞,剑士被推得滑退半步、前臂挡脸,冲击波劈开地面雾气,左侧观众被闪光照亮、起立欢呼,镜头随人群后仰。节拍4:剑士从烟中跃起,剑身引下一道竖直蓝色光柱砸向中央,忍者后撤翻滚,右侧观众爆发欢呼。收尾:两人分立两侧,中央余烟和电弧缓缓消散。no music, no subtitles.
```
- 每条视频提示词末尾固定加负面块:`official franchise character names, copyrighted logos, emblems, headbands, face marks, readable subtitles, text overlay, watermark, UI, cartoon, anime style, cel-shaded, plastic mascot suit, game CG character, floating VFX sticker, clean CGI arena, stiff motionless crowd, missing hit reaction, large foreground smartphone, centered phone screen, phone recording interface, screen-in-screen, third-person cinematic camera, drone shot, broadcast camera, hard cuts, new shot, extreme shaky camera, morphing, smearing, deformed hands, gore`。模糊的旗帜、灯箱、装饰字可以保留,只禁止可读字幕和 logo。
## 在 TVVV 上执行
- 角色和舞台用 generate_image,默认 Nano Banana 2;舞台背景上需要精确可读的招牌文字时用 GPT Image 2(一般不需要)。用户有参考图就放进 reference_images 改造成真人演员质感。
- 视频用 generate_video,默认 Seedance 2.5、720p、默认 9:16;一条 15 秒一次生成(模型单段上限不足 15 秒时拆成 2 段,后一段用前一段末帧做 first_frame,节拍接续)。reference_images 带上角色 A、角色 B、舞台图(和必要的道具图),image_role 用 reference。
- 旁白用 generate_speech:只有开场一句和收尾一句,不解说中间动作;声线按画面选低沉神秘男声、清冷空灵女声、力量型男声或热血男声。
- 配乐用 generate_music:纯器乐 + 音效化编曲,无人声无歌词,关键词如太鼓、低频嗡鸣、呼啸、雷裂、火焰咆哮、人群惊叹;多条视频共用一条配乐时复用,不重复生成。
- 一次回复最多 3 次工具调用:资产一轮,视频一轮,声音一轮。
- 生成被判定为敏感 / 疑似版权内容时,不要自动换模型;告诉用户外观可能太像某个 IP,给两个选择:进一步弱化外观特征并加强能力光效描述,或重新设计外观后重试。
- 交付清单:每条 15 秒视频作为独立片段;配乐音量约 0.7、旁白 1.0,保留部分现场原声;开场旁白对齐节拍 1,收尾旁白对齐收尾拍,配乐能量峰值落在节拍 3;最后 2 秒淡出但不切断旁白。提示用户在 TVVV 时间轴里叠音和导出。
## 注意事项
- **变成第三人称大片**:一旦写了 cut to、new shot 或转播机位,就丢了现场感。开头声明观众视角,负面块必须带上。
- **手机抢画面**:写「观众举手机」容易出现画面中央的大手机和录像界面。手机只写「边缘零星小手机」,负面里禁止画中画。
- **单人炫技**:一方放大招时另一方从画面消失。每个节拍都写对方此刻在哪、在做什么。
- **特效像贴纸**:特效必须写清它照亮了谁、推开了什么烟、在地面投下什么影子。
- **动漫味太重**:服装写成「演出服 / 假发 / 护目镜」等真人材质,负面里排除 anime、cel-shaded、plastic。