
东方浓彩武侠大片
大色块、仪式感、风雨雪沙的东方武侠与古装电影短片
一位红衣女刺客在竹林雨中拔剑对峙黑衣剑客,做一支 30 秒横屏武侠短片
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 东方浓彩武侠大片
适合武侠短片、古装史诗片段、高端国风广告。核心是用一种主色统治画面、用仪式化的慢动作和风雨雪沙的自然介质托住情绪,治掉 AI 视频常见的廉价感、脸部漂移和平光。致敬张艺谋式的浓烈色彩与仪式美学。默认交付 30 秒横屏、5-8 个镜头,环境声贯穿,可选配乐,无旁白无字幕。
## 开工前确认
- 一句话核心概念或剧情(必需)。只有一句话也可以,由你扩写人物和场景。
- 用 ask_user 先问最影响画面的那一项:主色调。
- 英雄红:热烈、宿命。
- 墨黑:水墨、隐忍。
- 竹青:清冷、杀意。
- 沙黄:尘土、生命力。
- 节奏(慢节奏仪式长镜头 / 中速叙事 / 快节奏蒙太奇,默认慢)、运镜偏好(仪式静止 / 慢动作 / 混合,默认混合)、时长(默认 30 秒)可以直接按默认推进,在设定里写明,用户想改再改。
- 用户有人物脸、服装或场景参考图就先分析:人物提取骨相、肤色、眼型、发型、服装材质与配色、标志道具;场景提取空间类型、主色占比、光线方向、标志性建筑或道具;服装图提取材质(粗麻、重甲、轻纱)和装饰细节。
## 制作流程
1. 项目设定 —— 回复里给出「项目设定」:核心概念、主色调、节奏、运镜偏好、时长、画幅、声音策略。停下等确认。
2. 分镜设计 —— 给出「人物卡」「场景卡」「分镜表」「声音层」。同一段连续动作(奔跑、追逐、对峙、情绪推进)标同一个连续组。停下等确认。
3. 参考资产 —— 每个人物出一张身份设定图,每个场景出一张场景设定图,道具、马匹、车辆有跨镜头出现的也各出一张。全部到位并确认后才进入视频。
4. 逐镜生成 —— 按分镜顺序分批生成,每个镜头都带上出场人物和场景的参考图;同一连续组的相邻镜头再带上一镜的结尾画面。
5. 声音层 —— 环境声(风、雷、雨、金属摩擦)为主,用户要配乐再加。确认后再进剪辑。
6. 交付清单 —— 剪辑顺序、转场方式、音量层级。
## 风格锁定
- 主色统治:场景里主色占比 ≥65%,其他颜色降饱和或做水墨化处理,让视线只有一个焦点。
- 光线:强侧光勾骨相,或强逆光让发丝、雨滴发亮;明暗强对比,暗部压成深邃的黑。禁止平光。
- 构图:对称构图、框中框(透过红纱、竹叶缝、窗棂、剑锋间隙窥视主体)、大面积留白。
- 自然介质:每个镜头必须有一种被放大的介质——狂风、暴雨、静雪、飞沙。竹林默认微风,可升级为狂风。
- 质感:保留皮肤毛孔、汗、尘土,轻微胶片颗粒;禁止磨皮、塑料皮肤、美颜滤镜、过度锐化。
- 风格词:cinematic wuxia epic, dominant [主色] color field, desaturated secondary colors, strong side light, strong backlight rim, deep black shadows, symmetrical composition, frame within frame, film grain, real skin texture。
- 必须避免:甜腻配色、现代转场、APP 风格的图标和渐变色块混进设定图、抽象情绪词。
## 分镜与镜头规则
- 节奏决定时长:慢节奏单镜 6-12 秒,固定长镜头 ≥70%;中速 4-8 秒,手持跟拍与固定长镜头混用;快节奏 2-4 秒,只用于动作高潮段,连续快切不超过 5 个,之后必须插一个 ≥4 秒的「呼吸镜头」。
- 动作极度克制、仪式化:拔剑、回头、闭眼、收剑,一个镜头只做一件事,做足。
- 情绪一律拆成生理细节,禁止写「愤怒、悲伤、害怕、坚定」:
- 愤怒 → 颊肌抽动、牙关咬紧、鼻翼快速翕张、眼睛一眨不眨。
- 悲伤 → 逆光里一滴泪在下眼睑边缘聚起,穿过脸上的尘土缓缓滑落,呼吸间隔拉长到近乎窒息。
- 害怕 → 指尖轻颤、指甲掐进掌心留下月牙印、喉结上下滑动、视线移向右下角。
- 坚定 → 五指慢慢收拢握紧剑柄直到指节发白,下巴抬起约两度,颈部肌肉绷紧。
- 优先组合眼部、嘴部、颈手三个区域来叠加情绪层次。
- 连续性:每个镜头写「承接上一镜的状态 / 本镜功能 / 交给下一镜的状态」,只记人物位置、移动速度、环境强度、关键道具状态。连续动作中插特写时,至少写两处能证明连续的细节(缰绳、马鞍、身体惯性、背景视差、风向、道具摆动频率),否则特写会被拍成孤立的空镜。
- 分镜表字段:镜号 / 时长 / 场景卡 / 景别与构图 / 运镜 / 仪式动作与台词 / 自然介质 / 光线 / 微表情 / 连续组与承接状态。
## 提示词写法
- 人物身份设定图:16:9 横版、纯白底、不对称排布、大量留白,四区——主视觉(全身正面或微侧,展示服装材质)、剪影区(2-3 个正 / 侧 / 背黑色剪影)、表情区(3-4 个头像:沉默、坚毅、含泪、隐忍)、细节区(布料纤维、皮肤纹理、手或剑饰)。先写骨相和服装材质这种最关键的锚点,再写次要细节。
示例:16:9 landscape, pure white background, cinematic character identity sheet, asymmetric layout, generous whitespace. Main visual: a young swordswoman with sharp cheekbones and narrow phoenix eyes, ink-black hair tied high, layered crimson silk robe over rough linen, worn leather bracers, full body slightly angled. Plus three black silhouettes front side back, four facial close-ups silent resolute tearful restrained, detail zones of silk fibers and sword tassel. No skin smoothing, no plastic look.
- 场景设定图:16:9、与主色匹配的深色或纯色底,四区——主视觉全景、2-3 个不同光线缩略图(黎明金光 / 黄昏长影 / 暴雨灰)、3-4 个局部特写(青石、沙地、落叶、墙面或植被纹理)、1-2 张标注对称轴或框景入口的构图草图。
- 视频提示词顺序:运镜 → 主体仪式动作与生理细节 → 空间构图 + 自然介质 → 光影 → 主色 → 质感 → 固定负面词。一个镜头有多个节拍时按叙事顺序列出,不用时间码切分。
示例:Static long take, slow motion. The swordswoman in crimson stands at the center of a symmetrical bamboo corridor, slowly closes her fingers around the sword hilt until her knuckles whiten, raises her chin two degrees, a single raindrop slides down her dusty cheek. Torrential rain falls in dense sheets, splashing at her knees, bamboo leaves whipping in the wind. Strong backlight makes every raindrop glow, deep black shadows. Crimson dominates against desaturated green. Real skin texture, film grain. No subtitles, no music, no plastic skin, no flat lighting.
## 在 TVVV 上执行
- 人物、场景、道具设定图先用 generate_image 出,确认后作为图N;每个镜头 generate_video 都在 reference_images 带上出场人物和场景的图N,image_role 用 reference;同一连续组承接上一镜时,把上一镜末帧作为 first_frame。没有参考图的人物镜头一律不生成。
- 默认图片模型 Nano Banana 2;设定图需要精确的标注文字时用 GPT Image 2。默认视频模型 Seedance 2.5,aspect 16:9,720p,单镜 5-10 秒;慢节奏的长镜头需要 12 秒时拆成两段连续生成。
- 环境声和配乐用 generate_music:环境层写 wind ambience / distant thunder / metal friction, no melody;配乐写 melancholic, sense of fate, string-led, guzheng accents。默认不用 generate_speech。
- 一次回复最多 4 次生成调用,每批回来检查人脸是否贴合设定图、主色是否压得住、介质是否可见,再继续。
- 交付清单与剪辑建议:
- 镜头之间默认硬切;相邻两个慢长镜头可用 0.3 秒叠化表现时间流逝,全片不超过 3 次。
- 从慢节奏转入快节奏蒙太奇前插 0.5 秒黑场。
- 慢节奏在风吹、落叶、雨滴落地的动作峰值处切;快节奏卡环境声峰值或鼓点。
- 环境声为基准、贯穿全片,配乐比环境声低 3-5dB,高潮时短暂拉平、2 秒内回落。
- 开头 0.5 秒黑场淡入,结尾 1 秒淡出。
- 提示用户到 TVVV 时间轴剪辑合成。
## 注意事项
- 脸跟设定图对不上:先确认参考图是否带上;带了还漂就重写提示词,把骨相和服装锚点放在最前。
- 主色压不住、画面发灰:加重主色关键词,把干扰色写进负面词(例如 no cool blue cast, no desaturated red)。
- 风雨雪沙看不见:在空间部分写出密度和互动,比如「暴雨成片落下,水花溅到膝盖」。
- 现代感混入:不用滑动、翻页、缩放类转场,设定图里不出现现代排版元素。
- 演员表演过满:动作越慢越少越好,情绪留给细节和介质去表达。