
云海天宫巨构
人在看不全的东方天宫巨构边缘,云海、斗拱、瀑布,出关键帧和慢镜短片
一位仙子背影站在巨大屋檐下的白玉栏杆边,远处云海和瀑布,做一组天宫短片
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 云海天宫巨构
适合做中国神话天宫题材的关键帧和短片:云端仙境、看不到尽头的仙家巨构、天宫里的日常小景。核心画面永远是「人在一座看不全的东方天宫巨构里面、下面或边缘」:一侧被裁出画框的连续建筑压住,另一侧打开明亮的云海呼吸空间,人物只负责提供尺度、视线和生活细节。交付一组 16:9 关键帧(通常 4-8 张)+ 每镜约 5 秒的慢运镜视频,剪成 20-40 秒无配乐、只有自然声的短片。
## 开工前确认
- 用户给了完整的英文生图提示词:除画幅、模型规则外原样使用,不改写不扩写。
- 用户只给一句话意图(如「仙女在天梯上回头」):按下面的六段事实链扩写,并默认放进天宫巨构的边缘,而不是天宫全景或人物写真。
- 用户有参考图:每张只分配一个职责(构图 / 人物 / 配色 / 材质 / 光线),不要混用导致互相污染。
- 用 ask_user 只问一个关键选择:装饰密度——「雅致」(降低装饰和饱和度,但保留巨构压迫感和白玉/木构的重量)还是「繁丽」(加重矿物颜料、朱红、孔雀蓝、青绿、铜金浮雕,但云海开口不能丢)。两者是同一空间语言的两档密度,不是两个世界。
- 画幅、时长、分辨率确定后不擅自改。
## 制作流程
1. **参考提炼** —— 有参考就逐张写可执行事实:机位在檐下、柱间、侧墙边、窄台、桥侧还是结构内部;哪块建筑压住画面、从哪两三条边出画;重复节奏来自斗拱、柱列、层檐、台阶、梁架还是水帘;云海占比;人数、位置、朝向、身高占比;光向与冷暖。输出「最可能跑偏的三件事」和建议的装饰密度。
2. **统一视觉 DNA** —— 在回复里给一张「镜头事实卡」模板并为每个镜头填好:观看位置、建筑压哪一侧、从哪几条边出画、密集区与云海开口的比例、唯一的结构奇观、人物精确坐标与动作、主光方向。
3. **试拍一张代表镜头** —— 先只为最有代表性的那一镜出 2-4 个候选。**停下**,等用户确认空间、色彩、质感方向再批量出其余镜头(用户明确接受风险才跳过试拍)。
4. **扩展其余关键帧** —— 以确认的代表镜头作为参考图,继承空间语言和渲染质感。每张出图后先自检,不合格不推荐给用户;每个不合格镜头最多自动修正重跑一次,仍不行就说明原因等用户决定。**逐张确认**——确认一张不等于确认全部。
5. **逐镜生成视频** —— 只用用户确认过的关键帧做首帧,每镜 5 秒,逐镜生成逐镜审。
6. **交付** —— 确认的镜头按顺序给出剪辑方案。
## 风格锁定
- 统一关键词:`inside an ungraspable Chinese celestial palace megastructure, Tang-Song timber architecture, dense interlocking dougong brackets, monumental xieshan eaves, vermilion lacquer columns, turquoise glazed tiles, white-jade cloud-scroll balustrades, bright cloud sea, 35mm live-action mythic fantasy set photography, soft highlights, very light film grain`。
- 构图比例:主镜头里一块被裁切的建筑体占画面约 55%-70%,明亮云海/天空开口/远处暖光占约 25%-40%,人物和小道具只占剩下的部分;主体建筑至少从两条画框边溢出,并有一种可以无限延伸的重复节奏。
- 偏好机位:巨檐正下方、窄云台边缘、无尽侧墙旁、柱列之间、藻井内部、残缺门洞、通天阶梯底部。休息镜头也要从半掩的门洞、桥侧、廊角、古松平台、巨墙缝隙里看出去。
- 每镜只能有一个「奇观事实」:无尽弧形回廊 / 宫墙底部持续流出的水 / 羽肋巨型天顶 / 鳞片状斗拱 / 被云吞没的门 / 通天阶梯 / 无尽侧墙 / 一道垂直水帘,选一个。
- 神兽默认转译成建筑语法:羽肋浮雕、羽状屋面层、鳞片斗拱、蛇形屋脊、扫掠的结构肋,不画活的龙头凤嘴、翅膀爪子。用户明确要活神兽时只能有一只,放远处、部分遮挡、地位次于建筑。
- 色彩:云白、青瓷/冷青、孔雀蓝、青绿、老木棕、浅金、青铜为主,朱红只做点缀;保留木头、白玉、琉璃瓦、丝麻、漆面和使用痕迹。光线选一种:桃金色侧光、温暖云层反光或柔和体积日光。
- 必须避免:哥特教堂、欧式城堡、巴洛克、希腊罗马柱、蒸汽朋克、皇冠纹章盔甲天使十字架等西方元素;航拍全景、完整天际线、对称宫殿正立面、居中的孤立亭台或漂浮小殿;帝王宝座、祭祀、跪拜等宫廷权力叙事;动画/游戏 CG/塑料感、霓虹科幻、巨型金属环、满屏无意义金光;灰褐风化的石头城;文字水印。
## 分镜与镜头规则
- 一组 4-8 镜,剪辑时有效片段约 2.5-3.5 秒,穿插少量 5 秒主镜头;默认硬切,只有明确的时空转换才用小于 0.5 秒的淡变。
- 人物 1-5 个成人,侧背、背面或斜侧,站在栏杆、柱脚、台缘、桥边、窄廊;默认占画面高度 3%-10%,脸不是视觉中心。多人要写清人数、左右分组、主要服装色块和一个生活动作(如「左侧栏杆两人交谈,右下回廊三人行走」),不要写「几位仙人」,不要仪仗队和复制脸。服装用交领、广袖、长袍、披帛、高髻、玉饰等中式词。
- 登阶、抵达、仰望类意图:优先选「已经在阶梯系统里的最低可见平台」机位——白玉天阶从前景斜向右上出画,云纹栏杆、朱红仪柱、带斗拱的歇脚亭重复延伸进亮云,上方只露一截唐宋木构。
- 视频每镜:一个主要人物动作 + 一条极慢的运镜 + 最多两层环境运动。运镜在横向漂移、轻推、慢拉、小幅升降、缓倾之间轮换;禁止静止镜头、快推、快速环绕、突然变焦、拉出完整城市的后撤。远近云层同向不同速缓慢漂移,瀑布持续下落,广袖披帛裙摆随高空风和身体惯性自然滞后。
- 相邻镜头检查:人数与服装色块、运动方向、光向、云的方向、云海高度、建筑连续性。
- 分镜表字段:镜号 / 时长 / 机位与压迫方向 / 出画边 / 奇观事实 / 人物坐标与动作 / 运镜 / 环境运动 / 声音。
## 提示词写法
- **图片提示词**:用英文写一条约 75-120 词的可见事实链,严格按六段顺序:[机位 + 画面压迫 + 出画边];[一套连续的中式建筑系统 + 重复节奏];[一个结构奇观];[精确人数 + 画面坐标 + 朝向 + 动作];[明亮云海/水的纵深];[材质色板 + 一种光 + 渲染目标]。前 30 个词必须回答:机位在哪、哪一侧被压、建筑从哪几条边出画。不要以 cinematic、epic、majestic、beautiful 开头。正文至少含三个中式结构锚点。末尾加排除项:no gothic cathedral castle baroque roman greek steampunk crown armor angel cross aerial skyline text watermark logo(建筑化神兽镜头再加 bird beak talon)。
- 图片示例:
```
Camera directly beneath colossal xieshan eaves, the cropped underside of dense interlocking dougong brackets presses in from the top and both sides, vermilion lacquer columns exit through the left and bottom edges; the bracket layers repeat endlessly into depth; one vertical water curtain falls from the eave edge on the right; one tiny female envoy in a celadon wide-sleeved robe stands at the lower-right white-jade cloud-scroll balustrade, back turned, gazing out; a bright deep cloud sea opens in the center distance; turquoise glazed tiles, bronze-gold relief, peach-gold side sunlight, warm cloud bounce, 35mm live-action mythic fantasy still, soft highlights, very light grain. No gothic, castle, aerial, skyline, text, watermark.
```
- **出图前自检**:开头有具体机位、压迫方向和至少两条出画边;不能概括成「完整宫殿/门/亭 + 云海背景」;建筑占比和云海开口对得上;只有一个奇观、一个视觉主体;人物有数量坐标朝向动作且不是正面写真;神兽是建筑语法。出图后出现以下任意两项判为不合格:居中完整宫殿或门亭、对称正立面、建筑不到半幅、没有云海开口、人脸成了焦点、宝座祭祀叙事、活神兽喧宾夺主、西方元素、灰褐风化质感、同时两个以上奇观。修正时只重写前 30 个词里最关键的三项,不靠堆形容词。
- **视频提示词结构**:首帧完整锁定 → 保持首帧的人数、服装色块、建筑几何、光向、云海高度与颜色 → 一个人物动作 → 一条极慢运镜 → 最多两层环境运动 → 声音 → 负面约束。
- 视频示例:
```
图1 as the complete first frame; preserve the single envoy, her celadon robe, the eave and bracket geometry, side light direction and cloud-sea height. She slowly lifts one hand to the balustrade and turns her head slightly upward; wide sleeves and shawl trail gently in high-altitude wind. Very slow lateral drift to the left. Near and far clouds drift right at different speeds; the water curtain keeps falling. Sound: high-altitude wind, falling water, soft fabric rustle. No dialogue, no music, no new people, no birds or beasts, no text, no static camera, no fast push-in, no melting structure, no pullback revealing the whole palace.
```
## 在 TVVV 上执行
- 关键帧用 generate_image,默认 Nano Banana 2、16:9;代表镜头确认后,其余每镜都把它作为 reference_images(image_role `reference`)带上,继承空间语言和质感;用户上传的参考也一并带上并在提示词里说明各自职责。本 skill 画面不需要文字,不用 GPT Image 2。
- 视频用 generate_video,默认 Seedance 2.5、720p、16:9、5 秒;确认过的关键帧作为 `first_frame`。不在首帧里的重要人物、神兽、建筑、道具不要在视频里新增。
- 默认不用 generate_music、不用 generate_speech:无对白、无旁白、无配乐,只保留高空风、瀑布、脚步、流水、衣料声。用户明确要配乐时再用 generate_music(古琴、箫、长音弦乐的空灵氛围)。
- 每次回复最多 4 次工具调用:试拍一轮;关键帧每批 3-4 镜;视频每批 2-3 镜,回来审过再继续。
- 交付清单:确认的关键帧、每镜视频、剪辑顺序(2.5-3.5 秒片段 + 少量 5 秒主镜头);提示用户在 TVVV 时间轴里硬切拼接,只平衡自然声,不加字幕标题。
## 注意事项
- **变成天宫明信片**:最常见的失败是「完整宫殿 + 云海背景」。永远让建筑从至少两条边溢出,机位放在结构里面或边缘。
- **变成古装人物写真**:人物一大、一转正脸,画面就塌了。坐标写在画面下角,占高 3%-10%,背面或侧背。
- **西方元素混入**:「palace」「celestial」容易引出教堂和城堡,正文多写斗拱、歇山、藻井、白玉栏杆这类中式锚点,排除项必带。
- **视频镜头拉出全景或冻住**:负面写清 no pullback revealing the whole palace、no static camera,云和水必须一直在动。
- **烧额度**:每个不合格镜头只自动重跑一次,不要无限重试;已确认的镜头不再动。