
混合现实拆解变形
第一人称召唤实物,悬浮界面操控变形、爆炸拆解、穿越内部再复原
做一支20秒竖屏混合现实短片,用手机召唤一辆越野车,变形成机器人,再拆解车灯和整车
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 混合现实拆解变形
第一人称 14mm 超广角视角:举起手机召唤出一个物体(车、设备、玩具、产品都行),周围浮出锚定在空间里的界面,手指点击后物体换色、换环境、变形成机甲,再做局部爆炸、整机爆炸、穿越内部,最后复原并回到第一帧形成循环。默认交付约 20 秒 9:16 竖屏(3-4 段视频首尾相接),无旁白,只有环境、界面、机械和冲击音效。
## 开工前确认
- 输入可以是:物体名、产品图、参考视频、上一次失败的成片、指定时长或画幅。只给名字就由你设计原形态、强化形态、零件对应关系、拆解结构、内部路线和场景。
- 有产品图时锁定轮廓、比例、颜色、材质、标识和零件数量;做真实教学拆解时需要型号和可靠资料,纯视觉作品用「概念上可信」的结构即可。
- 用 ask_user 只问一个真正改变结果的问题,通常是「简单版还是完整版」:
- 简单版:召唤 → 一次变形 → 复原 → 收回,不超过 4 个状态,约 10-15 秒。
- 完整版:多轮界面、换色换环境、激进推拉、局部拆解、整机拆解、穿越内部,约 20 秒。
- 默认物体:无品牌的方盒硬派越野车——方正车身、圆形灯圈、粗胎、直立格栅、平车顶、短前悬。
## 制作流程
1. 需求理解 —— 回复里给小表:模式、物体、画幅、时长、场景、三种外观 / 环境状态(只在这里随机一次,选定后锁死)。
2. 身份资产 —— 白底「这个物体是什么」的定型图,不进视频时间轴:车辆四视图(正前 / 正侧 / 正后 / 前 3/4)、机甲四视图、变形对应关系图(原形 → 半变形 → 机甲)、整机工程爆炸图、局部(如左前灯)爆炸图、内部资产(驾驶舱、后舱入口、机械通道)。简单版只需前三张。
3. 零件对应表 —— 原位置 → 新位置,例如:车门→肩甲与前臂甲;前轮→膝关节;后轮→脚踝或背部动力环;格栅→胸甲;大灯→视觉核心;引擎盖→胸板;车顶→背甲;底盘悬挂→骨盆与承重骨架。变形顺序固定为「解锁 → 展开 → 关节旋转 → 抬升 → 就位 → 锁定」,复原严格倒序。
4. 关键帧时间轴 —— 列出 K 帧(清晰状态帧)和 M 帧(速度峰值帧)及其秒数,见下文。停下来等用户确认。
5. 生成关键帧图 —— 用身份资产作参考,按时间顺序出带场景的关键帧;逐对检查能否连续衔接,接不上先重做图,不要指望视频提示词去修。
6. 分段生成视频 —— 每段以一个 K 帧为首帧、下一个 K 帧为目标,写清这段的变化提示词。
7. 复查与返工 —— 标出出问题的秒数,只重做那一段。
8. 交付清单 —— 段落顺序、音效峰值、文字修补建议。
## 风格锁定
- 视角固定:第一人称、等效 12-18mm(默认 14mm)超广角,保留呼吸、脚步和惯性,不要像稳定器那样漂浮。
- 界面必须锚定在世界空间里,有透视、遮挡和视差,而且真的在控制物体或环境(换漆、昼夜、灯光、变形),不能只是贴在屏幕上的装饰。完整版至少三种布局:物体右侧的状态面板 → 镜头左拉后的左前景控制面板 → 三块面板半环绕物体。
- 统一关键词:`first-person POV, 14mm ultra-wide lens, world-anchored holographic UI, realistic hands and phone, photoreal vehicle materials, cinematic mixed reality`。
- 必须避免:物体「融化」成机甲、瞬间替换、跳过半变形状态、外部剖面冒充内部视角、生成时写「随机颜色 / 随机天空」、首尾两帧长得像但不是同一张。
## 分镜与镜头规则
- 完整版 20 秒参考节奏:
- 0-1.2 秒:手机举向天空,微缩车辆悬浮,头随之抬起后下甩,车辆落地。
- 1.2-4.3 秒:右侧状态面板 → 镜头左拉,左前景控制面板 → 三面板展开。
- 4.3-6.4 秒:同机位下,界面切换三种外观 / 环境状态,构图完全不变。
- 6.4-8.5 秒:手指点变形键,车身缝隙发光,半变形,镜头右摇到正面,完整机甲。
- 8.5-10.2 秒:激进推到机甲面部,不停顿再激进拉到侧后方全景。
- 10.2-12 秒:机甲倒序折回车辆,镜头同步后拉;同机位白天切夜晚。
- 12-14.2 秒:激进推到左前灯,灯罩 → 透镜 → 灯圈 → 电路 → 核心依次拆开,大幅横甩,零件复位。
- 14.2-17.4 秒:拉宽 → 正侧 → 后方,整车按「外壳 → 承重结构 → 功能模块 → 动力核心」爆炸展开,高速推进尾部通道,进入后舱,内部结构展开。
- 17.4-20 秒:从内部冲出,向右环绕后拉,车辆复原;上仰,夜转昼,手机入画,回到第一帧。
- 每个高速动作都写成曲线变速:短暂预备 → 非线性猛推 / 猛拉 / 甩镜 → M 帧速度峰值 → 到目标前急停 → 轻微过冲回弹 → 停留 0.15-0.3 秒看清 → 沿连续路径再加速。普通 K 帧是轨迹上的采样点,不是停车点。
- 相邻关键帧必须满足:至少一个共同可追踪的物体;原点、背景锚点和主光方向可推断;机位能用直线或弧线连上;画面占比与推拉距离匹配;运动方向延续;变形前后至少三组零件位置可追踪。
- 局部拆解、整机拆解、内部拆解用不同的身份资产和不同的时间段,顺序不能混。内部关键帧必须是真正位于物体内部的视角。
- 首尾帧直接复用同一张图,形成无缝循环。
- 时间轴表字段:编号 / 秒数 / 类型(K 或 M)/ 画面(机位、物体状态、占比、界面、手与手机、光线)。
## 提示词写法
- 身份资产示例:`pure white background, no scene, identity sheet of an unbranded boxy off-road SUV showing front, true side, true rear and front three-quarter views, identical proportions, colors, materials and part count, round headlight rings, chunky tires, upright grille, no transformation, no motion blur, no text`
- K 帧结构:编号与秒数 + 9:16 第一人称 14mm + 场景与光线 + 机位(相对物体的位置、高度、朝向)+ 物体状态与画面占比 + 背景锚点 + 手和手机位置 + 界面(布局、透视、遮挡、功能)+「清晰状态帧,严格继承身份资产」。
- M 帧结构:位于哪两个 K 帧之间的速度峰值 + 镜头沿什么路径高速推 / 拉 / 甩 / 环绕 + 当前位置 + 物体身份不变 + 运动模糊只沿某个方向 + 不提前到达终点、不改变物体状态。
- 段落视频提示词结构:起止秒数与 K 帧 → 镜头从哪到哪、沿什么路径 → 先预备多久、在哪达到峰值、急停过冲回弹 → 终点是否停留 0.15-0.3 秒 → 物体只做一个主要变化 → 保持不变的东西(身份、原点、背景、界面、手、手机、光线)→ 手势写成「接近 → 触碰 → 界面反馈 → 2-6 帧延迟 → 物体响应 → 手回弹」→ 本段禁止项。
- 示例:`From the first frame, the camera prepares for 0.2s, then accelerates nonlinearly along a straight push toward the robot's face, peak speed with radial motion blur at mid-distance, brakes hard just before the face, slightly overshoots and rebounds, holds 0.2s for recognition, then immediately pulls back toward the side-rear along a smooth arc to a wide view. The robot only turns its head slightly. Keep identity, background anchor, night lighting and UI unchanged. Sound: servo whine leading the push by 2 frames, impact thump at the stop. No narration, no text.`
## 在 TVVV 上执行
- 身份资产和关键帧都用 generate_image:默认 Nano Banana 2;界面上要有清晰可读的数字和文字时用 GPT Image 2。同机位的状态帧尽量以上一张图为参考只改界面控制的那部分。
- 视频用 generate_video,默认 Seedance 2.5,9:16,720p,每段 5-8 秒:reference_images 带当前段起点 K 帧(image_role 选 first_frame),再带车辆和机甲身份图(image_role 选 reference)。20 秒完整版拆成 3-4 段,下一段的首帧用上一段的末帧或对应 K 帧。最后一段的目标画面就是第一帧那张图。
- 本片默认不配旁白、不配歌;需要底乐时用 generate_music 出一段低调的电子氛围乐,音量压在音效下面。
- 一次回复最多 3 次工具调用:身份资产一轮,关键帧分 2-3 轮,视频按段一轮一轮出,每轮先自查衔接再继续。
- 交付清单:段落顺序与接缝秒数;音效安排——连续环境声,界面短点击和确认声,变形用伺服、导轨、锁扣、磁吸声,局部爆炸 / 整机拆解 / 内部推进 / 冲出各一个峰值,声音领先激进推拉 1-3 帧,大冲击后留 2-5 帧静音。界面文字模糊时,建议在时间轴里叠一层透视匹配的矢量文字。
## 注意事项
- 画面跳:先查相邻关键帧能不能连上,连不上就重做图,不要堆更长的提示词。
- 每个 K 帧都停一下显得机械:段落提示词里只在界面、面部、爆炸结构和内部节点写短暂停留,其余写「不停顿,保持运动趋势」。
- 变形像融化:必须有半变形关键帧,并在提示词里写清「解锁 → 展开 → 旋转 → 抬升 → 就位 → 锁定」。
- 颜色乱变:三种状态在规划阶段定死,提示词写具体颜色和天空,不写随机。
- 首尾不循环:最后一段必须以第一帧原图为目标画面。
- 白底图直接出现在视频里:白底身份图只能作 reference,绝不能作 first_frame。