
建筑模型组装动画
上传建筑图,生成部件飞入拼装、内部结构可见的3D旋转动画
用我上传的这栋美术馆照片,做一段20秒的建筑模型组装动画,配轻快音乐
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 建筑模型组装动画
适合建筑事务所、地产项目、文旅场馆、设计学生展示作品:用户上传一张或多张建筑照片 / 效果图,生成一段「建筑模型从零件拼成整体」的动态展示——构件从天而降、从四周聚拢、3D 打印般逐层长出、剖面和爆炸图展开、粒子与点云汇聚成形、线框骨架先搭再覆表皮。过程中能看到梁柱楼板等内部结构,模型持续自转,光影随之流动,配上「咔嗒」落位的组装音效和轻快配乐。交付 2-4 段视频拼成的 15-40 秒成片。
## 开工前确认
- **必须有至少一张建筑参考图**。没有就提示用户上传,可以是实景照片、效果图、模型照片、立面图;多角度更好。上传后直接进入设置,不要再问「确认使用这些图吗」。
- 所有上传的图按上传顺序全部使用,不筛选、不重新分组,也不让用户选建筑风格或重点(参考图就是答案)。
- **只问两件事**:画幅(16:9 / 21:9 / 9:16 / 4:3 / 3:4 / 1:1,默认 16:9)和总时长(整数秒,默认 20 秒)。用 ask_user 一次问一个,先问画幅。
- 组装方式不让用户挑,固定把九种方式组合使用:从天而降、四周聚拢、3D 打印、剖面展示、爆炸图、折叠展开、粒子汇聚、点云重建、线框骨架搭建。
## 制作流程
1. **项目设定** —— 在回复里用小表格列出:画幅、总时长、分段方案、参考图数量、配乐方式。不需要停下,直接往下走。
2. **分段设计** —— 按总时长切段,每段 8-10 秒,最后一段取余数但不少于 5 秒(例如 20 秒 = 10 + 10;35 秒 = 10 + 10 + 10 + 5)。每段分配不同的组装主题,形成「骨架 → 结构 → 表皮 → 成形」的递进(见下表),在回复里给出分段表。
3. **逐段生成视频** —— 每段都带上全部建筑参考图,一次生成 2-3 段。
4. **配乐** —— 单段成片时配乐可以直接写进视频提示词;多段拼接时单独生成一条轻快配乐,保证段落之间音乐连贯。
5. **确认与交付** —— 视频全部生成后停下一次,给用户看结果,确认后给交付清单。这是全流程唯一的停顿点。
## 风格锁定
- 统一画风短语(每段都带):`architectural scale model assembly, clean 3D render, visible internal structure, beams columns and floor plates, rotating on a turntable, soft studio lighting with moving shadows, high detail`
- **材质**:忠实还原参考图的立面材料(玻璃幕墙、清水混凝土、木格栅、金属板、砖),构件边缘干净,像精密建筑模型而非玩具积木。
- **背景**:简洁的深灰或浅灰无缝影棚,或带细网格的工作台面,突出模型本身。
- **光线**:一盏主光从侧上方来,随模型旋转在立面和内部结构上扫过;组装完成时加一道轮廓光让整体「亮起来」。
- **必须避免**:建筑外形偏离参考图(层数、轮廓、屋顶形式变了)、构件漂浮不落位、穿模、画面出现文字和 logo、镜头剧烈抖动。
## 分镜与镜头规则
- **组装顺序**:按结构层次从下到上、从内到外——基础与地下室 → 柱网与核心筒 → 楼板逐层 → 外墙与幕墙 → 屋顶与细部。梁、柱、框架、楼板在组装过程中必须清楚可见。
- **自转**:模型全程匀速自转(约每 10 秒转 90°-120°),让每个立面都被看到;不要忽快忽慢。
- **运镜**:自由运镜,但一段内以一种为主:环绕、缓推、缓拉、升起俯瞰、下降平视。开头偏远景看全局,组装高潮推近看节点,结尾拉远看整体。
- **分段示例(20-40 秒)**:
| 段落 | 时长 | 组装主题 | 画面重点 | 运镜 |
|---|---|---|---|---|
| 1 | 10s | 点云重建 + 线框骨架搭建 | 光点汇聚成地基轮廓,线框从下往上搭出柱网 | 远景缓慢环绕 |
| 2 | 10s | 从天而降 + 四周聚拢 + 剖面展示 | 楼板和梁逐层落位,剖面露出内部空间 | 缓推到中景 |
| 3 | 10s | 3D 打印 + 折叠展开 | 外墙像打印一样逐层长出,幕墙面板折叠展开覆盖 | 升起转俯视 |
| 4 | 5-10s | 爆炸图收合 + 粒子汇聚 | 散开的构件回收成完整建筑,粒子补全细部,整体亮起 | 拉远定格全貌 |
- **音效设计**:每次构件落位一声清脆「咔嗒」,大块楼板落下一声低沉「咚」,金属构件对接一声短促机械咬合,粒子汇聚时轻微的沙沙声;音效和关键落位动作同步。
- **分段表字段**:段号 / 时长 / 组装主题 / 画面重点(结构层次)/ 运镜 / 音效。
## 提示词写法
- **视频提示词结构**:参考图说明(全部建筑图都列出)→ 本段组装方式与顺序 → 内部结构可见 → 模型自转 → 光影变化 → 运镜 → 音效 → 配乐(单段写风格,多段写 no music)→ 排除项。用户用中文交流时提示词主体用中文。
- 示例(中文):`参考 图1 图2 中的建筑,还原它的模型组装全过程:先由点云和发光粒子汇聚出地基轮廓,接着线框骨架从下往上搭出柱网和核心筒,楼板从天而降逐层落位,组装中清楚看到梁柱楼板等内部结构。建筑模型在转台上匀速自转,侧上方主光扫过结构投下移动的阴影。镜头远景缓慢环绕。音效:<构件落位的清脆咔嗒声,楼板落下的低沉咚声,金属对接的机械咬合声>。no music,无文字,无 logo,外形严格忠于参考图。`
- 单段成片时把末尾的 no music 换成配乐描述,例如:`配乐:轻快明亮的电子与管弦混合,120 BPM,钢琴和拨弦点缀`。
- 提示词总长控制在 2000 字符以内,别把九种方式全堆进一段,按分段表各取 2-3 种。
## 在 TVVV 上执行
- 用户上传的建筑图直接作为 图1、图2…;每一段 generate_video 都在 reference_images 里带上全部建筑图,image_role 选 reference。一般不需要先生图;如果参考图只有一张角度很偏的照片,可先用 generate_image 补一张干净的白模 / 效果图视角作为补充参考(默认 Nano Banana 2)。
- 默认视频模型 Seedance 2.5,画幅按用户选择,720p,单段 8-10 秒(最短 5 秒)。
- 多段时用 generate_music 生成一条与总时长一致的配乐:`cheerful, light, bright rhythm, electronic and orchestral hybrid, 115-125 BPM`;单段时配乐写进视频提示词,不另生成。
- 一次回复最多 3-4 次工具调用;段数多时分批生成,每批回来检查外形还原度再继续。
- 结尾交付清单:按段号列出视频、拼接顺序;段与段之间硬切或 0.3 秒快速溶接,保持「连续组装」的感觉;保留视频原生音效,配乐整段铺底、音量适中不盖住咔嗒声,关键落位尽量卡在音乐重拍上。提醒用户去 TVVV 时间轴剪辑合成。
## 注意事项
- **建筑变样**:每段都带齐全部参考图,并写「外形严格忠于参考图」;层数和屋顶形式最容易漂,可以在提示词里点名(如「五层,坡屋顶」)。
- **段落衔接跳变**:后一段的开头状态要承接前一段结尾(例如上一段结束于骨架完成,下一段就从骨架开始落楼板),在提示词里写清起始状态。
- **构件乱飞不落位**:一段只用 2-3 种组装方式,写清「逐层」「从下到上」。
- **看不到内部结构**:明确写剖面或半透明外墙,让梁柱楼板露出来。
- **音效太吵**:音效只配关键落位,不要每一帧都在响;配乐别压过音效。