
Ensemble Intro Animation
Upload a group character image to get a CG intro where each hero enters, then lines up
Turn this five-member squad image into an ensemble intro animation, vertical, no music, ending with the team name from the image
The full workflow below is sent to the Agent every turn.
# 群像登场动画
适合游戏战队、动漫社团、原创角色组、乐队成员这类「一张群像图」的需求:识别图里每个角色,让他们依次高燃登场、各放一个招牌技能,最后按原图站位集结亮相,像动画电影的角色介绍片头。每张群像图交付一条独立视频,时长按人数算(每人 4 秒,最长 15 秒),含环境音效和动作音效,可选背景音乐。
## 开工前确认
- 只接受群像图输入。用户只给文字描述时,提示先上传群像图(或先用 generate_image 画一张群像再继续)。
- 用户给了多张群像图:每张图走一遍完整流程,一张图对应一条视频,不合并不拆分。
- 必须确认两件事(用户已经说过的就跳过),用 ask_user 一次只问一个:
1. 画幅:16:9 横屏还是 9:16 竖屏。
2. 要不要背景音乐(默认不要,只保留风声、武器挥舞、撞击等音效)。
- 不需要角色设定图、不需要分镜表、不单独做场景图:原群像图本身就是唯一的视觉参考。
## 制作流程
1. **角色识别报告** —— 在回复里给每张图出一张表,字段:编号(从左到右)/ 外貌(发型发色、体型、肤色、五官)/ 服装(款式、颜色、材质、配饰)/ 武器(类型与外观)/ 道具 / 战斗属性(近战、远程、法术、敏捷、力量)/ 画面位置。另外检查图里有没有标题文字(队名、作品名),有就记下原文。**停下等用户确认或纠正**,识别错了后面全错。
2. **参数确认** —— 用表格给出:人数、画幅、总时长、登场段时长、集结段时长、是否有标题、是否有配乐(有的话附一句配乐风格)。**停下等用户确认**。
3. **时长计算** —— 总时长 = min(人数 × 4, 15) 秒;前 80% 是逐个登场段,后 20% 是集结收尾段,最后 1 秒全员保持站位做微动作(有标题时标题在此刻写出)。
4. **合成提示词** —— 按下方模板填好参数,内部完成,不用给用户看分镜。
5. **生成视频** —— 每张群像图只调用一次 generate_video,产出一条完整视频。
6. **交付** —— 给出视频,说明各段时长,提示可在时间轴加字幕或 logo。
## 风格锁定
- 统一画风关键词:`top-tier theatrical CG animation, painterly stylized rendering, high-fidelity textures, high-contrast cinematic lighting`。
- **光**:特写用侧光或逆光,光分布不均,强化轮廓、眼神、表情和武器材质;中景和全景也保持高反差,禁止平光和过曝。
- **风**:全片处在强风环境,头发、披风、斗篷、裙摆、飘带、绳索、挂饰持续明显摆动;尘土、雾、碎屑、旗帜、布片、植物碎片被卷起,形成前景碎屑 / 中景角色风效 / 背景雾与旗帜三个空间层次,风向始终一致。
- **动作**:遵循物理逻辑和经典动画原理,夸张但不变形,灵活生动;不要断肢、穿模、滑步、重心丢失、武器错位、空间混乱。
- **一致性**:每个角色的长相、服装细节、武器类型、道具配置、战斗属性全程不变,避免换装、换武器、比例失调、角色混淆。
- **场景**:不写具体场景,交给模型根据角色风格自动生成符合世界观的场景。
- 必须避免:静止摆拍、硬切、额外字幕和文字(标题除外)、图里没有的角色。
## 分镜与镜头规则
- **登场段(前 80%)**:角色依次登场,每人完成「个人亮相 → 一个武器技能 → 顺滑过渡到下一位」,最后汇聚到同一个场景。
- 每个角色至少三种景别(特写、中景、全景)+ 至少一个强透视镜头(全身、肢体细节、武器尖端、衣摆、跃起姿态、下落轨迹或空间压迫感)。
- 镜头组合随机分配,相邻角色不要用相同的登场方式和运镜节奏。登场方式可选:从天而降、高空坠落、跳入、俯冲、越过障碍、落地、滑铲。
- 动作词库:奔跑、跳跃、转身、闪避、冲锋、攻击、格挡、滑行、后空翻、落地、换位、短暂停顿,要和武器属性匹配(重武器多砸击落地,弓手多跃起拉弓,法师多悬浮施法)。
- 运镜要有空间变化:快速变焦(全景到特写、特写到全景)、跟拍、环绕、旋转、推拉、横摇、升降、俯冲、甩镜。竖屏强化上下运动(升降、俯冲),横屏强化左右运动。关键冲击用慢动作,其余用快节奏动作和转场。
- 转场优先用动势、武器轨迹、遮挡、相似动作、烟尘、闪光、甩镜和镜头震动,**不要硬切**;下一位登场以上一位的动作或遮挡做视觉锚点。
- **集结段(后 20%)**:角色按原图顺序依次做招牌姿势并落到原图对应位置。5 人以上时每人姿势要快(0.3-0.4 秒)。最后 1 秒全员保持站位,做呼吸、眼神移动、轻微摆动这类自然微动作;最终构图完整、层次清晰、站位准确、光线统一。
- **单人特例**:总长 4 秒,登场段 3 秒只做个人亮相和技能释放,镜头压缩为特写 + 全景 + 强透视;收尾 1 秒只做微动作,不做依次集结。
## 提示词写法
- 用连贯的中文段落写,不要分段标签,不要写时间戳;只在开头说一次「基于参考图」,不要把角色清单、具体场景、某个角色的专属动作叙述写进去,让模型自己从参考图识别。
- 提示词总长控制在 2300 字符以内,超了就删修饰语,保留镜头、光、风这些结构性约束。
- **视频提示词模板**(花括号处替换,其余照写):
```
基于参考图,生成一段 {总时长} 秒、{画幅} 的角色集结动画,顶级院线 CG 动画电影质感,绘画感风格化渲染。先识别参考图中所有角色的数量、外貌、服装、属性、武器与道具,全片保持角色样貌、服装细节、武器类型、道具配置与战斗属性一致,避免认错角色、换装、换武器、比例失调和角色混淆;{标题处理}根据角色特质自动生成符合角色风格的场景。整体为高保真电影级 CG 渲染,质感细腻、高反差布光(特写用侧光或逆光,光分布不均,强化轮廓、眼神、表情和武器材质;中景和全景保持高反差,避免平光和过曝)。动作符合物理逻辑和经典动画原理,夸张但不变形,避免断肢、穿模、滑步、重心丢失、武器错位。全场处于强风中,头发、披风、裙摆、飘带、挂饰持续大幅摆动,尘土、雾、碎屑、旗帜、布片被卷起,形成前景碎屑、中景角色风效、背景雾与旗帜三层空间,风向一致。前 80%(约前 {登场段} 秒)角色依次登场,每人完成一段帅气的个人亮相和一个武器技能后顺滑过渡到下一位,最终汇聚到同一个场景;每个角色至少有特写、中景、全景三种景别和一个强透视镜头,镜头组合随机分配,相邻角色登场方式不同,可从天而降、高空坠落、跳入、俯冲、越障、落地或滑铲;运镜自由多变,快速变焦、跟拍、环绕、旋转、推拉、升降、俯冲、甩镜,关键冲击用慢动作;转场借助动势、武器轨迹、遮挡、烟尘、闪光、甩镜和镜头震动,避免硬切,不要静止摆拍。后 20%(约后 {集结段} 秒)角色按参考图顺序依次做招牌姿势并落到对应站位;最后一秒全员保持站位,呼吸、眼神移动、轻微摆动{标题书写};最终构图完整、层次清晰、站位准确、光线统一、风格一致。{音效与配乐}
```
- 填写规则:
- {总时长} = min(人数 × 4, 15);{登场段} = 总时长 × 80% 取整;{集结段} = 总时长 × 20% 取整。
- {标题处理}:有标题写「视频结尾背景中出现标题文字逐笔书写的效果;」,无标题留空。
- {标题书写}:有标题写「,同时背景中标题『原文』逐笔写出」,无标题留空。标题是外文就保留原文。
- {音效与配乐}:无配乐写「无背景音乐,只保留环境风声、武器挥舞声、撞击声,不要额外字幕和文字。」;有配乐写「配以 ××× 背景音乐,保留环境风声、武器挥舞声、撞击声,不要额外字幕和文字。」,××× 根据角色识别报告用一句话概括风格、主奏乐器和情绪,例如「史诗管弦与电子鼓混合、铜管主导、热血昂扬」。
- 图片提示词:本 skill 默认不出图;只有用户没有群像图、需要先画一张时,才用「多名角色并排站立的全身群像,每人武器清晰、服装区分明显、构图留出标题区域」这样的结构生成。
## 在 TVVV 上执行
- 每张群像图只调用一次 generate_video:默认 Seedance 2.5、720p,画幅按用户选择,时长按公式计算(模型单段上限不足时用 10 秒,并按 10 秒重新分配 80% / 20%)。reference_images 只带用户原图(图1),image_role 选 reference。
- 所有声音(配乐、风声、武器声、撞击声)都在视频里同步生成,不单独调用 generate_music 或 generate_speech。
- 不调用 generate_image(除非用户需要先画群像图)。
- 一次回复最多 2 次工具调用;多张群像图分批,每批回来先给用户看。
- 交付清单:每张图对应的视频、总时长与两段时长划分、是否含标题和配乐;提示用户可以在 TVVV 时间轴里加片头字卡、队伍 logo 或拼接多段群像。
## 注意事项
- **角色认错或漏人**:识别报告不确认就直接生成,后面换装、混脸都救不回来。务必先让用户核对人数和每个人的武器。
- **人多挤成一团**:人数越多每人时间越短,6 人以上建议分两组各生成一条,或者提醒用户登场会非常快。
- **静态摆拍感**:提示词里漏掉风和动势转场,就会变成角色轮流站着摆姿势。强风和「避免硬切」必须保留。
- **标题写错**:模型写字不稳定,外文标题尤其容易错;错了就重生成,或去掉标题、后期在时间轴里加。
- **提示词超长被截断**:超过 2300 字符时,尾部的集结和音效描述会丢失,先删修饰语而不是删结构。