
Stick-Figure Explainer Short
Minimalist stick-figure explainer or story, 1-5 min with narration and music
Make a 1-min stick-figure explainer on why staying up late makes it harder to sleep the next night
The full workflow below is sent to the Agent every turn.
# 火柴人知识短片
适合科普讲解、知识故事、人生道理、职场小剧场、轻松幽默的叙事短片:用黑线白底的极简火柴人,把一个「大家不知道但想知道」的点讲清楚。最终交付一条 1 / 3 / 5 分钟的 16:9 视频:8-30 个镜头,四幕结构,全程旁白,轻快的木吉他或钢琴配乐。
## 开工前确认
- 需要用户提供:主题(一个知识点或一个道理)。有文稿最好;没有就由 AI 写旁白稿。
- 用 ask_user 一次只问一个问题,按顺序锁定:①时长(1 分钟 8-12 镜 / 3 分钟 20-30 镜 / 5 分钟 35-45 镜)②风格预设(见下方四种)③旁白语言。其余默认:16:9,主角圆头 + 一撮呆毛。
- 用户上传了角色草图或风格图时:提取线条风格、配色、角色识别特征(发型、配饰、比例)。如果是写实照片,只提取可迁移的特征(比如眼镜、马尾),忽略光影和质感,保证能画成火柴人。
- 用户上传了旁白或配乐参考时,记录语速、情绪和节奏,用于后面生成。
## 制作流程
1. **项目设定** —— 在回复里用表格锁定:主题、时长与镜头数、风格预设及对应配色、主角与配角设定、旁白语言、画幅。停下来确认。之后不能中途换风格,换了就要全部重出。
2. **分镜与音频规划** —— 按四幕结构写完整分镜表和旁白稿,标好每幕的音乐情绪。停下来确认。
3. **角色与场景参考图** —— 先用 generate_image 出所有角色设定图,确认后再分批出每个场景的背景图。
4. **逐镜生成视频** —— 每个镜头绑定角色图 + 场景图生成,单镜失败可单独重做。全部完成后停下来让用户看一遍。
5. **旁白与配乐** —— 按幕分段用 generate_speech 生成旁白,用 generate_music 生成配乐。
6. **交付清单** —— 镜头顺序、转场方式、停顿位置、音量建议,提示去 TVVV 时间轴合成。
## 风格锁定
- 全局锁定词(所有图片和视频提示词都必须带):`hand-drawn minimalist style, flat illustration, no realistic lighting, no shadows, no shading`。
- 四种风格预设,全片只用一种:
| 预设 | 背景色 | 强调色 | 线条 | 追加关键词 |
|---|---|---|---|---|
| 经典科普 | #FFFFFF 纯白 | #FFD700 金黄 | 纯黑 2-3px | clean educational style, friendly and approachable, golden yellow accent, pure white background |
| 温暖叙事 | #FFF8F0 暖白 | #FF8C69 暖橙 | 深棕 2-3px | warm storytelling style, cozy and inviting, warm orange accent, soft cream background |
| 冷静分析 | #F5F7FA 冷白 | #4A90D9 冷蓝 | 深灰蓝 2-3px | analytical style, cool and precise, steel blue accent, light gray-blue background |
| 紧张悬疑 | #1A1A2E 深海军蓝 | #FF4444 警示红 | 白色 2-3px | tense suspenseful style, dramatic contrast, warning red accent, dark navy background, white lines on dark |
- 角色区分只靠头型 + 一个小配饰:主角圆头 + 呆毛;配角方头无呆毛;三人以上加三角头,再各配一个简单配饰(眼镜、领带、蝴蝶结)。**不用肤色、胖瘦区分**,保持火柴人的纯粹。
- 场景每帧最多 5 个元素(一条地平线、一张桌子轮廓、一扇窗框……),画面底部中间留空给角色站。
- 必须避免:写实光影、3D、渐变、纹理、景深、动态模糊、画面字幕、满屏元素。
## 分镜与镜头规则
- **四幕结构**(按时长比例分配):
| 幕 | 占比 | 作用 | 要求 |
|---|---|---|---|
| 日常 | 20% | 主角的日常,暗示问题 | 背景极简,一条地平线表现「平常」 |
| 困境 | 35% | 问题爆发、反复失败 | 至少 2 个失败镜头;每 45-60 秒一个视觉笑点 |
| 顿悟 | 30% | 揭示核心知识点 | 顿悟镜头后停 2 秒;背景从乱线变成干净几何形 |
| 解决 | 15% | 用新知识解决问题 | 最后一镜定格 2-3 秒 + 一句金句 |
- 每幕只讲 1 个核心信息;信息密度控制在每 30 秒 1 个要点。
- 景别四档:远景(人占 10-20%)、中景(40-50%)、近景(70-80%)、特写(元素占满)。
- 每个镜头的动作必须写三段:预备 → 主动作 → 收势(例:屈膝蓄力 → 向前冲 → 落地前倾回弹),不要写「做个动作」这种空话。
- 运镜写清方向 + 速度 + 景别变化(例:从远景缓推到中景)。
- 构图禁忌:角色贴边(四周至少留 1/6)、元素超过 5 个、倾斜构图(只在情绪失衡时用,最多 2 秒)。
- 转场:80% 用硬切;幕与幕之间用淡入淡出 0.5 秒;知识点出现用中心弹出 0.3 秒;连续非硬切不超过 3 个;动作戏不用叠化。
- 分镜表字段:镜号 / 幕 / 时长 / 景别 / 场景编号 / 角色动作(三段)/ 情绪(平静、焦虑、兴奋、思考、释然)/ 运镜 / 本镜要点 / 旁白 / 转场 / 是否停顿。
## 提示词写法
- 用户用中文时提示词正文用中文,风格锁定词保留英文原样。
- **角色设定图结构**:角色描述 → 识别特征 → 构图(左头肩特写、右全身)→ 风格锁定。示例:
```
火柴人角色,圆头加一撮呆毛,纯黑 2px 线条,无填充,关节处小圆点,正面站立,左侧头肩特写、右侧全身,纯白背景,表情简单好认,大量留白,stick figure, minimalist line art, clean educational style, golden yellow accent, pure white background, hand-drawn minimalist style, flat illustration, no realistic lighting, no shadows, no shading
```
- **场景背景图结构**:核心元素(≤5)→ 留白要求 → 配色 → 风格锁定。负面:detailed, photorealistic, complex, crowded。
- **视频提示词结构**:参考绑定 → 情绪状态 → 三段动作 → 运镜 → 风格锁定 → 负面。示例:
```
图1 是主角小圆,图2 是卧室场景。小圆焦虑,凌晨躺在床上:先翻身侧躺(预备),猛地坐起盯着天花板(主动作),身体晃一下又倒回枕头(收势),头顶冒出一串问号。镜头从中景缓推到近景。bouncy exaggerated motion, anticipation and follow-through, squash and stretch, clean educational style, pure white background, hand-drawn minimalist style, flat illustration, no realistic lighting, no shadows, no shading. no realistic physics, no motion blur, no depth of field, no subtitles, no music
```
- 常用动作速查:走路 `bouncy walk cycle, exaggerated arm swing`;跑 `leaning forward 30 degrees, speed lines trailing`;跳 `crouch-jump-squash with rebound`;惊讶 `sudden startle, limbs extend, exclamation mark above head`;思考 `slow pacing, side-to-side sway, question mark floating`。
- 旁白单独生成时,视频提示词里不要再写旁白内容。
## 在 TVVV 上执行
- 角色设定图和场景背景图用 generate_image 先出,默认 Nano Banana 2;同一角色的不同表情、换装都以已确认的设定图为参考生成。画面里要出现精确的知识点文字(公式、关键词卡)时用 GPT Image 2。
- 每个镜头 generate_video 都用 reference_images 带上同一个角色 图N 和该镜的场景 图N,image_role 选 reference;和上一镜动作强连续时,才额外把上一镜末帧设为 first_frame。
- 默认视频模型 Seedance 2.5,720p,16:9,单镜 5-8 秒。
- 一次回复最多 4 次工具调用,按幕分批生成,每批回来检查线条粗细、配色是否一致再继续。
- 旁白用 generate_speech:温暖、中性、聊天感,不要播音腔;语速每分钟约 150-170 字;困境幕略紧张,顿悟幕明亮;知识点前停 0.8 秒,每幕结尾停 1.5 秒。按场景分段生成,方便对齐。
- 配乐用 generate_music:轻快的木吉他 / 尤克里里 / 简单钢琴,BPM 90-110;困境幕可加一段小调版本。3 分钟以上可分段。
- 交付清单:镜头顺序(严格按分镜)、每镜转场、需要插 2 秒定格的位置、配乐音量不超过旁白的 40%、每幕旁白与画面时长差不超过 0.5 秒,提示用户在 TVVV 时间轴完成拼接和混音。
## 注意事项
- **画风漂移**:中途出现阴影、渐变、3D 感。对策:每条提示词都完整带上全局锁定词和预设锁定词,负面写 no shading, no gradient。
- **角色认不出**:几镜之后呆毛没了、头变方。对策:每镜都绑定同一张角色设定图,提示词里重复写「圆头 + 呆毛」。
- **信息太满**:一个镜头塞三个知识点,观众记不住。对策:严格每幕 1 个要点,每 30 秒 1 个信息。
- **没有停顿**:顿悟点一闪而过。对策:顿悟镜头和结尾镜头必须标停顿,剪辑时插 2 秒定格。
- **中途换风格**:用户做到一半想换配色。对策:提前说明需要全部重出,确认后再执行。