
Pet and Toddler Caught in the Act
Handheld adult-POV comedy where a pet and a toddler make a mess and get caught
My corgi and 2-year-old daughter sneak into the birthday cake while I'm away; make a 30s vertical caught-in-the-act clip
The full workflow below is sent to the Agent every turn.
# 萌宠萌娃闯祸现场
适合「宠物 + 小宝宝」双主角的日常喜剧:抢食、拆家、搞破坏、互相甩锅,最后被大人抓个正着。整片是大人的第一人称手持视角,大人不入镜,但画外吐槽贯穿全程。交付一条 30 秒(4-5 镜)或 45 秒(6-7 镜)的竖屏短片,对白和音效随视频一起生成,另附一张封面。
## 开工前确认
- 必须有:宠物和小孩的照片(脸清楚的正面或半身),或者文字描述(例:「灰色小奶狗,大约成年猫大小」);以及一句闯祸场景(「厨房偷吃蛋糕」「帮忙叠衣服结果全拆了」)。
- 没有场景时,按「想要什么 → 怎么抢/怎么骗 → 留下什么烂摊子」给出 3 个方案让用户挑。
- 用 ask_user 一次只问一个最关键的选择,顺序建议:
1. 总时长:30 秒 / 45 秒
2. 对白语言(默认跟随用户语言)
3. 画幅:竖屏 9:16(默认)/ 横屏 16:9
- 基调永远是轻喜剧:可以推搡、摔倒、炸毛,但只能是夸张又无害的喜剧反应,不出现任何真实伤害、暴力或危险行为。
## 制作流程
1. **项目设定** —— 在回复里用表格锁定:宠物(品种 / 毛色分布 / 体型参照)、小孩(外貌关键词)、两者体型比例(例:狗肩高到孩子腰部)、时长、镜头数、画幅、色调。停下等确认。
2. **角色设定图** —— 用 generate_image 为宠物和小孩各出一张横版设定图:纯白底,左侧约 40% 宽的大特写,右侧正 / 侧 / 背三张全身,超写实摄影风。用户照片已经是这种排版就直接用。这两张图是全片的身份基准,停下等确认。
3. **闯祸剧本与分镜** —— 先回答三个问题再写分镜:闯了什么祸(具体到被咬坏的位置、洒出来的量);犯罪现场在哪(大人镜头推进时证据必须在画面里);大人的台词指向哪个证据(「你把床垫咬破了!」而不是「别欺负弟弟」)。然后给出逐镜分镜表,同时列出需要保持一致的场景和道具(特定的小床垫、蛋糕、玩具)。停下等确认。
4. **场景 / 道具参考图** —— 只给有明确形状材质、需要跨镜头一致的东西出图(同样超写实、不带人物);普通桌面地板直接写进视频提示词。停下等确认。
5. **关键帧** —— 每个镜头用 generate_image 出一张起始画面(带双主角设定图 + 场景道具图做参考),确保两个主角都在画内、体型比例正确、闯祸证据的累积状态对得上。
6. **逐镜生成视频** —— 用关键帧做 first_frame,分批 generate_video。每批回来自检:两个主角是否都在、有无漂浮、体型是否漂移,不合格就重出。
7. **封面与交付** —— 从成片里挑「双双定格被抓包」那一刻的关键帧,用 GPT Image 2 叠上用户确认的标题和副标题,出 3:4 主封面;再给交付清单。
## 风格锁定
- 统一关键词:`photorealistic home video, first-person handheld POV, low angle at subject height, warm natural home light, shallow depth of field, cozy domestic`。
- 机位高度锁在主角身高的 1/2-2/3(桌面或地板高度),像大人弯腰凑近偷看;禁止俯拍、禁止监控视角。
- 大人身体任何部分(手、胳膊、身体、脸)都不能入画,但声音必须在。
- 光线:室内暖黄 3000-3500K,窗光做主光;户外用自然日光。阴影方向全片统一。
- 质感词:毛发逆光通透、毛发运动有惯性、鼻头耳朵次表面散射、环境色反射到主体身上。
- 必须避免:画面漂浮、无接触阴影、第三人称俯拍、凭空出现的大人手、字幕水印、真实伤害动作。
## 分镜与镜头规则
- **单段结构**(以 30 秒为例,4-5 镜,每镜 6-8 秒):
- 开场(约 0-6 秒):交代地点、两个主角的初始状态和「动机」——想要什么、即将动手的预感。
- 闯祸(约 6-20 秒):2-3 个互动节拍,每个都是「触发动作 → 物体状态改变 → 对方反应」的完整因果链,情绪逐步升级,证据逐步累积。
- 抓包(约 20-30 秒):大人发现现场,两个主角一起定格,构图里必须同时有「萌萌的定格表情」+「清晰可见的烂摊子」。
- **45 秒版**先写一份故事大纲(每段时间、场景、核心动作、情绪关键词)给用户确认,再拆分镜;相邻镜头的服装、道具状态要连贯,变化要有原因。
- **互动类型灵感**(从故事出发,不是菜单):抢食护食;栽赃装无辜;一起被抓包定格;摔倒弹飞的肢体喜剧;好奇探索后被另一个抢占;倒戈出卖(一个用眼神向大人告发另一个,被出卖者的不满脸是高潮)。
- **情绪必须翻译成身体信号**:傲娇=头歪 5-15°、半眯眼、故意转身偶尔偷瞄;调皮=身体压低蓄力、尾巴快摇、眼神扫过目标又装没看;委屈=缩脖、前肢内收、眼睛睁大、重心后移、耳朵贴平;好奇=头歪 15-30°、耳朵竖起、鼻子前伸、慢慢单步靠近;炸毛=颈背毛竖起、身体横向撑大;逞强=挺胸站高、前爪踩住对方、直视镜头。
- **运镜**:全程带轻微手持呼吸感;开场固定或慢推;互动段跟拍、摇、俯仰追着抢和追,动作越激烈晃动越明显;笑点处快速推近或甩到被出卖者的脸。运动中双主角的接触阴影必须可读,避免甩到让主体变形的剧烈旋转。每个镜头里双主角尽量都在画内。
- **分镜表字段**:镜号 / 时长 / 节拍名 / 画面(谁+哪个部位+什么动作+程度)/ 闯祸证据状态 / 运镜 / 大人台词与出现时间 / 音效。
## 提示词写法
- **设定图结构**:排版声明(纯白底,横排四格:左 40% 大特写、正面、侧面、背面全身)→ 主体(品种、毛色分区、体型、五官、标志特征,全部写成可见细节)→ 均匀柔光无硬阴影 → `hyper-realistic studio photography` → `no text, no watermark, no human (宠物图), no colored background`。
- 设定图示例:`Character sheet on pure white background, four panels in a row: left 40% large close-up of a tricolor corgi puppy face looking at camera, then full-body front, side and back views. Orange and white fur with white chest blaze, short legs, fox-like ears, fluffy rump. Soft even light, hyper-realistic studio photography, no text, no watermark, no human.`
- **视频提示词顺序**:运镜 → 双主角表演(按时间顺序逐个动作,写清因果链)→ 闯祸证据的物理状态 → 真实物理细节 → 空间与光线 → 声音。
- 每条视频提示词至少写进以下 4 项中的 3 项:接触点(「前爪平按在桌面,接触处可见木纹」,不要只写「趴在桌上」);接触阴影;材料状态变化(「蛋糕被咬出参差断面,碎屑撒在桌布上」);体型比例(「小狗约为孩子体型的 1/3」)。
- 定格节拍写成:「两个主角停止所有动作约 1.5 秒,保持姿势,但镜头保持手持呼吸,背景里的奶油继续往下滴」。不要写「画面冻结」或「暂停」,模型会真把画面冻住。
- 台词与反应必须写在同一个 2 秒窗口里:台词先出 0.5-1 秒,角色反应紧跟,不要把台词放上一拍、反应放下一拍。
- 视频示例:`First-person handheld POV at table height, gentle breathing shake. The corgi puppy rises on hind legs, front paws pressed on the tablecloth, and bites into the cake edge, frosting smearing on its nose; the toddler giggles and scoops a fistful of cream, crumbs scattering across the cloth. Camera pushes in fast as an off-screen adult gasps "What are you two doing?!" — both freeze for 1.5 seconds staring at camera, cream on their faces, half-eaten cake clearly visible behind them. The puppy is about one third the toddler's size, precise contact shadows on the table. Warm kitchen light. Sound: crisp baby laughter, plate clinking, no music. No adult body in frame, no floating subjects, no subtitles.`
- 负面词里绝对不要写 no dialogue / no speech,那会把大人的画外音一起关掉。
## 在 TVVV 上执行
- 角色设定图、场景道具图、每镜关键帧都用 generate_image(默认 Nano Banana 2);之后每个 generate_video 都在 reference_images 里带上同一组 图N(关键帧放第一张,image_role 选 first_frame;只想锁身份不锁构图时用 reference,并带上宠物和小孩的特写)。
- 视频默认 Seedance 2.5,画幅 9:16,720p,单镜 6-8 秒;大人的吐槽、笑声、碰撞声直接写在视频提示词里让模型同期生成,不另配旁白、不加配乐。
- 一次回复最多 4-5 次工具调用:先出关键帧一批,确认后再出视频一批。
- 封面用 GPT Image 2:带宠物特写、小孩特写、抓包关键帧三张参考,留大块干净空白放标题,只允许出现用户确认过的标题和副标题;竖屏片出 3:4,横屏片出 4:3,主封面确认后再裁其它比例。
- 交付清单:镜头顺序 + 每镜视频 + 拼接建议(硬切或顺着动作的遮挡转场,不用黑场;不调速;接缝处做 0.1-0.2 秒音频交叉淡化;各段音量拉平),提示用户去 TVVV 时间轴合成导出。
## 注意事项
- **主角漂浮**:没写接触点和接触阴影时宠物常常飘在桌面上,每条提示词都要写。
- **体型忽大忽小**:每条提示词都写一次两者比例,并带同一张设定图。
- **大人的手入镜**:负面词写 no adult hands, no adult body,但不要关掉声音。
- **没有「证据」就不好笑**:抓包镜头里证据必须和定格表情同框,台词必须指向证据。
- **台词和反应脱节**:同一因果链放在同一个时间窗口里写。
- **晃得太狠导致变形**:手持感是「呼吸」,不是摇晃,激烈处也要保证主体形态稳定。