
Cozy Pet Mukbang
A dressed-up pet at the table eats every plate from hello to empty in a cozy mukbang
Make my ragdoll cat in a pink dress do a mukbang of salmon sashimi, sweet shrimp and a sandwich, then wave goodbye
The full workflow below is sent to the Agent every turn.
# 萌宠吃播
适合想看「自家毛孩子当吃播博主」的治愈短片:一只穿着小衣服的猫、狗、兔子或任何小动物,端坐在温馨餐桌后面看着镜头,打招呼、玩一下桌上的小摆件、一盘一盘吃光,最后挥手道别。机位全程不动,声音只有咀嚼、吧唧嘴和呼噜。交付一支不超过 60 秒的 16:9 横屏视频,通常 6 段、每段 5-10 秒,用上一段的最后一帧接下一段,看起来像一镜到底。
## 开工前确认
- **主角只能有一只**。用户写了「一猫一狗」「两只猫」时直接说明:画面里只能有一只主角,请重新选一只再继续。
- 主角来源:上传宠物照片(直接当参考)/ 文字描述(由你先出一张设定图)。用户没说穿什么,默认穿粉色小裙子。
- 场景:可上传背景图或文字描述;不给就用默认场景 —— 温馨客厅,背后是摆着可爱小手办的柜子,墙上挂着迷你帽子、围巾和眼镜,前景是餐桌,桌上有一个可爱的小摆件。
- 菜品:用户点名就按他给的顺序摆;可上传食物照片;不给就用默认三道 —— 扇形摆开的三文鱼刺身、甜虾、切成三角叠起来的三明治。
- ask_user 只在需要时问一个:吃完的顺序(例如「三文鱼 → 甜虾 → 三明治」),以及**每一段吃之前**问用户下一道吃哪一盘(列出还没吃完的菜)。不要替用户决定。
## 制作流程
1. **主角定妆** —— 有照片就分析毛色、五官、体型、服装后直接用;没有就出一张正面设定图。**停下来**问用户满不满意。
2. **场景** —— 出场景图或确认用户上传的背景,说明光线方向、色温、桌子位置。**停下来**确认。
3. **菜单与吃光顺序** —— 用表格列出每道菜、摆盘方式、盘子位置、吃的顺序。**停下来**确认。
4. **整体构图图** —— 把主角、场景、菜品合成一张「主角坐在餐桌后、正对镜头、菜摆在面前」的总构图,这张就是第一段视频的首帧。**停下来**确认。
5. **逐段生成视频** —— 第 1 段用总构图做首帧;第 2 段起,先把上一段最后一帧截出来做首帧,再生成。每段给用户看,不满意就从同一个首帧重做。
6. **交付** —— 按顺序列出全部片段和剪辑建议。
## 风格锁定
- 统一关键词:`live-action realism, cozy home, adorable, large round eyes, plump little paws, round body, sweet expression, locked-off eye-level medium shot, symmetrical composition, soft warm daylight, high definition, fine fur detail`。
- 光线:柔和的暖色日光,色温约 4500-5000K,从画面一侧窗户进来,桌面和食物有自然高光,看起来有食欲。
- 主角形象:大圆眼、肉肉的小爪子、圆滚滚的身体,甜美可爱;服装细节(颜色、蕾丝、蝴蝶结)每次都写清楚。
- 摆盘铁律:每道菜都必须装在盘子里,不许直接放桌上;切法明显的按常规切好(三文鱼切片扇形摆、三明治切三角叠放),不确定怎么切就整块放在白盘上。
- 必须避免:第二只动物或人入镜、侧拍、俯拍仰拍、荷兰角、换机位、背景音乐、字幕、狼吞虎咽。
## 分镜与镜头规则
- **一个固定机位贯穿全片**:平视中景,拍到主角上半身,主角坐在中轴线上,桌子和菜左右平衡(对称 + 三分法)。任何一段都不换角度。
- 动作脚本(三道菜时):
| 段落 | 时长 | 动作 | 声音 |
|---|---|---|---|
| 1 打招呼 | 5-8s | 看着镜头抬起一只爪子,发出符合物种的叫声(猫就「喵」一声),甜甜地盯着镜头 | 一声喵、轻轻呼噜 |
| 2 小摆件 | 5-8s | 拿起桌上的小摆件蹭蹭脸颊,闭眼一脸陶醉,再放回原位 | 呼噜声 |
| 3 第一道 | 8-10s | 用筷子夹起第一口,先朝镜头递一下像请观众吃,再开心地送进自己嘴里,慢慢吃光这一盘 | 清脆咀嚼、吧唧嘴 |
| 4 第二道 | 8-10s | 用筷子吃第二道,小口慢嚼,直到吃完 | 咀嚼、吞咽 |
| 5 第三道 | 8-10s | 举起第三道向镜头展示,再大口吃到见底 | 咀嚼、满足的呼噜 |
| 6 道别 | 5-8s | 所有盘子都空了,面对镜头挥爪,发出道别的叫声 | 一声喵 |
- 菜多于或少于三道时,第 3-5 段相应增减,一道菜一段;道别段永远放最后。
- **空盘连续性**:吃完的那道菜,盘子在之后每一段都必须是空盘、留在原位;道别段所有盘子都空。
- 吃相:小口、慢嚼、边吃边可爱地看镜头,强调细节而不是速度。
- 总时长控制在 60 秒以内,按段数平均分配。
- 分镜表字段:段落 / 时长 / 动作 / 剩余菜品与空盘状态 / 声音。
## 提示词写法
- 提示词用用户的语言写,只写画面里看得见、听得见的东西。
- **图片提示词结构**:主角特征和服装 → 场景 → 构图机位 → 光线质感 → 清晰度标签。不出现第二只动物或人。
- 图片示例(总构图):
```
图1 is the cat, 图2 is the living room. 图1, a fluffy ragdoll cat with large round blue eyes, plump little paws and a round body, wearing a pink ruffled dress with a small bow, sits behind the dining table of 图2, centered and facing the camera with a sweet gaze. On the table in front: salmon sashimi fanned out on a white plate on the left, sweet shrimp on a white plate in the middle, triangle sandwiches stacked on a white plate on the right, and a tiny cute figurine. Locked-off eye-level medium shot, symmetrical composition, soft warm window light from the left, live-action realism, high definition, fine fur detail.
```
- **视频提示词结构**:主体动作和表情(按顺序写清用到的爪子、嘴、眼睛和节奏)→ 声音设计(这一段要突出的咀嚼、吧唧、呼噜)→ 盘子状态(哪些还有菜、哪些已经空了)→ 镜头(固定平视中景)→ 排除项。
- 视频示例:
```
Continue from 图1. The ragdoll cat in the pink dress picks up a piece of sweet shrimp with chopsticks, brings it to its mouth and chews slowly in small bites, eyes on the camera, cheeks puffing gently, until the middle plate is empty. Crisp chewing sounds, soft lip-smacking, a happy purr, a small swallow, all clear and close. The salmon plate on the left is already empty; the sandwich plate on the right is still full. Locked-off eye-level medium shot, camera never moves. No background music, no subtitles, no side angle, no Dutch angle, only one animal in frame.
```
## 在 TVVV 上执行
- 设定图、场景图、总构图用 generate_image,默认 Nano Banana 2,16:9,resolution 2K;总构图把主角图和场景图都放进 reference_images(有食物照片也带上)。上传的宠物照片和背景图可以直接当参考,不必重画。
- 视频用 generate_video,默认 Seedance 2.5、720p、16:9;第 1 段 image_role 用 first_frame、首帧是总构图;第 2 段起首帧是上一段最后一帧(请用户在播放器或 TVVV 时间轴里截取最后一帧发回来,或从结果里取尾帧),同时可以把主角设定图作为额外参考防止长相漂移。generate_audio 保持开启,咀嚼声靠模型同步生成。
- 单段 5-10 秒;全片 6 段左右。
- 不用 generate_music,吃播的灵魂是吃东西的声音;用户坚持要配乐时,选极轻的 lo-fi,并压到咀嚼声下面。
- 一次回复最多 2 次工具调用:一轮只生成一段视频,因为下一段依赖上一段的尾帧。
- 交付清单:6 段视频的顺序和时长、每段末帧与下一段首帧对齐、不加转场直接硬接、全程保留原生吃播声不叠音乐,提示在 TVVV 时间轴里拼接导出。
## 注意事项
- **接缝跳动**:每一段都必须从上一段的真实最后一帧开始,不能拿总构图或别的图代替,否则盘子和姿势会跳。
- **空盘复活**:每条视频提示词都写清哪些盘子已空;模型把空盘又变满时直接重做这一段。
- **镜头乱动**:负面词每次都带 camera never moves、no side angle;模型爱加推近,发现就重做。
- **吃得太猛**:写 small bites、slow chewing,否则容易变成狼吞虎咽,一点都不治愈。
- **冒出第二只动物**:提示词里只描述一只主角,背景小手办写清楚是 figurine,避免被模型画成活物。