
手绘贴纸旅行Vlog
手绘贴纸小人叠进真实旅行风景,拼贴风竖屏旅行短片
用我京都的旅行照片,做一支30秒拼贴风旅行Vlog,主角是背双肩包的短发女孩贴纸
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 手绘贴纸旅行Vlog
适合想把一趟旅行做成「手账拼贴感」短视频的需求:一个粗黑描边的扁平卡通贴纸小人,被贴进真实的旅行风景里,跟着行程到站、逛街、吃东西、和当地人互动、告别。画面清新治愈,动作轻柔。最终交付一支 9:16 竖屏、15-60 秒(默认 30 秒)的旅行短片:6 个左右的 5 秒镜头 + 一条轻快治愈的配乐,可选手写风地名字幕。
## 开工前确认
- 可以提供:旅行照片(最推荐,直接当真实背景)、角色参考图或手绘草图、喜欢的拼贴风格参考、目的地和行程亮点。
- 没有照片时,按目的地让 AI 生成写实风景照作为背景;没有角色图时,按用户描述(性别、年龄、发型、穿搭、标志性配饰)设计一个贴纸小人。
- 角色最多 1-2 个,超过 2 个一致性会明显下降,要提醒用户。
- 用 ask_user 一次只问一个,通常先问「目的地和最想记录的 3 个瞬间」;时长不说就默认 30 秒。
- 总时长超过 60 秒时,建议拆成两支(例如「上篇:老城」「下篇:海边」)分别制作再拼接。
## 制作流程
1. **项目设定** —— 表格列出:片名、目的地、时长、画幅 9:16、色调关键词(例如 warm golden hour / cool fresh morning / soft overcast,定了就全片复用)、是否加字幕。
2. **六节点故事线** —— 按下文结构给出每个镜头的地点、动作、时长。停下等用户确认或增删节点。
3. **角色贴纸卡** —— 白底全身正面设定图,再出 3-5 个动作版本(走路、回头、坐着、拿食物、挥手)。停下确认长相、配色、画风,确认后**锁定角色**,后面不再改。
4. **风格锚点图** —— 先只做第 1 镜的拼贴合成图,确认贴纸感、色调、透视比例都对,再批量做其余镜头。
5. **逐镜拼贴图** —— 每镜一张「贴纸角色 + 真实风景」合成图。
6. **逐镜视频 + 配乐** —— 每张合成图作首帧生成 5 秒左右的轻动态;配乐同步生成。
7. **交付** —— 给出镜头顺序、转场、字幕文案与剪辑建议,成片后再问是否微调。
## 风格锁定
- 角色固定词(每次都带):`flat 2D cartoon illustration, thick black outline, sticker style, hand-drawn, bold outlines, consistent character design`。
- 合成固定词:`collage aesthetic, sticker-on-photo, hand-drawn character superimposed on the foreground of a real travel photograph, scrapbook style, travel vlog aesthetic`。
- 一致性词:`same character, same outfit, same hairstyle, consistent color palette, matching lighting`。
- 背景是真实照片质感,人物是平涂卡通,两者的反差就是这个风格的看点——**不要把背景也卡通化,也不要把人物写实化**。
- 色调:第一张确定后全片复用。黄金时刻约 3500K 暖光,清晨约 6500K 清冷光,阴天柔光低反差。
- 构图:角色放在前景下方或侧边,占画面高度 25-40%;背景要有纵深或引导线(街道延伸、栈道、台阶、海岸线),营造空间感。
- 必须避免:贴纸人物比例和场景脱节(巨人或蚂蚁)、透视方向不对、剧烈动作、复杂特效转场。
## 分镜与镜头规则
- 默认六节点结构(按 30 秒计,单镜约 5 秒;时长变化按比例缩放):
| 节点 | 占比 | 画面 | 作用 |
|---|---|---|---|
| 抵达 | 15% | 车站/机场/景区入口,拖着行李或背包,回头或望向站牌 | 开启旅程、期待感 |
| 初探 | 15% | 走在标志性街道或广场,东张西望、举相机拍照 | 第一印象 |
| 美食 | 20% | 小摊或咖啡馆,捧着当地食物,满足的表情 | 感官记忆,重点镜头 |
| 深入 | 15% | 神社参道/海边栈道/小巷台阶,摸墙、看花、远眺 | 沉浸氛围 |
| 人情 | 20% | 和摊主、路人、街头艺人互动,或参加体验活动 | 情感高潮 |
| 告别 | 15% | 回望夕阳剪影或车窗外掠过的风景,挥手或静静看着 | 收尾,呼应抵达 |
- 15 秒版本优先保留美食和人情,砍掉初探;40-60 秒版本在美食、人情各加 1-2 镜。
- 总镜头 4-8 个。运镜只用缓慢的横摇、推近、轻微跟移;角色动作只要轻微走动、头发和衣角飘动;环境动态用光线变化、海浪、树叶摇动。
- 分镜表字段:镜号 / 节点 / 时长 / 场景 / 角色动作 / 构图(角色位置 + 背景引导线)/ 运镜 / 光线色调。
## 提示词写法
- 提示词用英文写,字幕文案用中文。
- **角色图结构**:年龄性别 → 发型发色 → 服装配色 → 配饰 → 固定风格词 → 白底全身 → 姿态(walking pose slight side angle / looking back three-quarter view / sitting casually)。
- **拼贴合成结构**:真实照片场景描述 → 前景叠加的贴纸角色 → 角色外观**完整复述**(一个字都别省、别换说法)→ 粗黑描边 + 拼贴固定词 → 光线色调 → natural perspective, consistent scale。
- 合成示例:
```
Real photograph of a quiet stone-paved old street in Kyoto lined with wooden machiya houses, the street leading toward a distant pagoda, warm golden hour light, soft depth of field. A flat 2D cartoon sticker-style character superimposed on the lower-left foreground: a young woman with a short black bob, oversized mustard yellow cardigan over a white tee, light denim shorts, white sneakers, small red backpack, holding a film camera up to her eye. Thick black outline, white sticker border, collage aesthetic, sticker-on-photo, scrapbook style. Natural perspective, consistent scale, character about one third of the frame height. Vertical 9:16.
```
- **视频结构**:轻柔运镜 → 卡通角色的细微动作 → 环境细节动态 → 光线 → 约束词(subtle, gentle, slow)。
- 视频示例:
```
图1 as the first frame. Gentle slow push-in along the street. The cartoon sticker girl lowers her camera and smiles, her short hair and cardigan hem sway slightly in the breeze, she takes two small steps forward. Warm golden light flickers through the eaves, a few leaves drift across the road. Subtle, gentle, slow natural motion, the sticker character stays flat 2D with thick black outline, the background stays photographic. Soft street ambience, no music, no subtitles.
```
## 在 TVVV 上执行
- 角色贴纸卡用 generate_image,默认 Nano Banana 2,白底全身,同一提示词只换姿态描述出 3-5 个动作版本。
- 拼贴合成图也用 generate_image:reference_images 必带角色卡 图N(reference);用户有旅行照片就把对应照片也带上作背景参考。画面里要出现精确的手写地名、招牌文字时用 GPT Image 2。
- 视频用 generate_video,默认 Seedance 2.5、720p、9:16,每镜 5 秒;reference_images 里合成图设为 first_frame,角色卡设为 reference;提示词里每次完整复述角色外观。
- 配乐用 generate_music:轻快治愈的旅行感纯器乐(原声吉他、尤克里里、钢琴、轻打击乐,约 90-110 BPM),时长等于成片。想要「Vlog 口播」时可用 generate_speech 生成第一人称短旁白。
- 一次回复最多 4-6 次工具调用:先做 1 张锚点图确认,再批量出其余合成图,最后批量出视频。
- 交付清单:每镜视频按六节点顺序排列、配乐、字幕文案(地名 + 一句心情,例如「京都 · 第一口抹茶」)。提示用户在 TVVV 时间轴里拼接:转场只用简单的淡入淡出,切点对齐配乐节拍;视频原声压低或静音,让配乐做主;手写风字幕在剪辑里加。
## 注意事项
- **贴纸和风景比例不对**:人比门还大或小成蚂蚁。提示词加 natural perspective, consistent scale,并写明角色占画面高度的比例,不对就重出合成图。
- **角色每镜都在变**:每张合成图和每段视频都要带同一张角色卡,并完整复述外观,不要只写「the girl」。
- **背景也被画成卡通**:拼贴感来自「真照片 + 平面贴纸」的反差,提示词里背景一定写 real photograph。
- **动作太大**:贴纸小人一跑一跳就会变形、穿帮。只要轻微动作,约束词 subtle, gentle, slow 每条都写。
- **色调前后不一**:第一张确定的光线色调词要原样复用到每一镜。
- **超过 1 分钟**:一次做完质量会下滑,拆成上下篇分开做。