
一张照片当城市飞侠
上传一张照片选座城市,主演28秒真人版都市飞索英雄短片
用我这张照片,在上海外滩和陆家嘴之间荡绳飞跃,做一段都市英雄短片
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 一张照片当城市飞侠
适合想要一段「我穿着自己的衣服,在真实城市里飞檐走壁」的爆款短片:用户上传一张个人照片,选一座城市,他就从卧室窗台翻身跃出,手腕射出飞索,在地标街道和天际线之间荡绳、跑墙、踩出租车顶,夕阳下坐在钢梁上啃三明治,夜里倒挂在霓虹小巷逗猫,最后荡回家倒在沙发上。全程真人写实,衣服不换成任何英雄制服。默认交付一段 28 秒、16:9、一镜到底的跟拍短片,带对白、环境声和动作音效,不配背景音乐。
## 开工前确认
- **第一步只等照片**:一张清晰的个人照(最好能看到全身或大半身穿搭)。没有照片不往下走。
- **第二步选城市**:给几个常见选项(上海、北京、重庆、香港、东京、纽约、伦敦、巴黎),也允许用户自己输入。选定后在设定里记下这座城市的地标、标志性街道、天际线和代表性交通工具(例如纽约的黄色出租车、褐石公寓和消防梯;重庆的轻轨穿楼和山城梯道)。
- **自动判断模式**:用户只给了照片和城市 → 用下文固定的 28 秒十段模板;用户给了故事或动作点子 → ≤30 秒仍是一镜,超过 30 秒按叙事节拍拆成尽量少的几段,每段不短于 8 秒,绝不拆成三五秒的碎片。
- 不使用任何现有超级英雄的名字、标志、制服配色或台词,人物就是穿便装、会射飞索的普通人。
## 制作流程
1. **照片分析** —— 提炼脸型、五官比例、肤色、发型发色、身材比例、上衣、裤子、鞋、材质、配饰,以及正侧背一致所需的细节(发型是否对称、衣服背面图案、侧面配饰)。
2. **城市确认** —— 回复里给出城市设定小表:地标 2-3 个、标志街道、天际线特征、代表交通工具、光线时段。**停下等用户点确认或修改**。
3. **人物三视图** —— 以用户照片为参考,生成纯白背景的正 / 侧 / 背全身三视图,真人摄影质感,衣服裤子和照片完全一致。之后所有镜头都用这张三视图代替原照片。**停下确认像不像本人**。
4. **设定与分镜** —— 锁定 16:9、720p、城市、时长模式;无故事模式直接列出十段时间轴。**停下确认**。
5. **生成视频** —— 按分镜生成。
6. **交付** —— 单镜直接交付;多段按顺序拼接,保留原生音轨。
## 风格锁定
- 统一画风关键词:`photoreal live-action photography, cinematic lighting, urban superhero blockbuster aesthetic, high-contrast dynamic camera angles, native one-take drone-follow, warm golden hour`。
- 人物始终是真人:真实皮肤纹理和五官比例,**不是** 2D 动漫、3D 渲染、插画、卡通或赛璐璐。
- 服装:和照片一模一样的日常穿搭,飞索从手腕射出,但永远不换装。
- 光线走向:午后暖光 → 黄金时刻天际线 → 夕阳 → 夜间霓虹 → 室内暖灯,跟着时间推进。
- **环境规则**:汽车和出租车只出现在马路上,绝不出现在屋顶、阳台、露台、墙面和天际线镜头里;屋顶镜头只有屋面、空调外机、水箱、天线和远处塔楼;踩车顶的动作只发生在街面。
- 必须避免:英雄制服、面罩、标志性配色、肢体扭曲、飞索断成碎段或悬空漂浮。
## 分镜与镜头规则
- **无故事模式:固定 28 秒一镜到底,十段不能删、不能合并、不能换顺序、不能改时长**——少写一段,模型就会把整条视频都填成同一个荡绳动作。
| 时间 | 段落 | 画面与动作 | 声音 |
|---|---|---|---|
| 0-4s | 卧室开场 | 卧室里有床、书架、海报、散落的衣服,阳光柔和,大窗外是城市天际线;人坐在窗台上说「Let's Go?」,戴上耳机,笑着向后翻出窗外,镜头跟出 | 对白 |
| 4-5s | 飞索特写 | 下坠中手部大特写,五指张开,手腕射出一条连续飞索连到上方楼体,镜头快速拉远露出脚下城市 | 飞索弹射声 |
| 5-8s | 低空荡绳 | 暖午后,无人机大远景追拍,人在标志街道上空约 3 米荡过,经过公寓、消防梯、店铺、阳台;脚尖点过路边停着的车顶后物理回弹;镜头倾斜约 40° | 风声、街声 |
| 8-11s | 跑墙 | 荡到高点松索,空中舒展,侧身落在楼墙上竖直跑 5-6 步,蹬墙,射索到对面楼体,横越大马路,镜头随力道翻滚 | 脚步、风声 |
| 11-14s | 过马路 | 贴地掠过出租车、公交、斑马线、湿路面反光;落地跑过斑马线,被出租车按喇叭时笑一下,踏上出租车顶起跳射索,喊「Woohoo!」 | 喇叭、对白 |
| 14-15s | 天际线高点 | 屋顶高度大远景,人到达荡绳最高点,背后是黄金时刻天际线、地标塔楼、水箱、夕阳薄雾 | 风声 |
| 15-18s | 楼宇峡谷 | 在高楼峡谷间滑翔荡绳,落上屋顶,掠过一座屋顶泳池上空 | 飞索声 |
| 18-23s | 夕阳三明治 | 平静大远景,人随意坐在高空钢梁上俯瞰天际线,开心地啃三明治 | 城市远声 |
| 23-25s | 霓虹小巷 | 夜间霓虹小巷,人倒挂在飞索上,对窗台上的一只黑猫温柔地笑 | 猫叫、霓虹嗡鸣 |
| 25-28s | 回家 | 荡回阳台翻身进屋,开心地倒在沙发上大笑,拿起手机打电话 | 室内声 |
- **故事模式**:按用户故事写,镜头内有多个场景节拍时加时间标记(0-4s、4-9s),单一连续事件就不用标记。多段之间只有动作强连续时才用上一段末帧接续。
- 每一个飞索动作都要写清:飞索从人伸出的手腕射向上方或侧上方的楼体锚点,是一条从手到锚点完整不断的弧线。
- 分镜表字段:时间 / 段落 / 场景与地标 / 动作 / 运镜 / 对白与音效。
## 提示词写法
- **图片提示词结构(三视图)**:参考声明 → 布局(纯白底、正侧背横排)→ 保持项(脸、肤色、发型、身材、上衣、裤子、鞋、配饰)→ 真人摄影声明 → 负面。
- 图片示例:
```
Use 图1 as the identity reference. A pure white background character turnaround of the same person, three full-body views arranged horizontally: front, side, back. Keep the exact same face, skin tone, hairstyle, body type, the same oversized grey hoodie, black cargo pants, white sneakers and silver necklace from the photo. Photoreal live-action studio photography, even soft light, no scene, no props, no shadows on the floor. Not 2D anime, not 3D render, not illustration, not cartoon. 16:9.
```
- **视频提示词结构**:人物锁定 → 镜头类型(原生一镜到底无人机跟拍、无剪辑无时间跳跃)→ 城市环境(替换成所选城市的真实地标与街道)→ 十段带时间标记的动作 → 风格标签 → 固定负面。提示词总长控制在约 2300 字符内,压缩时优先保留人物锁定、十段时间标记、环境规则。
- 视频示例(节选):
```
图1 is a pure white background three-view reference of the character, the absolute identity and outfit reference: keep the same face, proportions, grey hoodie and black cargo pants, never change the outfit, real skin texture. Native one-take cinematic drone-follow action video in Shanghai, no edits, no time jumps. 0-4s: in a sunny bedroom with posters and an open window showing the Lujiazui skyline, the person sits on the windowsill, says "Let's Go?", puts on earphones, smiles and flips backward out of the window, camera follows. 4-5s: extreme close-up of the hand, fingers spread, a continuous silk line shoots from the wrist to an upper building anchor as one unbroken arc, camera pulls back to reveal the city. 5-8s: warm afternoon, wide drone chase above a tree-lined old street with lane houses and balconies, swinging about 3 meters above the road, feet tap a parked car roof and rebound … 25-28s: swings back to the balcony, flips inside and collapses on the sofa laughing, makes a phone call. Cars only on roads, no vehicles on rooftops. Photoreal live-action, cinematic lighting, urban blockbuster aesthetic. Normal body proportions, natural continuous motion, no fused or broken limbs, no broken or floating web strands, not anime, not 3D render, no music, no subtitles.
```
## 在 TVVV 上执行
- 三视图用 generate_image,默认 Nano Banana 2,比例 16:9,reference_images 放用户照片(图1)。原照片只用于这一步。
- 视频用 generate_video,默认 Seedance 2.5、720p、16:9;reference_images 带三视图,image_role 用 reference。若单段上限不足 28 秒,拆成 3 段(约 0-11s、11-18s、18-28s),每段都带三视图,后一段用前一段末帧作为 first_frame,时间标记改成段内相对时间,十段内容一段不少。
- 不用 generate_music,也不用 generate_speech:对白、环境声和动作声都由视频模型同步生成。
- 一次回复最多 3 次工具调用:三视图一轮,视频每轮 1-2 段,回来检查衔接再继续。
- 交付清单:28 秒成片(或按顺序的分段视频)、城市设定表、十段时间轴;多段时提示用户在 TVVV 时间轴里按顺序拼接、保留原生音轨,不加背景音乐,可以裁一个 15 秒竖版高光。
## 注意事项
- **衣服变成制服**:模型看到「飞索 + 城市」很容易套上英雄紧身衣。三视图阶段先锁死便装,视频提示词里反复写 never change the outfit。
- **整片只有荡绳**:十段少写任何一段都会让模型偷懒。每段都要有时间标记和具体动作。
- **车上屋顶**:天际线镜头里出现汽车会很假。环境规则写进每条提示词。
- **飞索断裂漂浮**:每次射索都写「从手腕到锚点完整不断的一条弧线」。
- **不像本人**:三视图阶段就确认相似度,不像时让用户换一张更清晰、正面、光线均匀的照片。