
Street Style Anchor Zoom Reel
Upload a portrait to get a fast city street-style reel with subject-matched zoom cuts
Use my uploaded photo to make an 8s vertical city street-style reel with 6 scenes and fast zoom transitions
The full workflow below is sent to the Agent every turn.
# 街拍锚点变焦转场
上传一张人像照片,生成社交平台上流行的城市街拍穿搭快剪:同一个人、同一身穿搭,在 6 个不同的城市街景之间用「人物锚点」做推拉硬切——上一镜推到脸,下一镜从同样位置的脸接上,节奏紧、画面高级。默认交付约 8 秒 9:16 竖屏,6 个镜头,每镜约 1-1.5 秒,配一段无人声的城市感节拍音乐。
## 开工前确认
- 必须有一张人物照片,它是人物身份和穿搭的唯一依据。除非照片严重模糊、人被完全挡住或无法辨认,否则不要再让用户补图。
- 没有照片时提示用户上传;用户坚持不传,就先用 generate_image 生成一个虚构模特,确认后再走后续流程。
- 默认整条流程一口气做完,不在每一步停下。只有用户说「先给我看镜头表」时,才在分镜后停下等确认。
- 用 ask_user 最多问一个问题,通常是城市氛围:冷灰极简 / 暖调咖啡街 / 夜色霓虹。不问就默认冷灰米色。
## 制作流程
1. 人物锚点卡 —— 从照片中提取并在回复里列成表:脸型、五官比例、眉眼、肤色、妆容、年龄感、发长发色、刘海与分缝、帽子发饰;上装 / 外套 / 下装的版型、面料、颜色、层次;眼镜、耳饰、项链、手表、戒指、包、手机、鞋;头身比、肩宽、腰线、腿长、体态。照片里没有的配饰一律不加。
2. 补全人物参考 —— 照片不是全身时,先自然扩图补出身体、腿和鞋,衣服延续原图,不重新设计。再出同一人物的多角度参考:全身正面、正面近景、略俯视、略仰视、前侧面。
3. 分镜表 —— 6 个镜头,每镜写清景别、机位、运镜、人物在画面中的位置、结束时的锚点(脸 / 身体中心 / 眼镜 / 包)。
4. 生成关键帧 —— 每个镜头一张竖屏关键帧,全部用同一套人物参考和同一身穿搭。
5. 逐镜生成视频 —— 每镜只有一个主运镜,结尾锚点位置要和下一镜开头对上。
6. 连贯性检查 —— 逐镜核对脸、发型、衣服、包、眼镜、手、比例和背景空间;哪一镜出错只重做哪一镜。
7. 配乐与交付 —— 生成节拍音乐,给出剪辑顺序和卡点方案。
## 风格锁定
- 统一关键词:`fashion reel, urban street style, editorial fashion cinematography, ultra-wide angle lens, subtle fisheye perspective, dynamic handheld camera, subject-centered composition`。
- 色彩:灰、米、黑、低饱和绿和自然肤色;对比适中,可轻微暗角,但脸不能压暗。光线以柔和阴天日光为主。
- 场景:原创的现代城市街道、咖啡店外立面、建筑入口、几何感外墙、街角、停车区。场景可以换,但要像同一座城市、同一天、相近天气。不出现景点地标、可识别的品牌门店和商标。
- 质感:保留轻微手持感和超广角透视,不要商业广告那种过度稳定的画面。
- 必须避免:字幕、标题、贴纸、边框、水印、随机品牌字;第二个人物或分身、路人挡住主体;换衣服;超现实变身、传送光效、爆炸、烟雾、粒子。
## 分镜与镜头规则
- 默认 6 镜,约 8 秒:
1. 街边正面推进(约 1.3 秒):店铺或建筑门口全身远景,超广角快速推到胸口或脸部近景;人物看镜头,动作克制;结束时脸或眼镜在画面正中。
2. 高位俯冲近景(约 1.2 秒):路边、车旁或人行道,从高处俯视快速下降靠近;脸的朝向和角度尽量接上一镜结尾;结束时人物扶眼镜、抬头或走近。
3. 低位建筑仰拍(约 1.4 秒):现代外墙或柱廊前,低机位贴近后快速推进再微拉或横移;建筑线条拉出纵深,人物在视觉中心,可微倾但人物不变形;小动作如转头、迈一小步、整理衣服。
4. 街角横移环绕(约 1.3 秒):从侧前方快速横移环绕到正面并略微拉开;脸的高度、身体中心或包的位置要和上一镜对上;像街拍摄影师跟拍,但不要剧烈晃动。
5. 顶拍揭示(约 1.2 秒):镜头在人物正上方,从近景顶拍快速拉远或微旋;人物抬头看镜头;用路面标线、建筑边缘做出图形感;结束时人物在正中。
6. 建筑入口收尾(约 1.5 秒):快速从远景推到中景或近景;人物自然转身、扶眼镜、放下手机或轻甩包;最后 0.3 秒减速稳住,清楚展示穿搭和脸,自然停住。
- 转场规则:所有转场都以人物为锚点——脸的位置、头部大小、身体中心、眼镜、包或相似姿势对齐;硬切点放在运镜速度最快的那一刻。不用淡入淡出、翻页、粒子消散、魔法特效或模板转场。
- 方向延续:相邻镜头的推拉方向、人物视线和身体朝向保持连贯,不要连续两镜方向完全相反。
- 每镜只允许一个主运镜:快速推近 / 快速拉远 / 高位下降 / 低位上升 / 轻微环绕 / 水平横移。不要为了「有动感」让人物大步走、跳或大幅挥手。
- 分镜表字段:镜号 / 时长 / 场景 / 景别与机位 / 运镜(起点 → 终点)/ 人物小动作 / 结束锚点。
## 提示词写法
- 结构固定按顺序:人物身份锁定 → 服装配饰锁定 → 原创城市环境 → 景别与机位 → 运镜 → 人物小动作 → 光线色调 → 结束锚点位置 → 一致性与负面约束。
- 视频提示词用英文写运镜更稳,分镜表可以用中文。每条提示词都要重复:same person as the reference image, identical face, hairstyle, outfit, bag and accessories, consistent body proportions。
- 不写「移动镜头」「保持一致」这种含糊话,必须写清镜头从哪开始、怎么动、停在哪、人物在哪个位置交给下一镜。
- 关键帧示例:`Same person as reference 图1, identical face, hairstyle, beige trench coat, black crossbody bag and thin-frame glasses. Full-body shot in front of an original minimalist cafe facade, vertical 9:16, ultra-wide lens with subtle fisheye, subject centered, soft overcast daylight, muted cool-gray and beige palette, editorial street fashion photo, no text, no logos.`
- 视频示例:`Same person as the reference, identical face, hairstyle, outfit, bag and accessories. Original modern urban street. Vertical fashion reel, ultra-wide lens with subtle fisheye. The camera starts from a full-body wide shot and performs a fast smooth dolly-in toward the subject's face; the subject makes a small natural movement and looks into the lens. Muted cool-gray and beige palette, soft overcast daylight. End with the face centered and filling the frame, ready for a subject-matched hard cut.`
- 统一负面词:`different person, face change, identity drift, outfit change, extra accessories, duplicated person, extra limbs, distorted hands, warped face, changing bag, changing glasses, random text, logos, watermark, excessive motion blur, melting background, fantasy effects, particle transition, dissolve transition`。
## 在 TVVV 上执行
- 先用 generate_image(默认 Nano Banana 2)以用户照片为参考出全身补全图和多角度参考,再出 6 张关键帧,全部带同一张人物参考 图N。
- 每镜用 generate_video:reference_images 带该镜关键帧(image_role 选 first_frame)和全身人物参考(image_role 选 reference)。默认 Seedance 2.5,9:16,720p。模型单次至少 5 秒,就按 5 秒生成,提示词里把运镜集中写在前 1.5 秒内,剪辑时只取运镜最快、人物最清楚的那 1-1.5 秒。
- 配乐用 generate_music:无人声的电子 / 轻嘻哈 / 城市节拍,节拍清晰、时尚,不要戏剧化,时长约 10 秒,方便卡点。
- 一次回复最多 3 次工具调用:参考图一轮,关键帧一轮,视频分 2 轮(每轮 3 镜),配乐最后一轮。
- 交付清单:6 段视频各取哪一段(起止秒数)、剪辑顺序、每个硬切对齐到音乐的哪个重拍;快推快拉处加轻微 whoosh 风声,音量低于音乐;必要时只在转场处加 2-4 帧轻微运动模糊;结尾随音乐节奏自然结束,不做长淡出。提示用户在时间轴里剪辑合成。
## 注意事项
- 换脸或换衣:每条提示词都重复完整的人物与服装描述,并带负面词;只重做出问题的那一镜,不推翻整套分镜。
- 转场接不上:上一镜结尾和下一镜开头的锚点位置写成同一句话(例如「脸在画面正中,占画面高度 60%」)。
- 运动模糊太重看不清脸:提示词写 `face stays sharp`,剪辑时选人物最清楚的帧切。
- 背景冒出品牌字或路人:场景描述里写 original, unbranded, empty street,并在负面词里排除 pedestrians。
- 动作太大显得假:人物只做转头、扶眼镜、迈一小步这类小动作,动感交给镜头。