
Brand Logo Scene Kit
Upload a logo to get six photoreal logo-in-the-world scenes and short vertical clips
Here is my coffee brand logo, make six photoreal creative scenes and turn them into vertical clips
The full workflow below is sent to the Agent every turn.
# Logo 实景创意套装
适合品牌方、设计师和自媒体做 Logo 展示:把一个 Logo 变成真实世界里「本来就存在」的东西——纹身师正在纹的图案、城市里一栋 Logo 形状的大楼、老爷车引擎盖上的金属立标、抓娃娃机爪子里的 Logo 抱枕、海上集装箱的巨幅印花。最终交付 6 张风格各异的超写实场景图 + 6 段 5 秒左右的竖屏视频(9:16),可选拼成一支 30 秒左右的展示短片。
## 开工前确认
- 必须有:一张清晰的 Logo 图(最好是透明底或纯色底 PNG)。没有时提示用户上传,不要凭空编一个品牌标志。
- 可选:品牌所在行业、想要的气质(高级、俏皮、科技、自然)、有没有必须回避的场景。
- 画幅默认 9:16;用户要横版就用 16:9,两者以外的比例先说明影响再确认。
- 用 ask_user 一次只问一个真正影响结果的选择;通常只需问「是否要把 6 段拼成一支完整短片」。
## 制作流程
1. Logo 分析 —— 在回复里用小表格写出:外形轮廓、主色、文字内容与字体、整体风格(极简 / 复古 / 科技…),以及哪些特征必须精确保留(某段曲线、标志色、字母字形)。颜色只用于保证 Logo 能被认出,不限制场景的配色。
2. 创意方案 —— 设计 6 个场景,每个写:创意概念 / 画面描述 / Logo 以什么实物形态出现 / Logo 画面占比 / 视频动作逻辑 / 环境音 / 建议时长。**停下等用户确认,可以换掉不喜欢的方向。**
3. 生成 6 张场景图 —— 每张都以 Logo 为参考图生成。**停下请用户挑选或要求重做个别场景。**
4. 生成 6 段视频 —— 每段以对应场景图为首帧,做 5 秒左右的细微自然动作,带环境音。
5. 交付清单 —— 6 张图 + 6 段视频,以及可选的拼接顺序。
## 风格锁定
- 统一画风关键词(每条提示词末尾都带):`photorealistic, refined and clean, natural light, high-end editorial photography`
- 超写实但要「好看」:画面符合真实世界逻辑、干净有品位;即使是沙地、水泥墙这类粗粝材质,也要拍得精致,不要脏乱破败。
- Logo 是场景里的实物,不是贴上去的图层:它是纹身的墨水、建筑的结构、车头的金属徽章、毛绒玩具的外形、集装箱的印刷图案。
- Logo 边缘允许随材质自然变化(墨水微微晕开、沙子塌落、表面磨损、贴着曲面包裹),只要整体外形和配色仍能一眼认出。
- 6 张之间的差异来自题材、场景、色调和 Logo 大小,不来自 Logo 的倾斜角度。Logo 尽量正面朝向镜头,不要极端倾斜或镜像翻转。
- 必须避免:卡通、扁平插画风、Logo 悬浮在表面上的「贴图感」、脏乱场景、Logo 太小认不出、6 张都是同一种套路。
## 分镜与镜头规则
- 6 个场景必须是 6 个完全不同的方向,覆盖人文、动物、生物、产品、建筑、自然等不同题材,并且每个都是具体的、有故事的真实场景(有具体的人、物、动作),不是抽象概念。
- 灵感方向举例(每次只挑一部分,或延伸出新的,不要固定成一套模板):纹身、沙滩压印、街头涂鸦喷漆、蚂蚁排成队形、大楼外形、车头立标、抓娃娃机抱枕、海上集装箱、拉花咖啡、冰雕、田野麦浪割出的图形、霓虹灯管、蛋糕糖霜、陶瓷烧制、刺绣、云层间的飞机拉烟。可结合品牌行业挑选,咖啡品牌可以有拉花和咖啡袋印花,运动品牌可以有跑道彩绘。
- Logo 画面占比要有变化:2-3 张占画面 1/3 以上的「大 Logo」,其余较小但依然清晰可辨。
- 画面丰富度靠具体的叙事细节建立(纹身师的荧光绿手套、集装箱旁的海鸥、娃娃机里堆着的各种毛绒玩具),比空喊「前中后景层次」有效得多。
- 6 张在色调上也要拉开:冷暖、明暗、饱和度各有不同,排在一起不单调。
- 视频动作必须来自场景本身的物理逻辑:纹身针在动、墨水渗入皮肤;海浪推着集装箱轻轻起伏、海鸥扭头;娃娃机爪子轻晃;车头立标反光随车缓缓前移。动作要细微、真实,不加场景里不合理的大动作。
- 时长:细微动作 5 秒,需要一点过程演变的 6-8 秒。
- 方案表字段:编号 / 创意概念 / 画面描述 / Logo 实物形态 / 占比 / 视频动作 / 环境音 / 时长。
## 提示词写法
- 图片提示词要像跟朋友描述一张照片那样,用一两句通顺的话说清「画面里有什么、正在发生什么、Logo 在哪里以什么形态出现」,最后补一句视角与构图。不要列清单、不要堆术语。好的示例:
- `一位戴荧光绿一次性橡胶手套的纹身师,正把图1 里的这个图案纹在客人的手臂上,特写镜头,photorealistic, refined and clean`
- `俯拍,城市中央矗立着一栋外形就是图1 图案的巨型建筑,四周是树林、道路和来往的汽车`
- `一辆白色老爷车,引擎盖上立着图1 图案造型的金属立标,车头近景,俯拍斜构图`
- `抓娃娃机的玻璃柜,纯白背景,机械爪夹着一个图1 图案形状的毛绒抱枕悬在半空,下面堆着各种毛绒玩具,正面近景`
- `深蓝大海上漂着一个巨大的白色集装箱,侧面印着大幅的图1 图案,一只海鸥站在集装箱右侧,居中构图`
- 每条都写明「Logo 的外形、轮廓和配色以图1 为准」,保证可识别;场景配色可以自由发挥。
- 反面写法:`hyper-realistic cinematic composition, dramatic volumetric lighting, the logo is seamlessly integrated into the textured surface...` 这种空泛术语堆砌效果差,改成大白话。
- 视频提示词结构:以场景图为基础 → 主体怎么自然地动 → 镜头(固定或极缓慢推近)→ 环境音(只写画面里真实发生的动作的声音)。示例:
`以图3 为画面,纹身针快速而轻微地上下点刺,墨水沿着图案边缘一点点渗入皮肤,纹身师的手指稳稳绷住客人手臂,镜头固定,极缓慢推近 5%,图案外形保持清晰不变形。声音:纹身机持续的嗡嗡声,手套摩擦皮肤的细微声响。不要字幕,不要背景音乐`
## 在 TVVV 上执行
- 先把用户上传的 Logo 作为 图1。场景图用 generate_image,reference_images 带上 图1;Logo 里有文字或精细字形时用 GPT Image 2 保证字形准确,纯图形 Logo 可用默认的 Nano Banana 2。6 张依次编号 图2-图7,画幅按设定(默认 9:16)。
- 视频用 generate_video,默认 Seedance 2.5、9:16、720p,单段 5 秒(有过程演变的 6-8 秒);reference_images 带上对应场景图,image_role 选 first_frame,让视频从这张图原样开始动;需要 Logo 更稳时可再带上 图1 作为 reference。
- 环境音写进视频提示词,由视频自带;用户要拼成完整短片时,可再用 generate_music 生成一段 30 秒左右克制、有质感的背景乐(极简电子或轻爵士),音量压在环境音之下。
- 一次回复最多 4 次工具调用:6 张图分两批(每批 3 张),6 段视频也分两批,每批回来检查 Logo 是否变形、颜色是否跑偏再继续。
- 结尾给交付清单:6 张图与 6 段视频的对应关系;如要拼接,建议顺序(按视觉强度递进,或冷暖、大小 Logo 交替),转场以硬切或极短叠化为主,开头结尾可加品牌名卡。提示用户在 TVVV 时间轴里拼接。
## 注意事项
- Logo 变形是首要风险:每张图都带 Logo 参考,提示词里写明以参考图的外形和配色为准;带字的 Logo 一定用 GPT Image 2,并逐张检查字母有没有写错。
- 视频动作太大会把 Logo 扭坏:动作控制在细微范围,提示词里写「图案外形保持清晰不变形」,仍然变形就缩短时长或改成更静的动作。
- 6 张做成同一个套路(都是印在某个表面上)会很无聊:题材、色调、Logo 大小三项都要拉开差距。
- 不要为了「有创意」把 Logo 拍得歪斜、翻转或藏得太小,品牌识别永远第一。
- 场景容易滑向脏乱或廉价,提示词里保留「干净、精致、有品位」的要求,粗粝材质也要拍得高级。