
Designer Toy IP Kit
Build an art-toy IP from scratch with turnarounds, expressions, outfits, merch, showcase video
Design a jellyfish-girl art toy IP in blue-purple gradient, brand JELLY GIRL, with merch and a showcase video
The full workflow below is sent to the Agent every turn.
# 潮玩IP全套设计
适合想从零打造一个「大头小身」潮玩 / 盲盒风原创形象,并一次性拿到全套设计资产的需求:基础形象、四视图、表情包、换装方案、排版展示图、周边设计,以及一支不超过 30 秒的 16:9 动态展示短片(开场快速换装蒙太奇 + 周边逐个登场的主展示长镜头)配背景音乐。
## 开工前确认
- **必须锁定的三件事**:品牌名(英文大写最好,会印在帆布袋等主视觉周边上)、主色调(例如蓝紫渐变)、角色概念。用户没说品牌名就先建议一个并让用户确认;一旦锁定,后面每一步都不能改。
- **角色概念没方向时**,在回复里给一份灵感清单让用户挑:动物系(猫耳少女、兔子精灵、熊猫团子、水母女孩)、食物系(草莓蛋糕精灵、抹茶团子、西瓜汽水少女)、植物系(蘑菇女孩、樱花仙子、蒲公英旅人)、职业系(宇航员、魔术师、深海探险家)、奇幻系(星星精灵、云朵仙子、极光信使)、节日系(圣诞精灵、南瓜、新年锦鲤)。
- **用户上传了已有角色图**:跳过基础形象生成,直接用上传图当身份锚点;先在回复里记录脸型、眼型与瞳色、发型发色刘海、头身比(精确到 0.1,例如 1:2.5)、肤色、服装、主色。多张图时选最清晰的正面全身图为主,其他补充侧背面;有冲突(比如发色不一致)问用户以哪张为准。
- **周边清单默认**:帆布袋、手机壳、抱枕、保温杯、遮阳帽、雨伞、贴纸、眼罩,用户可增删。
- 用 ask_user 一次只问一个问题,优先问角色概念,其次问品牌名。
## 制作流程
1. **IP 设定** —— 在回复里用表格列出:角色概念、潮玩风格基调、品牌名、主色调、周边清单、画幅(图片 16:9 和 3:4,视频 16:9)、语言。**停下等用户确认**。
2. **基础形象(双版本)** —— 同一角色出两版:3D 渲染版(软胶体积感、细腻光影)和扁平矢量版(色块分明、轮廓清晰)。这是后面所有图的一致性锚点,**停下确认**,此时改成本最低。
3. **四视图** —— 正面 / 侧面 / 背面 / 45° 侧面放在同一张白底 16:9 图上。确认后作为角色核心参考。
4. **表情 / 换装 / 排版 / 周边**(可并行):
- 表情动作默认 8 个,2×4 宫格,3:4:飞吻、开心、馋、生气、困、害羞、害怕、哭。数量变了自动排版(6=2×3、9=3×3、12=3×4)。可替换的扩展:得意、星星眼、偷看、委屈、吓一跳、吐舌头、打喷嚏、发呆、傲娇哼。
- 换装默认 6 套,全身,3:4:西部牛仔、古风仙侠、夏日潮酷、萌熊、西瓜、酷黑西装。可换:赛博朋克、街头工装、国潮、旗袍、哥特洛丽塔、魔法少女、森林精灵、学院风、未来机能风。
- 排版展示图:把表情做成半身头像,套白色细线圆框,统一放在渐变背景上,16:9(默认蓝粉渐变天空,可选紫橙日落、薄荷绿、马卡龙四色、星空深蓝、奶油暖白、赛博霓虹)。
- 周边设计:4 套完全不同的展示方案,16:9;品牌名大字印在帆布袋上,配色严格用锁定的主色。
做完分组展示,**停下等确认**;改了表情,排版图要跟着重做。
5. **展示短片分镜** —— 写分镜表(见下),让用户指定主展示镜头里角色穿哪一套。场景没方向时给选项:梦幻星空舞台、糖果色实验室、未来展厅、浮空岛花园、海底宫殿、复古像素世界、水晶矿洞、云上城堡、霓虹夜市。**停下确认**。
6. **空场景图** —— 有选定场景就按描述生成新背景;没选就以周边展示图为参考,去掉所有商品和人物只留背景。检查画面里无人、无商品、无文字,**确认后**再做主镜头。
7. **视频与配乐** —— 先出蒙太奇短镜(每套造型一条),再出主展示长镜头,配乐同步做。最后按清单逐项交付。
## 风格锁定
- 每张图都带:`cute art toy, blind box vinyl figure, chibi big head small body, kawaii, minimalist, soft glossy material, clean studio lighting`
- 所有参考图步骤末尾都加一致性约束:`strictly keep the same face, hairstyle, hair color, head-to-body ratio and rendering style as the reference`
- 主色调贯穿角色配饰、周边和背景;配色可以变化,但不能盖过主色。
- **必须避免**:头身比漂移超过 5%、3D 变水彩或 2D 画风、两套换装在主题 / 配色 / 配饰三项里有两项以上雷同、品牌名拼错或漏印。
## 分镜与镜头规则
- **总时长 ≤30 秒**,16:9。超了先压缩蒙太奇,主展示镜头保持完整。
- **开场蒙太奇(默认开启,可整段跳过)**:每套造型一条 4-5 秒短镜,剪辑时只取 1-2 秒;前 3 秒至少闪过 2 套造型。总长约等于造型数 ×2 秒(6 套 ≈12 秒)。动作必须呼应造型主题且不重复:牛仔压帽檐 + 侧步,仙侠甩袖转身,潮酷比酷手势 + 点头,萌熊抱臂左右晃,西瓜原地跳 + 双手捧脸,黑西装整领带 + 自信一瞥。短镜之间硬切,偶尔加 0.3 秒淡入淡出;最后一条到主镜头用 1 秒溶接。
- **主展示镜头(10-15 秒,单条长镜头)**:固定中景,角色略低于画面中心。角色从中心弹出站定 → 周边按顺序每隔 1-1.5 秒登场:帆布袋(最大、最先)→ 手机壳 → 抱枕 → 保温杯 → 遮阳帽 → 雨伞 → 贴纸 / 眼罩(最小、收尾)。每件登场时角色转头看、做反应(发现 → 惊喜 → 互动 → 回正)。登场方式轮换:弹出 / 滑入 / 发光浮现 / 放大进入。最后一件出现时镜头轻推。
- **音效**:每件周边登场配一个短音效:弹出「啵」0.3 秒、滑入「嗖」0.4 秒、发光「叮」0.6 秒、放大低频「咚」0.5 秒;相邻音效间隔至少 0.8 秒;角色登场用标志性的「叮咚」做 IP 声音标识。
- **分镜表字段**:镜号 / 时长(生成时长与剪辑时长)/ 造型 / 动作 / 登场元素与方式 / 运镜 / 音效。
## 提示词写法
- **图片提示词结构**:画面类型(基础形象 / 四视图 / 宫格 / 周边)→ 角色身份描述 → 风格锚点 → 内容排布(宫格每格写什么)→ 背景与画幅 → 一致性约束。
- 示例(换装宫格):`3x2 grid of the same chibi jellyfish-girl art toy in six outfits, full body: western cowboy, xianxia hanfu, summer streetwear, cute bear suit, watermelon dress, black suit. Each outfit with matching accessories, blue-purple gradient accents, white background, cute vinyl figure render. Strictly keep the same face, hair and head-to-body ratio as the reference.`
- **视频提示词结构**:参考图说明 → 角色与造型 → 动作(写清身体部位、幅度、速度,主动作在前)→ 元素登场顺序与方式 → 运镜 → 音效 → 质量约束。
- 示例(主展示):`Character from 图3 in the cowboy outfit, background from 图5, products from 图4. Fixed medium shot. The toy pops up at center and stands still with a "ding-dong" sound. A tote bag printed with JELLY GIRL pops in on the left, she turns and gasps, pop sound; a phone case slides in on the right, she claps, whoosh sound; a pillow glows into view, she hugs the air, soft chime... Slight push-in as the last item, an eye mask, scales in with a low thud. Cute, fashion, tech mood. No clipping, no deformation, keep character consistent.`
## 在 TVVV 上执行
- 基础形象和四视图用 generate_image 先出(四视图记为 图N),后面的表情、换装、周边、空场景都在 reference_images 里带同一个四视图,image_role 选 reference。
- 默认图片模型 Nano Banana 2;**周边设计图、排版图、带品牌名的画面用 GPT Image 2**,保证文字拼写准确。
- 默认视频模型 Seedance 2.5,16:9,720p。蒙太奇短镜每条 5 秒,参考对应造型图;主展示镜头 10-15 秒,同时带造型图 + 周边图 + 空场景图。
- 配乐用 generate_music:默认时尚电子,BPM 110-130,合成器主音 + 鼓机 + 钢琴点缀,开场鼓点紧、主镜头转旋律、结尾一个收束音。其他可选:梦幻流行(100-115)、元气日系(128-140)、8-bit 芯片(120-135)、轻爵士(110-125)。时长与成片一致。
- 一次回复最多 3-4 次工具调用;图片按步骤分批,视频先短镜后主镜头。每批生成后检查脸型、发型、头身比、画风、品牌名是否一致,不一致就带着具体问题重做。
- 结尾交付清单:基础形象 → 四视图 → 表情宫格 → 换装宫格 → 排版图 → 4 套周边 → 展示视频 + 配乐;建议剪辑顺序和叠法(音效出现时把配乐压低约 9dB,结束后 0.3 秒恢复),提醒用户在 TVVV 时间轴剪辑合成。
## 注意事项
- **跳过双版本确认直接做四视图**:基础形象有偏差会污染后面所有步骤,一定先停下确认。
- **换装后脸变了**:每个参考图步骤都重复一致性约束,并且参考四视图而不是上一张生成图。
- **视频里穿模、手脚变形**:先原样重生成;连续两次失败再降低动作复杂度。
- **主镜头周边漏了或顺序乱**:一个镜头最多放 6-8 件,太多就拆成两个镜头。
- **空场景残留商品或文字**:提示词里明确写「no characters, no products, no props, no text」。
- **品牌名乱码**:带文字的图一律用 GPT Image 2,并在提示词里用引号写出完整拼写。