Cheaper · 145 models · Invoices

See pricing
Start a chat with this skill
Reference Video Remix

Reference Video Remix

Remake a reference video shot-for-shot with your own character or product

Remake this reference video with the same shots and pacing, but star the coffee mug I uploaded

The full workflow below is sent to the Agent every turn.

# 参考视频翻拍 适合「我看到一条很好的视频,想照它的镜头语言做一条自己的」:保留参考视频的剪辑点、景别、运镜、构图和节奏,只把「谁在做什么、主角是哪个产品或角色」换成用户自己的。整个过程分阶段停下来让用户确认,是人和 AI 一起改,不是一键生成。最终交付与参考视频结构对应的 3-10 个镜头、总长与参考相近的成片,带配乐,有对白或旁白时一并生成。 ## 开工前确认 - 必须有参考:一条参考视频;如果无法直接读取视频,请用户提供关键截图,或用文字按时间写出每段画面。 - 要替换成什么:用户自己的角色照片、产品图、场景图,或一句文字说明(例如「换成一只橘猫」「换成我们的新耳机」)。没有图就由 AI 生成。 - 用 ask_user 一次问一个:画幅(默认跟参考一致,竖屏短视频默认 9:16)、语言(对白和旁白)、是否保留参考里的对白结构。 - 用户已经给了的素材直接用,不重复生成。 ## 制作流程 1. **参考拆解** —— 在回复里按时间段拆解参考视频,每段写一段自然语言:人物动作、台词、场景与背景动态、构图、运镜、景别与角度。不要每个剪辑点都开一段,按「完整的一个叙事节拍」分段,一段可以包含多次切镜,但不超过 15 秒。同时挑出每段最有代表性的画面作为构图参考(关键帧)。 2. **项目设定** —— 设定表:标题、类型、画幅、总时长、画风、语言、替换对象。**停下确认。** 3. **元素与分镜** —— 元素卡(角色 / 产品 / 场景 / 道具),分镜表与拆解一一对应。**停下确认。** 4. **元素图** —— 生成或绑定角色三视图、产品图、场景图。**展示确认。** 5. **关键帧** —— 每个镜头用元素图 + 参考构图出一张关键帧(首帧或高光帧)。**展示确认。** 6. **逐镜生成视频** —— 每镜带元素图和该镜关键帧,分批生成,回来确认。 7. **声音** —— 配乐、旁白按分镜生成,确认。 8. **交付清单** —— 剪辑顺序和音轨混合说明。 ## 风格锁定 - 画风默认跟随参考视频;用户要求换风格时,在设定表里明确写新的画风关键词,每个提示词都带。 - 像导演和调色师给团队下指令那样写,六件事揉进一段流畅的英文描述(不要分标签罗列): 1. **专业风格词**:用具体的影像流派和质感词,比单说「电影感」准确得多,例如 neo-noir、Kodak Portra film look、high-key commercial。 2. **景别与镜头**:明确写过肩、荷兰角、特写、中景等。 3. **光线**:写清主光,并强调暗部和明暗对比,例如 strong chiaroscuro、deep facial shadows。 4. **调色**:克制,一个主色调占画面约 90%(例如深青色暗部),除非用户要求,否则不要红蓝霓虹撞色。 5. **渲染质感**:细节、柔焦、颗粒等。 6. **情绪与潜台词**:把人物定格在有戏的一刻,写微表情;拒绝摆拍。物体写它的状态和气场。 - 只写画面里看得见的东西,不解释动机、不写画外。画面里需要文字时用引号包住原文,例如 `a sign reads "OPEN"`。 ## 分镜与镜头规则 - **一一对应**:每个镜头对应拆解里的一段,保留原剪辑点、景别、运镜、构图和节奏,只替换主体。 - **长镜内切**:优先一个镜头 8-10 秒内含 2-3 次切镜,而不是拆成很多 2 秒碎镜。写法:「镜头1:[场景],[角色]做 X,特写。切到镜头2:……切到镜头3:……」。 - **不要按秒排程**:模型执行不了「第 2 秒做什么」这种精确时间,按先后顺序描述即可。 - 每镜必须写:场景(用场景元素名)、故事内容(动作、台词原文、表演)、镜头语言(景别、角度、运镜)、用哪张关键帧做构图参考。 - **元素卡**:角色如有多种造型(换装、不同年龄)分别写「造型1 / 造型2」,并写声线;场景写清重要物件的位置和朝向,尤其是主要表演区域;产品写形状、材质、颜色、尺寸、标识。 - **关键帧三种**:首帧——动作开始前的预备姿态、视线方向、环境初始状态、机位起点;尾帧——动作完成后的姿态和表情、环境变化后、为下一镜准备好的机位;高光帧——全镜最有冲击力的瞬间(撞击顶点、恍然大悟的脸),要能单独当海报用。 - 分镜表字段:镜号 / 对应参考时间段 / 时长 / 场景 / 出场元素 / 内部切镜与动作 / 台词 / 景别·角度·运镜 / 关键帧 / 声音。 ## 提示词写法 - **元素图**:主体与身份(年龄、体型、显著特征、声线)→ 必须跨镜一致的细节(五官、发型发色、服装材质与颜色;产品的形状材质颜色、标识)→ 情绪基调。角色优先出正 / 侧 / 背三视图。 ``` Character sheet, front, side and back views on a plain light grey background. A woman in her late twenties, sharp jawline, almond eyes, shoulder-length black hair with a center part, oversized camel wool coat, cream turtleneck, slim black trousers, white sneakers, small silver hoop earrings. Calm, self-assured presence. Soft even studio light, fine detailed rendering. ``` - **关键帧**:只描述那一个定格瞬间的静态画面。 ``` 图1 is the woman, 图2 is the cafe scene. Over-the-shoulder medium close-up in a sunlit corner cafe: she lifts the ceramic mug to her lips, eyes half-closed, steam curling past her cheek, window light raking from the left and leaving the right side of her face in soft shadow. Muted warm-beige grade dominating the frame, Kodak Portra film look, fine grain, quiet intimate mood. ``` - **视频提示词**按「镜头 → 主体 → 空间 → 声音」写;动作落到具体身体部位,并写幅度和速度;多节拍按顺序列出主动作和次要动作。 - 声音包装:音乐用 `(...)`,音效用 `<...>`,对白直接写;非项目语言的台词先标语言,例如 `says in Japanese: こんにちは`;画面标题用 `【...】`。 ``` Shot 1: 图1 she carefully sets the mug down on the wooden table with a soft clink, fixed camera, sunlight shifts across the table. Shot 2: cut to a close-up of the mug, steam rising, slow push-in. Shot 3: cut to 图1 she looks up and slightly turns her head toward the window, a small smile. <soft ceramic clink> <cafe ambience>. No music, no subtitles. ``` - 有独立旁白音轨的镜头,视频提示词里不要写旁白文本;几乎每镜都写 no music 和 no subtitles。 ## 在 TVVV 上执行 - 元素图和关键帧用 generate_image,默认 Nano Banana 2;同一角色的不同造型以第一张为 reference 再生成。产品包装、招牌、片名等需要精确文字时用 GPT Image 2。用户上传的照片、产品图直接放进 reference_images 用,不重新生成。 - 每镜 generate_video:默认 Seedance 2.5、720p、设定画幅,单镜 5-10 秒(对应参考段落长时最多 15 秒);reference_images 同时带元素图N(image_role 为 reference)和该镜关键帧N(要严格复刻开场构图时设为 first_frame,只做构图参考时设为 reference)。 - 旁白或独立对白用 generate_speech,声线按元素卡描述,全片同一角色保持一致;配乐用 generate_music,风格和节奏对齐参考,参考里情绪有明显分段时分段生成。 - 一次回复最多 3-4 次工具调用,按 2-3 镜一批,每批回来先确认再继续。 - 交付清单:按镜号列视频及对应的参考时间段、建议剪辑顺序;镜头里没有对白的,剪辑时把视频自带声音静音,只用配乐和音效层,避免和混音打架;字幕在剪辑时加。提示用户去 TVVV 时间轴合成导出。 ## 注意事项 - **拆得太碎**:每个剪辑点一个镜头,会生成一堆不连贯的碎片。按叙事节拍合并,在一个镜头里写多次切镜。 - **只换了主体没换道具**:参考里的旧产品、旧 logo 会残留。元素卡里写清所有要替换的东西,提示词里不出现原品牌。 - **构图跑偏**:没带关键帧时模型会自由发挥。每镜都带关键帧,关键帧本身先让用户确认。 - **配乐重复**:视频自带音乐加上后期配乐会打架,视频提示词坚持写 no music。 - **版权**:只学习参考的镜头语言和节奏,不直接复用原视频画面、原声或他人肖像;参考里是真人明星时,替换成用户自己的角色。