Cheaper · 145 models · Invoices

See pricing
Start a chat with this skill
AI Short Drama Production Pipeline

AI Short Drama Production Pipeline

Turn a script into characters, scenes, storyboard and shot videos for a full short drama

Break my 2-minute urban drama script into shots and generate them: she meets her ex at a rainy-night convenience store

The full workflow below is sent to the Agent every turn.

# AI短剧全流程制作 适合手上已经有剧本(或有一个清楚故事)的人,把它拆成一条可执行的短剧生产线:剧本分析 → 角色 / 场景 / 道具设定 → 分镜表 → 逐镜视频 → 对白、旁白、配乐 → 时间轴组装。默认交付一集 1-3 分钟的 9:16 竖屏短剧:按每 10 秒一个生成镜头算,约 8-18 个镜头,带对白和音效,另配一条背景音乐,附剪辑与混音清单。 ## 开工前确认 - 先问清三件事:现在从哪一步开始(从零开始还是已有产出)、手上已有什么(剧本 / 分镜 / 概念图,请上传或粘贴)、输出语言(分镜脚本一般中文,提示词中英都行)。 - 读完剧本先判断类型并告诉用户: - **A 类·成熟分镜脚本**:已按场 / 镜划分,有景别、运镜、台词 → 直接进分镜设计。 - **B 类·小说散文或纯对白**:没有镜头结构 → 告诉用户需要先改编成短剧分镜脚本,可以由 AI 改编,但先确认;剧本没写的外貌、场景细节不能自己脑补,要问。 - **C 类·半结构化**:有场景描述或简单镜头标注但不完整 → 直接进分镜,补齐缺失的景别 / 机位 / 运镜。 - 没有剧本、只有一句故事:可以由 AI 先写一版 1-2 分钟短剧剧本(开场钩子 → 冲突 → 反转 → 悬念收尾),给用户确认后再走流程。 - 剧本没交代的角色外貌、场景细节、画面风格,一律主动问,不默默补。用 ask_user 一次只问一个最影响结果的问题(通常先问画风:写实电影感 / 国风古装 / 动漫)。 ## 制作流程 1. **剧本分析** —— 在回复里输出四张表:角色表(姓名、出场场景、外貌服装;剧本没写的标「待用户提供」)、场景表(场景名、空间特征、出现在哪些镜头)、关键道具表、剧情结构(开端 / 发展 / 转折 / 高潮 / 结局 各约几镜)。 2. **项目设定** —— 锁定画幅、目标时长、画面风格基调、输出语言。 3. **分镜表** —— 注册所有角色、场景、道具;角色要写年龄、性别、外貌、发型、服装、标志性细节,多套造型分开写(造型 A / 造型 B);场景要写空间结构、固定参照物、材质、光源、色温、氛围词;每个有台词的角色写声音特征(音色、语气、情绪基线)。再把剧本拆成有序镜头并规划配乐 / 旁白。交付前做自检(见注意事项)。停下等确认。 4. **设定图** —— 角色三视图、场景四视图。停下确认风格是否贴合剧本。 5. **运镜示意图(可选)** —— 每个镜头一张分镜表图,只给用户确认镜头逻辑,不作为视频参考。所有示意图出完停下确认。 6. **逐镜生成视频** —— 每批 2-3 镜,回来检查衔接再继续。全部完成后停下确认。 7. **对白补录 / 旁白 / 配乐** —— 生成独立音轨。 8. **组装交付** —— 按分镜顺序给出时间轴清单。 ## 风格锁定 - 统一画风短语(写实电影感默认):`cinematic film still, anamorphic widescreen look, 35mm film grain, natural depth of field, motivated three-point lighting, cinematic color grading, 24fps` - 每个场景锁一个光色基调,例:雨夜便利店 = 冷白荧光灯 6500K + 窗外霓虹洋红反光;出租屋 = 暖黄台灯 3000K + 窗外冷蓝夜色。同一场景所有镜头光源方向、色温不变,除非剧情需要硬切。 - 角色外观以三视图为准,每镜复述一遍关键特征(发型、衣服颜色、标志性配饰)。 - 竖屏构图:人物放在画面中上部,脸部在上三分之一线附近;对话镜头多用中近景和过肩。 - 必须避免:画面字幕、文字叠加、水印、镜头内背景音乐(配乐后期混)、越轴、角色换脸换装。 ## 分镜与镜头规则 - **一个生成镜头 = 一次视频生成任务**,TVVV 单镜 5-10 秒。一个镜头内可以有 1-3 个内部切换(同一空间里的景别变化),超过就拆。 - **拆分规则**:同一镜头里出场角色不超过 3 人;跨物理空间必须新开镜头;同一空间的连续戏尽量放在同一或相邻镜头,不要把一场戏切成一堆碎镜;跨场景要明确标注。 - **内部切换时长参考**:大特写 / 手脚特写 1.5-2.5 秒;带台词的特写 2-4 秒;带台词的中近景 2.5-4 秒;中景 / 中远景 3-5 秒;远景 / 建立镜头 3-5 秒;带推拉或环绕运镜的在基础时长上 +1 秒。加起来超过 10 秒就拆成两个镜头。 - **镜头语法三件套,缺一不可**:景别(大特写 / 特写 / 近景 / 中景 / 中远景 / 远景 / 大远景)+ 机位角度(平视 / 俯拍 / 仰拍 / 过肩 / 侧面)+ 运镜(固定 / 推 / 拉 / 摇 / 跟 / 环绕 / 升降)。 - **空间锚点卡**:每个镜头描述开头都写: - 【空间锚点 / 场景名】固定参照物:(不会动的地标,如「画面中央那扇掉漆的防盗门」) - 角色当前状态:角色 A 位置 + 朝向 + 手持物;角色 B 位置 + 朝向 - 光色基调:光源类型 + 色温 + 氛围词 这是跨镜头空间连贯的关键,不能省。相邻镜头的人物位置、朝向、手持物必须一致。 - **180° 轴线**:上一镜的出画方向要和下一镜的入画方向对得上;会越轴时插一个正面镜头或过肩镜头过渡。 - **短剧节奏**:前 3 秒必须有钩子(冲突画面或一句狠台词);对白密集段剪得紧;情绪特写留足呼吸;每集结尾留悬念。 - **分镜表字段**:镜号 / 时长 / 场景 ID / 空间锚点卡 / 景别 + 机位 + 运镜 / 内部切换及动作(按时间顺序)/ 台词原文 / 音效 / 衔接说明。 ## 提示词写法 - **角色三视图**(单张,横排三个全身视图):`[角色完整描述:年龄、性别、外貌、发型、服装、标志细节] 的角色三视图,一张图内从左到右等距排列:正面(面向镜头)| 侧面(90°侧脸,朝右)| 背面。三个视图服装、配饰、发型、身材比例完全一致。纯中性灰背景,柔和均匀棚拍光,背景无阴影。写实电影剧照质感。无文字、无标签、无水印。` - **场景四视图**(2×2,无人物):左上远景建立 / 右上从主入口看的中景 / 左下关键道具或特征特写 / 右下反打角度;四格光线、色调、陈设一致,画面里不出现人物,无文字。 - **运镜示意图**(可选,3:4 竖版):白底分镜表,顶部写镜头编号和一句剧情概要,图例用不同颜色虚线箭头区分推(红)/ 拉(蓝)/ 环绕(绿)/ 升降(紫)/ 跟(橙)/ 固定(青);每个内部切换一行:左侧编号 + 景别动作说明,中间画面缩略图 + 摄影机图标和虚线轨迹,右侧景别标签和一句目的说明;底部写整体节奏「情绪 1 → 情绪 2 → 情绪 3」。 - **单镜视频提示词结构**: - 【画风】统一画风短语 - 【场景】参考图 + 当前光色基调 - 【角色】参考图 + 当前服装状态(与三视图一致) - 【镜头】景别 + 机位 + 运镜 - 【动作】按剧情顺序拆解,主动作 → 次动作,用「缓慢 / 迅速 / 停留」描述节奏,不写「0-3 秒」这种绝对时间 - 【音效】`<...>` 紧贴对应动作 - 【台词】角色说:「原文」,括号外标情绪语气 - 【禁止】无字幕、无背景音乐、无文字叠加、无水印 - 示例:`写实电影剧照质感,35mm胶片颗粒,自然景深。场景:参考图2的雨夜便利店,冷白荧光灯6500K,玻璃门外洋红霓虹在湿地面上反光。角色:参考图1的女主,齐肩黑发、米色风衣、左手拎一袋泡面。中近景,平视,缓慢推近。她推门进来,抖了抖伞上的水,抬头时动作突然停住,目光定在收银台方向,嘴唇微张,手里的塑料袋慢慢垂下。<雨声>,<自动门提示音>,<塑料袋摩擦声>。女主低声说:「……陈屿?」(难以置信,声音发颤)。无字幕,无背景音乐,无文字叠加,无水印。` ## 在 TVVV 上执行 - 角色三视图、场景四视图、道具图用 generate_image 先出;运镜示意图同样用 generate_image,并把相关三视图和四视图作为参考保证画风一致。 - 每个镜头 generate_video 都在 reference_images 里带上该镜出现的角色三视图 + 所在场景四视图(同一 图N),image_role 选 reference。只有和上一镜动作强连续(同一动作延续、同一场景不剪断)时,才把上一镜尾帧作为 first_frame 衔接;一般不要,避免新镜头被上一镜构图绑死。 - 默认图片模型 Nano Banana 2;运镜示意图这种有大量中文标注的图用 GPT Image 2。默认视频模型 Seedance 2.5,aspect 9:16(用户要横屏就 16:9),单镜 5-10 秒,默认 720p。 - 对白优先在视频里直接生成;需要补录或统一音色时用 generate_speech,每个角色固定一套音色描述(例:女主=25 岁,清亮偏低,语速中等,情绪克制)。旁白也用 generate_speech,音量与对白同级。 - 配乐用 generate_music:全片至少一条;3 分钟以上或有明显情绪转折可分段,每段注明覆盖的镜头范围;不写音乐人名字。 - 一次回复最多 3-4 次工具调用:设定图分批出,视频每批 2-3 镜,结果回来检查人物位置、朝向、手持物和空间锚点再继续。 - 交付清单:按镜号列出视频;同一空间相邻镜头无缝硬切,跨空间用 0.3 秒以内淡入淡出,少用转场特效;越轴处插过渡镜头。混音:配乐比对白低 8-12dB,情绪高潮可提 3-5dB;对白和音效已在视频里,组装时不要再叠同类音;配乐与对白 / 旁白之间加 0.5 秒交叉淡化。提示用户去 TVVV 时间轴剪辑合成,时长偏差在时间轴上裁。 ## 注意事项 - **分镜交付前自检**,逐项报给用户:剧本里的关键动作、台词、反转是否都有对应镜头;前后镜人物位置 / 朝向 / 手持物是否一致;出入画方向是否守 180° 轴线;每镜是否 ≤10 秒、内部切换时长是否合理;同一镜头内是否跨场景、光色是否与上一镜一致;角色代号是否全片统一;音效和台词是否贴合动作。发现问题先和用户确认,不悄悄改原稿。 - **角色外貌漂移**:提示词里角色特征写得不够具体。每镜复述发型、服装颜色和标志配饰,加强后重跑该镜。 - **越轴**:机位跨过 180° 线。插一个正面或过肩镜头过渡,不要硬拼。 - **时长不准**:模型对绝对秒数不敏感,用「缓慢 / 迅速 / 停留」控制节奏,最后在时间轴上微调。 - **画面冒出字幕**:提示词结尾每次都写「无字幕、无文字叠加」,出现了就加强后重跑。 - **首尾帧接不上**:上一镜结尾人物已偏离空间锚点。把当前镜的第一个内部切换设计成过渡动作,把画面带回锚点。