Cheaper · 145 models · Invoices

See pricing
用这个 Skill 开始对话
治愈系AI日常Vlog

治愈系AI日常Vlog

设定一个角色,做节奏舒缓、画风统一的治愈日常vlog,可连载多集

做一集治愈系vlog:手绘风女孩周末早晨煮咖啡、给花浇水、窗边看书,竖屏40秒

下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。

# 治愈系AI日常Vlog 适合想做「温柔慢节奏日常」短视频的用户:一个固定角色在自己的小房间、咖啡馆、街角过平凡的一天——煮咖啡、浇花、看书、点香薰。不靠旁白,靠画面和轻音乐讲故事。重点是角色和画风跨镜头、跨集保持一致,适合做连载。交付每集 30-90 秒竖屏 vlog(4-10 个镜头,每镜 6-10 秒)+ 一条无人声的治愈配乐,系列模式下每集单独输出。 ## 开工前确认 - 用户有角色图、场景图、风格参考就优先用,先分析:角色的发色、发型、瞳色、脸型、体型、服装配色;场景的布局、光源位置、家具和道具分布、色调;风格图的画风标签和主色。角色图和场景图画风差异大时提醒用户,并建议统一用哪组风格词。 - 没有素材就由 AI 设计角色和场景。 - 用 ask_user 一次只问一个问题,按影响大小排序:画风(手绘日系动画 / 水彩绘本 / 赛璐璐 / 柔和三维,默认手绘日系动画)→ 是不是连载、做几集 → 每集主题。 - 用「项目设定」表一次锁住:主题方向、画风词(一字不差的一串英文)、色板、光线偏好、画幅(默认 9:16)、是否连载与集数、语言。后续所有提示词都以这张表为准。 ## 制作流程 1. **项目设定** —— 上面的表格。**停下等确认。** 2. **角色 / 场景 / 道具卡与分镜** —— 在回复里给出: - 「角色卡」:发型、发色、瞳色、肤色、标志性五官;每套服装单独命名,如「造型1:浅蓝碎花娃娃衫 + 米白半裙」「造型2:粉色竖条纹睡衣套装」。 - 「场景卡」:每个场景单列空间布局、标志道具的位置(如「床头柜左边一串暖光小灯,右边一支香薰蜡烛」)、主光源位置与色温、整体色调。 - 「道具卡」:跨场景反复出现的道具(小串灯、绿植)单列。 - 「分镜表」:按集、按场景排镜头。 - 「配乐规划」。 这些卡片一旦确认就是唯一标准,后面所有镜头只引用、不改写。**停下等确认。** 3. **角色参考图** —— 每个角色一张横版双联图:左边胸部以上特写(五官、发色、瞳色、发型),右边全身正面(服装、鞋、整体轮廓),白底。换装造型以原图为参考只换衣服,脸和发型不动。**停下等确认。** 4. **场景参考图** —— 每个场景一张无人物的全景图,给角色留出自然站坐的空间,不要被道具塞满。 5. **逐镜生成视频** —— 每镜都带同一张角色图和同一张场景图。全部生成完**停下**让用户检查。 6. **配乐** —— 按配乐规划生成。 7. **交付** —— 每集的镜头顺序、转场和混音建议。 ## 风格锁定 - 画风词:项目设定里锁定的那一串原样复制到每条图片和视频提示词开头,例如 `hand-drawn Japanese anime style, soft watercolor texture, gentle cel shading`;不换同义词、不拆、不增删修饰。角色图、场景图、道具图必须用同一串。 - 色板:例如 `low-saturation warm beige tone, Morandi palette`,角色图和场景图都写;单帧主色不超过两组,禁止高饱和撞色。 - 光线:柔和的窗光或台灯光,色温偏暖(早晨约 4500K、傍晚和夜晚 3000-3500K 的烛光灯串),柔和漫反射,影子浅。 - 道具要与画风一致:手绘场景里不要出现写实质感的道具。 - 必须避免:高饱和、强对比、恐怖元素、写实照片风、赛博朋克、机械科幻、变形、多余手指、模糊、字幕。 ## 分镜与镜头规则 - 每镜一个生活片段,6-10 秒,最长不超过 15 秒;每集 4-10 镜。 - 运镜默认固定机位或极慢推拉、轻摇;不要快切、不要晃动。 - 每镜写清四件事:引用哪个场景、角色在做什么(具体到身体部位和细微表情,如「右手慢慢搅拌咖啡杯,左手托腮,嘴角微微上扬,望向窗外的晨光」)、景别和角度(远景/中景/近景/特写,正面/侧面/俯拍)、光线(如「右侧窗光,暖色温,柔和漫反射」)。 - 景别交替:环境远景交代空间 → 中景动作 → 手部或物件特写(咖啡拉花、书页、浇水的水流)→ 回到人物表情,避免连续同一景别。 - 连载模式:一次设计完所有集的分镜,每集对应自己的场景;每集情绪有起伏(如「安静 → 期待 → 满足」);角色永远引用同一张角色卡,不重新描述外貌。 - 不用旁白:vlog 靠画面和音乐传达,不写 VO。 - 分镜表字段:集数 / 镜号 / 时长 / 场景 / 景别角度运镜 / 动作与表情 / 光线 / 环境声。 ## 提示词写法 - **图片提示词结构**:画风词 → 主体/角色描述 → 场景环境 → 道具与细节 → 色板 → 光影 → 构图。角色的发色、瞳色、肤色、发型、当前造型服装必须和角色卡一字不差(卡里写「深棕色长卷发」就不要改成「棕色卷发」);双联图写明「左边胸部以上特写,右边全身正面,白底,角色设定参考图」。场景图写明「无人物」,道具融入情境描述(「床头柜上燃着一支香薰蜡烛,床架上缠着橙色小串灯」而不是「小串灯,蜡烛」)。 - 图片示例(场景图): ``` Hand-drawn Japanese anime style, soft watercolor texture, gentle cel shading. A small cozy bedroom corner with no characters: a wooden desk under a large window on the right, a potted monstera on the windowsill, a ceramic coffee cup and an open book on the desk, warm string lights wrapped around the bed frame on the left, a scented candle on the nightstand. Low-saturation warm beige tone, Morandi palette. Soft morning window light from the right, warm diffused glow, light shadows. Medium wide composition with empty space by the desk for a person to sit. ``` - **视频提示词结构**:一句话说明画风和色调(与项目设定一致)→ 运镜 → 角色动作(身体动作 + 细微表情)→ 环境氛围细节 → 自然音效。**只写动作,不重复描述发色服装**——外貌靠参考图锁定,文字里写得越少越不打架。音效用自然语言融进动作描述里。 - 视频示例: ``` Hand-drawn Japanese anime style, low-saturation warm beige tone. Fixed camera, side medium shot, moving forward very slowly. The girl from 图1 sits at the desk in 图2, slowly stirring her coffee with her right hand, left hand resting on her chin, the corners of her mouth lifting slightly as she looks out at the morning light; steam curls up from the cup, curtain edge sways gently. The spoon taps the cup softly, birds chirp faintly outside. No music, no subtitles. ``` ## 在 TVVV 上执行 - 角色双联图、换装图、场景图用 generate_image,默认 Nano Banana 2;换装时把原角色图作为 reference_images 带上。画面里要出现清楚的手写字(便签、书名、咖啡店招牌)时用 GPT Image 2。 - 视频用 generate_video,默认 Seedance 2.5、720p、9:16,单镜 6-10 秒(模型单次 5-10 秒);每镜 reference_images 必带:已确认的角色图(当前造型那张)+ 同一张场景图,image_role 选 `reference`。同一场景且动作连续时,可把上一镜末帧作为 `first_frame`;换场景时不要带上一镜,避免把错误的光线带过去。连载跨集不引用上一集视频,只复用角色和场景图。 - 配乐用 generate_music:治愈轻音乐/氛围音乐,无人声,低频柔和。连载里情绪差异大时按集分轨,例如「晨雾般的钢琴」「夜晚烛光爵士轻音乐」。提示词里不写音乐人名字。本 skill 不用 generate_speech。 - 每次回复最多 3-4 次工具调用:角色图一轮、场景图一轮、视频每批 3-4 镜,结果回来再继续。 - 交付清单:每集镜头视频与顺序、配乐;剪辑建议——镜头之间用 0.5-1 秒柔和叠化,不压缩镜头时长,过长的镜头尾部轻微淡出;集与集之间约 1.5 秒淡出淡入;配乐音量为主轨的 40%-60%,保留视频里的咖啡机声、雨声等环境音(与配乐冲突时降 6dB),首尾各 1 秒音量淡入淡出;每集 30-90 秒单独导出。提示用户在 TVVV 时间轴里完成合成。 ## 注意事项 - **角色走样**:镜头里先检查带的是不是那张已确认的角色图,而不是急着重做角色图;提示词里别再写外貌。 - **画风漂移**:只要有一条提示词换了风格词,那一镜就会跳。画风词整串复制,不手打。 - **场景「相似但不同」**:同一场景每次都带同一张场景图,道具位置和光源描述与场景卡完全一致。 - **节奏太快**:治愈系最怕快切和晃动,默认固定机位,动作慢一点,每镜留出一两秒的呼吸。 - **颜色太艳**:一出现高饱和撞色就破功,负面词里写 high saturation, strong contrast。