
棒球直播观众席上镜
上传自拍+名字,生成韩式棒球直播里被镜头扫到的30秒片段
用我这张自拍,做一段韩国棒球直播观众席镜头,名字条写「小林 - TVVV 创作者」
下面是这个 Skill 的完整创作流程,每轮对话都会完整给到 Agent。
# 棒球直播观众席上镜
适合想要一段「我被球赛直播镜头扫到」的趣味社交短片:用户在韩国职业棒球联赛的夜场看台上,转播机位忽然切到他,屏幕下方有比分条,上方有一条写着用户名字的转播字幕条,两位解说员用韩语热情地介绍他。最终交付一张转播截图风格的定帧图 + 一段约 30 秒、一镜到底的观众席转播视频(带解说和现场环境声)。
## 开工前确认
- 必须拿到两样东西,缺一不可,缺了就直接说明并等用户补,不要自己编默认值:
1. **个人参考照**:正脸清晰的自拍或半身照,光线均匀、无墨镜、无大面积遮挡。
2. **转播名字条文字**:屏幕上要显示的名字,例如「小林 - TVVV 创作者」。名字建议 ≤16 个字符,过长会被模型写错或挤变形。
- 可选确认(用 ask_user 一次只问一个):主队/客队用什么配色(默认一红一蓝两支虚构球队);解说词是否需要额外提一句用户想说的内容(如生日、求婚彩蛋)。
- 不使用真实球队队名、队徽、电视台台标,统一用虚构的队名和通用「体育频道」角标,避免侵权,也避免模型写错真实 logo。
## 制作流程
1. **项目设定** —— 在回复里用一个小表格列出:名字条文字、两支虚构球队名与配色、比分(默认主队 3:1 领先,第 7 局)、画幅 16:9、总时长 30 秒、解说语言韩语。等用户确认名字拼写无误再继续。
2. **转播定帧图** —— 以用户照片为参考,用 generate_image 出一张「直播截图」:用户坐在看台前排、自然微笑,画面带完整的转播包装(底部比分条、左上角频道角标、比分条上方的名字条)。**生成后必须停下**,让用户确认「像不像本人」和「名字有没有写错」,不满意就重出,最多给 2-3 次修改建议(换角度、调光线、换衣服颜色)。
3. **30 秒观众席视频** —— 定帧图作为首帧,原始自拍作为身份参考,用 generate_video 生成一镜到底的转播片段,包含韩语解说和球场环境声。
4. **交付** —— 给出视频、名字条与解说词文本,并提示可以在 TVVV 时间轴里加片头片尾或剪成 15 秒版本发短视频平台。
## 风格锁定
- 统一画风关键词:`real live Korean baseball TV broadcast, telephoto broadcast camera, evening stadium floodlights, slight broadcast compression, faint interlacing grain, authentic crowd`。
- 色彩与光线:夜场灯光色温约 4500-5000K,人物脸部有顶光+侧前方补光,背景观众被长焦压缩成柔焦色块;整体是电视台的标准调色,饱和度略高、对比偏硬,**不要电影感调色**。
- 镜头质感:长焦 200-400mm 等效,浅景深,镜头有极轻微的手持晃动(转播摄像机在云台上,不是手机)。
- 屏幕包装:比分条、角标、名字条全程**完全静止**,不动画、不改比分。名字条用白字+半透明深色底,韩式转播字体风格。
- 必须避免:电影感宽银幕黑边、背景音乐、字幕、剪辑切换、夸张表演、一直盯着镜头说话。
## 分镜与镜头规则
- 只有 **1 个镜头**,30 秒一镜到底,不切镜、不换角度。如果当前视频模型单段上限不足 30 秒,就拆成 2-3 段(每段 10-15 秒),后一段用前一段最后一帧做首帧,动作接续。
- 动作节奏(按 30 秒分配,像真实的转播「逮观众」镜头):
| 时间 | 画面 | 运镜 | 声音 |
|---|---|---|---|
| 0-5s | 镜头刚落在用户身上,他自然地看向场内,再四处张望 | 长焦固定,极轻微晃动 | 解说开始介绍名字 |
| 5-10s | 发现自己上了大屏,笑着朝镜头随意挥手,周围观众欢呼 | 微微推近 | 观众欢呼 |
| 10-16s | 抬头看外野上方的大屏/记分牌,再回看镜头 | 保持 | 解说继续 |
| 16-22s | 场上有动静,他短暂兴奋地欢呼 | 保持 | 球棒击球声、观众声浪 |
| 22-27s | 转头跟旁边的人说话、大笑(听不到他说什么) | 保持 | 环境声 |
| 27-30s | 笑着鼓掌收尾 | 保持 | 解说收尾 |
- 所有动作要「小而真」:挥手幅度小、笑容不僵、眼神在场内与镜头之间自然切换,不要每一秒都看镜头。
- 分镜表字段:时间段 / 画面动作 / 运镜 / 声音。
## 提示词写法
- 所有生成提示词用英文写,`[NAME]` 一律替换成用户给的名字条文字,绝不使用占位或编造的名字。
- **图片提示词结构**:参考图说明(身份锁定)→ 场景(球场、看台、比赛局势)→ 人物状态 → 转播包装(比分条/角标/名字条的位置与样式)→ 画面质感 → 静态要求。
- 图片示例:
```
Use 图1 as the identity reference; keep the exact face structure and likeness. A screenshot from a live Korean pro baseball TV broadcast. The camera cuts to the crowd: the person sits in the front rows of a packed night stadium in Seoul, smiling naturally, unaware of the camera. Broadcast overlay: static scorebug at the bottom, home team (red) leading away team (blue) 3–1 in the 7th inning; a generic sports channel bug in the top-left; above the scorebug a name bar reading "小林 - TVVV 创作者", white text on a semi-transparent dark bar in Korean broadcast style. Looks exactly like a real TV sports screenshot: broadcast color grading, slight compression, faint interlacing grain. 16:9. All graphics static.
```
- **视频提示词结构**:参考绑定(首帧+身份)→ 场景与情境 → 身份保持 → 一镜到底声明 → 动作时间线 → 转播质感 → 屏幕包装静止声明 → 解说词(韩语原文)→ 环境声 → 负面约束。
- 视频示例(节选):
```
图1 as the first frame, 图2 as the identity reference. A realistic live Korean baseball broadcast cutaway: the broadcast camera finds a notable guest in the front stands during a night game. Preserve the subject's likeness for the whole clip. One continuous take, no cuts, no angle changes. The subject smiles and looks around, gives a relaxed small wave, glances up at the outfield scoreboard, cheers briefly at the play, turns to laugh with the person beside them, then claps. Telephoto broadcast look, evening floodlights, slight TV grain, real crowd movement behind. Static scorebug and name bar "[NAME]" for the full duration. Two male Korean commentators, warm and casual: "[NAME] 씨가 오늘 야구장을 찾아주셨습니다. 7회 접전 속에서 관중석에서 직접 응원하고 계시네요." Ambient crowd noise, vendor calls. No music, no subtitles, no exaggerated gestures, no talking to camera.
```
## 在 TVVV 上执行
- 第 2 步用 generate_image,reference_images 带上用户自拍(图1),画面里有名字条这种精确文字,**用 GPT Image 2**;比例 16:9。
- 第 3 步用 generate_video,默认模型 Seedance 2.5、720p、16:9;reference_images 里定帧图设为 `first_frame`,用户自拍设为 `reference`,两张都要带。单段 10-15 秒时分段生成,每段回来先看衔接再继续。
- 解说直接写进视频提示词让模型同步生成;如果模型生成的韩语解说不清晰,可以改用 generate_speech 单独生成两段男声韩语解说,再在时间轴上叠加。本 skill 不用 generate_music。
- 一次回复最多 2 次工具调用:定帧图一轮,视频一轮。
- 交付清单:定帧图(可直接当封面)、30 秒视频、名字条文字和解说词原文;提示用户可在 TVVV 时间轴里裁成 15 秒竖版或加片尾。
## 注意事项
- **名字写错**:名字条是最容易翻车的地方。出图后逐字核对,错了就重出图,不要带错图进视频——视频会把错字一直保留 30 秒。
- **不像本人**:定帧图阶段必须停下来让用户确认像不像。不像时优先换一张更正、更亮的自拍,而不是不停改提示词。
- **比分条动起来**:模型喜欢让比分跳动或字幕闪烁。提示词里反复强调 static / unchanged,负面里写 no scorebug animation。
- **表演过度**:一旦写「excited」「waving at camera」太多,人物会像在拍广告。用 subtle、natural、believable,并明确「不要对镜头说话」。
- **侵权风险**:不要写真实球队、球场全名、电视台台标,统一虚构;用户坚持要真实队名时说明风险并让用户自行决定。