yeha.ai
목록으로

Become the lead character

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

用于原视频角色与场景替换,支持换脸、换人、换全身、换背景,并严格保留原视频运镜、动作节奏和色调风格。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

触发条件: 用户上传视频并明确提出换脸、换人、换背景、换角色等替换需求,或同时上传视频与参考图时触发本 Skill。
全局硬性规则(每步均适用):

  • 每个关键里程碑(模式确认 → 分镜确认 → 参数确认 → 生成确认)必须暂停,等待用户明确回复"确认"/"继续"或选择编号后再执行下一步。
  • 所有结构化信息(分镜表、参数配置)以 Markdown 表格呈现。
  • 运镜继承优先级最高:最终输出视频每一帧的镜头运动必须与原视频逐帧对齐,禁止添加或改变任何镜头运动。
  • 色调动态匹配:自动分析原视频的色调、亮度、对比度、饱和度,将替换区域的色彩风格匹配到原视频整体调性,不添加任何预设滤镜(除非用户明确要求)。

执行阶段与顺序(严格按序,不可合并或跳过):

  1. 欢迎与模式选择: 引导用户选择替换模式(换人/换脸/换背景/组合),确认参考图已上传。用 reply_to_user 输出,附带模式编号供用户选择。→ 等待用户确认。
  2. 原始视频分析: 调用 resource_prepare_and_analyze 分析原始视频,提取所有镜头变化,生成「分镜分析表」(字段要求见 resource_prepare_and_analyze 模块)提交用户确认。明确告知用户可逐镜修改任意字段,重点包括:时间段(起止秒)和运镜描述。用户可回复"第 N 镜时间段改为 X–Y 秒"或"第 N 镜运镜改为…",每条修改即时更新表格并重新呈现,直到用户确认全表无误后方可进入下一步。→ 等待用户确认。
  3. 参考图分析: 调用 resource_prepare_and_analyze 分析用户上传的参考图,提取替换目标的关键特征(人脸特征、服装、背景风格等),以表格形式呈现,供用户确认是否符合替换意图。→ 等待用户确认。
  4. Storyboard 生成: 调用 storyboard_designer,基于分镜分析表逐镜生成 Storyboard,每个 shot 对应原视频中的一个镜头段,明确记录运镜参数与替换意图。→ 等待用户确认。
  5. 资产绑定: 将用户上传的原始视频片段与参考图,通过 media_generator 注册 asset_id 并绑定到对应 Storyboard 的 shot / key_element 槽位。
  6. 逐镜生成替换视频: 按 Storyboard shot 顺序,逐镜调用 media_generator 执行视频换人/换景生成。每镜生成完成后展示结果,等待用户确认后再继续下一个 shot。
  7. 最终组装: 所有 shot 确认后,调用 video_assembler 按原视频时间轴顺序拼接,保留原始节奏与剪切点,输出最终视频。→ 引导用户导出。

依赖关系: 2→1;3→1;4→2,3;5→4;6→5;7→6。

2. 멀티모달 분석

原始视频分析(分镜拆解):

  • 对原视频进行逐镜段解析,输出「分镜分析表」,字段定义如下(所有字段必填,不得留空):
    字段说明镜头编号从 1 开始的整数序号时间段起止秒,精确到 0.1s,例如 0.0–3.2s时长自动计算(结束秒 − 起始秒),单位秒运镜类型使用标准词汇:固定 / 推 / 拉 / 横摇(左→右)/ 横摇(右→左)/ 竖摇 / 跟随 / 手持抖动 / 俯冲 / 上升,若有复合运镜则并列列出运镜幅度与速度例如:缓慢(<5°/s)/ 中速(5–15°/s)/ 快速(>15°/s),或描述位移距离人物动作描述主体人物的肢体动作、姿态、面部朝向;无人物时填"无"背景描述主要背景内容、深度层次、关键视觉元素替换难点评估替换复杂度:低 / 中 / 高,并注明原因(如:快速运动模糊、遮挡、光线骤变等)
  • 重点识别镜头切换点与运镜过渡,确保分镜边界精确到帧级(以 0.1s 为最小单位)。
  • 分析原视频整体色调参数(色温、亮度、对比度、饱和度),记录为后续色调匹配的基准值,附于分析表末尾。
  • 用户逐镜修改支持: 分析表呈现后,用户可针对任意镜头的时间段或运镜描述提出修改。每次修改后立即更新表格并重新呈现完整表格,确认「所有镜头均已修改完毕」后方可进入下一步。

参考图分析:

  • 人脸/人物参考图: 提取人脸结构特征(五官、肤色、发型、面部轮廓)、体型特征、服装/造型描述,输出为结构化文本,供 Storyboard 和生成提示词使用。
  • 背景参考图: 提取场景类型、光线方向、色调风格、空间纵深感,记录为 element scene 描述。
  • 分析完成后以表格形式呈现关键特征,供用户确认是否符合替换意图。
3. 스토리보드 설계

Key Elements 设计:

  • 替换目标人物(element character): 基于参考图分析结果,完整描述替换后人物的外貌、肤色、发型、服装,确保与原视频动作姿态的兼容性。若用户提供了全身参考图,需同时记录头部特写与全身造型两套描述。
  • 替换背景(element scene): 基于背景参考图或用户文字描述,记录目标背景的场景类型、光线、色调、关键视觉元素,与原视频色调基准值对齐。
  • 原始视频(素材锚点): 将原始视频整体登记为参考素材,标注总时长与分辨率。

Shot 设计:

  • 每个 shot 严格对应分镜分析表中用户已确认的一个镜头段,时长与确认后的时间段完全一致;若用户在分析阶段修改过时间段,以修改后的值为准,不得回退到原始分析值。
  • 每个 shot 必须包含:
    • 时间段: 直接复用分镜分析表中用户最终确认的起止时间(精确到 0.1s),不得自行调整。
    • 运镜继承: 直接复用分镜分析表中用户最终确认的运镜类型 + 幅度/速度描述,完整照搬,不得简化或省略。
    • 替换意图: 明确标注本镜需替换的内容(人物/背景/组合),以及替换目标对应的 element id。
    • 人物动作: 复用分镜分析表中的动作描述,不添加原视频中没有的动作。
    • 色调匹配备注: 提醒生成时参照原视频色调基准值(色温/亮度/对比度/饱和度)。

独立音频轨道:

  • 默认保留原视频音频,不设计额外音频层(除非用户明确要求替换背景音乐或人声)。
4. 미디어 생성

资产注册与绑定:

  • 用户上传的原始视频各片段:注册 asset_id,绑定到对应 shot 的 reference_video 槽位。
  • 用户上传的参考图(人脸/全身/背景):注册 asset_id,绑定到对应 key_element(element character 或 element scene)。

替换视频生成:

  • 使用 MultiModalToVideo,模型优先选择 Seedance 2.5,分辨率默认 480p
  • 每个 shot 的输入:
    1. 对应原始视频片段作为 reference_video(Video Modifies 模式)。
    2. 替换目标参考图(人脸/全身/背景)作为 reference_image。
    3. 提示词中明确描述替换意图、运镜继承要求与色调匹配要求。
  • 不使用 TextToVideo 或 FirstFrameToVideo,必须基于原视频片段进行修改,以保留运镜。
  • 若 Seedance 2.5(分辨率 480p) 生成失败,优先尝试 Seedance 2.5(分辨率 480p)(同为 MultiModalToVideo 路径),不跨工具替代。

参考图质量评估与不足处理:
在执行步骤 3(参考图分析)时,对每张参考图按以下标准评估质量,并输出评估结论:
问题类型判定条件影响等级分辨率过低人脸区域像素 < 200×200,或整图长边 < 400px高局部遮挡人脸被遮挡 > 30%,或全身图仅含上半身/下半身中–高角度不佳人脸侧脸超过 45°,或全身图非正面/正背面中光线异常强逆光、极端曝光过度/不足导致细节丢失中–高背景参考图构图混乱场景元素过于复杂,主体背景无法与前景清晰区分中

处理路径(按影响等级):

  • 高影响等级(必须处理,否则暂停生成):
    1. 向用户明确说明问题:输出「⚠️ 参考图质量不足:[具体问题描述],可能导致替换结果不稳定。」
    2. 优先引导用户补充材料,输出建议:「建议提供 [正面近景/全身正面/更高分辨率] 参考图,以获得更佳效果。」
    3. 若用户明确表示无法补充,则询问是否授权自动生成补充参考图(见下方生成规则)。
    4. 未获得用户任一明确选择前,不得进入 Storyboard 生成阶段
  • 中影响等级(提示用户,可选择继续):
    1. 在分析表中标注「⚠️ 建议补充」,说明具体影响(如:侧脸角度可能导致正面换脸效果不稳定)。
    2. 提供两个选项:「继续使用现有参考图」或「补充/重新上传参考图」。
    3. 用户选择继续时,在后续逐镜确认卡片中的「已知问题」栏主动预警该风险。
      自动补充参考图生成规则(仅在用户授权后执行):
  • 人物参考图补充: 使用 ImageToImage,以用户提供的原图为基础,模型选择 Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K,生成:
    • 正面近景头像(用于换脸场景)
    • 全身正面图(用于换人场景)
    • 生成提示词需明确保留原图中的人物外貌特征(肤色、发型、服装),不得改变人物身份。
  • 背景参考图补充: 使用 TextToImage,模型选择 Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K,基于用户的文字描述或原参考图的场景风格生成。
  • 每张补充参考图生成后,必须经用户确认通过后方可绑定使用,不得跳过确认直接进入生成。

逐镜确认机制——标准化确认卡片:
每个 shot 生成完成后,必须按以下模板输出确认卡片,等待用户明确回复后再继续下一个 shot:

🎬 第 N 镜生成结果确认
字段内容镜头编号第 N 镜(共 X 镜)时间段X.Xs – X.Xs(时长 Xs)替换类型换人 / 换背景 / 组合运镜继承对比原视频:[运镜类型 + 幅度/速度] → 生成结果:[根据输出视频实际判断,注明是否一致]替换效果自评人物相似度: ⭐⭐⭐⭐☆(1–5)|背景融合度: ⭐⭐⭐⭐☆(1–5)|色调匹配度: ⭐⭐⭐⭐☆(1–5)已知问题[如有明显瑕疵,在此注明,例如:边缘融合不自然 / 人脸轻微变形 / 色温偏暖]建议操作✅ 确认通过,继续第 N+2 镜 | 🔄 重新生成本镜 | ✏️ 修改提示词后重试

请回复:「确认」 继续下一镜,或说明需要调整的内容。

评分说明(仅供参考,代理自评):

  • 人物相似度: 替换后人物与参考图的面部/体型吻合程度。
  • 背景融合度: 背景替换区域与前景的边缘自然度、空间感一致性。
  • 色调匹配度: 替换区域色彩风格与原视频整体调性的一致程度。
  • 若任一维度评分 ≤ 3 星,须在「已知问题」中注明原因并主动建议重试。
5. 프롬프트 작성

视频替换提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p)):

  • 参考图占位符: 人物参考图用 <<<image_1>>>,背景参考图用 <<<image_2>>>(如有多张参考图,按序编号)。原始视频片段作为 video 输入直接传入,不在提示词中用占位符标注。
  • 核心结构(顺序固定):
    1. 替换对象描述: 明确"将视频中的人物替换为 [参考图中人物的具体外貌描述]"或"将背景替换为 [目标背景描述]"。
    2. 运镜继承声明(必须写入): "保持原视频完全相同的镜头运动:[复用分镜表中的运镜描述,如:固定机位 / 向右缓慢摇镜 / 手持轻微抖动],不添加任何新的镜头运动。"
    3. 动作保留声明: "人物的动作轨迹、肢体运动、节奏与原视频完全一致。"
    4. 色调匹配: "替换区域的色彩、亮度、对比度匹配原视频整体调性:[色调描述],不添加预设滤镜。"
  • 禁止写入: 任何原视频中未出现的动作、场景元素或镜头运动。
  • 固定负向约束(每条提示词末尾附加): no added camera movement, no new lighting, no style filter, no subtitles

参考图提示词(TextToImage / ImageToImage):

  • 描述人物外貌时聚焦可视特征:五官、肤色、发型、服装材质与颜色,不写心理描述或不可见内容。
  • 使用自然语言段落描述主体 + 环境,短语标注风格/光线/构图,不使用标签堆砌。
6. 동영상 조립

拼接原则:

  • 严格按原视频的时间轴顺序拼接所有已生成的 shot,不改变原有剪切点与节奏。
  • 每个 shot 的时长与原视频对应镜头段完全一致,不添加额外的过渡效果(除非用户明确要求)。
  • 音频轨道默认使用原视频音频(提取自原始视频),与视频轨道精确同步对齐。

拼接后整体质检(输出前必须逐项执行):
逐项检查以下质检维度,并以表格形式向用户呈现质检报告:
质检维度检查内容判定标准镜头衔接跳帧相邻 shot 拼接点前后各 0.5s 是否存在画面跳动、重影或帧错位拼接点过渡自然,无可见跳帧音画同步偏差音频轨道与视频轨道的对齐误差偏差 ≤ 1 帧(约 33ms@30fps),人物口型与原音频匹配色调断层相邻 shot 之间替换区域的色温、亮度、饱和度是否出现明显断层跨镜色调变化幅度在视觉可接受范围内,无突兀色彩跳变运镜连续性相邻 shot 的运镜方向与速度衔接是否自然运镜过渡与原视频剪切节奏一致,无方向突变替换区域边缘全片范围内人物/背景替换区域的边缘融合质量无明显锯齿、光晕或抠图残留时长吻合输出视频总时长与原视频总时长是否一致误差 ≤ 0.1s

质检结果处理规则:

  • 若所有维度均通过,输出「✅ 质检通过」并引导用户导出。
  • 若任一维度发现问题,标注「⚠️ 需关注」或「❌ 需修复」,说明具体问题位置(如:第 N 镜与第 N+2 镜拼接点存在色调断层),并提供建议操作:重新生成对应 shot / 调整拼接参数 / 人工确认后强制导出。
  • 质检报告呈现后等待用户确认,用户明确回复后再执行导出。