yeha.ai
一覧に戻る

Action previs and storyboard video

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

根据用户动作构思或已有动作分镜,生成动作分镜故事板,并结合角色三视图与场景参考生成连续动作视频,重点处理动作节拍、镜头衔接、角色一致性与多板连续性。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

工作模式判断(优先询问)
项目启动时,先确认用户当前入口:

  • 模式 A(构思→分镜→视频): 用户提供动作构思/描述,先生成 PREVIS 分镜故事板图像,确认后再生成视频。
  • 模式 B(分镜→视频): 用户已有 PREVIS 分镜图像,跳过分镜生成阶段,由 resource_prepare_and_analyze 解析分镜图后直接对齐 Storyboard,再进入视频生成阶段。模式 B 的启动判断标准:用户在会话开始时直接上传了 PREVIS 分镜图,或明确表示"我已有分镜";不得因用户未上传分镜图而自动降级为模式 A,模式必须由用户确认。
  • 无论哪种模式,若用户提供了角色三视图,立即通过 resource_prepare_and_analyze 分析并注册为角色 key_element 资产;若尚未提供,在进入视频生成阶段前提示用户上传。
  • 场景图入口: 项目启动时同步确认场景图来源——用户是否已提供场景参考图,或需要 Skill 生成场景图,或暂无场景图(视频生成仅依赖 PREVIS 分镜图和角色三视图)。

完整流程与依赖顺序

  1. 锁定全局参数text_editor 建立 Final_Video_Spec.md,记录:项目名称、总板数、画面比例(默认 16:9)、目标输出分辨率(默认 480p)、视觉风格锁定(极简火柴人 PREVIS 手绘风)、视频每板时长上限(30s)。
  2. 分析输入素材并立即注册已提供资产resource_prepare_and_analyze + media_generator
    • 模式 A: 分析用户提供的角色三视图或场景参考图(分镜图此时尚未生成)。
    • 模式 B: 对用户上传的所有 PREVIS 分镜图执行逐张逐帧结构化解析,输出每板完整的"Storyboard 映射输出"(含动作节拍序列、镜头调度、板间衔接备注、跨板连续性预判);同步分析角色三视图和场景参考图(如有)。分析顺序:分镜图 → 三视图 → 场景图,全部完成后统一输出汇总结果。
    • 【关键规则】分析完成后必须立即注册资产: 无论模式 A 还是模式 B,只要用户已上传素材并完成分析,必须在本步骤结束前通过 media_generator 立即完成以下注册与绑定,不得推迟到后续步骤:
      • 每张角色三视图 → 注册 asset_id → 绑定至对应 element character(若 Storyboard 尚未建立,先完成注册并记录映射关系,待 Storyboard 建立后立即补绑)。
      • 每张场景参考图 → 注册 asset_id → 绑定至对应 element scene(同上,Storyboard 未建立时先注册记录,后补绑)。
      • 模式 B 下,每张用户提供的 PREVIS 分镜图 → 注册 asset_id → 绑定至对应 shot(Storyboard 建立后立即补绑)。
    • 注册完成后输出资产注册清单(素材名称 → asset_id → 绑定目标),供用户核对;若存在无法匹配绑定目标的素材,在清单中标记"[待绑定]"并提示用户确认归属。
  3. 建立 Storyboardstoryboard_designer
    • 模式 A: 预建 shot 占位(分镜图内容尚无,留空待生成后绑定),建立 element character 和 element scene 条目。
    • 模式 B: 直接将 resource_prepare_and_analyze 的"Storyboard 映射输出"逐板填入对应 shot 字段;根据分析工具识别的角色数量建立 element character 条目,根据跨板连续性预判推断场景切换并建立 element scene 条目。
  4. 生成 PREVIS 分镜图像(模式 A)→ media_generator(TextToImage 或 ImageToImage,模型:GPT Image 2)。每板生成完毕后暂停,等待用户确认后再继续。
  5. 场景图获取/生成
    • 若用户已提供场景参考图,注册 asset_id 并绑定至对应 element scene → media_generator
    • 若用户未提供,根据 Storyboard 中 element scene 描述生成场景概念图 → media_generator(TextToImage 或 ImageToImage,模型:GPT Image 2,分辨率 2K);生成后暂停确认。
  6. 绑定资产media_generator:将确认的 PREVIS 分镜图、角色三视图、场景图的 asset_id 分别绑定至对应 shot、element character、element scene。
  7. 生成动作视频(逐板)media_generator(MultiModalToVideo,模型:Seedance 2.5(分辨率 480p)):每板生成完毕后暂停,供用户审阅,确认后继续下一板。
  8. 最终剪辑合成video_assembler:按 Storyboard 顺序拼接各板视频,处理板间衔接、音频对齐。

依赖关系: 3→1;4→3;5→3;6→3,4,5;7→6;8→7。

多板批量视频生成顺序控制(5 板及以上项目)

  • 严格顺序生成: 始终按 Storyboard shot 顺序(Board 1 → Board N)逐板生成,禁止并行或乱序生成。每板生成完毕并经用户确认后,才将该板 final_shot 纳入下一板的参考候选池,再继续生成下一板。
  • 奇偶分段策略(板数 ≥ 10 时启用): 将所有板拆分为若干 5 板一组的批次(如 1–5、6–10……)。每批次全部生成并经用户逐板确认后,集中进行一次批次间一致性预检(角色位置/外观/场景),输出预检摘要,再开始下一批次。预检发现的问题须在当前批次修复后,才能推进下一批次,避免问题累积至装配阶段集中爆发。
  • 中途问题处理规则:
    • 当前板生成质量不达标(如角色外观严重飘移、动作节拍错序): 立即暂停,不继续生成后续板;向用户展示问题截图描述与建议修复方向(调整参考权重 / 修改提示词 / 更换参考输入),用户确认修复方案后重新生成当前板,通过后方可继续。
    • 当前板衔接断层(角色位置/朝向与上板末帧不一致): 在提示词空间调度层追加强制起始位置约束,重新生成当前板;若两次重生成后仍断层,提示用户选择:① 接受跳切并标记留装配处理;② 手动上传过渡帧图像作为 start_frame 辅助对齐;③ 返回修改 Storyboard 板间衔接备注后重试。
    • 连续 3 板出现同类问题(如同一角色持续外观飘移): 判定为系统性问题,暂停整个批次,向用户说明可能根因(三视图权重不足 / 角色描述过于模糊),建议补充更高质量三视图或调整 element character 描述后,从问题首板重新生成。
    • 单板生成失败(Seedance 2.5(分辨率 480p) 返回错误): 跳过当前板,继续生成后续板以节省时间;但跳过的板须在待处理列表中保留,所有板生成完毕后统一重试,禁止以空板状态进入装配。

暂停节点与用户确认交互规范
每个暂停点必须向用户展示结构化摘要,并提供明确的决策选项,不得仅输出"已完成,是否继续?"等模糊提示。
暂停点 1:Final_Video_Spec.md 锁定后

  • 展示内容:项目名称、总板数、画面比例、目标分辨率、视觉风格、每板时长上限、场景图来源确认(用户提供 / 需生成 / 暂无)。
  • 决策选项:① 确认参数,进入 Storyboard 设计;② 修改某项参数(用户可直接指出字段)。

暂停点 2:每张 PREVIS 分镜图生成后(模式 A)

  • 展示内容:当前板编号(如 Board 1/N)、生成图预览、该板覆盖的帧编号(F1–F8)及简要动作节拍描述。
  • 决策选项:① 确认此板,继续生成下一板;② 调整描述重新生成(用户说明修改方向);③ 跳过此板(标记为"待补充",先继续后续板)。
  • 若用户已上传场景参考图且尚未确认绑定,在此节点同步确认:显示场景图缩略说明,询问是否绑定至对应 element scene。

暂停点 3:所有 PREVIS 分镜图与场景图就绪,Storyboard 建立完毕后

  • 展示内容:完整 Storyboard 摘要——所有 element character(含描述来源:三视图 / 待上传)、所有 element scene(含图像来源:用户提供 / Skill 生成 / 暂无)、shot 列表(板编号 + 核心动作节拍一句话概括)、已绑定资产清单。
  • 决策选项:① 确认 Storyboard,进入逐板视频生成;② 修改某个 element 或 shot 描述;③ 提示用户上传仍缺失的角色三视图(若有标记为"待补充"的 element character,此步为强制暂停,必须等待上传后才能继续)。

暂停点 4:每板视频生成后

  • 展示内容:当前板编号(如 Board 1/N)、视频时长、使用的参考输入列表(PREVIS 分镜图 asset_id、各角色三视图 asset_id、场景图 asset_id、是否使用了上一板 reference_video)、板间衔接备注执行情况(如"已依据上板末帧将角色起始位置对齐至画框右侧")。
  • 决策选项:① 确认此板,继续生成下一板;② 当前板需重新生成(用户说明调整方向:镜头运动 / 动作节拍 / 角色外观 / 其他);③ 接受此板但标记需在装配阶段人工处理的问题点。

暂停点 5:所有板视频生成完毕,装配前

  • 展示内容:全部 final_shot 列表(板编号 + 时长 + 是否有标记问题点)、各板总时长合计、一致性预检摘要(已检出的角色位置跳切 / 场景飘移 / 外观飘移问题数量及位置)。
  • 决策选项:① 确认全部视频,进入装配;② 针对某板重新生成(根据预检问题定向修复);③ 接受现有问题直接装配(适用于蒙太奇意图明确的跳切情形)。
2. マルチモーダル分析

分析用户提供的 PREVIS 分镜图(模式 B 核心入口)
逐张分镜图执行以下结构化解析,输出须可直接映射为 Storyboard shot 字段:
① 画格清点与布局识别

  • 统计该张分镜图的画格总数(≤16 格),确认排列方式(4×4 网格或其他排列)。
  • 若画格编号不清晰或无编号,按从左到右、从上到下顺序自动标记为 F1–FN,并在输出中注明标注方式。
  • 若图像分辨率过低或部分画格模糊,逐一标记受影响的帧编号及可信度("可解读 / 部分可解读 / 无法解读"),无法解读的帧不得臆造内容,须在输出中保留空位并标记"[待用户补充]"。

② 逐帧结构化提取(每帧必须包含以下所有字段)

  • 帧编号: F1–FN(自动标注或引用图内标注)。
  • 景别: 从以下标准词中选择最接近的一项——EXTREME WIDE / WIDE / MEDIUM / MEDIUM CLOSE-UP / CLOSE-UP / EXTREME CLOSE-UP;若图内有文字标注,直接引用并括注映射词(如 "图内标注 WS → WIDE")。
  • 镜头运动: 推 / 拉 / 摇(方向)/ 跟 / 俯拍 / 仰拍 / 静止;依据画面内箭头、标注文字或透视线方向推断;若无法判断则标注"静止(推断)"。
  • 主动作节拍: 主动方角色(火柴人)的核心动作,以"部位 + 运动方向 + 幅度"格式描述,如"右臂向右上方大幅挥出";若有速度感线或拖尾线,在描述后加 [速度感: 爆发/流畅/沉重]。
  • 受击/反应动作: 若存在第二个角色,描述其反应姿态与运动方向;若无第二角色,标注"单角色帧"。
  • 画面内标注摘录: 逐字抄录图内所有文字标注,无论中英文;若无文字,标注"无文字标注"。
  • 运动轨迹箭头: 描述箭头的起点位置、指向与含义推断(如"角色从画框左下向右上位移")。

③ 整板镜头调度归纳

  • 汇总该板的镜头运动总体节奏:起幅景别 → 中间变化 → 落幅景别,用一句话概括(如"从 WIDE 推进至 EXTREME CLOSE-UP,全板以跟随运动为主")。
  • 识别板内是否存在明确的镜头切换节点(如 F3→F4 之间有明显切割线或"CUT"标注),若有,标记切换位置。
  • 归纳整板动势走向:角色主要运动方向(向左/向右/向画面纵深/由纵深向外)及整体节奏强度(起伏/持续爆发/渐进蓄力)。

④ 多板连续性预判(模式 B 特有)

  • 若用户同时提供了多张分镜图,在分析完所有单板后,额外输出跨板连续性摘要:
    • 相邻两板的落幅帧(前板 FN)与起幅帧(后板 F1)的角色位置/朝向是否一致;若存在明显不一致,标记"[需板间衔接备注]"。
    • 跨板出现的相同角色(依据火柴人体型比例或图内角色标注识别),确认其在各板中的身份一致性。
    • 识别跨板是否存在场景切换(背景几何元素明显变化),若有,标记新场景并建议建立独立 element scene。

⑤ Storyboard 映射输出(供 storyboard_designer 直接引用)
每张分镜图的分析结果最终以如下结构输出,字段名与 Storyboard shot 定义对齐:
[Board N 映射]\

  • 关联分镜板: [用户提供板编号或自动编号 Board_N]\
  • 帧范围: F1–FN(共 N 帧)\
  • 动作节拍序列: F1: … ; F2: … ; … ; FN: …\
  • 镜头调度: 起幅[景别] → [运动方式] → 落幅[景别];板内切点: [无 / F_N→F_N+1]\
  • 板间衔接备注: [与上板末帧的角色位置/朝向连续性说明,首板填"首板,无前板参照"]\
  • 时长上限: 30s\
  • 待补充项: [列出所有"[待用户补充]"或"[需板间衔接备注]"标记]

分析用户提供的角色三视图
分析目标:提取可在所有板(跨镜头)稳定复用的视觉锚点,输出结构化角色身份描述,作为 element character 的 description 基础,并直接服务于后续 GPT Image 2 角色参考图生成与 Seedance 2.5(分辨率 480p) 视频生成的参考绑定。
按以下维度逐项提取,每项必须给出具体描述而非"正常/无特殊"等空泛结论:
① 面部身份锚点(Face Identity Anchors)

  • 脸型轮廓(如:方形下颌 / 瓜子脸 / 宽颧骨)
  • 五官关键特征(眉形粗细与颜色、眼型与眼距、鼻梁高度与宽度、唇形与唇色)
  • 肤色与肤质倾向(色号范围描述,如:warm medium-tan / pale cool-toned)
  • 发型结构:发际线位置、分区方式(中分/偏分/无分)、长度、质感(直/卷/蓬松/贴头皮)
  • 发色:主色 + 次要色/挑染(如有),避免仅写"黑色",需补充光泽倾向(哑光黑 / 蓝黑光泽)

② 体型与比例(Body Proportion)

  • 整体身高体型分类(高挑/中等/矮壮/纤细等)
  • 肩宽与腰臀比的视觉印象
  • 手部/颈部等局部可识别特征(如有)

③ 服装与造型(Costume & Styling)

  • 上装:款式类型 + 主色 + 次要色/图案 + 领型/袖型等结构细节
  • 下装:款式类型 + 主色 + 长度 + 版型(修身/宽松)
  • 鞋履:类型 + 颜色 + 鞋底厚度(如有跨镜头可见性)
  • 材质质感关键词(2–3 个):如 matte cotton / shiny leather / worn denim
  • 标志性配件(如有):类型 + 颜色 + 佩戴位置(如:right wrist silver chain bracelet / left shoulder tactical strap)

④ 三视图一致性校验

  • 对比正面、侧面、背面三张图,指出各视角间存在的颜色差异或细节不一致(如侧面图中服装颜色偏暗、背面显示有背包但正面未体现),并注明"以正面图为准"或"以用户说明为准"。
  • 若三视图中任一视角缺失,标记缺失方向并说明后续图像/视频生成可能受到的影响。

输出格式: 以结构化文本输出,按上述①–④维度分段,每项用短句或关键词组列举,供后续步骤直接复制引用;不输出叙事性段落描述。

分析用户提供的场景参考图

  • 识别空间结构与关键视觉锚点:整体环境类型(室内/室外/特定地点)、主要构成元素(建筑轮廓、地面材质、光源方向与色调、背景层次)、可在多板视频中稳定复用的视觉特征。
  • 输出结构化场景描述,作为 element scene 的 description 基础,确保跨板视频中场景风格与氛围一致。
3. 絵コンテ設計

Key Elements 设计

  • 为每位出现的角色建立一个 element character,description 基于三视图分析结果;若用户未提供三视图,标记为"待补充"并提示用户上传。
  • 为每个主要场景/地点建立 element scene,描述空间结构、光线方向、背景关键视觉锚点、整体色调与氛围;若用户已提供场景参考图,description 须与参考图内容保持一致,不得矛盾;若无参考图,需提供足够细致的描述以供后续生成场景概念图。

Shot 设计(每板 = 一个 shot)
每个 shot 对应一张 PREVIS 分镜图(最多 8 个动作节拍),必须包含:

  • 关联分镜板: 注明对应的 PREVIS 分镜图资产 ID(或用户提供板的编号)。
  • 动作节拍序列: 按帧顺序简述每个节拍的核心动作、运动方向与动势。
  • 镜头调度: 整板的镜头起幅/落幅、镜头运动类型(推/拉/摇/跟/静止)、景别变化。
  • 板间衔接备注: 与上一板末帧的角色位置/场景状态的连续性要求(首板留空)。
  • 节拍密度标注: 为每板标注节拍密度类型——高密度(爆发板)低密度(过渡板),依据以下标准判断:
    • 爆发板: 板内动作以连续打击、冲撞、多人混战为主,节拍间动作因果紧密,无明显停顿或蓄力段;目标视频时长 6–8s
    • 过渡板: 板内包含拉开距离、蓄力、喘息、镜头大幅推进/拉远等慢节奏段落;目标视频时长 10–30s
    • 若板内爆发段与过渡段混合,以主导内容判定,或在备注中说明分段节奏意图。
  • 时长目标: 根据节拍密度标注填写(爆发板 6–8s,过渡板 10–30s),不强制统一为 30s 上限。

模式 B 专项——从分析结果建立 Storyboard
当用户直接提供 PREVIS 分镜图时,Storyboard 的 shot 字段须直接从 resource_prepare_and_analyze 输出的"Storyboard 映射输出"中提取,字段一一对应填入,不得依赖主观推测补充分析工具未能识别的内容。具体规则如下:

  • 分析工具输出即 shot 初稿: 动作节拍序列、镜头调度、板间衔接备注 三个字段直接从映射输出中复制,保持原始推断结论,不自行扩写。
  • 待补充项处理: 分析工具输出中标记为"[待用户补充]"或"[无法解读]"的字段,在 shot 对应位置保留相同标记,等待用户在暂停点 3 确认 Storyboard 时补充或放弃。不得用推测内容填充这些字段。
  • 跨板 element scene 推断: 若分析工具在多板连续性预判中识别到场景切换,需为新场景自动新增 element scene 条目,描述来源标注为"[分析工具推断,待用户确认]";若分析工具未识别到场景切换,默认所有板共用同一 element scene,直至用户说明。
  • 角色 element 对齐: 若分析工具在逐帧分析中通过体型比例或图内角色标注识别出多个不同角色,需为每个角色建立独立 element character 条目;description 字段此时为空或仅填入分析工具推断的极简特征(如"高体型,右侧主动方"),等待用户上传三视图后由 resource_prepare_and_analyze 补全。

独立音频轨道

  • 若项目需要背景音效或动作音效,在此规划 audio_layer;动作 PREVIS 视频默认无旁白轨。
4. 素材生成

PREVIS 分镜图像生成(模式 A)

  • 工具:TextToImage(无用户参考图时)或 ImageToImage(用户提供风格参考或已有部分分镜时)。
  • 模型:GPT Image 2,分辨率 2K
  • 每次调用生成一张包含最多 8 个连续画格的单图分镜板,画格横向排列(2 行 × 4 列),统一画幅比例。
  • 若 GPT Image 2 失败,优先切换至 Nano Banana Pro (Gemini 3 Pro Image)(同工具内切换),保持相同提示词和风格约束。

场景图生成(用户未提供时)

  • 工具:TextToImage(无参考图)或 ImageToImage(用户提供部分场景参考时)。
  • 模型:GPT Image 2,分辨率 2K
  • 根据 Storyboard 中 element scene 的描述生成场景概念图,重点表现:整体空间结构、主光源方向与色调、关键背景视觉锚点(建筑/地形/环境道具),风格需与项目整体视觉基调一致。
  • 同一场景在多板视频中复用时,仅生成一张场景图并统一绑定,无需为每板重复生成。
  • 若 GPT Image 2 失败,优先在同工具内切换至 Nano Banana Pro (Gemini 3 Pro Image) 兜底。

资产注册与绑定

  • 用户上传的每张三视图图像,注册 asset_id 并绑定至对应 element character。
  • 用户上传或 Skill 生成的每张场景图,注册 asset_id 并绑定至对应 element scene。
  • 确认的 PREVIS 分镜图,注册 asset_id 并绑定至对应 shot。

模式 B 专项——用户自带分镜图的资产注册流程
模式 B 下,用户直接提供 PREVIS 分镜图,资产注册须在 Storyboard 建立完毕且用户确认后、视频生成开始前完成,按以下顺序执行:

  1. 注册用户提供的 PREVIS 分镜图: 为每张分镜图注册 asset_id(每张独立注册,不合并),并绑定至 Storyboard 中对应的 shot。若用户一次性提供多张图,按分析工具输出的板编号顺序逐一注册,注册完成后输出清单(Board N → asset_id)供用户核对。
  2. 注册用户提供的角色三视图(如已上传): 每张三视图注册 asset_id 并绑定至对应 element character;若用户尚未上传三视图,此步骤为强制暂停节点,必须等待上传后才能继续,不得以无三视图状态进入视频生成。
  3. 注册用户提供的场景参考图(如有): 每张场景图注册 asset_id 并绑定至对应 element scene。同一场景若出现在多板中,仅注册一次,所有关联 shot 共用同一 asset_id 绑定,禁止重复注册同一场景的多份 asset_id。
  4. 注册完成确认: 所有资产注册与绑定完毕后,输出资产绑定总清单(shot list、element character list、element scene list,各含 asset_id),提示用户确认后进入视频生成阶段。若清单中存在未绑定项(如某 shot 对应的分镜图 asset_id 缺失),必须在此暂停并提示用户补充,禁止跳过未绑定的 shot 直接生成视频。

动作视频生成(逐板)

  • 工具:MultiModalToVideo,模型:Seedance 2.5,分辨率 480p
  • 目标时长根据 Storyboard 节拍密度标注决定:
    • 爆发板(高密度): 目标时长 6–8s,优先选择靠近下限(6s)以强化紧凑感。
    • 过渡板(低密度): 目标时长 10–30s,根据镜头运动复杂度在范围内选择。
    • 时长在上述范围内取整秒值输入,不超过 30s 上限。
  • 每板视频的参考输入:
    1. PREVIS 分镜图(该板的 asset_id):作为镜头调度与动作节拍的首要视觉参考,权重高于文字提示词。分镜图通过运动矢量箭头、拖尾线、冲击标注、景别信息栏等视觉元素已编码大量动作信息;提示词必须严格执行减法原则——分镜图已清晰表达的内容在提示词中一律省略,只补充分镜图无法传达的速度质感词和因果关系;提示词与分镜图高度重复会导致文字权重压制视觉参考,生成结果偏离分镜意图。
    2. 角色三视图(所有出场角色的 asset_id):作为角色外观一致性参考。
    3. 场景图(该板涉及场景的 element scene asset_id,用户提供或 Skill 生成均可):作为空间结构与色调氛围的一致性参考;若当前板无场景图可用,则省略。
    4. 上一板最终视频(可选):仅当该板与上一板的场景/角色状态连续性极强时,加入作为 reference_video;否则省略,避免引入不必要的动作延续。
  • 若 Seedance 2.5(分辨率 480p) 失败,不自动切换至其他模型;停止该任务,向用户说明并询问是否尝试其他工具。

多板批量生成的参考输入递进策略

  • reference_video 启用门槛随板数递进收紧: 板数 ≤ 4 时,按常规判断是否引入上一板 reference_video(连续性极强时使用);板数 ≥ 5 时,仅在 Storyboard 板间衔接备注中明确标注"强连续"的板才引入 reference_video,其余板一律省略,避免随着板数增加,参考链条传递误差被逐板放大。
  • element 参考图权重保持一致: 无论生成到第几板,每板视频的 element character 三视图和 element scene 场景图的绑定方式与输入顺序须与第 1 板完全一致,不得因"前几板已经稳定"而降低后续板的参考输入完整性。
  • 待修复板不阻塞后续批次: 某板被标记为"需重新生成"时,后续板可继续生成(跳过该板的 reference_video 引用链,直接使用最近一张已确认 final_shot 作为连续性参考);被跳过板修复完成后,若其直接后续板已生成,提示用户评估是否因参考缺失需要对后续板重新生成。

跨板一致性策略(视频生成阶段)
场景图复用规则:

  • 同一 element scene 在多板中出现时,强制复用同一张场景图 asset_id,禁止为同一场景重复生成或替换新图;只有用户明确要求场景状态变化(如时间段切换、破坏后场景)时,才生成新场景图并注册独立 asset_id。
  • 每板视频生成时,若该板涉及已有 element scene,必须将对应场景图纳入参考输入,即使当板主要动作与背景无直接关联,也应保留以稳定色调和空间结构。

角色位置连续性处理:

  • 在每板视频生成前,从 Storyboard 中读取"板间衔接备注"字段:若标明上板末帧角色位置(如"角色A位于画框右侧,面朝左"),需在该板提示词的空间调度(③)中将起始状态与之对齐,避免位置跳切。
  • 若两板之间存在明显的动作因果关系(如击打→倒地),后板提示词的首个动作节拍(F1)必须从被击打角色的受力姿态起写,而非重置至中立站姿。
  • 若无板间衔接备注(首板或明确场景切换),不强制对齐,按该板分镜图独立调度。

三视图一致性兜底:

  • 所有板的视频生成均须附带全部出场角色的三视图 asset_id;即使某板某角色戏份极少,也不得省略其三视图引用,防止 Seedance 2.5 在低权重情形下自行重绘角色外观。
5. プロンプト作成

PREVIS 分镜图像提示词(GPT Image 2)
核心设计原则: 生成的分镜图应具备足够的视觉信息密度,使 Seedance 2.5(分辨率 480p) 能够直接从图像中读取动作编排、空间关系和镜头意图,尽量减少对文字提示词的依赖。每一格画面须做到"自解释"——即便不读提示词,也能从图像内的标注、箭头、线条中理解该帧发生了什么。
核心约束(每条提示必须包含,放在最前):

  • 风格锁定: 极简粗粝手绘分镜风格,全部角色仅使用火柴人(stick figures)表现,禁止出现真实人体结构、肌肉、服装、裤子、鞋子或任何角色细节。
  • 线条风格: 粗细不均的手绘铅笔/炭笔感线条,允许轻微抖动与不规则感,体现速写张力;禁止光滑矢量线条或任何数字清稿感。关键动势用粗重线强调,辅助参考线(透视线、轨迹线)用细虚线表现。
  • 背景处理: 背景保持极简,仅用几何轮廓线(方块=建筑/掩体,水平线=地面/台阶,斜线=斜面)示意空间关系;禁止写实纹理、填充色块或任何细节贴图。整体背景为纯白或极浅冷灰纸面色,只有线条,无任何渐变或阴影填充。
  • 标注语言: 所有镜头标注、动作说明、技术指令一律使用英文(如 PUSH IN、WIDE SHOT、POV、IMPACT、×2 SPEED),保持专业导演预演惯例;禁止在画格内出现中文。
  • 单图多格布局: 明确指定格数(最多16格),排列为4×4网格,每格独立构图,格间用细实线分隔;每格左上角可有小号灰色帧编号(F1–F16)。

逐格视觉信息密度要求(核心)
每格画面须同时包含以下所有视觉元素层,缺少任何一层均会导致 Seedance 2.5 参考时信息不足:

  • ① 运动矢量箭头(Movement Vectors): 为每一个正在运动的肢体或身体部位绘制独立的带箭头轨迹线,箭头长度反映运动幅度(大幅度 = 长箭头),箭头粗细反映力度(爆发力 = 粗箭头);角色整体位移需另绘一条全身移动轨迹弧线,与肢体箭头用线型区分(肢体=实线,位移弧=虚线)。
  • ② 动势拖尾线(Motion Blur Streaks): 运动中的肢体末端(拳头、脚尖、膝盖)须绘制 2–4 条平行拖尾线,拖尾方向为运动的反方向,表示速度感;爆发性动作(如直拳、扫腿)拖尾线应延伸至画格边缘或极近处,表达穿越力度。
  • ③ 冲击/接触标注(Impact Markers): 任何接触或即将接触的帧须在接触点绘制爆炸形放射线(星形或菊花形),并在旁边添加英文标注(如 IMPACT / HIT / BLOCK / GRAB);若为近距发力(如贴身短打),需额外绘制同心圆或压缩波纹线表示力道传导。
  • ④ 空间深度标记(Spatial Depth Indicators): 所有帧须有明确地平线(用水平粗虚线表示),多角色场景中每个角色脚下须有落地阴影圆点或小横线(表示站立位置),前景角色用较粗线条绘制、背景角色用较细线条绘制,以形成视觉纵深层次。
  • ⑤ 角色区分标签(Character Labels): 当画面中出现两名及以上角色时,每个角色头部旁边须有大写字母标签(A / B / C),主动方角色用圆圈圈选标签(①),被攻击方用方框标签([B]);此标签须贯穿全板所有画格保持一致,不随帧变动。
  • ⑥ 镜头信息栏(Shot Info Bar): 每格底部或顶部留一条细横向标注栏,标注:景别缩写(WS / MS / MCU / CU / ECU)+ 镜头运动(STATIC / PUSH / PULL / PAN-L / PAN-R / TRACK)+ 可选速度修饰词(SLOW / NORMAL / SNAP);格式示例:MCU | PUSH | SNAP。
  • ⑦ 帧间过渡指示(Inter-frame Transition Cues): 在相邻格之间的分隔线处,若动作连续,用小箭头(→)指示动作流向;若为剪切(CUT),在分隔线处标注 CUT;若为镜头切换(场景改变),在分隔线处标注 NEW SHOT,并用双竖线替代单线分隔。

提示词结构(顺序):

  1. 风格约束 + 逐格视觉信息密度要求(上述核心约束,压缩为简洁指令)
  2. 格数与布局声明(如:8-panel grid, 2 rows × 4 columns)
  3. 按格编号逐一描述:镜头信息(景别 + 运动)+ 角色标签分配 + 主要动作矢量方向 + 冲击点位置 + 帧间过渡类型
  4. 整板的动作编排总体节奏(动作因果链一句话概括,如:A 突破防线→近身发力连打→B/C 相继倒地)
  5. 若有参考图(ImageToImage 模式):指明参考来源及参考维度(构图/动势/镜头语言),排除角色外观参考。

角色参考图提示词(GPT Image 2 — TextToImage / ImageToImage)
角色参考图的核心功能是为跨板视频提供稳定的角色外观锚点,输出须可直接用作 Seedance 2.5(分辨率 480p) 的 reference_image 输入。按以下结构顺序书写:
① 布局声明(Layout Declaration)

  • 首句明确输出为横向双格拼图(side-by-side two-panel reference sheet),左格:头肩特写(tight head-and-shoulders portrait);右格:全身像(full-body standing pose, neutral stance)。
  • 两格统一背景:plain light grey / pure white studio background,无任何阴影投射或环境元素,确保 Seedance 2.5 参考时不引入背景噪声。
  • 禁止将两格合并为单格,禁止增加侧面/背面视图(侧面/背面信息由三视图原图承担,参考图专注正面标准外观锁定)。

② 面部身份锁定(Facial Identity Lock)

  • 直接引用 resource_prepare_and_analyze 输出的 ① 面部身份锚点,逐项写入:脸型轮廓、五官关键特征(眉/眼/鼻/唇)、肤色描述、发型结构与发色(主色 + 光泽倾向)。
  • 左格(头肩特写)须额外注明:正面直视镜头(facing directly forward, neutral expression)、轻微柔光照明(soft frontal lighting, minimal shadow)以确保面部特征清晰可提取。
  • 禁止添加戏剧性光效(如强侧光、伦勃朗光)或夸张表情,避免干扰 Seedance 2.5 的面部一致性识别。

③ 服装与造型还原(Costume Reproduction)

  • 直接引用 resource_prepare_and_analyze 输出的 ② 体型比例 + ③ 服装与造型,逐层描述:上装 → 下装 → 鞋履 → 标志性配件。
  • 每项须包含颜色 + 款式 + 材质质感三要素;颜色使用英文色彩词(如 matte charcoal-grey / deep navy / off-white cream),避免中文颜色词混入。
  • 右格(全身像)须注明:standard neutral standing pose(双手自然垂落或微握拳),不添加动态姿势,确保全身服装无遮挡完整可见。

④ 风格与渲染参照(Style & Rendering Anchor)

  • 风格定位词(1 句):cinematic character design reference sheet, realistic proportions, clean studio lighting, sharp focus。
  • 不加入 PREVIS 火柴人风格词汇,角色参考图须为写实/半写实风格以服务 Seedance 2.5 的外观提取。
  • 若用户提供了三视图(ImageToImage 模式):在提示词末尾注明参考来源为三视图正面图,参考维度为 face + costume only,排除背景、姿势、光效参考。

⑤ 固定排除项(每条提示末尾必须附加)
no background elements, no props in hand, no dynamic pose, no motion blur, no text, no watermark, same character in both panels

场景概念图提示词(GPT Image 2 — TextToImage / ImageToImage)
场景图的核心功能是为跨板视频提供稳定的空间结构与色调锚点,提示词须确保输出可直接用作 Seedance 2.5 参考输入。按以下结构顺序书写:
① 空间构成(Spatial Composition)

  • 首句明确环境类型与拍摄视角:室内/室外、具体地点类型(如 industrial rooftop / narrow alley / concrete stairwell)、整体俯仰角(eye-level / high-angle establishing / low-angle looking up)。
  • 列出画面中必须出现的结构性锚点(最多 3 个),作为跨板复用时的视觉识别依据,例如:a rusted fire escape on the right edge, cracked asphalt ground, distant city skyline。
  • 明确前景/中景/背景的层次关系,指定各层的主要视觉元素,确保画面有足够的纵深供视频生成参考。
  • 禁止在场景图中出现任何可识别人物、角色轮廓或人形剪影;场景图仅用于空间与色调参考。

② 光源方向与质感(Lighting)

  • 指定主光源类型与位置:自然光(golden hour sidelight from left / overcast diffused top light)或人工光(single harsh overhead fluorescent / neon strip from below-right)。
  • 描述阴影方向与长度(short hard shadows cast to the right / long soft shadows stretching leftward)。
  • 指定次要光源或反射光(如有):填充光颜色、强度与方向(cool blue fill from the sky / warm amber bounce from ground)。
  • 锁定整体曝光倾向:high-key / mid-tone / low-key;对于动作场景,默认倾向 mid-tone 至 low-key 以增强对比与紧张感。

③ 风格基调(Visual Tone)

  • 色调基调描述:以主色相(dominant hue)+ 辅助色(accent)+ 整体饱和度倾向构成,例如:desaturated teal-grey base with orange accent points, low saturation。
  • 材质与纹理关键词(2–3 个):concrete / rust / wet asphalt / crumbling plaster / worn wood,与项目 PREVIS 视觉风格对齐。
  • 大气感描述(如有):light haze / rising dust particles / rain mist / dry heat shimmer;动作场景慎用强雾效,避免遮蔽空间结构。
  • 风格参照词(1 句):以电影/影像感风格词收尾,例如 cinematic location scout photograph, no people, sharp focus, production design reference。

④ 排除项(每条提示末尾必须附加)
no people, no characters, no silhouettes, no text, no watermark, no vignette, photorealistic environment only

视频提示词(MultiModalToVideo + Seedance 2.5(分辨率 480p))
核心原则:分镜图主导,提示词补漏
PREVIS 分镜图(<<<image_1>>>)通过运动矢量箭头、动势拖尾线、冲击标注、镜头信息栏等视觉元素已经编码了大量动作与镜头信息——这是 Seedance 2.5(分辨率 480p) 的首要参考源。提示词的唯一职责是补充分镜图无法编码的信息:速度质感词、角色因果关系、音效指令。
【强制减法原则】 凡是分镜图中已经清晰表达的内容,提示词中一律省略或只留 1–2 个关键词,不得展开描述:

  • 分镜图已有运动矢量箭头 → 提示词中对应肢体动作描述省略,仅保留速度质感词(如 explosive)
  • 分镜图已有镜头信息栏(如 MCU | PUSH | SNAP)→ 提示词中对应镜头运动描述简写为一句(如 medium close-up, push in),不展开
  • 分镜图已有冲击标注(IMPACT)→ 提示词中接触点描述省略,仅保留音效标注(<sharp impact crack>)
  • 分镜图已有角色标签和位置信息 → 提示词中对应空间调度描述省略
    违反此原则(即提示词与分镜图高度重复)会导致文字权重压制视觉参考,生成结果偏向文字而非分镜图意图。

参考输入绑定(按 Seedance 2.5 多模态输入规范):

  • <<<image_1>>> = PREVIS 分镜图(镜头调度与动作节拍蓝图,首要参考)
  • <<<image_2>>>, <<<image_3>>> … = 各角色三视图(每角色一张,用于外观还原,按出场顺序排列)
  • 若使用上一板视频参考:<<<video_1>>> = 上一板 final_shot(仅连续性极强时使用,默认省略)

提示词结构(运动栈顺序,严格按以下层级书写):
① 镜头运动(Camera Movement)

  • 简写原则: 分镜图镜头信息栏已标注的镜头运动,提示词中只写一句概括,不展开;提示词的补充价值在于速度质感词(分镜信息栏通常有 SNAP/SLOW,但 Seedance 2.5 对文字速度词更敏感)。
  • 格式:[起幅景别] → [运动方式] → [落幅景别],严格对应 PREVIS 分镜图的镜头调度标注。
  • 景别词汇锁定(与分镜标注保持一致):EXTREME WIDE / WIDE / MEDIUM / MEDIUM CLOSE-UP / CLOSE-UP / EXTREME CLOSE-UP。
  • 多镜头切换的板:按节拍顺序列出每段镜头运动,用"→ cut →"分隔,不使用时间码。
  • 示例:WIDE SHOT, swift push in → cut → EXTREME CLOSE-UP on fist impact, lock-off

② 角色动作(Character Action)

  • 减法优先: 分镜图中运动矢量箭头已明确的肢体动作,只写速度质感词,不重复描述具体肢体运动方向。只有分镜图无法传达的因果关系(如"被击中后重心后移""对冲互锁")才需展开描述。
  • 多节拍写法(简化版): 按 PREVIS 帧编号(F1→F8)顺序,每节拍只写【速度质感词 + 因果关系(如有)】,分镜图已清晰的肢体动作省略;节拍间用分号分隔。
    • ✅ 正确(分镜图已有箭头):F1: explosive; F2: recoils from impact, weight shifts back; F3: snapping
    • ❌ 错误(重复分镜已有信息):F1: right arm swings upward in a 120° arc at explosive speed, fist clenched, elbow leads
  • 多角色写法: 先描述主动作角色,后描述受击/反应角色;主从关系通过"in response / simultaneously / recoils"等词明确。
  • 速度质感词汇(统一使用以下标准词): explosive / snapping / fluid / heavy / weightless / sluggish;禁止使用 fast/slow 等模糊词。

③ 多角色场景专项规则(同一板内出现两名及以上角色时强制适用)
角色动作描述主从顺序:

  • 按"主动方 → 受击/反应方 → 次要旁观角色"顺序逐角色描述,每角色独立成句,角色间用"—"或换行分隔,禁止将两名角色的动作混写在同一句中。
  • 主动方定义:当前节拍中发起力量/位移输出的一方(攻击方、追逐方、推拉方);若节拍为双方同步对冲(如对打起手式),以画面视觉重心偏向(通常为画框中央偏近景的角色)为主动方。
  • 因果链接词规范:受击/反应方必须用明确因果词引出,选用以下之一:in response / simultaneously / recoils from / absorbs the impact / driven back by;禁止用 "and" 简单并列两名角色动作,避免主从关系模糊。
    画框空间分配:
  • 每名角色须用独立的画框位置词锁定其在构图中的占位,不得用相对词(如"他们站在一起")描述多人位置关系。
  • 两角色场景默认空间分配模板:主动方 frame left / center-left,受击方 frame right / center-right;若 PREVIS 分镜图显示相反布局,以分镜图为准并在提示词中明确注明。
  • 三角色及以上:按前景/中景/背景纵深分层分配,前景角色(最大景别)为主动方,中景为受击/反应方,背景为次要角色;各层须有明确的纵深距离感描述(如 pushed into the background, noticeably smaller in frame)。
  • 多角色同时运动时,每名角色的运动方向矢量须互相区分(如:A drives forward toward frame right; B retreats toward frame left),禁止模糊描述为"两人发生激烈冲突"。
    参考图绑定方式:
  • 多角色板的参考图输入须严格按角色一一绑定,绑定顺序固定:PREVIS 分镜图(<<<image_1>>>)→ 主动方三视图(<<<image_2>>>)→ 受击/反应方三视图(<<<image_3>>>)→ 次要角色三视图(<<<image_4>>> 依次递增)→ 场景图(最后一个 image 占位)。
  • 每张参考图绑定后,须在提示词的对应角色描述句首用括号注明其来源占位符,格式为 [ref:image_2] Character A: ...,确保 Seedance 2.5 能将参考图与提示词文本中的角色描述对应绑定,减少外观混淆风险。
  • 禁止将多名角色的三视图合并为单个 image 占位符输入;每名角色必须独立占用一个 image 槽位,以保证 Seedance 2.5 对每位角色的外观提取权重相互独立。

④ 空间调度(Spatial Blocking)

  • 描述角色在画框内的位置变化:frame left / frame right / center frame / foreground / background / off-screen。
  • 与场景元素(地面、障碍物、环境锚点)的空间关系需与 PREVIS 背景几何一致。
  • 若有角色出入画:明确入画/出画方向(enters from frame left / exits top frame)。

⑤ 音效与对白标注(仅在无独立旁白轨冲突时添加)
使用 Seedance 2.5(分辨率 480p) 官方语法,放在提示词末尾:

  • 动作音效(SFX):<sound of heavy footsteps on concrete>、<sharp impact crack>、<whooshing air burst>
  • 对白台词:{EN: "Get down!"}(语言代码前置)
  • 环境音:<ambient urban noise, distant siren> 用于补充场景氛围
  • 优先级: 动作冲击音效 > 环境氛围音 > 对白;三类同时出现时按此顺序在提示词末依次列出。

⑥ 节拍密度对应速度质感词(根据 Storyboard 标注自动选择,附加在②角色动作描述末尾)

  • 爆发板(高密度): 在角色动作描述层末尾追加:snapping cuts, explosive action rhythm, no slow motion, rapid kinetic energy
  • 过渡板(低密度): 在角色动作描述层末尾追加:deliberate pacing, building tension, smooth camera movement
  • 两类板均禁止使用 fast / slow 等模糊词代替上述标准速度质感词。

⑦ 固定否定项(每条提示末尾必须附加)
no subtitles, no text overlay, no wardrobe change, no style shift between cuts

  • no wardrobe change:确保角色服装与三视图全程一致。
  • no style shift between cuts:抑制 Seedance 2.5 在多节拍板内自动改变画面风格/色调的倾向。
6. 動画編集

板间拼接与节奏

  • 按 Storyboard shot 顺序拼接各板视频,默认使用硬切(无淡入淡出),保留动作冲击感。
  • 若相邻两板的 Storyboard 备注标明"连续性极强",可使用极短叠化(≤4帧)辅助衔接,避免跳切感。

一致性检查优先级(装配前必做)

  • 角色位置连续性: 逐一核查相邻两板衔接帧(前板末帧 vs 后板首帧)中每位角色的画框位置与朝向。若出现明显跳切(如角色从画框左侧瞬移至右侧、朝向无因果反转),在时间线对应切点处添加标记,暂停装配并提示用户选择:① 重新生成后板视频(在提示词中强制指定起始位置);② 接受跳切(适用于蒙太奇剪辑意图明确的情形)。
  • 场景视觉锚点一致性: 核查同一 element scene 在多板中背景主要视觉锚点(地平线高度、主光源方向、关键背景物体)是否稳定。若存在明显风格漂移或构图突变,同样标记并提示用户。
  • 角色外观漂移检测: 若相邻板中同一角色服装色系、发型或标志性配件出现视觉差异,在时间线备注中注明,提示用户评估是否需要以更强的三视图权重重新生成对应板。
  • 优先级顺序: 角色位置跳切 > 场景视觉锚点漂移 > 角色外观漂移;前者影响叙事连贯性,后两者影响视觉稳定性,分别处理,不混同。

音频处理

  • 若各板视频包含 Seedance 2.5(分辨率 480p) 生成的动作音效,默认保留;背景音乐轨(如有)跨板连续铺设,不随板间切点中断。
  • 无旁白轨时,动作音效轨音量适度提升以增强冲击感。

导出设置

  • 导出分辨率跟随 Final_Video_Spec.md 的全局设定(默认 480p),画面比例默认 16:9。