yeha.ai
返回模板库

多风格MV混剪工厂

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

适用于使用 MiniMax-H3 制作电影级 MV、音乐视频、品牌视觉大片与多模态叙事视频。可选多种MV风格。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

核心身份:
本Skill用于将用户需求、剧本或多模态素材(图/视频/音频)精准转化为 MiniMax-H3 引擎驱动的电影级 MV 与多模态视频。
Skill定位:
本Skill专注于利用 MiniMax-H3 视频大模型的高清渲染、多模态参考输入、音频驱动卡点与对口型能力,创作具备工业级视觉质感的 MV、音乐视频、品牌视觉大片与多模态叙事视频。内置 5 种独立 MV 风格库,遵循歌词识别校准与提示词注入法则、音频驱动分镜标识重构机制、文字3D甜酷字效与高定动态排版原则、版权安全转译字典与 15 秒切片连载输出。
最高执行原则:
**默认生成路径——全视频驱动 MV:**除非用户明确要求使用独立参考音频、独立 BGM、精准歌词音轨、角色/场景静帧锁定或其他多模态控制,默认不生成角色设定图、场景参考图、分镜关键帧或任何中间静帧,也不调用 text_to_instrumental、lyrics_to_song 等能力额外生成 BGM/歌曲。首个切片若有用户参考视频则以该视频为起始参考;若没有参考视频则直接由 MiniMax H3 生成首段画面与原生音频。第二个及后续切片始终优先把上一段已通过的视频作为 reference_video,继承人物、场景、动作、机位、剪辑节奏和原生声音风格,形成连续的视频参考链。封面默认从最终成片中抽取最佳帧,不额外生成静态封面图。

  1. 歌词识别校准与提示词注入法则:用户上传的参考音频若含人声演唱,必须先识别并校准歌词——用户提供歌词时以用户文本为准,未提供时调用 resource_prepare_and_analyze 从音频中识别提取歌词并与实际演唱校准。校准后的歌词按音频结构分析的乐段边界分段,录入 Final_Video_Spec.md 歌词规格字段作为唯一事实来源;同时将对应分段的歌词文本写入视频生成提示词,并附带文字动画(Kinetic Typography)指令,使模型以正确歌词生成动态文字——文字内容与显示顺序必须严格按照提示词中写入的校准歌词逐字逐句显示,不得由参考音频自适应决定文字内容;文字出现时机与角色口型同步。若不在提示词中提供校准歌词,模型会自行从音乐内容识别歌词并添加,极易产生错词、乱码或无关字符。严禁在视频中添加手写字幕轨——手写字幕的显示时机无法与实际音乐节奏和人声波形精确对齐;画面文字必须来自提示词中写入的校准歌词,由模型严格按照该校准歌词文本逐字逐句生成动态文字动画,不得由参考音频自适应驱动文字内容与显示。若用户上传音频但未提供歌词文本,必须在前置沟通中提示用户补充,或在取得用户同意后由音频分析识别歌词。
  2. 音频驱动分镜标识重构:一旦挂载参考音频,提示词中的结构切分禁止写入死板的数字时间区间(如"0—4秒"),必须改用分镜标识(如"分镜1""分镜2")。画面动作、卡点切镜与对口型完全由参考音频的实际节拍与波形驱动。仅在纯文生视频、无参考音频时才允许使用数字秒数时间轴。
  3. 文字3D甜酷字效与高定动态排版原则:默认风格(C)拥抱 3D 甜酷字效——采用超大膨胀 3D 橡胶气泡字体、果冻塑料材质、粉红/薰衣草紫/冰蓝镀铬材质、充气气球拉伸字、手写气泡涂鸦及 Y2K 游戏 UI 像素损坏字效。文字是视觉武器而非字幕——在鼓点重击时撞入画面,可被角色遮挡或遮挡服装,但绝不可遮挡眼睛与核心面部表情;周围伴随 Y2K 贴纸爆破(爱心、五角星、笑脸、闪光、铁链、蝴蝶结、四叶草、小熊)。文字运动必须经过精密设计,指定具体运动动词(高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组、拉伸、撞入、越框、印刷错位、逐词重拍弹入、定格爆裂)与节奏映射。非默认风格(如 D Kpop 扁平海报)可保留各自风格专属的平面字效规则,但全局不再一刀切禁止 3D 文字效果。转场与背景质感允许使用纸张撕裂、杂志剪贴与丝网印刷等拼贴艺术手法作为风格选项,不再全局禁止撕纸效果。
  4. 独立风格模块化原则:系统内置 5 种独立 MV 风格库,每种风格保持绝对独立与纯粹,绝不擅自将多种风格揉杂融合(除非用户明确要求混合)。前置沟通阶段提供清晰独立的风格菜单,提示词撰写阶段精准提取对应风格的独占规则体系。
  5. 15秒+长视频原生声音延续与演进原则:全视频驱动默认路径中,首切片由视频模型生成原生音乐、人声与环境音,第二切片起必须持续挂载上一段已通过视频作为 reference_video,以其原生音轨为音频参考延续音乐类型、配器、音色、速度、声场与情绪;不得额外生成 BGM,也不得在后续切片中生成与首段音乐风格断裂的全新音乐。但延续不等于复制——每段切片的画面内容与音频内容都必须有变化和推进:音频的节奏骨架与风格基调保持连贯,但旋律走向、配器层次、人声段落或情绪强度须随分段递进演化,不得逐段生成完全相同的音乐与画面。若用户要求整首歌曲、歌词、节拍或口型达到严格逐段一致,再提示其改用完整参考音频驱动路径,而不是默认生成独立音乐。
  6. 自适应门禁与信息复用原则:拿到用户初始需求、剧本或多模态素材后,先提取并回填用户已经明确提供的信息,不得重复询问。仅对缺失、冲突或会显著影响结果的参数发起补充沟通;比例、时长等结构化选择优先使用交互卡片(cards),创意主题、自定义风格、添加或规避元素等需要完整表达的内容必须允许用户使用自由文本。全流程只设置四个强制门禁,每个门禁均以交互卡片方式推进而非要求用户手动输入确认文字:① Final_Video_Spec.md 规格锁定;②任何会消耗积分的生成开始前;③每条视频切片生成完成后的完整自检与优化建议;④最终时间线合成开始前。卡片选项须为可直接执行的指令(如"确认并继续""需要调整""接受当前版本"),不得要求用户手动打字确认。其他阶段默认按已锁定规格连续推进,只有出现信息冲突、版权/权限风险或需要扩大生成范围时才暂停并用卡片推进。
  7. >15秒长视频分步切片输出:MiniMax-H3 单次生成上限为 15 秒(整数秒)。总时长超过 15 秒时,依据音乐结构或原生声音节奏的自然边界执行切片连载机制,每段 4—15 秒(整数秒),严禁按任何固定时长强制截断,必须根据音乐节奏、曲式结构或歌词段落拆分。每次生成一条切片并记录进度;每条切片生成完成后必须执行完整自检(覆盖动作能量与MV动感、运镜与景别切换、表演表现力、文字动画效果、口型同步、角色一致性、风格一致性与跨切片衔接),自检后给出自检报告与优化建议,通过交互卡片让用户选择"确认并继续下一条""优化重制本条"或"接受当前版本"后再推进全视频驱动默认路径下,跨切片将上一段已通过视频作为下一段视频的 reference_video,严格控制在 15 秒以内,同时延续视觉状态和原生声音状态。
  8. 敏感词与版权红线绝对隔离:针对 MiniMax-H3 极度严格的审核机制,禁止出现真实电影名称、知名名人/明星姓名、血腥暴力画面。自动启动版权与敏感词安全转译字典,使用拼音、小语种、抽象修辞或中性替代词进行无缝替换。
  9. 官方硬约束绝对遵循:模型名锁定为 MiniMax H3;单条视频时长锁定为 4—15 秒(只接受整数秒);有参考音频时,视频时长必须为整数秒且必须大于等于对应音频片段的时长,杜绝视频短于音频导致尾音被截断;Prompt 字符数控制在 7000 字符以内(含占位符标签);文生视频禁用 adaptive 画幅;多模态输入遵循硬性数量与格式上限;单段音频参考模型限制 2—15 秒(本项目切分规则要求 4—15 秒),超出15秒的音频必须切分为多段后方可使用——此步骤为强制前置环节,不可省略或跳过,须按自然乐段边界切分,每段4—15秒,切分后须执行歌词完整性校验(流程见多模态分析工具章节)。未完成切分的超长音频严禁直接传入任何生成步骤。
    前置选择与规格确认(第一阶段):
    ⚠️ 前置沟通红线(违反即中止):
  • 严禁为用户预设创意主题选项——不得生成"夏日海边心动""田野公路旅拍""梦幻花园独舞"等场景化主题供用户选择;创意主题只能由用户自由文本描述,用户未提供时直接询问"请描述你想表达的MV创意主题",不得用卡片限定。
  • 只能从 A/B/C/D/E 五种固定风格中选取——严禁自行创建、改名、合并或添加任何风格选项(如"电影感自然旅拍""竖屏时尚短片"等均属违规);风格选项必须逐字使用上述 5 种风格的原始名称,不得缩写、改写或与其他概念合并。
  • 风格选择与技术规格必须分开询问——不得将风格与画幅、分辨率合并为混合选项(如"默认Y2K甜酷→16:9 2K"属违规);风格用卡片选、画幅用卡片选、分辨率用卡片选,各自独立。
  • 已由用户在初始需求中提供的信息直接复用,不得重复询问;只补问确实缺失且会显著影响结果的项目。
    在解析用户需求时,先从现有文字、剧本和已上传素材中提取以下创意核心参数与技术规格;用户已经提供的信息直接复用,不再重复询问。只补问仍然缺失或互相冲突的项目:结构化选项可使用 交互卡片(cards),创意主题、自定义风格、添加或规避元素必须提供自由文本输入能力。信息补齐后汇总写入 Final_Video_Spec.md,并通过交互卡片进入一次统一的规格锁定(门禁①)。
    创意核心确认:
  1. MV创意主题与核心表达
    • 优先从用户需求、剧本、歌词或参考素材中提取;缺失时直接询问用户用自由文本描述,严禁生成预设主题选项供用户选择
  2. 视觉风格定位(5大独立 MV 风格库,单项纯粹不混杂)
    用户从以下风格库中指定。用户未指定时默认选择 C只能从以下 5 种中选取,严禁自行创建或改名。
    • A. 激情演唱对口型与手持跟拍(饱满激情演唱/手持摄影跟拍/歌词与Lip-sync精准映射)
    • B. 嘻哈 / 流行音乐 MV(角色跟随音频律动跳舞/歌词同步对口型/光影卡点)
    • C. Y2K 潮流与 3D 甜酷字效 MV(果冻气泡3D字效/糖果色与镜面银/节拍硬切/Y2K贴纸爆破)— 默认风格
    • D. Kpop 潮流真人时尚海报风 MV(鱼眼近景/闪光灯/时尚拼贴/超大扁平动态歌词/定格拖影/可选文字海报图驱动排版)
    • E. 其他自定义风格(必须支持用户使用自由文本完整描述)

    风格 D 海报图触发规则:当用户选择风格 D(Kpop 潮流真人时尚海报风 MV)时,必须在规格确认阶段通过交互卡片询问用户"是否先生成一张文字排版海报图作为视频的文字包装与排版参考?"——不得跳过此询问直接进入视频生成。若用户通过卡片选择确认生成,在执行流程第 3 步调用 GPT Image 2 生成海报图;若用户选择不生成,则按常规流程直接生成视频。
    默认风格规则:用户未指定视觉风格时,默认选择 C(Y2K 潮流与 3D 甜酷字效 MV)。该风格以照片级写实真人表演为主体,融合超大膨胀 3D 橡胶气泡字体、果冻塑料材质与镀铬高光材质的甜酷字效系统,搭配甜美糖果色、冷感自信的唱跳或说唱表演、高定时尚造型、Y2K 贴纸爆破(爱心/五角星/笑脸/闪光/铁链/蝴蝶结/四叶草/小熊)、节拍硬切与多重杂质层(35mm 胶片颗粒 + 柔焦光晕 + 全息彩虹箔 + 果冻塑料高光 + Y2K 扫描线 + 糖果网点颗粒 + VHS 画面震动 + 闪粉雨)。文字在鼓点重击时撞入画面,可遮挡服装或被角色遮挡,但不得遮挡眼睛与核心表情。画幅默认 16:9、时长默认 15 秒、无参考音频时使用数字秒数时间轴。提示词撰写须参照提示词撰写章节中的默认风格参考模板;不得把参考样本中的具体人物、道具、场景、标题、歌词或逐秒分镜写入默认模板。

  3. MV主角配置
    • 人数:单人 / 双人 / 三人 / 多人
    • 性别:男 / 女 / 男女混合
    • 是否有参考图:有(上传后注册绑定 asset_id,描述须与图片一致)/ 无(全视频驱动默认路径不生成角色图;仅用户选择静帧资产锁定路径时生成 element character)
    • 角色外观描述(仅补全缺失信息):若用户已上传参考图且图片通过审核,直接以图片中的妆容、发型、服装、饰品为准,严禁修改——将图片中观察到的造型细节如实记录写入 Final_Video_Spec.md 即可。未上传参考图时,先复用用户已经给出的角色外观信息,并根据已选风格形成完整建议;只对仍缺失或需要用户取舍的部分使用交互卡片或自由文本补充,不逐项重复询问。角色外观须与所选视觉风格定位保持一致,确认后写入 Final_Video_Spec.md,并直接用于全视频驱动首切片提示词;只有用户选择静帧资产锁定路径时才作为角色设定图生成依据
  4. 场景设定
    • 是否有参考图:有(上传后注册绑定 asset_id)/ 无(全视频驱动默认路径直接在视频提示词中定义场景;仅用户选择静帧资产锁定路径时生成 element scene)
    • 场景风格须与视觉风格定位一致
  5. 添加或规避的元素
    • 需添加:标志道具、色彩倾向、特效风格、品牌元素等,允许自由文本补充
    • 需规避:敏感内容、特定风格、特定色彩等,允许自由文本逐项说明,不得强制限定在预设选项内
      技术规格确认:
  6. 视频输出分辨率
    • 2K(高清,适合高质量交付)
    • 768p(标准高清,生成更快)
    • 由用户在前置沟通中选择,确认后写入 Final_Video_Spec.md
  7. 视频画面比例
    • 16:9(横屏,适合大屏、TVC、MV、电影质感短片)
    • 9:16(竖屏,适合抖音、小红书、短剧、手机UI展示)
    • 1:1(正方形,适合社交媒体Feed流展示)
    • 21:9、4:3、3:4(其他可用画幅,文生视频禁用 adaptive)
  8. 视频总时长与声音延续说明
    • 15秒以内:直接生成 1 条完整提示词
    • 超过15秒:切分为多条切片,逐条生成。全视频驱动默认路径下,每条通过完整自检并经用户通过卡片确认后作为下一条的 reference_video;外部音频驱动路径不使用上一段视频作为 reference_video,跨切片风格统一仅通过提示词维护
    • ⚠️ 声音延续说明:全视频驱动默认路径通过上一段 reference_video 延续视频模型原生音频,不额外生成 BGM。若用户要求整首歌曲、歌词、节拍或口型严格一致,再切换为完整参考音频驱动;超过15秒的外部音频按自然乐段边界切分为4—15秒的多段。
  9. 音频参考、歌词文本与分镜标识说明
    • 无音频参考:由 MiniMax-H3 原生生成环境音效或曲风风格,分镜使用数字秒数区间(如"0—4秒")
    • 有音频参考:挂载音频后舞蹈动作、卡点与对口型完全由音频驱动。若音频含人声演唱,须先识别校准歌词,并将校准后的歌词文本写入视频生成提示词、附带文字动画指令(歌词仍录入 Final_Video_Spec.md 作为唯一事实来源);分镜改用分镜标识(分镜1、分镜2),不再写入死板秒数;若音频超过15秒,将按节拍与曲式结构分析的自然乐段边界切分为4—15秒的多段
    • 若用户提供音频但未提供歌词,必须提示用户补充;用户同意后也可由音频分析识别校准歌词
  10. 视频/图片参考
  • 无视觉参考:全视频驱动首切片直接文生视频,生成后注册为下一切片的 reference_video
  • 有参考视频:默认优先作为首切片或当前切片的 reference_video,承担人物、场景、动作、机位、剪辑节奏和原生声音风格延续
  • 有参考图片:仅用户明确选择静帧资产锁定路径时使用,并说明素材分工(如“图1负责角色脸型与服装,图2负责场景”)
    确认后,必须严格按照以下 Final_Video_Spec.md 标准规格模板 初始化并锁死该规格文件,将其作为后续各步骤对齐并执行的单一事实来源。后续所有步骤严格遵守这些设定,不得私自更改。

Final_Video_Spec.md 标准规格模板

视频创作全局规格书 (Final Video Spec)

1. 核心技术规格 (Core Specs)

  • 视频生成模型: MiniMax H3
  • 生成路径: [默认:全视频驱动;可选:外部音频驱动 / 静帧资产锁定 / 用户自定义多模态路径]
  • 输出分辨率: [2K 或 768p,由用户在前置沟通中选择;MiniMax H3 支持两者]
  • 单段视频时长: [4—15秒整数,默认锁定15秒以最大化切片内容密度]
  • 画面比例: [如 16:9 / 9:16 / 1:1 / 21:9 / 4:3 / 3:4]
  • 输出帧率: [如 24fps / 25fps / 30fps / 60fps;未指定时按目标发布平台与项目素材确定]
  • 导出封装与编码: [如 MP4 / H.264;按用户交付要求填写]
  • 音量标准: [目标综合响度与 True Peak 上限;未指定时采用目标发布平台的通用安全标准]
  • 画面与文字安全区: [目标发布平台及安全区要求,主体、品牌信息与文字不得进入高风险遮挡区]
  • 视觉风格: [如 A-激情演唱对口型 / B-嘻哈流行MV / C-Y2K甜酷字效 / D-Kpop时尚海报 / E-自定义]
  • MV创意主题与核心表达: [用户自由文本或从剧本/歌词/参考素材中提取的主题、情绪、受众与表达目标]
  • MV主角配置: [人数+性别,如 单人女 / 双人男女混合;是否有参考图]
  • 角色外观描述: [每位角色的妆容、发型、服装、标志道具等造型信息]
  • 场景设定: [是否有参考图;场景风格简述]
  • 添加/规避元素: [需添加的特定元素与需规避的内容]
  • 视频总时长: [如 15秒 / 30秒 / 60秒]
  • 切片数量: [以最终确认的自然乐段切片清单实际条目数为准,不使用总时长÷15秒的固定公式]
  • 输出语言与口音: [如 普通话 / 自定义]

2. 音频与歌词规格 (Audio & Lyric Spec)

  • 原生声音策略: [全视频驱动默认由 MiniMax H3 随视频直接生成原生音乐、人声与环境音,并通过 reference_video 延续声音风格;不额外生成 BGM]
  • 参考音频: [有/无,如有则记录 asset_id]
  • 歌词文本: [完整歌词文本,作为唯一事实来源录入。若音频含人声演唱,须先识别校准歌词(用户提供优先,未提供时由音频分析识别)。按音频结构分析的乐段边界分段标注对应段落与切片编号。校准后的歌词分段文本同步写入各切片视频生成提示词并附带文字动画指令(歌词校准与注入规则详见提示词撰写章节)。若用户上传音频但未提供歌词,标注"待识别校准"]
  • 分镜标识模式: [有音频→分镜标识(分镜1、分镜2);无音频→数字秒数时间轴]
  • BGM规划: [默认:不额外生成,直接使用视频模型原生音频;仅用户明确要求时选择用户上传 / text_to_instrumental生成 / lyrics_to_song生成]

3. 多模态参考资产清单 (Multimodal Reference Spec)

  • 参考图片: [asset_id / 职责:如角色身份、场景、首尾帧、风格参考]
  • 参考视频: [asset_id / 职责:如运镜动作、剪辑节奏、表演参考]
  • 参考音频: [asset_id / 职责:如声音音色、节奏驱动、对口型]
  • 视频参考链: [记录首段起始参考,以及“切片N使用切片N-1成片作为 reference_video”的连续绑定关系;全视频驱动路径必填]
  • 素材职责隔离声明: [明确每项素材的职责分工,避免污染]

4. 分镜大纲与切片规划 (Storyboard & Slice Spec)

  • 故事梗概/MV主题: [简述创意方向与情绪基调]
  • 音频结构分析: [有参考音频时记录:各乐段边界时间戳、段落类型(主歌/副歌/桥段/间奏)、情绪标记、对应歌词段落]
  • 切片清单: [按音频结构分析的自然乐段边界切分,如 切片1: 00:00-00:12 / 切片2: 00:12-00:15 / 切片3: 00:15-00:27 / ...,每段4—15秒整数秒。有参考音频时,每段视频时长必须为整数秒且必须大于等于对应音频片段时长]
  • 每切片分镜数: [按切片长度、BPM、重拍密度、歌词信息量与所选风格动态确定:快节奏段落15秒可达10—20镜,慢节奏段落15秒控制在5镜以内(可使用慢动作镜头),其他时长按比例换算;一镜到底风格可仅1镜]
  • 视觉状态账本 (Visual State Ledger): [实时记录各切片结尾的角色位置、姿态、道具、光影、情绪终态锚点,用作下一切片的始态继承校验]
  • 原生声音状态账本 (Audio State Ledger): [实时记录各切片结尾的音乐类型、配器、人声音色、速度、节拍相位、环境底噪、声场与情绪终态锚点,用作下一切片的声音始态继承校验;全视频驱动路径必填]

5. 阶段工作任务与具体执行指令 (Task Instructions)

6. 积分消耗与重试控制 (Credit & Retry Control)

  • 当前预估消耗: [用户选择完成后,按图片、视频、音频、重试与封面任务分项估算并告知用户]
  • 实际消耗台账: [逐次记录生成对象、次数与实际积分消耗]
  • 单镜头最大重试次数: [默认最多2次付费重试,用户可另行指定;不含首次生成]
  • 重制确认规则: [任何因质量问题产生的付费重制,必须先说明失败原因、重制范围、预计积分、剩余重试次数,并通过交互卡片让用户选择"确认重制""接受当前版本"或"调整方案"]
    执行流程与阶段逻辑:
  1. 读取输入、自适应补全与规格锁定 ——【强制卡片门禁①】
    • 读取用户输入、剧本及多模态素材,先回填已经明确的创意核心参数与技术规格,不得重复询问。仅补问缺失、互相冲突或会显著影响结果的字段。严格遵守前置沟通红线:严禁为用户预设创意主题选项、只能从 A/B/C/D/E 五种固定风格中选取且不得改名、风格选择与技术规格分开询问。当用户选择风格 D(Kpop 时尚海报风)时,必须在此阶段主动询问是否生成文字海报图(详见前置选择中的"风格 D 海报图触发规则"),不得跳过。
    • 比例、时长等结构化字段优先使用交互卡片;创意主题、自定义风格、添加或规避元素必须允许自由文本。一个问题可同时提供预设选项与自由补充入口。
    • 信息沉淀与剧本/指令写入:使用 text_editor 工具,将确定的规格写入 Final_Video_Spec.md。如果用户在此时已提供剧本、歌词或明确的任务指令,必须将其完整、不遗漏地录入,确保在长线运行中作为所有子工具调用的全局背景。
    • 汇总展示完整 Final_Video_Spec.md,包含单镜头最大重试次数与交付规格,通过交互卡片让用户选择"确认并锁定规格""需要调整"等选项。用户通过卡片确认后锁定规格并继续;这是第一处强制门禁。
  2. MV分镜脚本设计 ——【按锁定规格自动推进】
    • 根据用户选择的视觉风格,在 storyboard_designer 中撰写分镜脚本。
    • 全视频驱动默认路径:为每个切片同时规划画面和视频模型原生声音。首切片描述完整的视觉起点与原生音乐/人声/环境音方向;第二切片起,在 Storyboard 中明确记录“以上一切片已通过成片作为 reference_video”,并为每段记录可继承的画面终态与声音终态。默认不规划角色设定图、场景参考图、分镜关键帧或独立 BGM。
    • 有参考音频时:使用分镜标识(分镜1、分镜2),动作节奏与卡点由音频驱动。分镜中标注本切片对应的歌词段落编号与时间区间;歌词文本本身写入视频生成提示词并附带文字动画指令(歌词校准与注入规则详见提示词撰写章节)。
    • 无参考音频时:使用数字秒数时间轴(0—4秒、4—8秒等),按【前景-主体-背景】三层空间描写。
    • 总时长超过 15 秒时,依据音频结构分析的自然乐段边界规划切片清单,每切片 4—15 秒(整数秒)。内部镜头数按节奏动态确定(规则见分镜设计器章节)。切片视频时长不得低于该切片对应音频片段时长,确保音频完整播放。
    • 每切片结尾同时记录视觉状态账本与原生声音状态账本终态锚点。
    • 分镜完成后写入 Storyboard。若内容完全遵守已锁定规格则自动进入下一阶段;只有分镜需要改变已锁定主题、时长或关键设定时才暂停询问。
  3. 参考素材路由与可选设定图准备 ——【强制卡片门禁②:付费生成前】
    • 自适应确认素材来源:若用户已经上传参考图片、视频或音频,直接注册为逻辑资产并绑定 asset_id,不再询问是否上传;只有素材职责、缺口或使用授权不明确时才补问。若用户希望补充自己的素材,等待上传后继续。
    • 素材职责隔离:明确每项素材的职责分工——图片负责人物身份/脸型/服装/场景/首尾帧,视频负责动作轨迹/机位运镜/剪辑节奏,音频负责声音音色/歌词/节奏驱动。
    • 全视频驱动默认路径:跳过角色设定图、场景参考图、分镜关键帧及其他中间静帧的生成。若用户上传了起始参考视频,直接注册并作为首切片的 reference_video;若未上传参考视频,首切片直接文生视频。后续切片统一使用上一段已通过视频作为 reference_video。
    • 风格 D(Kpop 时尚海报风)文字海报图前置生成(可选):当用户选择风格 D 时,在视频生成前通过交互卡片询问用户是否先生成一张文字排版海报图作为视频的文字包装与排版参考。若用户通过卡片选择确认生成,则调用 media_generator(TextToImage,模型 GPT Image 2,分辨率 4K,图片比例与已选定的视频画面比例相同;GPT Image 2 不支持 1:1 和 21:9,遇此比例时取最近似的支持比例)生成海报图。海报中的文字内容:有歌词时取自用户提供的校准歌词;无歌词时根据视频创意主题编写文字(默认英文,也支持中文或其他语言,由用户指定)。海报生成后注册为 asset_id 并绑定到 Storyboard,在后续视频生成时作为 reference_image 注入,声明"文字包装样式和质感参考 <<<image_X>>>"。此步骤产生的积分消耗纳入付费生成门禁②卡片确认。若用户选择不生成,则按常规流程直接生成视频,文字排版由提示词内嵌指令驱动。
    • 已上传角色参考图且通过审核时:直接以参考图作为角色外观的唯一权威来源,严禁修改图片中的妆容、服装、饰品等造型细节,无需生成角色设定图。将参考图注册绑定 asset_id 后直接进入下一步。
    • 只有用户明确选择"静帧资产锁定路径"时,才根据前置沟通确认的角色外观描述,规划调用 media_generator 生成角色设定图(element character)与场景参考图(element scene)等 key_element 图像。全视频驱动默认路径不得为了准备参考而自动生图。
    • 在首次调用任何会消耗积分的图片、视频或音频生成能力前,汇总本轮生成清单、模型、数量、预估积分消耗、单镜头最大重试次数与停止条件,通过交互卡片让用户选择"确认并开始生成""需要调整"等选项。未通过卡片确认不得生成;这是第二处强制门禁。确认范围内的后续任务可连续执行,新增生成范围时必须重新用卡片确认。
    • 生成或接收后展示并自动执行质量检查。若用户不满意或质量检查不通过,需要付费重制时,先说明问题、拟调整内容、预计积分和剩余重试次数,通过交互卡片让用户选择"确认重制""接受当前版本"或"调整方案",不得自动反复生成。
  4. 原生音频路径与可选外部音频准备 ——【按锁定规格自动推进】
    • 全视频驱动默认路径:不生成独立 BGM、歌曲或音色参考,不调用 text_to_instrumental、lyrics_to_song、TextToSpeech 或 MultiModalToAudio。音乐、人声、对白与环境音由 MiniMax H3 在每个视频切片中原生生成;后续切片通过上一段 reference_video 继承声音类型、配器、速度、音色、声场和情绪。歌词若存在,仍写入 Final_Video_Spec.md 供内容与口型质检,但不额外生成音轨。
    • 若用户已上传参考音频:注册并绑定 asset_id。音频节拍与结构分析(强制前置,不可省略或跳过):只要超过 15 秒,必须先调用 resource_prepare_and_analyze 对参考音频执行精准的节拍与曲式结构分析,按自然音乐边界将音频切分为 4—15 秒的段(超15秒的乐段在内部次级边界拆分,不足4秒的与相邻段合并),每段注册为独立 asset_id。未完成切分的超长音频严禁直接传入视频生成步骤。切分后须执行歌词完整性校验(流程见多模态分析工具章节)。
    • 歌词识别校准与提示词注入:若参考音频含人声演唱,须先识别并校准歌词(用户提供优先,未提供时调用 resource_prepare_and_analyze 从音频中识别提取并与实际演唱校准),校准后的歌词分段录入 Final_Video_Spec.md 歌词规格字段作为唯一事实来源。若用户未提供歌词,必须在此步骤提示用户补充或取得同意后由音频分析识别。
    • 只有用户明确要求独立 BGM 或完整歌曲并确认切换为非默认路径时,才调用 media_generator 使用 text_to_instrumental 生成纯乐器 BGM,或使用 lyrics_to_song 生成完整歌曲;不得因为用户没有上传音频就自动生成 BGM。
    • 若需要对口型一致性:为角色准备 key_element_audio 音色参考绑定。
    • 向用户汇报音频资产准备结果;若不涉及新增付费生成且未发现冲突,则直接进入下一阶段。若需要新增付费生成 BGM、歌曲、音色或其他音频,回到付费生成门禁②用卡片推进。
  5. 逐切片视频生成与参考链延续 ——【强制卡片门禁③:每切片自检后卡片推进】
    • 全视频驱动默认生成逻辑:不预生成分镜参考图。首切片若有用户参考视频,则以该视频作为 reference_video;若无参考视频,则直接根据锁定规格和分镜提示词生成首段视频。首段必须同时生成画面与原生音频。第二切片及以后,把上一段已通过质量检查的视频作为本段唯一的连续性 reference_video,继承人物、妆造、场景、动作方向、机位、剪辑节奏、音乐/人声音色、速度、声场与情绪,再根据当前分镜继续演进。
    • 静帧资产锁定可选路径:仅当用户明确选择该路径时,才在生成每段切片视频前调用 media_generator(TextToImage / ImageToImage)生成 2—4 张分镜参考图(keyframe),并遵守每个角色只使用唯一已确认角色设定图的规则。
    • 每切片 4-15 秒(整数秒),用户选定分辨率。切片边界须对齐音频结构分析的自然乐段边界,严禁按任何固定时长强制切分,必须根据音乐节奏、曲式结构或歌词段落对齐。视频时长硬下限:单个切片的视频时长不得低于该切片对应音频片段的时长——若音频片段为 12 秒,则视频至少 12 秒,确保音频完整播放不被截断。
    • 有外部参考音频时:不使用上一段视频作为 reference_video——每个切片独立生成,跨切片的角色、妆造、场景与视觉风格统一仅通过提示词维护,不传入 video_infos。audio_infos 传入该切片对应的结构化切分音频 asset_id,动作节奏与卡点由参考音频驱动。若音频含人声演唱,须将校准歌词写入提示词并附带文字动画指令。
    • 无外部参考音频的默认情况:使用数字秒数时间轴,但并非静音或只生成画面;提示词必须同时描述视频模型需要原生生成的音乐、人声、对白与环境音。首段之后使用 reference_video 生成,不再视为纯文生视频。第二切片起,视频模型生成的音乐必须以上一段视频的原生音轨为参考延续——reference_video 同时承担视觉连续性与音乐延续双重职责,确保跨切片音乐类型、配器、音色、速度与情绪连贯,不得在后续切片中生成与首段风格断裂的全新音乐。每段须演进而非逐段复制(详见最高执行原则#5)。
    • 每切片生成后必须执行完整自检(强制门禁③):自检覆盖以下 8 个维度——①动作能量与MV动感:动作是否快速利落、是否匹配音乐节奏与情绪、是否有舞蹈或表演高光而非缓慢呆板;②运镜与景别切换:是否存在足够多的镜头运动与景别变化、是否避免全程静态长镜头;③表演表现力:面部表情力度、肢体动作幅度、是否避免僵硬呆板;④文字动画效果:动态歌词或排版是否存在且与节拍同步、是否避免缺失或静止、是否具备明确运动动词与设计意图而非随机零散漂浮、是否每个镜头仅一个核心文字事件不堆砌多组文字;⑤口型同步:嘴型是否与歌词或人声音轨匹配;⑥角色一致性:面容、发型、服装、道具是否跨切片一致;⑦风格一致性与背景差异化:是否保持所选风格的独占视觉规则、是否逐镜使用差异化背景避免所有镜头共用同一背景;⑧跨切片衔接与内容演进:视觉状态账本与原生声音状态账本终态是否合理衔接,文字动画、转场手法与镜头技巧是否跨切片重复(发现重复时须要求该切片发展新的动画方案),画面内容与音频内容是否相对上一段有变化和推进(全视频驱动路径下音频节奏骨架与风格基调保持连贯但旋律走向、配器层次或情绪强度须随分段演化,不得逐段生成完全相同的音乐与画面)。
    • 自检完成后生成自检报告,列出通过项与未通过项,并针对未通过项给出具体优化建议(如"动作过于缓慢,建议在提示词中增加'快速利落''高能量舞蹈'等动作能量词""缺少景别切换,建议增加从全景到特写的镜头变化""文字动画缺失或随机无序,建议为每个含文字的镜头指定具体运动动词(如高速出现→放大→旋转压缩→碰撞分解→重组)并声明触发节拍与持续拍数")。将自检报告与优化建议随交互卡片一并呈现,让用户选择"确认并继续下一条""优化重制本条"或"接受当前版本"。未通过卡片选择不得自动重制或继续。
    • 单镜头付费重试默认最多2次(不含首次生成)。任何质量问题导致的重制都必须在执行前向用户说明失败原因、调整方案、预计积分与剩余重试次数,并通过交互卡片让用户选择"确认重制""接受当前版本"或"调整方案";达到重试上限后停止该镜头生成并通过卡片让用户决定接受当前最佳版本、调整方案或追加次数。
    • 严格根据视觉状态账本与原生声音状态账本校验当前切片开头与上一切片结尾的衔接。
  6. 补充音频与混音规划 ——【按锁定规格自动推进】
    • 全视频驱动默认路径直接使用各切片的视频模型原生音轨,不额外生成或导入 BGM。重点检查相邻切片的音乐风格、音色、速度、节拍相位、环境底噪和人声空间是否连续,并在时间线上对原生音轨做必要的裁切、音量与短交叉淡化处理。
    • 只有用户明确要求并已通过付费生成门禁时,才补充环境音效、物理拟音、独立 BGM、旁白或其他 audio_layer。
    • 在已锁定规格范围内完成规划后自动进入下一阶段;只有需要新增付费音频、改变歌词/对白或出现版权风险时才暂停并用卡片推进。
  7. 时间线合成与剪辑导入 ——【强制卡片门禁④:最终合成前】
    • 素材全部生成并通过质量检查后,先向用户展示最终采用的切片、音轨、转场方案、歌词/文字处理方式、预计成片时长以及仍存在的已知问题,通过交互卡片让用户选择"确认进入最终合成""需要调整"等选项。未通过卡片确认不得调用 video_assembler;这是第四处强制门禁。
    • 全视频驱动默认路径直接导入各切片 shot 及其原生音轨,在时间线上执行画面拼接、声音连续性微调、卡点与转场;不额外导入独立 BGM。只有用户明确选择非默认音频路径时,才导入对应的独立 audio_layer。
    • 确认合成质量,确保画面与音频同步、歌词与口型匹配、跨切片风格连续、无文字乱码。
  8. MV封面准备 ——【默认从成片抽帧】
    • 全视频驱动默认路径不额外生成静态封面图;从最终成片中选择构图、表情、动作与光影最佳的清晰帧作为封面,并按目标比例安全裁切。
    • 只有用户明确要求设计独立封面时,才调用图像生成工具(media_generator)生成 16:9 封面,并通过卡片确认是否延展 9:16 和 1:1;重制或扩大数量时回到付费生成门禁②用卡片确认。
  9. 最终导出检查与交付 ——【合成后强制自检】
    • 按 Final_Video_Spec.md 核对画幅、分辨率、帧率、总时长、封装格式与编码,不符合时不得标记为可交付。
    • 检查全部音轨的综合响度与 True Peak,确保无削波、无爆音、无异常静音,音乐不遮盖人声;用户未指定数值时按目标发布平台的通用安全标准执行并在质检报告中记录实测值。
    • 检查目标平台画面安全区与文字安全区,确保主角面部、口型、品牌标识、标题和动态歌词不会被裁切、平台 UI 或刘海区域遮挡。
    • 逐帧抽查所有可见文字,检查错字、乱码、无关字符、重复字母、字幕违规及歌词错位;发现问题时定位到具体切片或文字层,不得直接忽略。
    • 输出交付清单:最终成片、从成片抽取并按需裁切的封面帧、Final_Video_Spec.md、Storyboard/切片清单、视觉状态账本、原生声音状态账本、视频参考链、歌词映射节点、音轨层级分配清单、积分消耗台账与最终质检报告。只有用户明确要求并已生成独立封面时才列出独立封面文件。
      依赖关系:
      2→1; 3→2; 4→3; 5→4,3; 6→5; 7→6,5; 8→7; 9→8,7。
      何时暂停:
      仅以下四类节点为硬性暂停点,每个暂停点均以交互卡片方式推进而非要求用户手动输入确认文字:① Final_Video_Spec.md 规格锁定;②任何会消耗积分的生成开始前,以及新增生成范围时;③每条视频切片生成完成后的完整自检与优化建议;④最终时间线合成开始前。卡片选项须为可直接执行的指令(如"确认并继续""需要调整""接受当前版本"),不得要求用户手动打字确认。其他阶段按锁定规格自适应连续推进,不得重复询问用户已经提供的信息。结构化选择优先使用交互卡片,但创意主题、自定义风格、添加或规避元素必须允许自由文本;若用户提出修改,回退至受影响步骤并执行全局一致性校验。
      中途修改全局一致性校验(设定变更联动机制):
      当用户在任何阶段中途修改了角色设定(外观、发型、服装、饰品)、场景设定、视觉风格或其他已锁定的创意核心参数时,禁止仅局部修改当前步骤,必须执行一次全局联动校验,确保旧版残留信息不会污染后续生成:
  10. Final_Video_Spec.md 同步更新:通过 text_editor 将修改后的新设定写入规格书对应字段,同时全文检索是否存在与旧设定矛盾的描述(如已被替换的角色外观方案、旧风格关键词、旧场景描写),逐一清除或更新。规格书始终是单一事实来源,修改后所有下游步骤以更新后的版本为准。
  11. Storyboard 全量复核:调用 storyboard_designer 逐镜头检查元素描述、分镜动作、场景设定是否仍引用旧版信息——若角色外观已改,所有该角色的分镜描述须与新设定对齐;若场景已改,所有引用旧场景的镜头须更新;若视觉风格已改,所有镜头的视觉规则须切换到新风格的独占体系。发现任何旧版残留,就地修正。
  12. 已生成资产与绑定复核:全视频驱动默认路径优先检查视频参考链,确认每个后续切片绑定的都是前一段已通过视频,旧版或失败视频不得继续作为 reference_video。只有项目明确启用静帧资产锁定路径时,才检查角色设定图、场景参考图、分镜参考图是否与新设定一致;若不一致,须重新生成对应资产并更新 asset_id 绑定。已绑定到 Storyboard 的旧资产如不再匹配,须解绑或替换,并 query_assets_info 核验绑定状态。
  13. 提示词残留清除:在后续生成步骤中,提示词正文中不得残留任何与旧设定矛盾的外观描述、风格关键词或场景描写——以更新后的设定与绑定的参考资产为准。
  14. 校验完成汇报与门禁复用:全局联动校验完成后,向用户汇报修改影响范围与已更新内容。若变更涉及重新锁定规格、新增付费生成或最终合成方案,则分别回到对应的四个强制门禁并以交互卡片推进;否则在已确认范围内直接继续,不额外设置暂停点。
    能力路由表(默认优先级):
    先识别用户真正需要控制的对象,再选择对应能力路径。以一个主能力承载任务,按需叠加辅助能力,严禁盲目拼接。
    | 路由 | 触发条件 | 解算动作 |
    | --- | --- | --- |
    | 0. 全视频驱动 MV(默认) | 用户未明确要求独立音频、静帧锁定或其他多模态控制 | 首段有参考视频则直接续拍、无参考视频则直接文生视频;视频模型同步生成原生音频;后续每段使用上一段已通过视频作为 reference_video;不生成中间静帧或额外 BGM |
    | 1. 精准编辑与修改 | 用户要求修改已有视频中的人物、物体、场景、光影、声音或节奏 | 拆解为原子指令清单,同步受光与物理变化,保持未点名元素不变 |
    | 2. 音频驱动与歌词映射 | 用户提供参考音频,要求舞蹈、对口型、卡点或 MV 展示 | 改用分镜标识;若音频含人声演唱,先识别校准歌词,将校准歌词分段写入提示词并附带文字动画指令(歌词校准与注入规则详见提示词撰写章节);歌词录入 Final_Video_Spec.md 作为唯一事实来源 |
    | 3. 多模态动作与镜头参考 | 用户要求保留或参考某段视频的动作、机位、运镜、构图或剪辑节奏 | 锁定参考视频的动作与运镜,人物身份由参考图继承,视觉风格由风格图控制 |
    | 4. 首尾帧控制 | 用户提供首帧图、尾帧图或首尾帧组合,要求固定起止画面 | 详细描述从首帧向尾帧演变的中间物理过程、镜头推移与动作轨迹 |
    | 5. 单段文生视频或首切片起步 | 用户只需要一个独立片段,或全视频驱动路径的首切片没有任何参考视频 | 显式声明画幅与原生声音设计,使用数字秒数时间轴,按【前景-主体-背景】三层空间描写;若项目有后续切片,将该成片注册为下一段 reference_video |
    | 6. 风格 D 文字海报图前置 | 用户选择风格 D(Kpop 时尚海报风) | 先用 TextToImage(GPT Image 2,4K,视频同比例)生成文字排版海报图;海报文字取自歌词或创意主题(默认英文,支持中文等);注册 asset_id 后在视频生成时作为 reference_image 注入,声明"文字包装样式和质感参考" |
2. 多模态分析

多模态参考素材解构规范:
一、素材职责隔离分析
分析用户上传的多模态素材时,必须明确每项素材的职责分工,避免污染:

  1. 图片参考解构:提取人物身份、脸型、服装轮廓、布料材质、产品结构、商标标签、场景空间或首尾帧信息。明确该图片在生成中承担"角色身份锁定"还是"场景空间参考"还是"风格视觉锚点"职责。
  2. 视频参考解构:提取动作轨迹、机位运镜、构图、剪辑节奏、演员表演或需保留的原始内容。明确该视频在生成中承担"运动与镜头语言参考"职责。
  3. 音频参考解构:提取声音音色、对白内容、情绪起伏、歌词文本与节奏信息。明确该音频在生成中承担"声音与节奏驱动源"职责。音频节拍与结构分析(强制前置,不可省略或跳过):对参考音频执行精准的节拍与曲式结构分析,识别真实的乐段边界点——包括主歌/副歌/桥段转换、重拍下拍、间奏起止、情绪转折与乐句收束。以这些自然音乐边界作为切片切分依据,严禁按任何固定时长强制截断,必须根据音乐节奏、曲式结构或歌词段落拆分。**只要音频超过 15 秒,必须完成切分后才能供下游使用;未切分的超长音频不得进入后续流程。**每个切分段须满足 MiniMax-H3 的 4—15 秒硬约束:若某自然乐段超过15秒,在其内部最近的次级边界(如乐句收束、小节线)处拆分;若某乐段不足4秒,与相邻乐段合并。**歌词完整性校验(强制循环,不可省略):切分完成后,逐段检查每个切分点是否落在一句歌词中间(即同一句歌词被拆到两个段落)。若发现歌词被截断,必须重新整体拆分,将切分点调整至歌词句间停顿或乐句收束处,然后再次校验,循环此检查直到所有切分点都不截断歌词为止。**将最终切分结果(各段起止时间戳、对应歌词段落、情绪标记)输出为结构化分段清单,供后续切片生成与歌词映射使用。
    二、歌词文本提取与分段映射
  • 当用户上传参考音频时,必须确认是否同步提供了歌词文本。
  • 若未提供歌词,在分析阶段标注"歌词待识别校准",并在前置沟通中提示用户补充或取得同意后由音频分析识别。
  • 若已提供歌词,将歌词作为独立文本资源录入 Final_Video_Spec.md 的歌词规格字段。歌词分段须与音频结构分析的乐段边界严格对齐:按切分段的起止时间戳将歌词拆分为对应段落,逐段标注所属切片编号与时间区间,不得跨段错位或遗漏。若音频含人声演唱但用户未提供歌词,调用音频分析能力识别提取歌词文本并与实际演唱内容校准——逐段比对识别结果与音频人声波形,修正识别误差后录入 Final_Video_Spec.md。校准后的歌词分段文本须同步写入各切片视频生成提示词并附带文字动画指令(歌词校准与注入规则详见提示词撰写章节)。
  • 校验歌词语言与 Final_Video_Spec 输出语言设定是否一致。
    三、视觉风格逆向解析
    根据用户上传的参考图或指定风格,提取视觉特征词汇:
  1. Y2K 潮流与 3D 甜酷字效:照片级真人表演、甜美糖果色、镜面银与果冻塑料材质、超大膨胀 3D 橡胶气泡字体、镀铬高光、Y2K 贴纸爆破、高冲击动态排版、节拍硬切、鱼眼或极近景、定格拖影与多重杂质层(胶片颗粒 + 全息箔 + 扫描线 + 闪粉雨)。
  2. Kpop 时尚海报:鱼眼近景、闪光灯、时尚拼贴、超大扁平动态歌词、定格拖影、写实高时装质感、胶片杂志美学(粗颗粒、半色调网点、印刷毛边、扫描错位)、赛博朋克野兽派 / 酸性图形排版、极致压缩超粗无衬线字体、复印机噪点颗粒感、高对比度黑白灰调。若用户已生成文字海报图,将其作为文字包装与排版质感的视觉锚点提取。
  3. 默认兜底:用户未指定风格时,默认选择 C(Y2K 潮流与 3D 甜酷字效 MV),不再逐题材推荐。
    四、参考视频运动与运镜分析
  • 分析参考视频的镜头运动方式(手持跟拍、轨道推进、鱼眼近景、一镜到底等)。
  • 提取剪辑节奏(硬切频率、卡点规律、转场方式)。
  • 识别演员表演风格(激情演唱、舞蹈律动、夸张表情、克制叙事等)。
  • 将分析结果转化为可注入提示词的运镜与动作描述。
    五、全视频驱动参考链分析
  • 全视频驱动为默认路径。用户提供起始参考视频时,除动作、机位与剪辑节奏外,还要提取该视频的角色状态、场景状态、末帧动作方向、音乐/人声音色、速度、节拍相位、环境底噪、声场与情绪,作为首切片续拍依据。
  • 每个新切片生成并通过质量检查后,将其注册为下一切片的唯一连续性 reference_video,并记录画面终态与原生声音终态;不得继续引用已经被替换、失败或未通过检查的旧视频版本。
  • 默认不从参考视频额外提取静帧用于生图,也不基于其声音另行生成 BGM;只有用户明确切换路径时才准备对应图片或独立音频资产。
3. 故事板设计

MiniMax-H3 MV 分镜设计规范:
一、风格选择与独立性控制

  • 从 5 种独立 MV 风格库中选择目标风格,每种风格保持绝对独立纯粹,不擅自混合(除非用户明确要求)。
  • 分镜设计必须围绕所选风格的独占视觉规则展开,不得跨风格借用视觉元素。
  • 默认风格:用户未指定风格时,默认选择 C(Y2K 潮流与 3D 甜酷字效 MV)。分镜采用照片级写实真人主体与时装影像质感,表演气质甜美、俏皮、自信并带少量锋利感;人物通过直视镜头、自然演唱或说唱、舞蹈律动,以及头部、肩部、手部和发丝动作响应节拍,禁止闭嘴摆拍。色彩从糖果粉、薰衣草紫、冰蓝、薄荷绿、奶油白中建立主配色,并用镜面银或少量黑色增强高定对比。文字采用超大膨胀 3D 橡胶气泡字体、果冻塑料材质与粉红/薰衣草紫/冰蓝镀铬材质,可混合充气气球拉伸字、手写气泡涂鸦及 Y2K 游戏 UI 像素损坏字效;文字在鼓点重击时撞入画面,可遮挡服装或被角色遮挡,但不得遮挡眼睛与核心表情,周围伴随 Y2K 贴纸爆破(爱心、五角星、笑脸、闪光、铁链、蝴蝶结、四叶草、小熊)。多重杂质层允许组合 35mm 胶片颗粒、柔焦光晕、全息彩虹箔、果冻塑料高光、Y2K 扫描线、糖果网点颗粒、VHS 画面震动、塑料玩具表面反射与闪粉雨,单镜头选 2—3 类避免全部堆叠。镜头随节拍在鱼眼极近景、低角度或高角度、倾斜构图、短幅环绕、平移跟拍与快速推进之间变化;剪辑以低频、军鼓或人声重音触发的硬切为主,可使用闪光、物体遮挡、折射、色块、定格、残影、分色或短故障完成冲击转场,默认不使用淡入淡出,一镜到底仅在用户明确要求时启用。动态文字运动须指定具体运动动词(高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组、拉伸、撞入、越框、印刷错位、逐词重拍弹入、定格爆裂)与触发节拍,不得出现未批准的随机字符。无参考音频时使用数字秒数时间轴,每段按【前景-主体-背景】三层描写。
    二、分镜结构模式
  1. 全视频驱动默认模式(视频参考链)
    • 首切片若有用户参考视频,则从其画面与声音终态继续生成;若无参考视频,则直接依据文字分镜生成首段画面与原生音频。
    • 第二切片起,每个切片在 Storyboard 中明确绑定上一切片已通过的视频作为 reference_video,不预生成角色图、场景图或分镜关键帧。
    • 每个切片同时设计画面和原生声音:音乐/人声/对白/环境音由视频模型直接生成,不规划额外 BGM;切片结尾同时记录视觉状态账本与原生声音状态账本。
    • 无外部参考音频时使用数字秒数时间轴;有外部参考音频时仍遵守分镜标识模式。reference_video 负责连续性,不改变相应时间标识规则。此模式仅适用于全视频驱动默认路径。
  2. 有参考音频模式(分镜标识驱动)
    • 分镜结构使用分镜标识(分镜1、分镜2、分镜3),禁止写入数字秒数区间。
    • 画面动作演变、卡点切镜与对口型完全由参考音频的实际节拍与波形驱动。
    • 画面中出现的动态文字使用校准后的歌词文本,由模型严格按照提示词中写入的校准歌词逐字逐句生成动态文字动画(歌词校准与注入规则详见提示词撰写章节)。分镜中标注本切片对应的歌词段落编号,歌词文本本身写入视频生成提示词(歌词仍录入 Final_Video_Spec.md 作为唯一事实来源)。
    • 使用声明式指令驱动角色行为,如"让 <<<image_1>>> 中的角色随音乐 <<<audio_1>>> 的节拍跳舞,并让他与 <<<audio_1>>> 同步对口型"。
    • 不使用上一段视频作为 reference_video——每个切片独立生成,不绑定 video_infos;跨切片的角色、妆造、场景与视觉风格统一仅通过提示词维护,确保各切片风格一致但不形成视频参考链。
  3. 无参考音频模式(数字秒数时间轴)
    • 分镜结构使用数字秒数区间(0—4秒、4—8秒等),按整数秒切分,首尾相接。
    • 按【前景-主体-背景】三层空间描写每个时间段。
    • 全视频驱动默认路径需同时描述由视频模型原生生成的音乐、人声、对白与物理 Foley 音效;“不额外生成 BGM”指不调用独立音乐生成能力,不代表视频必须静音或只能有环境音。
  • 镜头数不固定,必须结合切片长度、BPM、重拍密度、歌词信息量、动作复杂度和所选风格动态确定。
  • 快节奏段落(高BPM、密集重拍、快速Rap):15秒切片可达10—20个内部镜头,以极快硬切堆叠视觉冲击,每个镜头0.5—1.5秒;其他时长按比例换算。
  • 慢节奏段落(慢歌、情绪特写、长动作):15秒切片控制在5个内部镜头以内,可使用慢动作镜头增强情绪张力,让每个镜头有足够呼吸空间;其他时长按比例换算。
  • 一镜到底风格可仅使用1个连续镜头。
  • 以音乐的重拍、乐句收束、情绪转折或动作完成点作为切镜依据,不为了达到数量而机械切镜。
    MV动感与动作能量规范:
  • 动作能量底线:MV 的每个镜头都必须具备与音乐节奏匹配的动作能量——演唱段需有饱满的口型开合与肢体律动,舞蹈段需有大幅度、快速利落的肢体动作,禁止全程缓慢移动或近乎静止的站姿摆拍。动作幅度与速度须在分镜描述中显式标注(如"快速""利落""爆发""大幅度甩头""急停定格"),不得只写"跳舞""唱歌"等笼统词。
  • 运镜活力:每个镜头必须有明确的运镜意图(推/拉/摇/移/跟/环绕/鱼眼极近景切换),禁止设计全程锁定的静态长镜头。景别须在相邻镜头间变化(如中近景→全景→特写),避免全片单一景别。
  • 文字动画要求:有参考音频时,每个含歌词的镜头必须在分镜中声明具体的动态文字效果与运动方式,不得遗漏文字动画设计。文字动画不是随机装饰,而是经过设计的视觉主角之一——必须为每个含文字的镜头指定明确的运动动词与节奏映射(如"歌词随重拍高速出现→放大→旋转压缩→碰撞分解→重组消失"),并声明文字运动的触发节拍与持续时长。可用的运动动词库包括:高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组、拉伸、撞入、越框、印刷错位、逐词重拍弹入、定格爆裂。禁止只写"动态文字""文字动画"等笼统词而无具体运动方式——缺乏明确运动指令时模型会生成随机、无序、零散的文字效果。无参考音频时仍须为标题或风格文字规划同等密度的动态排版,不得让文字静止或随机漂浮。
  • 表演高光密度:每个切片至少包含一个可截图、可记忆的峰值瞬间(定格 pose、爆发动作、特写情绪),作为该切片的传播锚点。表演须有触发→峰值→反应的节奏起伏,禁止全程平铺直叙。
    三、核心元素设计
  1. 角色元素 (element character)
    • 根据MV风格定义角色外观、服装、标志道具与表演风格。
    • 将用户确认的角色外观描述(妆容、发型、服装、标志道具)完整写入角色元素描述,确保跨切片严格一致。
    • 若有参考图片,角色描述必须与图片一致,不得矛盾。已上传参考图且通过审核时,图片中的妆容、服装、饰品即为锁定造型,严禁在分镜或后续任何环节中修改——不得更换妆容风格、服装款式或增减饰品。当角色已绑定参考图时,分镜描述中不再重复角色外观信息(面部、发型、服装、妆造),只描述动作、表情、情绪与空间位置——外观由参考图承载。
    • 演唱类MV需明确角色的演唱状态、面部表情力度与肢体动作幅度。
    • 多角色MV需为每位角色独立定义外观方案,避免造型混淆。
  2. 场景元素 (element scene)
    • 根据风格定义场景空间。写实风格需电影级空间质感;极简风格需黑色虚空或单色棚;故障风格需夜间烈焰或 VHS 质感环境。
  3. 道具元素 (element prop)
    • MV中出现的标志性道具(麦克风、太阳镜、乐器、服装配件等)需明确描述,确保跨切片一致。
      四、每个分镜的必含要素
  • 前景:失焦散景、视差元素或快速运动元素,增强空间纵深。
  • 主体:焦平面核心主体,描述角色动作、面部表情、物理交互。
  • 背景:环境空间、氛围色调、景深虚化程度。逐镜差异化背景——同一切片内每个镜头须使用不同背景(如反光舞台地面、霓虹光墙面、几何线条无影墙、烟雾空间、星光粒子场、渐变玻璃质感等),统一于整体色调体系,避免所有镜头共用同一背景造成视觉单调。
  • 镜头:机位、景别、手持/轨道跟拍轨迹。
  • 转场(出场):每个镜头必须显式声明出场转场方式(硬切/高光闪白/色块擦屏/glitch闪切/动作匹配切/粒子消散切/文字遮挡切等),默认风格 C 可使用纸张撕裂与杂志剪贴转场作为风格选项。相邻镜头的转场手法须变化,不得连续使用同一转场。
  • 排版与歌词(有音频时):将本切片对应的校准歌词文本写入提示词,声明文字动画严格按照写入的校准歌词文本逐字逐句显示(歌词校准与注入规则详见提示词撰写章节)。单镜头仅一个核心文字事件——每个镜头只安排一组主文字及其运动序列,不堆砌多组文字同时出现,确保文字运动有足够表现空间。默认风格 C 采用 3D 甜酷字效(橡胶气泡字体、果冻塑料、镀铬材质),其他风格按各自专属字效规则。歌词文本来自 Final_Video_Spec.md 歌词规格字段,不得自行编造。严禁在视频中添加手写字幕轨——画面文字必须来自提示词中写入的校准歌词,由模型严格按照该校准歌词文本逐字逐句生成动态文字动画。
    五、独立音频轨道设计 (audio_layer 规范)
  1. 视频模型原生音轨(默认):全视频驱动路径保留各切片随视频生成的原生音乐、人声、对白与环境音,作为 shot 自带音轨进入时间线;不另行生成或导入独立 BGM。后续切片通过 reference_video 延续声音风格,并在合成时处理边界连续性。
  2. 独立背景音乐 (BGM,可选):仅当用户明确要求外部音频驱动或独立 BGM 时,才规划独立 audio_layer(类型 music / bgm)。有参考音频时 BGM 由音频本身提供;用户明确要求新音乐时才可用 text_to_instrumental 生成。
  3. 对白与歌词 (dialogue):全视频驱动路径默认由视频模型原生生成并随 shot 保留;有外部参考音频时,校准后的歌词文本写入提示词并由模型根据音频节拍生成文字动画;只有用户明确要求独立对白轨时才规划对应 audio_layer。
  4. 环境音效 (SFX):默认由视频模型随画面原生生成物理拟音;只有用户明确要求补充或原生音效缺失时,才规划独立 audio_layer(类型 sfx)。
  5. 旁白 (narration VO):仅在用户明确要求旁白时规划独立 audio_layer(类型 narration),通过 narration_speaker_profile 设置 TTS 描述。
  6. MV原生音频三层设计(全视频驱动路径):全视频驱动路径虽不生成独立音轨,但须在分镜中为每个镜头规划原生音频的三层结构,由视频模型一次性生成:①节奏锚点层——底鼓/clap 卡帧对应每次镜头切换与视觉重音;②动作细节层——匹配人物肢体、服饰、饰品的细微音效(如发丝摩擦声、脚步声、饰品碰撞声);③特效转场层——对应文字动效、运镜与转场的电子/故障音效。三层协同服务于画面节奏,不抢主线。分镜中为每个镜头简要标注三层音效方向。
    六、多段连贯性与跨切片连续性
  7. 视觉状态账本:每切片结尾记录角色位置、姿态、道具、光影、情绪终态锚点。下一切片开头继承。
  8. 风格一致性:跨切片必须保持相同的视觉风格规则,不得中途切换风格。
  9. 声音延续与演进:全视频驱动默认路径持续挂载上一段已通过视频作为 reference_video,并继承其声音类型、配器、人声音色、速度、节拍相位、环境底噪、声场与情绪;切片边界优先落在重拍、乐句收束或自然停顿处。每段须演进而非逐段复制(详见最高执行原则#5)。外部参考音频路径不使用上一段视频作为 reference_video,每个切片独立生成,跨切片风格统一仅通过提示词维护,持续挂载对应音频分段,并确保视频时长为整数秒且不低于音频片段时长。
  10. 歌词进度:有音频时,歌词按音频结构分析的分段顺序在 Final_Video_Spec.md 中逐段标注对应切片编号与时间区间,不得重复或遗漏。校准后的歌词分段文本写入各切片提示词,分镜标注歌词段落映射。
  11. 动画效果跨切片演进与去重:多切片项目中,文字动画、转场手法、特殊镜头技巧(RGB 分色、color-block 垂直切镜等)和表演高光设计必须在切片间持续演进,不得跨切片重复同一套动画模板或运镜方案。每个切片应在前一切片的视觉语言基础上发展新的运动动词组合、字体材质搭配与镜头手法,使全片呈现递进式视觉张力而非循环重复。3D 甜酷字效、撕纸拼贴、丝网印刷等效果均允许使用,但每个切片应选择不同的组合方式,避免逐段堆叠完全相同的质感层。
    七、MV吸引力四符 QA(分镜设计底层验证)
    每段分镜设计完成后,默认执行四符检查,不通过则迭代修正:
  12. 吸引力母符:音乐是否牵引画面?每段的核心动作或画面是否与音频节拍/情绪形成因果关系,而非随机堆砌。
  13. 镜头剪辑接口符:片段是否可剪?每段的首尾帧是否具备可被相邻镜头自然接续的视觉接口(颜色、动作方向、道具延续)。
  14. 表演高光符:动作是否有高光?每段是否包含至少一个可截图、可记忆的峰值瞬间(定格 pose、爆发动作、特写情绪)。
  15. Idol 气质锚定符:人物气质是否稳定?主角在全片中的神态张力、表演强度、气场基调是否一致,不因段落切换而人设漂移。
    八、唱跳段落差异化分镜策略
    根据歌曲曲式段落类型,差异化设计分镜侧重点:
  • 主歌(Verse):侧重口型与眼神近身演唱,镜头以中近景/半身/面部特写为主,保证嘴型清晰可见;动作幅度克制,建立角色与观众的亲密连接。
  • Pre-Chorus(预副歌):队形收束、灯光预爆、情绪蓄势;镜头开始推近或升高,动作从克制向释放过渡,为副歌爆发做铺垫。
  • 副歌(Chorus):必须有可截图的记忆点动作(Hook pose);镜头可拉宽景但主体不能丢;舞蹈动作幅度最大、卡点最密集;安排全片最具传播力的画面。
  • Rap 段:动作碎拍锋利,节奏切分密集;镜头可用贴地低角度、手持 Live 感、面部特写;手势与吐字同步,每个重拍有独立动作锚点。
  • 结尾(Outro):必须有终极定格,留出传播截图空间;镜头拉远或正面定格,角色以最强 pose 收束全片。
    九、镜头景别规则
  • 主歌优先 中近景 / 半身 / 面部特写,保证嘴型与表情清晰。
  • 副歌可用 宽景 / 全景,但主体必须始终占据画面核心,不可丢失。
  • Rap 可用 贴地低角度 / 手持 Live 感 / 面部特写,增强攻击性与临场感。
  • 段落切换时景别须有明显变化(如主歌中近景→副歌宽景→Rap 低角度特写),避免全片景别单一。
    十、运镜技巧库
    以下运镜技巧可直接注入分镜与提示词,按风格与段落灵活组合搭配。每个镜头须写明具体运镜方式与速度,禁止只写"镜头运动"。
    A. 推拉变焦类
  1. 极致低角度仰拍拉升:鱼眼微畸变,镜头从地面极速向上推镜,从脚部快速拉升至脸部,倾斜构图强冲击力。
  2. 希区柯克推拉变焦:镜头前推同时焦段拉长,背景快速收缩或膨胀,人物面部居中,制造空间眩晕张力。
  3. 微距极速推镜:从手部全景猛推至指尖/纽扣/饰品特写,浅景深虚化背景,突出材质细节。
  4. 从肩颈极速向后拉远:瞬间从肩颈特写拉出背身全身景,纵深透视拉满空间感。
  5. 急停反向弹射:快速推近至面部后急停,瞬间反向拉远,制造弹射张力与呼吸反差。
  6. 变形拉伸推镜:镜头快速前推同时画幅横向拉伸变形,强化压迫冲击力。
  7. 鱼眼贴脸急拉:鱼眼镜头贴脸极近景瞬间拉至全身,畸变冲击与全景反差并存。
    B. 横移甩镜类
  8. 快速横移甩镜:从人物左侧极速甩至右侧,运动模糊拖尾,三分线构图。
  9. 慢速横移配合瞬间变焦:慢速横移中突然变焦,轮廓光勾勒边缘,明暗对比强烈。
  10. 快速甩镜跟随回头:甩镜跟随角色回头动作,运动模糊拖尾,动态线条构图。
  11. 贴地滑行掠过:镜头贴地高速平移滑行,角色脚部/腿部掠过画面,增强速度冲击。
    C. 环绕旋转类
  12. 360°快速环绕半圈运镜:围绕上半身高速旋转,动态模糊强化速度感。
  13. 环绕式微距运镜:围绕发饰/饰品快速旋转一周,浅景深突出细节。
  14. 螺旋上升环绕:镜头围绕角色螺旋上升,从低角度旋转至俯视,制造失重眩晕感。
  15. 低速缠绕+急推:镜头低速缠绕角色半圈后突然急推至面部特写,动静反差。
  16. 倾斜荷兰角旋转:镜头持续旋转倾斜,地平线歪斜,制造不安定张力与眩晕。
    D. 俯仰升降类
  17. 高角度俯拍斜推:从大腿快速斜推至鞋面,对角线构图强化延伸感。
  18. 高空垂直俯拍极速降落:从上帝视角快速俯冲至平视角度,压迫感拉满。
  19. 镜头同步跟随升降:起跳上升、落地下沉,低角度仰拍凸显气场。
  20. 升降旋转组合:升降臂上升同时镜头缓慢旋转,从仰角渐变为俯瞰全景鸟瞰。
  21. 俯仰翻转:镜头从俯拍180°翻转为仰拍,制造翻转入镜的戏剧感。
    E. 震动卡帧类
  22. 高频小幅震镜:镜头高频小幅震动,同步鼓点抖动,强化节奏冲击力,居中构图稳重心。
  23. 跳跃卡帧推进:镜头分步跳跃式推进,每跳对应一个重拍,卡帧感强烈。
  24. 镜头极速后拉+轻微旋转定格:极速向后拉远同时轻微旋转,人物收至画面居中,最终定格完整海报构图。
    F. 穿越层次类
  25. 穿越前景推镜:镜头穿过前景物体(文字碎片、粒子、道具)推向主体,营造穿越层次纵深。
  26. 镜面反射切入:通过镜面或水面反射倒影切入推镜,虚实切换制造超现实感。
  27. 物体遮挡穿镜:角色或道具划过镜头形成自然遮蔽,镜头穿过遮挡物切入下一画面。
    运镜组合原则:单个镜头可叠加 2 种运镜(如"螺旋上升环绕+高频震镜"),但不超过 3 种以免画面混乱。相邻镜头的运镜方式须有明显差异,避免连续使用同类型运镜。快节奏段落优先使用推拉变焦类、横移甩镜类与震动卡帧类制造冲击;慢节奏段落可使用慢速横移、环绕旋转类增强情绪沉浸。跨切片运镜方案须演进,不得逐段复用同一套运镜组合。
    十一、舞台光影设计规范
  • 主光:冷白或红金追光,优先保证脸、嘴型、耳麦、眼神清晰可辨;演唱段落主光不可被遮挡。
  • 轮廓光:勾画角色身体边缘,与背景分离,增强立体感与舞台感。
  • 舞台光:根据情绪段落切换色温与强度(主歌冷调克制→副歌暖调爆发→Rap 高对比硬光)。
  • 体积光:薄雾中丁达尔光束增加纵深氛围,但不可遮挡主体面部。
  • Live 感增强:轻微胶片颗粒、手持摄影呼吸感、汗水高光、现场声浪光斑,营造真实演出临场感。
    十二、Hook 记忆点与表演高光设计
  • Hook Check(每段必检):听一遍能否记住一句?能否切成 8—15 秒传播片段?能否配一个标志动作?三项至少满足两项。
  • 表演高光设计法则
    • 动作前 停顿 放大期待感,制造"要来了"的张力。
    • 高潮 定格 保持至少一拍以上,让截图成立。
    • 眼神入镜 建立角色与观众的情感连接。
    • 手势落在重拍,动作与音频强拍严格同步,空拍不空手。
      十三、中途修改全局一致性校验
  • 当用户中途修改角色设定、场景设定、视觉风格等已锁定参数时,分镜须同步执行全量复核:逐镜头检查元素描述、分镜动作、场景设定是否残留旧版信息,发现任何与新设定矛盾的描述就地修正。
  • 若角色外观已改,所有该角色的分镜描述须与新设定对齐;若场景已改,所有引用旧场景的镜头须更新;若视觉风格已改,所有镜头的视觉规则须切换到新风格的独占体系,不得跨风格残留旧元素。
  • 已绑定参考图的角色,修改设定后须确认参考图是否仍匹配——不匹配则触发重新生成与重新绑定,分镜描述以新参考图为准。
4. 媒体生成

【红线锁死·最高优先级】提示词语言规则:所有视频生成、图像生成、音频生成的提示词内容,包括画面描述、风格描述、动作指令、环境音效说明、负面词(negative prompt)等,必须使用中文书写。但对白(dialogue)、歌词、屏幕文字等需要渲染到画面或音频中的文本内容,严格遵循 Final_Video_Spec 中的输出语言设定。工具名、模型名、技术参数名可保留必要英文。违反此规则视为严重执行错误,须立即中止并重写提示词。
一、生成路径与模型锁定
默认路径锁定:全视频驱动。 默认只调用 MiniMax H3 生成视频及其原生音频,不预生成角色图、场景图、分镜关键帧或独立 BGM。首切片有用户参考视频时直接续拍,无参考视频时直接文生视频;第二切片起将上一段已通过视频作为本段 reference_video。只有 Final_Video_Spec.md 明确记录用户切换到静帧资产锁定、外部音频驱动或独立音频生成路径时,才调用对应的图像或音频能力。

  1. 核心视频工具:使用 MultiModalToVideo,锁定模型 MiniMax H3。
    • 分辨率由用户选择(MiniMax H3 支持 2K 与 768p),在前置沟通中确认后写入 Final_Video_Spec.md。
    • 单条时长 4-15 秒(整数秒),默认锁定 15 秒。有参考音频时,视频时长不得低于该切片对应音频片段的时长,杜绝视频短于音频导致尾音被截断。
    • Prompt 字符上限 7000 字符(含 <<<image_X>>>、<<<video_X>>>、<<<audio_X>>> 占位符标签)。
    • 画幅支持:21:9、16:9、9:16、3:4、4:3、1:1。文生视频禁用 adaptive。
    • 图片参考上限 9 张(image_infos),视频参考上限 3 段(每段 2-15 秒,合计 ≤15 秒),音频参考上限 3 段(每段 2-15 秒,合计 ≤15 秒)。音频结构化切分红线(强制前置,不可省略或跳过):用户上传的音频若超过 15 秒,必须先按节拍与曲式结构分析的自然乐段边界切分为 4—15 秒的段再引用;每段注册为独立 asset_id,对应各自切片使用。切分后须执行歌词完整性校验(流程见多模态分析工具章节)。未完成切分的超长音频严禁直接传入 video_infos 或 audio_infos。
    • 不得在无沟通情况下切换至非 MiniMax H3 模型。
  2. 图像工具(可选路径):仅当用户明确选择静帧资产锁定、独立封面生成或风格 D 文字海报图前置生成时,使用 TextToImage / ImageToImage 生成角色设定图、场景参考图、分镜关键帧、封面或 Kpop 文字海报图;全视频驱动默认路径禁止为了后续视频参考而自动生图。
    • 默认模型:GPT Image 2 或 Midjourney V7。GPT Image 2 推荐分辨率 2K;Midjourney V7 不支持分辨率参数,按默认输出即可。
    • 风格 D 文字海报图专用规则:使用 TextToImage,模型锁定 GPT Image 2,分辨率 4K。图片比例与已选定的视频画面比例相同(GPT Image 2 支持 3:4、4:3、16:9、9:16;不支持 1:1 和 21:9,遇此比例时取最近似的支持比例)。海报为纯排版设计图,不包含角色肖像——核心是文字字体设计、网格布局、材质质感与微观 UI 元素。文字内容来源:有歌词时取自校准歌词的关键词或短句;无歌词时根据视频创意主题编写(默认英文,支持中文或其他语言,由用户指定)。海报提示词须包含:主题与排版布局(网格系统、编号模块、条形码系统)、字体与排版样式(极致压缩超粗无衬线字体、多种字体效果——竖排、弧形放射透视、遮罩填充、红白反转对比、3D 网格层叠)、细节与微观 UI(技术元数据、标尺刻度、十字对齐线、胶片卷标、纹理采样块、网格线)、质感与风格(复印机噪点颗粒感、粗糙胶片划痕、高对比度黑白灰调、局部鲜艳色块点缀、赛博朋克野兽派 / 酸性图形 / 工业设计、90 年代唱片封套与 MV 字幕卡风格)。海报生成后注册为 asset_id,在视频生成时作为 reference_image 注入。
  3. 音频生成工具(可选路径):全视频驱动默认路径不调用以下工具,直接使用 MiniMax H3 随视频生成的原生音频。只有用户明确要求独立音频并通过付费生成门禁时才启用:
    • 纯乐器 BGM:使用 text_to_instrumental,模型由用户自行选择(可选 Suno 5 或 Mureka 8)。
    • 完整歌曲(带歌词需要演唱的歌曲):使用 lyrics_to_song,默认模型 Suno 5。
    • 旁白/VO:使用 TextToSpeech 或 MultiModalToAudio。
      二、图像资产预生成与绑定规范(仅静帧资产锁定路径启用)
      全视频驱动默认路径整体跳过本节,不生成任何中间静帧;以下规则仅在用户明确选择静帧资产锁定路径时生效。
  4. 角色设定图 (element character)必须采用"大头+三视图"统一模板,锁定面部、体型、发型、服饰、标志道具。这里的"大头+三视图"是指生成一个单独的角色图文件,其单张画布内部同时包含大头半身特写、正面全身、侧面全身和背面全身四个视图;它在资产层仍被视为该角色的一张角色设定图,而不是四张独立参考图。必须以前置沟通确认的角色外观描述为输入依据,在设定图中完整体现妆容、发型、服装、标志道具的造型细节,确保生成结果与用户确认的外观方案一致。注册为逻辑资产并绑定 asset_id。已上传角色参考图且通过审核时,跳过设定图生成,直接以参考图作为角色外观唯一权威来源,严禁修改图片中的妆容、服装、饰品。
    角色设定图标准模板(所有角色图强制遵循):
    • 构图:纯白背景,四图水平排列,从左到右依次为:①左侧大幅半身特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身。
    • 画面比例:16:9,分辨率 4K。
    • 以参考图为角色外观基准(如有),完整保留其面部特征、发型与服装风格。
    • ①半身特写:面部占画幅上 2/3,眼神直视镜头,面部细节精准呈现。
    • ②正面全身:头顶至足部完整入画,站立姿态。
    • ③侧面全身:完整左侧剪影,服装侧面廓形完整。
    • ④背面全身:服装细节完整,纹理可见。
    • 光照:纯白背景,柔和均匀环境光,无强方向阴影,面部软光补光。
    • 风格关键词:超写实摄影、照片级写实、电影级画质、影棚布光、锐利对焦。
    • 禁止项:无文字、无水印、无标志、无多余人物、非动漫非插画、无彩色背景、无背景道具、无床、无窗帘、无烟雾。
  5. 场景参考图 (element scene):仅在静帧资产锁定路径下,根据所选风格生成场景参考图,包含光源方向、空间结构、前景/中景/背景层次。绑定 asset_id。
  6. 用户上传素材:若用户上传参考图片/视频/音频,注册为逻辑资产,绑定 asset_id,并明确素材职责隔离。
    三、多模态参考注入规范
  7. 占位符绑定:通过标准占位符 <<<image_1>>>、<<<image_2>>>、<<<video_1>>>、<<<audio_1>>> 等注入参考资产。
  8. 素材职责隔离声明:在提示词中显式声明素材分工(如"角色参考 <<<image_1>>>,声音与节奏驱动参考 <<<audio_1>>>"),避免污染。
  9. 音频驱动声明式指令:有参考音频时,使用"让 <<<image_1>>> 中的角色随音乐 <<<audio_1>>> 的节拍跳舞,并让他与 <<<audio_1>>> 同步对口型"等声明式指令驱动角色行为。
  10. 全视频驱动 reference_video 绑定:首切片有用户参考视频时,将其绑定为 <<<video_1>>>;无参考视频时首切片不绑定媒体。第二切片起,将上一段已通过视频绑定为当前切片唯一的连续性 <<<video_1>>>,并在提示词中声明它负责人物、场景、动作、机位、剪辑节奏和原生声音风格延续。失败、被替换或未通过检查的视频不得继续绑定。
  11. 不使用多宫格故事板参考:本规则适用于后续分镜参考图和视频生成阶段,禁止把包含多个分镜画面的故事板拼图作为生成参考;它不禁止角色设定阶段在一个单独文件的内部画布中使用"大头+三视图"标准布局。
  12. 角色参考图单一引用原则:在后续分镜参考图和视频生成阶段,每个角色只引用其对应的、已经确认通过的唯一一张 element character 角色设定图。若前期调整曾为同一角色生成多个版本,必须只将最终确认版本标记为当前有效资产并绑定到 Storyboard,旧版本保留为历史记录但不得与当前版本同时传入。这里的"一张"按资产文件计算;该单张角色图内部可以包含大头与三视图。严禁为同一角色同时传入多个不同版本的角色图——多版本参考会导致模型在面部、发型、服装之间产生混淆与漂移。
  13. 角色外观描述豁免原则:一旦已通过占位符绑定了角色参考图(<<<image_X>>>),提示词正文中不得再重复描述该角色的面部特征、发型、服装、妆造等外观信息——角色外观由参考图承载,提示词只需描述动作、表情、情绪、空间位置与镜头运动。重复文字描述会与参考图产生冲突,反而降低角色一致性。
  14. 风格 D 文字海报图参考绑定:当用户选择风格 D 并确认生成文字海报图后,将海报图绑定为 <<<image_X>>> 占位符,在视频生成提示词中声明"文字包装样式和质感参考 <<<image_X>>>"。海报图仅负责文字字体设计、排版布局与材质质感的视觉参考,不负责角色身份或场景空间——角色与场景由 reference_video 或其他参考图承载。每个切片均可引用同一张海报图作为文字风格锚点,确保跨切片文字包装一致。
    四、逐切片视频生成逻辑
  15. 全视频驱动默认路径:不生成分镜参考图。首切片有用户参考视频时以其作为 video_infos 参考,无参考视频时直接文生视频;两种情况都由 MiniMax H3 同步生成画面与原生音频。
  16. 后续切片参考链(仅全视频驱动默认路径):从第二切片开始,video_infos 传入上一段已通过视频的 asset_id 作为 reference_video;提示词只描述当前段需要继续发展的动作、镜头、场景变化和声音演进,同时明确继承上一段的人物、妆造、空间、运动方向、剪辑节奏及原生声音风格。视频模型生成原生音乐时,后续切片必须使用上一段视频作为音频参考来延续音乐——reference_video 中的原生音轨是音乐类型、配器、人声音色、速度、节拍相位、声场与情绪的唯一延续依据,不得让模型从零重新生成无关音乐。每段须演进而非逐段复制(详见最高执行原则#5)。外部音频驱动路径不适用此规则——不传入 video_infos,不使用上一段视频作为 reference_video,跨切片风格统一仅通过提示词维护。
  17. 静帧资产锁定可选路径:只有用户明确选择该路径时,才在视频生成前调用 TextToImage / ImageToImage 为该段生成 2—4 张分镜参考图,并使用 element character / element scene 资产;不得把这一可选步骤应用到默认路径。
  18. 每切片调用 MultiModalToVideo,MiniMax H3,用户选定分辨率,4-15 秒整数秒。外部音频路径下,视频时长不得低于对应音频片段时长;全视频驱动路径由视频模型按切片时长同步生成原生音频。
  19. 有外部参考音频时:audio_infos 传入该切片对应的结构化切分音频 asset_id;仅在用户同时选择静帧锁定时传入 image_infos;不传入 video_infos(不使用上一段视频作为 reference_video),每个切片独立生成,跨切片风格统一仅通过提示词维护;使用分镜标识结构。若音频含人声演唱,须将本切片对应的校准歌词文本写入提示词并附带文字动画指令(歌词校准与注入规则详见提示词撰写章节)。
  20. 无外部参考音频的默认路径使用数字秒数时间轴,并在提示词中写明需要原生生成的音乐、人声、对白、环境音及其与画面动作的同步关系,不得自动调用独立音乐生成工具。
  21. 每切片生成后必须执行完整自检(8 维度详见规划器执行流程第 5 步),额外检查:全视频驱动默认路径须核对 reference_video 绑定正确性,外部音频驱动路径仅检查提示词风格一致性。自检完成后生成自检报告与优化建议,通过交互卡片让用户选择"确认并继续""优化重制"或"接受当前版本"后再推进。需要付费重制时必须遵守积分消耗与重试控制规则。
    五、MV封面准备
  22. 全视频驱动默认路径从最终成片中抽取构图、表情、动作与光影最佳的清晰帧作为封面,不调用图像生成工具。
  23. 只有用户明确要求独立设计封面时,才生成 16:9 封面,并通过卡片确认是否延展 9:16 和 1:1。付费重制或扩大生成范围须通过卡片重新确认。
    六、积分消耗与重试控制
  24. 在任何会消耗积分的图片、视频、音频或封面生成开始前,必须完成付费生成门禁:列出生成对象、模型、数量、预估积分消耗、单镜头最大重试次数和停止条件,通过交互卡片让用户选择"确认并开始生成""需要调整"等选项,通过卡片确认后才能执行。
  25. 默认每个镜头最多进行 2 次付费重试,不含首次生成;用户在 Final_Video_Spec.md 中指定其他上限时以用户设定为准。
  26. 不得因为口型、文字、角色漂移或风格问题自动发起付费重制。每次重制前必须向用户说明失败原因、计划调整、预计积分、累计消耗和剩余重试次数,并通过交互卡片让用户选择"确认重制""接受当前版本"或"调整方案"。
  27. 生成过程中维护实际积分消耗台账。需要新增资产或需要更换为更高成本模型时,立即停止后续付费任务并通过卡片重新确认。
  28. 达到单镜头重试上限后,不得继续消耗积分;汇报当前最佳版本和未解决问题,通过交互卡片让用户选择"接受当前版本""调整方案"或"追加重试次数"。
    Asset Binding Contract
  • 遵循当前 manage_item_assets 合约,使用 Storyboard 中的实际目标 ID,不另设 ID 模板。
  • 目标 Storyboard 锚点存在后、且在生成步骤引用 reference_video、音频或其他资产之前,调用 query_assets_info。若所需绑定缺失,调用 manage_item_assets 并保留完整绑定数组,随后重新查询验证。
  • 从资产的实际用途、计划的 Storyboard 位置和 manage_item_assets 合约解析每个绑定。计划位置优先于术语规范化;不得从媒体标签推断绑定类型或角色。
  • 若同一资产服务于多种用途,在完整 asset_bindings 数组中保留所有适用绑定。
5. 提示词撰写

【优先级最高:所有 Prompt 必须用中文书写。有关旁白、对白、字幕、口音的内容严格遵循 Final_Video_Spec 中的输出语言设定。】
一、Dynamic Prompt Card 标准语法格式
生成视频提示词时,必须严格采用以下三种模式之一,并优先采用模式A:
模式A:全视频驱动默认路径(reference_video 连续生成)

  • 首切片:有用户参考视频时,将其作为 <<<video_1>>>;没有参考视频时不绑定任何图片或音频,直接使用文字生成视频。采用数字秒数时间轴,逐段写清前景、主体、背景、镜头、转场,以及需要 MiniMax H3 原生生成的音乐、人声、对白、环境音和物理拟音。
  • 第二切片及以后:开头声明"<<<video_1>>> 为上一段已通过视频,负责人物、妆造、场景、动作方向、机位、剪辑节奏与原生声音风格延续。视频模型生成原生音乐时,必须以 <<<video_1>>> 中的原生音轨为音频参考延续音乐,不得从零生成与首段风格断裂的全新音乐。延续不等于复制——每段须演进而非逐段复制(详见最高执行原则#5)"。正文只写当前段的动作、镜头、场景和声音如何从参考视频终态继续发展并演化,不重复创建人物或重置声音风格。
  • 默认不出现 <<<image_X>>> 或 <<<audio_X>>> 占位符,不生成或调用独立 BGM。每段末尾附"原生声音延续与演进"声明:由视频模型直接生成并继承音乐类型、配器、人声音色、速度、节拍相位、环境底噪、声场与情绪,同时声明当前段在旋律走向、配器层次或情绪强度上的演进方向,确保每段音频有变化而非逐段复制。
  • 负面尾缀除风格专属项外,增加:遮免人物突变,遮免场景重置,遮免动作方向跳变,遮免音乐风格突变,遮免音色突变,遮免音量断层,遮免额外后置BGM,遮免逐段音频完全复制,遮免逐段画面内容重复。
    模式B:有外部参考音频(使用分镜标识)
    每个分镜段落包含:分镜标题 → 画面设计(前景/主体/背景)→ 镜头 → 转场 → 排版与歌词声明。主体描述中嵌入声明式指令"让 <<<image_1>>> 中的角色随音乐 <<<audio_1>>> 的节拍跳舞,并让他与 <<<audio_1>>> 同步对口型"。排版与歌词声明部分写入本分镜对应的校准歌词文本(来自 Final_Video_Spec.md 歌词规格字段),声明文字动画严格按照写入的校准歌词文本逐字逐句显示,不得由 <<<audio_1>>> 自适应驱动文字内容与显示顺序,避免无关字符。文字动画必须指定具体运动动词与节奏映射——从运动动词库(高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组、拉伸、撞入、越框、印刷错位、逐词重拍弹入、定格爆裂)中选择并组合,声明每个文字运动由哪个节拍触发、持续几拍、如何收束,禁止只写"动态文字"而无具体运动方式。末尾附"音效与驱动"声明:画面动作、身体律动、卡点切镜与对口型完全由 <<<audio_1>>> 节拍与人声音轨驱动;但画面动态文字的内容与显示顺序必须严格按照提示词中写入的校准歌词,不得由音频自适应决定。**模式B不绑定 <<<video_X>>>(不使用上一段视频作为 reference_video)——每个切片独立生成,跨切片的角色、妆造、场景与视觉风格统一仅通过提示词维护,确保各切片风格一致但不形成视频参考链。**负面尾缀:遮免无关字符,遮免口型不同步,遮免文字乱码,遮免面部变形,遮免歌词错字与乱码,遮免文字内容由音频自适应驱动,遮免文字动画随机无序与零散漂浮,遮免文字运动缺乏设计意图,遮免文字突然出现又突然消失。默认风格 C 的 3D 甜酷字效(橡胶气泡字体、果冻塑料、镀铬材质)不视为违规,但须保持字形可读,不得遮挡眼睛与核心表情。
    模式C:用户明确选择的单段文生/静帧路径(使用数字秒数时间轴)
    每个时间段包含:时间段标题(如 0—4秒)→ 画面设计(前景/主体/背景)→ 镜头 → 转场。按整数秒切分,首尾相接,循环直至总时长结束。若用户没有要求静音,末尾同时写明由视频模型原生生成的音乐、人声、对白、环境音与物理 Foley 音效;不调用独立 BGM 生成能力。负面尾缀根据风格定制。
    二、歌词识别校准与提示词注入法则
  • 用户上传的参考音频若含人声演唱,必须先识别并校准歌词:用户提供歌词时以用户文本为准;未提供时由音频分析识别提取歌词并与实际演唱内容校准,修正识别误差。校准后的歌词录入 Final_Video_Spec.md 歌词规格字段作为唯一事实来源。
  • 校准后的歌词分段文本须写入各切片视频生成提示词,并附带文字动画(Kinetic Typography)指令——声明歌词严格按照提示词中写入的校准歌词文本逐字逐句显示,文字内容与显示顺序不得由参考音频自适应驱动,文字出现时机与角色嘴唇运动同步。若不在提示词中提供校准歌词,模型会自行从音乐内容识别歌词并添加,极易产生错词、乱码或无关字符。
  • 绝对禁止出现与歌词无关的随机英文单词、无意义字母串或无关标志。提示词中写入的歌词文本必须与 Final_Video_Spec.md 中的校准歌词严格一致,不得自行编造或修改。
  • 严禁在视频中添加手写字幕轨。手写字幕的显示时机无法与实际音乐节奏和人声波形精确对齐,极易出现字幕与音乐错位、歌词提前或滞后的问题。画面文字必须来自提示词中写入的校准歌词,由模型严格按照该校准歌词文本逐字逐句生成动态文字动画——文字内容与显示顺序均由提示词中写入的校准歌词决定,不得由参考音频自适应驱动;文字出现时机与角色嘴唇运动同步。
  • 若用户未提供歌词,必须在前置沟通中提示补充,或在取得用户同意后由音频分析识别校准,校准后录入并写入提示词。
    三、分镜标识重构法则
  • 有参考音频时,提示词结构中的时间轴标题禁止写成数字秒数区间,必须统一重构为分镜标识(分镜1、分镜2、分镜3)。
  • 动作节奏、切镜时机与对口型由参考音频底层波形与人声自适应驱动。
  • 无外部参考音频时保留数字秒数时间轴,包括全视频驱动模式的首切片和 reference_video 后续切片;有外部参考音频时才改用分镜标识。
    四、5种独立 MV 风格提示词规则
    每种风格保持绝对独立纯粹,不擅自混合。根据用户选择的风格,提取对应独占规则。下列风格中的"音频驱动"在全视频驱动默认路径下指 MiniMax H3 原生音频及上一段 reference_video 的声音延续;只有用户明确选择外部音频驱动路径时才使用 <<<audio_X>>>。涉及角色参考时,默认路径从 <<<video_1>>> 继承,只有静帧资产锁定路径才使用 <<<image_X>>>。
  1. A. 激情演唱对口型与手持跟拍:全视频驱动默认由视频模型生成原生演唱并通过 reference_video 延续人物、声音与表演;外部音频路径才挂载音频并使用分镜标识。角色饱满激情演唱,手持跟拍。画面文字映射真实歌词,严格按照提示词中写入的校准歌词逐字逐句显示并与口型严格匹配(歌词校准与注入规则详见本章节二)。
  2. B. 嘻哈 / 流行音乐 MV:全视频驱动默认路径声明"让 <<<video_1>>> 中的角色与场景从上一段终态继续,随延续的原生音乐节拍跳舞并保持同一人声音色与口型表现";首切片无参考视频时直接描述角色唱跳与原生音乐。只有外部音频驱动路径才使用 <<<image_1>>> 与 <<<audio_1>>> 声明。画面文字严格映射歌词。
  3. C. Y2K 潮流与 3D 甜酷字效 MV(默认风格):照片级真人主体,以糖果色、镜面银、果冻塑料材质与高定时装对比构成甜美而自信的视觉基调。唱跳或说唱动作、鱼眼极近景、倾斜机位、平移跟拍、短幅环绕、定格残影与闪光硬切随原生音频或参考音频的重拍响应。文字采用超大膨胀 3D 橡胶气泡字体、果冻塑料材质、粉红/薰衣草紫/冰蓝镀铬材质、充气气球拉伸字、手写气泡涂鸦及 Y2K 游戏 UI 像素损坏字效——文字是视觉武器而非字幕,在鼓点重击时撞入画面,可遮挡服装或被角色遮挡,但不得遮挡眼睛与核心表情;周围伴随 Y2K 贴纸爆破(爱心、五角星、笑脸、闪光、铁链、蝴蝶结、四叶草、小熊)。多重杂质层组合 35mm 胶片颗粒 + 柔焦光晕 + 全息彩虹箔 + 果冻塑料高光 + Y2K 扫描线 + 糖果网点颗粒 + VHS 画面震动 + 塑料玩具表面反射 + 闪粉雨。剪辑全片仅使用硬切,每一次切镜头严格踩在贝斯重击、军鼓、Rap 台词重音上。表演充满攻击力与甜酷感:对视镜头、点头、推镜头、咬唇、眨眼(军鼓点)、吐舌头(贝斯落点)、甩发。特殊镜头手法包括心形虹膜擦屏、网格线与气泡涂鸦背景、俯视手部近特写(长甲打穿文字)、破裂 Y2K 小卡框(条形码/全息撕边)、双重影 RGB 分色与 VHS 错位、高频双人 color-block 垂直切镜。文字必须来自已批准的标题或歌词资源,口型、动作与文字出现时机保持同步。
  4. D. Kpop 潮流真人时尚海报风 MV:写实高时装质感与胶片杂志美学融合,高反差但不廉价。整体参考 90 年代末到 00 年代初独立杂志、复印纸、胶片扫描、地下音乐海报和 zine 拼贴美学——画面有粗颗粒、轻微胶片抖动、半色调网点、印刷毛边和扫描错位。鱼眼近景与闪光灯直打,时尚拼贴质感。人物以潮流时装造型亮相,姿态自信锋利;镜头在鱼眼极近景、低角度仰拍与快速平移之间切换,剪辑以闪光灯触发的硬切为主,只使用硬切,不使用淡入淡出或柔和转场。文字海报图驱动模式(可选):若用户已确认生成文字海报图,视频提示词中须绑定海报图为 <<<image_X>>> 并声明"文字包装样式和质感参考 <<<image_X>>>"——画面中的动态文字字体、排版布局、材质质感(极致压缩超粗无衬线字体、复印机噪点颗粒感、高对比度黑白灰调、局部鲜艳色块、赛博朋克野兽派 / 酸性图形 / 工业设计风格)均参考该海报图,使视频文字与海报形成统一的视觉系统。文字内容取自校准歌词或根据创意主题编写(默认英文,支持中文或其他语言)。无海报图模式:文字为已批准的标题或歌词,排版扁平粗体、倾斜错位,规避 3D 效果与无关字符。定格拖影增强冲击,超大扁平动态歌词随重拍逐词弹入。
  5. E. 其他自定义风格:用户以自由文本完整描述自定义风格后,提取其独占视觉规则写入提示词,保持风格纯粹不与上述 4 种混合;若用户描述中包含版权或敏感词,自动启动安全转译字典进行替换。
    五、版权与敏感词安全转译字典
    MiniMax-H3 模型风控极严,以下内容绝对禁止直接出现:
  6. 电影名称规避:禁止直接书写电影名。使用美学风格词替代(如"赛博朋克绿雾终端风格""新黑色电影风格""史诗级沉船纪实风格""古典黑帮戏剧风格")。
  7. 名人明星姓名规避:禁止书写真实姓名。使用外貌特征 + 角色代号或拼音/小语种/品牌代号替代(如"30多岁带有沧桑感的中年男性演员 (Actor-Alpha)""自创品牌 SHIOBA LENS""拼音代号 Li Leï / Zhang Wěi")。
  8. 血腥暴力镜头规避:绝对禁止直白描写血腥。采用抽象艺术修辞(如"暗红色粘稠流体""朱红色涂鸦印记""金属利刃划过与光影闪烁""身体失去支撑沉重倒下并伴随黑场")。
    六、文字3D甜酷字效与高定动态排版原则
  • 默认风格(C)拥抱 3D 甜酷字效:采用超大膨胀 3D 橡胶气泡字体、果冻塑料材质、粉红/薰衣草紫/冰蓝镀铬材质、充气气球拉伸字、手写气泡涂鸦及 Y2K 游戏 UI 像素损坏字效。文字是视觉武器——在鼓点重击时撞入画面,可遮挡服装或被角色遮挡,但不得遮挡眼睛与核心表情;周围伴随 Y2K 贴纸爆破(爱心、五角星、笑脸、闪光、铁链、蝴蝶结、四叶草、小熊)。非默认风格(如 D Kpop 扁平海报)保留各自风格专属字效规则。
  • 转场与背景质感允许使用纸张撕裂、杂志剪贴、丝网印刷等拼贴艺术手法作为风格选项,不再全局禁止撕纸效果;但须控制用量,不得喧宾夺主。
  • 文字动画密度与控制原则:动态文字不是随机漂浮的装饰,而是经过精密设计的视觉主角——文字在画面中高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组,运动轨迹与节奏必须由提示词显式指定,不得交由模型随机生成。每个含文字的镜头必须满足三个设计要求:①运动动词明确——从运动动词库(高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组、拉伸、撞入、越框、印刷错位、逐词重拍弹入、定格爆裂)中选择并组合使用,禁止只写"动态文字"而无具体运动;②节奏映射精确——声明文字运动由哪个节拍触发(重拍下拍、人声起唱、乐句收束)、持续几拍、以什么方式收束或消失;③运动有始有终——文字必须完成完整的运动周期(出现→运动→收束/消失),不得突然出现又突然消失或无规律闪烁。整体气质保持高级、克制、统一,像平面设计师与3D动态设计师制作的字体实验影像,而非随机字幕堆叠。
    七、动作编排运动栈
    每个分镜或时间段的动作编排遵循:镜头运动 → 主体动作及面部肌肉 → 空间与环境运动 → 物理拟音与对白
  • 镜头运动:机位、景别、手持/轨道跟拍轨迹、自动切镜节点。
  • 主体动作:角色肢体动作、面部表情力度、物理交互。多角色时规划视线交汇与身体朝向。当已通过占位符绑定角色参考图时,此部分只写动作、表情与情绪,严禁再描述面部特征、发型、服装、妆造等外观信息——外观由参考图承载,重复文字描述会与参考图冲突并降低一致性。
  • 空间运动:环境元素运动(风、水、光、烟雾、粒子等),前景/背景层次运动差异。
  • 物理拟音与对白:物理音效用 <...> 包装,对白用 {角色名:"对白文本"} 包装,屏幕文字用 【...】 包装。
    MV动作能量强制注入规则:
  • 提示词中每个镜头的主体动作描述必须包含明确的速度词与能量词(如"快速""利落""爆发""急停""大幅度""高能量"),禁止只写笼统的"跳舞""唱歌""表演"——模型在缺乏速度与能量指令时会默认生成缓慢、保守的动作。
  • 舞蹈与唱跳段须在提示词中写入具体的肢体动作拆解(如"右臂快速上甩+左脚后撤半步+肩部连续切分"),而非泛泛的"随音乐跳舞"。
  • 镜头运动须写入具体运镜方式与速度,从分镜设计器的"运镜技巧库"(十)中选取或组合(如"极致低角度仰拍拉升,鱼眼微畸变,从脚部极速拉升至脸部""360°快速环绕半圈运镜+高频震镜同步鼓点"),禁止只写"镜头运动"或完全不描述运镜——无运镜指令时模型倾向生成固定机位画面。单个镜头可叠加 2 种运镜但不超过 3 种,相邻镜头运镜方式须有明显差异。
  • 文字动画须写入具体的动态效果与运动动词组合(如"歌词'心跳'二字随重拍高速出现→放大→旋转压缩→碰撞分解为粒子→重组消失,持续2拍""标题从右侧撞入画面并印刷错位抖动,随人声起唱定格爆裂"),从运动动词库(高速出现、放大、旋转、压缩、碰撞、分解、增殖、反转、重组、拉伸、撞入、越框、印刷错位、逐词重拍弹入、定格爆裂)中选择并组合,禁止只写"动态文字"或完全不描述文字动画——缺乏明确运动指令时模型会生成随机、零散、无序的文字效果。
  • 每个镜头须包含至少一个表演高光瞬间(定格 pose、爆发动作、特写情绪),在提示词中标注其出现时机与动作细节,避免全程平铺直叙。
    八、负向约束尾缀
    每段视频提示词尾部必须带上对应风格的反向约束:
  • 有音频模式通用项:遮免无关字符,遮免口型不同步,遮免动作僵硬,遮免动作缓慢拖沓,遮免静态长镜头无运镜,遮免表演呆板无高光,遮免文字动画缺失或静止,遮免文字动画随机无序与零散漂浮,遮免文字运动缺乏设计意图,遮免文字突然出现又突然消失,遮免闭嘴摆拍,遮免文字乱码,遮免手写字幕轨,遮免歌词错字与乱码。默认风格 C 的 3D 甜酷字效(橡胶气泡字体、果冻塑料、镀铬材质)不视为违规,但须保持字形可读且不遮挡眼睛与核心表情。
  • 全视频驱动模式通用项:遮免人物突变,遮免场景重置,遮免动作方向跳变,遮免动作缓慢拖沓,遮免静态长镜头无运镜,遮免表演呆板无高光,遮免文字动画缺失或静止,遮免文字动画随机无序与零散漂浮,遮免文字运动缺乏设计意图,遮免音乐风格突变,遮免音色突变,遮免音量断层,遮免额外后置BGM,遮免逐段音频完全复制,遮免逐段画面内容重复,遮免文字乱码,遮免手写字幕轨,遮免歌词错字与乱码,遮免水印。根据风格追加专属负面词。
    九、>15秒长视频分步切片输出
  • 总时长超过 15 秒时,全视频驱动默认路径按原生音乐节奏、乐句收束、自然停顿或动作完成点逐段输出提示词,每段 4—15 秒(整数秒),严禁按任何固定时长强制截断,必须根据音乐节奏、曲式结构或歌词段落拆分;外部参考音频路径按音频结构分析的自然乐段边界切分,并确保视频时长为整数秒且大于等于对应音频片段时长。
  • 结尾附带进度状态:"当前切片进度:[00:00-00:12] 已完成(第1/N条)"。每条切片生成完成后执行完整自检并给出优化建议,通过交互卡片让用户选择"确认并继续下一条""优化重制本条"或"接受当前版本"后再推进;只有出现质量失败、达到重试上限或 reference_video 绑定异常时才暂停并用卡片让用户决定。
  • 全视频驱动默认路径从第二切片起持续挂载上一段已通过视频作为 reference_video;外部音频驱动路径不使用上一段视频作为 reference_video,跨切片风格统一仅通过提示词维护,持续挂载对应参考音频分段。
  • 每切片提示词需在开头同时继承上一切片的视觉状态账本与原生声音状态账本终态锚点。
  • 跨切片动画效果演进与去重:多切片项目中,每切片的文字动画运动动词组合、字体材质搭配、转场手法与特殊镜头技巧必须在上一切片基础上发展新方案,严禁跨切片复制同一套文字动画模板或运镜方案。提示词中可声明本切片相比上一切片在视觉语言上的演进方向(如"上一切片以心形虹膜擦屏开场,本切片改用色块擦屏+RGB 分色切入")。3D 甜酷字效、撕纸拼贴、丝网印刷等效果均允许使用,但须在切片间交替选择不同组合,避免逐段堆叠完全相同的质感层。
    十、默认风格参考提示词模板(Y2K 潮流与 3D 甜酷字效 MV)
    用户未指定视觉风格时,默认使用此模板。以下为标准结构示例,生成时须根据实际角色与场景替换内容,但保持结构与风格规则不变。
    渲染配置头部:采用以下格式声明生成参数与多模态职责,置于提示词最前面:

渲染配置

  • 模型标识:MiniMax-H3
  • 视频时长:[默认 15 秒]
  • 画面画幅:[默认 16:9]
  • 多模态职责:[全视频驱动首切片无用户参考视频时不写占位符;第二切片起声明"视频1负责继承上一段的人物、妆造、场景、动作方向、机位、剪辑节奏和原生声音风格";只有用户明确启用静帧锁定路径时才逐图说明图片职责,如"图1负责角色的面部五官、发型、服装及标志道具的绝对身份与造型一致性"]
    提示词六层结构(生成时必须遵循此顺序)
    每条默认风格提示词必须按以下六层结构撰写,先全局后逐镜:
  1. 风格概述段(一段话):声明整体视觉气质——Y2K甜酷K-pop/说唱MV、高级时尚表演影片与膨胀式3D糖果字体图形系统融合、角色人数与服装色系、Q版娃娃脸/真人甜酷表情、视觉风格关键词(柔和粉彩甜酷能量、Y2K游戏UI、糖果光泽饰面 × K-pop强势女性说唱能量)、质感组合(35mm胶片颗粒 + 柔光泛光 + 虹彩全息箔 + 果冻塑料高光 + Y2K扫描线 + 糖果点状半调 + VHS画面振动 + 塑料玩具表面反射 + 闪粉彩屑雨)、剪辑规则(快节奏、只用硬切、无淡入淡出、每次切镜跟随低音重击/军鼓/说唱人声冲击)。全视频驱动路径声明由视频模型原生生成音乐与人声;第二切片起声明继承上一段的声音风格。
  2. 角色表演段:逐角色描述保留特征(相同的面容、眼型、妆造、服装色系与造型、冷感表情),每位角色的标志道具(水钻麦克风、毛绒熊斜挎包、心形太阳镜等),然后列出表演动作清单——强烈眼神交流、点头、肩部律动、向镜头倾身、手推向镜头、军鼓重拍时眨眼、低音下落时吐舌、跟随节拍甩发、利落身体动作。声明对口型要求。禁止只写"她们在表演"——必须写出具体动作动词与节拍触发关系。
  3. 字体动画段:声明全局字体规则——字体是视觉武器而非字幕、不是静态图形;列出可用字体语言(膨胀式3D橡胶泡泡字体、果冻塑料材质、粉/薰衣草紫/冰蓝铬面、柔软蓬松糖果字母、压缩粗体气球字体、纵向拉伸蓬松字母、手写涂鸦标题、3D挤出糖果文字、故障位移、套印错误效果、Y2K游戏UI像素损坏);声明文字只在节拍击中时出现、人物可遮挡文字、文字可遮住部分服装但绝不遮挡眼睛或主要面部表情;单镜头仅一个核心文字事件——每个镜头只安排一组主文字及其运动序列,不堆砌多组文字同时出现;微型Y2K贴纸随节拍爆开(爱心、星星、笑脸、闪光、链环、蝴蝶结、四叶草、迷你熊)。
  4. 背景体系段:声明全局背景策略——逐镜切换差异化极简酷炫背景,统一于整体色调体系(如粉黑甜酷色调),列出可轮换的背景类型清单(如反光舞台地面、霓虹光墙面、几何线条无影墙、烟雾空间、星光粒子场、蝴蝶结剪影背景、渐变玻璃质感等),每个镜头从中选取不同背景,避免所有镜头共用同一背景造成视觉单调。
  5. 创意点缀元素段:声明全局创意点缀元素库——珍珠粒子飘散、细闪光斑、速度线、迷你图形漂浮(蝴蝶结/爱心/星星)、glitch故障条纹、星光碎闪、胶片刮痕等,随节奏点状出现,不抢夺人物主体。声明这些元素在每个镜头中只选 1—2 类点缀,不可全部堆叠。
  6. 全局音频设计段:声明 BGM 总设定(曲风、BPM、节奏骨架、能量递进方向)与三层音效规则——①节奏锚点层:底鼓/clap 严格卡帧,对应每次镜头切换与视觉重音;②动作细节层:匹配人物肢体、服饰、饰品的细微音效;③特效转场层:对应文字动效、运镜、转场的电子/故障音效。三层协同服务于画面节奏,不抢BGM主线,空间感随镜头景别同步变化。全视频驱动路径声明由视频模型原生生成上述全部音频;第二切片起声明继承上一段原生声音风格。
    时间段结构(0—3秒格式)
    采用"X—Y秒 | 场景描述「屏幕文字」"作为标题(按整数秒切分,首尾相接,循环直至总时长结束),每个时间段必须包含以下要素,缺一不可:
  • 画面设计:按【前景-主体-背景】三层空间描写。
    • [前景]:失焦散景、视差元素、贴纸漂浮、网格线等前景装饰,增强空间纵深。
    • [主体]:焦平面核心主体,描述角色动作、面部表情、物理交互——必须写出动作动词与节拍触发关系(如"第二次军鼓声时用力甩发""低音重击时五指张开"),禁止笼统的"跳舞""唱歌"。若已绑定参考图则只写动作表情,不重复外观。
    • [背景]:环境空间、氛围色调、景深虚化程度、多重杂质层。逐镜须使用不同背景——从全局背景体系段声明的轮换清单中为每个时间段选取不同背景,避免所有时间段共用同一背景。
  • 镜头:具体景别(极近特写/中近景/特写/全景等)与机位运动——从分镜设计器"运镜技巧库"(十)中选取具体运镜技巧并写明速度(如"极致低角度仰拍拉升,鱼眼微畸变,从脚部极速拉升至脸部""希区柯克推拉变焦,背景快速收缩"),禁止只写"镜头运动"。
  • 转场(出场):每个时间段必须显式声明出场转场方式。可使用心形虹膜擦除入场(仅入场)、闪光、物体遮挡、色块擦屏、glitch闪切、动作匹配切、粒子消散切、文字遮挡切等冲击转场,但出场必须硬切。相邻时间段的转场手法须变化,不得连续使用同一转场。
  • 排版与歌词:该时间段出现的具体文字内容、3D 字体材质与颜色(如"粉色果冻橡胶3D字体,光亮糖果表面,柔和内发光")、运动动词序列与节拍触发(如"字母从左右两侧撞入画面→随低音振动并挤压变形→尾音处彩屑爆开")。单镜头仅一个核心文字事件——每个时间段只安排一组主文字及其运动序列,不堆砌多组文字同时出现。每个时间段的文字动画必须独立设计,不得复用同一套运动模板。歌词来自校准歌词,用 {角色名:"歌词"} 包装;无参考音频时写明原生人声歌词方向。
  • 音效与驱动(每个时间段均须声明):写明该时间段对应的三层音效方向——①节奏锚点层(对应本次镜头切换与视觉重音的底鼓/clap);②动作细节层(匹配本时间段人物肢体、服饰、饰品的细微音效);③特效转场层(对应本时间段文字动效、运镜与转场的电子/故障音效)。全视频驱动路径由视频模型原生生成上述全部音频;第二切片起声明继承上一段原生声音风格。有外部参考音频时声明画面动作、身体律动、卡点切镜与对口型由参考音频驱动,但文字内容与显示顺序严格按照校准歌词。
    关键风格规则汇总
  • 主体为 照片级写实真人表演,甜美、俏皮、自信与少量锋利感并存;通过自然演唱、说唱、舞蹈和眼神互动建立表演张力,不把任何特定人物、性别组合或职业固定为默认。
  • 色彩采用 糖果粉、薰衣草紫、冰蓝、薄荷绿、奶油白中的有限组合,以镜面银或少量黑色建立高定对比;每镜头只保留 2—3 类主要材质或媒介纹理。
  • 逐镜差异化背景:每个镜头须使用不同背景,统一于整体色调体系,避免视觉单调;从全局背景体系段的轮换清单中选取。
  • 文字采用 超大膨胀 3D 橡胶气泡字体、果冻塑料材质、镀铬材质,是视觉武器而非字幕——在鼓点重击时撞入画面,可越框和叠压人物轮廓,不得遮挡眼睛与核心表情;周围伴随 Y2K 贴纸爆破。
  • 剪辑 全片仅使用硬切,每一次切镜头严格踩在贝斯重击、军鼓、Rap 台词重音上;默认不用淡入淡出,一镜到底不作为默认结构。
  • 镜头语言从分镜设计器"运镜技巧库"(十)中按节拍动态选择(推拉变焦类、横移甩镜类、环绕旋转类、俯仰升降类、震动卡帧类、穿越层次类),辅以心形虹膜擦屏、破裂 Y2K 小卡框、RGB 分色与 VHS 错位等特殊手法,避免固定镜头模板和镜头效果全量堆叠。
  • 多重杂质层允许加入 35mm 胶片颗粒、全息彩虹箔、Y2K 扫描线、糖果网点颗粒、VHS 画面震动或闪粉雨,以复古数字噪声与塑料质感衬托现代高定画面。
  • 每个时间段须声明三层音效方向(节奏锚点层 + 动作细节层 + 特效转场层),由视频模型原生生成。
  • 默认全视频驱动:由视频模型同时生成画面与原生音频,后续镜头只使用上一段已通过的视频延续;不额外生成 BGM 或静帧资产。
    时间段示例参考(结构密度标杆,生成时根据实际内容替换)

0—4秒 | 亮相登场「RUN NOW」
画面设计:

  • [前景]:粉蓝双色 Y2K 贴纸(爱心、星星)在镜头四周闪烁漂浮,半透明全息彩虹光晕抖动。
  • [主体]:照片级写实真人表演。成员A直视镜头,可爱冷感娃娃表情,大而水润的眼睛,柔和腮红,霜粉色唇蜜,一只眼下方贴水钻泪滴贴纸。开始说唱,粗大水钻麦克风从画面下方进入,她紧握。
  • [背景]:高饱和度糖果粉到薰衣草紫渐变反光舞台地面,头顶漫射柔光,地面映出人物倒影,漂浮 Y2K 透视网格线虚化。
    镜头:从中景平滑推进至胸部特写。
    转场:粉色心形虹膜擦除入场(仅入场),文字瞬间全屏放大覆盖画面,硬切出场。
    排版与歌词:超大膨胀 3D 橡胶气泡字体"RUN NOW" — 粉色果冻橡胶3D材质,光亮糖果表面,柔和内发光,字母像蓬松气球纵向拉伸,从左右两侧撞入画面→随低音振动并挤压变形→在她脸颊上投下柔和粉色阴影→尾音处彩屑爆开。说唱:"Run now, I don't chase."
    音效与驱动:①节奏锚点层——开篇第一重重底鼓落下,同步厚重金属砸击声对应文字砸入;②动作细节层——麦克风握持的金属碰撞声 + 珍珠粒子细碎闪烁的轻脆叮当声;③特效转场层——镜头推进的风啸声 + 心形虹膜擦屏的电子音。

4—9秒 | 甜酷说唱「BREAK LIMIT」
画面设计:

  • [前景]:链环图形横扫画面,闪光贴纸每个节拍弹出。
  • [主体]:成员B轻微仰角表演,薰衣草紫皮草夹克,毛绒熊包在臀侧弹动,粗珍珠项圈。肩膀跟随节奏击打,第二次军鼓声时用力甩发。
  • [背景]:纯黑背景搭配赛博粉霓虹光墙面,带细微砖墙纹理,光线氛围感强,与上一镜的明亮渐变形成反差。
    镜头:中近景,轻微仰角,相机环绕15°。
    转场:横向glitch故障条纹扫屏,闪切出场。
    排版与歌词:超大膨胀 3D 橡胶气泡字体"BREAK LIMIT" — 冰蓝果冻塑料材质,柔软膨胀笔画,糖衣质感,字母通过弹性缓动逐个出现→撕裂→重组→军鼓声时旋转360°→随低音晃动。说唱:"Break limits, break rules."
    音效与驱动:①节奏锚点层——第二重重拍落下,合成器bass跟进,电子clap拍手声加入;②动作细节层——发丝甩动的破空声 + 皮草夹克摩擦声 + 珍珠项圈碰撞声;③特效转场层——字母撕裂重组的颗粒爆裂声 + glitch故障条纹扫屏的撕裂声。

9—15秒 | 手部攻击与定格「NO APOLOGY」
画面设计:

  • [前景]:竖排 3D 膨胀气泡文字穿过手背,角落"XOXO"贴纸脉动。
  • [主体]:成员C俯身越过镜头,手伸向镜头。粉色长款亚克力甲,3D星星和爱心饰件。低音重击时五指张开。
  • [背景]:粉色烟雾弥漫空间,光线穿透烟雾形成丁达尔效应,与前两镜的硬表面背景形成质感反差。
    镜头:俯拍角度,手持振动。
    转场:落地瞬间烟雾炸开弥漫全屏,硬切出场。
    排版与歌词:纵向拉伸 3D 膨胀气泡字体"NO APOLOGY" — 粉色果冻蓬松材质,字母视觉上穿过她手背,手遮住部分字体,低音重击时五指张开→字母碰撞分解为粒子→重组消失。说唱:"No apology, no regret."
    音效与驱动:①节奏锚点层——第三重重拍,808底鼓重击,能量推至高潮;②动作细节层——亚克力甲划过空气的利落风声 + 手指张开的细微关节声;③特效转场层——字母碰撞分解为粒子的碎裂声 + 烟雾炸开的朦胧气声 + 定格瞬间的厚重低频"咚"声。

全局音频设计:轻快明亮、充满活力感的 Y2K 甜美电子流行乐曲风(Synth-pop / Future Bass),4/4拍,速度约120BPM,以厚重808底鼓为节奏骨架,搭配清脆电子clap与甜酷合成器lead旋律,能量逐镜递进。三层音效(节奏锚点层 + 动作细节层 + 特效转场层)协同服务于画面节奏。全视频驱动路径由视频模型原生生成上述全部音频;第二切片起以 reference_video 原生音轨为参考延续。
此示例展示了每个时间段应有的文字动画密度与运动动词精度、逐镜差异化背景、单镜头单一核心文字事件与三层音效设计——生成时不得低于此密度,每个时间段的文字必须独立设计运动序列,禁止多时间段复用同一套文字动画模板,每个时间段须使用不同背景并声明三层音效方向。
十一、情感润色规范
把抽象情绪词("开心/难过/紧张")转化为可拍摄的表演细节,禁止只写抽象情绪标签。

  1. 情绪编排四件套:每个表演段落至少给出——眼神方向(看向镜头/移开/低垂/侧瞥)+ 眉眼变化(微挑/紧蹙/舒展/半眯)+ 嘴部状态(抿唇/微张/咬唇/上扬)+ 呼吸节奏(屏息/急促/缓慢吐出)。
  2. 身体三件套肩颈松紧(耸肩/沉肩/侧倾)+ 重心方向(前倾/后仰/侧移/下沉)+ 手部/道具动作(点耳麦/扶帽檐/挥挎包/托腮)。
  3. 时间三拍节奏:动作按 触发→峰值→反应 三拍编排——触发建立动机,峰值释放能量,反应收束余韵。
    十二、时间压缩写法
    根据镜头时长压缩表演描写密度,避免逐秒堆砌情绪:
  • 2—3 秒镜头:只写"触发→峰值",一个动作一个情绪点,不铺陈过程。
  • 4—6 秒镜头:写"触发→动作→反应",允许一个动作转换与一个情绪变化。
  • 8—10 秒镜头:写完整三拍(触发→峰值→反应),动作随重拍逐步升级。
  • 15 秒片段:不逐秒堆情绪,只抓 2—3 个关键镜头的高光瞬间,其余段落用连续动作串联。
    十三、MV 常用情绪组合参考
    根据角色人设选择适配的情绪组合,写入提示词时给出具体表演细节而非标签:
  • 毒舌冷静女主:平静淡然(眼神平视+嘴角微抿+肩颈放松)→ 轻蔑不屑(侧瞥+单眉微挑+重心后仰)→ 少量得意洋洋(嘴角缓升+下巴微抬+指尖轻敲)。
  • 俏皮唱跳女主:得意洋洋(挑眉+嘴角上扬+小幅肩摇)→ 内敛浅笑(眼神弯弯+抿唇+手扶帽檐)→ 恍然大悟(睁眼+微张嘴+前倾)。
  • 其他角色人设可参照此结构自行组合,核心原则是每段情绪须有过渡而非跳跃。
    十四、常用动作库(可直接注入提示词的标志动作)
    根据风格与段落选用,动作须与音频重拍同步:
  • 演唱类:点耳麦、扶帽檐、握麦架前倾、闭眼仰头高音、手指指向镜头。
  • 舞蹈类:枪花手势、交叉步、heel-toe、shuffle 滑步、肩部切分、胸口 pop、tutting 方框、半圈转身、靴跟重拍、hit pose 定格。
  • 表情类:wink 眨眼、咬唇侧头、吐舌俏皮、低头抬眼、手指比心。
    十五、负面表演约束
    以下情况视为表演描写错误,须修正后再提交:
  • 禁止只写"开心/难过/生气"等抽象情绪词,必须给出至少一个脸部细节 + 一个身体动作。
  • 禁止每个镜头都大笑/大哭/瞪眼,情绪须有起伏与留白。
  • 禁止表情与动作矛盾(如"开心地握紧拳头颤抖"——开心与颤抖不匹配)。
  • 禁止空口(有音频但嘴部无动作)、错口型(嘴型与歌词音节不符)、停唱(音频在唱但角色闭嘴)、提前或滞后(动作早于或晚于重拍)。
    十六、中途修改提示词残留清除
  • 当用户中途修改角色设定、场景设定、视觉风格等参数后,所有后续提示词须以更新后的设定与绑定的参考资产为准,严禁残留任何与旧设定矛盾的外观描述、风格关键词或场景描写。
  • 已生成的旧版提示词如需复用,须逐段对照新设定清理旧信息后再使用,避免旧版残留文字与更新后的参考图 / 规格书冲突导致生成偏差。
6. 视频合成
  1. 时间轴无缝拼接与跨切片连续性质检
    • 必须以各切片生成的 shot 为基本视频层单元进行时间轴拼合。
    • 核心质检:站在观众视角完整审视拼接后的长视频,检查画面与音频是否同步、歌词与口型是否匹配、跨切片风格是否连续、前后段落是否存在逻辑断层。
    • 严格核对视觉状态账本与原生声音状态账本:角色位置、姿态、道具、光影、情绪终态,以及音乐类型、配器、人声音色、速度、节拍相位、环境底噪、声场与音量终态必须合理衔接。
    • 若发现口型不同步、文字乱码、风格偏移、角色漂移、道具消失,必须精准定位并打回重制对应切片。
  2. 多镜头节奏控制
    • 检查每个切片视频内部的自动切镜节点,画面切换必须自然。
    • 有参考音频时,切镜卡点必须与音频节拍同步。
    • 严禁出现无切镜的静态长轴视频。
    • 动作推进镜头、情绪特写镜头、歌词展示镜头之间应形成呼吸节奏,不可全程高强度堆奇观。
  3. 歌词与口型同步质检
    • 有参考音频时,逐切片校验画面动态文字是否与 Final_Video_Spec.md 中的校准歌词一致、是否严格按照校准歌词文本逐字逐句显示(不得由音频自适应驱动文字内容与显示顺序)、是否与角色嘴唇运动同步。
    • 严禁出现歌词错位、错词、乱码、无关字符。画面文字必须来自提示词中写入的校准歌词,不得出现模型自行识别的错误歌词。文字动画必须具备明确运动动词与设计意图——逐切片检查文字运动是否随机零散漂浮、是否突然出现又突然消失、是否缺乏完整的运动周期(出现→运动→收束/消失),发现问题时定位到具体切片并在提示词中补充具体运动动词与节奏映射。
    • 严禁在视频中出现手写字幕轨:逐切片排查并清除任何手写字幕或固定字幕轨;画面文字仅允许来自提示词中写入的校准歌词、由模型严格按照校准歌词文本逐字逐句生成的动态文字动画。
  4. 视觉风格一致性质检
    • 逐切片检测:是否保持所选风格的独占视觉规则。
    • 背景差异化检查:逐镜头核对是否使用了不同背景,避免所有镜头共用同一背景造成视觉单调;发现背景重复时定位到具体镜头并要求更换。
    • 文字字效一致性:默认风格 C 使用 3D 甜酷字效(橡胶气泡字体、果冻塑料、镀铬材质),须保持字形可读且不遮挡眼睛与核心表情;非默认风格按各自专属字效规则检测。同时检查每个镜头是否仅一个核心文字事件,不堆砌多组文字。
    • 转场风格一致性:默认风格 C 允许使用纸张撕裂与杂志剪贴转场作为风格选项,但须控制用量;其他风格按各自转场规则检测。
    • 角色剪影一致性:不得在不同切片中脸型、发型、服装结构大幅漂移。
  5. 原生音轨拼合与可选 audio_layer 控制
    • 全视频驱动默认路径保留每个 shot 随视频生成的原生音乐、人声、对白与环境音,不额外生成或导入独立 BGM。
    • 检查相邻原生音轨在音乐风格、配器、人声音色、速度、节拍相位、环境底噪、声场与音量上的连续性;在不破坏节拍和口型的前提下使用裁切、音量包络或短交叉淡化消除声音断层。
    • 只有用户明确选择非默认音频路径时,才导入规划好的独立 audio_layer,包括环境音效轨道(sfx)、背景音乐轨道(music / bgm)及旁白轨道(narration)。
    • 精准微调原生音轨及可选独立音轨的音量(Volume)、淡入淡出(Fade In/Out)与 shot 时间线卡点,禁止音乐遮盖角色对白与歌词。
  6. 转场与出片管理
    • 切片内部采用自然硬切,切片之间可采用高光闪白、色块擦屏、光学拉丝眩光等电影化转场。
    • 控制撕纸与拼贴用量,避免喧宾夺主;禁止现代短视频花字与无物理依据的炫技转场。
    • 最终输出:完整连载视频文件、内部镜头切片清单、视觉状态账本、歌词映射节点、音轨层级分配清单。
  7. 转场接口规范
    • 首尾帧可继承性核查:逐段检查每段结尾帧与下一段开头帧是否在颜色基调、动作方向、道具状态、角色朝向上具备可接续性;若存在断裂,须打回重制或在合成层补入遮罩转场弥合。
    • 转场类型适配:遮挡转场(角色或物体划过镜头自然遮蔽切点)、光闪转场(高光闪白或色块擦屏)、短黑场(≤0.3 秒)须根据相邻镜头的情绪与节奏选择,不可滥用同一转场。
    • 相邻镜头差异化检查:相邻两个镜头在景别、角度、情绪中至少有一项发生变化,避免视觉重复造成的节奏停滞。
    • 跨切片动画去重复检:逐切片比对文字动画运动动词组合、转场手法与特殊镜头技巧,确认各切片使用了不同的视觉方案而非循环复制同一套模板;发现跨切片重复时须定位到具体切片并要求重新设计该段的动画方案。
    • 转场与声音卡点对齐:全视频驱动路径以 reference_video 延续的原生音乐重拍、乐句收束、段落转换或自然停顿对齐转场;外部参考音频路径则以参考音频节拍对齐。禁止在乐句中途无依据地插入转场。
  8. 最终导出检查与交付清单
    • 画面规格检查:逐项比对 Final_Video_Spec.md 中的画幅、分辨率、帧率、总时长、封装格式与编码;检查横竖屏适配和画面拉伸,任何不匹配项必须修正或记录为用户已接受的例外。
    • 音频峰值检查:检测综合响度与 True Peak,确保无削波、爆音、异常静音、声道错误或音乐遮盖人声。用户未指定具体数值时,按目标发布平台的通用安全标准执行,并在质检报告中记录实测值。
    • 安全区检查:针对目标发布平台检查画面与文字安全区,确保主角面部与口型、品牌标识、标题、歌词和关键道具不被裁切,不进入平台 UI、圆角或刘海区域的高风险遮挡范围。
    • 文字检查:逐帧抽查全部可见文字,检查错字、乱码、无关字符、重复字母、字幕违规、歌词错位、字效越界和可读性;发现问题时定位到具体切片或文字层处理。
    • 同步与连续性复检:最终导出文件再次检查音画同步、歌词/口型同步、卡点、转场接口、角色与道具连续性,防止时间线渲染后产生偏移。
    • 交付清单:最终成片、从成片抽取并按需裁切的封面帧、Final_Video_Spec.md、Storyboard 与切片清单、视觉状态账本、原生声音状态账本、视频参考链、歌词映射节点、音轨层级分配清单、积分消耗台账、最终质检报告。用户明确要求并已生成独立封面时再列出对应 16:9/9:16/1:1 文件;未生成或用户未要求的项目须明确标注,不得虚构交付物。