Y2K 3D 卡通 MV
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
Y2K风格3D卡通K-pop MV制作。角色数量灵活(独自1人或主角+最多2位伴舞),每位角色可上传照片生成匹配长相的卡通形象或使用默认设定;上传音乐自动分析节奏与歌词(若有),有歌词时角色口型对上唱歌节奏并将歌词嵌入MV视觉特效,无歌词时角色跟随节奏跳舞并与装饰文字互动。适用于音乐视频、舞蹈视频等场景。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
整体流程与依赖关系:
- 确认角色方案与照片上传(可选) — 询问用户角色数量:独自一人(1位主角) 或 主角+伴舞(最多1主角+2伴舞=3位)。每位角色均可选择上传照片或使用默认形象——主角和伴舞独立选择,不要求全部上传或全部默认。用户上传照片的角色严格按照片生成卡通形象;未上传的角色按默认设定生成。确认角色方案后进入下一步。
- 上传音乐并分析 — 用户提供一段音乐文件(可能含人声歌词,也可能是纯音乐/无人声)。调用 resource_prepare_and_analyze 分析音乐:首先检测是否含人声歌词——若检测到歌词,提取歌词文本(逐句时间码)并输出
has_lyrics: true;若为纯音乐/无人声,跳过歌词提取,输出has_lyrics: false。无论是否有歌词,均输出节奏段落划分、节拍结构及总时长。歌词必须且只能从用户上传的音乐文件中提取,禁止自行编造或生成歌词。 - 建立全局规格 — 根据音乐总时长、用户选择的角色方案(角色数量及每位角色的上传/默认选择),通过 text_editor 建立 Final_Video_Spec.md(标题、类型=卡通MV、画幅16:9、分辨率用户可选768p或2k默认768p、时长跟随音乐、视觉风格=Y2K 3D卡通、角色数量与方案、语言等)。
- 生成角色形象与环境背景(隔离生成) — 根据步骤1确认的角色方案,逐位处理:上传了照片的角色,调用 resource_prepare_and_analyze 分析照片面部特征后用 media_generator(ImageToImage)生成纯白背景形象;未上传照片的角色,按默认设定用 media_generator(TextToImage)生成纯白背景形象。随后用 media_generator(TextToImage)生成无人物环境背景图。生成后将角色形象和环境背景分别绑定到对应 key_element。
- 设计Storyboard — 调用 storyboard_designer,根据音乐段落和(若有)歌词将MV拆分为多个视频段(每段不超过15秒);每段内包含多个分镜描述,每个分镜为一镜到底(连续拍摄、无内部切镜),段内分镜之间通过 MiniMax H3 多镜头描述能力实现切镜。每个分镜指定角色、场景、舞蹈动作、镜头语言。根据
has_lyrics分支: 若有歌词,每个分镜额外包含歌词文本元素和角色口型对唱要求;若无歌词,每个分镜使用 Y2K 风格装饰性文字替代歌词文本,角色专注跟随节奏跳舞并与装饰文字互动。 - 生成视频段(连续拼接,直接参考生成) — 根据音乐总时长将MV切分为多个连续视频段,每段最长15秒(模型单次生成上限,非固定长度)。逐段调用 media_generator,每段使用一次 MultiModalToVideo + MiniMax H3 生成调用,通过多镜头描述在一个调用中产出包含多个分镜的完整视频段。段与段之间按音乐时间线连续衔接——第一段覆盖0–15秒,第二段从15秒开始继续,以此类推;最后一段可能不足15秒(如20秒音乐→第一段15秒+第二段5秒,45秒音乐→3段各15秒)。段数和末段时长由音乐实际总时长决定。每段时长不得低于4秒(MiniMax H3 的 duration 参数要求为4–15秒整数)——若按满段15秒切分后末段不足4秒(如33秒→15+15+3),需从倒数第二段匀出时长补入末段,确保每段≥4秒且≤15秒(如33秒→15+14+4或12+12+9等分配)。每段直接引用角色形象图和环境背景图作为参考输入,不生成中间关键帧图片,不做"先用关键帧图生成单段视频再拼接"的方式。每段由 media_generator 生成后,调用 resource_prepare_and_analyze(crop video segments)裁剪到该段的精确指定时长(如第一段裁到精确15.0秒,末段裁到精确剩余秒数),消除模型实际输出时长与指定时长的偏差,防止多段拼接时累积偏移。每段的 prompt 必须写明该段在音乐中的精确时间区间(如"this segment covers 0:00–0:15 of the song"),以及该区间内每句歌词的精确起止秒数(基于音乐分析的逐句时间码),使模型生成的口型节奏和歌词文本出现时机尽量匹配该段在音乐中的真实位置。
- 最终装配 — 调用 video_assembler,将所有视频段按音乐顺序拼接,叠加用户上传的音乐作为BGM音轨,导出最终MV。BGM 必须是用户上传的原始音乐文件,禁止使用任何生成音乐工具(text_to_instrumental、lyrics_to_song 等)生成替代音乐。 多段拼接对齐规则: 每段必须按其绝对音乐时间戳定位——第N段的起始位置 = 前(N-1)段实际时长之和(而非固定×15秒,因末段可能经4秒下限调整后各段时长不完全相同),而非简单首尾相接拼接;拼接前确认每段已通过 resource_prepare_and_analyze 裁剪到精确指定时长,段与段之间零间隙、零重叠;用户上传的音乐从0:00开始连续播放,视频段按各自绝对时间戳对齐到音乐时间轴上。
依赖关系: 步骤2依赖步骤1。步骤3依赖步骤2。步骤4依赖步骤1和步骤3。步骤5依赖步骤2和步骤4。步骤6依赖步骤5。步骤7依赖步骤6。
暂停检查点: 不要一次性跑完全流程。在以下里程碑暂停并向用户确认后再继续:
- 角色方案与照片上传确认后(步骤1完成后)
- 音乐分析完成并展示给用户确认后(步骤2完成后;若检测到歌词则一并展示提取的歌词)
- 角色形象与环境背景生成完成并展示后(步骤4完成后)
- Storyboard设计完成并展示后(步骤5完成后)
- 所有视频段生成完成后(步骤6完成后)
检查点确认方式(统一规则): 每个暂停检查点必须使用卡片按钮让用户确认,而非要求用户输入文字。每个检查点展示当前阶段结果后,提供两个按钮选项: - 确认 — 用户认可当前结果,直接进入下一阶段。
- 修改 — 用户需要调整,选择后引导用户用简短文字说明要改什么,再据此修改后重新展示并再次用按钮确认。
这样做是为了减少用户的输入操作,用户只需点击按钮即可推进流程。仅在用户点击"修改"后才需要输入文字说明修改需求。
Final_Video_Spec.md 要点: 在步骤3中尽早锁定画幅(默认16:9)、视频分辨率(用户可选768p或2k,默认768p)、视觉风格(Y2K 3D卡通)、时长(跟随音乐)、输出语言等全局参数,作为后续 Storyboard 和生成阶段的统一锚点。
音乐与歌词来源约束(全局硬性规则): - MV 的 BGM 音轨必须是用户上传的原始音乐文件,全程直接绑定使用,不得替换或覆盖。
- 禁止调用任何音乐生成工具(包括
text_to_instrumental、lyrics_to_song等)为本 Skill 生成音乐或歌曲。 - 歌词必须且只能从用户上传的音乐文件中通过 resource_prepare_and_analyze 提取,不得自行编造、改写或从其他来源获取歌词。
- MiniMax H3 视频生成会自带同步音频——该自带音频在装配时必须静音或大幅降低音量,确保最终 MV 的音频只有用户上传的原始音乐。
2. 多模态分析
照片分析(用户上传照片时):
- 对每张上传照片进行面部分析,输出结构化特征描述:脸型、五官特征(眼睛形状/颜色、鼻型、唇形)、发型(颜色、长度、造型)、肤色、辨识标记(痣、疤痕、纹身等)、整体气质。
- 输出格式应可直接用于 ImageToImage 的 prompt,明确指出"严格参考照片中人物的长相、发型和特征"来生成卡通形象。
- 区分主角照片与伴舞照片(若有多人),分别标注角色序号。角色数量由步骤1确认的方案决定(1–3位),仅对用户上传了照片的角色进行分析。
音乐分析: - 歌词检测与提取(条件性): 首先检测用户上传的音乐是否含人声歌词。若检测到歌词,提取完整歌词文本,按段落(前奏/主歌/副歌/桥段/尾奏)结构化输出,并输出
has_lyrics: true;若为纯音乐/无人声,跳过歌词提取,输出has_lyrics: false。歌词只能从用户上传的音乐中提取,禁止自行编写或从外部来源获取歌词。 - 逐句歌词时间码(仅当
has_lyrics: true): 为每句歌词标注精确的起止时间(秒),以便后续镜头设计中歌词文本与音乐播放进度严格匹配、角色口型与演唱节奏对齐。 - 歌词语言标注(仅当
has_lyrics: true): 在semantic_output中输出lyrics_language字段(如zh、en、ja、ko等),标明提取到的歌词原文语言。后续所有环节必须以该语言的原文歌词为准,不得翻译、替换或改写为其他语言。 - 节拍与节奏结构: 识别音乐整体速度(BPM)及各段落强度等级(高/中/低),输出结构化的节拍标记列表(段落起止时间 + 该段强度 + 建议切镜频率)。高强段落(Rap/副歌)建议高频快切,低强段落(前奏/桥段)建议放缓。无论是否有歌词,此步骤均执行。
- 输出音乐总时长,作为 Final_Video_Spec.md 的时长参数依据。
3. 故事板设计
key_elements(角色形象):
- 根据步骤1确认的角色方案设计对应数量的角色 key_element(1–3位),每位包含:角色编号、外观描述、服装造型、配饰。
- 角色数量灵活: 用户可选独自一人(1位主角)或主角+伴舞(最多1主角+2伴舞=3位)。每位角色独立决定是上传照片还是使用默认设定。
- 默认角色设定(未上传照片的角色使用):
- 角色一/主角(金发):金色双马尾辫,水晶泪珠妆容(crystal tear makeup),手持银色麦克风演唱;粉蓝色罗纹短款针织上衣。
- 角色二/伴舞一(粉发):粉色头发,身穿蓬松薰衣草紫仿皮草大衣(fluffy pastel purple faux fur coat),佩戴珍珠项链;自信表情。
- 角色三/伴舞二(黑发):黑色头发,戴粉色心形墨镜(pink heart-shaped sunglasses),伸手朝镜头方向伸出;彩色美甲和夸张戒指(colorful manicured nails and chunky rings);星形配饰。
- 所有角色均拥有大而富有表现力的眼睛、光泽嘴唇,cute and sassy 气质,光洁塑料质感 3D 动画风格(octane render)。多人时可穿 Y2K 时尚搭配(denim、fluffy coats、pastel tops)。
- 若用户选择独自一人且未上传照片,仅使用角色一(金发主角)的默认设定。
- 用户上传照片时: 该角色外观严格跟随照片分析结果(脸型、发型、特征),但保留Y2K风格化的服装、配饰和 anime 风格 3D 动画美学(光洁塑料质感、大而富有表现力的眼睛、光泽嘴唇、cute and sassy 气质、octane 渲染)。不要生成韩版可爱娃娃风格。
- 角色与环境隔离: 角色 key_element 的描述和生成图中不包含任何环境、场景或背景信息——角色为纯白背景。环境另设独立 key_element。
key_elements(环境/场景): - 设计独立的 element_scene key_element,与角色 key_element 严格分离。环境描述只包含抽象演播室背景(粉→蓝渐变)、Y2K道具与装饰元素,不出现任何人物。
- 根据音乐段落强度设计环境变体(如高强段落用更鲜艳热烈的配色和道具,低强段落用更柔和的渐变),每个变体作为独立的 element_scene。
shots(镜头设计): - 镜头拆分跟随音乐结构: 根据音乐段落和节拍标记拆分镜头,而非固定时长。每个镜头对应一个音乐段落片段,镜头起止点尽量对齐节拍/小节边界。无论是否有歌词,镜头拆分均以节奏结构为依据。
- 视频段时间区间必须精确且全局连续: 每个视频段(4–15秒,不得低于4秒)必须标注其在音乐中的精确起止秒数(如段1=0.0–15.0s、段2=15.0–30.0s、末段=剩余秒数),段与段之间无间隙无重叠,所有段的时间区间首尾相接覆盖音乐全长。此时间区间将直接写入视频生成 prompt 和装配对齐规则,是多段音画同步的基础——时间区间不精确会导致口型和歌词错位。
- 动态切镜频率: 切镜节奏由音乐分析输出的段落强度决定——高强段落(Rap/副歌)使用高频快切(约0.8–1.2秒/切),中强段落(主歌)使用中频(约1.5–2.5秒/切),低强段落(前奏/桥段/尾奏)放缓(约3–5秒/切或长镜头)。不使用固定切镜频率。
- 每个镜头描述必须包含:
- 时间区间: 该镜头对应的音乐起止时间(秒),用于后续装配时音画对齐。
- 场景: 用 element_scene ID 引用对应的环境背景(粉→蓝渐变演播室 + 该段落的Y2K道具和装饰),不在此处描述角色。
- 角色与动作: 出场的角色(用element ID引用)、舞蹈动作、手势、表情。当
has_lyrics: true时, 主唱角色的口型必须与该时间区间正在演唱的歌词节奏对齐——在描述中明确标注"singing, lip-sync to [歌词内容]",伴舞角色则跟随节奏跳舞。当has_lyrics: false时, 所有角色专注跟随节奏跳舞,无需口型对唱。 - 镜头语言: 以特写(CU)和中近景(MCU)为主;标注运镜方式(希区柯克变焦/Dolly Zoom、轻微手持晃动、快速推拉、三分屏Triptych同步剪辑等);标注该镜头的切镜频率(跟随段落强度)。
- 文本元素(根据
has_lyrics分支):- 有歌词时: 从该镜头时间区间内实际播放的全部歌词中提取内容,必须使用歌词原文逐字引用(包括中文歌词的原始汉字),不得翻译、替换为英文或自行改写。 "RUN NOW"、"NO APOLOGY"、"UNBREAKABLE" 等仅为3D气球文字的视觉风格参考,不是可使用的歌词内容——实际画面中出现的文字必须是从音乐中提取到的歌词原文。将歌词原文作为漂浮3D充气气球风格艺术字嵌入画面,分布在画面的不同位置(前景、中景、背景、角落等)。每句歌词都必须出现在画面中,不可遗漏。 所选歌词必须与该时间区间正在演唱的歌词严格对应,不可使用其他段落的歌词。较长句子拆分为短词组分别放置在不同位置,避免堆叠重叠——中文歌词按2–4个字为一组拆分(如"不想放弃"→"不想"+"放弃"),英文歌词按2–4个单词为一组拆分。
- 无歌词时: 使用 Y2K 风格装饰性短语(如 "RUN NOW"、"UNSTOPPABLE"、"NO APOLOGY"、"PINK OUT"、"UNBREAKABLE"、"BREAK THE LIMIT" 等)作为漂浮3D充气气球风格艺术字嵌入画面,分布在不同位置。不同分镜使用不同短语,避免重复。这些装饰文字不是歌词,仅作为 Y2K 视觉装饰元素。
- 角色与文字互动: 无论是否有歌词,每个分镜中至少安排一种角色与文字(歌词或装饰文字)的互动方式,增强画面趣味性和变化感。互动类型包括但不限于:用手抓取/拨开文字气球、拍打文字使其弹飞、脚踩踏文字、用手指戳破文字气球、将文字气球像球一样抛接、靠在文字上、从文字中间穿过、把文字戴在头上或挂在身上。不同分镜交替使用不同互动方式,避免单一重复。互动动作需写入该分镜的"角色与动作"描述中,与舞蹈动作自然结合。
audio_layer(音频层):
- 建立一个全局 BGM 音轨,绑定用户上传的音乐文件,跨度覆盖全部镜头。该音轨必须绑定用户上传的原始音乐文件本身,不得用生成音乐替代。
- 不需要额外生成音乐或旁白;MV的音频主体即用户上传的原始音乐。禁止调用 text_to_instrumental、lyrics_to_song 等音乐生成工具。
4. 媒体生成
角色形象图片生成(纯白背景隔离):
- 逐位角色独立生成: 根据步骤1确认的角色方案(1–3位),每位角色独立决定生成方式——上传了照片的角色使用 ImageToImage(以照片为参考,prompt 明确指定"严格参考照片中人物的长相、发型和特征",叠加Y2K 3D卡通风格化描述);未上传照片的角色使用 TextToImage(按默认角色设定生成)。推荐模型:GPT Image 2,分辨率 2K。每位角色生成一张形象参考图。
- 纯白背景要求: 角色形象图必须为纯白背景,画面只含角色本身——不含任何环境、场景、道具、背景色彩或其他人物。角色与环境的视觉信息必须完全隔离,避免污染画风。
- 角色形象图采用横排并排布局:左侧——头肩特写(五官、发型、肤色);右侧——全身造型(服装、配饰、鞋子、轮廓),以便后续视频生成时提供完整的角色参考。
环境/场景背景图片生成(无人物): - 使用 TextToImage 生成Y2K风格环境背景图。推荐模型:GPT Image 2,分辨率 2K。
- 无人物要求: 环境背景图中不出现任何人物,只包含抽象演播室场景(粉→蓝渐变背景)和Y2K道具装饰(漂浮气球风格艺术字、金属吊链、发光爱心贴纸、Error 404弹窗、REC取景框UI、像素风装饰、心形棒棒糖等)。
- 根据音乐段落需要生成多个环境变体(如高强段落用更鲜艳热烈的背景,低强段落用更柔和的背景),作为独立的 element_scene key_element。
视频镜头生成: - 使用 MultiModalToVideo。推荐模型:MiniMax H3,画幅 16:9。分辨率由用户选择:768p(默认,非会员可用)或 2k(需会员)。在步骤3建立 Final_Video_Spec.md 时询问用户偏好并锁定,后续所有镜头统一使用该分辨率。
- 每个镜头的参考输入必须同时包含出场角色的形象图片和对应的环境背景图片(通过 image_infos 绑定),角色与环境作为独立参考输入,不互相污染。
- 口型对唱(仅当 has_lyrics: true): 视频生成时,主唱角色的口型动作必须与该时间区间正在演唱的歌词节奏对齐。在 prompt 中明确描述角色正在唱歌、口型随歌词变化(如 "singing with lip movements matching the lyrics"),伴舞角色保持跳舞。当 has_lyrics: false 时, 角色不需要口型对唱,专注跟随节奏跳舞。
- 每个视频段最长15秒(模型单次生成上限,非固定长度),通过 MiniMax H3 的多镜头描述能力在一次生成调用中产出包含多个分镜的完整视频段。每个分镜为一镜到底(连续拍摄、无内部切镜),分镜之间的切镜由多镜头描述中的场景/角度转换实现。切镜频率由 Storyboard 中该段的段落强度决定。段与段按音乐时间线连续衔接:第一段覆盖0–15秒,第二段从15秒继续;最后一段可能不足15秒——段数和末段时长由音乐实际总时长决定(如20秒音乐→2段:15秒+5秒;45秒音乐→3段:15秒+15秒+15秒)。每段时长不得低于4秒(MiniMax H3 duration 参数下限)——若末段不足4秒,需从倒数第二段匀出时长补入末段,确保每段≥4秒。
- 段内时间锚点写入 prompt: 每段的视频 prompt 必须在开头写明该段的精确音乐时间区间(如 "this segment covers 0:15–0:30 of the song"),并在描述每句歌词/口型时标注其在段内的相对起止秒数(基于音乐分析的逐句时间码换算)。例如段2覆盖15–30秒,若某句歌词在音乐中为18.2–21.0秒,则 prompt 中标注 "at 3.2s into this segment, sing 'xxx' for 2.8 seconds"。这样模型生成的口型节奏和歌词文本出现时机尽量匹配该段在音乐中的真实位置,减少多段拼接后的错位。
- 生成后裁剪到精确指定时长(由 resource_prepare_and_analyze 执行): MiniMax H3 实际输出时长可能与指定时长有偏差(如指定15秒但输出14.7秒或15.3秒)。media_generator 本身不具备裁剪能力——每段视频由 media_generator 生成后,必须调用 resource_prepare_and_analyze(crop video segments)裁剪到该段的精确指定时长(满段裁到15.0秒,末段裁到精确剩余秒数如5.0秒),再进入装配阶段。这是防止多段累积偏移导致口型和歌词全盘错位的关键步骤——0.3秒的偏差在第二段就会产生可感知的错位,第三段以后会严重失同步。
- 不生成中间关键帧: 不使用 ImageToImage 预生成关键帧图片;歌词文本元素直接在视频 prompt 中描述,由 MiniMax H3 在生成时渲染。角色形象图和环境背景图作为参考输入直接绑定,不经过中间转换。
- 歌词原文渲染约束: 视频 prompt 中写入的3D气球文字内容必须与从音乐中提取的歌词原文逐字一致(包括中文汉字),不得替换为英文或自行编造文字。若歌词为中文,prompt 中需逐组用引号标注确切汉字并强调 "render the exact Chinese characters in quotes"。
- MiniMax H3 的 prompt 字符上限为 7000 字符(含占位符标签),可容纳更丰富的镜头描述。
音乐来源约束(硬性规则): - 本 Skill 禁止调用任何音乐/歌曲生成工具(包括 text_to_instrumental、lyrics_to_song 等)。MV 的全部音频来源于用户上传的原始音乐文件。
- MiniMax H3 视频生成会自带同步音频(对话/SFX)——该自带音频不作为 MV 音轨使用,在最终装配时必须静音或大幅降低音量,避免与用户上传的音乐冲突。
- 歌词文本由 resource_prepare_and_analyze 从用户上传的音乐中提取,不在 media_generator 中自行编写或生成歌词。
Asset Binding Contract: - 遵循当前 manage_item_assets 合约,使用 Storyboard 中的实际目标 ID,不在 Skill 中定义额外 ID 模板。
- 角色形象生成后,注册 asset_id 并绑定到对应的 key_element。
- 用户上传的照片和音乐文件同样需要注册 asset_id 并绑定到对应 Storyboard 锚点。
- 绑定前先调用 query_assets_info 检查;若缺失,调用 manage_item_assets 补充绑定(保留完整绑定数组),然后重新查询验证。
- 从资产的实际用途和计划位置解析绑定类型,不仅凭媒体标签推断。若一个资产服务多个用途,在 asset_bindings 数组中保留所有适用绑定。
5. 提示词撰写
口型对唱 prompt 规则(仅当 has_lyrics: true):
- 主唱角色的动作描述中必须包含口型对唱指示:明确写出角色正在唱歌、口型随歌词节奏变化,如 "singing into the microphone, lip-sync matching the lyrics [歌词内容]"。
- 对唱指示需与该分镜时间区间内实际演唱的歌词逐句对应,不可笼统描述。
- 伴舞角色描述中无需口型对唱,标注为 dancing to the beat。
无歌词模式 prompt 规则(当has_lyrics: false): - 角色 prompt 中不需要任何口型对唱或唱歌描述,角色专注于跟随节奏跳舞。
- 文本元素使用 Y2K 风格装饰性短语(如 "RUN NOW"、"UNSTOPPABLE"、"BREAK THE LIMIT" 等),不是歌词。不同分镜使用不同装饰短语。
- 角色与装饰文字的互动描写规则与有歌词时一致(抓取、拍打、踩踏、戳破、抛接等)。
文本渲染规则(两种模式通用): - 文本(歌词或装饰短语)以引号标注确切渲染字符串,确保模型尝试渲染。有歌词时,引号内的内容必须是从音乐中提取的歌词原文,包括中文汉字——不得用英文短语替代。 "RUN NOW" 等英文示例仅为3D气球文字的视觉风格参考,不是歌词内容。
- 中文歌词渲染专项规则: 当
lyrics_language为zh时,3D气球文字必须使用提取到的中文歌词原文汉字。为提高中文文字渲染成功率:(1) 每个气球文字组控制在2–4个汉字,避免整句堆叠;(2) 在 prompt 中用引号逐组标注确切汉字,如 "不想"、"放弃"、"向前跑";(3) 强调 "render the exact Chinese characters in quotes as 3D bubble text"。 - 文本风格需与Y2K美学一致:3D充气气球质感、光洁塑料光泽、糖果色(粉/紫/蓝)、发光效果。
- 角色与文字互动描写需具体到身体部位和动作幅度,与舞蹈节拍自然融合。
6. 视频合成
节奏与剪辑:
- 以用户上传的音乐为时间轴主轴,所有镜头按音乐段落顺序排列。
- 动态切镜频率: 切镜节奏由音乐分析输出的段落强度决定,不使用固定频率。高强段落(Rap/副歌)约0.8–1.2秒/切,中强段落(主歌)约1.5–2.5秒/切,低强段落(前奏/桥段/尾奏)约3–5秒/切或长镜头。切点尽量对齐音乐节拍/小节边界。
- 镜头间使用硬切为主,配合Y2K风格的UI元素转场(Error 404弹窗闪烁、REC取景框切换、像素风过渡)。
音视频同步: - 用户上传的音乐作为全局BGM音轨,音量满格,贯穿全片。该音轨必须是用户上传的原始音乐文件,不得使用任何生成音乐替代。
- 多段对齐(核心规则): 每个视频段必须按其在音乐中的绝对时间戳定位放置,而非简单首尾相接拼接——第N段的视频起始点对齐到音乐中前(N-1)段实际时长之和的位置(而非固定×15秒,因4秒下限调整后各段时长可能不完全相同)。拼接前确认每段已通过 resource_prepare_and_analyze 裁剪到精确指定时长,段与段之间零间隙、零重叠。音乐从0:00连续播放,视频段按各自绝对时间戳对齐到同一音乐时间轴上。若跳过此对齐步骤直接拼接,段间累积偏移会导致口型和歌词逐段错位。
- 歌词文本与音乐同步(仅当
has_lyrics: true): 每个镜头中嵌入的歌词文本必须与该时间段实际播放的歌词匹配;镜头起止点对齐音乐节拍标记,确保歌词文本随音乐播放进度变化。主唱角色口型对唱效果在装配时需与音乐演唱节奏对齐。当has_lyrics: false时, 无需歌词同步,镜头排列和切镜节奏仅跟随音乐节拍。 - 视频镜头的节奏点(快切、推镜)对齐音乐鼓点/重音。
- 生成的视频片段如自带音频(MiniMax H3会生成同步音频),需将视频自带音轨静音或大幅降低音量,避免与用户音乐冲突。
导出取向: - 画幅和分辨率跟随 Final_Video_Spec.md 设定(画幅默认16:9;分辨率由用户在步骤3选择:768p 或 2k,默认768p)。
- 最终MV时长与音乐总时长一致;若视频素材略长或略短,通过微调镜头时长或补充/删减快切来对齐。