音乐MV(需上传音乐)
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
用于通过已上传的音乐生成音乐视频。Nano Banana + Omnihuman + Seedance 2.5(分辨率 480p)。在关键阶段暂停以供用户确认;采用人机协作的单次(one-shot)流程。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
阶段逻辑与依赖关系:
- 分析已上传的音乐,导出其节奏结构、精确时间(时间戳)和歌词 → resource_prepare_and_analyze。
- 编写
Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、语言、模型偏好) → text_editor。 - 生成故事板(关键元素、镜头列表、音频层) → storyboard_designer。并将上传的音频绑定到audio layer → media_generator。
- 设置元素:如果用户已经上传了元素资源(如角色图像或参考库中的角色),请直接将其作为资产绑定到相应的关键元素上。否则,为所有元素生成图像 → media_generator。
- 为每个镜头生成一张关键帧图像以锁定视觉一致性;参考元素图像(第 3 步),后续镜头应参考之前类似的画面以保持连贯性 → media_generator。
- 为每个镜头生成最终视频;仅当该镜头中有可见人物正在说话或演唱、且可见嘴部必须与对应语音/人声音频匹配时,才使用 ImageToVideoByAudio(OmniHuman 1.5)。所有其他镜头(纯 BGM、舞蹈、剧情表演、舞台全景、观众反应、节奏跟随镜头等)一律使用 MultiModalToVideo(Seedance 2.5)。严格参考音频片段来驱动该镜头中的关键帧 → media_generator。
- 所有资源就绪后进行最终合成;然后引导用户导出 → video_assembler。
依赖关系: 2→1;3→1,2;4→2;5→3;6→3,5;7→3,6。
注意 — 用户提供或预先存在的媒体(主要影响第 3-6 步): 在填充生成内容之前,先通过 media_generator 将媒体绑定并分配到适当的分镜位置;避免重复生成用户已提供的内容。
何时暂停: 不要一次性运行所有步骤。在上述每个关键阶段(例如:规格确定后、故事板后、元素图像后、关键帧后、镜头视频后、音频后)停止,与用户确认,然后再继续下一步。使用卡片或 reply_to_user 在继续前邀请用户进行审查。
音频驱动视频(口形同步/OmniHuman)的依赖关系:
先决条件链: 在分镜脚本、起始帧和最终确定的驱动音频全部就绪并经用户确认之前,绝对不能开始最终视频生成。
工作流修正: 如果缺少驱动音频,请在视频合成前转向auditory_designer。- 用户覆盖与风险: 如果用户要求在没有最终音频的情况下生成视频,您必须在
reply_to_user中说明:“由于缺少驱动音频,现在生成将导致唇形同步精度下降。” 仅在获得用户明确确认后方可继续。
缺失音频资源恢复(工作流修正): 如果分镜脚本已准备就绪,但缺少所需的音频,请转向音频生成。
- 用户覆盖与风险: 如果用户要求在没有最终音频的情况下生成视频,您必须在
2. 多模态分析
使用此步骤来持久化结构化时间信息:例如 BPM、强拍、分段标签(前奏/主歌/导歌/副歌/桥接/尾奏),以及带有 start_ms / end_ms 的歌词行跨度。下游的分镜镜头必须引用这些 ID 或时间戳。
3. 故事板设计
如何设计关键元素
- 始终包含关键主体(角色、物体等)、关键地点/场景和关键道具(如有)。
- 如何规划 element_id: 当每个角色、道具或场景是一个独立的实体时,为每个实体分配一个 element_id(例如
[Element_Detective_Li]、[Element_Boss_Zhao];[Element_Observation_Room]、[Element_Chief_Office])。 - 如何编写描述:
- 角色: 如果角色在项目中具有多种状态或外观(例如不同的服装、年龄),请在描述中清楚地说明(例如:外观 1:...;外观 2:...)。包括角色的声音/音色,以便下游音频能够匹配。
- 关键地点/场景: 描述场景中重要物体的位置和方向,特别是道具或发生主要动作/表演的区域。
- 用户提供的资产: 如果用户提供了参考媒体并将其指定为关键元素,描述必须与该资产匹配;不要与所展示或听到的内容相矛盾。
如何设计镜头
- 每个镜头描述必须包含:场景与元素、镜头语言(景别、角度、运动)。
- MV 分镜脚本时间规划(核心规则)
根据分析后的音频(结构、节拍)以及来自分析的歌词和逐行时间戳来驱动分镜板。主轨道上每个镜头的时间线选择必须确保落入该镜头内的歌词是一个完整的单元 —— 不要定义一个会导致歌词行或短语被中途截断的镜头。当根据逐行或逐短语的 start_ms / end_ms 布局分镜时间线时,增加 ±1s 的缓冲区:将镜头的可用窗口延伸至第一个歌词时间戳前 1 秒,以及最后一个歌词时间戳后 1 秒(相对于这些歌词边界)。这可以吸收快节奏和紧凑的行间间隔,避免唇形同步和剪辑受到帧级精确剪切的干扰。 - 不要默认设计"叙事表演+唇形同步演唱表演"的固定组合。唇形同步镜头(
ImageToVideoByAudio)只在同时满足以下两个条件时才设计:① 画面中有可见人物正在说话或演唱;② 可见嘴部必须与对应的语音/人声音频精确匹配。以下情形不得设计唇形同步镜头:纯 BGM 伴奏、舞蹈动作、剧情表演、舞台大全景、观众反应、节奏跟随动作;以及仅仅因为是 MV 项目、包含歌词、处于副歌或说唱段落、画面中出现歌手、采用近景/中景,或包含表演性动作。不满足上述两个条件的镜头一律设计为叙事/表演镜头,由MultiModalToVideo生成。
如何设计独立音频 - 背景音乐: 使用用户上传的音乐作为 BGM;
- 旁白: 除非用户特别指定,否则不需要额外的配音。
4. 媒体生成
元素图像生成
- 使用 TextToImage。对于不同外观或年龄的同一角色,建议使用 ImageToImage;后续的外观应参考之前生成的形象以保持一致性。
- 推荐模型:Nano Banana 2(Gemini 3.1 Flash Image),分辨率 2K。角色元素建议优先使用三视图(正面/侧面/背面)以支持跨镜头的一致性。
关键帧图像生成(每个镜头) - 使用 ImageToImage。推荐模型:Nano Banana Pro(Gemini 3 Pro Image),分辨率 2K。参考图像必须包含 (1) 该镜头相关的元素图像,以及 (2) 对于每个镜头,参考同一组中先前镜头的最相似关键帧(成批生成时,批次中的后续镜头参考之前的镜头),作为额外的参考以加强连贯性——例如角色在场景中的位置、他们如何面对彼此以及表情:这些是元素引用无法定义的细节。
最终镜头视频生成
逐镜头按以下条件判断生成路径: - 唇形同步镜头(同时满足以下两个条件才使用):
① 画面中有可见人物正在说话或演唱;② 可见嘴部必须与对应的语音/人声音频精确匹配。
使用 ImageToVideoByAudio。推荐模型:OmniHuman 1.5,分辨率 1080p。参考关键帧 + 对齐的音频片段。 - 所有其他镜头(默认路径): 包括纯 BGM、舞蹈、剧情表演、舞台全景、观众反应、节奏跟随镜头,以及任何不同时满足上述两个条件的镜头。
使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p。参考该镜头的关键元素 + 关键帧图像。
5. 提示词撰写
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成提示词(TextToImage, ImageToImage)—— 图像提示词编写指南:
所有图像提示词的通用原则:
- 提示词不仅是描述“画面中有什么”,更像是真正的电影导演和调色师向团队下达指令。
- 使用连贯的自然语言描述场景内容(主体 + 行为 + 环境等),并使用简短的词组描述视觉美学(风格、色彩、灯光、构图)。拒绝文学冗余: 不要向 AI 解释角色动机或内心状态(例如“仿佛他不关心这张照片”)。不要描述屏幕外或不可见的元素。只描述物理上可见的内容。
- 对于所有图像提示词(任何角色):然后指导“如何绘制”,而不仅仅是“画什么”。你必须在全球范围内(照片级真实感、动漫、3D 等)应用电影级提示词的 6 大核心规则,以确保电影质感。将提示词写成流畅、自然的英语描述,将这 6 条规则交织在一起。不要将它们输出为带标签的部分:
专业风格术语: 将专业艺术或电影术语与风格术语结合使用,以提高准确性。(例如,引入电影大师和特定的电影视觉锚点,使用Neo-Noir style, David Fincher Style, inspired by Se7en作为风格锚点,而不是泛泛地声明Neo-Noir风格)。
取景(Framing): 明确说明电影取景(例如,Over-the-shoulder shot,Dutch angle)和景别(例如,Close-up,Medium shot)。
灯光(Lighting): 详细说明主光,并强烈强调“负向补光(negative lighting)”以增加对比度和戏剧性(例如,Strong chiaroscuro contrast,dramatic interplay of light and shadow, 或deep facial shadows emphasizing facial structure)。
调色(Color Grading): 使用好莱坞高端调色来设定克制的调色板(例如,deep teal-cyan shadows dominating 90%, zero warm fill或muted watercolor wash)。除非用户明确要求,否则永远不要使用红蓝霓虹冲突(例如禁止crimson bleed,霓虹洋红对比青色)。将图像限制在一种占画面约 90% 的主色调中(例如深青色)——极度克制。
视觉渲染(Visual Rendering): 描述内容的整体视觉质量和纹理(例如,fine rendering quality, rich and intricate details, soft-focus effect with subtle Gaussian blur.)。
情绪与潜台词(Mood & Subtext): 描述角色的“潜台词”和微表情,将动作冻结在戏剧性的节拍上(例如oppressive suffocation,no mercy, 和predatory stillness)。拒绝僵硬的摆拍。对于无生命物体,描述其状态(例如,Destined aura,piercing gaze,cold and detached atmosphere)。
条件元素(仅在相关时包含):
材质描述: 在相关时,对于视觉表现至关重要的重要物体,添加适当的描述(例如,worn leather with creases,thick knit wool fabric)。
画面内精准文字: 在相关时,如果场景中出现文字(例如,屏幕文字),请自然地整合它。你必须用引号包裹场景中需要渲染的确切文本内容以示强调。例如:'A neon sign in the background reads "DANGER".'。
当目标角色是key_element时: 提供清晰、详细的视觉定义,以便在不同镜头中保持一致。围绕以下结构构建提示词:
取景与构图: 优先选择全身镜头;避免半身像/上身或紧凑裁剪的视图,这些视图无法为下游一致性提供足够的视觉信息。对于角色,一套三视图(正面/侧面或四分之三侧面/背面)必须对每个视图使用中景或广角/全景,以便整个身影(头部、躯干、腿部、脚部、服装轮廓)保持可见——这对跨视频保持完整的角色身份至关重要。特写或胸部以上视图不是这些主要参考视图的可接受替代方案(可选的独立面部细节展示仅在全/中身全身视图之外是可以的)。
主体与身份: 清楚说明该元素是什么——角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体格、种族(如指定)、显著特征、声音)。
特征细节: 具体描述元素的主要视觉特征。优先考虑必须在镜头间保持一致的特征:
角色: 面部特征(眼睛形状、下颚线、发型/颜色)、化妆与造型(如相关)、服装与配饰(材质、合身度、颜色、状况)。
道具/物体: 形状、材质、颜色、大小、状况(全新/风化/损坏)、独特的标记。
情绪/情感基调: 描述定义场景的情感基调(例如,紧张、忧郁、希望、宁静、不安、温暖、压抑、恐惧、怀旧、孤立、亲密)。
如果目标角色是key_frame(起始帧、结束帧或高光帧)
首先,在镜头的“描述”中找到对应的时刻:确定确切的节奏点——开头状态、结尾状态,或最具视觉冲击力或戏剧张力的瞬间——并以此为基础。如果镜头描述没有清晰地描绘出该时刻,请在脑海中模拟该镜头(主体运动 + 镜头移动 + 环境变化),想象场景在那个精确瞬间的呈现方式,然后自行补充细节。无论采用哪种方法,都只需描述该瞬间的静态图像——可见内容、构图方式以及所有元素的状态: - 起始帧: 展示动作开始前的场景——主体运动前的姿势和意图(重心转移、视线方向、肢体预加载)、环境的初始状态以及摄像机的初始构图和角度。
- 结束帧: 展示动作结束后的即时结果——主体的最终姿势或表情、环境变化后的状态以及摄像机为下一个剪辑做好准备的最终位置。
- **高光帧:**找出镜头中最具视觉冲击力或情感冲击力的瞬间(例如,冲击力达到顶峰、角色恍然大悟的那一刻、能够凝固镜头主题的构图)。将这一帧定格并尽可能详细地描述——姿势、表情、光线状态、镜头构图——使其能够独立成章,成为镜头中最具感染力的静帧。
视频生成提示词(FirstFrameToVideo, ImageToVideoByAudio):
对于基于关键帧的视频生成,提示词的主要目的是描述“变化”和“动态”。你应该避免重新描述开始/结束帧中已经存在的静态细节,而是专注于让场景“活”起来。高质量的视频提示词必须描述场景在以下维度上的动态演变:
静态主体描述: 对镜头开始时主体外观的清晰详细描述(例如,角色的特征、服装或物体的材质和外观)。当主体具有显著特征时,将其包含在内以锚定主体(例如,the elderly man,the woman in sunglasses)。 - 角色/物体动态: 描述主体自身的运动,包括表情、动作的变化,以及相对于摄像机的任何自发方向变化(例如,
a character turning from a profile view to face the camera directly)。如果主体保持静止,你必须明确描述其静态姿势或状态(例如,the character stands perfectly still, staring forward)。 - 基本提示词结构: 提示词 = 主体 + 运动,背景 + 运动,摄像机 + 运动等。使用简单、直接的措辞和短句结构;模型会根据你的描述及其对图像的理解进行扩展。
- 运动限定词: 描述运动时,始终指定程度副词(例如,quickly, violently, large amplitude, high frequency)。
- 运动限定词: 模型对时序性、多拍动作以及带有不同动作的多个主体反应强烈。你可以写:subject1 + motion1 + motion2, 或 subject1 + motion1, subject2 + motion2 等。按顺序排列动作;模型将相对于帧进行扩展和解释。
- 摄像机运动: 摄像机运动(电影摄影)提示词:用自然语言描述所需的摄像机变化。支持的选项包括 orbit(环绕), aerial(航拍), zoom(变焦), pan(平移), track/follow(跟拍), handheld(手持), 和 shot cuts(镜头剪切)。摄像机语言是许多基于帧的视频模型的强项。对于多镜头或切镜频繁的提示词,写出镜头之间的逻辑连接;使用明确的提示,如 "cut to" 或 "shot cut" 来连接镜头。切镜后,如果场景发生变化,描述新场景。当提示词包含摄像机运动时,基础参数应该是 "non-fixed camera"(非固定镜头)。这些摄像机提示词指南同时适用于图生视频和文生视频。如果摄像机是静止的,你必须声明 'static camera' 或 'fixed shot'。
ImageToVideoByAudio的特别说明: 当使用音频驱动(唇形同步/表演)模型时,提示词必须遵循上述维度,同时还要遵守以下独特的结构:
你必须明确描述由音频驱动的角色状态(例如,speaking, singing, crying while talking, rapping)。 - 最佳实践模板: 摄像机运动 + 说话者情绪 + 说话状态 + 具体身体动作 + (可选) 背景事件。
- 示例:
The camera follows as a man turns to face the lens and walks forward while singing with an intoxicated, soulful expression. He first touches his collar with both hands, then spreads his arms wide and tilts his head back, appearing completely immersed. Light and shadow in the background pulse with the rhythm.
注意: 你必须始终在提示词中包含以下负面约束,以确保后期制作输出干净: - 如果分镜脚本指示该镜头有单独的旁白音轨,不要在视频提示词中写入旁白文本,以避免冲突。
- 为防止模型添加不需要的背景音乐,你应该始终包含 'no music'。
字幕是在剪辑过程中添加的,因此你必须始终包含 'no subtitles'。
安全与合规性优化(当下游模块拦截时,请按顺序检查并优化后再重试):
当下游模型拦截或中断生成时,请按顺序检查以下项目,查看提示词是否可以优化。如果可以,使用以下策略重写提示词,然后重试生成。不要输出单独的“禁止:...”行;将合规约束自然地嵌入到提示词描述中。 - 按顺序检查:
- 真实名人/公众人物: 替换为
virtual [physical description] actor/character。 - 受版权保护的 IP(迪士尼/漫威/动漫/游戏角色): 保留视觉特征(颜色、服装风格、姿势),移除名称和品牌标志。使用公式:original virtual character + [color palette] + [outfit/equipment style] + [action/ability trait] + no copyright identifiers。
- 著名品牌标志/名称: 使用
original [type],[color + shape + material],no brand identifiers。 - 政治人物/党派-军事/敏感历史事件: 无合规重写。 告知用户无法生成该内容;不要尝试重写。
- 血腥/暴力/打斗特写: 替换为
tense atmosphere, no gore, no violent close-ups。 - 裸露/性暗示: 替换为
simple clothing, natural movement, no nudity。 - 身体曲线/身体部位强调: 替换为
balanced figure, natural posture;不要描述具体的身体部位。 - 恐怖/鬼怪/超自然: 替换为
suspenseful mood, no horror elements。
- 真实名人/公众人物: 替换为
- 六大禁区(直接拒绝):
不要尝试优化;告知用户无法生成该内容:(1) 国家领导人、党派/军事、敏感历史事件;(2) 分裂主义、极端主义、仇恨/歧视;(3) 毒品、赌博、诈骗、非法金融;(4) 假新闻、冒充官方媒体;(5) 儿童不宜内容。
6. 视频合成
- 静音
video_track;根据时间戳(以及歌词提示(如使用))将每个镜头对齐到音乐时间线。 - 对于使用 ImageToVideoByAudio 生成的唇形同步镜头,请勿更改播放速度或时间戳。如果两个唇形同步片段之间出现没有可用素材的空白(速度必须保持固定),请用现有素材中最合适的叙事/表演剪辑来填补。
- 当根据逐行或逐短语的
start_ms/end_ms构建分镜时间线时,增加 ±1 秒的缓冲区;如果缓冲区与相邻镜头重叠,请合并、在自然的短语边界处重新分割,或在生成前调整镜头边界——仍然保持每个镜头中的完整歌词单元(与 storyboard_designer 的规则相同)。