汉斯季默风格史诗MV
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
适用于汉斯·季默风格史诗音乐MV制作;用户可上传音频或提供文字想法,使用 Seedance 2.5(分辨率 480p) 生成写实电影感画面,无旁白、无对口型、无字幕。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
整体阶段逻辑与依赖:
- 解析输入 → 调用 resource_prepare_and_analyze,分析用户提供的音频(BPM、情绪曲线、段落划分)或文字想法,输出结构化叙事表(段落、情绪标签、建议视觉元素、建议时长)。
- 确认节奏类型 → 如用户未在输入中明确选择「快节奏蒙太奇」或「慢节奏沉浸式」,必须在进入分镜前通过 reply_to_user 请用户选择,不得跳过。
- 建立全局规格 → 通过 text_editor 创建 Final_Video_Spec.md,锁定:片名、节奏类型、输出规格(16:9、1080p、24fps、无字幕、无旁白、无对口型)、视觉风格(汉斯·季默风格)、音频来源。
- 生成分镜 → 调用 storyboard_designer,根据叙事表和节奏类型生成分镜(key_elements + shots + audio_layers)。暂停并向用户展示分镜,确认后再继续。
- 生成视频片段 → 调用 media_generator,逐镜生成视频片段。
- 合成输出 → 调用 video_assembler,拼接片段、同步音频、应用转场,输出最终视频。完成后向用户展示结果并提示导出。
依赖关系: 2→1;3→2;4→3;5→4;6→5。
异常处理:
- 用户未提供任何输入(无音频、无文字):提示"请上传音频文件或写下您的故事想法,例如'英雄独自走向战场'"。
- 音频时长超过5分钟:提示"建议截取前3分钟,或告知是否分两段分别生成",等待用户决策后再继续。
暂停节点: 不得一次性跑完全部流程。阶段4(分镜完成后)和阶段6(最终视频完成后)必须停下,向用户展示成果并获得确认。
2. 多模态分析
音频解析(核心任务):
① BPM 与节奏分析:
- BPM > 120 → 情绪标签:紧张/战斗/追击 → 视觉适配:快切、手持晃动、快速横移。
- BPM 80–120 → 情绪标签:蓄力/行进/中等张力 → 视觉适配:中速推拉、混合切镜。
- BPM < 80 → 情绪标签:悲壮/沉思/孤寂 → 视觉适配:慢镜、航拍、缓慢推拉。
② 频谱能量与配器识别:
- 低频能量强(大号、低音弦乐、工业鼓) → 压迫感/宏大 → 搭配大景别(远景、全景)、逆光剪影。
- 中高频突出(合成器主旋律、管风琴、高音铜管) → 科幻/希望/仰望 → 搭配丁达尔光柱、上升运镜。
- 电子音色为主(合成器垫底、工业质感音效) → 冷硬/未来感 → 搭配冷蓝色调、工业废墟或太空场景。
③ 重复动机识别:
- 若检测到短小旋律片段循环叠加、且音量/配器层层递增,标记为「重复动机段落」。
- 重复动机段落的视觉适配:每一次循环对应一次景别推进(远景→全景→中景→特写)或切镜频率加快,实现音画同步递进。
④ 情绪曲线:
- 提取整曲的情绪变化节点(平静→上升→高潮→余韵),按段落切分(建议3—6段)。
- 每段标注:大致时间范围、情绪标签、音乐特征摘要、建议视觉关键词、建议时长、节奏适配(慢镜/中速/快切)。
文字想法扩展(备用路径):
- 若用户仅提供文字想法,将其扩展为3—5个场景叙事段落(开端、发展、高潮、结尾),每段包含:情绪定性、视觉关键词建议、建议时长。
- 输出格式与音频解析结果保持一致,使下游分镜设计可无缝接收。
输出原则: 输出结构化叙事表,供 storyboard_designer 直接使用;不做主观美学评判,只提取可操作的视觉与情绪信号。
3. 故事板设计
Key Elements 设计:
- 根据叙事表中的视觉关键词,提炼3—6个 key_element(如:荒原、废墟城堡、战场、孤独英雄剪影、苍穹、海岸悬崖等),每个元素描述其核心视觉特征和光影基调。
- 不涉及具体角色对口型;人物若出现,以剪影或局部特写呈现,不需要精确面部建模。
写实主义强制规则(优先级最高,凌驾于所有其他视觉描述):
- 绝对禁止:动漫、卡通、插画、水墨、赛博朋克、抽象几何、虚幻引擎渲染风格、超现实合成感、塑料模型感、任何"AI生成感"的平滑涂抹或过度锐化。
- 强制写实质感:
- 人物:真实皮肤纹理(毛孔、汗毛、痣、皱纹)、自然光照下的人物面貌、真实服装材质(棉麻、皮革、金属盔甲、磨损布料)。
- 场景:真实地形与建筑、真实天气表现(雨、雪、雾、烈日)、自然光源(太阳、月光、火光、爆炸光)。
- 道具:真实磨损感、锈迹、反光(头盔、剑刃、旗帜、装备)。
- 参考基准:诺兰式电影写实风格(《星际穿越》《敦刻尔克》)、纪实摄影质感、电影实拍感。
- 不合格判定:若生成画面出现非写实元素(发光线条、抽象光晕、卡通化人物、游戏渲染质感),优先在同模型内重试一次;重试仍不合格则提示用户,不得静默通过。
汉斯·季默视觉体系(所有镜头强制执行):
- 光影: 高对比,主光与阴影亮度差极大;逆光剪影、丁达尔光束(耶稣光)为标志性光效;禁止平光、均匀照明。
- 色调: 暗部冷蓝(深沉蓝灰,参考 #1A2A3A),亮部暖黄(琥珀金,参考 #F5C76E),整体低饱和高对比,避免鲜艳纯色。可叠加极轻度胶片颗粒,增强质感,不得过度。
- 景别: 大景别(远景、全景、大全景)占比 ≥60%,用于建立宏大空间;辅以局部特写(手、脚印、武器、旗帜、灰尘等细节)强化情绪;中景仅作过渡使用。
- 运镜规则:
- 沉浸式慢镜:缓慢推拉、无人机航拍(水平或俯冲)、摇臂弧线移动、固定带呼吸感(微晃)、长焦压缩空间感。
- 蒙太奇快切:急推急拉、手持晃动、快速横移、急摇(Whip Pan)、短促定格。
- 转场: 叠化(表达时间流逝)、黑场切入(情绪断裂或章节感)、匹配剪辑(形状/动势呼应)。
- 重复动机同步: 若音频存在「重复动机段落」(叙事表标注),画面需同步递进:每一次循环对应一次景别推进(远景→全景→中景→特写),或逐步加快切镜频率;禁止在此段落使用静止无变化的单镜头。
Shot 设计:
- 每个 shot 必须包含:场景(引用对应 key_element)、画面内容(主体动作/状态)、景别与运镜、光影描述、建议时长、是否同步重复动机。
- 沉浸式慢镜模式:单镜建议时长 4—8s,总镜头数控制在 5—10 个。
- 蒙太奇快切模式:单镜建议时长 1.5—3s,总镜头数可达 10—20 个。
- 无对口型,无角色演唱,无旁白同步。
镜头衔接与连贯性规则:
- 色调与光源一致性: 同一叙事段落内,相邻镜头的主光方向、色温(暖/冷)和主色调必须保持一致;跨段落时光影变化须有明确动机(如时间推移、场景切换),不得无故突变。
- 景别逻辑: 相邻两镜不得出现无过渡的极端景别跳跃(如直接从特写切至大远景而无匹配剪辑);须通过中间景别或匹配动势过渡,除非刻意利用黑场制造情绪断裂。
- 运动方向一致性: 同一段落内,主体运动方向(画面左→右 或 右→左)须保持统一,避免轴线跳切造成方向混乱。
- 主体与场景绑定: 同一 key_element(如「废墟城堡」或「孤独英雄剪影」)在不同 shot 中出现时,视觉描述须引用同一 key_element 基准图,确保外观、材质、光影风格跨镜头一致。
- 节奏连贯: 快切段落内不得插入孤立的慢镜,慢镜段落内不得插入孤立的急切镜头;节奏转变须在叙事段落边界处发生,并通过转场类型(叠化 / 黑场)明确标注。
Audio Layers 设计:
- music(BGM): 将用户提供的原始音频作为主 BGM audio_layer,覆盖全片。
- 环境音(可选): 若用户希望叠加环境音效(风声、战鼓、人群远声等),在分镜确认后单独询问,作为独立 audio_layer 添加。
- 不设置 narration(旁白)audio_layer,不设计任何人声演唱轨道。
4. 媒体生成
视频片段生成:
- 主生成路径:MultiModalToVideo,首选模型 Seedance 2.5,分辨率 480p。
- 每个 shot 以对应 key_element 图像作为视觉参考(reference_image),确保场景光影、色调风格跨镜头一致。
- 不使用含对口型/人声的生成路径;生成内容不包含任何口型同步或角色演唱。
- 若前后两个 shot 场景连贯性极强(如同一场景的推进),可将前一 shot 的视频作为 reference_video 追加;一般情况下仅引用 key_element 图像,不叠加 reference_video。
Key Element 图像生成:
- 使用 TextToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 每个 key_element 生成一张风格基准图,须体现汉斯·季默光影体系(逆光、冷暗部、暖亮部、大景别构图)。
环境音生成(可选):
用户选择添加「史诗级低音环境音」后,按以下规则生成:
- 生成路径: 使用 text_to_instrumental,模型优先 Mureka 8(对低频氛围音效的控制更稳定);备用 Suno 5。
- 提示词规范: 明确描述音效类型 + 频率特征 + 情绪基调,例如:
- 风声:epic wind ambience, low rumbling gust, distant howling, no melody, no percussion, dark atmospheric
- 远雷:distant thunder roll, deep low-frequency rumble, slowly fading, no music, cinematic tension
- 低频嗡鸣:deep sub-bass drone, industrial hum, sustained low frequency texture, ominous, no rhythm
- 心跳:slow deep heartbeat, tense cinematic pulse, isolated low thud, no melody
- 时长匹配: 生成时长对齐对应叙事段落时长,避免拼接感;若段落较长(>30s),分段生成后由 video_assembler 顺序拼接。
- 音量配比策略(交由 video_assembler 执行):
- 主 BGM 音量基准:100%
- 环境音整体上限:BGM 的 20–30%(避免掩盖主音乐)
- 高潮快切段落:环境音可短暂提升至 BGM 的 30–35%,增强冲击感;高潮结束后立刻回落
- 慢镜/余韵段落:环境音降至 BGM 的 10–15%,保持画面呼吸感
- 视频片段自带的低电平环境声(风声、脚步)保留 ≤15%;任何人声或音乐轨一律静音
全局参数:
- 输出规格:16:9,1080p,无字幕。
- 模型失败时,优先在同工具内切换备用模型(如 Seedance 2.5(分辨率 480p)),不跨工具强行替代。
5. 提示词撰写
图像提示词(TextToImage / ImageToImage):
- 以自然语言描述主体+环境+光效,短句补充风格/色调/构图。只写镜头可见内容,不写情绪动机或画外信息。
- 固定风格锚点(每条图像提示均应包含):cinematic epic, photorealistic, shot on film, real skin texture, natural lighting, high contrast lighting, rim light silhouette, teal shadows, amber highlights, low saturation, wide establishing shot, anamorphic lens flare, atmospheric haze, Nolan-style realism。
- 光影必须明确:逆光方向、丁达尔光柱存在与否、主光色温(暖/冷)。
- 禁止描述平光场景、均匀照明、饱和鲜艳色彩。
视频提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p)):
- 参考图用 <<<image_1>>> 等占位符标注。
- 按以下顺序构建提示:运镜(如 slow aerial push-in / rapid whip pan)→ 主体状态(位置、动作幅度)→ 环境与光效(光源、烟尘、天气)→ 音效备注(风声、远雷等,若需要)。
- 慢节奏镜头:强调"slow motion"、"gradual"、"lingering"等缓慢质感词。
- 快节奏镜头:强调"fast cut"、"sharp"、"dynamic"、"handheld energy"等爆发质感词。
- 固定否定项:no subtitles, no text overlay, no lip sync, no singing, no narration voice, no flat lighting, no music, no anime, no cartoon, no illustration, no watercolor, no cyberpunk neon, no abstract geometry, no CGI render, no plastic texture, no AI smoothing, no over-sharpening, no glowing outlines(BGM 由独立音频轨道承载,视频生成不内嵌音乐描述)。
- 所有提示词以英文书写,确保模型最优理解。
6. 视频合成
拼接顺序: 严格按分镜表中的 shot 顺序拼接,不得随意调换。
衔接连贯性检查(逐镜执行):
- 色调跳变检查: 相邻片段衔接处如出现明显色温突变(如暖黄→冷白或暗部突然提亮),须在剪辑层做颜色过渡补偿,或选择用叠化转场掩盖。
- 运动方向一致性: 相邻片段主体运动方向若相反,须插入中性过渡镜头(如静止特写)或黑场切断,不得直接硬切造成方向混乱。
- 景别衔接: 避免相邻片段出现无过渡的极端景别跳跃(特写直接接大远景);若分镜中已标注匹配剪辑,严格按形状/动势匹配执行。
- 音画同步复查: 每段叠化或硬切时间点须与 BGM 的明显节拍点或情绪变化节点对齐,不得随机落点。
节奏匹配:
- 慢节奏模式:片段间使用叠化转场(dissolve,建议时长1.0—1.5s),保持画面呼吸感;切勿急切。
- 快节奏模式:以硬切为主,转场时长≤0.3s;高潮处可插入单帧黑场(2—3帧)增强冲击感。
音频同步:
- 将用户提供的原始音频作为主 BGM 轨道,覆盖全片,音量保持稳定(无淡出淡入,除非视频结尾需收尾)。
- 若有环境音轨,音量设置为 BGM 的20—30%,避免掩盖主音乐。
- 视频片段自带的环境声(风声、脚步声等)可保留低电平(≤15%),绝不保留任何人声或音乐轨。
导出规格: 16:9,1080p,24fps,无字幕,无旁白,H.264编码。
收尾: 最后一个 shot 结束后,建议加入0.5—1s黑场淡出,与音乐尾音自然收束。