Denis Villeneuve-inspired film
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
专为丹尼斯·维伦纽瓦(Denis Villeneuve)导演美学定制的微电影制作Skill。全程仅允许使用 GPT Image 2 进行图像生成,仅允许使用会员专享的 Seedance 2.5(分辨率 480p) 制作
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
<planner>
工作流逻辑与控制(维伦纽瓦风格微电影)
-
灵感孵化与全局设定(Creative Director & Screenplay Ideation - Final_Video_Spec.md)
- 优先创建 Final_Video_Spec.md(使用 text_editor)。
- 灵感与构思孵化(导演编剧顾问机制):若用户仅提供碎片化灵感或粗浅构思,而非完整剧本,Planner 必须先发挥“导演兼首席编剧”能力。深入挖掘其灵感背后的情绪与宿命感,固定提供 3个具有不同情感导向的剧本方案(方案一:悲壮宿命,方案二:神圣空灵,方案三:冷酷绝望),且均需契合维伦纽瓦导演美学(需包含:核心戏剧冲突、标志性巨物意象、以及推荐的视觉风格子类型:如“黄沙荒漠废土风”、“冷钢深蓝科幻风”或“黑色巨物工业风”)。
- 锁定全局参数:在用户确认大纲后,在 Final_Video_Spec.md 中锁定画幅(aspect_ratio: "16:9"),视觉风格(visual_style 设为判定的具体风格子类型),视频输出分辨率(resolution: "480p"),以及低饱和度、末世苍凉、宗教般庄严等情绪设定。
-
剧情深度拓展与故事板设计(Storyboard Designer)
- 剧情来源与脚本拓展:以确定的创意大纲/剧本为核心,调用 storyboard_designer 创作故事板(包含角色/场景等 key_element、shot 列表、以及独立的 audio_layer)。若剧本细节不足,storyboard_designer 必须主动补充极具电影感和象征意义的动作、环境细节、运镜手法和富有张力的对白。
- 用户素材多模态处理:若用户上传了参考素材(如人物全身图、角色设定、场景参考或参考文档),先调用 resource_prepare_and_analyze 进行多模态分析,提炼核心视觉和空间特征,确保故事板完美继承用户的物理输入,不产生冲突。
-
建立与绑定关键元素视觉与音频资产(Key Elements Visual & Audio Asset Management)
- 视觉素材判定、风格校验与分支(强制独立画幅比例):
- 若用户已提供视觉素材且契合要求:直接将符合要求的人物全身三视图(角色图必须是多角度、头到脚的全身三视图,绝不能是半身三视图,画幅比例为 16:9),或符合“多角度无人物四宫格”且风格契合的场景参考图(画幅比例为 4:3)通过 media_generator 注册并绑定为对应 key_element 的首选资产,跳过自主生成步骤。
- 若用户已提供素材但不符合要求(风格不符,或角色图不是全身三视图/是半身三视图,或场景图不是无人物多角度四宫格):绝不直接使用。必须将用户原始素材作为 reference_image,调用 media_generator 的 ImageToImage 功能(指定使用 GPT Image 2 模型,分辨率 2K),必须覆盖并重设画幅比例参数,严禁套用视频画面比例,重塑生成符合影片美学的新资产:对人物重塑生成既保留核心五官特征又符合风格的“人物全身三视图”(强制要求必须是头到脚的完整全身三视图,绝非半身三视图,画幅比例强制设定为 16:9);对场景重塑生成既继承用户场景几何轮廓又符合风格的“多角度无人物四宫格场景参考图”(四格内容固定为:全景定场/陈设特写/纵深透视/气氛光效,画幅比例强制设定为 4:3)。重新生成后,将其绑定为对应 key_element 的首选资产。
- 若用户未提供任何视觉素材:调用 media_generator 的 TextToImage 功能,指定使用 GPT Image 2 模型生成所有 key_element。在接口调用时必须显式重设并覆盖画幅比例参数,绝对禁止套用全局视频比例。角色优先生成多角度“人物全身三视图”(必须是头到脚的全身三视图,绝非半身三视图,画幅比例强制指定为 16:9);场景生成高信息密度的“多角度无人物四宫格场景参考图”(四格标准分配:全景定场/陈设特写/纵深透视/气氛光效,画幅比例强制指定为 4:3),分辨率推荐为 2K(支持 1K, 2K, 4K)。
- 音频素材判定与音色绑定(key_element_audio):
- 若用户提供了角色的音色参考音频:直接将该音频通过 media_generator 注册并绑定为对应角色 key_element 的 key_element_audio 资产,以锁定该角色的声音基础。
- 若用户未提供音色参考:在需要生成对话(dialogue)的镜头中,如果包含角色发声,则利用 media_generator 设定同一稳定的音色,并将其注册绑定为 key_element_audio,或在 narration 生成中指定相同的 narration_speaker_profile 确保音色一致。
- 资产生成与绑定及分镜头自检(防跳画审计):在元素图像与音色资产建立完成后,进入分镜头视频(shot)生成之前,必须对故事板中的所有 key_element 及分镜头资产进行完整性交叉审计:(1) 逐一检查并核对每一个角色、场景的图像资产以及所需角色的 key_element_audio 音频资产是否已全部生成完毕并成功绑定对应的 asset_id;(2) 逐一审核故事板中的每一个分镜头(shot),核实其是否明确标注且正确绑定了场景 key_element_id 的参考图像,同一场景内的连续分镜头必须强制绑定相同且唯一的场景参考图,绝对禁止出现空缺或混用,从而在底层锁死空间一致性。 若有任何遗漏或不一致,必须立即拦截、补足并重新绑定,严禁在分镜头资产未完全对齐绑定的情况下直接进入下一个分镜头视频的生成流程。
- 视觉素材判定、风格校验与分支(强制独立画幅比例):
-
生成分镜头视频(Seedance 2.5(分辨率 480p))与一致性保持
- 调用 media_generator 的 MultiModalToVideo 接口,指定使用 Seedance 2.5(分辨率 480p) 生成每个 shot。
- 视频分辨率统一设为 480p。
- 提示词与分镜脚本无缝核查:每次生成视频前,Planner 必须核对并检查该镜头的生成提示词,与故事板中对应的分镜脚本进行深度对比。重点核实是否遗漏了当前镜头应包含的场景参考、人物参考、台词与对白(dialogue)内容以及特定的特效音/环境描述。如有遗漏,必须在进入生成前补全并修正。
- 视觉连贯性绑定:每个镜头的输入必须通过 refer_id 同时绑定其对应的角色 element character(人物全身三视图)和场景 element scene 的图像资产。必须确保每一个 shot 都 100% 成功绑定了有效的场景参考图(element scene),决不允许任何 shot 在缺乏场景参考的情况下进行盲目生成。 当长视频中角色穿梭于不同场景时,保持角色 turnaround sheet(全身三视图)的绑定不变,仅更换场景参考图。同一个场景内的连续镜头必须且仅能绑定相同且唯一的场景参考图,绝对禁止混用,以此强行锁定空间连续性,彻底根除镜头间的场景跳画或背景漂移。
- 音色连贯性绑定:凡是包含开口说话(dialogue)的镜头,必须在生成分镜头视频时引入该角色绑定的 key_element_audio,让 Seedance 2.5(分辨率 480p) 自动克隆并输出一致音色的同步人声。
- 一般情况下,不使用前序视频作为参考(跳过视频参考),除非在极少数需要强动作连贯性的相邻镜头中才引入前一个 shot 的视频进行生成。
-
生成音频层(Audio Layer)
- 调用 media_generator 的音频生成工具,生成低频振动的 BGM 和庄严的 narration。
-
时间线装配与渲染(Video Assembler)
- 调用 video_assembler 将最终生成的视频片段、BGM及旁白合成输出。
里程碑确认与暂停策略:
为了确保创作者对生成的每一项资产都有绝对控制权,并在生成额度及美学方向上不产生偏差,在整个工作流中必须严格执行“先确认、后生成”的暂停策略:
- 节点一:全局规格与故事板确认。在 Final_Video_Spec.md 与故事板设计(storyboard_designer)完成后,暂停让用户确认剧本结构、运镜以及低频音效设计是否符合要求。在此暂停交互中,Planner 必须显式、明确地告知用户其自动判定的维伦纽瓦风格子类型(如“黄沙荒漠废土风”、“冷钢深蓝科幻风”或“黑色巨物工业风”),并询问用户是否满意该风格设定。同时主动告知用户:如果对判定的风格子类型不满意,可以提出更换,Planner 将自动修改全局设定(Final_Video_Spec.md)及后续方案。对于仅提供灵感的用户,此节点应重点展示故事板设计方案,详细向用户展示故事板是如何将微弱灵感深度扩编为极具维伦纽瓦导演风格的起承转合、视觉符号与声效张力的,供用户评审。
- 元素与分镜头资产完整性自检。在建立关键元素图像资产后,在启动任何分镜头视频生成前,Planner 必须执行自检,不仅要确认故事板中规划的所有角色和场景等 key_element 图像资产已经生成完毕且均完成了 asset_id 的绑定,更必须逐一深度核实故事板中的每一个分镜头(shot)是否都已 100% 正确绑定了对应的场景参考图(element scene)。任何分镜头如果发现未标注或未绑定场景参考图,必须在此刻暂停、提示异常并强制补全,绝对禁止带着缺失场景参考的分镜头资产进入下一步,从而在底层锁死空间、杜绝生成时的场景跳画。
- 节点二:生成任何新资产前的强制暂停确认。在工作流中,每一次调用 media_generator 生成任何新资产之前(包括系统生成 key_element 的人物/场景参考图、每个分镜头 shot 视频、以及任何独立的 audio_layer 音频资产),必须暂停运行并向用户展示即将生成的资产规划、提示词或参数方案。特别是在展示视频生成方案时,必须显式附带提示词自检比对结果,向用户核实当前提示词 and 参考绑定是否与故事板分镜中的角色、场景、台词对白、环境声效等内容精准一致、毫无遗漏。 等待用户做出明确确认指示后,才能继续执行该资产 of 生成与下一步流程。
2. 멀티모달 분석
用户输入参考多模态分析指南(维伦纽瓦风格)
当用户上传参考素材、视频或设定文档时,调用 resource_prepare_and_analyze 按照以下维度进行提炼和规范化:
-
巨物与尺度检测(Scale & Monolithic Detection)
- 硬性量化巨构与人类体量比例:精确分析并记录人类角色与巨型建筑/几何体的物理高度比例,硬性量化其尺度对比(如人类与巨型建筑高度比例为 1:50 至 1:100,人类在画面中的面积占比必须低于 1% - 2%,呈现极致的蝼蚁与神圣巨物感)。
- 粗野主义建筑几何线条量化:深度提取粗野主义混凝土结构的几何边界与延伸方向(如:纵向几何线条是否垂直贯穿整个画幅,水平/对角线条的倾斜度,消失点是否精准汇聚在画幅的中轴线上),为后续对称和极简构图提供精确参数。
- 镜头视点与尺度对比评估:检测镜头的视点高度(如极端低仰角 ground-view 仰视或极端俯视鸟瞰视角),量化其透视纵深与空间压缩比例,确保空间压迫感能被下游完美继承。
-
色彩与灰度提取(Muted Palette Extraction)
- 严格识别并提取低饱和度的色彩参数。主要分类:
- 沙漠色系:琥珀黄(amber)、赭石色(ochre)、沙金色(sand gold)、焦土棕(burnt brown)。
- 冷灰与钢蓝色系:深灰(dark grey)、冷钢蓝(cold steel blue)、铅灰(lead grey)、雾白(foggy white)。
- 浓黑与阴影:暗影区域的比例,是否具有 Chiaroscuro(明暗对照法)特征。
- 警告并过滤高饱和、刺眼的霓虹杂色,保持维伦纽瓦色彩的纯粹性。
- 严格识别并提取低饱和度的色彩参数。主要分类:
-
大气介质评估(Atmospheric Medium Assessment)
- 分析素材中的“空气感”,检测是否有雾气(fog)、沙尘(dust)、霾(haze)、雨雪等介质,以及光线穿过这些介质产生的可见光束(volumetric beams)。
-
文本与台词意境及冲突提取(Text, Dialogue & Conflict Extraction)
- 对白深层意境与宿命感剖析:当用户上传剧本、大纲或对白文档时,深度剖析对白(dialogue)的潜在心理张力。提取台词中蕴含的虚无、痛苦、抗争、敬畏或绝对压迫等微观情绪。
- 核心戏剧冲突标签提炼:将剖析结果提炼为契合维伦纽瓦风格的戏剧冲突标签(如:[Fate_Confrontation] 宿命抗争、[Silent_Suppression] 无声压抑、[Sovereign_Judgment] 主权审判、[Existential_Dread] 存在虚无、[Divine_Revelation] 神圣启示),并在输出中建立“对白 -> 冲突标签”的精密映射。
- 生理声学控制指示映射:根据台词意境,预先推演并判定角色说话时的生理喉腔发声状态与呼吸节奏,自动映射为生理声学控制标记(如 [throat tensing], [shaky voice], [whispering, low decibel]),为 storyboard_designer 细化分镜台词和 media_generator 合成双向对白对抗提供精确的声学输入蓝图。
-
规范化输出:将分析结果(包含视觉尺度、色彩参数、大气介质及提炼的戏剧冲突标签与生理声学映射)转换为可直接用于 GPT Image 2 绘图 prompt、Seedance 2.5(分辨率 480p) 视频生成 prompt 以及音响合成参数的标准化结构信息,并存储于 asset 信息中。
3. 스토리보드 설계
维伦纽瓦风格故事板设计规范
调用 storyboard_designer 规划故事板时,必须严格遵守以下定制化规则:
-
编剧与导演创作法(灵感扩写与视听建构原则)
- 灵感多维文学级扩写(Screenplay Expansion):若用户仅提供碎片化的灵感、概念或短句(如“沙丘中的废弃雕像”),故事板设计师必须充当“首席编剧与创意总监”角色。深度解构灵感内核,围绕宿命对抗、神圣探索、文明遗迹或孤独求索等维伦纽瓦核心哲学主题,扩充为结构完整、富有戏剧张力和情绪起伏的短片文学剧本。
- 视觉隐喻叙事(Show, Don't Tell):维伦纽瓦美学的灵魂是“用纯粹的画面语言取代冗余对白”。故事板在设计情节时,必须把抽象的情绪和台词,转化为物理空间的压迫与视觉对照。例如:用巨型几何体的投影吞噬渺小人物来暗示命运不可抗拒;用无垠荒原中踽踽独行的微小身影来凸显个体虚无;用阳光刺破滚滚浓雾(大气介质与可见光束)来折射理智的觉醒。
- 情节张力控制(情绪微宇宙):遵循维伦纽瓦标志性的慢燃叙事。一个故事弧光必须划分为三个情绪张力阶段:压抑(Suspression - 迷雾锁闭、低饱和巨物无声压迫) -> 逼近(Approach - 极慢运镜、呼吸感加剧、环境介质起舞) -> 爆发/静默(Eruption/Silence - 震耳的低频嗡鸣或命运审判,紧接极致的音景真空寂静)。
- element character(角色与音色):强调角色的“符号性”与“命运感”。服装设计优先选择具有流动感的长袍(flowing robes)、防护服或质朴的粗粝编织衣物。当长袍暴露于狂风废土时,其布料运动必须遵循 0.2x 慢速风力的重力阻尼与高物理质量的厚重垂坠规律,呈现出极其缓慢、沉重的褶皱折痕流转与摆动过程,严禁出现任何高频抖动、轻飘飘的乱舞或无序的快速拍打。 面部表情要求极致克制与深邃,展现维伦纽瓦式的隐忍微表情与喉部肌肉缩紧控制(如:不眨眼的锁定凝视 unblinking locked gaze、喉部肌肉微妙紧绷 subtle throat tensing、吞咽动作 swallowing、下眼睑微颤 micro-tremor of the lower eyelid,以及一呼一吸间的微弱起伏与情绪压抑)。特别细化吞咽动作与下眼睑微颤的微秒级时序配合(Micro-expression millisecond-level temporal coordination sequence):起跑至 1500 毫秒,角色维持 100% 完全不眨眼的中轴凝视;在第 1500 毫秒至 2000 毫秒,下眼睑由于情绪压迫开始出现高频、微幅的电性微颤(频率 8-12Hz,振幅 < 1mm);在第 2000 毫秒至 4000 毫秒,喉部爆发一段慢速且极深重的物理吞咽动作(吞咽动作持续 2.0 秒,喉结/喉头缓慢升起),在此吞咽期间,下眼睑的微颤受喉部隆起肌肉张力波及,其颤动频率和振幅在第 3000 毫秒达到最高峰值(微颤增强 50%),形成极其逼真的生理颤栗联动;在第 4000 毫秒,随着喉部完全回位,下眼睑颤动迅速平息并重新降温至极其微弱的 1-2Hz 极微颤动,恢复极致冷酷隐忍的表面。 每一个角色元素必须分配一个唯一的标识 ID,并在描述中精准定义其声音特质。声音描述禁止使用粗泛词,必须深度结合物理音腔共鸣(如:深厚胸腔共鸣 rich chest resonance、胸骨震动 heavy sternum rumble、紧缩咽腔/喉腔共鸣 constricted pharyngeal space)与声带物理状态及质感(如:声带边缘沙哑磨损 gravelly vocal fry, 喉头紧绷/声门摩擦 squeezed glottal friction, 气声微弱颤动 airy breathiness, 干燥摩擦质感 dry vocal cord friction),用以展现出饱含重压、冰冷或悲凉的深层人性张力。如果用户提供了角色的音色参考音频,故事板描述中必须进行标注,以便将其绑定为该角色的 key_element_audio(用以保持跨镜头对话音色的一致性)。
- element scene(场景)与 element prop(道具):必须体现“未来考古学”和“粗野主义(Brutalism)”美学。
- 场景与建筑表面质感:场景描述必须包含巨型几何结构(如巨大的立方体、圆锥、高耸 of 无装饰立柱)、不加修饰的混凝土粗糙表面、大面积的墙体留白。必须细化斑驳的风化质感与暴露的混凝土拼缝缝隙、模板拼接处的细微接缝(exposed concrete joints and formwork seams)。针对建筑表面拼缝与模具拼接处,必须明确锁定风化尘埃的附着颗粒、风吹积聚的细碎沙尘晶体、以及沿拼缝凹槽积淀的暗色氧化风蚀层,以此增加极高物理精度的微观粗糙感。 另外,还需设计斑驳的工业钢结构锈迹(mottled industrial rust stains on metal and structural components),以及墙体裂纹与雨水冲刷水渍,展现文明遗迹饱经风霜的物理侵蚀感。
- 遗迹道具表面质感(古代石雕与废弃重工业机械):针对古代石雕或废弃重工业机械等关键道具元素,必须细腻描绘饱经岁月侵蚀的斑驳表面、微观物理开裂(micro-fracturing)以及受逆光或强明暗光影雕琢出的凹凸不平的浮雕与机械表面质感(uneven, light-sculpted tactile relief textures),以此展现人造秩序与历史痕迹在时光冲刷下的实体消亡感。
- 每个场景元素均需规划为高信息密度的“多角度无人物四宫格场景参考图”,其四格内容固定为标准物理分配(全景定场 / 陈设特写 / 纵深透视 / 气氛光效),不得包含任何人物。
- 用户素材特征继承与风格重塑:如果用户提供了场景参考图、人物设计图或特定的全身三视图(角色图必须是多角度全身三视图,绝非半身三视图),故事板中的元素描述必须与用户上传素材的核心人物特征或空间几何线条对齐,不得擅自修改人设的核心标志。若用户原始素材与维伦纽瓦风格不符,或场景图不是符合标准的无人物多角度四宫格,或人物图不是多角度全身三视图(包含非三视图、半身三视图等不符规格情况),且后续通过 media_generator 重新生成了风格及格式对齐的新“全身三视图”或“四宫格场景参考图”,故事板仍需完美继承用户原素材中关于长相五官、发型、特殊印记或建筑基本比例与空间几何结构等本质物理特征,仅重塑其质感、格式布局、光影与色调色彩,确保视觉连续性。
-
分镜头(Shots)设计(导演视听语言控制)
- 单镜头时长与节奏动态规划(Shot Duration & Dynamic Pacing):维伦纽瓦风格拒绝快节奏剪辑。分镜时长与节奏应根据故事板剧情张力与叙事起伏进行动态规划,但受 Seedance 2.5(分辨率 480p) 模型能力边界限制,单条视频的最低时长为 4秒,最长时长为 30秒。多规划 8s 或 12s 的长镜头以充分发挥 Seedance 2.5(分辨率 480p) 支撑慢镜头、静置悬停和画面大面积留白美学的绝对优势。
- 镜头视点与构图:
- 必须频繁规划超广角远景(extreme wide shot)或全景镜头,突出“人极小、环境极大”的极端体量对比。在超广角全景中,必须引入刚性边缘消隐(Rigid Edge Vanishing)与几何暗角控制(Geometric Vignette Control)。通过在画面左右边界部署高耸的粗野主义立柱、阴影覆没的刚性几何立面或深色门廊作为边界遮挡,将两侧杂乱的物理边缘彻底隐没,并在画幅四周形成对称的刚性光影暗角,强制将观众的视觉落点向正中轴深处透视线压缩,以极致的构图凝聚力彰显崇高感。
- 构图必须严格优先采用“几何中轴对称(central axis symmetry)”,并结合“双侧对角透视(bilateral diagonal perspective)”。通过两侧刚性几何边界或建筑/自然线条(如两侧向中心合拢的巨大墙体、斜向倾立的大理石石柱、向画面中心会聚的沙脊或遗迹通道)强力汇聚于画面深处的绝对中轴消失点上,从而构建起极具庄严感、神圣仪式感与空间深邃度的视觉秩序,严防镜头歪斜或画面重心失衡。
- 光影与氛围设定:
- 必须包含逆光(backlighting)和剪影(silhouette)设计,人物在明亮背景(如地平线、巨大光窗、烈火)前呈现为纯黑的轮廓。
- 必须设计大气介质:雾、尘、沙。光影要有卡拉瓦乔式的明暗对比(Chiaroscuro),例如:“阳光从巨大神殿穹顶的一缕缝隙中射入,照亮空气中飘浮的微尘,四周一片死寂的黑暗”。
- 镜头运动与运镜组合策略(Camera Movement & Combination Strategy):镜头运动必须缓慢、沉稳,极力营造宏大肃穆与凝滞的窒息感。禁止出现急推、急拉、手持抖动或任何混乱的快速运动。
- 单一运动矢量红线(Single Vector Restriction):每个分镜头(shot)必须严格遵循单一且纯粹的运动矢量。严禁在单镜头内混合交叉运镜(如同时进行水平慢摇与向前推轨、或者慢摇中途发生俯仰倾斜)。要么是 100% 纯粹的中轴极慢推轨(slow push-in),要么是 100% 纯粹的水平慢摇(slow pan),要么是 100% 静止绝对悬停(static hover)。
- “静-动-静”运镜时间轴占比(Static-Dynamic-Static Timeline Ratio):每一个包含运动的分镜头在生成时,运动不可贯穿始终,必须采用“静-动-静”的黄金剪辑缓冲节奏:
- 前置静止缓冲(Static Hold Intro):镜头的 前 20% - 30% 持续时间 必须为完全静止机位(static hover),用于锁定画面的极致对称中轴线、巨构体量感及角色的微表情凝固起点。
- 极缓匀速运镜(0.1x Uniform Motion):镜头的 中间 50% - 60% 持续时间 执行极缓、匀速、毫无物理加速度的 0.1x 微速推轨或水平慢摇,使画面在大气介质中产生如冰川滑行般的漂移感。
- 后置静止缓冲(Static Hold Outro):镜头的 最后 10% - 20% 持续时间 重新锁死为完全静止,使运镜平稳着陆,为下一个分镜的硬切(straight cut)预留视觉凝视焦点。
- 运镜类型数量分发占比(Motion Type Shot Distribution):在整部短片的镜头规划中,各运动类型所占镜头个数比例必须遵循以下刚性权重:
- 中轴极慢推轨(Slow Push-In along Central Axis):占所有运动镜头的 70%。主要用于将视线深度向画面对称消失点压迫,推进角色心理张力,是绝对主导的运镜手法。
- 极慢水平横摇(Slow Horizontal Pan):占所有运动镜头的 20%。仅用于定场展示横向铺开的废土荒原、巨大几何墙面、或在两个相距遥远的空间 key_element 之间进行视线极小编织的位移。必须严格限制镜头的水平扫掠扇区角度在 15° 至 30° 之间(绝对禁止超过 30°),以防宽幅画面的边缘产生严重的几何拉伸畸变或暴露出尚未渲染的背景边缘虚无(防穿帮与透视畸变控制)。
- 绝对静止悬停(Absolute Static Hover):占所有镜头的 10%(在非强动作分镜中作为独立的呼吸切口)。用绝对的死寂与静滞反衬环境的冷酷与巨构的永恒。
- dialogue(对话)与双向情绪互动/声压对抗:
- 极简克制与宿命诗意:角色对话必须极度克制,多用画外音/内心独白(VO)形式。台词应具有诗意、哲学意味或宿命感。发声角色必须显式引用对应的角色 ID,以确保其发音音色能通过绑定的 key_element_audio 在生成时被完美继承。为了使声音极具悲怆、宿命的深重情绪与真实的肉体声带质感,台词中不仅要写出字词,更必须显式植入微观生理状态与呼吸节奏标记(如 [sigh] (叹息)、[swallow] (吞咽)、[long pause] (长停顿)、[shaky voice] (颤音)、[whispering] (低语)、[throat tensing] (喉头紧绷))。通过“破碎短句 + 物理声学顿挫”和情绪标记语的无缝嵌套,彻底消除 AI 语音合成平淡、空虚的机械假感,使其如在耳畔沙哑诉说。
- 双向情绪阶梯递进:两个角色之间(或角色与旁白之间)的互动绝非平铺直叙,必须设计双向情绪阶梯递进(Emotional Progression Ladder)。从开端的压抑静默(低语/微弱气声/断续),随戏剧冲突向着紧绷、压迫、宿命抗争或冷酷深渊的方向逐渐拉升,形成情绪波谷到波峰的完整张力弧线。
- 音高与声压物理对抗:严禁两人采用相同的语调与音量交谈,必须设计音高(Pitch)与声压(Sound Pressure / Volume)的物理级两极分化与对立(Acoustic Confrontation):
- 高压施压者 vs 卑微承受者:施压者使用高声压、喉头紧缩的强音(例如 [high vocal pressure]、[constricted glare]),被动承受者则以极低声压、干枯气泡音或颤音(例如 [whispering, shaky, low decibel])进行宿命妥协或深渊式回应。
- 级差对抗控制:施压者语速稍快、音高上升(Pitch +10%至+20%)、声压级拉满;承受者则语速变慢、音高下沉(Pitch -15%)、声压深度衰减,利用极端的声学两极对立,物理化展现统治与被统治、审判与挣扎的张力。
- 对白戏剧冲突场景渲染模版(Visual Dialogue Conflict Rendering Templates):
- 在分镜头设计中,必须将从用户文档中提炼的戏剧冲突标签与对应的视觉渲染规范关联,制定特定的镜头渲染模版。场景参考图(四宫格)作为整体空间参照,供视频生成阶段整体理解该场景的空间结构、材质质感、光影氛围与尺度关系;模版中描述的是各冲突标签对应的构图意图与情绪目标,不强制要求 shot 锁定参考图的某一特定分格,具体构图由提示词文字描述驱动。设计标准如下:
- 【[Silent_Suppression] (无声压抑) 或 [Existential_Dread] (存在虚无)】视觉渲染规范:
- 视觉呈现:画面必须渲染极致空阔的巨构全景。将渺小的角色(面积占比 < 1%)放置于巨大几何体阴影边缘,四周是成片粗糙坚硬的混凝土墙,表现生命在绝对静默与庞大客观世界面前的虚无、隔绝与绝对压服。
- 微表情与流体运动配合控制:角色眼神呈绝对凝固状态(0x速度不眨眼锁定),视线定格于画幅对角线的虚空中。喉部肌肉处于静止紧张状态(zero swallow, static throat tensing),呼吸慢至极限(每 6 秒极微弱呼气一次)。面部隐忍微表情必须与极缓流动的大气介质或微尘(0.05x超微速漂浮)完全同步,通过肉体与物理世界的双重“冻结”折射生命的虚无与绝对静滞。
- 【[Fate_Confrontation] (宿命抗争)】视觉渲染规范:
- 视觉呈现:强力调动双侧倾斜的巨构对角透视线,指向画面正中深处无法逃避的消失点。人物沿此中轴对角透视线方向极慢行进,通过画面的高透视压缩感和无退路的物理线条,具象化表达角色与不可抗拒命运的惨烈搏斗和无路可逃。在末世烈阳强烈的逆光照射下,穿透巨构光窗与石门门洞的不同角度光线,照亮漫天飞扬的粗糙沙尘,微观上呈现高烈度的前向散射与边界发光,金沙颗粒在明暗交界处熠熠生辉、发光发亮,宛如飞舞的微型碎钻。
- 微表情与流体运动配合控制:角色眼神以 0.1x 极缓速度沿对角透视线朝中轴消失点进行渐进式追踪锁定(unblinking locked gaze with slow sweep-in eye tracking),目光如炬。下眼睑微颤与缓慢深重的吞咽动作遵循严格的微秒级时序配合(在第 1500ms 至 2000ms 眼睑开始高频微颤,第 2000ms 至 4000ms 启动 2 秒的物理吞咽,并在第 3000ms 吞咽最高潮、喉结升至顶点时,眼睑微颤受肌肉张力联动达到巅峰,随后于 4000ms 随喉部完全回位同步平息恢复极微颤动),喉部肌肉显现极高张力下的微妙紧绷(subtle throat tensing)。 此微动速度需与黄沙荒漠方案下的风沙热流流速(0.2x慢速尘暴漫卷、0.1x缓速流沙倾泻)、以及在多角度烈阳逆光下金沙微粒闪烁自旋的发光质感(0.1x微速自旋与多角度散射发光) 保持物理级低频共振,以流体的慢速流变反衬肉体对抗宿命的缓慢坚毅。
- 【[Sovereign_Judgment] (主权审判)】视觉渲染规范:
- 视觉呈现:渲染卡拉瓦乔式的极限明暗对比。审判者或巨型建筑投影切割下大面积冷钢色或铅灰色阴影(阴影覆盖率 > 60%),将被审判者完全吞没,使其呈现出神圣而肃穆的纯黑剪影。用极致的光影切割,物理化展现统治力量的绝对性与对立个体的无助。
- 微表情与防雨水流速对抗配合:施压者面部为绝对冰冷的无表情面具,眼神微闭向下俯视;被审判者眼神在阴影中睁大并锁定向上仰视。被审判者喉部肌肉发生深度喉腔收缩(constricted glottal muscles),喉头剧烈紧绷,伴随延迟干燥的吞咽动作(subtle dry throat swallow),与下眼睑在阴影中的绝望微颤维持精确的微秒时序(在被审判的第 2000ms 处启动长达 1.5 秒的极度干枯吞咽动作,吞咽进行至 1000ms、即整段第 3000ms 喉结高耸顶点时,触发下眼睑由于极度克制恐惧而发生一瞬间的高频紧绷微颤,随之于 3500ms 吞咽结束、喉头回位时强行将微颤和喉部冻结为死寂状态),以扼制身体受压迫下的本能颤抖。 该紧绷微表情与高重力速度直落的垂直暴雨(terminal gravity velocity) 与墙面水渍缓速流淌(0.1x微速水痕)形成强烈的速度与物理动能落差,以冻结的肌肉张力抗衡无情冲刷 的流水。
- 【[Divine_Revelation] (神圣启示)】视觉渲染规范:
- 视觉呈现:阳光穿过巨构混凝土拼缝的极窄缝隙,呈精准 45° 斜角射入刚硬的体积光柱(45-degree Tyndall effect),光束中伴有微细色散和棱镜虹光边缘。强体积光轴产生强烈的反向散射(intense backscattering),并穿透因阴影切割而高度浓缩 of 暗区。无数精微沙尘/空气微尘颗粒在切入光柱边界的瞬间被强光点亮发光(scintillating and glittering at the light-shadow threshold),呈现出晶莹剔透的高反差高光。在光束内部,微尘与空气分子进行极其缓慢的流体热对流漫移(micro-thermal convection drift),在 45° 刚性光轴内呈现出慢动作气旋环绕与低速自旋(slow-motion helical vortex and self-spin of dust particles),形成极具实体厚度与半透明介质体积感(dense translucent volumetric fog with high optical thickness and atmospheric viscosity)的宏大光景。光柱正好照亮一件象征文明遗迹的古老机械图腾、圣物或古朴陈设特写。
- 微表情与体积光/微尘色散配合控制:角色眼神微张,不眨眼地紧紧锁定 45° 角折射的强体积光柱。瞳孔深处微微颤动并映射出光束边缘的微观棱镜色散虹光。面部微表情从绝对紧绷中逐渐释怀展开,伴随双唇微张(lips parting slightly, 呼吸气雾在寒冷中凝结)和极缓的拖尾叹息呼气(slow trailing exhaling sigh, 持续 3 秒以上)。面部的舒缓微动与光束中静止悬浮、发光且闪烁、极慢自旋飞舞(0.05x缓速自旋)的微尘轨迹达成完美视觉契合,展现时间静止下的崇高救赎。
- 【[Silent_Suppression] (无声压抑) 或 [Existential_Dread] (存在虚无)】视觉渲染规范:
- 在分镜头设计中,必须将从用户文档中提炼的戏剧冲突标签与对应的视觉渲染规范关联,制定特定的镜头渲染模版。场景参考图(四宫格)作为整体空间参照,供视频生成阶段整体理解该场景的空间结构、材质质感、光影氛围与尺度关系;模版中描述的是各冲突标签对应的构图意图与情绪目标,不强制要求 shot 锁定参考图的某一特定分格,具体构图由提示词文字描述驱动。设计标准如下:
- 跨镜头一致性标注与场景及分区锁死:每个 shot 必须显式且强制声明本镜头中出场的角色 ID(如 [Element_Hero])、场景 ID(如 [Element_Scene_Desert])以及本次分镜具体使用的四宫格场景参考图分区(如“左上全景定场”或“左下纵深透视”),以便下游媒体生成工具分离提取、精准绑定并准确解构该特定局部的空间。严禁任何分镜头不标注场景 ID 和四宫格分区。 属于同一场景且处于同一子空间设定的连续镜头,必须强制使用完全相同且唯一的场景 ID 以及相同且唯一的四宫格分区(例如连续几个镜头均锁定使用 [Element_Scene_Desert] 的 左上全景定场 分区),从而在故事板层面彻底锁死空间与局部视角的一致性,防止人物在不同镜头中在四宫格不同的子空间内发生位置跳变。若剧本中发生场景或空间分区切换,必须明确建立新的场景 ID 或声明新的四宫格分区,绝不进行模糊过渡,从源头防止因参考缺失或指向不明导致场景跳画。
-
独立音频层(Audio Layers)设计
- 必须规划全局的低频氛围音轨。
- BGM/Sound Effect:避免使用旋律性强的音乐。描述为“低沉的弦乐嗡鸣(low strings drone)、原始打击乐脉冲(primordial percussion pulses)、宗教感和空灵的吟唱、高强度的低频次声振动(low-frequency infrasound vibration)”。让声音听起来像风、像雷、像废墟深处的震动。
- 声音留白与“音质真空”(Sound Vacuum):必须在故事板中特设“绝对静默”的音频切口。在巨大物体全貌展现或命运判决式对白出口的瞬间,音效与背景乐骤停,仅保留微弱的风沙呼啸(hollow wind)或人物沉重的吸气声,用极致的寂静释放戏剧张力。
- “神圣空灵”专属音景设计:当确定使用“神圣空灵”风格方案时,配乐与声效设计必须贯彻极其神圣空灵的特质:
- 无声静默:在神殿门开、圣光降临、或命运顿悟的关键瞬间,设计一段长达 3 秒以上的“绝对真空式无声静默”(Complete Sound Vacuum),将所有的风沙声、BGM和次声骤然切断,仅留白,以静衬动。
- 远古空灵吟唱:引入空灵悠长、无歌词、带有强烈神圣感和沧桑感的远古人声吟唱(ancient wordless ethereal chanting / angelic divine choir drone),其音域高旷,释放出悲悯与崇高感。
- 空气震动感:在最底层,必须持续铺设一种空气分子在强声压下低频颤动的空气震动感(sub-bass air vibration, deep heavy atmospheric drone, pulsating resonating ambient low-frequency rumble),让观影者通过低频震颤感知神迹空间的物理体量与肃穆氛围。
- “悲壮宿命”专属音景设计:当确定使用“悲壮宿命”风格(黄沙荒漠废土风)方案时,配乐与声效设计必须深度传达个体与无情自然、宏大命运进行悲壮搏斗的荒凉与力量感:
- 部落战鼓低频脉冲(Tribal Drum Pulses):引入极具压迫感、沉重且节奏缓慢的原始部落战鼓低频脉冲(heavy rhythmic tribal war drum pulses, primordial percussion pulses, deep slow-tempo ritualistic drum beats at 50-60 BPM)。每一个鼓点都要犹如大地沉重、单调且坚定的心跳,通过强烈的低频声压重重撞击耳膜,渲染出命运步步逼近的悲壮仪式感与行进感。
- 风沙物理摩擦声效(Gritty Sand Friction):强化狂风席卷黄沙的干燥与粗糙物理磨损质感(coarse gritty sand friction, dry harsh whistling wind, textured scraping of wind-blown sand particles against massive rocks or metallic ruins)。声效中必须清晰可闻细小砂砾击打硬物的金属感、颗粒滚动的沙沙摩擦声与干枯的嘶吼声,用尖锐且粗粝的物理磨削音色彻底释放废土荒原对生命力剥夺的肃杀张力。
- “冷酷绝望”专属音景设计:当确定使用“冷酷绝望”风格(黑色巨物工业风)方案时,配乐与声效设计必须展现粗野主义建筑下的冰冷压迫、机械无情与深渊般的绝望感:
- 金属摩擦与工业低鸣(Industrial Metallic Groan & Mechanical Hum):引入刺耳缓慢的金属摩擦声、工业巨构空洞的回声、以及沉重冰冷的机械低频嗡鸣(industrial metallic friction, screeching of rusted steel, colossal hollow industrial echoes, deep mechanical humming drone at 40Hz)。展现冰冷建筑的压迫、废墟的破碎以及人造机械秩序对个体的吞噬。
- 冰冷雨水与空洞水滴声(Cold Rain Splashing & Hollow Water Dripping):强化瓢泼冷雨拍打混凝土与钢板的撞击声,以及巨大空旷空间中冰冷水滴坠落深渊般的滴答空响(heavy relentless rain pouring on concrete, metallic clatter of raindrops, sparse water dripping echoes inside a colossal vacant concrete vault)。用潮湿刺骨、不断冲刷的物理声效,将绝望与孤冷感彻底实体化。
- 旁白(narration)音调设计:旁白类型必须规划为低沉的回忆录叙事。文案设计需多用破碎短句,并在文字中预留停顿指示符,使声音产出起伏有致、神圣肃穆的咏唱式节奏感。
4. 미디어 생성
媒体生成器参数与引用策略(维伦纽瓦风格)
调用 media_generator 执行生成任务时,必须严格应用以下物理规则与模型选择。
模型唯一性红线(Model Exclusivity Redline - 绝对禁止使用其他模型):
- 图像生成:必须且只能调用 GPT Image 2 模型进行所有静态图像、角色全身三视图、场景参考图等资产的制作与重塑。绝对禁止使用任何其他图像生成模型(如 Seedream, Nano Banana, Midjourney 等)。
- 视频生成:必须且只能调用会员专享的 Seedance 2.5(分辨率 480p)(通过 MultiModalToVideo 路径)生成所有分镜头视频。绝对禁止切换到其他任何视频模型(如 Kling, Sora, Vidu, Google Veo 等)。
-
图像与音频元素资产建立与生成(GPT Image 2 & key_element_audio)
- 用户视觉素材评估、绑定与风格重塑:
- 对用户提供的人物设计图、人设全身三视图 or 场景参考图进行质量与风格校验。若其风格完全符合“维伦纽瓦导演美学”(低饱和、冷峻、粗粝、极简巨物感),且人物图为多角度、从头到脚的“全身三视图”(绝对不能是半身三视图),且场景参考图确实为“多角度无人物四宫格”样式,则 media_generator 必须直接将这些素材注册并绑定为对应 key_element 的首选资产,跳过自主生成。
- 若用户提供的视觉素材风格不符,或角色图不是全身三视图/是半身三视图,或场景图不是无人物多角度四宫格样式,则必须调用 ImageToImage 进行风格与格式重塑生成(指定使用 GPT Image 2 模型,分辨率 2K,且必须覆盖接口中的默认画幅参数:人物图强制指定为 16:9,场景图强制指定为 4:3):
- 对人物使用原素材作为 reference_image 重塑生成既保留核心五官特征与服饰、又符合美学调性的“人物全身三视图”(画幅比例强制固定为 16:9,在 Prompt 中强制约束必须生成头到脚的完整全身三视图,绝非半身三视图);
- 对场景使用原素材作为 reference_image 重塑生成符合美学调性的**“无人物多角度四宫格场景参考图”,并强制要求画幅比例强制固定为 4:3**,四格内容固定为标准分配(全景定场 / 陈设特写 / 纵深透视 / 气氛光效),提高场景信息密度,且画面中不得出现任何人物。重新生成后绑定为对应 key_element 的首选资产。
- 系统自主生成视觉资产策略(GPT Image 2):
- 若用户未提供任何视觉资产,则必须使用 GPT Image 2 模型生成所有的 key_element,且分辨率设定默认为 "2K"(支持 1K, 2K, 4K)。在此步骤中,在调用接口时必须强制重写画幅比例参数,绝不能继承全局默认的视频画面比例:将角色全身三视图生成比例指定为 16:9,场景四宫格参考图生成比例指定为 4:3。
- 人物全身三视图生成规范:生成角色 key_element 时,在 Prompt 中必须明确要求生成“多角度人物全身三视图(full-body character turnaround sheet, exhibiting front, side, and back profiles from head to toe in a single image)”,必须是全身,绝非半身三视图,画幅比例强制要求为 16:9,确保三维角色的一致性基准。
- 场景四宫格生成规范:生成场景 key_element 时,在 Prompt 中必须明确要求生成**“无人物多角度四宫格场景参考图(4-panel scene reference sheet with no characters, containing 4 grids showing different angles and details of the same space)”**,画幅比例强制要求为 4:3。在 Prompt 中强制规定其四格内容的固定物理分配方案:全景定场(top-left: epic wide establishing shot of the monolithic space) / 陈设特写(top-right: close-up of local furniture and props) / 纵深透视(bottom-left: extreme depth perspective and geometric lines) / 气氛光效(bottom-right: volumetric light beams and atmospheric shadows)。
- 角色音色资产绑定、定制与克隆策略(key_element_audio):
- 若用户提供了角色的音色参考音频(voice reference):media_generator 必须将该音频注册并分配 asset_id,绑定为对应角色 key_element 的 key_element_audio,作为该角色在整部影片中发声的一致性基准。
- 若用户未提供专属音色参考:
- 旁白(narration)高阶拟真设计:生成旁白时使用 text to narration,对英语项目推荐 ElevenLabs v3,中文/多语言推荐 MiniMax Speech 2.8 HD。严禁使用宽泛空洞的音色描述(如“成熟男声”、“悲凉旁白”)。必须在 narration_speaker_profile 中采用“多维音腔共鸣 + 物理声带阻抗 + 微观呼吸/情感标记”的工业级物理细节描述框架:
- 多维音腔共鸣 (Vocal Cavity Resonance): 必须显式声明声音在不同共鸣腔体中的物理振动感,如:deep thoracic vibration (胸腔深度共鸣/厚重感)、sternum rumble (胸骨低频震颤/释放神圣仪式感与体量感)、constricted laryngeal space (喉腔/咽腔紧缩共鸣/产生强烈的压抑或潜藏痛苦情绪)、hollow nasal reverberation (鼻腔空洞回响/带来未来科幻的疏离与孤独感)。
- 物理声带阻抗与发声质感 (Vocal Impedance & Cord Texture): 精确刻画声带边缘摩擦与气流阻抗状态,如:coarse vocal fry (声带边缘沙哑摩擦/低频气泡音/带有强烈的时间沧桑与历史厚重感)、gravelly vocal fold friction (沙砾般粗粝声带摩擦)、tense dry glottal constriction (声门干燥紧缩感)、heavy dry breathiness (重度干燥气流感/渲染肉体衰竭与绝望感)。
- 微观呼吸及气流运动 (Micro-breathing & Air Movement): 融入可感知的气流生理运动控制,如:audible light inhalation catch (微弱但清晰的吸气抽动)、slow trailing exhaling sigh (极缓的拖尾叹息呼气)、subtle dry throat swallow (微弱的干燥喉部吞咽声),用以打破 AI 语音平铺直叙的单调感。
- 细节标签合成示例 (Synthesized Example): [Deep, gravelly mature male baritone, slow and solemn tempo, deep thoracic vibration with heavy sternum rumble, constricted laryngeal space showing suppressed agony, coarse vocal fry at phrase endings, heavy dry breathiness, occasional audible inhalation catch, tragic hollow tone]。利用这些极其精细、相互作用的物理共鸣与声学特征标签强力引导 TTS 引擎,塑造具有顶级电影美学物理厚度与心理压迫感的宿命级旁白。
- 台词对白(dialogue)音色绑定:若镜头内包含角色台词且需自主建立音色,必须通过 media_generator 定制生成一个具备相同呼吸感、微哑、冷峻的物理特征音频文件,分配 asset_id 并注册绑定为 key_element_audio,以确保其发声的高逼真度。
- 双向对白与旁白互动声学冲突合成控制:当镜头或音频层中包含双向角色对话(或角色与旁白互动)时,media_generator 在派发音频合成任务时,必须基于故事板中规划的“音高与声压对抗规则”,对两路音频进行物理差异化参数控制。通过独立的 pitch_scale(音高偏移参数)和 volume_gain(分贝增益参数)来强行拉开两路人声的物理距离,实现“高音强声压 vs 低音弱声压”的极致对立。严格控制两路人声的声学时间轴,确保情感递进点的冲突碰撞不产生声能重叠掩蔽,在渲染时通过级差避让(主动施压者声压提至 -3dB,被动承受者声压降至 -15dB 以下)来物理化展现权力、审判与宿命纠缠的声学张力。
- 情感和节奏渲染传递:派发音频生成任务时,必须将故事板脚本中包含的所有情绪及物理动作标记(如 [sigh]、[long pause])无缝传入 TTS 语音模型。引导引擎渲染出带叹息、吞咽、气声停顿等逼真的拟真细节,彻底打破无感情的机械感。
- 旁白(narration)高阶拟真设计:生成旁白时使用 text to narration,对英语项目推荐 ElevenLabs v3,中文/多语言推荐 MiniMax Speech 2.8 HD。严禁使用宽泛空洞的音色描述(如“成熟男声”、“悲凉旁白”)。必须在 narration_speaker_profile 中采用“多维音腔共鸣 + 物理声带阻抗 + 微观呼吸/情感标记”的工业级物理细节描述框架:
- 保持后续图像的一致性:随后需要生成特定镜头下的角色变体图、特定神态时,必须采用 ImageToImage 路径,且必须引入上述用户提供的、重新生成的或系统自生成的“人物全身三视图”作为首要 reference input 进行风格与面容约束。
- 用户视觉素材评估、绑定与风格重塑:
-
分镜头视频生成(Seedance 2.5(分辨率 480p))与多维一致性保持
- 分镜头视频生成必须使用会员专享的 Seedance 2.5(分辨率 480p)(通过 MultiModalToVideo 路径)。
- 分辨率:必须设定为 "480p"(非会员无法使用 480p 会员高阶分辨率,同时 Seedance 2.5 默认且推荐 480p,符合用户预设)。
- 视频时长(duration):根据故事板的动态规划设定,单镜头时长必须在 4秒至30秒 之间(Seedance 2.5(分辨率 480p) 模型单条视频的最低限制是 4s,最长限制是 30s)。默认推荐 8s 或 12s,以突显长镜头的悬停感。
- 提示词与分镜一致性校验红线(Pre-Generation Omission Audit):
- 每次执行分镜头视频生成前,media_generator 必须对视频生成方案(提示词与关联参数)进行无遗漏的比对审计。
- 必须逐项核实并确认:
- 视觉参考与场景必绑及四宫格分区锁定红线: 脚本中出现的所有角色(element character)与场景(element scene)必须通过物理参考(asset_id)完整且正确地进行绑定。每一个分镜头(shot)的视频生成均必须强行绑定一个场景参考图(element scene 资产)。严禁在仅有角色参考、无场景参考,或场景参考未绑定的情况下启动视频生成。同时,系统必须比对故事板中该分镜指定的四宫格分区(如“左上全景定场”),在生成视频提示词前,深度核对该分区是否已被精准提取并强制嵌入到提示词首部的空间解构声明中。若检测到场景参考缺失或四宫格分区声明缺失,系统必须立刻拦截并报警,暂停运行,绝不执行任何无场景、无分区约束的盲目生成,从底层彻底解决场景跳画与环境漂移问题。
- 台词与对白(dialogue): 分镜脚本中若包含具体台词,必须核查并确保对应的台词内容已 100% 录入视频提示词尾部的 {} 对话标记中,且其配音所需的 key_element_audio 绑定无误。
- 动作与细节描述: 提示词中的摄像机慢速运动指令、角色克制微动、沙尘等大气环境描述是否与分镜脚本完全对齐。
- 特殊标记: 脚本中指定的背景氛围音效等特征是否已正确转化为 <SFX> 格式填入。
- 如果审计中发现任何信息遗漏 or 参数错误,系统必须在暂停确认环节自动提示并更正,严禁带着不完整的绑定或漏掉的台词进入实际生成阶段。
- 长视频跨镜头一致性锁定策略(Cross-Shot Consistency):
- 主体与环境分离绑定及分区锁定(变景不变人、景同区不变): 当角色在长视频中穿梭于不同场景时,将角色的“人物全身三视图” asset_id 与当前的场景参考图 asset_id 作为独立的 visual reference 传入。绝对保持角色 turnaround sheet(全身三视图)视觉参考不变,仅更换场景参考图。同时,如果连续镜头处于同一个场景且设定空间相同,必须确保提示词首部的四宫格分区锁定声明完全相同、毫无漂移(例如连续几个镜头均明确锁定 >>>image_2>>> 的 [左上全景定场] 分区),实现“角色参考不变、场景参考不变、解构渲染分区亦不改变”的严格三重一致性锁定,从底层彻底根除因为引用了四宫格而导致的人物在多个分格场景之间瞬移、乱跳或闪烁的 Bug。
- 音色一致性强制克隆:凡是涉及开口说话(dialogue)的 shot,media_generator 必须将对应角色的 key_element_audio 绑定传入. Seedance 2.5(分辨率 480p) 会提取并克隆该音色,直接输出带有高度一致性配音的同步口型视频片段。
- 可选视频参考(强动作连贯性):除非在极高动作连贯性的“分接镜头”中,否则不引入上一个 shot 的 reference video,避免产生伪影或不稳定的运动。
-
音乐与音效生成
- 优先使用支持氛围音乐生成的模型(如 Suno 5 / Mureka 8 的 text_to_instrumental 路径),生成具有实验性、极简和低频震动的器乐氛围音轨。
5. 프롬프트 작성
图像与视频提示词书写规范(维伦纽瓦导演风格)
当调用 write_media_prompt(or 在生成器下编写 prompt)时,必须将故事板描述翻译为以下高度标准化的提示词结构:
-
全局提示词书写语言:
- 当用户在中文语境下交互时,Prompt 的描述主体采用中文书写,从而精准表达细微意境;
- 提示词中嵌入的专业美学标签和镜头指令使用英文(如 Denis Villeneuve style, brutalist architecture),实现中英双向混合优化。
- 提示词中涉及的字幕、画面台词及旁白文本,必须严格遵循 Final_Video_Spec.md 锁定的 Output Language。
-
图像生成提示词(GPT Image 2)
- 严禁使用“最高画质”、“ cinematic”等无实际决策意义的空泛词。
- 必须采用以下“三段式”结构编写:
- 主干实体与多角度全身三视图约束:
- 对于角色 key_element 图像(系统自主生成或 ImageToImage 风格与格式重塑),主干实体必须强制声明为“多角度人物全身三视图”,在单张图像中展示正面、侧面和背面的多角度视图,且必须是头到脚的完整全身(from head to toe),绝不能是半身三视图,且画幅比例设为 16:9。英文核心描述词:16:9 aspect ratio, full-body character turnaround sheet, exhibiting front, side, and back profiles from head to toe in a single image。
- 对于单镜头生成或特定微调图,指定角色的具体穿着质感(如长袍 flowing robes),重力阻尼垂坠的布料折痕与随风漫动的微调细节(heavy gravity-damped fabric folds with 0.2x low-velocity wind response)、发型和克制微表情。
- 对于场景,若生成或重塑“四宫格场景图”,主干实体必须声明为:“4:3 比例的多角度无人物空间四宫格概念参考图 (a 4:3 aspect ratio, 4-panel grid concept sheet of a desolate architectural interior with NO humans)”。
- 维伦纽瓦风格锚点与四宫格物理分配:
- 基础风格:显式揉入 Denis Villeneuve style, extreme scale contrast, brutalist massive concrete block, minimalist geometric design, vast scale, emptiness.
- 硬性量化巨构与人类尺度对比:在描述建筑与人类的对比时,必须强制量化其微缩物理对比参数,显式写入英文控制词 microscopic tiny human figure, extreme scale contrast, 1:100 scale ratio of human to architecture, human figure occupying less than 1% of the total frame area(极小的人类角色、1:100的建筑高度比、低于1%的画面占比),凸显命运压迫。
- 粗野主义建筑几何与中轴对称/双侧对角透视控制:粗野主义混凝土结构或大空间必须强制使用绝对的“几何中轴对称”和“双侧对角透视”。在 Prompt 中显式写入:perfect central axis symmetry, symmetrical composition, bilateral diagonal perspective lines converging at a deep center vanishing point, towering brutalist concrete monolithic structures with sharp geometric lines extending diagonally and vertically from the absolute bottom to the very top edge of the frame, imposing vertical scale(完美中轴对称、对称构图、双侧对角透视线向中心深处消失点会聚、具有刚性几何斜线和垂直线的粗野巨构),通过强烈的双侧透视会聚线和绝对中轴网格锁死视线焦点,确保画面构图严丝合缝地对称与深邃。
- 极极简视角尺度对比控制:利用极端视角渲染物理重力或宏大寂静感,显式写入 captured from an extreme low-angle ground view looking straight up, creating overwhelming crushing gravitational pressure from the brutalist geometry(地面极低仰角)或 epic ultra-wide shot with extreme deep vanishing point perspective, compressing human scale under monolithic shadows(全景极深视点)。针对超广角全景,必须强制写入边缘遮挡与几何暗角指令:rigid edge framing with brutalist monolithic pillars on boundaries, structural boundary occlusion, heavy geometric vignette on frame borders, visual focus compressed toward the symmetrical center, eliminating stray peripheral light leaks(刚性边界框架遮挡、四周几何暗角、视觉落点向中轴对称线凝聚、消除外围光漏),以保持画面边缘的绝对平整与中心聚焦。
- 遗迹道具材质微观参数锁(古代石雕与废弃重工业机械):对画面中的古代石雕、神殿圣物、或废弃重工业机械等道具元素,必须显式写入斑驳表面、微观物理开裂(micro-fracturing)以及受高反差光影和卡拉瓦乔明暗对照雕刻出的三维表面深度与凹凸浮雕质感。英文控制词:ancient weathered stone carvings, abandoned heavy industrial machinery, mottled and eroded surfaces with micro-fracturing and hairline cracks, tactile uneven relief textures sculpted by sharp chiaroscuro shadows, high-contrast light defining three-dimensional surface depth and physical hollows, structural rust, coarse mineral grain texture。
- 四宫格空间分配(场景专属):必须在提示词中强行约定四个板块的内容划分:(1) 左上:全景定场(top-left: epic wide establishing shot of the monolithic space);(2) 右上:陈设与道具特写(top-right: close-up detail of furniture or structural texture);(3) 左下:深邃纵深透视(bottom-left: extreme vanishing point perspective showing geometric depth);(4) 右下:强明暗气氛光效(bottom-right: dramatic chiaroscuro lighting, heavy atmospheric shadows, and volumetric dust beams)。
- 光影与色调控制: 显式写入色彩方案(如 muted color palette, desaturated, sand gold and amber tones 或 cold steel blue, lead grey)、大气介质(volumetric light, dense fog, swirling sand dust)、以及卡拉瓦乔明暗对照(chiaroscuro lighting, deep shadows, strong silhouette, backlit)。强调“无人物(strictly NO characters, completely vacant interior)”以防混入噪点。必须引入低饱和局部色彩溢出约束(Low-Saturation Local Color Bleed Constraint):画面中任何局部光源或微小高亮发光体(如沙尘自旋的微弱金光、终端荧幕、冷光指示灯或微小的熔岩余烬)必须被严格束缚在其物理发光体范围内,其色彩饱和度及溢出范围必须受到极高强度限制,防止其高饱和色度污染或晕染周围大面积的低饱和(80%-85%去色等级)美学环境。英文描述词:strictly localized accent glow with zero high-saturation ambient spill, zero chromatic bleeding, tight color containment, keeping surrounding muted environments pristine。
- “神圣空灵”方案特定视觉隐喻设计: 当剧本方向为“神圣空灵”方案时,提示词必须强化以下标志性视觉隐喻与光影构图,以营造空灵神圣的仪式感:
- 强逆光与剪影(Strong Backlighting & Silhouette): 显式写入 blinding backlit, divine halo effect, crisp silhouette against bright light sources。将刺眼、神圣的光线部署在巨物或主体正后方,使其呈现出边缘分明、神圣肃穆的轮廓剪影。
- 可见光束与丁达尔效应(Volumetric Beams & Dust Scattering Micro-Interaction): 显式写入 sharp volumetric light shafts refracting at a precise 45-degree angle through concrete clefts, dramatic divine beams of light cutting through thick shadows, with subtle chromatic dispersion and delicate prism-like rainbow separation at the light-shadow boundary. 为了极大强化光影体积感,必须强制写入光束与尘粒的微观物理交互参数:intense backscattering inside the dense light shafts, scintillating tiny dust particles illuminated as brilliant glints when crossing the sharp beam boundaries, micro-thermal convection rendering a slow helical drift of airborne dust inside the 45-degree rayleigh scattering columns, creating a palpable optical thickness and dense translucent material presence of the air space. 光束必须具有极强的几何线条感、穿透力与微观折射及色散光影。
- 悬浮微尘与空气介质(Floating Dust & Atmospheric Viscosity): 显式写入 shimmering dust motes floating slowly in light rays, tiny glittering particles suspended in the air, heavy atmospheric haze. 辨识并锁死光尘微观动态,必须显式限制其自旋与边界闪烁:shimmering dust motes floating with a lazy helical spin, glittering particles flashing as they enter and leave the light beam boundaries (cross-boundary scintillation), creating an intricate layer of suspended air dust that interacts with the Tyndall effect to visualize the thick viscosity of the atmospheric medium. 利用被光线照亮的悬浮微尘,将静止的时间物质化,传递宇宙级别的孤寂与崇高。
- 冷钢深蓝色彩等级与参数(Cold Steel Blue Color Grading): 显式写入 desaturated cold steel blue, misty silver, deep indigo shadows, color grading dominance 85%, muted highlights。从色彩上强行锁死高尚神圣、未来疏离的极简科幻感,冷暖对比降至最低。任何蓝色或白色微弱荧光必须严格受限,严禁向铅灰墙体漫溢任何饱和色度,写入英文:strictly localized neon emission, zero color leakage to dark concrete walls。
- “悲壮宿命”方案特定视觉符号设计: 当剧本方向为“悲壮宿命”方案时,提示词必须引入荒凉宏大的自然巨变与渺小人类的宿命感对立:
- 广阔黄沙与风沙沙尘: 显式写入 endless rolling sand dunes, vast golden sandstorms, swirling ochre dust, barren earth, desolation。强化风沙遮天蔽日的压迫感与荒凉大地的无边无际。
- 末日烈阳: 显式写入 a blazing post-apocalyptic sun, giant low-hanging sun on the horizon, scorching giant solar disk, blinding hazy heat。太阳通常被描述为巨大、暗淡却散发灼热压迫感的圆盘,或被浓厚风沙笼罩的垂死恒星。
- 烈阳下逆光沙尘微粒发光与多角度散射质感(Backlit Sand Particles & Multi-Angle Aperture Scattering): 必须显式写入 English 控制词组:shimmering golden sand grains catching blinding backlit sun rays through massive architectural apertures, intense forward scattering of light by coarse mineral dust, miniature glowing embers of light on individual airborne sand particles, high-contrast rim lighting outlining the dust canopy, prismatic light leakage around the edges of colossal stone portals, varying angles of heavy solar shafts filtering through deep window slots, illuminating swirling dense dust columns with a bright, incandescent outline。在烈日高悬、大风沙尘暴背景下,悬浮的金沙颗粒在穿过庞大巨构孔洞/深邃窗槽时,被不同入射角度的强烈逆光“点燃”并展现出高反差轮廓光发光轮廓与微观结晶前向散射,边缘伴随有棱镜般的微弱散射与耀眼白炽光影,凸显空气与介质的宏大触感。
- 孤独远影: 显式写入 a single lonely tiny figure walking into the distance, microscopic scale contrast, fragile silhouette walking towards a giant monolithic structure on the far horizon。强调人类在广漠天地间的卑微与宿命之感。
- 黄沙琥珀色彩等级与参数(Amber Sand Color Grading): 显式写入 desaturated amber, ochre tones, burnt sand gold, dusty yellow tint, desaturation grade 80%。用低饱和度的广袤黄色与金棕色系,统一风沙肆虐、红日高悬的末日荒原宿命感。即使在多角度烈阳逆光下沙尘散射发光,其金黄/琥珀色高光也必须牢牢锁在尘粒边缘,严禁产生大面积饱和黄色光晕晕染暗部空间,写入英文:local micro-glowing edges on particles, zero overall yellow haze spill in shadows。
- “冷酷绝望”方案特定视觉符号设计: 当剧本方向为“冷酷绝望”方案时,提示词必须凸显人造结构的冰冷沉重以及自然环境的无情冲刷:
- 粗野主义混凝土巨构与表面材质纹理: 显式写入 massive towering brutalist concrete structures, monolithic decaying buildings with visible concrete formwork joints and horizontal mold seams heavily packed with dark weathered dust and fine micro-deposits of sand nested within the recessed seams, weathered exposed concrete surfaces with fine cracks and ancient grey-black soot, mottled industrial rust stains on structural steel brackets, stained rusted metallic dripping marks, imposing unadorned walls with wind-swept dust clinging to structural textures。不仅表现其斑驳粗糙、无装饰的厚重几何感,还必须在 Prompt 中强行约束暴露的混凝土拼模拼缝缝隙处风化尘埃与沙尘颗粒的微观沉积、粗糙墙体裂纹以及由风化和锈蚀导致的钢结构锈迹与铁锈水渍滴落痕迹,从而在像素级上锁死重工业废墟被漫长岁月和恶劣环境侵蚀的极致物理质感。
- 冰冷雨水与潮湿环境: 显式写入 torrential cold rain pouring down vertically at terminal gravity velocity, slick wet concrete surfaces with slow-draining liquid films, reflective dark puddles, heavy rain shafts cutting through the gloom。强调高流速重力坠落的雨滴与巨构表面极慢流淌(slow liquid sliding at 0.1x speed)的水渍在质感 与速度上的对比。
- 沉重阴影与铅灰色彩等级(Lead Grey & Pitch-black Shadows): 显式写入 heavy lead grey color palette, pitch-black colossal shadows, stark chiaroscuro, swallowing darkness, shadow coverage > 60%。利用大面积沉重的极致黑色阴影蚕食光线,配合低饱和铅灰色调,将环境和角色牢牢笼罩在深渊般的绝望与冷酷秩序中。画面中偶发的工业锈迹红褐色或雨水反光,必须严格保持极低饱和度,绝不产生偏离灰黑大调的杂色溢出,写入英文:rust color containment with extreme low-saturation, zero chroma spill on wet surfaces。
- 主干实体与多角度全身三视图约束:
-
视频生成提示词(Seedance 2.5(分辨率 480p) / MultiModalToVideo)
- 必须利用 Seedance 2.5(分辨率 480p) 对运动和氛围的卓越解析力,按以下“动作堆栈(Motion Stack)”顺序构建 prompt:
- 视频参考占位符与四宫格解构防多格化(核心红线):
- 首先声明绑定的参考图 <<<image_1>>>(角色)或 <<<image_2>>>(场景)。
- “The referenced image <<<image_2>>> is a 4-panel reference grid showing four different aspects of a single scene: top-left is establishing panoramic view, top-right is furniture close-up, bottom-left is depth perspective, bottom-right is lighting atmosphere. The output video MUST be a single-panel, unified, seamless full-screen shot that animates ONLY the specific quadrant designated in the storyboard (e.g., if the storyboard designates [左上全景定场], then the prompt must explicitly write: 'The output video MUST animate ONLY the [top-left establishing panoramic view] quadrant of the referenced image <<<image_2>>>. Do not reference, blend, or drift into any other quadrants. Ensure the character is positioned correctly inside this specific space and stays within it throughout the entire shot'). Strictly do NOT generate a split-screen, 4-panel, multi-grid, or collage video layout. Ensure the final video is a single, immersive camera shot.”
- 对白戏剧冲突与四宫格分区的提示词映射(Dialogue Conflict Prompt Mapping - 包含微表情与流体运动配合控制):
- 当故事板中的分镜被标注了特定的对白戏剧冲突标签时,视频生成提示词主体中必须结合所绑定的四宫格分区,写入特定的视觉渲染与微表情-流体联动控制语,实现画面意境与肉体微动的极致统一:
- [Silent_Suppression] 或 [Existential_Dread](绑定左上区): 提示词必须显式写入 visualize a microscopic human silhouette standing in absolute silent isolation under monolithic shadows, camera locked-off to emphasize extreme scale contrast, heavy desolate atmosphere, strictly NO movement from the colossal architecture, static scale locking; 配合微表情与流体运动控制:character face is perfectly frozen, unblinking locked-off gaze focused onto the diagonal empty space with 0x speed, throat muscles are statically tensed with zero swallow, breathing slowed to a barely perceptible pause of a micro-exhalation once every 6 seconds, synchronized with the absolute stillness of the volumetric dust particles drifting at 0.05x micro-speed。
- [Fate_Confrontation](绑定左下区): 提示词必须显式写入 perfect central axis symmetry with bilateral diagonal lines leading to a deep center vanishing point, the character walking slowly towards the vanishing point along the symmetrical path, slow-motion push-in camera movement at 0.1x crawl speed, intense feelings of unavoidable fate, golden sand particles dynamically ignited by intense backlight at various angles of incidence, sparkling like micro-diamonds as they drift slowly inside the sun-drenched portals and stone-window openings, slow-motion floating dust columns showing intense light scattering, with light refracting off heavy crystalline structures of mineral sand at a 0.2x slow movement; 配合微表情与流体运动配合控制:character exhibits unblinking locked gaze with slow sweep-in eye tracking at 0.1x speed toward the deep vanishing point, with a millisecond-level facial timing sequence: 0ms-1500ms has locked gaze with zero blink; 1500ms-2000ms triggers high-frequency electric micro-tremor of the lower eyelid; 2000ms-4000ms executes a slow deep swallowing action taking exactly 2.0 seconds with throat/larynx rising, causing lower eyelid micro-tremor amplitude to intensify and peak by 3000ms under muscle tension; 4000ms onwards dampens the eyelid tremor back to a faint residual 1Hz flutter as the larynx resets to standard resting state, subtle tensing of the throat muscles, breathing is shallow and rapid, perfectly coordinating with slow-motion golden dust storm billowing at 0.2x speed, sand cascading down at 0.1x crawl, and the shimmering scintillation of backlit sand grains at 0.1x slow self-spin speed with intense forward scattering。
- [Sovereign_Judgment](绑定右下区): 提示词必须显式写入 dramatic chiaroscuro lighting with colossal shadows swallowing more than 60% of the space, sharp high-contrast silhouette against a bright focal light window, intense heavy atmosphere of authority, sovereign oppressive tone; 配合微表情与流体运动控制:subject has a cold expressionless mask face with absolute shadow coverage, eyes wide open in an unblinking gaze locked upward at 0x speed, throat muscles in deep constricted glottal contraction with high tension to swallow dry throat under a suppressed gasp, with a precise timing sequence: at 2000ms initiating a dry swallow lasting 1.5 seconds, peaking at 3000ms with a sudden high-frequency lower eyelid shudder from suppressed fear, resetting to complete cold stillness by 3500ms as swallow ends, contrasting and coordinating with sheets of cold rain falling vertically at high-velocity downward plunge 与墙面水渍缓速流淌于 0.1x speed 从而在物理层面形成动能落差。
- [Divine_Revelation](绑定右上与右下联动): 提示词必须显式写入 sharp volumetric light shafts refracting through a narrow 45-degree angle concrete fissure with intense backscattering, shimmering dust motes scintillating and glittering at the sharp light-shadow boundary and slowly drifting in a micro-thermal helical vortex inside the light beams, illuminating a detailed close-up of a monolithic ancient relic with high-resolution texture, delicate chromatic dispersion at shadow boundaries, dense translucent volumetric fog with high optical thickness, divine angelic ethereal mood; 配合微表情与流体运动控制:lips parting slightly with warm breath fogging up in the cold, unblinking eyes widening slightly and locked onto the 45-degree light shaft with pupils reflecting the prismatic rainbow dispersion, throat muscles relaxing from tension, letting out a slow trailing exhaling sigh of 3+ seconds, perfectly matching the scintillating dust motes floating, self-spinning and dancing with a lazy helical spin at 0.05x speed in the light beam。
- 当故事板中的分镜被标注了特定的对白戏剧冲突标签时,视频生成提示词主体中必须结合所绑定的四宫格分区,写入特定的视觉渲染与微表情-流体联动控制语,实现画面意境与肉体微动的极致统一:
- 首先声明绑定的参考图 <<<image_1>>>(角色)或 <<<image_2>>>(场景)。
- 缓慢运动指令与速度等级控制: 显式指定并精确量化超慢的摄像机运动。必须强制采用绝对低速和极限凝滞的运动速度参数,确保符合单一运动矢量和“静-动-静”的运镜时间轴比率:
- 极缓推轨(0.1x倍率感):提示词中明确写入具有超微速物理运动感的速度等级参数,如 extremely slow camera push-in at a 0.1x crawl speed 或 slow-motion camera track, barely perceptible 0.1x zoom speed。
- 极缓水平横摇(0.1x倍率感):提示词中明确写入横扫视的速度参数与水平扫掠角度限制,如 extremely slow horizontal panning at a 0.1x sweep speed restricted strictly within a narrow 15 to 30 degree sector, panning camera laterally across the monolithic structures with zero vertical shift, avoiding any edge distortion or peripheral break-outs, capturing wide desolate horizons with absolute spatial alignment。
- 静止绝对悬停:在无需运镜的静置镜头中,显式声明 absolute static freeze and hovering with zero camera motion, locking spatial geometry,禁止出现任何模型自主产生的镜头摇晃、微弱镜头偏移或方向漂移。
- “静-动-静”时序过渡提示词设计:在有运镜的视频提示词中,Prompt中应显式构建包含动作前、中、后状态的三段式叙事架构,以体现时间轴缓冲。例如写入:the camera begins completely frozen for the first 3 seconds, followed by an extremely slow 0.1x crawl speed push-in, and settles back into a static hover for the final 2 seconds, maintaining absolute geometric symmetry and zero movement fluctuations。
- 巨物建筑、遗迹道具与人类动态尺度控制(Scale, Prop, and Viewpoint Locking):
- 必须在视频提示词主体中锁定人类微缩比例与粗野建筑几何线条的动态延伸,并强制锁定中轴对称与双侧对角透视。写入 maintaining extreme monolithic scale, microscopic human figure occupying less than 1% of the screen, towering concrete geometries with vertical lines running seamlessly from bottom edge to top edge, perfect central axis symmetry, symmetrical composition, bilateral diagonal perspective lines converging at a deep center vanishing point, absolute 1:100 scale ratio, epic wide-angle perspective locked-off to capture the overwhelming gravity,以强制防止在视频模型运算推移时,人类主体出现比例不合理膨胀、巨物地平线塌缩、刚性混凝土线条发生扭曲变形、或画面中轴对称发生偏斜。
- 遗迹道具材质与光雕琢动态锁定:对于古代石雕与废弃工业机械,必须在视频提示词中锁定其受光影雕琢的凹凸质感与微观开裂等静态细节,防止在动态镜头(0.1x crawl)中因相机位移导致材质产生闪烁、变相或虚无滑动。英文写入:maintaining stable tactile uneven relief textures of ancient stone carvings and abandoned metallic machinery, micro-fractured weathered surfaces sculpted by moving sharp volumetric light, preventing any pixel flickering or geometry melting on high-contrast weathered textures。
- 主体微动与克制微表情控制:描述角色极其克制和隐忍的肢体及面部微表情。在 Prompt 中必须显式描述角色眼神的凝视变化、下眼睑微颤或喉部肌肉的微弱紧缩等隐忍微动。特别强制对吞咽与眼睑微颤进行毫秒级时序约束描述:1500ms内凝视不眨眼,1500ms-2000ms眼睑高频微颤,2000ms-4000ms喉部吞咽且微颤于3000ms随肌肉紧绷达到峰值,4000ms喉部复位且微颤回降。英文控制词推荐如:'unblinking locked gaze with zero blink from 0-1500ms, electrical micro-tremor of the lower eyelid starting at 1500ms, deep slow swallowing action taking exactly 2.0 seconds from 2000-4000ms with larynx rising and lower eyelid tremor peak at 3000ms under muscle tension, and eyelid tremor dampening to 1Hz post-4000ms as larynx resets, subtle tensing of the throat muscles, controlled breathing showing emotional restraint, cold expressionless face harboring hidden tension'。对于服装布料,必须在 Prompt 中显式锁定长袍随风摆动的物理动力学与重力阻尼细节:英文推荐词如:'loose flowing robes billowing extremely slowly under a 0.2x low-velocity wind, capturing deep gravity-damped fabric folds and slow-motion crease transitions, heavy textile draping with high physical mass and inertia, strictly avoiding rapid flapping or chaotic flutter'。肢体推荐如:'character in flowing robe slowly turns their head, hair gently swaying in the sand wind, minimal facial micro-expressions'。
- 环境动态与各方案微动特征:描述沙尘、雾气、光束、雨水等的流动:
- 默认氛围:volumetric dust particles floating in the light beams, heavy fog drifting slowly across the concrete walls.
- “神圣空灵”方案特定动态:必须写入极其微弱、近乎静止的空气动力,如 countless tiny dust motes slowly drifting and dancing inside the bright volumetric light beams, shimmering particles hovering in the air。通过微尘在光柱中极为缓慢的翻滚与沉降,在视觉上表现出声音的“绝对真空”与“时间的凝固感”,强化神圣肃穆的意境。
- “悲壮宿命”方案特定动态与风沙/热流慢速微动控制:必须极其细致地描写风沙、尘暴和地平线热流的慢速微动,避免剧烈的无秩序飘忽。在 Prompt 中明确写入速度控制词,如 slow-motion golden dust storm billowing lazily at a 0.2x slow crawl speed, heavy sand dust blowing across the frame in a steady and barely-moving wave, low-frequency heat haze shimmering extremely slowly and subtly above the sand dunes, slow-motion sand grains cascading down the slope like liquid at a 0.1x crawl。为了在视频动态中渲染出烈阳逆光下沙尘微粒的多角度散射与发光质感,必须显式写入:golden sand particles dynamically ignited by intense backlight at various angles of incidence, sparkling like micro-diamonds as they drift slowly inside the sun-drenched portals and stone-window openings, slow-motion floating dust columns showing intense light scattering, with light refracting off heavy crystalline structures of mineral sand at a 0.2x slow movement。 通过控制尘暴、热流和沙粒的低速流动,衬托时间的延展、生命的沉重和环境的不息残酷。
- “冷酷绝望”方案特定动态:必须精密描写雨滴的极限高重力直落与墙面水渍的缓速流淌,显式写入:sheets of cold rain falling vertically at a high-velocity downward plunge, heavy rain droplets splashing aggressively onto the wet concrete surface, dark water stains crawling down the massive concrete walls at an extremely slow 0.1x trickle speed。从而利用高重力流速坠落的暴雨跟几乎静止、凝固般极其微慢流淌的墙面水渍(0.1x速)形成极致的速度与物理动能落差,凸显时空的冰冷与无情秩序。
- Seedance 2.5(分辨率 480p) 特效音与对话标记(情感与拟真强化):**
- 若镜头需要同步生成极简环境声或台词,在提示词尾部显式使用 Seedance 2.5 的专属标记:
- 极极简氛围环境音:根据风格方案选择适配的音效描述(用 <...> 标记包围):
- 默认环境音:<hollow wind howling, distant industrial rumble, sandstorm rustling>
- “神圣空灵”专属环境音(远古空灵吟唱与空气震动):必须指定神圣空灵配乐与特效音标记,如 <ancient wordless ethereal chanting, divine choir drone, celestial singing voice, sub-bass air vibration, deep heavy atmospheric low-frequency drone>,以便在视频生成时同步融合出极其空灵神圣的仪式感低音。
- “悲壮宿命”专属环境音(部落战鼓与风沙摩擦):必须指定部落战鼓与风沙硬质摩擦特效音标记,如 <heavy slow-tempo tribal drum pulses, primordial rhythmic deep ritualistic drum beats at 55 BPM, intense sandstorm howling, coarse gritty wind sand friction, sand scraping dry wind>,以便在视频生成时同步融合出具有强烈行进感与压迫感的环境低音。
- “冷酷绝望”专属环境音(工业低鸣、金属摩擦与冰冷雨水):必须指定冷酷绝望配乐与声效特征标记,如 <heavy cold rain pouring, clatter of heavy raindrops on concrete, sharp industrial metallic friction, rusted iron screeching, deep mechanical hum drone, colossal hollow echoes>,以便在视频生成时同步融合出深渊般的冰冷与压迫低音。
- 角色同步对话(timbre 自动继承绑定的 key_element_audio):不仅要复制剧本文字,还必须包含情绪控制符与停顿,写为 {emotion/tempo/performance: Verbatim dialogue line} 的混合标记结构(例如 {whispering, shivering: [sigh]... It's already begun... [long pause]...})。同时,在前面的“主体微动”描述中,必须增加演员的面部生理与声门状态描述(如:'throat muscles tensing, lips parting slightly with warm breath fogging up in the cold'),实现视觉口型动作与情绪音频输出的完美契合,彻底打碎AI配音机械平淡的假象。
- 双向对白与情绪互动标记(Seedance 2.5(分辨率 480p) 混合对白极化书写):凡包含两个角色情绪互动/声压对抗的镜头,视频提示词尾部必须为各角色分别书写独立的 {Timbre_ID/Emotion/Pitch/Volume: Dialogue} 标记,绝对禁止将其合并为一个混乱的文本块。在混合标记中实现情绪与物理状态的双向两极分化,例如:施压者 写入 {Element_A/hostile, high-pressure, tense-pitch: [throat tensing]... You have no choice...};承受者 写入 {Element_B/fearful, whispered, low-decibel, suppressed-vocal-fry: [swallow]... [shaky voice]... I know... [long pause]...}。通过极致分化的参数,为 Seedance 2.5(分辨率 480p) 赋予清晰的物理对比参照,确保口型、脸部肌肉紧绷感与音频在物理层面高度咬合。
- 极极简氛围环境音:根据风格方案选择适配的音效描述(用 <...> 标记包围):
- 否定提示词(Negative Prompts):如果该镜头不含画面台词且有独立BGM音轨,必须显式加入 no music, no subtitles 避免声音重叠与画面脏乱。
- 若镜头需要同步生成极简环境声或台词,在提示词尾部显式使用 Seedance 2.5 的专属标记:
- 提示词与分镜脚本无缝比对核查:
- 在编写及校验提示词时,必须严格比对故事板中对应的原分镜脚本:
- 细节对齐:确认提示词中所描述的人物(身份、服装质感)与场景(几何结构、色调)与故事板及绑定的视觉参考图高度一致。
- 台词复核:严密核对分镜脚本中是否存在对话台词。一旦存在,必须 100% 毫无偏差地将其提取并写在提示词尾部的 {} 对话标记中。
- 音效与环境音复核:检查分镜中是否有特定的物理音效、环境声音描述(如“狂风”、“低频轰鸣”),确保其均已通过专属 <SFX> 标记翻译,不放过任何一个视听细节,决不产生信息遗漏。
- 在编写及校验提示词时,必须严格比对故事板中对应的原分镜脚本:
- 视频参考占位符与四宫格解构防多格化(核心红线):
- 必须利用 Seedance 2.5(分辨率 480p) 对运动和氛围的卓越解析力,按以下“动作堆栈(Motion Stack)”顺序构建 prompt:
6. 동영상 조립
时间线组装与剪辑策略(维伦纽瓦风格)
调用 video_assembler 拼合时间线并渲染时,必须贯彻以下剪辑美学:
-
凝滞的节奏感(Slow Burn Pacing)
- 单镜头剪辑严禁碎片化。根据动态规划的分镜时长,保留每个 shot 至少 4s 到 30s 的完整展现时间,让观众有足够的时间产生面对巨物环境时的“敬畏与崇高感”。
- 镜头与镜头之间的过渡:默认使用直接切(straight cut),保持冷峻与严肃。除非需要展现时间的漫长流逝或跨空间的梦幻过渡,才使用极其缓慢的淡入淡出(fade in/out 或 cross dissolve)。
-
三大专属音景之画面时间线精密对齐与剪辑切口节奏(Timeline Alignment & Cut Pacing for Sub-styles)
- “神圣空灵”音景对齐与节奏:画面剪辑点必须与“绝对无声静默”的起始和切出帧进行原子级对齐。在故事板设计的“绝对静默”音频切口(3s+)发生的第1帧,画面运动必须瞬间冻结或转为极其凝滞的无相机位移悬停状态;在静默结束、远古吟唱(chanting)切入的第1帧,瞬间以清脆直接切(straight cut)切入 45° 丁达尔体积光照亮圣物陈设的全新大景深特写分镜,用视听瞬间爆发的厚重感造成感官震撼。
- “悲壮宿命”音景对齐与节奏:视频时间线的每一个画面剪辑切口(straight cut)必须以 100% 物理精度精确对齐在慢速部落战鼓低频脉冲(50-60 BPM)的重下槌点(downbeat)上,绝对禁止在鼓点之间的弱拍或空白拍发生画面切变。相机 0.1x crawl 极慢推轨在此剪辑切口发生前的最后 5 帧进行无痕的微动降速,在鼓点敲击瞬间锁死为静止机位,使画面剪辑节奏与命运的沉重鼓点重重同步。
- “冷酷绝望”音景对齐与节奏:剪辑切口节奏与冰冷重工业雨滴的溅落空响或缓慢尖锐的金属拉扯磨削声同步。当空旷废墟中出现稀疏而巨大的“水滴深渊空响”或刺耳铁锈拉扯声时,每一次剪辑切口的转换必须瞬间落在线声能释放的声学陡峭起点,且画面中高重力直落暴雨的下落方向、墙体 0.1x 缓速流淌水痕的起始点,在切换镜头的首帧保持完全连续、不发生动能方向突变,使工业冷酷美学在剪辑惯性中无缝流动。
-
视听共振与声级阶梯及频率/分贝避让规范(Audio-Visual Resonance, Frequency Allocation & Ducking Specs)
- 音景频率划分与赫兹(Hz)配置:
- 极低频次声波(Sub-bass / Infrasound):集中在 20Hz - 40Hz(代表远古巨构的声压共鸣、废墟深处震动和神圣空间重低音),最大声压级(SPL)需充足但严控浑浊,主频段在 30Hz 设为能量中心。
- 环境风噪与介质音(Ambient Wind Noise & Media Textures):集中在中高频 200Hz - 1000Hz(风沙呼啸、大气的空旷气流感),且在 80Hz 以下进行陡峭切除(Low-cut roll-off),防止其与 20Hz-40Hz 的次声波重叠,从而在物理频谱上保持声场的澄澈度。
- 人声对白与旁白(Dialogue & Narration):核心频段锁定在 150Hz - 4000Hz,特别是在 3000Hz - 4000Hz(高清晰度区)预留丰满通透的频响。
- 音画剪辑点控制:剪辑点必须精确卡在低频低音振动(bass drop)或巨型物体完全显现的瞬间。当画面展现极端空旷的大远景时,音频层应瞬间压低(只保留微弱的风声或高频机械耳鸣音),利用视听的极度“空无”强化孤独感与宿命感。
- 多路分贝(dB)避让与压限比例(Multichannel Sound Ducking & Gain Allocation):
- “贴耳人声”与次声波避让(-18dB 至 -24dB):当角色进行对话(dialogue)或旁白(narration)时,为了消除次声波对人类声带频段的掩蔽效应(Masking Effect),必须对 20Hz - 80Hz 频段的低频次声和 BGM 实施高强度、大陡度衰减(Ducking),衰减比例设为 -18dB 至 -24dB。
- “贴耳人声”与环境风噪避让(-12dB 至 -15dB):同期,对中高频 200Hz - 1000Hz 的环境风噪进行中等陡度衰减(Ducking),衰减比例设为 -12dB 至 -15dB。通过这一级差避让(次声深度避让、风噪中度避让),使温暖、干燥的人声如在耳边呼吸般凸显,与情感对比张力。
- 音景频率划分与赫兹(Hz)配置:
-
字幕与后期
- 不在视频画面内直接叠加 AI 生成的脏字幕。所有旁白和对话的字幕应在最后组装阶段以干净、无边框、纤细的极简字体进行渲染,且位置居中偏下,绝不遮挡构图中的几何线条。