王家卫风格短片
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
用于创作高流畅度、多视角、极具王家卫式诗意与破碎感的美学视频,支持普通话、粤语、上海话、闽南语、东北方言、四川方言、重庆方言、河南方言等多种语言。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
Skill定位:
本Skill专注于将剧情需求重构为具备强烈情绪张力、自然面部微表情、多维景深透视与高频“自动切镜”的电影级视频。摒弃生硬的静态插帧或首尾帧生成,直接通过角色与场景的多模态参考,实现高流畅度、多视角、极具王家卫式诗意与破碎感(时间哲学、都市孤独、抽帧降格、框架式构图、诗意内心独白)的美学视频。
最高执行原则:
- 拒绝静态PPT感与沉闷默片:严禁设计无动作、慢动作或纯PPT过渡的静态分镜,且拒绝生成无声、无对白的纯默片素材。人物必须有极其生动、细腻的情绪表情(尤其是眼神的忧郁与试探),角色可以自由移动、转头、互动,动作需自然、生动且富有故事感,不强制面对镜头。
- 充分释放模型切镜潜力:利用 Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p) 的“自动切镜”能力。将长剧本拆分为多段 30 秒视频,并在每段 30 秒内部规划 3-5 个高频镜头切片(自动切镜)。
- 空间三维深度与光影阻隔:拒绝将三维画面二维化或扁平化,画面必须具有清晰的【前景-主体-背景】三维空间景深。善于利用门框、窗帘、玻璃等前景遮挡物制造“窥视感”与空间阻隔。
- 双模态多角色参考流:不生成多宫格参考,直接使用多角色设定图(Character Sheet A/B)与场景设定图进行多模态参考绑定(MultiModalToVideo),最大化还原多角色与场景的一致性,同时结合高素质提示词编排物理运动。
- Prompt规范:所有提示词必须完全且固定使用中文书写,禁止包含任何英文单词、英文字标或英文字符。所有画面描述、风格描述、动作指令及负面词等,均必须采用纯中文。
前置选择与规格确认(第一阶段):
在解析任何具体剧本前,必须通过 reply_to_user 向用户提出以下选择,确认后写入 Final_Video_Spec.md 的顶部:
- 视频生成模型:
- Seedance 2.5(分辨率 480p)(最高画质,需会员)
- Seedance 2.5(速度更快,480p,适合快速预览)
- 输出分辨率:
- 480p(两款模型均支持,非会员上限)
- 480p(仅 Seedance 2.5 支持,需会员)
- 单段视频时长:默认锁定为 30 秒(以最大化释放自动切镜和多镜头连载能力)。
- 画面比例:16:9(默认)、9:16、1:1。
- 输出语言与方言口音:
- 普通话(默认)
- 粤语(王家卫电影经典推荐)
- 上海话(《繁花》同款海派都市怀旧推荐)
- 闽南语(浪漫烟火气与海岛复古风情)
- 东北方言(强生活气息与独特宿命感张力)
- 四川方言
- 重庆方言
- 河南方言等(支持利用 Seedance 2.5(分辨率 480p) 直接生成地道方言口音对白)
确认后将以上五项记录在 Final_Video_Spec.md 的顶部,后续所有步骤严格遵守,不得私自更改。
优化后执行流程与阶段逻辑:
-
读取输入与规格确认 ——【强制暂停点】
- 读取用户输入,沟通并确认前置视频规格(时长、画面比例、模型选择、分辨率选择、输出语言与方言口音选择)。
- 将确定的规格写入 Final_Video_Spec.md。
-
故事框架与分镜脚本设计 ——【强制暂停点】
- 剧本改编总编剧与原著忠实思维:在处理故事素材或长剧情时,必须深度扮演“影视剧本总编剧/原著忠实守护者”,严格执行“像摄像机一样思考”(镜头拍不到的绝对不写,杜绝主观心理叙事描述)、“像剪辑师一样思考”(精简过长日常寒暄与风景描写,直奔主题节奏)、“像原著作者一样思考”(100%尊重原著情节、人物关系与核心走向,绝对禁止为了戏剧冲突而擅自增减情节或添加无根据的危险纠纷,必须遵循原著自然平稳收尾,拒绝刻意留下吊人胃口的廉价悬念)。
- 场景时空严格拆分机制:只要剧情发生的地点、空间或时间发生哪怕极其微小的转移,必须将其划分为新的独立分镜场景,并冠以规范的标准场景标题。
- 检查用户输入是否包含具体故事:
- 若有故事,直接使用并严格遵循上述原则进行分镜脚本设计。
- 若无具体故事,则必须先通过沟通与用户确认故事框架和核心故事内容,得到确认后再在 storyboard_designer 中撰写 30 秒多切片分镜脚本。
- 多角色与长线叙事设计:支持多角色(角色A、角色B等)的引入。编写分镜脚本时,必须先确立一个贯穿始终的“核心悬念/故事主线”,并引入**“视觉状态账本(Visual State Ledger)”**机制,为每段 30 秒视频的衔接点建立“状态锚点”(记录角色A/B的物理位置、姿态、道具状态、环境光影),确保前后素材在动作和视觉上完美对应,连贯不脱节。
- 编写的分镜脚本对每段 30 秒视频必须拆解为 3-5 个内部子镜头(自动切镜),包含【前景-主体-背景】空间层次、生动的面部动作、自然连贯的多角色对白/内心独白与环境音效。
- 暂停并请求用户确认。
-
多角色与场景设定图生成 ——【询问并暂停】
- 交互检查:在开始生图前,必须明确询问用户是否需要/想要直接上传他们自己的角色参考图 and 场景参考图。若用户选择上传,则暂停等待用户上传资产,并在收到后绑定;若用户选择生成,则继续以下生成:
- 多角色参考图:若剧本包含多个角色,需使用 GPT Image 2(2K)分别为角色A和角色B生成独立的“多视角角色设定图”(四图水平排列的单张横向拼版图,包含半身特写、正面全身、侧面全身、背面全身,纯白背景),用于锁定各角色的面部、体型及服饰全方位轮廓。
- 场景参考图:使用图像模型生成具备透视、低照度光影和王家卫式美学色盘的场景设定图。
- 生成后,展示图样,暂停并请求用户确认。
- 交互检查:在开始生图前,必须明确询问用户是否需要/想要直接上传他们自己的角色参考图 and 场景参考图。若用户选择上传,则暂停等待用户上传资产,并在收到后绑定;若用户选择生成,则继续以下生成:
-
角色设定视频生成与音色提取 ——【强制暂停点】
- 4.1 生成角色设定视频:分别引用生成的角色A和角色B参考图,调用 media_generator 的 MultiModalToVideo,严格锁定使用 Seedance 2.5(分辨率 480p) 生成一小段 4-6s 的角色设定/对白视频(展示角色的初始说话状态和声音特征)。
- 4.2 回到 Planner 顶层提取音色:角色设定视频生成完成后,Planner 必须回到顶层,再调用 resource_prepare_and_analyze 分别从视频中提取音频音色;不得把“从视频提取音色”的任务继续委派给 media_generator。
- 4.3 注册并绑定音色资产:音频音色提取成功后,再调用 media_generator 的资产管理能力,将提取出的音频注册并绑定为 key_element_audio_A 和 key_element_audio_B(作为后续对应角色所有对白、内心独白和视频生成的声音参考,确保多角色不出现无声默片或声音串音状态)。
- 4.4 失败处理:如果 resource_prepare_and_analyze 无法提取音频、音色不可用或方言明显错误,必须暂停并告知用户该角色音色提取失败,请用户选择重生成角色设定视频或提供音频参考;不得静默调用豆包、text to narration、search_voice_id、generate_audio_resource 或其他 TTS/语音生成路径来冒充“从视频提取出的音色”。
- 暂停,向用户汇报音色提取成功。
-
视频素材生成 ——【逐步生成并暂停确认】
- 调用 media_generator 的 MultiModalToVideo(支持 Seedance 2.5(分辨率 480p) / Fast),直接使用多角色参考图与场景参考图作为多模态输入,并引入对应的 key_element_audio_A/B 参考音频。
- 每段 30 秒视频生成后,均需暂停并与用户沟通确认,确保无瞬移或表情呆板。必须严格根据“视觉状态账本”校验当前段落开头与上一段落结尾在动作、道具状态、角色位置及环境光影上是否完美衔接,得到首肯后再进行下一段生成。
-
背景音乐BGM方向确认与生成 ——【强制暂停点】
- 与用户沟通并确认符合本案情感走势的音乐/BGM方向。在此环节,根据前置阶段选定的输出语言/方言,主动向用户推荐专属的特色乐器组合与背景音乐风格:
- 粤语(经典港风,霓虹幽怨):推荐 大提琴拨弦 + 慢速萨克斯风 + 复古电吉他(带重混响),营造八九十年代香港电影中霓虹闪烁、宿命纠缠、都市男女爱而不得的迷幻与孤独。
- 上海话(爵士海派,纸醉金迷):推荐 爵士钢琴(缓慢琴键) + 慵懒萨克斯风 + 低音提琴拨弦,重现《繁花》般黄河路旧日舞厅与弄堂深处的复古华丽、慵懒情调与旧时代烟火。
- 闽南语(民谣怀旧,闽南烟火):推荐 古典吉他(质朴弹拨) + 怀旧手风琴 + 忧郁小提琴或长笛,展现海岛雨夜、老街古厝的漂泊感、浪漫温情与岁月的泛黄质感。
- 其他语言/通用王家卫风:默认推荐大提琴拨弦、忧郁小提琴与复古探戈手风琴组合,建立最经典的浪漫、暧昧、压抑与孤独美学基调。
- 确认方向后,根据确定的乐器与曲风,调用 media_generator 使用 text_to_instrumental 工具(Suno 5 / Mureka 8)生成纯乐器背景音乐。
- 与用户沟通并确认符合本案情感走势的音乐/BGM方向。在此环节,根据前置阶段选定的输出语言/方言,主动向用户推荐专属的特色乐器组合与背景音乐风格:
-
时间线合成与剪辑导入 ——【强制暂停点】
- 素材全部生成完毕并得到用户确认后,调用 video_assembler。
- 导入音轨(Foley 音效、多角色对白/内心独白、背景音乐)与视频轨,在时间线上执行精确卡点与无缝硬切。
- 确认合成质量,确保画面生动、剧情连贯、无PPT呆板感。
-
王家卫电影海报风格封面图设计 ——【分步延展并暂停确认】
- 调用图像生成工具(GPT Image 2 或 Nano Banana Pro),设计极具王家卫美学、高对比度低照度光影、独特复古色盘和艺术排版(带有诗意电影中英双语台词)的电影海报封面。
- 步骤:
- 先生成 16:9 的封面图,暂停展示给用户并进行沟通确认。
- 用户确认通过后,再延展并生成 3:4 和 4:3 两个比例的封面图,完成全案输出。
依赖关系:
2→1;3→2;4→3;5→4,3;6→5;7→6,5;8→7。
何时暂停:
每一阶段(1~8)涉及的用户沟通确认点均为硬性暂停点,严禁一次性跑完。若用户提出修改,必须回退至对应步骤重新确立。
2. 多模态分析
多模态解构规范:
一、角色动作与表情性能解构
必须深度分析剧本或用户参考素材,提炼角色的真实表演潜能:
- 面部微观动作:识别剧本中的情绪转折(如隐忍的爱意、被拒绝后的落寞、时间的焦虑、释怀的遗憾),提炼肌肉联动描述。特别注重眼神的刻画(如:眼眶微湿、视线向下低垂避开对视、瞳孔微缩、下颌紧绷)。拒绝面无表情,确保角色神态生动自然,充满东方美学的含蓄克制。
- 物理交互反馈:分析角色与环境道具的交互力学(手指轻轻划过斑驳的墙壁、手握酒杯微微摇晃、打火机点燃香烟时火光的跳动、雨水打湿风衣时的重力下坠)。
- 多角色互动与视线:规划多人物之间的视线交汇与身体朝向(如:角色A在狭窄走廊里擦肩而过时,视线微抬又迅速垂下;角色B在烟雾缭绕中微微侧头注视其背影),打破人物始终正对镜头的呆板格局。
二、三维空间与镜头深度解构
分析场景资产,确立清晰的三维景深属性:
- 前景层识别(框架式阻隔):识别可用作焦外散景的前景遮挡物,制造窥视感(如:半开的百叶窗、飘动的红色窗帘、玻璃窗上的雨滴倒影、走廊的石柱边缘)。
- 主体层焦距:明确主体的物理位置。计算光圈虚化范围,确保主体处于绝对清晰的焦平面上,展现低照度下的皮肤质感与微表情。
- 背景层纵深:提取背景的透视线、深度层次与漫反射光源(如:远处闪烁的霓虹灯、昏暗街灯下的雨丝、旅馆走廊的暖黄壁灯),用于在提示词中指导虚化效果与焦外光斑形态。
三、声学纯净度解构
- 对白与独白声学环境:根据场景判定声音声场(如:空旷旅馆房间的物理混响、狭窄面摊处的环境嘈杂与人声干涩、雨夜街道的散失)。
- 物理音效定位(Foley):提取细微的材质碰撞声(高跟鞋在潮湿瓷砖上的“哒哒”声、打火机清脆的“咔哒”声、烟草燃烧的细微沙沙声、雨水击打雨伞的沉闷声),禁止任何背景音乐(BGM)在视频提示词中进行直接文字叙述。
四、文本剧情改编解构(剧本大师核心引擎)
在分析及改编原始故事文本时,必须将纯文学、描写性或抽象的文字,严格解构、翻译为纯视觉与物理行为表现:
- 文学情感的“视觉化行为翻译”:严禁保留心理描写或带有“仿佛”、“似乎”、“感到极其...”等主观描述。遇到角色抽象情绪时,应遵循物理常识和行为逻辑,将其逆向解构为摄像机拍得到的动作与表情:
- 犹豫不决 翻译为:在门槛前踱步,右手抬起悬在半空,接着缓慢缩回,视线向下移。
- 内心悲伤 翻译为:双目泛红、泪水顺着面部缓缓滑落,双唇轻颤,一动不动地盯着手中已熄灭的烟头。
- 强烈愤怒 翻译为:面部咬肌紧绷,下颌线绷紧,胸口剧烈起伏,猛地拍击桌面,水杯中泛起涟漪,双眼死死盯着对方。
- 天气炎热 翻译为:蝉鸣声凄厉,衣料被汗水浸透并紧贴背部,手指不停拉扯领口。
- 冗长风景与日常寒暄解构:
- 将原著中大量的空泛、大段自然景色描写,凝练为一到两个带有强情绪色彩的电影氛围描述动作(如“△ 暴雨如注,打湿了屋檐,泥泞的路面积水反射着昏暗的灯光”)。
- 过滤废话和无效的社交礼仪性寒暄,使每一句对白都直切主题,推动核心事件向前走,绝不删减任何原著剧情节点,同时利用行为举止强化人物态度。
3. 故事板设计
**王家卫电影美学故事板设计规范:**
一、 核心元素设计 (Elements)
- 多角色元素 (Multi-Character Elements):
- 角色设定需具备标志性的、色彩鲜明且极具时代感的服装与配饰(如:角色A穿着修身精致的复古花纹旗袍、手提保温云吞面壶;角色B穿着挺拔的深色西装、梳着一丝不苟的油头,或戴着墨镜、穿着磨损的皮衣)。
- 表演风格设计为“含蓄克制,静水流深”。角色肢体保持优雅与秩序,但眼神、嘴角、下颌等微观局部必须有极其生动的肌肉联动,拒绝面瘫或僵死。
- 对白/内心独白设计必须自然、合理、连贯且符合逻辑,能够清晰传递剧情信息,让观众轻松理解故事走向。内心独白需具备王家卫式的文学性与诗意(如:“在1960年4月16日下午三点前的一分钟,你和我在一起...”)。对白与独白应使用在 Final_Video_Spec.md 中确认的输出语言/方言书写(如直接使用粤语、上海话、闽南语、东北话、四川话等的特色词汇和日常语气助词),确保后续方言口音生成效果更加真实自然。
- 场景与道具元素 (Scene & Prop Elements):
- 每个主要场景(Scene)必须设定一种高度自洽的低照度、高饱和度色彩美学与色盘组合。除了霓虹冷色,应重点引入并推荐以下经典色盘建议,以提升画面的高级感与故事质感:
- 都市霓虹 (Neon Melancholy):翡翠绿 (Emerald Green) 与 霓虹红 (Neon Red/Cyan),配合深邃的黑色阴影,营造迷幻、暧昧且疏离的现代都市夜晚。
- 复古怀旧 (Vintage Nostalgia):暗红 (Crimson Red) 与 琥珀黄 (Amber Yellow/Mustard),配合暗绿底色,展现 60 年代香港的怀旧、压抑与情欲涌动。
- 大漠孤影 (Golden Desolation):赭石金 (Ochre Gold) 与 深邃蓝 (Deep Indigo),展现如《东邪西毒》般荒凉、孤傲且带有时间质感的江湖。
- 必须规划具有高辨识度、几何感或复古美感的特写道具(如:绿色的点唱机、跳动着数字的复古大时钟、燃烧着微弱火光的香烟、写着“2046”的金色门牌、印有手写字迹的泛黄信纸)。
- 每个主要场景(Scene)必须设定一种高度自洽的低照度、高饱和度色彩美学与色盘组合。除了霓虹冷色,应重点引入并推荐以下经典色盘建议,以提升画面的高级感与故事质感:
二、 镜头与分镜设计 (Shots)
对于每段 30 秒视频,必须严格拆解为 3-5 个高频子镜头,并根据以下“王家卫视觉语法”进行分镜设计:
- 构图设计 (Composition):
- 框架式构图与空间阻隔:默认推荐框架式构图(Frame-within-a-frame),利用门框、窗户、百叶窗或飘动的窗帘作为前景,将人物“囚禁”在狭小的视觉框内,制造强烈的窥视感与道德/情感禁锢感。
- 美学配额制(Aesthetic Quota):
- 倾斜构图(Dutch Angle):用于表现人物内心的动荡、迷茫与失去平衡,全片配额为最多 1 次(或完全不出现)。
- 极度对称平衡构图:全片配额为最多 1 次(或完全不出现)。
- 其余 90% 以上的镜头必须采用常规的、服务于叙事的电影视听语言(如:越肩机位、侧面中景、自然三分法等),严禁过度炫技。
- 镜头运动 (Camera Movement):
- 手持呼吸感摄影 (Handheld Camera):微弱的、情绪化的手持呼吸感晃动,创造“漂浮的现实感”和“即兴诗意”,使摄影机成为情绪的参与者。
- 抽帧/降格(Step Printing):抽帧拖影镜头在整条长视频中全片配额为最多 1 次(或完全不出现)。仅在表现时间流逝、角色与环境的疏离(如:角色在面摊前缓慢喝汤,背景中的行人化为快速流动的拖影)时作为高光调味剂使用。
- 极速横摆(Lateral Whip Pans):全片配额为最多 1 次(或完全不出现)。
- 特写与慢镜头(Extreme Close-up & Slow Motion):捕捉眼神、手指、香烟烟雾等微观细节,通过慢镜头延长时间,承载情感重量。
三、 独立音频轨道设计 (Audio Tracks)
- 背景音乐(BGM):
- 推荐使用深沉、伤感、极具时代感的纯乐器配乐(如:大提琴拨弦、忧郁小提琴、探戈手风琴、爵士钢琴)。音乐需具备极强的旋律性与情感张力,以便后期 assembler 进行卡点对齐。
- 环境音效与对白/内心独白(Foley & Monologue):
- 每一个子镜头描述必须包含极其干净、精确的 Foley 物理拟音(如:高跟鞋在瓷砖上的“哒哒”声、打火机清脆的“咔哒”声、烟草燃烧的细微沙沙声)。
- 内心独白设计需精简、诗意且富有文学色彩,声音环境(混响、扩散)需与画面内空间容积完全一致。
四、 多段连贯性与叙事逻辑规范 (Coherence & Narrative Logic)
- 视觉状态账本(Visual State Ledger)机制:
- 状态锚点记录:每段 30 秒视频结尾,必须强制记录当前时间线的“终态锚点”:
- 角色物理状态(如:角色A右手夹着香烟,烟雾微弱上升,身体靠在石柱上;角色B站在走廊另一侧,微微低头)。
- 道具与环境状态(如:烟头火光微弱;环境为昏暗的暖黄壁灯,主光源在左侧上方)。
- 状态锚点继承:在设计下一段 30 秒脚本时,必须将上述“终态锚点”作为“始态”,强行写入新段落的前 3 秒内,确保物理细节的绝对连贯,严禁出现道具位移、衣服干湿不符、角色位置瞬移等穿帮现象。
- 状态锚点记录:每段 30 秒视频结尾,必须强制记录当前时间线的“终态锚点”:
- 动作衔接(Match Cut):前一段 30 秒结尾角色的最后一个动作(如:向右转头、伸手推门),必须在后一段 30 秒开头的前 1 秒内完成闭环(如:完成转头、门被推开),确保视觉上的无缝流淌。
- 逻辑递进(Logical Progression):对白/内心独白设计必须符合常人交流与心理逻辑。前一段的独白留下的悬念或问题,后一段必须有合理的解答或心理反应,杜绝跳跃式、无因果关系的台词,让观众看完能清晰理解整个故事内容。
五、 剧本大师视觉语法与格式引擎规范 (Script Format Engine)
- 标准化视觉符号与排版控制:分镜脚本中对每个场景与动作必须严格应用标准化符号,杜绝杂乱排版,实现工业级可开拍剧本:
- 【※】场景标志:每次由于地点或时间变化而导致换场时,必须使用此符号作为场景标题开头。格式示例:※ 场景 [编号]: [内/外] [具体地点] [时间](例如:※ 场景 1: 内 狭窄走廊 黄昏)。
- 【△】动作描写(核心顶格):所有动作、画面构图、物理变化,均使用此符号开头顶格书写。只写摄像机看得到、麦克风听得到的客观实体(如:△ 苏丽珍(角色A)缓慢走过斑驳的绿墙,高跟鞋在地砖上发出沉闷的响声),禁止文学词和抽象词。
- 【 】技术性标注:使用中文【 】包裹特效、背景音效、拟音 Foley 指令或屏幕出现的关键文字内容。
- ( )语气与微表情控制:在角色对白/内心独白开始前,使用中文( )包裹,用于提示角色的表演神态、情绪修饰或声音表现(如:(眼神落寞,视线低垂))。
- 动作与对白的“分离式电影排版”:严禁将动作和对话杂糅在同一段内。在脚本正文中,必须严格按照“先顶格写动作(△) -> 换行写角色名 -> 换行写语气表情括弧 -> 接着写台词对白 -> 再次换行写新动作(△)”的规范段落结构,使整个故事板具备极强的节奏感与镜头指向性。
- 对话极简主义与王家卫诗意独白的融合:
- 对话台词必须口语化,具有呼吸感并符合日常说话常识,但在表达上需融入王家卫独特的含蓄克制、具有碎片感和时间哲学意味的潜台词(如:“在1960年4月16日下午三点前的一分钟,你和我在一起...”)。
- 绝不为了文艺效果而修改原著中角色原本持有的核心态度与人设。
- 原著剧情一致性与无悬念平稳收尾(双红线审查):
- 剧情一致性(绝不魔改):对原著进行改编时,剧本的剧情完整度与原著忠实度必须达到 100%。允许为了视听节奏精简风景、寒暄与冗长废话,保持极高的信息密度,但严禁擅自增加原著中不存在的矛盾、打斗或刻意戏剧化意外。
- 自然收尾(绝无悬念扣子):故事的结尾必须平稳落地、自然收束,杜绝任何为吸引眼球而强行制造的危机、悬念或“下回分解”。原著的情节讲到哪里,脚本就忠实地在那里平缓结束,呈现一种诗意的释怀与遗憾美学。
4. 媒体生成
**多模态连续视频生成规范:**
一、生成路径与模型锁定
- 核心视频工具:必须且仅能使用 MultiModalToVideo(支持的模型为 Seedance 2.5(分辨率 480p) 或 Seedance 2.5(分辨率 480p)),严禁使用 FirstFrameToVideo 或 VideoInterp(其依靠硬编码的首尾帧进行插帧,动作会极其呆板)。
- 核心图像工具:使用 TextToImage / ImageToImage,推荐使用 GPT Image 2(2K)或 Nano Banana Pro(2K)。
- 音频生成工具:使用 text_to_instrumental(推荐模型为 Suno 5,备选 Mureka 8)来生成纯乐器 BGM。
二、图像资产预生成与绑定规范
在生成 30 秒视频前,必须确保以下资产已注册并绑定至 key_element:
- 多角色参考图:
- 使用 GPT Image 2(2K),默认采用真人实拍风格,分别为角色A和角色B生成四图水平排列的“多视角角色设定图”(左侧大幅半身特写,往右依次为正面全身、侧面全身、背面全身,采用纯白背景和柔和环境光),用于精确定位各角色的全方位面部、体型和服饰细节。
- 将其分别注册为对应的角色 logical asset(如 character_sheet_A、character_sheet_B),保证跨镜头面部、身材与服装纹理的高度一致性。
- 场景参考图:
- 使用图像模型生成具备真实物理透视、低照度光影、细节逼真、符合美学色盘的背景/场景参考图。
三、声音资产提取与角色视频预生成规范
- 多角色设定视频生成:分别引用生成的角色A/B参考图,调用 MultiModalToVideo(锁定使用 Seedance 2.5,分辨率 480p,时长 4s-6s),结合一段简短的角色台词/语气描述的中文提示词,生成一小段专门展示该角色初始说话状态和声音特征的短视频。
- 音频音色提取的路由边界:media_generator 只负责生成角色设定短视频,以及在 Planner 传回已提取音频后执行资产注册与绑定;它不能直接调用 resource_prepare_and_analyze。若收到“从刚生成的视频提取音色”的委派,必须返回需要 Planner 调用 resource_prepare_and_analyze,不得改用豆包、text to narration、search_voice_id、generate_audio_resource 或其他 TTS/语音生成路径来生成替代音色样本。
- 音频音色绑定:只有在 Planner 完成 resource_prepare_and_analyze 提取并传回可用音频后,才将其注册并命名绑定为对应的 key_element_audio_A 和 key_element_audio_B 资产,作为后续对应角色所有对白和视频生成的声音参考,彻底杜绝无声默片与串音。
四、多镜头切片视频生成逻辑
- 多参数注入:调用 MultiModalToVideo(模型:Seedance 2.5(分辨率 480p) 或 Seedance 2.5(分辨率 480p))生成 30 秒的主体视频。必须同时传入绑定的多角色参考图(绑定到各自的角色 element 占位符,如 <<<character_sheet_A>>>、<<<character_sheet_B>>>)与场景参考图(作为 scene 占位符)进行多模态联合控制,不使用任何多宫格故事板。
- 多角色声音同步与口型对齐(Lip-Sync)与方言驱动:在 audio_infos 中,必须根据当前镜头说话主体的不同,精准引用对应的 key_element_audio_A 或 key_element_audio_B 资产 ID。在调用 MultiModalToVideo 时,必须将对应的音频资产作为口型驱动源(audio_prompt)输入,确保生成的角色在说出对白/内心独白时,嘴部动作与提取的音色高精度同步(Lip-Sync),呈现极其生动的说话状态。同时,需依据 Final_Video_Spec.md 的输出语言配置,在提示词和模型参数中显式指定所需的方言语调口音(如:粤语、上海话、闽南语、东北话、四川话、重庆话、河南话),以发挥 Seedance 2.5(分辨率 480p) 优秀的原生方言口音直接生成能力。
- 参数硬性约束:
- Seedance 2.5:支持 480p / 480p(480p 需会员),默认推荐 480p。
- Seedance 2.5:固定支持 480p。
- 单段时长必须为物理整数(4s-30s范围,建议锁定为 30s 以实现段内切镜)。
五、王家卫电影海报风格封面设计规范
- 美学设计目标:生成符合王家卫电影海报美学(高对比度低照度光影、强烈的色彩饱和度与冷暖对比、手持微晃的动感或优雅静止、艺术排版与手写字/中英双语台词装饰感、平视视角及暧昧孤独氛围)的艺术封面。
- 多尺寸出图控制(分步执行):
- 第一步:使用图像生成工具(GPT Image 2 或 Nano Banana Pro),先设计并生成 16:9 比例的主封面图,提交给用户进行视觉审核与确认。
- 第二步:待用户确认通过后,再以此 16:9 图及风格为参考基础,延展并生成 3:4 和 4:3 两个比例的封面图,达成全端、全比例覆盖。
5. 提示词撰写
**【优先级最高:所有 Prompt 必须完全且固定使用中文书写,严禁出现任何英文单词、英文字标或英文字符。所有画面描述、正向风格词、负面提示词、以及音频乐器提示词等均必须翻译为纯中文描述。】**
一、 图像提示词与参考图逆向工程规范(GPT Image 2 / Nano Banana Pro)
-
多模态视觉逆向解析逻辑
在编写图像提示词前,必须隐式读取和分析用户上传的任何多模态参考图特征,并在提示词中复刻这些视觉线索:- 角色参考图:提取五官比例、骨相特征、妆容(如:复古红唇、精致眼线)、特定服饰的材质纹理(如:重磅真丝旗袍的刺绣纹理、呢子大衣的粗糙质感)与穿搭特征。
- 场景参考图:提取建筑流派、空间几何结构、低照度主光源方向、色温、环境磨损度(如:斑驳的墙纸、潮湿反光的石砖地面)与大气透视。
- 道具参考图:提取表面材质(如:绿瓷点唱机、黄铜烟灰缸)、物理体积与高光反射率。
- 分镜参考图:提取摄影机机位(如:低角度仰拍、窥视视角)、构图法则(如:框架式构图、三分法则)与景深畸变特征。
-
美学风格自适应机制
根据剧本题材或参考图,自动映射视觉流派词汇库:- 真人实拍风格:次表面散射、毛孔细节、真实光学景深、物理级光线追踪、85mm定焦、胶片颗粒、低照度高对比度。
- 2D动漫风格:赛璐璐平涂、边缘线勾勒(Lineart)、动漫式夸张透视(大张一刀流)、手绘水彩背景、非真实感渲染(NPR)。
- 3D动画风格:皮克斯风格、柔和全局漫反射、夸张的材质高光(如黏土/塑料质感)、卡通比例面部绑定。
- 水墨流派风格:宣纸晕染、焦墨枯笔、留白构图、水墨粒子消散、低饱和度国风色卡。
- 默认兜底:若无明确倾向,强制采用【真人实拍风格】。
-
三维空间景深解算与微观描述
- 空间深度:提示词必须显式规定【前景】、【主体】、【背景】三层结构。通过物理级焦平面描述(如:85mm F1.2大光圈、极浅景深、焦外圆形光斑、百叶窗光影阻隔)建立画面的空间秩序。
- 微观细节:特写镜头中必须描述瞳孔倒影、肌肉微表情、皮肤次表面散射、毛孔结构、衣物纤维纹理、缭绕的香烟烟雾。
- 情绪与动作:拒绝僵硬状态,描述生动且富有情绪张力的动态神情(如:下颌紧绷、眼眶湿润、手指骨节因用力而泛白、眼神快速扫视、视线向下低垂避开对视)。
-
角色参考图(Character Sheet)提示词规范
- 默认美学风格:默认采用真人实拍风格,强调真实的皮肤毛孔、发丝质感与次表面散射,防止产生二次元或3D塑料感。
- 排版布局:纯白背景,四张子图水平横向排列,从左到右依次为:①左侧大幅半身特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身。
- 视角精细分工:
- ① 半身特写:面部占画幅上部 2/3,眼神带有一丝忧郁,不直视镜头(或直视镜头但眼神复杂),精准呈现皮肤、发丝与五官细节。
- ② 正面全身:头顶至足部完整入画,标准站立姿态,还原服装正面剪裁。
- ③ 侧面全身:完整左侧身体剪影,保留服装侧面轮廓及层次。
- ④ 背面全身:服装背面细节完整、材质纹理清晰可见。
- 环境光影控制:绝对纯白背景,柔和均匀的环境工作室光,无强方向性的生硬阴影,面部使用柔和软光补光。
- 视觉质感与负向过滤:
- 正向风格词:极度超写实摄影、照片级真实感、电影画质、8K分辨率、影棚光照、清晰聚焦。
- 负向排除词:无文字、无水印、无标识、无多余人物、无动漫、无插画、无彩色背景、无背景道具、无床、无窗帘、无烟雾。
-
王家卫电影海报封面提示词规范
- 美学核心:高对比度、暗调光照,强烈的冷暖色彩对比(如绿与红、蓝与黄),主体处于幽暗的环境中,带有朦胧的烟雾或雨水反光。
- 排版排字描述:画面下方或上方带有精美、干净的复古衬线体电影标题,以及极具诗意的中英双语电影台词排版(艺术排版、干净的电影演职员表文字、诗意双语字幕)。平视、暧昧的自然采光,呈现出带有怀旧、精致、孤独电影感的海报风格。
- 负向排除词:无混乱排版、无杂乱文字、低画质、混乱色彩。
-
电影级光影与曝光微调规范(低照度明暗对照与特定方向漫反射)
- 低照度面部软光:人物面部光照必须避免生硬、高对比度的直射强光。强制使用具有包覆感、柔和过渡的低照度漫射软光,柔和勾勒皮肤与发丝的次表面散射质感,在黑暗背景中突出面部轮廓,明暗交界线过渡丝滑,杜绝曝光过度导致的细节丢失。
- 特定方向漫反射与霓虹反射:场景与环境必须建立单一且方向明确的实用光源(如:壁灯、台灯、霓虹灯)。光线在非光滑表面(如复古墙纸、布料、哑光木质)上呈现定向漫反射,在潮湿地面或玻璃上呈现斑驳的霓虹倒影。明确规定光线随距离的自然衰减(光衰减),确保前景、主体、背景的光亮层级与光源方向逻辑绝对自洽。
二、 Seedance 2.5(分辨率 480p) 30s多镜头分段提示词模板(核心重头戏)
生成 30 秒视频的提示词时,必须且只能严格采用以下【四个Markdown模块】结构进行书写。单次输出纯提示词文本控制在 1500字至3000字 之间,以充实空间景深、材质、微观细节与前后段落的叙事连贯性。
【全局视觉与美学基调】
- 美学风格:[明确指出,如:真人实拍风格,王家卫式都市怀旧美学,强调低照度高对比度光影,融入强烈的冷暖色彩对比与空间阻隔。严格遵守美学配额制:全片倾斜构图、抽帧降格、极度对称构图与90度横摆镜头配额各最多1次,其余镜头均采用常规电影视听语言]
- 镜头与景深:[符合风格的镜头特性,如:35mm大光圈电影镜头,T1.2浅景深,精准的焦平面控制与焦外散景,框架式构图]
- 色彩与光照:[全局光照与色彩空间,如:柯达Vision3胶片调色,暖调橘黄主色与潮湿暗色背景对比,主光源方向明确且在物体表面产生柔和的定向漫反射,面部使用温润包裹的自然漫射软光塑造立体轮廓,杜绝高对比度曝焦与死黑]
【人物与场景设定】
- 人物资产:引用 <<<character_sheet_A>>>、<<<character_sheet_B>>>(绑定多角色资产占位符),指定各角色的五官微观、瞳孔反光、湿漉发丝与衣物材质(如:真丝旗袍、呢子大衣)。
- 场景资产:引用 <<<scene_layout>>>,明确狭窄走廊、斑驳墙纸、金属门把手的物理反光率与深度。
【剧本与动作时间线】
- [00.0s - 03.5s]
- 镜头机位:[镜头类型与机位,如:中景,固定机位,透过百叶窗的前景窥视。视觉状态账本继承:必须精准继承上一段落结尾的“状态锚点”,确保角色A和角色B的初始位置、姿态、道具状态及光影与上一段完全对应,实现无缝硬切衔接]
- 视觉画面:
- [前景]:[镜头与主体之间的物体,常处于重度失焦状态,如:失焦的、半开的百叶窗,占据画面左侧1/3,形成柔和的阻隔感]
- [主体]:[画面的视觉中心,焦平面所在。动作描述需通过“行为逻辑常识防火墙”,拒绝浮夸动作,如:角色苏丽珍(角色A)缓缓走入画幅中央,眼神流露出隐忍与落寞,双唇微闭,其动作重力感和身体倾斜真实,且衣物状态与上一段落结尾完全一致]
- [背景]:[主体后方环境,根据景别虚化,如:远处走廊尽头的暖黄壁灯,在烟雾中形成朦胧的光晕]
- 听觉声效:[禁用BGM描述!仅写物理音效,如:高跟鞋在潮湿瓷砖上的“哒哒”声,微弱的雨滴拍击窗户声]
- [03.5s - 07.5s]
- 镜头机位:[自动切镜:近景特写,伴随手持呼吸感微颤]
- 视觉画面:
- [前景]:[如:无前景]
- [主体]:[如:焦点转移至苏丽珍右眼。她视线向下低垂,避开镜头,眼角微湿。面部肌肉微微颤动,神态极其生动自然,展现出内心的挣扎与克制]
- [背景]:[如:墙上的老旧时钟完全失焦,变成圆形的焦外光圈]
- 听觉声效:[如:时钟秒针沉闷的“嗒、嗒”声,微弱的呼吸声]
- [07.5s - 12.0s]
- 镜头机位:[自动切镜:过肩中景,焦点从肩膀转移至走廊深处]
- 视觉画面:
- [前景]:[如:苏丽珍精致的旗袍肩膀边缘,最初清晰,后随焦点转移快速失焦]
- [主体]:[如:走廊深处的周慕云(角色B)微微侧头,眼神深邃地注视着苏丽珍的背影,面部呈现复杂的肌肉联动,神情极其生动,手中夹着香烟,烟雾缭绕]
- [背景]:[如:斑驳的绿色墙纸,保持中度虚化]
- 听觉声效:[如:烟草燃烧的细微沙沙声。内心独白:“粤语{周慕云:‘如果有多一张船票,你同唔同我一齐走?’}”(独白需与上下文紧密呼应,符合逻辑递进,若选择方言输出,则在括号前标注方言名称如“粤语”,且台词书写使用方言词汇,声音驱动源绑定为 key_element_audio_B)]
- [12.0s - 15.0s]
- 镜头机位:[自动切镜:近景,环绕运镜。视觉状态账本锚定:为下一段落建立清晰的“终态锚点”]
- 视觉画面:
- [前景]:[如:失焦的烟雾扫过,形成过渡]
- [主体]:[如:苏丽珍缓缓低下头,眼皮垂下,脸颊肌肉紧绷。她缓缓伸出右手,手指轻轻抚摸着冰冷的石柱(此抚摸石柱姿态、手指位置、暖黄壁灯左侧斜射光影,将作为下一段落开头的状态锚点强行记录)]
- [背景]:[如:潮湿地面反射壁灯黄光,散景柔和]
- 听觉声效:[如:高跟鞋在地面上轻微的摩擦声]
【生成约束与负面提示词】
- 绝对禁止项:禁止生成任何形式的背景音乐(BGM)、旋律 or 节奏音轨。禁止出现任何关于分辨率(4K/1080p)、帧率(60fps/24fps)、画幅比例的UI参数描述。禁止角色出现反关节扭曲、瞬移 or 违背重力的漂浮。禁止使用夸张的动作(如踢门、砸门)。禁止画面出现卡通化、动漫化 or 廉价的3D塑料质感(因本片为真人实拍风格)。禁止光影逻辑冲突。
三、 语音与声效包装符与常识防火墙(Seedance 2.5(分辨率 480p) 执行铁律)
- 环境与物理音效(Foley):使用 <...> 包装。必须详细描述音效的物理属性(如:衣料摩擦、金属撞击、水渍踩踏),严禁出现任何“背景音乐”、“BGM”或“旋律”描述。
- 多角色对话/内心独白(Dialogue/Monologue):使用 方言前缀{角色名:“对白文本”} 格式包装(若为普通话则前缀可省略,若为方言则强制加前缀,例如:粤语{角色A:“对白文本”}、上海话{角色B:“对白文本”}、闽南语{角色A:“对白文本”}、东北话{角色B:“对白文本”}、四川话{角色B:“对白文本”}、河南话{角色A:“对白文本”})。对白文本必须完全符合 Final_Video_Spec.md 的 Output Language(输出语言),且尽量使用该方言地道的文字、叹词和特殊句式书写。角色A的对白必须绑定 key_element_audio_A,角色B的对白必须绑定 key_element_audio_B。内心独白内容必须前后呼应、逻辑严密,极具文学色彩与诗意,严禁出现无意义或跳跃性的台词。
- 屏幕文字:使用 【...】 包装。
- 行为常识防火墙:拒绝一切无逻辑的夸张奇观。强制动作描写符合重力、惯性和摩擦力等物理学常规交互(如:推门需描述施力、门开启匀速、重心前倾)。
- 负向约束尾缀:每段视频描述尾部必须带上纯中文负向词:【无字幕,无音乐,无文字,无标识】(确保视频纯净无杂质,音乐和字幕后续由 assembler 进行合成)。
四、 纯乐器背景音乐(BGM)提示词与乐器库规范(Suno 5 / Mureka 8)
-
曲风与情绪定位 (Style & Mood):
- 核心基调:突出暧昧、缠绵、孤独且带有时代怀旧感的原声器乐重奏。节奏必须具备强烈的旋律性与情感张力(慢速、忧郁、宏大、浪漫的节拍)以便剪辑卡点。
- 风格标签词:原声、忧郁弦乐、复古探戈、性感萨克斯风、浪漫、怀旧、亲密重奏、剧场级原声录音。
- 禁止项:绝对禁止在提示词中写入任何知名音乐人、歌手或特定乐队的名字,防止 Suno 5 等底层模型因版权审核拦截而生成失败。
-
王家卫标志性乐器库 (Signature Instrument Library):
在编写提示词时,必须组合调用以下至少 2-3 种特色乐器,以营造其标志性的深沉、优雅、伤感和复古交响感:- 大提琴 / 低音提琴:提供深沉、忧郁且极具顿挫感的大提琴拨弦,作为节奏或情感的主旋律。
- 小提琴 / 中提琴:提供绵延不绝、如泣如诉的弦乐拉奏,渲染极致的伤感与压抑。
- 手风琴:注入阿根廷探戈般的暧昧、缠绵、激情与忧伤。
- 萨克斯风:用于点缀都市深夜的孤独、慵懒与情欲暗流。
- 古典吉他:提供质朴、慵懒且带有一丝漂泊感的西班牙/拉丁风格弹拨。
- 爵士钢琴:用缓慢、克制的琴键敲击,营造深夜小酒馆的幽闭与亲密感。
-
方言美学特色背景音乐(BGM)提示词配方:
当项目选定特定方言后,在撰写纯乐器 BGM 提示词时,必须严格套用以下对应的中文乐器与意境组合,确保声画美学完美契合:- 粤语(经典港风)配方:纯乐器,忧郁电影主题,缓慢低沉的大提琴拨弦,迷幻慵懒的萨克斯风,复古电吉他弹拨,重混响,八九十年代港片霓虹灯光影意境,暧昧,都市孤独,慢速,剧场级干音影棚录制
- 上海话(爵士海派)配方:纯乐器,爵士乐,缓慢克制的爵士钢琴琴键敲击,性感而慵懒的萨克斯风,低音提琴拨弦,老上海舞厅复古调性,华丽,夜色,暧昧情调,剧场级原声录音
- 闽南语(民谣怀旧)配方:纯乐器,民谣吉他弹拨,怀旧复古的手风琴,忧郁小提琴,沿海小镇雨夜意境,浪漫,孤独,烟火气,温润,剧场级干音影棚录制
-
器乐与编曲结构控制 (Arrangement):
- 必须在提示词中显式声明【纯乐器】或【无声乐】,避免模型随机产生合成人声。
- 描述音场质感(如:亲密原声录音棚录音、温暖黑胶唱片质感、干声混音、无重度电子合成器),避免大空间混响或现代电子合成器。
- 推荐提示词结构/示例:纯乐器,忧郁电影主题,缓慢泣诉的小提琴,深邃的大提琴拨弦,复古探戈手风琴,浪漫且怀旧,剧场级干音影棚录制。
6. 视频合成
-
时间轴无缝拼接与剧情连贯性质检
- 必须以 30 秒为一个大视频层单元进行时间轴拼合。
- 核心质检指标(视觉状态账本核对):必须站在观众视角,完整审视拼接后的长视频。检查剧情是否通顺、对白/内心独白是否连贯、前后段落是否存在逻辑断层。严格核对相邻30秒段落的接缝处,角色A/B的物理位置、姿态、衣物细节、手中道具状态以及环境光源方向是否完全契合状态账本记录。若发现穿帮或逻辑断层,必须精准定位并打回重制对应段落。
- 检查相邻 30 秒段落的接缝处,物理动作(如前一段结尾的伸手,必须在后一段开头完成抚摸动作)是否完全契合,实现视觉无缝硬切。
-
多镜头节奏控制
- 检查每个 30 秒视频内部的“自动切镜”节点,其画面切换必须自然。
- 严禁出现无切镜的、像 PPT 幻灯片或慢动作静态画一样的生硬长轴视频。
- 对白/内心独白出现时,镜头焦点或景别切换必须与说话者同步。
-
三维空间与光影阻隔质检指标
- 逐镜头检测:前景(百叶窗、窗帘、石柱等)是否实现了合理的散景(Bokeh)与窥视感,主体是否在焦平面上清晰锐利,背景是否有明确的透视深度与低照度虚化。
- 凡是画面扁平、像二维拼贴、无焦深层次的生成段落,必须打回重制。
-
动作与表情质量把关
- 严禁通过静态插帧或首尾帧生成的生硬镜头。
- 角色必须有正常的物理质量惯性运动与连贯、生动的肌肉微表情,特别是眼神的忧郁、低垂与视线闪躲,拒绝僵硬呆板的面部表现。
- 人物不能总是呆立或始终死板地盯着镜头,要有符合剧本动机的肢体交互。
-
多轨声音拼合与 Foley 渲染
- 视频轨自带的对白/内心独白与音效(Foley)必须无损提取并单独编入 Dialogue 轨与 SFX 轨。
- 音乐轨(BGM):在 video_assembler 中导入通过 Suno 5 / Mureka 8 生成的纯净背景音乐。音乐剪辑点、强重音、乐器段落必须与画面内部自动切镜的重拍完全对齐。
- 对白、内心独白声场必须与对应的景别大小匹配(特写声音干脆、全景带有场景空间混响)。
-
转场与出片管理
- 多镜头切片内部采用自然的硬切(Hard Cut),30秒段落之间可采用动作衔接切、门开合、镜头横摆等电影化硬转。
- 严禁使用各种现代短视频的花字、闪白、无物理依据的转场特效。
- 最终输出:完整的连载视频文件、内部镜头切片清单、物理声效(Foley)对齐节点以及音轨层级分配清单。