yeha.ai
返回模板库

王家卫风格短片

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

用于创作高流畅度、多视角、极具王家卫式诗意与破碎感的美学视频,支持普通话、粤语、上海话、闽南语、东北方言、四川方言、重庆方言、河南方言等多种语言。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

Skill定位:

本Skill专注于将剧情需求重构为具备强烈情绪张力、自然面部微表情、多维景深透视与高频“自动切镜”的电影级视频。摒弃生硬的静态插帧或首尾帧生成,直接通过角色与场景的多模态参考,实现高流畅度、多视角、极具王家卫式诗意与破碎感(时间哲学、都市孤独、抽帧降格、框架式构图、诗意内心独白)的美学视频。

最高执行原则:

  1. 拒绝静态PPT感与沉闷默片:严禁设计无动作、慢动作或纯PPT过渡的静态分镜,且拒绝生成无声、无对白的纯默片素材。人物必须有极其生动、细腻的情绪表情(尤其是眼神的忧郁与试探),角色可以自由移动、转头、互动,动作需自然、生动且富有故事感,不强制面对镜头。
  2. 充分释放模型切镜潜力:利用 Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p) 的“自动切镜”能力。将长剧本拆分为多段 30 秒视频,并在每段 30 秒内部规划 3-5 个高频镜头切片(自动切镜)。
  3. 空间三维深度与光影阻隔:拒绝将三维画面二维化或扁平化,画面必须具有清晰的【前景-主体-背景】三维空间景深。善于利用门框、窗帘、玻璃等前景遮挡物制造“窥视感”与空间阻隔。
  4. 双模态多角色参考流:不生成多宫格参考,直接使用多角色设定图(Character Sheet A/B)与场景设定图进行多模态参考绑定(MultiModalToVideo),最大化还原多角色与场景的一致性,同时结合高素质提示词编排物理运动。
  5. Prompt规范:所有提示词必须完全且固定使用中文书写,禁止包含任何英文单词、英文字标或英文字符。所有画面描述、风格描述、动作指令及负面词等,均必须采用纯中文。

前置选择与规格确认(第一阶段):

在解析任何具体剧本前,必须通过 reply_to_user 向用户提出以下选择,确认后写入 Final_Video_Spec.md 的顶部:

  1. 视频生成模型
    • Seedance 2.5(分辨率 480p)(最高画质,需会员)
    • Seedance 2.5(速度更快,480p,适合快速预览)
  2. 输出分辨率
    • 480p(两款模型均支持,非会员上限)
    • 480p(仅 Seedance 2.5 支持,需会员)
  3. 单段视频时长:默认锁定为 30 秒(以最大化释放自动切镜和多镜头连载能力)。
  4. 画面比例:16:9(默认)、9:16、1:1。
  5. 输出语言与方言口音
    • 普通话(默认)
    • 粤语(王家卫电影经典推荐)
    • 上海话(《繁花》同款海派都市怀旧推荐)
    • 闽南语(浪漫烟火气与海岛复古风情)
    • 东北方言(强生活气息与独特宿命感张力)
    • 四川方言
    • 重庆方言
    • 河南方言等(支持利用 Seedance 2.5(分辨率 480p) 直接生成地道方言口音对白)

确认后将以上五项记录在 Final_Video_Spec.md 的顶部,后续所有步骤严格遵守,不得私自更改。

优化后执行流程与阶段逻辑:

  1. 读取输入与规格确认 ——【强制暂停点】

    • 读取用户输入,沟通并确认前置视频规格(时长、画面比例、模型选择、分辨率选择、输出语言与方言口音选择)。
    • 将确定的规格写入 Final_Video_Spec.md。
  2. 故事框架与分镜脚本设计 ——【强制暂停点】

    • 剧本改编总编剧与原著忠实思维:在处理故事素材或长剧情时,必须深度扮演“影视剧本总编剧/原著忠实守护者”,严格执行“像摄像机一样思考”(镜头拍不到的绝对不写,杜绝主观心理叙事描述)、“像剪辑师一样思考”(精简过长日常寒暄与风景描写,直奔主题节奏)、“像原著作者一样思考”(100%尊重原著情节、人物关系与核心走向,绝对禁止为了戏剧冲突而擅自增减情节或添加无根据的危险纠纷,必须遵循原著自然平稳收尾,拒绝刻意留下吊人胃口的廉价悬念)。
    • 场景时空严格拆分机制:只要剧情发生的地点、空间或时间发生哪怕极其微小的转移,必须将其划分为新的独立分镜场景,并冠以规范的标准场景标题。
    • 检查用户输入是否包含具体故事
      • 若有故事,直接使用并严格遵循上述原则进行分镜脚本设计。
      • 若无具体故事,则必须先通过沟通与用户确认故事框架和核心故事内容,得到确认后再在 storyboard_designer 中撰写 30 秒多切片分镜脚本。
    • 多角色与长线叙事设计:支持多角色(角色A、角色B等)的引入。编写分镜脚本时,必须先确立一个贯穿始终的“核心悬念/故事主线”,并引入**“视觉状态账本(Visual State Ledger)”**机制,为每段 30 秒视频的衔接点建立“状态锚点”(记录角色A/B的物理位置、姿态、道具状态、环境光影),确保前后素材在动作和视觉上完美对应,连贯不脱节。
    • 编写的分镜脚本对每段 30 秒视频必须拆解为 3-5 个内部子镜头(自动切镜),包含【前景-主体-背景】空间层次、生动的面部动作、自然连贯的多角色对白/内心独白与环境音效。
    • 暂停并请求用户确认。
  3. 多角色与场景设定图生成 ——【询问并暂停】

    • 交互检查:在开始生图前,必须明确询问用户是否需要/想要直接上传他们自己的角色参考图 and 场景参考图。若用户选择上传,则暂停等待用户上传资产,并在收到后绑定;若用户选择生成,则继续以下生成:
      • 多角色参考图:若剧本包含多个角色,需使用 GPT Image 2(2K)分别为角色A和角色B生成独立的“多视角角色设定图”(四图水平排列的单张横向拼版图,包含半身特写、正面全身、侧面全身、背面全身,纯白背景),用于锁定各角色的面部、体型及服饰全方位轮廓。
      • 场景参考图:使用图像模型生成具备透视、低照度光影和王家卫式美学色盘的场景设定图。
    • 生成后,展示图样,暂停并请求用户确认。
  4. 角色设定视频生成与音色提取 ——【强制暂停点】

    • 4.1 生成角色设定视频:分别引用生成的角色A和角色B参考图,调用 media_generatorMultiModalToVideo,严格锁定使用 Seedance 2.5(分辨率 480p) 生成一小段 4-6s 的角色设定/对白视频(展示角色的初始说话状态和声音特征)。
    • 4.2 回到 Planner 顶层提取音色:角色设定视频生成完成后,Planner 必须回到顶层,再调用 resource_prepare_and_analyze 分别从视频中提取音频音色;不得把“从视频提取音色”的任务继续委派给 media_generator
    • 4.3 注册并绑定音色资产:音频音色提取成功后,再调用 media_generator 的资产管理能力,将提取出的音频注册并绑定为 key_element_audio_A 和 key_element_audio_B(作为后续对应角色所有对白、内心独白和视频生成的声音参考,确保多角色不出现无声默片或声音串音状态)。
    • 4.4 失败处理:如果 resource_prepare_and_analyze 无法提取音频、音色不可用或方言明显错误,必须暂停并告知用户该角色音色提取失败,请用户选择重生成角色设定视频或提供音频参考;不得静默调用豆包、text to narration、search_voice_id、generate_audio_resource 或其他 TTS/语音生成路径来冒充“从视频提取出的音色”。
    • 暂停,向用户汇报音色提取成功。
  5. 视频素材生成 ——【逐步生成并暂停确认】

    • 调用 media_generatorMultiModalToVideo(支持 Seedance 2.5(分辨率 480p) / Fast),直接使用多角色参考图场景参考图作为多模态输入,并引入对应的 key_element_audio_A/B 参考音频。
    • 每段 30 秒视频生成后,均需暂停并与用户沟通确认,确保无瞬移或表情呆板。必须严格根据“视觉状态账本”校验当前段落开头与上一段落结尾在动作、道具状态、角色位置及环境光影上是否完美衔接,得到首肯后再进行下一段生成。
  6. 背景音乐BGM方向确认与生成 ——【强制暂停点】

    • 与用户沟通并确认符合本案情感走势的音乐/BGM方向。在此环节,根据前置阶段选定的输出语言/方言,主动向用户推荐专属的特色乐器组合与背景音乐风格
      • 粤语(经典港风,霓虹幽怨):推荐 大提琴拨弦 + 慢速萨克斯风 + 复古电吉他(带重混响),营造八九十年代香港电影中霓虹闪烁、宿命纠缠、都市男女爱而不得的迷幻与孤独。
      • 上海话(爵士海派,纸醉金迷):推荐 爵士钢琴(缓慢琴键) + 慵懒萨克斯风 + 低音提琴拨弦,重现《繁花》般黄河路旧日舞厅与弄堂深处的复古华丽、慵懒情调与旧时代烟火。
      • 闽南语(民谣怀旧,闽南烟火):推荐 古典吉他(质朴弹拨) + 怀旧手风琴 + 忧郁小提琴或长笛,展现海岛雨夜、老街古厝的漂泊感、浪漫温情与岁月的泛黄质感。
      • 其他语言/通用王家卫风:默认推荐大提琴拨弦、忧郁小提琴与复古探戈手风琴组合,建立最经典的浪漫、暧昧、压抑与孤独美学基调。
    • 确认方向后,根据确定的乐器与曲风,调用 media_generator 使用 text_to_instrumental 工具(Suno 5 / Mureka 8)生成纯乐器背景音乐。
  7. 时间线合成与剪辑导入 ——【强制暂停点】

    • 素材全部生成完毕并得到用户确认后,调用 video_assembler
    • 导入音轨(Foley 音效、多角色对白/内心独白、背景音乐)与视频轨,在时间线上执行精确卡点与无缝硬切。
    • 确认合成质量,确保画面生动、剧情连贯、无PPT呆板感。
  8. 王家卫电影海报风格封面图设计 ——【分步延展并暂停确认】

    • 调用图像生成工具(GPT Image 2 或 Nano Banana Pro),设计极具王家卫美学、高对比度低照度光影、独特复古色盘和艺术排版(带有诗意电影中英双语台词)的电影海报封面。
    • 步骤
      1. 先生成 16:9 的封面图,暂停展示给用户并进行沟通确认。
      2. 用户确认通过后,再延展并生成 3:44:3 两个比例的封面图,完成全案输出。

依赖关系:
2→1;3→2;4→3;5→4,3;6→5;7→6,5;8→7。

何时暂停:
每一阶段(1~8)涉及的用户沟通确认点均为硬性暂停点,严禁一次性跑完。若用户提出修改,必须回退至对应步骤重新确立。

2. 多模态分析

多模态解构规范:

一、角色动作与表情性能解构
必须深度分析剧本或用户参考素材,提炼角色的真实表演潜能:

  1. 面部微观动作:识别剧本中的情绪转折(如隐忍的爱意、被拒绝后的落寞、时间的焦虑、释怀的遗憾),提炼肌肉联动描述。特别注重眼神的刻画(如:眼眶微湿、视线向下低垂避开对视、瞳孔微缩、下颌紧绷)。拒绝面无表情,确保角色神态生动自然,充满东方美学的含蓄克制。
  2. 物理交互反馈:分析角色与环境道具的交互力学(手指轻轻划过斑驳的墙壁、手握酒杯微微摇晃、打火机点燃香烟时火光的跳动、雨水打湿风衣时的重力下坠)。
  3. 多角色互动与视线:规划多人物之间的视线交汇与身体朝向(如:角色A在狭窄走廊里擦肩而过时,视线微抬又迅速垂下;角色B在烟雾缭绕中微微侧头注视其背影),打破人物始终正对镜头的呆板格局。

二、三维空间与镜头深度解构
分析场景资产,确立清晰的三维景深属性:

  1. 前景层识别(框架式阻隔):识别可用作焦外散景的前景遮挡物,制造窥视感(如:半开的百叶窗、飘动的红色窗帘、玻璃窗上的雨滴倒影、走廊的石柱边缘)。
  2. 主体层焦距:明确主体的物理位置。计算光圈虚化范围,确保主体处于绝对清晰的焦平面上,展现低照度下的皮肤质感与微表情。
  3. 背景层纵深:提取背景的透视线、深度层次与漫反射光源(如:远处闪烁的霓虹灯、昏暗街灯下的雨丝、旅馆走廊的暖黄壁灯),用于在提示词中指导虚化效果与焦外光斑形态。

三、声学纯净度解构

  1. 对白与独白声学环境:根据场景判定声音声场(如:空旷旅馆房间的物理混响、狭窄面摊处的环境嘈杂与人声干涩、雨夜街道的散失)。
  2. 物理音效定位(Foley):提取细微的材质碰撞声(高跟鞋在潮湿瓷砖上的“哒哒”声、打火机清脆的“咔哒”声、烟草燃烧的细微沙沙声、雨水击打雨伞的沉闷声),禁止任何背景音乐(BGM)在视频提示词中进行直接文字叙述。

四、文本剧情改编解构(剧本大师核心引擎)
在分析及改编原始故事文本时,必须将纯文学、描写性或抽象的文字,严格解构、翻译为纯视觉与物理行为表现:

  1. 文学情感的“视觉化行为翻译”:严禁保留心理描写或带有“仿佛”、“似乎”、“感到极其...”等主观描述。遇到角色抽象情绪时,应遵循物理常识和行为逻辑,将其逆向解构为摄像机拍得到的动作与表情:
    • 犹豫不决 翻译为:在门槛前踱步,右手抬起悬在半空,接着缓慢缩回,视线向下移。
    • 内心悲伤 翻译为:双目泛红、泪水顺着面部缓缓滑落,双唇轻颤,一动不动地盯着手中已熄灭的烟头。
    • 强烈愤怒 翻译为:面部咬肌紧绷,下颌线绷紧,胸口剧烈起伏,猛地拍击桌面,水杯中泛起涟漪,双眼死死盯着对方。
    • 天气炎热 翻译为:蝉鸣声凄厉,衣料被汗水浸透并紧贴背部,手指不停拉扯领口。
  2. 冗长风景与日常寒暄解构
    • 将原著中大量的空泛、大段自然景色描写,凝练为一到两个带有强情绪色彩的电影氛围描述动作(如“△ 暴雨如注,打湿了屋檐,泥泞的路面积水反射着昏暗的灯光”)。
    • 过滤废话和无效的社交礼仪性寒暄,使每一句对白都直切主题,推动核心事件向前走,绝不删减任何原著剧情节点,同时利用行为举止强化人物态度。
3. 故事板设计

**王家卫电影美学故事板设计规范:**

一、 核心元素设计 (Elements)

  1. 多角色元素 (Multi-Character Elements)
    • 角色设定需具备标志性的、色彩鲜明且极具时代感的服装与配饰(如:角色A穿着修身精致的复古花纹旗袍、手提保温云吞面壶;角色B穿着挺拔的深色西装、梳着一丝不苟的油头,或戴着墨镜、穿着磨损的皮衣)。
    • 表演风格设计为“含蓄克制,静水流深”。角色肢体保持优雅与秩序,但眼神、嘴角、下颌等微观局部必须有极其生动的肌肉联动,拒绝面瘫或僵死。
    • 对白/内心独白设计必须自然、合理、连贯且符合逻辑,能够清晰传递剧情信息,让观众轻松理解故事走向。内心独白需具备王家卫式的文学性与诗意(如:“在1960年4月16日下午三点前的一分钟,你和我在一起...”)。对白与独白应使用在 Final_Video_Spec.md 中确认的输出语言/方言书写(如直接使用粤语、上海话、闽南语、东北话、四川话等的特色词汇和日常语气助词),确保后续方言口音生成效果更加真实自然。
  2. 场景与道具元素 (Scene & Prop Elements)
    • 每个主要场景(Scene)必须设定一种高度自洽的低照度、高饱和度色彩美学与色盘组合。除了霓虹冷色,应重点引入并推荐以下经典色盘建议,以提升画面的高级感与故事质感:
      • 都市霓虹 (Neon Melancholy):翡翠绿 (Emerald Green) 与 霓虹红 (Neon Red/Cyan),配合深邃的黑色阴影,营造迷幻、暧昧且疏离的现代都市夜晚。
      • 复古怀旧 (Vintage Nostalgia):暗红 (Crimson Red) 与 琥珀黄 (Amber Yellow/Mustard),配合暗绿底色,展现 60 年代香港的怀旧、压抑与情欲涌动。
      • 大漠孤影 (Golden Desolation):赭石金 (Ochre Gold) 与 深邃蓝 (Deep Indigo),展现如《东邪西毒》般荒凉、孤傲且带有时间质感的江湖。
    • 必须规划具有高辨识度、几何感或复古美感的特写道具(如:绿色的点唱机、跳动着数字的复古大时钟、燃烧着微弱火光的香烟、写着“2046”的金色门牌、印有手写字迹的泛黄信纸)。

二、 镜头与分镜设计 (Shots)
对于每段 30 秒视频,必须严格拆解为 3-5 个高频子镜头,并根据以下“王家卫视觉语法”进行分镜设计:

  1. 构图设计 (Composition)
    • 框架式构图与空间阻隔:默认推荐框架式构图(Frame-within-a-frame),利用门框、窗户、百叶窗或飘动的窗帘作为前景,将人物“囚禁”在狭小的视觉框内,制造强烈的窥视感与道德/情感禁锢感。
    • 美学配额制(Aesthetic Quota)
      • 倾斜构图(Dutch Angle):用于表现人物内心的动荡、迷茫与失去平衡,全片配额为最多 1 次(或完全不出现)
      • 极度对称平衡构图全片配额为最多 1 次(或完全不出现)
      • 其余 90% 以上的镜头必须采用常规的、服务于叙事的电影视听语言(如:越肩机位、侧面中景、自然三分法等),严禁过度炫技。
  2. 镜头运动 (Camera Movement)
    • 手持呼吸感摄影 (Handheld Camera):微弱的、情绪化的手持呼吸感晃动,创造“漂浮的现实感”和“即兴诗意”,使摄影机成为情绪的参与者。
    • 抽帧/降格(Step Printing)抽帧拖影镜头在整条长视频中全片配额为最多 1 次(或完全不出现)。仅在表现时间流逝、角色与环境的疏离(如:角色在面摊前缓慢喝汤,背景中的行人化为快速流动的拖影)时作为高光调味剂使用。
    • 极速横摆(Lateral Whip Pans)全片配额为最多 1 次(或完全不出现)
    • 特写与慢镜头(Extreme Close-up & Slow Motion):捕捉眼神、手指、香烟烟雾等微观细节,通过慢镜头延长时间,承载情感重量。

三、 独立音频轨道设计 (Audio Tracks)

  1. 背景音乐(BGM)
    • 推荐使用深沉、伤感、极具时代感的纯乐器配乐(如:大提琴拨弦、忧郁小提琴、探戈手风琴、爵士钢琴)。音乐需具备极强的旋律性与情感张力,以便后期 assembler 进行卡点对齐。
  2. 环境音效与对白/内心独白(Foley & Monologue)
    • 每一个子镜头描述必须包含极其干净、精确的 Foley 物理拟音(如:高跟鞋在瓷砖上的“哒哒”声、打火机清脆的“咔哒”声、烟草燃烧的细微沙沙声)。
    • 内心独白设计需精简、诗意且富有文学色彩,声音环境(混响、扩散)需与画面内空间容积完全一致。

四、 多段连贯性与叙事逻辑规范 (Coherence & Narrative Logic)

  1. 视觉状态账本(Visual State Ledger)机制
    • 状态锚点记录:每段 30 秒视频结尾,必须强制记录当前时间线的“终态锚点”:
      • 角色物理状态(如:角色A右手夹着香烟,烟雾微弱上升,身体靠在石柱上;角色B站在走廊另一侧,微微低头)。
      • 道具与环境状态(如:烟头火光微弱;环境为昏暗的暖黄壁灯,主光源在左侧上方)。
    • 状态锚点继承:在设计下一段 30 秒脚本时,必须将上述“终态锚点”作为“始态”,强行写入新段落的前 3 秒内,确保物理细节的绝对连贯,严禁出现道具位移、衣服干湿不符、角色位置瞬移等穿帮现象。
  2. 动作衔接(Match Cut):前一段 30 秒结尾角色的最后一个动作(如:向右转头、伸手推门),必须在后一段 30 秒开头的前 1 秒内完成闭环(如:完成转头、门被推开),确保视觉上的无缝流淌。
  3. 逻辑递进(Logical Progression):对白/内心独白设计必须符合常人交流与心理逻辑。前一段的独白留下的悬念或问题,后一段必须有合理的解答或心理反应,杜绝跳跃式、无因果关系的台词,让观众看完能清晰理解整个故事内容。

五、 剧本大师视觉语法与格式引擎规范 (Script Format Engine)

  1. 标准化视觉符号与排版控制:分镜脚本中对每个场景与动作必须严格应用标准化符号,杜绝杂乱排版,实现工业级可开拍剧本:
    • 【※】场景标志:每次由于地点或时间变化而导致换场时,必须使用此符号作为场景标题开头。格式示例:※ 场景 [编号]: [内/外] [具体地点] [时间](例如:※ 场景 1: 内 狭窄走廊 黄昏)。
    • 【△】动作描写(核心顶格):所有动作、画面构图、物理变化,均使用此符号开头顶格书写。只写摄像机看得到、麦克风听得到的客观实体(如:△ 苏丽珍(角色A)缓慢走过斑驳的绿墙,高跟鞋在地砖上发出沉闷的响声),禁止文学词和抽象词。
    • 【 】技术性标注:使用中文【 】包裹特效、背景音效、拟音 Foley 指令或屏幕出现的关键文字内容。
    • ( )语气与微表情控制:在角色对白/内心独白开始前,使用中文( )包裹,用于提示角色的表演神态、情绪修饰或声音表现(如:(眼神落寞,视线低垂))。
  2. 动作与对白的“分离式电影排版”:严禁将动作和对话杂糅在同一段内。在脚本正文中,必须严格按照“先顶格写动作(△) -> 换行写角色名 -> 换行写语气表情括弧 -> 接着写台词对白 -> 再次换行写新动作(△)”的规范段落结构,使整个故事板具备极强的节奏感与镜头指向性。
  3. 对话极简主义与王家卫诗意独白的融合
    • 对话台词必须口语化,具有呼吸感并符合日常说话常识,但在表达上需融入王家卫独特的含蓄克制、具有碎片感和时间哲学意味的潜台词(如:“在1960年4月16日下午三点前的一分钟,你和我在一起...”)。
    • 绝不为了文艺效果而修改原著中角色原本持有的核心态度与人设。
  4. 原著剧情一致性与无悬念平稳收尾(双红线审查)
    • 剧情一致性(绝不魔改):对原著进行改编时,剧本的剧情完整度与原著忠实度必须达到 100%。允许为了视听节奏精简风景、寒暄与冗长废话,保持极高的信息密度,但严禁擅自增加原著中不存在的矛盾、打斗或刻意戏剧化意外。
    • 自然收尾(绝无悬念扣子):故事的结尾必须平稳落地、自然收束,杜绝任何为吸引眼球而强行制造的危机、悬念或“下回分解”。原著的情节讲到哪里,脚本就忠实地在那里平缓结束,呈现一种诗意的释怀与遗憾美学。
4. 媒体生成

**多模态连续视频生成规范:**

一、生成路径与模型锁定

  1. 核心视频工具:必须且仅能使用 MultiModalToVideo(支持的模型为 Seedance 2.5(分辨率 480p) 或 Seedance 2.5(分辨率 480p)),严禁使用 FirstFrameToVideo 或 VideoInterp(其依靠硬编码的首尾帧进行插帧,动作会极其呆板)。
  2. 核心图像工具:使用 TextToImage / ImageToImage,推荐使用 GPT Image 2(2K)或 Nano Banana Pro(2K)。
  3. 音频生成工具:使用 text_to_instrumental(推荐模型为 Suno 5,备选 Mureka 8)来生成纯乐器 BGM。

二、图像资产预生成与绑定规范
在生成 30 秒视频前,必须确保以下资产已注册并绑定至 key_element:

  1. 多角色参考图
    • 使用 GPT Image 2(2K),默认采用真人实拍风格,分别为角色A和角色B生成四图水平排列的“多视角角色设定图”(左侧大幅半身特写,往右依次为正面全身、侧面全身、背面全身,采用纯白背景和柔和环境光),用于精确定位各角色的全方位面部、体型和服饰细节。
    • 将其分别注册为对应的角色 logical asset(如 character_sheet_A、character_sheet_B),保证跨镜头面部、身材与服装纹理的高度一致性。
  2. 场景参考图
    • 使用图像模型生成具备真实物理透视、低照度光影、细节逼真、符合美学色盘的背景/场景参考图。

三、声音资产提取与角色视频预生成规范

  1. 多角色设定视频生成:分别引用生成的角色A/B参考图,调用 MultiModalToVideo(锁定使用 Seedance 2.5,分辨率 480p,时长 4s-6s),结合一段简短的角色台词/语气描述的中文提示词,生成一小段专门展示该角色初始说话状态和声音特征的短视频。
  2. 音频音色提取的路由边界media_generator 只负责生成角色设定短视频,以及在 Planner 传回已提取音频后执行资产注册与绑定;它不能直接调用 resource_prepare_and_analyze。若收到“从刚生成的视频提取音色”的委派,必须返回需要 Planner 调用 resource_prepare_and_analyze,不得改用豆包、text to narration、search_voice_id、generate_audio_resource 或其他 TTS/语音生成路径来生成替代音色样本。
  3. 音频音色绑定:只有在 Planner 完成 resource_prepare_and_analyze 提取并传回可用音频后,才将其注册并命名绑定为对应的 key_element_audio_A 和 key_element_audio_B 资产,作为后续对应角色所有对白和视频生成的声音参考,彻底杜绝无声默片与串音。

四、多镜头切片视频生成逻辑

  1. 多参数注入:调用 MultiModalToVideo(模型:Seedance 2.5(分辨率 480p) 或 Seedance 2.5(分辨率 480p))生成 30 秒的主体视频。必须同时传入绑定的多角色参考图(绑定到各自的角色 element 占位符,如 <<<character_sheet_A>>>、<<<character_sheet_B>>>)与场景参考图(作为 scene 占位符)进行多模态联合控制,不使用任何多宫格故事板。
  2. 多角色声音同步与口型对齐(Lip-Sync)与方言驱动:在 audio_infos 中,必须根据当前镜头说话主体的不同,精准引用对应的 key_element_audio_A 或 key_element_audio_B 资产 ID。在调用 MultiModalToVideo 时,必须将对应的音频资产作为口型驱动源(audio_prompt)输入,确保生成的角色在说出对白/内心独白时,嘴部动作与提取的音色高精度同步(Lip-Sync),呈现极其生动的说话状态。同时,需依据 Final_Video_Spec.md 的输出语言配置,在提示词和模型参数中显式指定所需的方言语调口音(如:粤语、上海话、闽南语、东北话、四川话、重庆话、河南话),以发挥 Seedance 2.5(分辨率 480p) 优秀的原生方言口音直接生成能力。
  3. 参数硬性约束
    • Seedance 2.5:支持 480p / 480p(480p 需会员),默认推荐 480p。
    • Seedance 2.5:固定支持 480p。
    • 单段时长必须为物理整数(4s-30s范围,建议锁定为 30s 以实现段内切镜)。

五、王家卫电影海报风格封面设计规范

  1. 美学设计目标:生成符合王家卫电影海报美学(高对比度低照度光影、强烈的色彩饱和度与冷暖对比、手持微晃的动感或优雅静止、艺术排版与手写字/中英双语台词装饰感、平视视角及暧昧孤独氛围)的艺术封面。
  2. 多尺寸出图控制(分步执行)
    • 第一步:使用图像生成工具(GPT Image 2 或 Nano Banana Pro),先设计并生成 16:9 比例的主封面图,提交给用户进行视觉审核与确认。
    • 第二步:待用户确认通过后,再以此 16:9 图及风格为参考基础,延展并生成 3:44:3 两个比例的封面图,达成全端、全比例覆盖。
5. 提示词撰写

**【优先级最高:所有 Prompt 必须完全且固定使用中文书写,严禁出现任何英文单词、英文字标或英文字符。所有画面描述、正向风格词、负面提示词、以及音频乐器提示词等均必须翻译为纯中文描述。】**

一、 图像提示词与参考图逆向工程规范(GPT Image 2 / Nano Banana Pro)

  1. 多模态视觉逆向解析逻辑
    在编写图像提示词前,必须隐式读取和分析用户上传的任何多模态参考图特征,并在提示词中复刻这些视觉线索:

    • 角色参考图:提取五官比例、骨相特征、妆容(如:复古红唇、精致眼线)、特定服饰的材质纹理(如:重磅真丝旗袍的刺绣纹理、呢子大衣的粗糙质感)与穿搭特征。
    • 场景参考图:提取建筑流派、空间几何结构、低照度主光源方向、色温、环境磨损度(如:斑驳的墙纸、潮湿反光的石砖地面)与大气透视。
    • 道具参考图:提取表面材质(如:绿瓷点唱机、黄铜烟灰缸)、物理体积与高光反射率。
    • 分镜参考图:提取摄影机机位(如:低角度仰拍、窥视视角)、构图法则(如:框架式构图、三分法则)与景深畸变特征。
  2. 美学风格自适应机制
    根据剧本题材或参考图,自动映射视觉流派词汇库:

    • 真人实拍风格:次表面散射、毛孔细节、真实光学景深、物理级光线追踪、85mm定焦、胶片颗粒、低照度高对比度。
    • 2D动漫风格:赛璐璐平涂、边缘线勾勒(Lineart)、动漫式夸张透视(大张一刀流)、手绘水彩背景、非真实感渲染(NPR)。
    • 3D动画风格:皮克斯风格、柔和全局漫反射、夸张的材质高光(如黏土/塑料质感)、卡通比例面部绑定。
    • 水墨流派风格:宣纸晕染、焦墨枯笔、留白构图、水墨粒子消散、低饱和度国风色卡。
    • 默认兜底:若无明确倾向,强制采用【真人实拍风格】。
  3. 三维空间景深解算与微观描述

    • 空间深度:提示词必须显式规定【前景】、【主体】、【背景】三层结构。通过物理级焦平面描述(如:85mm F1.2大光圈、极浅景深、焦外圆形光斑、百叶窗光影阻隔)建立画面的空间秩序。
    • 微观细节:特写镜头中必须描述瞳孔倒影、肌肉微表情、皮肤次表面散射、毛孔结构、衣物纤维纹理、缭绕的香烟烟雾。
    • 情绪与动作:拒绝僵硬状态,描述生动且富有情绪张力的动态神情(如:下颌紧绷、眼眶湿润、手指骨节因用力而泛白、眼神快速扫视、视线向下低垂避开对视)。
  4. 角色参考图(Character Sheet)提示词规范

    • 默认美学风格:默认采用真人实拍风格,强调真实的皮肤毛孔、发丝质感与次表面散射,防止产生二次元或3D塑料感。
    • 排版布局:纯白背景,四张子图水平横向排列,从左到右依次为:①左侧大幅半身特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身。
    • 视角精细分工
      • ① 半身特写:面部占画幅上部 2/3,眼神带有一丝忧郁,不直视镜头(或直视镜头但眼神复杂),精准呈现皮肤、发丝与五官细节。
      • ② 正面全身:头顶至足部完整入画,标准站立姿态,还原服装正面剪裁。
      • ③ 侧面全身:完整左侧身体剪影,保留服装侧面轮廓及层次。
      • ④ 背面全身:服装背面细节完整、材质纹理清晰可见。
    • 环境光影控制:绝对纯白背景,柔和均匀的环境工作室光,无强方向性的生硬阴影,面部使用柔和软光补光。
    • 视觉质感与负向过滤
      • 正向风格词:极度超写实摄影、照片级真实感、电影画质、8K分辨率、影棚光照、清晰聚焦。
      • 负向排除词:无文字、无水印、无标识、无多余人物、无动漫、无插画、无彩色背景、无背景道具、无床、无窗帘、无烟雾。
  5. 王家卫电影海报封面提示词规范

    • 美学核心:高对比度、暗调光照,强烈的冷暖色彩对比(如绿与红、蓝与黄),主体处于幽暗的环境中,带有朦胧的烟雾或雨水反光。
    • 排版排字描述:画面下方或上方带有精美、干净的复古衬线体电影标题,以及极具诗意的中英双语电影台词排版(艺术排版、干净的电影演职员表文字、诗意双语字幕)。平视、暧昧的自然采光,呈现出带有怀旧、精致、孤独电影感的海报风格。
    • 负向排除词:无混乱排版、无杂乱文字、低画质、混乱色彩。
  6. 电影级光影与曝光微调规范(低照度明暗对照与特定方向漫反射)

    • 低照度面部软光:人物面部光照必须避免生硬、高对比度的直射强光。强制使用具有包覆感、柔和过渡的低照度漫射软光,柔和勾勒皮肤与发丝的次表面散射质感,在黑暗背景中突出面部轮廓,明暗交界线过渡丝滑,杜绝曝光过度导致的细节丢失。
    • 特定方向漫反射与霓虹反射:场景与环境必须建立单一且方向明确的实用光源(如:壁灯、台灯、霓虹灯)。光线在非光滑表面(如复古墙纸、布料、哑光木质)上呈现定向漫反射,在潮湿地面或玻璃上呈现斑驳的霓虹倒影。明确规定光线随距离的自然衰减(光衰减),确保前景、主体、背景的光亮层级与光源方向逻辑绝对自洽。

二、 Seedance 2.5(分辨率 480p) 30s多镜头分段提示词模板(核心重头戏)
生成 30 秒视频的提示词时,必须且只能严格采用以下【四个Markdown模块】结构进行书写。单次输出纯提示词文本控制在 1500字至3000字 之间,以充实空间景深、材质、微观细节与前后段落的叙事连贯性。

【全局视觉与美学基调】

  • 美学风格:[明确指出,如:真人实拍风格,王家卫式都市怀旧美学,强调低照度高对比度光影,融入强烈的冷暖色彩对比与空间阻隔。严格遵守美学配额制:全片倾斜构图、抽帧降格、极度对称构图与90度横摆镜头配额各最多1次,其余镜头均采用常规电影视听语言]
  • 镜头与景深:[符合风格的镜头特性,如:35mm大光圈电影镜头,T1.2浅景深,精准的焦平面控制与焦外散景,框架式构图]
  • 色彩与光照:[全局光照与色彩空间,如:柯达Vision3胶片调色,暖调橘黄主色与潮湿暗色背景对比,主光源方向明确且在物体表面产生柔和的定向漫反射,面部使用温润包裹的自然漫射软光塑造立体轮廓,杜绝高对比度曝焦与死黑]

【人物与场景设定】

  • 人物资产:引用 <<<character_sheet_A>>>、<<<character_sheet_B>>>(绑定多角色资产占位符),指定各角色的五官微观、瞳孔反光、湿漉发丝与衣物材质(如:真丝旗袍、呢子大衣)。
  • 场景资产:引用 <<<scene_layout>>>,明确狭窄走廊、斑驳墙纸、金属门把手的物理反光率与深度。

【剧本与动作时间线】

  • [00.0s - 03.5s]
    • 镜头机位:[镜头类型与机位,如:中景,固定机位,透过百叶窗的前景窥视。视觉状态账本继承:必须精准继承上一段落结尾的“状态锚点”,确保角色A和角色B的初始位置、姿态、道具状态及光影与上一段完全对应,实现无缝硬切衔接]
    • 视觉画面
      • [前景]:[镜头与主体之间的物体,常处于重度失焦状态,如:失焦的、半开的百叶窗,占据画面左侧1/3,形成柔和的阻隔感]
      • [主体]:[画面的视觉中心,焦平面所在。动作描述需通过“行为逻辑常识防火墙”,拒绝浮夸动作,如:角色苏丽珍(角色A)缓缓走入画幅中央,眼神流露出隐忍与落寞,双唇微闭,其动作重力感和身体倾斜真实,且衣物状态与上一段落结尾完全一致]
      • [背景]:[主体后方环境,根据景别虚化,如:远处走廊尽头的暖黄壁灯,在烟雾中形成朦胧的光晕]
    • 听觉声效:[禁用BGM描述!仅写物理音效,如:高跟鞋在潮湿瓷砖上的“哒哒”声,微弱的雨滴拍击窗户声]
  • [03.5s - 07.5s]
    • 镜头机位:[自动切镜:近景特写,伴随手持呼吸感微颤]
    • 视觉画面
      • [前景]:[如:无前景]
      • [主体]:[如:焦点转移至苏丽珍右眼。她视线向下低垂,避开镜头,眼角微湿。面部肌肉微微颤动,神态极其生动自然,展现出内心的挣扎与克制]
      • [背景]:[如:墙上的老旧时钟完全失焦,变成圆形的焦外光圈]
    • 听觉声效:[如:时钟秒针沉闷的“嗒、嗒”声,微弱的呼吸声]
  • [07.5s - 12.0s]
    • 镜头机位:[自动切镜:过肩中景,焦点从肩膀转移至走廊深处]
    • 视觉画面
      • [前景]:[如:苏丽珍精致的旗袍肩膀边缘,最初清晰,后随焦点转移快速失焦]
      • [主体]:[如:走廊深处的周慕云(角色B)微微侧头,眼神深邃地注视着苏丽珍的背影,面部呈现复杂的肌肉联动,神情极其生动,手中夹着香烟,烟雾缭绕]
      • [背景]:[如:斑驳的绿色墙纸,保持中度虚化]
    • 听觉声效:[如:烟草燃烧的细微沙沙声。内心独白:“粤语{周慕云:‘如果有多一张船票,你同唔同我一齐走?’}”(独白需与上下文紧密呼应,符合逻辑递进,若选择方言输出,则在括号前标注方言名称如“粤语”,且台词书写使用方言词汇,声音驱动源绑定为 key_element_audio_B)]
  • [12.0s - 15.0s]
    • 镜头机位:[自动切镜:近景,环绕运镜。视觉状态账本锚定:为下一段落建立清晰的“终态锚点”]
    • 视觉画面
      • [前景]:[如:失焦的烟雾扫过,形成过渡]
      • [主体]:[如:苏丽珍缓缓低下头,眼皮垂下,脸颊肌肉紧绷。她缓缓伸出右手,手指轻轻抚摸着冰冷的石柱(此抚摸石柱姿态、手指位置、暖黄壁灯左侧斜射光影,将作为下一段落开头的状态锚点强行记录)]
      • [背景]:[如:潮湿地面反射壁灯黄光,散景柔和]
    • 听觉声效:[如:高跟鞋在地面上轻微的摩擦声]

【生成约束与负面提示词】

  • 绝对禁止项:禁止生成任何形式的背景音乐(BGM)、旋律 or 节奏音轨。禁止出现任何关于分辨率(4K/1080p)、帧率(60fps/24fps)、画幅比例的UI参数描述。禁止角色出现反关节扭曲、瞬移 or 违背重力的漂浮。禁止使用夸张的动作(如踢门、砸门)。禁止画面出现卡通化、动漫化 or 廉价的3D塑料质感(因本片为真人实拍风格)。禁止光影逻辑冲突。

三、 语音与声效包装符与常识防火墙(Seedance 2.5(分辨率 480p) 执行铁律)

  1. 环境与物理音效(Foley):使用 <...> 包装。必须详细描述音效的物理属性(如:衣料摩擦、金属撞击、水渍踩踏),严禁出现任何“背景音乐”、“BGM”或“旋律”描述。
  2. 多角色对话/内心独白(Dialogue/Monologue):使用 方言前缀{角色名:“对白文本”} 格式包装(若为普通话则前缀可省略,若为方言则强制加前缀,例如:粤语{角色A:“对白文本”}、上海话{角色B:“对白文本”}、闽南语{角色A:“对白文本”}、东北话{角色B:“对白文本”}、四川话{角色B:“对白文本”}、河南话{角色A:“对白文本”})。对白文本必须完全符合 Final_Video_Spec.md 的 Output Language(输出语言),且尽量使用该方言地道的文字、叹词和特殊句式书写。角色A的对白必须绑定 key_element_audio_A,角色B的对白必须绑定 key_element_audio_B。内心独白内容必须前后呼应、逻辑严密,极具文学色彩与诗意,严禁出现无意义或跳跃性的台词。
  3. 屏幕文字:使用 【...】 包装。
  4. 行为常识防火墙:拒绝一切无逻辑的夸张奇观。强制动作描写符合重力、惯性和摩擦力等物理学常规交互(如:推门需描述施力、门开启匀速、重心前倾)。
  5. 负向约束尾缀:每段视频描述尾部必须带上纯中文负向词:【无字幕,无音乐,无文字,无标识】(确保视频纯净无杂质,音乐和字幕后续由 assembler 进行合成)。

四、 纯乐器背景音乐(BGM)提示词与乐器库规范(Suno 5 / Mureka 8)

  1. 曲风与情绪定位 (Style & Mood)

    • 核心基调:突出暧昧、缠绵、孤独且带有时代怀旧感的原声器乐重奏。节奏必须具备强烈的旋律性与情感张力(慢速、忧郁、宏大、浪漫的节拍)以便剪辑卡点。
    • 风格标签词:原声、忧郁弦乐、复古探戈、性感萨克斯风、浪漫、怀旧、亲密重奏、剧场级原声录音。
    • 禁止项:绝对禁止在提示词中写入任何知名音乐人、歌手或特定乐队的名字,防止 Suno 5 等底层模型因版权审核拦截而生成失败。
  2. 王家卫标志性乐器库 (Signature Instrument Library)
    在编写提示词时,必须组合调用以下至少 2-3 种特色乐器,以营造其标志性的深沉、优雅、伤感和复古交响感:

    • 大提琴 / 低音提琴:提供深沉、忧郁且极具顿挫感的大提琴拨弦,作为节奏或情感的主旋律。
    • 小提琴 / 中提琴:提供绵延不绝、如泣如诉的弦乐拉奏,渲染极致的伤感与压抑。
    • 手风琴:注入阿根廷探戈般的暧昧、缠绵、激情与忧伤。
    • 萨克斯风:用于点缀都市深夜的孤独、慵懒与情欲暗流。
    • 古典吉他:提供质朴、慵懒且带有一丝漂泊感的西班牙/拉丁风格弹拨。
    • 爵士钢琴:用缓慢、克制的琴键敲击,营造深夜小酒馆的幽闭与亲密感。
  3. 方言美学特色背景音乐(BGM)提示词配方
    当项目选定特定方言后,在撰写纯乐器 BGM 提示词时,必须严格套用以下对应的中文乐器与意境组合,确保声画美学完美契合:

    • 粤语(经典港风)配方:纯乐器,忧郁电影主题,缓慢低沉的大提琴拨弦,迷幻慵懒的萨克斯风,复古电吉他弹拨,重混响,八九十年代港片霓虹灯光影意境,暧昧,都市孤独,慢速,剧场级干音影棚录制
    • 上海话(爵士海派)配方:纯乐器,爵士乐,缓慢克制的爵士钢琴琴键敲击,性感而慵懒的萨克斯风,低音提琴拨弦,老上海舞厅复古调性,华丽,夜色,暧昧情调,剧场级原声录音
    • 闽南语(民谣怀旧)配方:纯乐器,民谣吉他弹拨,怀旧复古的手风琴,忧郁小提琴,沿海小镇雨夜意境,浪漫,孤独,烟火气,温润,剧场级干音影棚录制
  4. 器乐与编曲结构控制 (Arrangement)

    • 必须在提示词中显式声明【纯乐器】或【无声乐】,避免模型随机产生合成人声。
    • 描述音场质感(如:亲密原声录音棚录音、温暖黑胶唱片质感、干声混音、无重度电子合成器),避免大空间混响或现代电子合成器。
    • 推荐提示词结构/示例:纯乐器,忧郁电影主题,缓慢泣诉的小提琴,深邃的大提琴拨弦,复古探戈手风琴,浪漫且怀旧,剧场级干音影棚录制。
6. 视频合成
  1. 时间轴无缝拼接与剧情连贯性质检

    • 必须以 30 秒为一个大视频层单元进行时间轴拼合。
    • 核心质检指标(视觉状态账本核对):必须站在观众视角,完整审视拼接后的长视频。检查剧情是否通顺、对白/内心独白是否连贯、前后段落是否存在逻辑断层。严格核对相邻30秒段落的接缝处,角色A/B的物理位置、姿态、衣物细节、手中道具状态以及环境光源方向是否完全契合状态账本记录。若发现穿帮或逻辑断层,必须精准定位并打回重制对应段落。
    • 检查相邻 30 秒段落的接缝处,物理动作(如前一段结尾的伸手,必须在后一段开头完成抚摸动作)是否完全契合,实现视觉无缝硬切。
  2. 多镜头节奏控制

    • 检查每个 30 秒视频内部的“自动切镜”节点,其画面切换必须自然。
    • 严禁出现无切镜的、像 PPT 幻灯片或慢动作静态画一样的生硬长轴视频。
    • 对白/内心独白出现时,镜头焦点或景别切换必须与说话者同步。
  3. 三维空间与光影阻隔质检指标

    • 逐镜头检测:前景(百叶窗、窗帘、石柱等)是否实现了合理的散景(Bokeh)与窥视感,主体是否在焦平面上清晰锐利,背景是否有明确的透视深度与低照度虚化。
    • 凡是画面扁平、像二维拼贴、无焦深层次的生成段落,必须打回重制。
  4. 动作与表情质量把关

    • 严禁通过静态插帧或首尾帧生成的生硬镜头。
    • 角色必须有正常的物理质量惯性运动与连贯、生动的肌肉微表情,特别是眼神的忧郁、低垂与视线闪躲,拒绝僵硬呆板的面部表现。
    • 人物不能总是呆立或始终死板地盯着镜头,要有符合剧本动机的肢体交互。
  5. 多轨声音拼合与 Foley 渲染

    • 视频轨自带的对白/内心独白与音效(Foley)必须无损提取并单独编入 Dialogue 轨与 SFX 轨。
    • 音乐轨(BGM):在 video_assembler 中导入通过 Suno 5 / Mureka 8 生成的纯净背景音乐。音乐剪辑点、强重音、乐器段落必须与画面内部自动切镜的重拍完全对齐。
    • 对白、内心独白声场必须与对应的景别大小匹配(特写声音干脆、全景带有场景空间混响)。
  6. 转场与出片管理

    • 多镜头切片内部采用自然的硬切(Hard Cut),30秒段落之间可采用动作衔接切、门开合、镜头横摆等电影化硬转。
    • 严禁使用各种现代短视频的花字、闪白、无物理依据的转场特效。
    • 最终输出:完整的连载视频文件、内部镜头切片清单、物理声效(Foley)对齐节点以及音轨层级分配清单。