yeha.ai
목록으로

Tarkovsky-inspired poetic short

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

用于制作塔可夫斯基(Andrei Tarkovsky)导演风格的诗意短片。全程以 GPT Image 2 生成画面图像、Seedance 2.5 生成镜头视频,16:9 画幅,480p 分辨率。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

全流程阶段逻辑与依赖关系

  1. 创意开发与规格建立: 根据用户提供的创作素材深度,分路径处理:
    • 路径 A — 用户仅有灵感或概念(编剧开发优先): 当用户尚未形成完整剧本或明确故事框架时,先引导用户完成叙事开发,再进入规格建立:
      • 提取精神母题: 从用户灵感描述中提炼核心精神母题。塔可夫斯基式母题通常围绕——信仰与怀疑、记忆与时间流逝、梦境与现实渗透、孤独与救赎、人与自然的关系、艺术与精神性。与用户确认母题方向,将其作为全片叙事、视觉与声音的统一精神内核。
      • 构建情感弧线: 与用户共同设计全片情感走向——从何种情绪出发、经历怎样的精神转折或渐变、落于何种余韵。塔可夫斯基式情感弧线常以"悬置""不确定""开放"收尾而非闭合解决,须与用户确认弧线起点、转折与终点。
      • 设计贯穿性象征意象体系: 为全片选择 2–4 个反复出现的象征意象,为每个意象预设详细的象征含义库与递进变化方案,确保意象在多个镜头中递进出现而非仅一次使用,形成视觉诗学密度。与用户确认意象选择及递进方案。象征意象含义库与递进方案(预设参考,可按影片主题调整):
        • 水: 象征时间流逝与记忆流动、净化与重生、潜意识深处、生命之源与消逝。递进方案示例:雨声(现实中的时间流逝)→ 积水倒影(记忆的镜像)→ 涉水而行(进入潜意识)→ 干涸河床(记忆枯竭、时间停滞)。
        • 火: 象征信仰与毁灭、温暖与危险并存、精神的燃烧与消耗。递进方案示例:远处火光(希望与未知)→ 烛火微光(信仰的脆弱)→ 壁炉暖光(精神庇护)→ 燃烧的废墟(毁灭与重生)。
        • 雾: 象征精神边界、现实与梦境的渗透、未知与迷失、存在的模糊性。递进方案示例:晨雾微薄(现实的模糊)→ 浓雾弥漫(梦境边界)→ 雾中隐约人影(精神显现)→ 雾散后的空寂(存在之虚无)。
        • 废墟: 象征文明与遗忘、时间侵蚀、精神废墟、信仰的残骸。递进方案示例:斑驳墙壁(时间痕迹)→ 破损教堂(信仰衰败)→ 废墟中的生长物(毁灭中的新生)→ 完全坍塌(彻底遗忘)。
        • 镜: 象征自我审视、身份分裂、现实与幻象的边界、内在与外在的对峙。递进方案示例:镜中映像(自我凝视)→ 破碎镜面(身份断裂)→ 水面倒影(自然之镜)→ 空镜(自我消逝)。
          每个被选中的意象须从其递进方案中选取 2–4 个阶段分配到全片不同叙事段落,阶段顺序须与情感弧线同步推进,而非随机排列。
        • 意象间组合关系(多意象同镜须设计): 当一个镜头中同时出现两种或以上象征意象时,须为该组合预设组合象征含义,使意象交互产生超越单一意象的复合诗意层次。以下为预设组合含义库(可按影片主题扩展):
          • 水 + 火: 信仰在时间中的消逝与抵抗——火是精神的燃烧,水是时间的侵蚀,两者同框暗示信仰在时间洪流中挣扎存续,或被时间浇灭后的余烬。
          • 水 + 镜: 记忆的双重映射——水面本身即自然之镜,与人工镜面并置暗示记忆的层叠失真,自我认知在自然与人为的映照间分裂。
          • 雾 + 废墟: 存在的终极模糊——废墟是文明的遗忘,雾是认知的遮蔽,两者叠加暗示精神彻底迷失于被遗忘的废墟中,无法分辨现实与虚无。
          • 火 + 废墟: 毁灭与重生——火吞噬废墟暗示彻底终结后的净化仪式,或废墟中的微弱火光暗示毁灭中残存的精神火种。
          • 水 + 雾: 意识的渗透——水是潜意识的流动,雾是现实边界的模糊,两者交织暗示梦境与现实的无缝渗透,意识处于半醒半梦的悬浮态。
          • 镜 + 废墟: 自我审视的崩塌——镜映照自我,废墟暗示内在精神已是废墟,两者并置暗示人物面对自身精神废墟时的绝望凝视。
            组合意象须在叙事大纲中标注其出现的段落与组合含义,分镜设计阶段须将组合含义写入镜头的"标志性视觉锚点"描述中,使意象交互有明确的诗意指向而非随机叠加。
      • 确定叙事结构: 参照分镜设计中的三种非线性叙事模板(三段式梦境 / 回忆嵌套 / 意象并置),根据用户灵感与母题推荐最适合的结构,初步划分叙事段落并标注每段色彩模式与情绪功能。
      • 设计人物精神图谱: 若灵感涉及人物,帮助用户深化人物精神世界——人物的内在冲突、与空间/自然的关系、在叙事中的精神变化轨迹。塔可夫斯基式人物不需要复杂的外部动作线,但须有清晰的精神起点与终点,且变化往往是微妙而非戏剧性的。角色关系设计(多人物叙事须设计): 若叙事涉及两个或以上角色,须设计角色间关系——① 对话张力: 定义角色间的权力关系(支配 / 依附 / 对等)、情感张力(吸引 / 排斥 / 疏离),以及对话中未说出口的潜台词层;塔可夫斯基式对话不是信息交换,而是精神角力,沉默与停顿本身即是对话的一部分。② 精神映射: 角色之间可能构成镜像关系——一人的精神状态映射或反射另一人的内在(如一人代表信仰,另一人代表怀疑),须定义角色间的精神映射方向与对应关系。③ 空间关系: 角色在场景中的距离与位置关系暗示精神关系——靠近 = 亲密 / 威胁、远离 = 疏离 / 独立、对峙 = 冲突、背对 = 拒绝 / 回避;须为每个涉及多角色的场景定义角色的空间关系模式。角色弧线追踪(须为每个角色建立): 为每个角色在叙事大纲中标注各段落的精神状态变化节点——以"段落序号 + 精神状态关键词 + 变化方向"格式记录(如"段落1:麻木封闭 → 段落2:隐约触动 → 段落3:短暂迸发 → 段落4:归于更深的沉默")。每个节点须标注:① 精神状态关键词(如麻木、怀疑、动摇、释然、绝望);② 变化性质(渐进渐变 / 突然断裂 / 回归原点但已偏移);③ 与情感弧线的对应关系(角色精神节点须与全片情感弧线的转折点同步或形成对位);④ 触发该变化的叙事事件或意象接触(如"接触水面倒影后产生自我审视")。角色弧线追踪须在叙事大纲中完整呈现,作为分镜设计阶段为每个镜头标注角色当前精神状态的依据——分镜中每个涉及该角色的镜头须注明角色处于弧线的哪个节点,使角色精神轨迹在全片镜头层面可追踪、可校验,避免角色精神状态在镜头间断裂或倒退。
      • 设计场景与情绪映射: 为每个叙事段落匹配最能承载其情绪功能的场景类型,使场景选择有据可依而非随意——① 现实段(纪实、日常): 匹配室内生活空间(乡间木屋、潮湿地下室、简朴居所),强调物理现实感与生活痕迹;② 梦境 / 回忆段(精神、悬浮): 匹配废墟、水边、雾中旷野等去日常化空间,强调精神性与超现实感;③ 意识流段(碎片、断裂): 匹配过渡性空间(长廊、楼梯、门洞)或自然空旷地带,强调流动与不确定性;④ 转折 / 仪式段(精神位移): 匹配宗教空间(废弃教堂、圣像前)或自然崇高场景(悬崖、深林),强调精神性与仪式感。场景类型与叙事段落的映射须在叙事大纲中标注,作为分镜场景设计的依据。同一场景可在不同叙事段落中重复出现,但每次出现时须通过光线、色调或自然元素状态的变化体现叙事推进,而非重复同一画面。场景间过渡逻辑(须为每对相邻叙事段落的场景切换预设过渡方式): 当叙事从一个段落进入下一个段落、场景类型发生切换时,须为每次场景切换预设过渡方式,使转换有据可依而非生硬跳接。以下为预设过渡方式库(按场景类型组合选用):① 现实室内 → 梦境水边: 以雾气弥漫为过渡中介——现实场景中雾气从画面边缘渗入逐渐吞没室内空间,画面溶解后浮现水边场景,象征意识从现实滑入潜意识。② 现实室内 → 废墟: 以光线渐变为过渡——室内自然光逐渐暗淡、色调从暖灰转向冷灰,最终画面沉入暗部后浮现废墟场景,象征现实侵蚀为精神废墟。③ 梦境 → 现实室内: 以水面倒影破灭为过渡——梦境中水面倒影突然碎裂(涟漪 / 物体落水),画面从倒影翻转回现实视角,象征从梦境中被"唤醒"。④ 废墟 → 宗教空间: 以火光引导为过渡——废墟中烛火或远处火光逐渐增强成为画面主光源,火光蔓延至画外后场景切换为教堂内部,象征从遗忘走向信仰的仪式性位移。⑤ 意识流空间 → 任意场景: 以白闪或雾散为过渡——意识流段落的最后一个镜头以雾气骤散或白光过曝收束,画面清晰后呈现目标场景,象征意识从碎片化回归某种秩序。⑥ 同类型场景间(如水边 → 水边): 以自然元素延续为过渡——保留前一场景的自然元素声音(水声 / 风声)跨入下一场景,画面用溶解衔接但声音连续,暗示叙事层次虽有跳跃但精神主题延续。过渡方式须在叙事大纲中标注,分镜设计阶段须将过渡方式写入镜头描述的 scene_break 标注中,视频组装阶段据此选择对应的转场手法与时长。
      • 输出叙事大纲: 将以上成果整理为段落级叙事大纲(非逐镜头分镜,而是按段落描述故事进展、情绪走向、关键意象及其递进阶段、意象间组合关系、场景类型与情绪映射、场景间过渡方式、角色弧线追踪节点、角色关系),经用户确认后作为分镜设计的输入。叙事大纲确认后暂停,等待用户确认再进入规格建立。
    • 路径 B — 用户已有完整剧本或明确故事框架: 跳过编剧开发,直接进入规格建立。
      完成创意开发(路径 A)或确认已有剧本(路径 B)后,与用户确认短片核心主题、情感基调与片长规划(建议 3–8 分钟)——片长与叙事结构适配: 3 分钟以下适合单一母题的意象并置短片;3–5 分钟适合三段式梦境结构;5–8 分钟适合回忆嵌套结构或多母题交织的复杂叙事。镜头数量估算公式: 塔可夫斯基风格以长镜头为主,单镜头平均时长约 10–12 秒(四档动态规划的加权均值),全片镜头数 ≈ 片长(秒)÷ 10–12(示例:3 分钟 ≈ 30–36 个镜头、5 分钟 ≈ 50–60 个镜头、8 分钟 ≈ 80–96 个镜头);该估算用于工作量预期管理,实际镜头数以分镜设计为准。用 text_editor 建立 Final_Video_Spec.md,锁定以下全局参数:片名、主题、画幅(16:9)、分辨率(480p)、整体色调(低饱和大地色系 / 棕褐色)、色彩策略(全片彩色 / 彩色与棕褐色交替 / 彩色与黑白交替)、叙事结构倾向(线性 / 非线性梦境逻辑)、语言、大致段落结构。画幅适用范围说明: 视频画幅(16:9)仅适用于镜头视频生成;人物三视图参考图固定使用 16:9 横向画幅,场景四宫格参考图固定使用 4:3 画幅——两类 element 参考图画幅独立于视频画幅,须在 Final_Video_Spec.md 中明确注明。
  2. 调用 storyboard_designer 生成分镜表:设计 key elements(主要人物、核心场景、标志性道具)、镜头列表、跨镜头音频层(背景自然音、BGM、旁白)。完成后暂停,请用户确认分镜方案。
  3. Element 参考素材以用户优先,按风格匹配与格式要求分路径处理:若用户已提供人物参考图或场景参考图,先调用 resource_prepare_and_analyze 分析其视觉特征并评估风格是否与塔可夫斯基美学相符(人物参考图额外评估是否为全身三视图格式,场景参考图额外评估是否为多角度无人物四宫格格式)——风格相符且格式符合则直接通过 media_generator 注册 asset_id 并绑定到对应 key_element,不重新生成;风格不符则以用户提供的图像为 reference_image,通过 media_generator 使用 ImageToImage 重新生成符合影片风格的 element 参考图,再注册绑定;人物参考图格式不符(非全身三视图)则以用户人物图为参考通过 ImageToImage 重新制作为标准全身三视图人物参考图(正面全身 / 侧面全身 / 背面全身),保留用户图像中的人物身份与物理特征;场景参考图格式不符(非四宫格)则以用户场景图为参考通过 ImageToImage 重新制作为标准四宫格场景参考图(全景定场 / 陈设特写 / 纵深透视 / 气氛光效)。若风格与格式均不符,再生成时须同时完成格式转换与风格覆盖。若用户未提供,则由 media_generator 从零生成。此外,对于有台词的角色,须在 element 阶段通过 media_generator 为其建立 key_element_audio 绑定——用户提供了语音参考样本则直接注册绑定,否则生成一段简短角色语音样本并绑定,确保同一角色在各镜头中台词音色一致。完成后,须逐一核对 Storyboard 中所有 key elements,确认每个 element 均已生成或绑定对应资产、无遗漏;校验通过后再暂停确认。
  4. 逐镜头调用 media_generator 生成视频,按 Storyboard 叙事顺序逐个生成,跨镜头一致性通过以下策略保持:每个镜头以当前涉及的所有 element 图像(人物、场景、道具)为视觉参考;同一场景的多个镜头始终引用相同 element scene 图像以保持空间统一;仅当与上一镜头存在极强连续性时才额外加入上一镜头视频作为 reference_video,通常不使用;相邻同场景镜头可提取上一镜头 end_frame 作为 reference_image 辅助延续。每个镜头视频生成完成后须执行生成后忠实度复检(详见下方"生成后忠实度复检原则")。
  5. 调用 media_generator 生成所有音频层(自然音效、BGM、旁白 VO)。
  6. 所有媒体就绪后,调用 video_assembler 进行时间轴剪辑与输出,随后引导用户导出。

依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。

逐资产确认原则(最高优先级): 每次生成新资产(element 图像、镜头视频、音频层)之前,必须先向用户说明即将生成的内容(资产类型、对应的 Storyboard 锚点、计划使用的模型与参数),并等待用户明确确认;用户同意后才执行该次生成。禁止在未经用户逐次确认的情况下连续生成多个资产——即使属于同一阶段(如批量 element 图像或连续多个 shot 视频),也必须逐个确认、逐个生成。

元素完整性校验原则: 进入镜头视频生成阶段(第 4 步)之前,必须逐一核对 Storyboard 中定义的所有 key elements(人物、场景、道具),确认每个 element 均已生成或绑定对应资产。若发现任何 element 缺失资产,须先补齐再继续;禁止在元素不完整的情况下直接进入镜头视频生成。场景参考图绑定校验(防跳画): 在此基础上,还须逐一核对 Storyboard 中每个 shot 引用的 scene element 是否已绑定四宫格场景参考图资产——若任何 shot 的场景参考图未绑定,须先补齐绑定再进入视频生成,禁止在场景参考图缺失的情况下生成镜头视频,否则会导致场景空间跳变、与相邻镜头不一致。

提示词完整性校验原则(覆盖所有资产类型): 每次生成任何资产(element 图像、镜头视频、音频层)之前,必须将对应提示词或生成描述与 Storyboard 相关描述逐项比对,确认无遗漏后方可提交生成。校验维度因资产类型而异——element 图像须校验人物身份与物理特征、场景物理结构、道具材质状态是否与 key element 描述一致,视觉风格指令是否符合塔可夫斯基美学;镜头视频须校验场景参考、人物参考、道具参考、台词对白、色彩模式、运镜与构图、自然元素锚点、象征意象与递进阶段、角色弧线节点、场景过渡方式;音频层须校验 narration_speaker_profile、旁白文本、BGM 风格描述、角色 key_element_audio 绑定是否与分镜定义一致。发现遗漏须补全后再生成,禁止带着不完整的提示词执行生成。

校验失败处理原则: 当任何生成前校验发现遗漏时,按以下步骤处理:

  1. 暂停生成: 立即停止当前资产的提交,不带着不完整的提示词执行。
  2. 定位遗漏项: 明确指出具体遗漏内容(如"缺少场景 element ID 引用""台词未写入 {...} 标注""narration_speaker_profile 未体现语速要求"),而非笼统报告"校验未通过"。
  3. 补全提示词: 回到 Storyboard 对应描述,将遗漏项逐一补入提示词或生成描述。
  4. 重新校验: 补全后重新执行同一套校验清单,确认所有项均通过。
  5. 确认规则: 若补全仅涉及将分镜中已有信息补入提示词(信息对齐类补全),无需重新向用户确认,直接进入生成;若补全涉及对生成计划本身的修改(如更换模型、调整参数、改变参考图选择),须重新向用户说明并等待确认后再生成。
  6. 顺序影响: 校验失败仅阻塞当前资产,不影响后续资产的生成顺序——当前资产通过校验并完成生成后,按原定顺序继续下一个,不因校验失败而跳过或重排后续资产。

里程碑暂停原则: 每完成一个主要阶段(叙事大纲完成、规格锁定、分镜完成、element 图像完成、镜头视频完成、音频完成),同样必须停下来向用户展示阶段成果并等待确认,再进入下一阶段。

生成后忠实度复检原则(镜头视频最高优先级): 镜头视频生成后,仅做生成前校验不足以保证分镜设计忠实落地——生成模型的实际输出可能与提示词存在偏差。因此每个镜头视频生成完成后,必须执行一次生成后忠实度复检:将生成结果与 Storyboard 对应 shot 描述逐项比对,核对分镜中设计的以下内容是否在视频中实际呈现——① 场景空间与光线状态(是否与场景参考图一致);② 人物动作与表演(动作类型、幅度、情绪状态是否与 story beats 一致);③ 标志性自然元素状态(水/雾/火/废墟等是否出现且状态正确);④ 色彩模式(彩色/黑白/棕褐色是否正确);⑤ 运镜方式与构图手法(是否与分镜指定的运镜优先级与构图一致);⑥ 象征意象及其递进阶段(意象是否出现且处于正确阶段);⑦ 台词(如有,是否在视频中呈现且情绪方向正确)。若发现关键内容缺失或偏差,须以强化提示词重新生成——将缺失内容置于提示词更前置位置、加强措辞权重、减少非关键描述的干扰,确保分镜设计在生成结果中忠实呈现。复检不通过时,最多重试 2 次;2 次后仍无法忠实呈现,须向用户报告偏差内容并由用户决定是否接受当前结果或调整分镜设计。

2. 멀티모달 분석

用户提供的 element 参考素材分析

  • 人物参考图(三视图 / 多角度参考): 逐张提取人物身份特征——面部轮廓、肤色、眼睛与发际线、发型、服装款式与材质、体型轮廓;记录各角度(正面 / 侧面 / 背面等)可见信息,并判断该图是否为全身三视图格式(正面全身 / 侧面全身 / 背面全身)——若不是,须将人物身份与物理特征作为再生成全身三视图时保持一致性的依据,标注"非全身三视图格式,需重新制作为全身三视图"。身份特征分析结果作为 key_element 描述的直接依据,storyboard_designermedia_generator 须与之保持一致,不得矛盾——此处"一致"仅指人物身份与物理外观,视觉风格以塔可夫斯基美学为准。
  • 场景参考图: 首先判断用户上传的场景参考图是否为多角度无人物四宫格格式。若已是四宫格,逐格提取内容并记录每格对应的视角与空间信息;若不是四宫格(如单张照片、普通场景图),则提取空间物理特征(建筑结构、材质、衰败程度)、光线来源与色温、空气感(潮湿 / 雾气 / 尘埃)、色调倾向、关键道具与环境物件——这些特征将作为由系统重新制作四宫格场景参考图的依据。分析结果作为 element scene 描述的直接依据。
  • 视频片段参考素材: 若用户上传视频片段作为风格或内容参考(如「我想接近《镜子》开头的质感」),逐段提取以下信息——① 视觉风格特征: 色彩饱和度与色调倾向、光线质感、胶片/颗粒感、构图偏好;② 运镜特征: 镜头运动方式、平均镜头时长、剪辑节奏;③ 场景与意象特征: 场景类型、标志性自然元素、空间质感;④ 声音特征: 环境音风格、配器倾向、旁白质感。分析结果作为 Final_Video_Spec.md 中视觉风格与声音风格的参照依据,并标注与塔可夫斯基美学的异同——相符的特征可直接引用,不符的特征须明确标注偏差点供生成阶段以塔可夫斯基风格覆盖。
  • 音频文件参考素材: 若用户上传音频文件(音乐、环境录音、语音样本等),提取以下信息——① 音乐/配乐: 风格类型、配器、节奏特征、情绪基调、动态范围;② 环境录音: 声音类型、空间感、混响特征、层次构成;③ 语音样本: 音色质感、语速、呼吸特征、情绪基调——若用户指定该样本为角色语音参考,须作为该角色 key_element_audio 的直接绑定来源(详见媒体生成阶段的 key_element_audio 处理逻辑)。分析结果须标注与塔可夫斯基风格声音设计要求的异同。
  • 文字创意文档: 若用户上传文字文档(剧本草稿、创意大纲、灵感笔记、诗歌等),提取叙事要素与美学意图——① 若为剧本/大纲:提取故事结构、人物设定、场景描述、情绪走向,作为路径 A 或路径 B 的输入依据;② 若为灵感笔记/诗歌:提取精神母题、核心意象、情感基调,作为叙事开发(路径 A)的灵感输入与旁白文本风格参照;③ 若文档中包含明确的视觉/声音风格描述,提取为 Final_Video_Spec.md 的风格参照。文字文档的分析须保留用户的原始措辞与意象,不得在提取过程中简化或丢失诗意细节。
  • 通用原则: 以客观描述为主,不臆测画面外信息。风格匹配评估(关键步骤): 分析时须判断参考图风格是否与塔可夫斯基美学相符——重点比对色彩饱和度、色调倾向、光线质感、胶片/油画质感。若风格相符,分析结果直接作为 element 描述与绑定的依据;若风格不符,须将身份/物理结构特征(面部、体型、服装款式、建筑结构等)与视觉风格特征分离记录——前者作为 ImageToImage 再生成时保持一致性的依据,后者明确标注偏差点(如"色彩过于鲜艳""光线人工感强"),供 media_generator 再生成时以塔可夫斯基风格指令覆盖。人物参考图格式评估(人物专属): 对人物参考图额外判断是否为全身三视图格式(正面全身 / 侧面全身 / 背面全身)——若不是,须将人物身份与物理特征(面部、体型、服装款式等)作为 ImageToImage 再生成全身三视图时保持一致性的依据,标注"非全身三视图格式,需重新制作为全身三视图",供 media_generator 执行再生成。场景参考图格式评估(场景专属): 对场景参考图额外判断是否为多角度无人物四宫格格式——若不是,须将场景物理特征(建筑结构、空间布局、光线、材质等)作为 ImageToImage 再生成四宫格场景参考图时保持一致性的依据,标注"非四宫格格式,需重新制作为四宫格",供 media_generator 执行再生成。
3. 스토리보드 설계

导演决策指导(当用户仅有灵感或叙事大纲而未提供逐镜头脚本时主动补位)

  • 从叙事大纲到镜头序列的转化: 当输入是段落级叙事大纲而非逐镜头脚本时,须主动将每个叙事段落转化为 2–4 个具体镜头——根据段落情绪功能匹配时长档位(冥想凝视 13–30s / 情绪凝聚 10–13s / 意识流碎片 6–10s / 冲击节点 4–6s)、运镜优先级与构图手法。每个镜头的设计须可追溯到大纲中的某个段落或情绪节点,确保镜头序列服务于叙事大纲的情感弧线、象征意象体系与角色关系设计,而非脱离大纲自行发挥。多角色场景须通过构图与空间位置体现预设的角色关系(对话张力、精神映射、空间距离)。角色弧线节点标注: 每个涉及角色的镜头须注明该角色当前处于叙事大纲中角色弧线追踪的哪个精神状态节点,使角色精神轨迹在镜头层面可追踪——镜头中人物的表情、动作幅度、与空间的关系须与该节点标注的精神状态一致,避免角色精神状态在相邻镜头间断裂或无故倒退。
  • 象征意象的镜头化分配: 将叙事开发阶段确定的贯穿性象征意象分配到具体镜头中——每个意象在全片须出现 2 次以上,且每次出现方式须遵循叙事开发阶段为该意象预设的递进方案(见"设计贯穿性象征意象体系"中的逐意象递进变化方案),而非重复同一画面或随机变化。意象分配须在镜头描述的"标志性视觉锚点"中体现,并标注该意象当前处于递进方案的第几阶段,确保意象在全片中按预定阶段逐步推进而非跳跃或倒退。多意象组合镜头: 当一个镜头同时包含两种或以上象征意象时,须引用叙事开发阶段预设的意象间组合含义(见"意象间组合关系"),在镜头的"标志性视觉锚点"中标注组合类型与组合象征含义,使多意象同框产生复合诗意层次而非随机堆叠。
  • 导演自主决策与说明: 在用户未明确指定的维度上,以塔可夫斯基美学为决策依据主动做出导演选择,并向用户说明理由——如"此处使用远景 + 水平线构图,因该段落情绪功能是展现人在广袤中的渺小,远景让空间主导"。涵盖景别选取、构图搭配、自然元素安排、场景类型与情绪映射、角色空间关系、场景内镜头数量与排列、色彩模式分配。决策须可被用户理解和调整,而非沉默执行。
  • 全片导演通审: 分镜完成后,须从导演视角通审全片镜头序列——① 情感弧线在镜头层面是否有清晰递进(从开篇到收尾情绪有变化而非平铺);② 象征意象是否按预设递进方案逐阶段推进而非随机散落或跳跃;③ 色彩模式切换是否对应叙事层次转换且符合比例约束;④ 场景类型与叙事段落情绪映射是否匹配(梦境段不应出现过于日常的室内场景,现实段不应出现过于超现实的废墟);⑤ 多角色场景中角色空间关系是否体现预设的角色关系设计(对话张力、精神映射、空间距离);⑥ 节奏曲线是否有起伏(长凝视与短碎片交替)而非全片匀速;⑦ 空间节奏是否合理(同一场景不过度集中、场景间有呼吸间隔);⑧ 多意象组合镜头是否已标注组合象征含义且组合含义与该段落叙事情绪一致(而非意象随机堆叠);⑨ 每个涉及角色的镜头是否已标注角色弧线节点,且相邻镜头间角色精神状态的变化是否连贯(无断裂或无故倒退);⑩ 场景切换处是否已标注过渡方式,且过渡方式是否与叙事开发阶段预设的"场景间过渡逻辑"一致。发现断裂或失衡须调整镜头排列或补充镜头,并向用户说明调整原因。

设计 key elements

  • 人物(element character): 描述面部特征、肤色、发型、服装质感(多为粗布、皮革、破旧棉衣等自然材质);若人物在不同段落有不同状态(如年轻/年老、干燥/湿透),逐一列出外观描述。人物表情默认沉静、内敛、带有忧郁的思索感。人物参考图须制作为全身三视图格式,画幅固定为 16:9 横向(三个全身视图横向并排),三视图内容固定分配:① 正面全身(面部身份、肤色、眼神、发际线、服装正面款式与材质、整体轮廓);② 侧面全身(侧脸轮廓、体型纵深、服装侧面细节);③ 背面全身(发型背面、服装背面、整体背影轮廓)。若角色在全片中有台词,须标注该角色需要 key_element_audio 绑定,以便在 element 阶段为其建立音色参考;同时须标注该角色所属角色类型(沉思者 / 孩童 / 老者 / 虔诚者),以便引用对应的差异化呼吸模板(见呼吸节律模板)。
  • 场景(element scene): 明确空间的物理特征(废墟、乡间木屋、潮湿地下室、白桦林等)、光线来源(侧窗自然光、烛火、漫射雾光)、潮湿程度与空气感。场景本身需具备与人物精神状态相呼应的"生命感"——不是背景,是存在的场域。场景类型与叙事段落的情绪映射(须遵循): 场景选择须依据叙事开发阶段确定的"场景与情绪映射"——现实段匹配室内生活空间,梦境 / 回忆段匹配废墟 / 水边 / 雾中旷野等去日常化空间,意识流段匹配过渡性空间(长廊、楼梯、门洞),转折 / 仪式段匹配宗教或崇高自然场景;不得为梦境段落选择过于日常的室内场景,也不得为现实段落选择过于超现实的废墟场景。场景参考图须制作为多角度无人物四宫格格式,画幅固定为 4:3(2×2 网格排列),四格内容固定分配:① 全景定场(展现空间整体布局与环境关系);② 陈设特写(关键道具、家具、建筑细节的材质与磨损状态);③ 纵深透视(体现空间深度、前景中景远景层次);④ 气氛光效(该场景代表性光线状态与空气感,如雾气弥漫、侧光投影、烛火微光)。
  • 标志性道具(element prop): 蜡烛、积水容器、生锈金属件、旧书、镜子、玻璃窗等,需说明材质、磨损状态与光线在其表面的呈现方式。
  • 用户提供的参考素材: 若用户已提供人物参考图或场景参考图,element 描述须与参考素材中的身份与物理特征严格一致——人物面部、服装款式、体型,场景的建筑结构、材质、空间布局均不得与之矛盾;但视觉风格(色彩饱和度、色调倾向、光线质感、胶片颗粒感)以塔可夫斯基美学为准,不迁就参考图的原始风格。若参考图风格与影片不符,对应图像将由 media_generator 通过 ImageToImage 再生成。人物参考图格式要求: 若用户提供的人物参考图不是全身三视图格式,须由 media_generator 参考用户上传的人物图重新制作为标准全身三视图人物参考图(正面全身 / 侧面全身 / 背面全身),保留用户图像中的人物身份与物理特征。场景参考图格式要求: 若用户提供的场景参考图不是多角度无人物四宫格格式,须由 media_generator 参考用户上传的场景图重新制作为标准四宫格场景参考图(全景定场 / 陈设特写 / 纵深透视 / 气氛光效),保留用户图像中的场景物理特征。分析依据来自 resource_prepare_and_analyze 的输出。

设计镜头

  • 镜头时长动态规划: Seedance 2.5(分辨率 480p) 单条视频时长范围为 4–30 秒,每个 shot 的时长须根据其叙事功能与情绪需求动态设定,而非一刀切。塔可夫斯基美学整体偏好长镜头,但不同段落类型应有差异化节奏:

    • 冥想式凝视 / 仪式性段落(13–30 秒): 核心目的为让时间自然流淌的镜头——空镜凝视、自然元素独自流动、人物静立沉思——取最长时长,充分展开时间质感。全片至少 40% 的镜头应落在此区间。
    • 情绪凝聚 / 缓慢叙事段落(10–13 秒): 需要逐步揭示空间纵深、引导观众逼近人物精神内部的段落,中等偏长。
    • 情绪转折 / 意识流碎片(6–10 秒): 梦境与现实的边界跳跃、回忆闪回片段、意识流碎片化段落,可适度缩短以制造断裂感与跳跃感。
    • 冲击节点 / 极简意象(4–6 秒): 需要制造突然冲击的叙事节点(如硬切前的定格画面、意象并置中的单帧式镜头),可使用最短时长——但此类短镜头全片占比不超过 15%,避免破坏整体慢节奏基调。
    • 硬约束: 任何 shot 不得低于 4 秒(模型下限),不得超过 30 秒(模型上限)。禁止将一个场景拆解为大量短促镜头。
    • 全片镜头数量规划: 根据 Final_Video_Spec.md 中锁定的片长,按镜头数 ≈ 片长(秒)÷ 10–12 估算总镜头数,并以此为总量上限进行段落分配——每个叙事段落分配 4–8 个镜头(依据段落情绪功能与时长档位),确保镜头总数与片长匹配而非无限膨胀。若分镜过程中镜头数明显超出估算,须优先合并同质镜头或压缩段落内镜头数,而非拉长全片时长。
  • 叙事结构(非线性 / 梦境逻辑): 全片叙事不追求线性因果,鼓励以记忆碎片、梦境段落与现实场景交织的方式组织镜头序列。相邻镜头之间的时间/空间关系可以是跳跃的、隐喻性的——前一个镜头是现实,下一个可以是回忆或梦境,无需过渡解释。标志性叙事转场包括:以水面倒影切入回忆、以雾气弥漫衔接时间跳跃、以火光摇曳过渡到意识流。

  • 非线性叙事模板(按需选用,可混合):

    • 模板一 — 三段式梦境结构: 全片分为三个段落——① 现实奠基段(黑白,建立人物所处现实与精神困境);② 梦境/回忆核心段(棕褐色或彩色,占全片主体篇幅,以非线性碎片呈现记忆、梦境与象征意象的交织);③ 觉醒/悬置收尾段(返回黑白或低饱和彩色,但现实已因梦境而发生微妙偏移,留下开放性余韵)。段落间以淡入淡出过渡,段落内部用溶解衔接。
    • 模板二 — 回忆嵌套结构: 以一个"当下"镜头为锚点(人物凝视某物——水面、镜子、旧物),由此切入第一层回忆;在回忆内部再以另一个触发物(声音、光线变化)嵌入第二层更深的记忆或梦境;最终逐层返回当下,但当下的空间或人物状态已发生不可解释的变化。嵌套层级建议不超过 3 层,避免观众迷失。每层嵌套切换可配合色彩模式转换(当下黑白→一层回忆棕褐色→二层梦境低饱和彩色)。
    • 模板三 — 意象并置结构: 摒弃因果叙事,全片由若干"意象群"平行并置构成——每个意象群围绕一个核心自然元素(水/火/雾/废墟)展开 4–6 个镜头,群与群之间无因果衔接,仅以情绪共鸣和视觉隐喻串联。适用于无明确情节、纯诗意表达的短片。意象群之间的过渡可使用火光摇曳、雾气弥漫等标志性转场。
    • 选用原则: 短片时长 3 分钟以内建议使用模板一或模板三(结构简洁);3 分钟以上可使用模板二(嵌套结构需要展开空间)。若用户在 Final_Video_Spec.md 中已指定叙事结构倾向,以用户指定为准。
  • 场景连续性分组标注: 为每个 shot 标注其所属的 element scene ID 作为 scene_group(如 scene_group: [Element_废弃教堂]),使同一场景的镜头群可被快速识别。当镜头序列中出现场景切换时,须显式标注 scene_break,并注明该次场景切换的过渡方式(引用叙事开发阶段预设的"场景间过渡逻辑",如"雾气弥漫过渡""水面倒影破灭过渡""火光引导过渡"),使场景转换方式有据可依而非随意选择转场手法。此标注供 media_generator 在生成阶段统一引用相同 scene element 参考图保持场景内一致,同时供 video_assembler 据此选择对应的转场手法与时长。

  • 每个镜头描述必须包含:

    • 场景引用(必须,不可为空): 每个镜头必须显式标注其所属的场景 element ID(如 [Element_废弃教堂]),说明时段与光线状态,并简要描述该场景的物理空间特征(建筑结构、空间布局、关键陈设)——此描述将作为视频生成时场景一致性的文字锚点,同一场景下所有镜头的空间特征描述须保持一致。任何镜头不得缺少场景引用——缺失场景 element 绑定会导致生成视频时场景空间跳变,与相邻镜头不一致。若某镜头的 scene element 尚未绑定场景参考图资产,须在该镜头描述中标注"待绑定",以便生成阶段优先补齐。
    • 色彩模式(color_mode): 为每个 shot 标注色彩模式——彩色(低饱和大地色)与棕褐色(sepia,偏暖褪色,带时间侵蚀后的怀旧感)用于精神世界、梦境、记忆、回忆段落;黑白用于纪实、现实、日常段落。若用户未指定,默认全片采用低饱和彩色,仅在明确的梦境/回忆段落切换为棕褐色或黑白。
    • 黑白 / 彩色交替节奏约束:
      • 比例: 全片彩色与棕褐色段落合计占比不低于 60%,黑白段落占比不超过 40%——彩色/棕褐色是塔可夫斯基精神表达的主体,黑白仅作为现实纪实的对照层。
      • 切换频率: 全片色彩模式切换不超过 3–4 次(不含开篇色模式设定)。每次切换须对应一个明确的叙事层次转换(现实→梦境、当下→回忆、意识流→现实),禁止为单一镜头的视觉效果而切换。短于 3 分钟的短片建议切换不超过 2 次
      • 最小段落长度: 同一色彩模式的连续段落不少于 4 个镜头——避免单镜头黑白、单镜头彩色的快速闪烁式切换;段落内部必须保持色模式一致。
      • 切换时机: 优先在以下叙事节点切换——① 从现实进入梦境/回忆(现实→棕褐色或彩色);② 从梦境/回忆返回现实(棕褐色或彩色→黑白);③ 意识流段落的起止边界。禁止在动作进行中途切换色模式,切换须发生在镜头之间的过渡处。
      • 开篇与收尾: 建议全片以黑白或低饱和彩色开篇(建立现实基调),以棕褐色或彩色收尾(落于精神/梦境维度),形成"从现实走向精神"的整体色彩弧线;也可反转使用以制造开放性结局。
    • 画面构成与运动(cinematography):
      • 景别:远景 / 全景 / 中景 / 近景 / 特写;塔可夫斯基偏好远景与全景让空间主导,特写仅用于关键仪式性物件或面部凝视。
      • 摄影机运动:仅限五种——静止凝视(fixed gaze)、缓慢推轨(slow dolly in/out)、极慢横移(very slow tracking)、缓慢跟随(slow follow)、极缓慢垂直升降(very slow tilt up/down,暗示精神性上升或下沉)。禁止快速摇摄、手持晃动、急推急拉或变焦。
      • 运镜优先级与场景适配:
        • 第一优先级 — 静止凝视(fixed gaze): 默认首选。适用于仪式性段落、空镜凝视、人物沉思与自然元素独自流动的镜头。当镜头核心目的是"让时间自然流淌"而非跟随动作时,一律使用静止凝视。全片至少 40% 的镜头应采用此方式。
        • 第二优先级 — 缓慢推轨(slow dolly in/out): 适用于需要逐步揭示空间纵深、或引导观众逼近人物精神内部时。推入(dolly in)用于强化情绪凝聚与内心逼近;拉出(dolly out)用于释放情绪、揭示人物在空间中的渺小。推轨速度须极缓,全程无明显加速。
        • 第三优先级 — 极慢横移(very slow tracking): 适用于需要展现场景全貌或揭示画面外空间时(如沿废墟墙壁横移、沿河流平移展现水面倒影)。当单一视点无法容纳空间层次时使用,但优先考虑是否能以静止凝视 + 深景深替代。
        • 第四优先级 — 缓慢跟随(slow follow): 仅用于人物行走、穿越空间的段落(如穿越长廊、走过泥泞小路)。跟随距离保持恒定,不忽近忽远;人物停步时摄影机同步静止,不继续滑行。
        • 第五优先级 — 极缓慢垂直升降(very slow tilt up/down): 使用频率最低,仅用于暗示精神性上升(tilt up,如从地面升至教堂穹顶、树冠)或下沉(tilt down,如从天空降至水面、泥泞地面)。每部短片使用不超过 2 次,避免滥用削弱仪式感。
      • 构图手法(每个镜头至少运用一种):深景深(前景/中景/远景同时清晰,形成层次);前景遮挡(植物、破墙、家具半遮画面,制造窥视感与空间纵深);框中框(门框、窗框、拱廊将主体置于画中画结构);边缘构图(人物置于画面边角,空间占据主导,暗示人在宇宙中的渺小);水平线构图(强调大地广袤与沉重);垂直线构图(高耸教堂、树木,暗示精神性上升);对称构图(制造仪式感与肃穆)与不对称构图(制造不安与失衡)交替使用。
    • 叙事动态(story beats): 人物动作应描述为缓慢的、仪式化的(行走、转身、抬手、凝视);列出当前镜头中标志性自然元素的状态(雨水滴落、雾气流动、烛焰摇曳、风吹草浪);如有台词,写出精确台词文本,并附台词表演指示——标注情绪状态(低语 / 颤抖 / 疲惫 / 肃穆 / 呢喃)、发声方式(气声 / 压低嗓音 / 沙哑 / 气息不稳)、关键停顿(用"——"标注长停顿)与呼吸位置(用"(呼吸)"标注换气点),以及台词背后的潜台词情绪(角色此刻真实感受与表面言辞之间的落差),使台词成为带有呼吸感与情绪层次的声音表演,而非干涩的文字朗读。台词的停顿间隔、换气频率与句末尾音处理须遵循"呼吸节律模板"标准(见跨镜头音频层)。允许在镜头中安排"无事件时间"——人物静立、自然元素独自流动的空镜段落,这是时间质感的核心载体。
    • 塔可夫斯基标志性视觉锚点: 每个镜头必须包含至少一种——水(雨水、积水、倒影、溪流)、雾(晨雾、蒸汽、浓雾)、火(蜡烛、壁炉、燃烧的废墟)、自然(白桦林、风中草地、泥泞土路)、废墟(斑驳墙壁、破损教堂、锈迹物件)、镜像(镜面、水面倒影)之一。
  • 开场序列设计(全片第一个镜头): 开场镜头须为全片定调——以极缓慢的长镜凝视(13–30 秒)建立全片的时间质感与精神氛围。开场优先选择以下方式之一:① 自然元素空镜定调——凝视水面、雾中旷野、风中草地等自然元素独自流动,无人物,让空间先于叙事建立存在感(参照《镜子》开篇的田野);② 静物 / 空间凝视——凝视室内静物(旧物、烛火、窗外光线),建立物理现实质感后再引入人物;③ 人物背影 / 侧影——人物背对镜头或处于画面边缘,空间主导,暗示人物在宇宙中的位置而非揭示身份。开场镜头的色彩模式须与叙事结构模板匹配(三段式梦境以黑白开篇、意象并置以低饱和彩色开篇)。开场镜头不得包含台词或旁白——让纯视觉建立最初的沉浸。

  • 结尾序列设计(全片最后一个镜头): 结尾镜头须以悬置意象收束而非闭合解决——塔可夫斯基式结尾留下开放性余韵,不提供叙事答案。结尾优先选择以下方式之一:① 自然元素余韵——火光渐熄、雾气散去后的空寂、水面归于平静,以自然元素的"静止"暗示精神状态而非交代结局;② 空间空镜——人物已离开画面,空间中仅留痕迹(熄灭的蜡烛、空椅、关闭的门),以"缺席"暗示精神位移;③ 悬置凝视——人物凝视画面外某处(或直视镜头),表情不给出明确情绪结论,定格于不确定状态。结尾镜头时长取最长档(13–30 秒),让悬置感在时间中延展。结尾色彩模式须与开场形成弧线呼应(如开场黑白→结尾棕褐色,形成"从现实走向精神"的色彩弧线)。结尾镜头不宜包含解释性旁白——若需旁白,以未尽之言收束(如半句未完成的话、一个悬置的意象),而非总结性陈述。

  • 间幕 / 标题文字设计: 间幕文字用于叙事段落之间的分隔或精神母题的文字性介入,非装饰性字幕。使用时机: 仅在叙事结构有明确段落切换时使用(三段式梦境的段落之间、回忆嵌套的层级转换处),全片不超过 2–3 次——间幕须稀少而有分量,不是每段都加。文本风格: 间幕文字应为诗性短语或象征性意象描述(如「火熄灭后的第三天」),而非叙事性章节标题(避免「第一章:童年的记忆」式直白标题);可引用阿尔谢尼·塔可夫斯基式诗句风格。呈现方式: 黑底白字,衬线字体或手写体,字号居中偏小,留白充足;入场用 2–3 秒淡入,停留 3–5 秒,出场用 2–3 秒淡出;间幕期间画面为纯黑底,仅文字与沉默——间幕本身就是一次"视觉呼吸"与叙事停顿。间幕须在分镜中作为独立"间幕镜头"标注(shot type 标注为 interstitial),在视频提示词中使用 【...】 标注银幕标题文字内容。

设计跨镜头音频层

  • 自然环境音(audio_layer,type: ambient): 全片底层铺设自然音效,但环境音不是恒定底噪——须随叙事层次变化,参与叙事表达。环境音叙事化设计(必须设计): 为每个叙事段落标注对应的环境音特征与情绪功能:① 现实段——具象、纪实感的环境音(雨声持续、远处钟声、脚步踏泥),锚定物理现实;② 梦境 / 回忆段——去具象、空灵化的环境音(水声残响、回声感、远处低鸣),制造精神空间的悬浮感;③ 意识流段——无序、断裂的环境音(风声骤起骤止、不规则碎裂声、突兀的寂静),反映精神状态的碎片化。段落切换时环境音做交叉淡化(如现实雨声渐弱→梦境水声渐起),过渡时长 2–3 秒。环境音须与画面中的标志性自然元素呼应——画面有水面倒影时以水声为主,画面有烛火时融入微弱火焰噼啪声。体现塔可夫斯基以"沉默本身为声音设计"的理念,环境音应低混、不抢占画面,但须有层次变化而非全片一种声音。

    • 环境音与画面元素联动配方(必须设计): 为每类标志性自然元素指定对应环境音配方,当镜头包含某类元素时环境音层须自动叠加对应配方——① 水元素:持续低混水声基底(溪流 / 积水),叠加间歇性水滴声(单一、清脆、间隔不规则),有水面倒影时加入轻微水波声;梦境段落水声转为残响回声。② 雾元素:极低频持续嗡鸣(近乎无声的空气振动),叠加远处若有若无的风声,雾气浓重时加入微弱湿冷气息声;梦境段落可加入失真远处呢喃。③ 火元素:烛火 / 壁炉噼啪声(不规则间隔,极低音量),叠加微弱燃烧气流声,火焰摇曳时加入间歇性"呼"声。④ 废墟元素:封闭空间低频回声,叠加材料老化声(墙皮碎裂、木质嘎吱,极低频),风吹过缺口时加入低沉呜咽声;梦境段落回声加重。镜头同时含多种元素时按"主元素为主、辅元素为底"混合,在分镜中标注主辅关系。
  • BGM(audio_layer,type: bgm): 若需要音乐,选用古典音乐风格(弦乐、管风琴、古钢琴、极简重复音型),与画面形成对位关系而非同步渲染;避免情绪过度强调的现代配乐。BGM 情绪弧线(必须设计): 按全片叙事段落规划 BGM 情绪走向,与旁白情绪弧线形成对位而非同步——旁白沉寂时 BGM 可微升填补空间,旁白迸发时 BGM 反而收敛退让,两者此起彼伏。为每段 BGM 标注:① 段落情绪方向(如开篇低沉疏离→中段弦乐渐浓→转折处单音悬置→收尾归于寂静);② 配器倾向(弦乐 / 管风琴 / 古钢琴 / 极简音型 / 无);③ 力度走向(渐强 / 渐弱 / 恒定 / 骤停 / 消隐);④ 与旁白的对位关系(同步 / 对位 / 错位 / 互让)。示例走向:开篇——极简低频持续音,近乎环境音,疏离空旷;中段——弦乐渐浓,和声层次缓慢叠加但不推向高潮;转折——短暂沉默或单音悬置,制造精神断裂感;收尾——归于寂静,仅留极弱持续音或完全消隐。

    • BGM 与旁白逐段对位规则(必须设计): 对位不是笼统的"此起彼伏",须为每个叙事段落指定 BGM 与旁白的具体交互方式。以下为标准对位模式库,每段须从中选取或组合并标注:① 互让-填充型——旁白停顿时 BGM 弦乐 / 持续音渐入填补空间,旁白重新开口时 BGM 收敛至极低或退至单音;适用于段间过渡、空镜凝视。② 互让-退让型——旁白情绪迸发时 BGM 收至单音悬置或暂停,将声场让给人声,旁白收敛后 BGM 缓缓恢复;适用于情绪高潮。③ 同频-低伏型——旁白极低音量呢喃时 BGM 同样保持极低频持续音,两者共处低能量区,制造压抑静默张力;适用于开篇疏离、收尾余韵。④ 错位-反衬型——旁白情绪沉重时 BGM 以清冷高音反衬,或旁白平静时 BGM 以低沉弦乐暗示暗流,两者情绪方向相反制造精神张力;适用于梦境与现实边界。⑤ 渐变-交接型——旁白音量渐升时 BGM 逐层抽离配器(弦乐→单音→消隐),完成声场主导权交接;适用于从 BGM 主导段进入旁白主导段。每段须标注:当前对位模式、BGM 与旁白各自的能量方向(渐升 / 渐降 / 恒定 / 骤变)、交接触发点(以旁白某停顿或句末为信号触发 BGM 变化)。
  • 旁白 VO(audio_layer,type: narration): 若有旁白,文本须遵循以下内容创作指导——

    • 语言风格: 诗性散文诗语言,而非叙事性解说或情节复述。句子以意象和感受为单位而非信息为单位,允许语法不完整、意象跳跃、逻辑留白。参照塔可夫斯基电影中旁白的哲学性与诗意质地(如《镜子》中阿尔谢尼·塔可夫斯基的诗句),语言应沉重而透明,像在水底说话。
    • 内容方向: 围绕全片精神母题(信仰与怀疑、记忆与时间、梦境与现实等)展开,以间接、隐喻方式触及母题而非直白论述。旁白不是解释画面,而是与画面形成对位或延伸——画面展示的与旁白诉说的是同一精神的不同切面。
    • 禁忌: 禁止叙事性解说(如「他走进了房间」)、禁止情绪直述(如「我感到非常悲伤」)、禁止信息交代(如「这是 1962 年的冬天」)。情绪与信息须通过意象隐喻传达(如「雪落在所有熄灭的窗上」代替「冬天来了,一切都沉寂了」)。
    • 范例(风格参考,非直接套用): 「——水从指缝间流走的时候,(呼吸)· 你以为自己握住了什么。——其实只是时间· 借你的手经过。↘」 / 「火光在墙上· 投下一个不属于这里的影子——(呼吸)那是谁的脸,还是· 只是记忆在燃烧。↘」
      在 description 中定义 narration_speaker_profile(如:[低沉、温暖的男声,中年,语速极缓,嗓音带有微弱沙砾感与沧桑质地,呼吸深沉而有节律])。旁白情绪弧线(必须设计): 旁白不是匀速朗读,须按全片叙事结构设计情绪弧线——为每段旁白标注情绪方向与强度(如:① 开篇疏离空旷,近乎独白呢喃;② 中段情绪渐浓,声音有了重量与微颤;③ 高潮处压抑中短暂迸发后立刻收敛;④ 收尾归于沉寂,余韵未尽)。旁白节奏标注: 在旁白脚本中用"——"标注长停顿(2 秒以上)、"·"标注短停顿(约 1 秒)、"(呼吸)"标注换气点,使生成时自然呈现呼吸节律与沉默间隔。旁白与画面对位: 旁白停顿位置应与画面中的"无事件时间"(空镜凝视、自然元素流动)对齐——让声音的沉默与画面的沉默共振,而非用声音填满每一秒。
  • 呼吸节律模板(塔可夫斯基风格声音标准,适用于旁白 VO 与角色台词): 为确保声音呈现呼吸感与时间质感而非机械朗读,所有旁白与台词须遵循以下节律标准:

    • 句间沉默间隔: 每句结束后须保留至少 2–3 秒沉默,让话语的重量在静默中沉淀;段落间须保留 4–6 秒以上无声音间隔,让叙事呼吸。
    • 换气频率: 每句之内换气不超过 1–2 次,换气深沉而缓慢;换气点用"(呼吸)"标注,置于自然语义停顿处而非任意位置。
    • 句末尾音下沉: 句末最后一个字须自然下沉收束(尾音下沉),禁止上扬(避免疑问感或轻浮感),在脚本中用"↘"标注关键句末下沉。
    • 语速基准: 每分钟约 80–100 字(极缓);情绪凝聚段可降至 60–80 字/分钟,情绪释放段微升至 100–120 字/分钟后即刻收敛——避免全片匀速。
    • 停顿标注体系(统一使用): "——" = 长停顿(2 秒以上);"·" = 短停顿(约 1 秒);"(呼吸)" = 换气点;"↘" = 句末尾音下沉。旁白与台词脚本中须以上述符号标注节奏,使生成时自然呈现呼吸节律。
    • 此模板为旁白 VO(audio_layer narration)与角色台词(shot 内 dialogue)的共同节律标准;旁白须同时遵循"旁白情绪弧线"与"旁白与画面对位"规则,台词须同时遵循"台词表演指示"与"逐镜头情绪方向"规则。
    • 角色类型差异化呼吸模板(按角色类型选用): 上述呼吸节律模板为基础标准,不同角色类型须在此基础上差异化调整,使不同角色声音节奏各有特征:
      • 沉思者(成年主角,内省型): 基础模板。语速 80–100 字/分钟;换气深沉缓慢,每句 1 次,换气后短暂屏息再开口;句末尾音缓慢下沉;停顿间隔偏长(句间 3 秒,段落间 5–6 秒),沉默是声音的一部分。
      • 孩童(天真 / 纯粹型): 语速略快 100–120 字/分钟;换气浅而急,每句 1–2 次,无明显屏息;句末尾音自然下沉偶有上扬(保留稚气);停顿间隔较短(句间 1.5–2 秒),不刻意沉默;声音轻而薄,气息感明显。
      • 老者(沧桑 / 疲惫型): 语速极缓 60–80 字/分钟;换气沉重带叹息感,换气声可闻,每句 1–2 次;句末尾音极度下沉近乎消逝;停顿间隔最长(句间 3–4 秒,段落间 6–8 秒),字句间可有轻微颤动,声音有磨损质感。
      • 虔诚者(宗教 / 仪式型): 语速缓慢均匀 70–90 字/分钟;换气深沉有节律,似祈祷呼吸;句末尾音庄重下沉不颤不晃;停顿间隔稳定(句间 2.5–3 秒),具仪式般规律性;声音低沉肃穆,气息绵长。
    • 在 element character 设计中须为每个有台词角色标注角色类型并引用对应模板;逐镜头情绪方向在此基础上叠加当次情绪变化。
4. 미디어 생성

模型锁定(最高优先级): 全程仅使用 GPT Image 2 生成所有图像(TextToImage / ImageToImage),仅使用 Seedance 2.5(分辨率 480p) 生成所有视频(MultiModalToVideo);禁止切换至其他图像或视频模型。若指定模型生成失败,停止当前任务并向用户报告,由用户决定下一步——不得自行以其他模型替代。

Key element 图像生成

  • 使用 TextToImageImageToImage,模型固定为 GPT Image 2,分辨率 2K
  • Element 参考图画幅独立于视频画幅(防继承): 人物三视图参考图固定使用 16:9 横向画幅(三个全身视图横向并排);场景四宫格参考图固定使用 4:3 画幅(2×2 网格排列)。两类参考图均不得继承 Final_Video_Spec.md 中的视频画幅——element 参考图是身份与空间信息载体,不是视频帧。
  • 每个 element character 生成一张全身三视图参考图,三视图内容固定分配:① 正面全身——面部身份、肤色、眼神、发际线、服装正面款式与材质、整体轮廓;② 侧面全身——侧脸轮廓、体型纵深、服装侧面细节;③ 背面全身——发型背面、服装背面、整体背影轮廓。画面风格指令需包含低饱和大地色调、自然光或烛光照明、胶片质感。
  • 每个 element scene 生成一张多角度无人物四宫格场景参考图,四格内容固定分配:① 全景定场——展现空间整体布局与环境关系,无人物;② 陈设特写——关键道具、家具、建筑细节的材质与磨损状态;③ 纵深透视——体现空间深度、前景中景远景层次关系;④ 气氛光效——该场景代表性光线状态与空气感(如雾气弥漫、侧光投影、烛火微光、潮湿反光)。画面中不得出现人物。 提示词中须明确标注每格内容,防止后续视频生成时误将四宫格当作视频分镜输出四宫格视频。
  • Element 参考素材以用户优先,按风格匹配与格式要求分路径处理:
    • 风格相符且格式符合: 用户提供的参考图风格已与塔可夫斯基美学一致(人物参考图同时须为全身三视图格式,场景参考图同时须为多角度无人物四宫格格式),直接注册 asset_id 并绑定到对应 key_element,不重新生成。
    • 风格不符: 参考图风格与影片不符(如色彩鲜艳、光线人工、质感偏离胶片油画基调),以用户图像为 reference_image,使用 ImageToImage(模型 GPT Image 2,分辨率 2K)重新生成符合塔可夫斯基风格的 element 参考图——再生成时须保留用户图像中的人物身份/场景物理结构特征,仅覆盖视觉风格层(色彩、光线、质感、构图氛围);若该资产同时存在格式不符(人物非全身三视图 / 场景非四宫格),再生成时须同时完成格式转换。生成后注册 asset_id 并绑定。
    • 人物参考图格式不符(人物专属): 用户提供了人物参考图但不是全身三视图格式(如单张肖像、半身照、非标准角度参考图),以用户图像为 reference_image,使用 ImageToImage(模型 GPT Image 2,分辨率 2K)重新制作为标准全身三视图人物参考图——保留用户图像中的人物身份与物理特征(面部、体型、服装款式等),按三视图固定分配(正面全身 / 侧面全身 / 背面全身)重新组织。生成后注册 asset_id 并绑定。若风格与格式均不符,再生成时须同时完成格式转换与风格覆盖。
    • 场景参考图格式不符(场景专属): 用户提供了场景参考图但不是多角度无人物四宫格格式,以用户图像为 reference_image,使用 ImageToImage(模型 GPT Image 2,分辨率 2K)重新制作为标准四宫格场景参考图——保留用户图像中的场景物理特征(建筑结构、空间布局、材质、光线),按四格固定分配(全景定场 / 陈设特写 / 纵深透视 / 气氛光效)重新组织,画面无人物。生成后注册 asset_id 并绑定。
    • 用户未提供:media_generator 使用 TextToImage 从零生成。
  • 生成前提示词校验(element 图像必须执行): 在提交 element 图像生成之前,必须将该图像提示词与 Storyboard 对应 key element 描述逐项比对,确认以下内容无遗漏:
    • 人物 element: 面部身份特征(轮廓、肤色、眼睛与发际线、发型)、服装款式与材质、体型轮廓是否与 key element 描述一致;若角色有多状态变体(年轻 / 年老、干燥 / 湿透等),当前生成的变体是否正确;若用户提供了参考图(经 resource_prepare_and_analyze 分析),身份与物理特征是否与分析结果一致。
    • 场景 element: 建筑结构、材质、衰败程度、光线来源与色温、空气感(潮湿 / 雾气 / 尘埃)、关键道具与环境物件是否与 key element 描述一致;四宫格格式校验——是否为多角度无人物四宫格,四格内容是否分别对应全景定场 / 陈设特写 / 纵深透视 / 气氛光效,画面中是否无人物。
    • 道具 element: 材质、磨损状态、光线在其表面的呈现方式是否与 key element 描述一致。
    • 视觉风格: 提示词是否已包含塔可夫斯基风格指令(低饱和大地色调 / 棕褐色、自然光或烛光、胶片颗粒质感、油画质感)——若用户参考图风格不符,此处须确认风格指令已覆盖参考图原始风格。
    • 三视图布局(仅人物): 是否已指定 16:9 横向画幅,是否已包含正面全身 / 侧面全身 / 背面全身的三视图布局指令,每视图内容是否已明确标注。
    • 四宫格布局(仅场景): 是否已指定 4:3 画幅,是否已包含四格固定分配(全景定场 / 陈设特写 / 纵深透视 / 气氛光效)的布局指令,每格内容是否已明确标注,画面是否无人物。
    • 若发现任何遗漏,须补全提示词后再提交生成;校验失败处理流程遵照规划阶段的校验失败处理原则。

镜头视频生成

  • 使用 MultiModalToVideo,模型固定为 Seedance 2.5,分辨率 480p,时长在 4–30 秒之间(依分镜动态规划,不得低于 4 秒或超过 30 秒)。
  • 跨镜头视觉一致性策略(长视频核心):
    1. Element 图像(必须): 每个镜头以当前涉及的所有 element character 图像 + 对应 element scene 图像 + 相关 element prop 图像为视觉参考。这是跨镜头一致性的基础——角色外观、服装、场景空间、道具状态均通过 element 图像锚定,无论镜头是否相邻。
    2. 场景参考图强制绑定(防跳画核心): 生成任何镜头视频之前,必须确认该镜头引用的 scene element 已绑定四宫格场景参考图资产,并将该场景参考图作为视觉参考传入生成请求。若发现该镜头的 scene element 未绑定场景参考图,须先通过 media_generator 补齐绑定再生成——禁止在缺少场景参考图的情况下生成视频,否则模型失去场景空间锚点,生成的画面场景会跳变、与相邻镜头不一致。同一 element scene 下的多个镜头始终引用相同的场景参考图,确保空间布局、光线条件与色彩基调在场景内统一。
      四宫格统一性说明(防环境漂移): 四宫格场景参考图中的四个画面是同一场景的不同角度与细节展示(全景定场 / 陈设特写 / 纵深透视 / 气氛光效),不是四个独立场景。传入视频生成时,须在提示词中明确声明该参考图展示的是同一个场景,视频中的空间环境须与该统一场景一致——不得将四宫格中的不同格子解读为不同场景,导致不同镜头中人物出现在视觉上不连贯的空间内。提示词中须同时包含一段对该场景物理特征(建筑结构、空间布局、材质、光线来源、空气感)的文字描述,作为模型理解该场景的统一文字锚点,而非仅依赖四宫格图像自行解读。
    3. 上一镜头末帧(可选)——使用判断标准:
      • 提取末帧的条件(须全部满足): ① 当前镜头与上一镜头属于同一 element scene;② 两者之间无极强动作连续性(若有,应改用 reference_video 路径);③ 当前镜头的起始构图与上一镜头结束画面存在空间或视觉延续需求;④ 当前镜头的景别与运镜方式与末帧兼容——引用末帧不会限制新镜头的构图自由度。
      • 跳过末帧的条件(满足任一即跳过): ① 不同场景——element scene 图像已足以锚定空间,无需末帧;② 极强动作连续性——改用 reference_video;③ 上一镜头以淡出 / 溶解收尾,末帧已模糊或不可用作参考;④ 当前镜头视角或景别与上一镜头差异显著(如远景→特写),引用末帧反而造成视觉冲突;⑤ 当前镜头为梦境 / 回忆段落开篇,与上一镜头有意做风格断裂。
    4. 连续性视频参考(可选): 仅当当前镜头与上一镜头存在极强连续性(同一空间连续动作、人物位置严格衔接)时,才将上一镜头视频加入作为 reference_video;通常不使用,避免动态风格被上一镜头过度锁定。
    5. 按叙事顺序生成: 镜头视频按 Storyboard 中的叙事顺序逐个生成,使每个镜头均可利用前一镜头的产出作为连续性参考。
  • 生成前提示词校验(逐镜头必须执行): 在提交 MultiModalToVideo 生成每个镜头视频之前,必须将该镜头的视频提示词与 Storyboard 对应 shot 描述逐项比对,确认以下内容无遗漏:
    • 场景参考: shot 引用的所有 element scene ID 是否已在提示词中体现,场景的空间特征、光线状态、空气感是否完整写入。四宫格统一性校验: 提示词是否已明确声明四宫格参考图展示的是同一个场景(非四个不同场景),是否已包含该场景物理特征的文字描述锚点。场景参考图绑定校验(防跳画): 该 shot 引用的 scene element 是否已绑定四宫格场景参考图资产,该参考图是否已作为视觉参考传入生成请求——若未绑定或未传入,须先补齐绑定再生成,禁止在场景参考图缺失的情况下提交视频生成。
    • 人物参考: shot 中出现的所有 element character 是否均已绑定参考图占位符(<<<image_1>>> 等),人物动作、表情、状态描述是否与分镜一致。
    • 道具参考: shot 涉及的 element prop 是否已在提示词中提及并绑定参考图。
    • 台词 / 对白: shot 中定义的精确台词是否已完整写入 Seedance 2.5 台词标注({...}),无遗漏、无改写;台词表演指示(情绪状态、发声方式、停顿与呼吸标注)是否已随台词写入。
    • 色彩模式: shot 标注的 color_mode(彩色 / 黑白 / 棕褐色)是否已在提示词色彩指令中正确体现。
    • 运镜与构图: shot 指定的景别、摄影机运动方式、构图手法是否已写入提示词。
    • 自然元素锚点: shot 安排的标志性自然元素(水 / 雾 / 火 / 废墟等)状态是否已包含。
    • 象征意象与递进阶段: shot 安排的标志性象征意象(水 / 火 / 雾 / 废墟 / 镜等)是否已写入提示词,且意象当前所处的递进阶段是否已通过具体视觉描述体现(如"干涸河床露出龟裂泥土"而非笼统的"水元素");多意象组合镜头是否已标注组合象征含义并转化为具体画面描述。
    • 角色弧线节点: shot 中涉及的角色是否已标注其当前精神状态节点,人物的表情、动作幅度、与空间的关系描述是否与该节点一致。
    • 场景过渡方式: 若该镜头存在 scene_break,过渡方式是否已转化为具体的画面变化描述(如"雾气从画面边缘渗入逐渐吞没空间"),而非仅标注过渡类型名称。
    • 若发现任何遗漏,须补全提示词后再提交生成;禁止带着不完整的提示词直接执行生成。
  • 生成后忠实度复检(逐镜头必须执行): 每个镜头视频生成完成后,必须将生成结果与 Storyboard 对应 shot 描述逐项比对,核对分镜设计的核心内容是否在视频中实际呈现——① 场景空间与光线状态是否与场景参考图及描述一致;② 人物动作与表演是否与 story beats 一致(动作类型、幅度、情绪状态);③ 标志性自然元素是否出现且状态正确;④ 色彩模式是否正确(彩色 / 黑白 / 棕褐色);⑤ 运镜方式与构图手法是否与分镜指定一致;⑥ 象征意象是否出现且处于正确递进阶段;⑦ 台词(如有)是否在视频中呈现且情绪方向正确。偏差处理: 若发现关键内容缺失或偏差,须以强化提示词重新生成——将缺失内容置于提示词更前置、更突出的位置,加强措辞权重(如将"缓慢推轨"强化为"摄影机全程极缓慢地向主体推进,画面持续收紧"),减少非关键描述的干扰使核心设计不被淹没。最多重试 2 次;2 次后仍无法忠实呈现,须向用户报告偏差内容并由用户决定是否接受当前结果或调整分镜设计。

角色音色一致性与情绪表现力(key_element_audio):

  • 在 element 阶段,为每个有台词的 element character 建立 key_element_audio 绑定:若用户提供了角色语音参考样本(reference_audio),直接注册 asset_id 并绑定;若用户未提供,由系统生成——使用 text to narration,模型指定 MiniMax Speech 2.8 HD(多语言首选;若影片输出语言为英语,可使用 ElevenLabs v3),生成一段 5–10 秒的角色语音样本,注册 asset_id 并绑定。
    • 语调描述规范(voice profile 多维度): 生成指令中须包含该角色的完整 voice profile,涵盖以下维度——性别、年龄感、音色质感(沙哑 / 清亮 / 低沉 / 沙砾感 / 气息感)、音量倾向(轻声 / 中等 / 压抑)、语速(塔可夫斯基风格角色默认极缓)、呼吸特征(深沉缓慢 / 浅而急促 / 带叹息感)、情绪基调(沉思 / 忧郁 / 肃穆 / 疲惫 / 虔诚)、情绪表现范围(标注该角色声音在不同情绪下的变化方式,如"悲伤时声音收紧、尾音下沉;释然时气息变深、语速微升;压抑时近乎气声、字句间长停顿")。示例:[低沉沙哑的男声,中年,轻声说话,语速极缓,呼吸深沉带叹息感,情绪基调为疲惫与沉思;悲伤时声音收紧尾音下沉,平静时气息绵长近乎呢喃,压抑时转为气声]。
    • 角色类型呼吸模板对应: voice profile 须与该角色在分镜中标注的角色类型及对应的角色类型差异化呼吸模板一致——语速、换气频率、停顿间隔、句末尾音处理须遵循该角色类型的呼吸模板标准,逐镜头情绪方向在此基础上叠加变化。
    • 样本内容: 使用一句能体现角色声音特质与性格的独立短句,避免与正片台词重复;样本须包含至少一次明显的情绪转换(如从平静到微微颤动、从低语到一声叹息),充分展示角色的音色范围、语调节奏与呼吸特征,使后续镜头复用时模型能理解该角色声音的情绪可变性,供后续镜头复用。
  • 逐镜头情绪方向(声音表演指导): key_element_audio 锚定的是角色的基础音色一致性;但同一角色在不同镜头中的情绪状态不同,声音表演须随之变化。在每个需要角色台词的镜头中,将该角色的 key_element_audio 传入 audio_infos 的同时,须在该镜头台词旁附当次情绪方向——标注角色此刻的具体情绪状态与 delivery 方式(如"压抑着恐惧的低语""疲惫到近乎空洞的呢喃""突然释然的轻叹""强忍颤抖的肃穆"),使同一角色在不同叙事节点呈现不同的声音情绪层次,而非全片一种语气。情绪方向须与该镜头 story beats 中的人物动作与情境一致。
  • 若影片中有旁白 VO,旁白音色独立于角色 key_element_audio,由 audio_layer 的 narration_speaker_profile 定义,不与角色语音混淆。

音频生成

  • BGM:使用 text_to_instrumental,模型推荐 Suno 5Mureka 8,风格描述以古典弦乐、低沉管风琴、极简重复音型为主。生成指令中须包含分镜中设计的 BGM 情绪弧线——各段落的情绪方向、配器倾向、力度走向(渐强 / 渐弱 / 恒定 / 骤停 / 消隐)及 BGM 与旁白逐段对位规则(对位模式、双方能量方向、交接触发点),使 BGM 与旁白的交互关系精确可执行而非笼统的"此起彼伏"。若全片 BGM 分为多段,各段须分别生成并标注其在时间轴上的起止位置与过渡方式(渐变 / 骤停 / 消隐),确保段落间衔接自然而非突兀拼接。Suno 5 须注意合规提示——提示词中不得包含知名音乐艺术家姓名。
  • 自然环境音:使用 text_to_instrumental(模型 Suno 5Mureka 8),以环境音景 / 氛围声描述替代旋律性音乐描述(如"持续低混雨声,远处偶发钟声,无旋律"),生成分镜中设计的叙事化环境音层。须按叙事段落分别生成对应环境音(现实段具象音景 / 梦境段空灵残响 / 意识流段断裂风声),各段标注起止位置与交叉淡化过渡时长。生成时须同时参照分镜中设计的环境音与画面元素联动配方——根据每个镜头包含的标志性自然元素(水 / 雾 / 火 / 废墟)叠加对应环境音配方,使环境音与画面视觉锚点自动匹配。镜头内的即时音效(如水滴声、脚步声、火焰噼啪声)可通过 Seedance 2.5(分辨率 480p) 视频生成的 <...> 音效标注嵌入,不单独生成。
  • 旁白 VO:使用 text to narration,模型推荐 MiniMax Speech 2.8 HD(英语影片可用 ElevenLabs v3),依分镜中定义的 narration_speaker_profile 生成。生成指令中须包含分镜中设计的旁白情绪弧线(各段落情绪方向与强度)、呼吸节律模板标准(句间沉默 2–3 秒、段落间 4–6 秒、换气每句 1–2 次、句末尾音下沉、语速基准 80–100 字/分钟)与节奏标注(长停顿"——"、短停顿"·"、换气"(呼吸)"、尾音下沉"↘"),使旁白呈现呼吸节律与情绪起伏而非匀速机械朗读;语速整体极缓但各段落间须有微妙节奏变化——情绪凝聚段降至 60–80 字/分钟、情绪释放段微升至 100–120 字/分钟后即刻收敛,避免全片一个速度导致的"假"感。

音频层生成前校验(必须执行)

  • 旁白 VO 校验: 提交生成之前,将旁白生成描述与 Storyboard 对应 audio_layer 逐项比对——narration_speaker_profile(性别、年龄感、音色质感、语速、情绪基调、呼吸特征)是否与分镜定义一致;旁白情绪弧线是否已按段落标注情绪方向与强度;呼吸节律模板是否已应用——句间沉默间隔(2–3 秒)、段落间间隔(4–6 秒)、换气频率(每句 1–2 次)、句末尾音下沉标注("↘")、语速基准(80–100 字/分钟,凝聚段 60–80、释放段 100–120)是否已写入生成指令;旁白节奏标注(长停顿"——"、短停顿"·"、换气"(呼吸)"、尾音下沉"↘")是否已写入脚本;旁白文本是否与分镜中的精确脚本一致,无遗漏无改写;段落分布与 layout_instruction 是否与分镜规划匹配;旁白停顿位置是否与画面"无事件时间"对齐。
  • BGM 校验: 提交生成之前,核对 BGM 风格描述是否与分镜中 audio_layer 的音乐风格要求一致——古典弦乐 / 管风琴 / 极简重复音型;是否避免了情绪过度强调的现代配乐;BGM 情绪弧线是否已按段落标注情绪方向、配器倾向、力度走向及与旁白的对位关系;BGM 与旁白逐段对位规则是否已为每段指定具体对位模式(填充型 / 退让型 / 低伏型 / 反衬型 / 交接型)、双方能量方向与交接触发点;若有多个音乐段落,各段过渡方式(渐变 / 骤停 / 消隐)是否已标注。
  • 自然环境音校验: 提交生成之前,核对环境音是否已按叙事段落分别设计——现实段具象音景 / 梦境段空灵残响 / 意识流段断裂风声的特征是否与分镜中环境音叙事化设计一致;段落切换处的交叉淡化过渡时长(2–3 秒)是否已标注;环境音与画面标志性自然元素的呼应关系是否已体现;环境音与画面元素联动配方是否已按镜头包含的自然元素(水 / 雾 / 火 / 废墟)叠加对应配方,多元素镜头是否已标注主辅关系。
  • 角色台词音色与情绪校验: 提交生成之前,核对每个有台词的镜头是否已将对应角色的 key_element_audio 传入 audio_infos,音色绑定无遗漏、无错绑;同时核对该镜头是否已附逐镜头情绪方向(角色此刻的情绪状态与 delivery 方式),且与 story beats 中的人物情境一致;台词的停顿标注("——"/"·")、换气标注("(呼吸)")、句末尾音下沉标注("↘")是否符合呼吸节律模板标准;是否已按该角色的角色类型差异化呼吸模板(沉思者 / 孩童 / 老者 / 虔诚者)调整语速、换气频率与停顿间隔。
  • 若发现任何遗漏,须补全后再提交生成;校验失败处理流程遵照规划阶段的校验失败处理原则。
5. 프롬프트 작성

全局最高优先级: 若用户以中文交互或界面语言为中文,所有提示词正文以中文书写;台词、VO 文本语言遵照 Final_Video_Spec.md 中设定的输出语言。

提示词完整性自检(视频镜头必须执行): 每条镜头视频提示词写完后,须回到 Storyboard 对应 shot 描述逐项对照,确认以下内容均已完整写入——场景引用与光线状态(含四宫格统一性声明与场景物理特征文字锚点)、所有出场人物的动作与参考图占位符、相关道具、精确台词文本({...})及台词表演指示(情绪状态与发声方式、呼吸节律标注"——"/"·"/"(呼吸)"/"↘")、color_mode 色彩指令、景别与运镜方式、构图手法、标志性自然元素状态、象征意象及其递进阶段的具体视觉描述(如"干涸河床露出龟裂泥土"而非笼统的"水元素")、多意象组合镜头的组合象征含义是否已转化为具体画面描述、角色当前精神状态节点是否已通过人物表情与动作描述体现、场景过渡方式(若有 scene_break)是否已转化为具体画面变化描述。发现遗漏须补全后再提交,禁止带着不完整的提示词执行生成。

提示词完整性自检(element 图像必须执行): 每条 element 图像提示词写完后,须回到 Storyboard 对应 key element 描述逐项对照,确认以下内容均已完整写入——人物身份特征(面部、肤色、发型、服装款式与材质、体型)或场景物理特征(结构、材质、光线、空气感)或道具特征(材质、磨损状态);塔可夫斯基视觉风格指令(低饱和色调、自然光、胶片质感);若用户提供了参考图,身份与物理特征是否与 resource_prepare_and_analyze 分析结果一致;人物 element 额外校验——是否已指定 16:9 横向画幅,是否已包含全身三视图布局指令(正面全身 / 侧面全身 / 背面全身),每视图内容是否已明确标注;场景 element 额外校验——是否已指定 4:3 画幅,是否已包含四宫格布局指令(全景定场 / 陈设特写 / 纵深透视 / 气氛光效),每格内容是否已明确标注,画面是否无人物。发现遗漏须补全后再提交。

图像提示词(GPT Image 2 — TextToImage / ImageToImage)

  • 以导演视角用自然语言描述:主体 + 动态 + 空间环境,再附加简短短语描述色彩 / 光线 / 质感 / 构图。所有描述只写镜头可见之物,不写心理动机或画面外内容。
  • 塔可夫斯基视觉语法(融入一段流畅段落,不分标签小节):
    • 色彩:根据 shot 标注的 color_mode 切换——彩色模式明确指定低饱和度、去鲜艳化处理;大地色系(土黄、赭石、暗绿、灰褐)或棕褐色(sepia)调性;高光区乳黄 / 琥珀,阴影区深绿 / 墨蓝 / 冷灰;明暗法(chiaroscuro)参照文艺复兴油画。黑白模式指定高对比黑白胶片质感,暗部极深沉、亮部柔和发光,保留丰富灰阶层次,参照银盐粗粒胶片;侧光与逆光制造雕塑般的明暗分割。棕褐色模式用于回忆与梦境段落,整体偏暖褪色,带有时间侵蚀后的怀旧感。
    • 光线:自然光或模拟自然光——侧窗漫射光、穿透雾气的散射光、逆光剪影、烛火 / 壁炉微暖光;避免任何人工打光痕迹。黑白段落中可加大光比,强化侧光与逆光的雕塑感。
    • 质感:胶片颗粒感(film grain)、油画质感、真实材质(粗布、泥土、苔藓、锈蚀金属、潮湿石墙);黑白段落加重颗粒感以模拟粗粒银盐胶片。
    • 构图:深景深(前景 / 中景 / 远景同时清晰形成层次);前景遮挡(植物、门框、破墙半遮画面制造窥视感与纵深);框中框(门框 / 窗框 / 拱廊将主体置于画中画结构);边缘构图(人物置于画面边角,空间主导,暗示渺小);水平线构图强调大地广袤与沉重,垂直线构图(高耸教堂、树木)暗示精神性上升;对称构图制造仪式感,不对称构图制造不安——两者交替使用。
    • 标志性视觉锚点:在描述中自然嵌入至少一种——水面倒影、潮湿地面、雾气、烛焰、废墟、白桦林等。
  • 人物三视图参考图提示词(仅人物 element): 提示词须以全身三视图布局指令开头,明确指定画幅为 16:9 横向,明确标注每视图内容,防止后续视频生成误将三视图当作分镜输出三视图视频。固定三视图分配:① 正面全身——面部身份、肤色、眼神、发际线、服装正面款式与材质、整体轮廓;② 侧面全身——侧脸轮廓、体型纵深、服装侧面细节;③ 背面全身——发型背面、服装背面、整体背影轮廓。三视图共享同一人物设定但各自聚焦不同角度,画面为全身。每视图内容须与 Storyboard 中 element character 描述一致。
  • 场景四宫格参考图提示词(仅场景 element): 提示词须以四宫格布局指令开头,明确指定画幅为 4:3(2×2 网格),明确标注每格内容,防止后续视频生成误将四宫格当作分镜输出四宫格视频。固定四格分配:① 全景定场——描述空间整体布局、建筑结构与环境关系,无人物;② 陈设特写——描述关键道具、家具、建筑细节的材质与磨损状态;③ 纵深透视——描述空间深度层次、前景中景远景关系;④ 气氛光效——描述该场景代表性光线状态与空气感(雾气、侧光、烛火、潮湿反光等)。四格共享同一场景的空间设定但各自聚焦不同维度,画面全程无人物。每格内容须与 Storyboard 中 element scene 描述一致。

视频提示词(MultiModalToVideo — Seedance 2.5(分辨率 480p))

  • 忠实转译原则(最高优先级): 提示词须忠实转译 Storyboard 中对应 shot 的全部设计内容,不得概括、压缩或遗漏任何设计维度。分镜中每个设计元素——场景空间、人物动作与表演、台词、色彩模式、运镜方式、构图手法、标志性自然元素状态、象征意象及其递进阶段、角色精神状态——均须在提示词中有对应的、具体的、可执行的描述。禁止以笼统描述替代分镜中的具体设计: 如分镜写"缓慢推轨揭示空间纵深",提示词不得简化为"推轨镜头";分镜写"雨声持续、积水倒影中人物身影模糊",提示词不得简化为"雨天场景"。核心元素前置原则: 当提示词篇幅较长时,须确保最影响画面结果的核心元素在提示词中得到充分、前置的描述——场景空间与光线、人物动作与状态、运镜方式是决定画面骨架的三要素,须置于提示词前部并给予充分篇幅;自然元素与象征意象、色彩模式、构图手法紧随其后;台词与音效标注置于末尾。避免次要描述稀释核心设计的注意力权重,导致模型忽略关键设计。

  • 参考图绑定: 每个 element character 参考图使用占位符 <<<image_1>>>、<<<image_2>>> 等逐一标注,并在描述中说明各图所对应的角色或元素。人物参考图为三视图布局,绑定时标注其用途为"人物身份与外观参考";场景参考图为四宫格布局,绑定时标注其用途为"场景空间与氛围参考",并明确声明"该四宫格图展示的是同一个场景的不同角度与细节,不是四个不同场景";视频提示词须描述单一连续镜头的内容,不得复述三视图或四宫格的结构——三视图与四宫格仅作为信息参考,不是视频分镜指令。场景环境文字锚点(必须写入): 绑定四宫格场景参考图时,提示词中须补充一段对该场景物理特征(建筑结构、空间布局、材质、光线来源、空气感)的文字描述,使模型对该场景有统一的文字理解,而非仅依赖四宫格图像自行解读——不同镜头引用同一场景参考图时,这段文字描述须保持一致,确保人物始终活动在同一个空间环境中。

  • 运镜堆叠顺序: 摄影机运动主体动态空间与自然元素变化音效 / 台词提示

    • 摄影机运动:只使用——静止凝视(static shot, fixed gaze)、缓慢推轨(slow dolly in/out)、极慢横移(very slow tracking)、缓慢跟随(slow follow);禁止快速运动、手持晃动、急速变焦等指令。
    • 主体动态:强调缓慢、仪式化(如:缓缓转身、沉默地凝视远处、手指轻轻拂过墙面);指定身体部位与动作幅度;多个动作按时间顺序列出。
    • 自然元素变化:描述水的流动 / 滴落 / 涟漪、雾气的飘移、草叶 / 树枝在风中的微动、烛焰的轻微飘动——这些是画面的"呼吸",必须明确说明。
    • 禁止使用墙钟式时间分段(如"0–3s / 3–6s");按故事动态顺序描述。
  • Seedance 2.5(分辨率 480p) 音效标注(按需使用):**

    • 背景音乐:(...)
    • 音效(环境音):<...>(如 <雨声,持续,低混>、<远处钟声,缓慢>)
    • 台词:{...}(如 {zh: 我已经等了很久了});括号内只写精确台词文本。台词的情绪状态与表演方式须在该台词标注旁以简短指令注明(如"低语,疲惫,句末长停顿""气声,颤抖,压抑""喃喃自语,近乎叹息"),并使用呼吸节律模板标注符号——"——"长停顿、"·"短停顿、"(呼吸)"换气、"↘"句末尾音下沉——使视频生成时角色声音带有情绪质感与呼吸节奏,而非平板朗读。
    • 银幕标题:【...】
  • 固定否定指令: 若旁白 VO 走独立音频层,视频 prompt 中不重复完整 VO 文本;几乎所有镜头加 no music(BGM 在后期层叠);始终加 no subtitles(字幕由后期处理)。

6. 동영상 조립

节奏与剪辑基调

  • 整体剪辑节奏极慢、均匀、深沉,仿照塔可夫斯基"呼吸般的节奏"——镜头切换不追求信息密度,追求时间质感的完整流动。
  • 不压缩镜头时长:保留每个 shot 的原始时长,不随意修剪开头或结尾的"空镜时刻"——那是塔可夫斯基风格的核心价值所在。

镜头间过渡规则(按叙事关系分类)

  • 过渡方式遵循分镜标注: 每个场景切换处的过渡方式须遵循分镜中 scene_break 标注的过渡方式(引用叙事开发阶段预设的"场景间过渡逻辑"),如分镜标注"雾气弥漫过渡"则使用淡入淡出配合雾气效果,标注"水面倒影破灭过渡"则使用溶解配合色彩翻转——转场手法须服务于叙事意图而非仅按时长规则机械套用。以下时长规则为各过渡类型的具体参数。

  • 同场景连续镜头: 优先使用短溶解(dissolve,0.5–1 秒),保持空间与时间的自然延续;环境音层不随切换中断,保持连续流动。

  • 场景切换(同一叙事层内): 使用较长溶解(1–2 秒)或淡入淡出(fade,1–1.5 秒),给观众从一处空间"离开"再"抵达"另一处的过渡时间。

  • 现实→梦境 / 回忆: 使用较长淡入淡出(fade,2–3 秒),配合色彩模式切换(如黑白→棕褐色),让转换成为沉浸式的精神位移;过渡过程中环境音做交叉淡化——现实层音效渐弱、梦境层音效渐起。

  • 梦境 / 回忆→现实: 使用淡入淡出(fade,1.5–2.5 秒),节奏比"进入梦境"略快——"醒来"比"入梦"更突然是塔可夫斯基惯用手法;过渡处保留一丝梦境音效余韵(如水声残响),暗示精神印记未消。

  • 意识流段落内部: 使用快速溶解(0.3–0.5 秒)或跳接(jump cut),允许碎片化跳跃——意识流的逻辑是非线性、无因果的。

  • 意象并置结构(无因果衔接): 使用淡入淡出(fade,1–2 秒),让意象群之间有"呼吸"间隔。

  • 硬切(hard cut)使用条件: 仅限于——① 时间跳跃(白天→夜晚);② 意识流断裂(精神状态骤变);③ 需要制造冲击感的叙事节点。即使使用硬切,环境音层仍须保持连续,不可同步硬切。

  • 黑白↔彩色段落过渡: 当 color_mode 切换时,优先使用较长淡入淡出(fade,2–3 秒),让色彩转换成为一次"视觉呼吸";段落内部同色模式镜头间用溶解衔接。

音频层叠与同步(多层混音规则)

  • 混音优先级(从高到低): ① 旁白 VO(信息主体)> ② 角色台词(镜头内音频)> ③ BGM(情绪底色)> ④ 自然环境音(氛围基底)。
  • 音量比例参考(相对值):
    • 自然环境音:20–30%——全片氛围基底,始终存在但不抢占注意力。
    • BGM:40–50%;当旁白 VO 或角色台词出现时自动压低至 25–30%(ducking),让人声清晰可辨。
    • 角色台词:55–65%;与旁白不同时段出现时保持原音量。
    • 旁白 VO:60–70%;信息主体,须始终清晰可辨。
  • 淡入淡出时长约束:
    • 自然环境音:片首淡入 3–5 秒,片尾淡出 4–6 秒;镜头切换时不做淡变,保持连续流动感。
    • BGM:进入淡入 2–4 秒,退出淡出 3–5 秒;禁止突然开始或停止。
    • 旁白 VO:每段开始前 0.5–1 秒淡入(近乎无痕),结束后 1–2 秒淡出(留出沉默余韵);段落间保留至少 3–5 秒无旁白间隔。
    • 色彩模式切换处:环境音做 2–3 秒交叉淡化(如现实层雨声渐弱→梦境层水声渐起),配合画面色彩转换。
  • BGM 情绪弧线跟随: BGM 音量与配器层次须按分镜中设计的情绪弧线变化——开篇低沉疏离段音量偏低(30–35%)、配器极简;中段弦乐渐浓段音量微升(40–50%)、层次叠加;转折段可骤降至极低或短暂静默;收尾段渐弱消隐。BGM 情绪走向与旁白情绪弧线形成逐段对位——须按分镜中设计的 BGM 与旁白逐段对位规则执行(填充型 / 退让型 / 低伏型 / 反衬型 / 交接型),旁白沉默时 BGM 弦乐渐入填充,旁白高潮时 BGM 收至单音或暂停,旁白低语时 BGM 同频低伏,两者交互精确而非笼统此起彼伏。音量变化须与对位模式匹配——退让型段 BGM 降至 20–25%,填充型段 BGM 升至 40–50%,低伏型段 BGM 维持 25–30%。
  • 环境音叙事化过渡: 环境音须随叙事层次变化而非全片恒定——现实段以具象音景为主(雨声、钟声、脚步),梦境 / 回忆段过渡为空灵残响(水声回声、低鸣),意识流段转为断裂无序声(风声骤止、突兀寂静)。叙事段落切换时环境音做 2–3 秒交叉淡化,与画面色彩模式转换同步;同一叙事层内镜头切换时环境音不做淡变,保持连续流动感。
  • "沉默即声音设计"原则: 允许关键画面处所有音频层降至极低(环境音 <10%、BGM 暂停),仅留极微弱环境声或完全静默,制造"声音真空"与时间凝固感。
  • 旁白 VO 语速极慢,留有充分沉默间隔;VO 文字与画面不需严格同步,允许声音与画面"错位"产生诗意张力。

间幕 / 标题文字处理

  • 间幕镜头(shot type: interstitial)在时间轴中作为独立段落处理——前后各留 0.5–1 秒纯黑间隔,与前后镜头不做溶解衔接,以硬切或淡入淡出分隔,确保间幕的"停顿"质感。
  • 间幕期间所有音频层处理:BGM 降至极低或暂停(≤15%),环境音降至极低(≤10%),旁白 VO 暂停——间幕是全片最安静的叙事呼吸点,声音真空是其设计意图。
  • 间幕文字入场 2–3 秒淡入、停留 3–5 秒、出场 2–3 秒淡出,黑底持续时间总计 7–11 秒
  • 若间幕出现在色彩模式切换处(如黑白段→棕褐色段之间),间幕本身作为切换的"中性空间"——前后镜头的色彩转换在间幕的黑底中自然完成,无需额外过渡。

导出立场

  • 输出规格遵照 Final_Video_Spec.md:16:9 画幅,480p 分辨率。
  • 帧率: 目标 24fps(电影标准帧率,与胶片质感呼应)。若原始生成帧率不足,可通过 super_resolution(MediaKit)提升至 24fps;不建议提升至 30fps 或 60fps——过高帧率削弱胶片颗粒感与慢电影时间质感。
  • 分辨率提升(可选): 480p 为基础输出;若用户需更高画质,可通过 super_resolution(MediaKit)提升至 1080p 或 4K。480p 已足以呈现胶片颗粒与低饱和色调,非必要不提升。
  • 时间轴 JSON 规格须反映上述慢节奏剪辑逻辑、多层音频混音结构与逐叙事关系的过渡规则。