yeha.ai
一覧に戻る

Ceylan and Angelopoulos long take

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

适用于存在主义孤独叙事、历史创伤史诗、边境/流亡主题、诗意行走影像等一类慢电影创作场景。融合锡兰固定机位凝视与安哲罗普洛斯360度全景长镜头的慢电影工作流;GPT Image 2 生成画面+Seedance 2.5 生成镜头视频。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

全流程阶段逻辑与依赖关系:

  1. 创意开发与规格建立: 根据用户创作素材深度,分路径处理:
    • 路径 A — 用户仅有灵感或概念(编剧开发优先): 当用户尚未形成完整剧本或明确故事框架时,先引导用户完成叙事开发:
      • 确立慢电影气质定位: 与用户确认是偏向锡兰式内省(个体存在主义困境、疏离、沉默、室内/私密空间)还是安哲罗普洛斯式史诗(集体历史创伤、流亡、边境、宏大景观),或二者融合。锡兰式气质适合"地质学家的凝视"——固定机位,人物在荒原中如化石般被时间侵蚀;安哲罗普洛斯式气质适合"吟游诗人的巡礼"——移动镜头,人物在历史迷雾中无尽行走。
      • 选择核心天气意象: 天气是慢电影中最重要的"角色"。锡兰式天气:雪(苍凉、寒意、内心困境的视觉隐喻)、枯草平原(安纳托利亚腹地的视觉签名)、夜间的车灯(低照度美学)。安哲罗普洛斯式天气:雾(记忆的模糊、身份的迷茫、历史的不可见)、水(河流/海洋=时间的流动)、雪(死亡与遗忘的覆盖)。与用户确认全片主导天气意象。
      • 设计贯穿性天气意象体系(必须为每个被选中的天气意象预设递进方案与组合关系): 为全片选择 2–4 个反复出现的天气意象,为每个意象预设详细的象征含义库与递进变化方案,确保意象在多个镜头中递进出现而非仅一次使用。天气意象含义库与递进方案(预设参考,可按影片主题调整):
        • 雪(锡兰侧+安哲罗普洛斯侧共有): 锡兰式——苍凉的白、内心困境的视觉隐喻、人物在雪中如沧海一粟。安哲罗普洛斯式——死亡与遗忘的覆盖、大地用沉默为死者书写墓志铭。递进方案示例:零星飘雪(时间开始凝固)→ 积雪覆盖地面(现实被掩埋)→ 暴雪中人物独行(精神困境的极致)→ 雪停后的苍白寂静(余韵,一切被覆盖后留下的空无)。
        • 雾(安哲罗普洛斯侧核心): 记忆的模糊、身份的迷茫、历史的不可见、真相被掩盖。递进方案示例:晨雾微薄(现实的边界开始模糊)→ 浓雾弥漫(梦境/记忆侵入现实)→ 雾中隐约人影(历史的幽灵显现)→ 雾散后的空寂(存在之虚无,一切被看清后反而更空)。
        • 水(安哲罗普洛斯侧核心): 时间的流动、历史的无常、记忆的承载与冲刷。递进方案示例:雨滴/积水(时间在现实中留下痕迹)→ 河流流动(历史的不可阻挡)→ 水面倒影(记忆的镜像,过去与现在的重叠)→ 海洋/干涸河床(时间的终极形态——永恒或终结)。
        • 风(锡兰侧核心): 安纳托利亚的持续呼啸、希腊海岸的潮湿海风、时间的无形流动。递进方案示例:微风拂过枯草(时间在流动)→ 持续呼啸(环境的压迫感)→ 狂风骤起(命运的转折)→ 风停后的寂静(时间的凝固)。
        • 枯草(锡兰侧核心): 存在的荒芜、生命的坚守、安纳托利亚腹地的视觉签名。递进方案示例:枯黄草原无边无际(空间的广袤与人的渺小)→ 孤树矗立(孤独的坚守)→ 风吹草浪(时间的流动在枯草上显形)→ 雪覆盖枯草(生命被时间掩埋)。
          每个被选中的意象须从其递进方案中选取 2–4 个阶段分配到全片不同叙事段落,阶段顺序须与时间弧线同步推进,而非随机排列。
      • 天气意象间组合关系(多意象同镜须设计): 当一个镜头中同时出现两种或以上天气意象时,须为该组合预设组合含义。以下为预设组合含义库(可按影片主题扩展):
        • 雪 + 风: 苍凉中的动荡——雪是静止的覆盖,风是动态的侵蚀,两者同框暗示人物在困境中同时承受"被掩埋"与"被撕扯"。
        • 雾 + 水: 记忆的双重遮蔽——雾模糊了空间,水模糊了倒影,两者叠加暗示过去既不可见也看不清。
        • 雪 + 雾: 存在的终极消隐——白色覆盖一切,白色模糊一切,两者叠加暗示空间与时间同时失去坐标。
        • 风 + 枯草: 时间的显形——风是无形的,但枯草的摇曳让风变得可见,暗示时间在荒芜中留下痕迹。
        • 水 + 风: 历史的动荡——水面被风吹皱,倒影碎裂,暗示历史记忆在时间中被搅乱。
          组合意象须在叙事大纲中标注其出现的段落与组合含义,分镜设计阶段须将组合含义写入镜头的视觉锚点描述中。
      • 构建时间弧线(替代"情节弧线"): 慢电影不以情节驱动,而以"时间质感的递进"驱动。与用户共同设计——从何种时间质感出发(如:晨雾中的静止)、经历何种时间变形(如:黄昏时分的360度旋转、雪夜中的漫长等待)、落于何种时间余韵(如:雾散后的空寂、雪停后的苍白)。时间弧线须以"天气变化"为锚点——起雾→雾浓→雾散→空寂,或飘雪→暴雪→雪停→苍白。
      • 确定叙事结构(四种模板,按需选用,可混合):
        • 模板一 — 锡兰式地质学凝视(线性时间、渐变为核心): 全片以单一空间或有限空间展开,时间线性推进,天气逐步变化——从"天气尚可"到"天气恶化"到"天气极端"到"余韵中的静止"。人物在空间中的心理状态随天气变化逐步揭露而非突然爆发。适用于存在主义孤独叙事、室内疏离主题。片长建议: 3–5 分钟。
        • 模板二 — 安哲罗普洛斯式史诗巡礼(空间穿越、360°为标志): 全片以人物在多个空间中的持续行走为主线,每个空间对应一种天气状态与历史隐喻。2–3 个 360°全景慢摇作为段落收束的仪式性节点。行走的路径从"出发"到"穿越"到"抵达"到"继续前行",无终点。适用于流亡、边境、历史创伤主题。片长建议: 5–8 分钟。
        • 模板三 — 两极交替(锡兰静态↔安哲罗普洛斯移动): 全片在锡兰式固定机位与安哲罗普洛斯式移动镜头之间交替——静态段落用于内省独处、室内疏离、荒原凝视(人物静止、空间安静);移动段落用于行走、穿越、历史巡礼(人物行走、空间展开)。两次视觉模式切换对应叙事层次转换,收尾归于其中一极(选择锡兰静默收束或安哲罗普洛斯无尽行走收束)。片长建议: 5–8 分钟。
        • 模板四 — 天气即叙事(无人物或极少人物): 摒弃人物叙事,全片由天气意象的递进变化构成叙事——雪从飘落到覆盖到融化到露出土地;雾从弥漫到浓稠到散去到空寂。没有人物,天气本身就是主角。适用于纯诗意影像、环境冥想。片长建议: 3–5 分钟。
        • 选用原则: 短片时长 3 分钟以内建议模板一或模板四;3–5 分钟建议模板一或模板三;5 分钟以上建议模板二或模板三。若用户在 Final_Video_Spec.md 中已指定叙事结构倾向,以用户指定为准。片长与叙事结构适配: 须在创意开发阶段与用户确认片长,并根据片长推荐最适合的模板。
      • 设计场景与情绪映射: 为每个叙事段落匹配最能承载其时间质感的场景类型——① 锡兰式室内疏离段: 匹配室内私密空间(昏暗房间、单窗光源、老式公寓),强调低照度美感与人物距离感;② 锡兰式荒原凝视段: 匹配安纳托利亚荒原(枯草、孤树、无尽公路),强调远景中人物渺小与大地广袤;③ 安哲罗普洛斯式行走巡礼段: 匹配边境/废墟/海岸(铁丝网、铁轨、弹孔墙、沙滩),强调行走的空间穿越感与历史痕迹;④ 安哲罗普洛斯式雾中风景段: 匹配雾中自然空间(河流、海洋、废弃工厂),强调朦胧与不确定性。场景类型与叙事段落的映射须在叙事大纲中标注。
      • 场景间过渡逻辑(须为每对相邻叙事段落的场景切换预设过渡方式): 当叙事从一个段落进入下一个段落、场景类型发生切换时,须为每次场景切换预设过渡方式。以下为预设过渡方式库(按场景类型组合选用):① 室内→荒原: 以光线渐变为过渡——室内自然光逐渐暗淡,画面沉入暗部后浮现荒原远景,象征从封闭空间走向广袤。② 荒原→废墟: 以天气变化为过渡中介——荒原上雾气渐起或雪花渐密,画面溶解后浮现废墟场景,象征从自然荒原进入历史废墟。③ 废墟→室内: 以阴影扩散为过渡——废墟中阴影逐渐扩散填满画面,暗部中浮现室内场景,象征从历史废墟回归私人空间。④ 雾中风景→任意场景: 以雾散为过渡——浓雾逐渐散去,画面清晰后呈现目标场景,象征从迷茫中浮现。⑤ 同类型场景间(如荒原→荒原): 以自然元素延续为过渡——保留前一场景的天气声音(风声/雪声)跨入下一场景,画面用溶解衔接但声音连续。⑥ 行走段落→静止段落: 以人物停止行走为过渡——人物从行走中逐渐放慢、最终停下,摄影机同步静止,场景随之切换。过渡方式须在叙事大纲中标注,分镜设计阶段须将过渡方式写入镜头描述的 scene_break 标注中。
      • 设计人物与空间的关系: 锡兰式人物关系:通过物理距离体现心理距离——同一画面中两人各在房间一端沉默、远景中人物如沧海一粟。安哲罗普洛斯式人物关系:行走即存在——人物总是在路上,每一步都是对"失去"的丈量。若叙事涉及人物,须定义人物与空间的关系模式(被吞没/对峙/穿行/消失)。角色弧线追踪(若叙事涉及人物须建立): 为每个角色在叙事大纲中标注各段落的精神状态变化节点——以"段落序号 + 精神状态关键词 + 变化方向"格式记录。每个节点须标注:精神状态关键词(如麻木、疏离、动摇、释然、绝望)、变化性质(渐进渐变 / 突然断裂 / 回归原点但已偏移)、与时间弧线的对应关系、触发该变化的叙事事件或天气意象接触。角色弧线追踪须在叙事大纲中完整呈现,作为分镜设计阶段为每个镜头标注角色当前精神状态的依据。
      • 输出叙事大纲: 将以上成果整理为段落级叙事大纲(按"时间质感段落"描述天气变化、意象递进、人物状态、空间关系、场景类型与情绪映射、场景间过渡方式、角色弧线追踪节点),经用户确认后进入规格建立。叙事大纲确认后暂停,等待用户确认再进入规格建立。
    • 路径 B — 用户已有完整剧本或明确故事框架: 跳过编剧开发,直接进入规格建立。
      完成创意开发后,用 text_editor 建立 Final_Video_Spec.md,锁定:片名、主题、画幅(16:9 或 2.35:1 宽银幕)、分辨率(480p)、整体色调(锡兰模式:低饱和大地色系/暗沉阴影;安哲罗普洛斯模式:低饱和灰蓝/雾白;融合模式:按段落切换)、主导视觉模式(锡兰静态/安哲罗普洛斯移动/融合)、天气意象、片长规划(建议 3–8 分钟)镜头数量估算: 慢电影单镜头平均时长 8–15 秒(Seedance 2.5 上限 15 秒),全片镜头数 ≈ 片长(秒)÷ 10–12(示例:3 分钟 ≈ 15–18 镜头、5 分钟 ≈ 25–30 镜头)。
  2. 调用 storyboard_designer 生成分镜表:设计 key elements(人物、场景、天气意象)、镜头列表(含视觉模式标注:锡兰静态/安哲罗普洛斯移动)、跨镜头音频层(环境天气音、BGM、旁白)。完成后暂停确认。
  3. Element 参考素材以用户优先:若用户已提供参考图,调用 resource_prepare_and_analyze 分析并评估风格匹配度,风格相符直接绑定,不符则通过 media_generatorImageToImage 重新生成。人物参考图须为全身三视图(16:9 横向),场景参考图须为多角度无人物四宫格(4:3)。key_element_audio 建立(与视觉 element 同步完成): 对每个有台词的 element character,在此阶段一并通过 media_generator 生成或注册角色音色样本,完成 key_element_audio 绑定并验证——此步骤必须在进入镜头视频生成之前完成,因为视频生成的 audio_infos 依赖该绑定。完成后逐一核对所有 key elements 资产完整性(含 key_element_audio),校验通过后暂停确认。
  4. 逐镜头调用 media_generator 生成视频,按 Storyboard 叙事顺序逐个生成。跨镜头一致性策略: 每镜头以当前涉及的所有 element 图像为视觉参考;同一场景的多个镜头始终引用相同 element scene 图像;仅当与上一镜头存在极强连续性时才额外加入上一镜头视频作为 reference_video。每个镜头视频生成完成后须执行生成后忠实度复检。
  5. 调用 media_generator 生成所有音频层(环境天气音、BGM、旁白 VO)。
  6. 所有媒体就绪后,调用 video_assembler 进行时间轴剪辑与输出。

依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。

逐资产确认原则(最高优先级): 每次生成新资产(element 图像、镜头视频、音频层)之前,必须先向用户说明即将生成的内容(资产类型、对应的 Storyboard 锚点、计划使用的模型与参数),并等待用户明确确认;用户同意后才执行该次生成。禁止在未经用户逐次确认的情况下连续生成多个资产——即使属于同一阶段(如批量 element 图像或连续多个 shot 视频),也必须逐个确认、逐个生成。

元素完整性校验原则: 进入镜头视频生成阶段(第 4 步)之前,必须逐一核对 Storyboard 中定义的所有 key elements(人物、场景、道具、天气意象),确认每个 element 均已生成或绑定对应资产。若发现任何 element 缺失资产,须先补齐再继续;禁止在元素不完整的情况下直接进入镜头视频生成。场景参考图绑定校验(防跳画): 在此基础上,还须逐一核对 Storyboard 中每个 shot 引用的 scene element 是否已绑定四宫格场景参考图资产——若任何 shot 的场景参考图未绑定,须先补齐绑定再进入视频生成,禁止在场景参考图缺失的情况下生成镜头视频,否则会导致场景空间跳变、与相邻镜头不一致。

提示词完整性校验原则(覆盖所有资产类型): 每次生成任何资产(element 图像、镜头视频、音频层)之前,必须将对应提示词或生成描述与 Storyboard 相关描述逐项比对,确认无遗漏后方可提交生成。校验维度因资产类型而异——element 图像须校验人物身份与物理特征、场景物理结构、道具材质状态是否与 key element 描述一致,视觉风格指令是否符合锡兰/安哲罗普洛斯美学;镜头视频须校验场景参考、人物参考、天气意象与递进阶段、视觉模式、运镜与构图、自然元素锚点、scene_break 过渡方式;音频层须校验 narration_speaker_profile、旁白文本、BGM 风格描述、天气环境音叙事化设计是否与分镜定义一致。发现遗漏须补全后再生成,禁止带着不完整的提示词执行生成。

校验失败处理原则: 当任何生成前校验发现遗漏时,按以下步骤处理:

  1. 暂停生成: 立即停止当前资产的提交,不带着不完整的提示词执行。
  2. 定位遗漏项: 明确指出具体遗漏内容(如"缺少场景 element ID 引用""天气意象未标注递进阶段""运镜方式未与视觉模式匹配"),而非笼统报告"校验未通过"。
  3. 补全提示词: 回到 Storyboard 对应描述,将遗漏项逐一补入提示词或生成描述。
  4. 重新校验: 补全后重新执行同一套校验清单,确认所有项均通过。
  5. 确认规则: 若补全仅涉及将分镜中已有信息补入提示词(信息对齐类补全),无需重新向用户确认,直接进入生成;若补全涉及对生成计划本身的修改(如更换模型、调整参数、改变参考图选择),须重新向用户说明并等待确认后再生成。
  6. 顺序影响: 校验失败仅阻塞当前资产,不影响后续资产的生成顺序——当前资产通过校验并完成生成后,按原定顺序继续下一个,不因校验失败而跳过或重排后续资产。

里程碑暂停原则: 每完成一个主要阶段(叙事大纲完成、规格锁定、分镜完成、element 图像完成、镜头视频完成、音频完成),必须停下来向用户展示阶段成果并等待确认,再进入下一阶段。

生成后忠实度复检原则(镜头视频最高优先级): 镜头视频生成后,仅做生成前校验不足以保证分镜设计忠实落地——生成模型的实际输出可能与提示词存在偏差。因此每个镜头视频生成完成后,必须执行一次生成后忠实度复检:将生成结果与 Storyboard 对应 shot 描述逐项比对,核对分镜中设计的以下内容是否在视频中实际呈现——① 场景空间与光线状态(是否与场景参考图一致);② 人物动作与表演(动作类型、幅度、情绪状态是否与 story beats 一致);③ 天气意象与递进阶段(雪/雾/水/风/枯草是否出现且处于正确阶段);④ 视觉模式(锡兰静态/安哲罗普洛斯移动是否正确);⑤ 运镜方式与构图手法(是否与分镜指定的运镜优先级与构图一致);⑥ 多意象组合镜头的组合含义是否正确呈现。若发现关键内容缺失或偏差,须以强化提示词重新生成——将缺失内容置于提示词更前置位置、加强措辞权重、减少非关键描述的干扰,确保分镜设计在生成结果中忠实呈现。复检不通过时,最多重试 2 次;2 次后仍无法忠实呈现,须向用户报告偏差内容并由用户决定是否接受当前结果或调整分镜设计。

2. マルチモーダル分析

用户提供的 element 参考素材分析

  • 人物参考图: 逐张提取人物身份特征——面部轮廓、肤色、体型、服装款式与材质;判断是否为全身三视图格式(正面全身 / 侧面全身 / 背面全身),若不是则标注"需重新制作为全身三视图"。分析结果作为 key_element 描述的直接依据。
  • 场景参考图: 判断是否为多角度无人物四宫格格式。若是四宫格则逐格提取内容;若不是则提取空间物理特征(建筑结构、材质、衰败程度)、光线来源与色温、空气感(潮湿 / 雾气 / 尘埃 / 风雪)、色调倾向——作为重新制作四宫格场景参考图的依据。分析结果作为 element scene 描述的直接依据。
  • 视频片段参考素材: 提取视觉风格特征(色彩饱和度、色调倾向、光线质感、胶片颗粒感)、运镜特征(静态/移动/360°旋转)、天气意象特征、声音特征。分析结果标注与锡兰/安哲罗普洛斯美学的异同。
  • 音频文件参考素材: 提取音乐风格、环境音特征、语音样本音色质感。分析结果标注与慢电影声音设计要求的异同。
  • 文字创意文档: 提取叙事要素与美学意图——故事结构、人物设定、场景描述、情绪走向、天气意象偏好。
  • 风格匹配评估: 判断参考图风格是否与锡兰/安哲罗普洛斯美学相符——重点比对色彩饱和度、色调倾向、光线质感、构图偏好。若风格不符,将身份/物理结构特征与视觉风格特征分离记录,供 media_generator 再生成时以目标风格覆盖。
3. 絵コンテ設計

导演决策指导(当用户仅有灵感或叙事大纲时主动补位)

  • 从叙事大纲到镜头序列的转化: 当输入是段落级叙事大纲而非逐镜头脚本时,须主动将每个"时间质感段落"转化为 2–4 个具体镜头——根据段落的时间质感类型匹配视觉模式(锡兰静态 / 安哲罗普洛斯移动 / 融合)、镜头时长档位与运镜方式。每个镜头的设计须可追溯到大纲中的某个时间质感段落或天气变化节点。
  • 视觉模式分配原则: 全片须在锡兰静态模式与安哲罗普洛斯移动模式之间做出有意识的选择与切换,而非随机混合。切换须对应叙事层次转换——锡兰静态用于内省独处、室内疏离、荒原凝视;安哲罗普洛斯移动用于行走、流亡旅程、历史巡礼、空间穿越。全片至少 50% 镜头采用锡兰静态模式,安哲罗普洛斯移动模式不超过 40%,剩余 10% 可为融合模式(如:固定机位凝视 + 缓慢 360° 摇镜作为段落收束)。
  • 导演自主决策与说明: 在用户未明确指定的维度上,以慢电影美学为决策依据主动做出导演选择,并向用户说明理由。
  • 全片导演通审: 分镜完成后,从导演视角通审——时间弧线是否有递进、天气意象是否作为叙事元素推进、视觉模式切换是否对应叙事层次、节奏曲线是否有起伏(长凝视与短碎片交替)、空间节奏是否合理。

设计 key elements

  • 人物(element character): 锡兰式人物:面部表情沉静、内敛、带有忧郁的思索感,服装多为粗布、皮革、破旧棉衣等自然材质,常从背后拍摄(背影是锡兰的视觉签名)。安哲罗普洛斯式人物:行走中的身影、冬衣裹身、面容模糊(雾中/远景中),身体姿态带有疲惫与仪式感。人物参考图须为全身三视图(16:9 横向),三视图固定分配:正面全身 / 侧面全身 / 背面全身。
  • 场景(element scene): 锡兰式场景:安纳托利亚荒原(枯草、孤树、无尽公路)、室内私密空间(昏暗房间、单窗光源、人物被门框/墙壁分隔)、卡帕多奇亚奇特地貌、雪原。安哲罗普洛斯式场景:雾中边境(铁丝网、河流、铁轨)、废弃工业废墟(弹孔墙、破损工厂)、海边(沙滩、海浪、码头)、无尽公路。场景本身须具备与人物精神状态相呼应的"生命感"——不是背景,是存在的场域。场景参考图须为多角度无人物四宫格(4:3),四格固定分配:全景定场 / 陈设特写 / 纵深透视 / 气氛光效。
  • 天气意象(element weather,本 Skill 特有): 天气是慢电影中最重要的"角色"之一,须作为独立 element 设计——雪(苍凉的白,覆盖一切)、雾(记忆的模糊,历史的不可见)、风(安纳托利亚的持续呼啸,希腊海岸的潮湿海风)、雨(车窗上的雨痕,泥泞的道路)、枯草(无边无际的枯黄,偶尔一棵孤树)。每个天气意象须标注其视觉特征与情绪功能,供跨镜头一致性使用。
  • 标志性道具(element prop): 锡兰式:车灯/尾灯(夜间唯一光源)、老式电话、茶杯/烟灰缸、旧书。安哲罗普洛斯式:行李箱、旧照片、地图、乐器(钢琴/手风琴)。

设计镜头

  • 镜头时长动态规划: Seedance 2.5 单条视频时长范围为 4–15 秒。慢电影整体偏好长镜头,但不同段落类型应有差异化节奏:

    • 冥想式凝视 / 荒原静观(13–15 秒): 锡兰式固定机位凝视荒原、雪原、孤树;安哲罗普洛斯式远景凝视雾中风景。全片至少 40% 镜头落在此区间。
    • 缓慢行走 / 空间穿越(10–13 秒): 安哲罗普洛斯式跟拍行走、缓慢推轨穿越空间。
    • 室内疏离 / 情绪凝聚(8–10 秒): 锡兰式室内长镜头,人物在画面中沉默、疏离。
    • 天气变化节点(6–8 秒): 雾起、雪落、雨至——天气变化本身作为叙事事件。
    • 硬约束: 任何 shot 不得低于 4 秒,不得超过 15 秒。全片镜头数量按片长(秒)÷ 10–12 估算。
  • 视觉模式一 — 锡兰静态模式:

    • 摄影机: 固定机位(locked-off camera),摄影机不移动。全片此模式镜头中至少 60% 为完全静止。
    • 景别: 远景/全景为主——人物在安纳托利亚荒原中如沧海一粟;中景用于室内疏离场景;特写极稀少,仅用于关键仪式性物件(手中的烟、茶杯、旧照片)。
    • 构图: 深焦构图(前景人物与远景地平线形成强烈对比);阴影与暗部(昏暗沉重的色块占据画面大部分);人物背对镜头(锡兰式视觉签名);室内空间分割(门框、窗户、墙壁将人物分隔在不同画面区域);水平线构图(强调大地广袤与沉重)。
    • 光线: 仅限自然光——晨昏斜阳、阴天散射光、夜间车灯/月光。室内场景常常只有一扇窗的光源或一盏台灯,人的面孔半明半暗。
  • 视觉模式二 — 安哲罗普洛斯移动模式:

    • 摄影机运动(仅限以下五种):
      • 第一优先级 — 360度全景慢摇: 安哲罗普洛斯标志性技法,摄影机围绕场景做完整的 360 度旋转,一个镜头内完成空间全景呈现。全片使用不超过 2–3 次,仅用于叙事转折或段落收束。
      • 第二优先级 — 缓慢跟拍行走: 摄影机从身后或侧面跟拍人物长时间的行走。跟随距离保持恒定,人物停步时摄影机同步静止。
      • 第三优先级 — 极慢横移: 沿荒原边缘、废墟墙壁、河流堤岸的横向缓慢移动,展现场景全貌。
      • 第四优先级 — 缓慢推轨: 推入用于逼近人物内心,拉出用于释放情绪、揭示人物在空间中的渺小。
      • 第五优先级 — 极缓慢垂直升降: 使用频率最低,仅用于暗示精神性上升或下沉,全片不超过 1–2 次。
      • 禁止: 快速摇摄、手持晃动、急推急拉、变焦、无人机飞行。
    • 景别: 超远景为主——人物在宏大景观中占比极小;远景跟拍行走;中景用于室内或废墟场景。
    • 构图: 框式构图(门框、窗框、拱门、桥洞取景);"消失点"构图(道路、铁轨、河流向远方延伸);水平线构图(海岸线、地平线、道路分割画面);对称构图(仪式感)与不对称构图(不安感)交替。
  • 天气意象的镜头化分配: 将叙事开发阶段确定的主导天气意象分配到具体镜头中——天气必须有"变化"而非恒定。雪:飘雪→积雪→暴雪→雪停后的苍白。雾:微雾→浓雾→雾中隐约人影→雾散后的空寂。风:微风→持续呼啸→风停后的寂静。每个镜头须标注天气所处的阶段,确保天气在全片中按预定阶段逐步推进。多意象组合镜头: 当一个镜头同时包含两种或以上天气意象时,须引用叙事开发阶段预设的意象间组合含义(见"天气意象间组合关系"),在镜头描述中标注组合类型与组合含义。

  • 场景连续性分组标注: 为每个 shot 标注其所属的 element scene ID 作为 scene_group(如 scene_group: [Element_安纳托利亚荒原]),使同一场景的镜头群可被快速识别。当镜头序列中出现场景切换时,须显式标注 scene_break,并注明该次场景切换的过渡方式(引用叙事开发阶段预设的"场景间过渡逻辑",如"光线渐变过渡""天气变化过渡""阴影扩散过渡"),使场景转换方式有据可依而非随意选择转场手法。此标注供 media_generator 在生成阶段统一引用相同 scene element 参考图保持场景内一致,同时供 video_assembler 据此选择对应的转场手法与时长。

  • 全片导演通审(分镜完成后必须执行): 分镜完成后,须从导演视角通审全片镜头序列——① 时间弧线在镜头层面是否有清晰递进(从开篇到收尾时间质感有变化而非平铺);② 天气意象是否按预设递进方案逐阶段推进而非随机散落或跳跃;③ 视觉模式切换是否对应叙事层次转换且符合比例约束;④ 场景类型与叙事段落映射是否匹配;⑤ 节奏曲线是否有起伏(长凝视与短节点交替)而非全片匀速;⑥ 空间节奏是否合理(同一场景不过度集中、场景间有呼吸间隔);⑦ 多意象组合镜头是否已标注组合含义且组合含义与该段落叙事一致;⑧ 每个镜头的场景是否已标注 scene_group 且 scene_break 处已标注过渡方式;⑨ 若涉及人物,角色弧线节点是否已标注且相邻镜头间精神状态变化是否连贯(无断裂或无故倒退);⑩ 开场与结尾序列是否已按规范设计。发现断裂或失衡须调整镜头排列或补充镜头,并向用户说明调整原因。

  • 每个镜头描述必须包含:

    • 视觉模式: 标注为"锡兰静态"或"安哲罗普洛斯移动"或"融合"。
    • 场景引用(必须): 标注所属 scene element ID,说明时段与光线状态,描述该场景的物理空间特征。
    • 天气状态: 当前天气意象所处的阶段(如"雪:阶段2——积雪已覆盖地面,雪花仍在持续飘落")。
    • 画面构成与运动: 景别 + 摄影机运动方式(若为锡兰静态则标注"固定机位")+ 构图手法。
    • 叙事动态: 人物动作应描述为缓慢的、仪式化的(行走、转身、抬手、凝视);列出当前镜头中标志性自然元素的状态。允许"无事件时间"——人物静立、天气独自流动的空镜段落,这是时间质感的核心载体。
    • 锡兰/安哲罗普洛斯标志性视觉锚点: 每个镜头必须包含至少一种——雪/枯草/孤树/阴影(锡兰侧),或雾/水/铁轨/废墟/边境(安哲罗普洛斯侧)。
  • 开场序列设计: 开场镜头须为全片定调——以极缓慢的长镜凝视(13–15 秒)建立全片的时间质感。锡兰式开场:固定机位凝视荒原/雪原,自然元素独自流动,无人物,让空间先于叙事建立存在感。安哲罗普洛斯式开场:超远景凝视雾中风景,缓慢 360° 摇镜或极慢横移,人物在雾中隐约出现或完全缺席。开场镜头不得包含台词或旁白——让纯视觉建立最初的沉浸。

  • 结尾序列设计: 锡兰式结尾:固定机位凝视——人物独坐/独行在荒原中,渐行渐远或静止不动,画面以"不解决"收束。安哲罗普洛斯式结尾:雾中远景——人物走向雾中/铁轨尽头/地平线,消失或定格于不确定状态。结尾镜头时长取最长档(13–15 秒),让悬置感在时间中延展。结尾不宜包含解释性旁白。

设计跨镜头音频层

  • 天气环境音(audio_layer,type: ambient): 天气环境音是慢电影声音设计的核心——不是恒定底噪,须随天气变化推进。天气环境音叙事化设计: 为每个叙事段落标注对应的天气音特征——雪:持续低混风声 + 雪花落地近乎无声的"寂静";雾:极低频空气振动 + 远处若有若无的声响(钟声、汽笛);风:安纳托利亚持续呼啸声 / 希腊海岸潮湿海风声;雨:车窗上的雨滴声 / 泥泞道路的积水声。段落切换时天气音做交叉淡化(2–3 秒),与画面天气变化同步。天气环境音与画面元素联动配方(必须设计): 为每类天气意象指定对应环境音配方,当镜头包含某类天气时环境音层须自动叠加对应配方——① 雪元素:持续低混风声基底,叠加雪花落地近乎无声的"寂静"(极低频白噪),暴雪阶段加入间歇性强风呼啸;雪停后仅留极低频空气振动。② 雾元素:极低频持续嗡鸣(近乎无声的空气振动),叠加远处若有若无的声响(钟声、汽笛、海鸥),雾浓时加入失真远处呢喃;雾散后仅留空寂。③ 水元素:持续低混水声基底(雨声/溪流/海浪),叠加间歇性水滴声(单一、清脆、间隔不规则),有水面倒影时加入轻微水波声;雨停后仅留积水滴落声。④ 风元素:持续呼啸声(安纳托利亚干燥风/希腊海岸潮湿风),叠加间歇性阵风骤起,风吹过枯草/废墟时加入沙沙声或低沉呜咽声;风停后仅留极弱空气振动。⑤ 枯草元素:风拂过枯草的沙沙声(偏高频、干燥质感),叠加间歇性草叶摩擦声;无风时近乎无声。镜头同时含多种天气意象时按"主意象为主、辅意象为底"混合,在分镜中标注主辅关系。

  • BGM(audio_layer,type: bgm): 若需要音乐,锡兰式偏好:极简弦乐/钢琴单音,或完全无声(锡兰早期作品大量使用"沉默")。安哲罗普洛斯式偏好:古典弦乐(尤其是小提琴和手风琴,参照艾莲妮·卡兰德若的配乐风格)、极简重复音型。避免情绪过度强调的现代配乐。BGM 情绪弧线(必须设计): 按全片叙事段落规划 BGM 情绪走向,与旁白情绪弧线形成对位而非同步——旁白沉寂时 BGM 可微升填补空间,旁白迸发时 BGM 反而收敛退让。为每段 BGM 标注:① 段落情绪方向(如开篇低沉疏离→中段弦乐渐浓→转折处单音悬置→收尾归于寂静);② 配器倾向(弦乐 / 钢琴单音 / 手风琴 / 极简音型 / 无);③ 力度走向(渐强 / 渐弱 / 恒定 / 骤停 / 消隐);④ 与旁白的对位关系(同步 / 对位 / 错位 / 互让)。BGM 与旁白逐段对位规则(必须设计): 为每个叙事段落指定 BGM 与旁白的具体交互方式。以下为标准对位模式库:① 互让-填充型——旁白停顿时 BGM 弦乐渐入填补空间,旁白重新开口时 BGM 收敛至极低或退至单音;适用于段间过渡、空镜凝视。② 互让-退让型——旁白情绪迸发时 BGM 收至单音悬置或暂停,将声场让给人声,旁白收敛后 BGM 缓缓恢复;适用于情绪高潮。③ 同频-低伏型——旁白极低音量呢喃时 BGM 同样保持极低频持续音,两者共处低能量区;适用于开篇疏离、收尾余韵。④ 错位-反衬型——旁白情绪沉重时 BGM 以清冷高音反衬,或旁白平静时 BGM 以低沉弦乐暗示暗流;适用于慢电影特有的"对位"张力。⑤ 渐变-交接型——旁白音量渐升时 BGM 逐层抽离配器(弦乐→单音→消隐),完成声场主导权交接。每段须标注:当前对位模式、BGM 与旁白各自的能量方向(渐升 / 渐降 / 恒定 / 骤变)、交接触发点(以旁白某停顿或句末为信号触发 BGM 变化)。

  • 旁白 VO(audio_layer,type: narration): 若有旁白,锡兰式旁白:哲学思辨性、文学性(契诃夫/陀思妥耶夫斯基式),文本围绕存在主义困境、道德、孤独展开。安哲罗普洛斯式旁白:诗性、史诗感、隐喻性,文本围绕历史、记忆、流亡展开。旁白情绪弧线(必须设计): 旁白不是匀速朗读,须按全片叙事结构设计情绪弧线——为每段旁白标注情绪方向与强度(如:① 开篇疏离空旷,近乎独白呢喃;② 中段情绪渐浓,声音有了重量与微颤;③ 高潮处压抑中短暂迸发后立刻收敛;④ 收尾归于沉寂,余韵未尽)。旁白节奏标注: 在旁白脚本中用"——"标注长停顿(2 秒以上)、"·"标注短停顿(约 1 秒)、"(呼吸)"标注换气点,使生成时自然呈现呼吸节律与沉默间隔。旁白与画面对位: 旁白停顿位置应与画面中的"无事件时间"(空镜凝视、天气独自流动)对齐——让声音的沉默与画面的沉默共振,而非用声音填满每一秒。呼吸节律模板(慢电影风格声音标准,适用于旁白 VO 与角色台词): 为确保声音呈现呼吸感与时间质感而非机械朗读,所有旁白与台词须遵循以下节律标准——① 句间沉默间隔: 每句结束后须保留至少 2–3 秒沉默,让话语的重量在静默中沉淀;段落间须保留 4–6 秒以上无声音间隔。② 换气频率: 每句之内换气不超过 1–2 次,换气深沉而缓慢;换气点用"(呼吸)"标注,置于自然语义停顿处。③ 句末尾音下沉: 句末最后一个字须自然下沉收束(尾音下沉),禁止上扬(避免疑问感或轻浮感),在脚本中用"↘"标注关键句末下沉。④ 语速基准: 每分钟约 80–100 字(极缓);情绪凝聚段可降至 60–80 字/分钟,情绪释放段微升至 100–120 字/分钟后即刻收敛——避免全片匀速。⑤ 停顿标注体系(统一使用): "——" = 长停顿(2 秒以上);"·" = 短停顿(约 1 秒);"(呼吸)" = 换气点;"↘" = 句末尾音下沉。此模板为旁白 VO 与角色台词(shot 内 dialogue)的共同节律标准。

  • "沉默即声音设计"原则: 允许关键画面处所有音频层降至极低或完全静默——慢电影的核心声音不是"有什么声音",而是"沉默的质地"。锡兰式沉默:室内的"死寂",两人同处一室却无话可说的沉默。安哲罗普洛斯式沉默:雾中的"空寂",历史在沉默中发声。

  • 角色类型差异化呼吸模板(按角色类型选用): 上述呼吸节律模板为基础标准,不同慢电影角色类型须在此基础上差异化调整,使不同角色声音节奏各有特征:

    • 锡兰式内省者(存在主义沉默者,成年主角): 基础模板。语速 80–100 字/分钟;换气深沉缓慢,每句 1 次,换气后短暂屏息再开口;句末尾音缓慢下沉;停顿间隔偏长(句间 3 秒,段落间 5–6 秒),沉默是声音的主体而非间隙;声音带有压抑的沙砾感,仿佛话语在喉咙里被过滤过。
    • 安哲罗普洛斯式流浪者(流亡者、边境行走者): 语速极缓 70–90 字/分钟;换气沉重带叹息感,换气声可闻,每句 1–2 次;句末尾音极度下沉近乎消逝;停顿间隔最长(句间 3–4 秒,段落间 6–8 秒),字句间可有轻微颤动,声音有磨损质感与疲惫感,仿佛走了很远的路才开口。
    • 锡兰式沉默伴侣(对话者、共处一室却无话可说的人): 语速缓慢 80–100 字/分钟;换气浅而克制,几乎听不到换气声;句末尾音庄重下沉不颤不晃;停顿间隔适中(句间 2.5–3 秒),对话中长久停顿是常态——不是"不知道该说什么",而是"不需要说";声音低沉中性,不带明显情绪波动。
    • 安哲罗普洛斯式见证者(历史旁观者、叙述者): 语速缓慢均匀 70–90 字/分钟;换气深沉有节律,似在吟诵史诗;句末尾音庄重下沉,带有仪式感;停顿间隔稳定(句间 2.5–3 秒),具规律性;声音低沉肃穆,气息绵长,仿佛在讲述一个不属于自己的故事。
    • 在 element character 设计中须为每个有台词角色标注角色类型并引用对应模板;逐镜头情绪方向在此基础上叠加当次情绪变化。
4. 素材生成

模型锁定(最高优先级): 全程仅使用 GPT Image 2 生成所有图像(TextToImage / ImageToImage),仅使用 Seedance 2.5 生成所有视频(MultiModalToVideo);禁止切换至其他模型。

Key element 图像生成

  • 使用 TextToImageImageToImage,模型固定为 GPT Image 2,分辨率 2K
  • 人物三视图参考图固定使用 16:9 横向画幅;场景四宫格参考图固定使用 4:3 画幅。
  • 每个 element character 生成一张全身三视图(正面全身 / 侧面全身 / 背面全身)。画面风格指令须包含:低饱和色调、自然光或阴天散射光、胶片颗粒质感。
  • 每个 element scene 生成一张多角度无人物四宫格(全景定场 / 陈设特写 / 纵深透视 / 气氛光效)。画面中不得出现人物。
  • Element 参考素材以用户优先,按风格匹配与格式要求分路径处理:风格相符且格式符合则直接绑定;风格不符则以用户图像为 reference_image 通过 ImageToImage 重新生成;格式不符(人物非全身三视图/场景非四宫格)则重新制作。再生成时保留用户图像中的人物身份/场景物理结构特征,仅覆盖视觉风格层。

镜头视频生成

  • 使用 MultiModalToVideo,模型固定为 Seedance 2.5,分辨率 480p,时长在 4–15 秒之间(依分镜动态规划)。
  • 跨镜头视觉一致性策略:
    1. Element 图像(必须): 每个镜头以当前涉及的所有 element character 图像 + 对应 element scene 图像 + 天气意象 element 描述为视觉参考。
    2. 场景参考图强制绑定: 生成任何镜头视频之前,必须确认该镜头引用的 scene element 已绑定四宫格场景参考图资产。同一 element scene 下的多个镜头始终引用相同的场景参考图。四宫格统一性: 提示词中须明确声明四宫格展示的是同一个场景,视频中的空间环境须与该统一场景一致。
    3. 上一镜头末帧(可选): 仅当同一场景内且无视觉断裂时使用。
    4. 连续性视频参考(可选): 仅当极强连续性时使用。
    5. 按叙事顺序生成: 镜头视频按 Storyboard 叙事顺序逐个生成。

生成前提示词校验(逐镜头必须执行): 提交前将视频提示词与 Storyboard 逐项比对——场景参考、人物参考、天气状态与阶段、视觉模式(锡兰静态/安哲罗普洛斯移动)、运镜方式、色彩指令、自然元素锚点。发现遗漏须补全后再提交。

生成后忠实度复检(逐镜头必须执行): 每个镜头视频生成后,将结果与 Storyboard 逐项比对——场景空间与光线、人物动作、天气状态、运镜方式、色彩。发现偏差须以强化提示词重新生成,最多重试 2 次。

音频生成

  • 天气环境音: 使用 MultiModalToAudio(纯文本到音效/氛围声路径),以自然语言描述环境声景特征——情绪、声音质地、空间感、元素组合,而非旋律性音乐描述。须按叙事段落分别生成对应天气音(雪段:持续低混风声+寂静;雾段:极低频空气振动+远处若有若无的声响;风段:持续呼啸;雨段:雨滴/积水声),各段标注起止位置与交叉淡化过渡时长。生成时须参照分镜中设计的天气环境音与画面元素联动配方——根据每个镜头包含的天气意象(雪/雾/水/风/枯草)叠加对应环境音配方,使环境音与画面视觉锚点自动匹配。镜头内的即时音效(如水滴声、风声、火焰噼啪声)可通过 Seedance 2.5 视频生成的 <...> 音效标注嵌入,不单独生成。
  • BGM: 使用 text_to_instrumental(模型 Suno 5Mureka 8)。锡兰式风格:极简弦乐/钢琴单音/无音乐;安哲罗普洛斯式风格:古典弦乐、小提琴、手风琴、极简重复音型。生成指令中须包含分镜中设计的 BGM 情绪弧线——各段落的情绪方向、配器倾向、力度走向(渐强 / 渐弱 / 恒定 / 骤停 / 消隐)及 BGM 与旁白逐段对位规则(对位模式、双方能量方向、交接触发点),使 BGM 与旁白的交互关系精确可执行。若全片 BGM 分为多段,各段须分别生成并标注其在时间轴上的起止位置与过渡方式(渐变 / 骤停 / 消隐),确保段落间衔接自然。Suno 5 须注意合规提示——提示词中不得包含知名音乐艺术家姓名。
  • 旁白 VO: 使用 TextToSpeech,模型推荐 MiniMax Speech 2.8 HD(英语影片可用 ElevenLabs v3)。生成指令中须包含分镜中设计的旁白情绪弧线(各段落情绪方向与强度)、呼吸节律模板标准(句间沉默 2–3 秒、段落间 4–6 秒、换气每句 1–2 次、句末尾音下沉、语速基准 80–100 字/分钟)与节奏标注(长停顿"——"、短停顿"·"、换气"(呼吸)"、尾音下沉"↘"),使旁白呈现呼吸节律与情绪起伏。

角色音色一致性与情绪表现力(key_element_audio): 在 element 阶段,为每个有台词的 element character 建立 key_element_audio 绑定:若用户提供了角色语音参考样本(reference_audio),直接注册 asset_id 并绑定;若用户未提供,由系统生成——使用 TextToSpeech,模型指定 MiniMax Speech 2.8 HD(英语影片可用 ElevenLabs v3),生成一段 5–10 秒的角色语音样本,注册 asset_id 并绑定。语调描述规范(voice profile 多维度): 生成指令中须包含该角色的完整 voice profile——性别、年龄感、音色质感(沙哑 / 清亮 / 低沉 / 沙砾感 / 气息感)、音量倾向(轻声 / 中等 / 压抑)、语速(慢电影角色默认极缓)、呼吸特征(深沉缓慢 / 浅而急促 / 带叹息感)、情绪基调(沉思 / 忧郁 / 肃穆 / 疲惫)、情绪表现范围(标注该角色声音在不同情绪下的变化方式,如"悲伤时声音收紧、尾音下沉;释然时气息变深、语速微升;压抑时近乎气声、字句间长停顿")。逐镜头情绪方向(声音表演指导): key_element_audio 锚定的是角色的基础音色一致性;同一角色在不同镜头中情绪状态不同,声音表演须随之变化。在每个需要角色台词的镜头中,将该角色的 key_element_audio 传入 audio_infos 的同时,须在该镜头台词旁附当次情绪方向——标注角色此刻的具体情绪状态与 delivery 方式。

音频层生成前校验(必须执行):

  • 旁白 VO 校验: 提交生成之前,将旁白生成描述与 Storyboard 对应 audio_layer 逐项比对——narration_speaker_profile(性别、年龄感、音色质感、语速、情绪基调、呼吸特征)是否与分镜定义一致;旁白情绪弧线是否已按段落标注情绪方向与强度;呼吸节律模板是否已应用——句间沉默间隔(2–3 秒)、段落间间隔(4–6 秒)、换气频率(每句 1–2 次)、句末尾音下沉标注("↘")、语速基准(80–100 字/分钟);旁白节奏标注(长停顿"——"、短停顿"·"、换气"(呼吸)"、"↘")是否已写入脚本;旁白文本是否与分镜中的精确脚本一致,无遗漏无改写;旁白停顿位置是否与画面"无事件时间"对齐。
  • BGM 校验: 提交生成之前,核对 BGM 风格描述是否与分镜中 audio_layer 的音乐风格要求一致;BGM 情绪弧线是否已按段落标注情绪方向、配器倾向、力度走向及与旁白的对位关系;BGM 与旁白逐段对位规则是否已为每段指定具体对位模式(填充型 / 退让型 / 低伏型 / 反衬型 / 交接型)、双方能量方向与交接触发点;若有多个音乐段落,各段过渡方式(渐变 / 骤停 / 消隐)是否已标注。
  • 天气环境音校验: 提交生成之前,核对环境音是否已按叙事段落分别设计——雪段/雾段/风段/雨段/枯草段的特征是否与分镜中天气环境音叙事化设计一致;段落切换处的交叉淡化过渡时长(2–3 秒)是否已标注;天气环境音与画面元素联动配方是否已按镜头包含的天气意象(雪/雾/水/风/枯草)叠加对应配方,多意象镜头是否已标注主辅关系。
  • 角色台词音色与情绪校验: 提交生成之前,核对每个有台词的镜头是否已将对应角色的 key_element_audio 传入 audio_infos,音色绑定无遗漏、无错绑;同时核对该镜头是否已附逐镜头情绪方向(角色此刻的情绪状态与 delivery 方式),且与 story beats 中的人物情境一致;台词的停顿标注("——"/"·")、换气标注("(呼吸)")、句末尾音下沉标注("↘")是否符合呼吸节律模板标准。
  • 若发现任何遗漏,须补全后再提交生成;校验失败处理流程遵照规划阶段的校验失败处理原则。

Asset Binding Contract

  • 遵照当前 manage_item_assets 合约使用实际 Storyboard 目标 ID,不在 Skill 内另建 ID 模板。
  • key_element_audio 绑定时序(最高优先级): 在 element 阶段生成或注册角色音色样本后,立即调用 manage_item_assets 将 asset_id 绑定至对应 element character,然后调用 query_assets_info 核实绑定成功,再进入镜头视频生成阶段。每个需要 audio_infos 引用的镜头,须在生成前确认该 key_element_audio 绑定已存在。
  • 环境音 / BGM 绑定时序: 环境音与 BGM 生成完成后,注册 asset_id 并绑定至对应 audio_layer Storyboard 锚点,再调用 query_assets_info 验证;绑定验证通过后方可进入时间轴剪辑阶段。
  • 绑定操作规范: 每次调用 manage_item_assets 前须先 query_assets_info 查询现有绑定,提交时保留完整 asset_bindings 数组不得覆盖已有绑定;操作完成后再次 query_assets_info 验证。一个资产服务多种用途时,须在数组中保留每个适用绑定。
  • 绑定类型和角色以资产的实际用途和计划 Storyboard 位置为准,不依据媒体标签名称推断。
5. プロンプト作成

全局最高优先级: 若用户以中文交互,所有提示词正文以中文书写;台词、VO 文本语言遵照 Final_Video_Spec.md 中设定的输出语言。

提示词完整性自检(视频镜头必须执行): 每条镜头视频提示词写完后,须回到 Storyboard 逐项对照——场景引用与光线状态、所有出场人物的动作与参考图占位符、天气状态与阶段、视觉模式(锡兰静态/安哲罗普洛斯移动)、运镜方式、景别与构图手法、标志性自然元素状态、色彩指令。发现遗漏须补全后再提交。

图像提示词(GPT Image 2 — TextToImage / ImageToImage)

  • 以导演视角用自然语言描述:主体 + 动态 + 空间环境,再附加简短短语描述色彩 / 光线 / 质感 / 构图。所有描述只写镜头可见之物,不写心理动机或画面外内容。

  • 锡兰式视觉语法(融入一段流畅段落):

    • 色彩:低饱和度大地色系——棕色、灰色、暗绿、土黄、暗蓝。去鲜艳化处理。高光区乳黄/琥珀,阴影区深褐/墨绿/冷灰。
    • 光线:自然光或模拟自然光——晨昏斜阳、阴天散射光、夜间车灯/月光、单窗室内光。低照度美学——室内场景仅有一扇窗或一盏台灯,面孔半明半暗。大量阴影占据画面。
    • 质感:胶片颗粒感(film grain)、安纳托利亚高原的粗粝质感、真实材质(粗布、泥土、枯草、锈蚀金属、潮湿石墙)。
    • 构图:深焦(前景人物与远景地平线形成强烈对比);阴影与暗部占据画面大部分;人物背对镜头;室内空间分割(门框/窗户/墙壁);远景中人物如沧海一粟;水平线构图。
    • 标志性视觉锚点:雪(铺天盖地的雪景)、枯草(无边无际的枯黄草原)、孤树(旷野中一棵孤树)、车灯(夜间唯一光源)、阴影(人物面孔半明半暗)。
  • 安哲罗普洛斯式视觉语法:

    • 色彩:低饱和度灰蓝色调——灰蓝、雾白、暗绿、土褐。去鲜艳化处理。低对比度,朦胧感。偶尔的暖光(路灯、烛光、黄昏)与整体冷调形成强烈对比。
    • 光线:自然光——阴天漫反射、雾中散射光、黄昏/黎明光线。光线须带有"空气感"——不是清晰的,而是被雾/水汽柔化的。
    • 质感:胶片颗粒感、水汽/雾气的湿润感、废墟的斑驳纹理、铁轨的锈迹、弹孔墙壁的创伤痕迹。
    • 构图:框式构图(门框/窗框/拱门/桥洞);"消失点"构图(道路/铁轨/河流向远方延伸);超远景(人物在画面中占比极小);对称构图(仪式感)与不对称构图交替。
    • 标志性视觉锚点:雾(浓雾/晨雾/蒸汽)、水(河流/海洋/积水/倒影)、铁轨(延伸入雾中)、废墟(弹孔墙/废弃工厂/破损教堂)、边境(铁丝网/围墙/河流)。
  • 人物三视图参考图提示词(仅人物 element): 提示词须以全身三视图布局指令开头,明确指定画幅为 16:9 横向,三视图固定分配:正面全身 / 侧面全身 / 背面全身。每视图内容须与 Storyboard 中 element character 描述一致。

  • 场景四宫格参考图提示词(仅场景 element): 提示词须以四宫格布局指令开头,明确指定画幅为 4:3(2×2 网格),四格固定分配:全景定场 / 陈设特写 / 纵深透视 / 气氛光效。画面全程无人物。 每格内容须与 Storyboard 中 element scene 描述一致。

视频提示词(MultiModalToVideo — Seedance 2.5)

  • 忠实转译原则(最高优先级): 提示词须忠实转译 Storyboard 中对应 shot 的全部设计内容,不得概括、压缩或遗漏任何设计维度。核心元素前置原则: 场景空间与光线、天气状态、人物动作与状态、运镜方式是决定画面骨架的要素,须置于提示词前部并给予充分篇幅。

  • 参考图绑定: 每个 element character 参考图使用占位符 <<<image_1>>>、<<<image_2>>> 等逐一标注。场景参考图为四宫格布局,绑定时标注其用途为"场景空间与氛围参考",并明确声明"该四宫格图展示的是同一个场景的不同角度与细节,不是四个不同场景"。场景环境文字锚点(必须写入): 绑定四宫格场景参考图时,提示词中须补充一段对该场景物理特征的文字描述,不同镜头引用同一场景时这段文字须保持一致。

  • 运镜堆叠顺序: 摄影机运动天气状态主体动态空间与自然元素变化音效/台词提示

锡兰静态模式视频提示词结构:

[天气状态描述], [固定机位/静止镜头], [场景空间与光线],
[人物动作——缓慢、仪式化], [自然元素变化——雪飘落/风吹草动/雾气流动],
[低饱和度大地色调], [胶片颗粒质感], [锡兰风格],
[音效标注], [负面约束]

安哲罗普洛斯移动模式视频提示词结构:

[天气状态描述], [360度全景慢摇/缓慢跟拍行走/极慢横移],
[场景空间与光线], [人物在画面中渺小], [行走路径与空间穿越],
[自然元素变化——雾气流动/水面涟漪/铁轨延伸],
[低饱和度灰蓝色调], [朦胧空气感], [安哲罗普洛斯风格],
[音效标注], [负面约束]
  • 摄影机运动(仅限): 锡兰静态模式——static camera, fixed shot, locked-off camera, completely still。安哲罗普洛斯移动模式——360-degree slow pan, slow tracking following figure from behind, very slow lateral tracking, slow dolly in/out, very slow tilt up/down。禁止:fast movement, handheld shake, rapid zoom, drone flight。

  • 天气动态描述: 天气须有"变化"而非静态——雪:snowflakes slowly falling, snow accumulating on ground, wind blowing snow across the landscape。雾:mist slowly rolling in, fog gradually thickening, figures emerging from the fog。风:continuous wind blowing through dry grass, wind rustling through barren trees。雨:rain streaking down window, raindrops creating ripples on puddles, rain slowly stopping。

  • 主体动态: 强调缓慢、仪式化——slowly turning, silently gazing into distance, hands resting motionless, walking with heavy measured steps。锡兰式:人物长时间静止不动,背对镜头。安哲罗普洛斯式:人物持续行走,步伐沉重而均匀。

  • Seedance 2.5 音效标注(按需使用): 背景音乐:(...)。音效:<...>(如 <持续低混风声>、<远处雾中汽笛声,缓慢>、<雪花落地的寂静>)。台词(如有):{...},标注情绪状态与表演方式。

  • 固定否定指令: 若旁白 VO 走独立音频层,视频 prompt 中不重复完整 VO 文本;始终加 no music(BGM 在后期层叠);始终加 no subtitles(字幕由后期处理);no fast cuts, no quick camera movement, no Hollywood style, no dramatic climax。

6. 動画編集

节奏与剪辑基调

  • 整体剪辑节奏极慢、均匀、深沉。不压缩镜头时长——保留每个 shot 的原始时长,不随意修剪开头或结尾的"空镜时刻"——那是慢电影风格的核心价值所在。
  • 允许"无事件时间"完整保留——人物静立、天气独自流动的空镜段落不缩短。

镜头间过渡规则(按视觉模式与叙事关系分类)

  • 锡兰静态→锡兰静态(同场景): 短溶解(dissolve,1–1.5 秒),保持空间与时间的自然延续。天气环境音层不随切换中断。
  • 锡兰静态→锡兰静态(场景切换): 较长溶解(1.5–2.5 秒),给观众从一处空间"离开"再"抵达"另一处的过渡时间。
  • 安哲罗普洛斯移动→安哲罗普洛斯移动: 长溶解(2–3 秒),配合 360° 摇镜的惯性——上一个镜头的旋转感与下一个镜头的移动感通过溶解衔接。
  • 锡兰静态→安哲罗普洛斯移动(或反向): 较长淡入淡出(fade,2–3 秒),视觉模式切换须沉浸式过渡——从"静止"到"移动"或从"移动"回归"静止"是叙事层次转换。
  • 天气变化节点: 长淡入淡出(fade,2–3 秒),配合天气环境音交叉淡化——雪段风声音渐弱→雾段空寂渐起。
  • 硬切(hard cut)使用条件: 仅限于——① 时间跳跃(白天→夜晚);② 天气骤变(风停→暴雨);③ 需要制造冲击感的叙事节点。即使使用硬切,环境音层仍须保持连续,不可同步硬切。

音频层叠与同步

  • 混音优先级: ① 旁白 VO > ② 天气环境音 > ③ BGM。
  • 音量比例参考: 天气环境音 25–35%(全片氛围基底);BGM 30–45%(旁白出现时自动压低至 20–25%);旁白 VO 60–70%。
  • 淡入淡出: 天气环境音片首淡入 3–5 秒,片尾淡出 4–6 秒,镜头切换时不做淡变保持连续。BGM 进入淡入 2–4 秒,退出淡出 3–5 秒。旁白每段开始前 0.5–1 秒淡入,结束后 1–2 秒淡出,段落间保留至少 3–5 秒无旁白间隔。
  • "沉默即声音设计"原则: 允许关键画面处所有音频层降至极低或完全静默。锡兰式沉默——室内死寂,仅留极弱环境音或完全无声。安哲罗普洛斯式沉默——雾中空寂,仅留极低频空气振动。

音频叙事化过渡与 BGM 对位执行规则

  • 环境音叙事化过渡: 环境音须随叙事层次变化而非全片恒定——锡兰室内疏离段以极低声学环境为主(房间混响、远处隐约的街道声),安哲罗普洛斯行走巡礼段以开阔空间声学为主(风声、水声、空旷回声),雾中风景段以空灵残响为主(低频空气振动、远处若有若无的声响)。叙事段落切换时环境音做 2–3 秒交叉淡化,与画面场景类型转换同步;同一叙事层内镜头切换时环境音不做淡变,保持连续流动感。天气变化节点(如从雪转雾)须配合环境音交叉淡化——雪段风声渐弱→雾段空寂渐起。

  • BGM 与旁白对位执行: 须按分镜中设计的 BGM 与旁白逐段对位规则执行——① 填充型段: 旁白停顿间隙 BGM 渐入(从 25% 升至 40–50%),填充声场空隙;旁白重新开口时 BGM 在 0.5 秒内迅速压回 20–25%。② 退让型段: 旁白情绪迸发处 BGM 骤降至单音或暂停(≤15%),将声场完全让给人声;旁白收敛后 BGM 在 3–5 秒内缓缓恢复至 30–35%。③ 低伏型段: BGM 与旁白同处低能量区——BGM 维持 25–30%,旁白维持极低音量(约 50%),两者共同制造压抑静默张力。④ 反衬型段: BGM 情绪方向与旁白相反——旁白沉重时 BGM 清冷高音漂浮(30–35%),旁白平静时 BGM 低沉弦乐暗示暗流(35–40%)。⑤ 交接型段: 旁白音量渐升(从 50% 升至 65%)时 BGM 逐层抽离配器(弦乐→单音→消隐),交接时长 3–5 秒。

导出立场

  • 输出规格:16:9 或 2.35:1 宽银幕(依 Final_Video_Spec.md),720p 分辨率。
  • 帧率: 目标 24fps(电影标准帧率,与胶片质感呼应)。不提升至 30fps 或 60fps——过高帧率削弱慢电影时间质感。
  • 分辨率提升(可选): 720p 为基础输出;若用户需更高画质,可通过 super_resolution 提升至 1080p 或 4K。