yeha.ai
返回模板库

陈凯歌电影美学

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

适用于真实事件、历史创伤、戏梦人生、时代压迫、师徒父子等题材,将用户灵感重构为陈凯歌式文人史诗短片。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

整体工作流(六阶段串行,每阶段强制用户确认)

阶段依赖关系: 阶段0(信息收集+写入全局规格文档)→阶段1(角色版依赖灵感输入)→阶段2(场景图依赖角色版锁定)→阶段3(叙事依赖角色+场景锚点)→阶段4(样片依赖叙事+分镜结构)→阶段5(完整生成依赖样片确认)。

阶段0:接收用户灵感

通过 reply_to_user 引导用户输入:真实事件/回忆/灵感文本、涉及人物及其关系(师徒/父子/三人纠缠/艺人身份错位等,可选)、主要场景(可选)、时代背景(可选)。若用户已附带描述,直接进入阶段1。将核心信息写入 Final_Video_Spec.md(通过 text_editor),记录:短片标题(可暂定)、总时长意向、主视觉情绪基调、题材类型(用于色系自动匹配)、三线比例意向(现实/回忆/时代压迫)、画面比例(默认 16:9),作为后续各工具的全局锚点。

阶段1:角色身份板生成(强制前置,一致性锁定)

调用 media_generator,为每个主要角色生成完整角色视觉资产包:主视觉身份板(正面+背面+左右侧全身+手部微距,16:9横版)、表情库(平静/凝视/隐忍/微悲/克制怒,3—5张)、三线光影测试图(冷调版+暖调版+时代压迫版半脸侧光各1张);戏曲题材时追加戏妆/戏服图。
生成策略(分两步,节省积分): 先生成主视觉身份板(单图预览),展示给用户确认角色方向;用户确认后,再生成表情库与光影测试图,完成完整资产包。
多时间段处理规则: 若用户故事跨越明显时间跨度(如"二十年前与现在"),须为同一角色分别生成青年版中老年版两套身份板(第二套使用 ImageToImage 参考第一套以保证面部结构一致,仅改变年龄/服饰特征);每套独立标注版本标签(如"Look A:现实/中年"/"Look B:回忆/青年")。若用户未提及时间跨度,默认只生成一套,全片统一使用。
角色声音参考生成(key_element_audio): 在角色视觉资产确认后,为有台词/吟诵的角色生成短声音参考样本(3—5秒代表性台词),使用 media_generatortext to narration 工具(推荐模型 MiniMax Speech 2.8 HD),按角色 narration_speaker_profile 设定音色参数;生成后通过 register → bind 绑定至对应 element character 的 key_element_audio 槽位。此样本仅用于后续 Seedance 2.5(分辨率 480p) 视频生成时保持跨镜头音色一致,不作为最终成片旁白。若用户上传了角色声音参考素材,优先绑定用户素材,跳过此步。
用户确认节点(强制):
向用户展示每位角色的主视觉身份板及文字描述,询问:

  • A. 确认方向 → 生成完整资产包(表情库+光影测试图+声音参考),完成后进入阶段2
  • B. 修改角色(请说明内容)→ 重新生成主视觉身份板
  • C. 重新生成 → 重试
  • D. 快速模式(跳过图像生成,仅以文字描述锁定角色)→ 直接进入阶段2;后续分镜参照文字描述,一致性由用户自行把控

确认前不得推进。角色外观锁定后,后续所有阶段必须严格参照,不得改变。

阶段2:场景多机位参考图生成(强制前置,场景一致性锁定)

色彩模式检测(阶段2前置,进入生成前执行): 扫描用户本轮及上轮输入,检测是否包含以下任意关键词:"提高清晰度"、"高清"、"清晰"、"锐化"(包含匹配,任一命中即触发):

  • 未检测到 → 采用默认 A模式(按题材选定色系的陈凯歌风格),通过 reply_to_user 告知:「【色彩风格】未检测到清晰度相关关键词,采用默认陈凯歌风格(根据题材自动匹配色系)。如需提升细节清晰度,请在描述中输入"高清""清晰""锐化"或"提高清晰度"后重新生成。」
  • 检测到 → 切换至 B模式(仅提升清晰度与细节,不改变饱和度),通过 reply_to_user 告知:「【清晰度】检测到清晰度相关关键词,启用高清晰度模式(仅提升细节与纹理,饱和度不变),同时保留陈凯歌三线叙事、仪式化调度、山河空镜等核心语法。」
    当前色彩模式须写入 Final_Video_Spec.md(通过 text_editor),作为后续分镜与生成阶段的全局参数锚点。B模式不覆盖三线色温分割、仪式化调度、山河空镜、构图原则等已有核心规则。
    调用 media_generator,为每个主要场景生成完整场景视觉资产包:多机位参考图(正拍+航拍/高角度+细节特写+侧拍,共4张)以及同一场景在冷调/暖调/时代压迫下的三线光影预览图各1张(共3张)。

生成策略(分两步,节省积分): 先生成4张多机位参考图,展示给用户确认场景方向;用户确认后,再生成冷暖光影预览图,完成完整资产包。
用户确认节点(强制): 展示每个场景的多机位参考图及对应道具坐标说明,询问:

  • A. 确认全部场景 → 生成各场景冷暖光影预览图,完成后执行光影匹配检查(见下方),再进入阶段3
  • B. 修改某场景(请说明内容)→ 重新生成
  • C. 新增场景 → 按描述补充生成
  • D. 重新生成 → 重试
  • E. 精简模式(仅生成正拍机位图1张,航拍/细节/侧拍以文字描述代替)→ 仅执行第一步中的正拍图,确认后可选择是否额外生成冷暖光影预览图,再进入阶段3;适用于室内小场景或积分有限时
  • F. 快速模式(跳过所有图像生成,仅以文字描述锁定场景)→ 直接进入阶段3,一致性由用户自行把控
    用户除确认画面外,还需确认道具坐标说明是否准确(如"石碑位于画面左侧1/3处");道具位置一经确认即作为后续分镜的构图锚点。

确认前不得推进。场景风格与道具布局锁定后,后续分镜中所有对应场景必须参照,不得偏离。
光影匹配检查(阶段2完成后、阶段3前执行): 对比各角色视觉资产中标注的默认光源方向与各场景的主光源方向;若存在明显不一致(如角色冷调光从左,场景主光从右),通过 reply_to_user 提示用户并建议对齐方向,等用户确认或选择忽略后再进入阶段3。

阶段3:叙事重构与三线规划

调用 storyboard_designer,将用户灵感结合角色+场景锚点重构为四幕叙事结构(20%日常铺垫→30%触景/回忆或仪式→30%情感扎根/命运压迫→20%留白/山河),生成完整 Storyboard(key_elements / shots / audio_layers)。

用户确认节点(强制):

  • A. 确认叙事与分镜 → 进入阶段4
  • B. 修改独白/誓词/训话文本 → 请说明调整方向(如"更克制"、"加入更多山河意象"、"加入戏文吟唱")
  • C. 调整时空占比(见下方选项)
  • D. 重新构建

时空占比调整选项(C 项展开):

  • C1. 默认(现实 45% / 回忆 35% / 时代压迫 20%)
  • C2. 现实为主(现实 60% / 回忆 25% / 时代压迫 15%)
  • C3. 回忆为主(回忆 55% / 现实 30% / 时代压迫 15%)
  • C4. 时代为主(时代压迫 50% / 现实 30% / 回忆 20%)
  • C5. 自定义(请输入比例,如"现实 40% 回忆 30% 时代 30%")

用户选定比例后,storyboard_designer 须按该比例重新分配各幕 shot 数量与时长,并更新 Final_Video_Spec.md 中的三线比例记录。

确认前不得推进。

阶段4:样片镜头生成(单镜头风格验证)

从分镜表中选取1个"情感峰值"镜头(如递进特写+独白/誓词组合,或仪式化空间调度镜头),调用 media_generator 先行生成,让用户确认光影、构图、运镜是否符合预期,避免全量生成的积分浪费。

用户确认节点(强制):

  • A. 确认样片 → 进入阶段5(完整生成)
  • B. 修改光影/构图 → 调整后重试
  • C. 更换情感峰值镜头 → 从分镜表中重新选取后生成
  • D. 重新生成样片

确认前不得推进。

阶段5:完整短片生成与剪辑

  1. 按分镜表逐镜头生成所有视频镜头(含 Seedance 2.5(分辨率 480p) 原生音频:独白/誓词/训话/戏文、环境音效、锣鼓/广播等)→ media_generator
  2. 按分镜表顺序拼接、混音 → video_assembler

导出前强制质检确认节点: 组装完成后,向用户展示以下一致性检查清单,等待用户逐项确认后方可导出:
【一致性检查清单】请逐项确认后回复"确认一致",或回复"修改[具体问题]":

  • [ ] 人物外观是否与角色版一致(发型、服饰、体态)?
  • [ ] 若有多版本角色(青年/中年),各 shot 使用版本是否正确?
  • [ ] 角色关系(师徒/父子/身份错位等)是否在画面中通过空间站位、身体语言体现?
  • [ ] 场景道具位置是否与参考图一致(无漂移)?
  • [ ] 现实段光影是否为冷调硬分层光?回忆段是否为暖黄柔光?时代段是否为顶光硬阴影?
  • [ ] 递进特写或仪式化调度是否服务于叙事(非机械模板)?
  • [ ] 每段沉重内容后是否插入山河空镜?
  • [ ] 独白/誓词段落人物是否闭口、居中构图?
  • [ ] 戏台段落是否有台上/台下对照与后台上妆/脱装仪式(戏曲题材时)?
  • [ ] 有无超出角色版/场景参考图范围的未授权新增元素?
    用户回复"确认一致"后导出;回复"修改[问题]"则针对性修正后重新提交检查。

异常处理规则

若用户灵感中未出现任何可识别的人物描述,不得跳过阶段1,改为:

  1. 根据故事题材自动匹配关系模板并生成对应角色(模板详见 storyboard_designer 的 Key Elements 设计规范中"用户无描述时的默认模板")。
  2. 在阶段1确认节点向用户说明:"已根据故事内容自动生成角色形象及关系(如师徒/父子/时代冲突),如需调整年龄、服饰、面容、关系类型等细节请直接描述。"
  3. 等待用户确认后继续,不得自动进入阶段2。

用户未提供场景描述

若用户灵感中未涉及任何具体场景,不得跳过阶段2,改为:

  1. 自动生成2—3个与故事情感基调匹配的核心场景(模板详见 storyboard_designer 的 element scene 设计规范中"用户无描述时的默认模板"),并在 Final_Video_Spec.md 中记录。
  2. 在阶段2确认节点向用户说明:"已根据故事自动规划场景,如需修改或新增场景请说明。"
  3. 等待用户确认后继续,不得自动进入阶段3。

确认节点无响应

所有强制确认节点(阶段1—5)均遵循以下等待机制:

  • 每次展示确认选项后,停止推进,等待用户明确回复(A/B/C/D 或自由文本)。
  • 不设超时自动推进,不得以"默认确认"视为用户同意。
  • 若用户发送与确认无关的消息(如新灵感描述),先通过 reply_to_user 提示用户当前流程处于待确认状态,询问是否继续当前项目或开启新项目,再根据回复决定后续行动。
2. 多模态分析

用户上传素材分析与处理

用户可能上传图片、视频、音频或文档作为参考素材(角色参考、场景参考、声音参考、故事灵感文本等)。需根据素材类型执行以下分析,输出结构化文本供后续阶段使用。

图片素材(角色参考 / 场景参考 / 道具参考):

  • 提取角色外观特征:年龄区间、性别、体态、面容特征、发型、服饰颜色与材质、手部特征(老茧/伤痕等陈凯歌标志性细节)。
  • 提取场景特征:地理环境、建筑/地貌、核心道具及其位置坐标、光源方向与色温倾向。
  • 若为戏曲相关图片(脸谱/戏服/戏台),额外提取脸谱图案、戏服色彩材质、戏台结构特征。
  • 输出结构化描述文本,供 storyboard_designer 写入对应 key_element description,确保后续生成与用户素材一致。

视频素材:

  • 整体理解:叙事内容、情绪基调、视觉风格(色系、光影、构图倾向)。
  • 若视频含角色,提取角色外观特征(同图片素材规则)。
  • 若视频含场景,提取场景布局与道具位置。
  • 可按需执行裁切片段、提取关键帧(作为 keyframe 或 reference_image)、提取音频(作为声音参考或 key_element_audio)。

音频素材(声音参考 / key_element_audio):

  • 识别音色特征:性别、音域(低沉/中音/高音)、语速、语气倾向(克制/压迫/苍桑等),输出 narration_speaker_profile 描述文本。
  • 若用户上传角色声音参考,标记为优先绑定素材,跳过 text to narration 生成步骤。

文档素材(故事灵感 / 剧本 / 历史资料):

  • 提取核心叙事要素:人物及关系(师徒/父子/三人纠缠/艺人身份错位等)、时代背景、关键场景、情感基调。
  • 识别题材类型(乡土/戏曲/时代/宫廷/幻梦),供色系自动匹配使用。
  • 输出结构化摘要,供 planner 写入 Final_Video_Spec.md。

一致性与风险检查:

  • 若多张素材中同一角色外观不一致,通过 reply_to_user 提示用户并询问以哪张为准。
  • 若素材风格与选定色系冲突,提示用户是否调整色系或更换素材。
3. 故事板设计

核心叙事结构

采用四幕循环节拍(比例可调,默认:20% 日常/铺垫 → 30% 触景/回忆或仪式 → 30% 情感扎根/命运压迫 → 20% 留白/山河),每个循环单元内部节拍为:

全景环境交代 → 纪实中景 → 仪式化空间调度(或递进特写)→ 誓词/训话/戏文/独白 → 山河空镜

陈凯歌式叙事不只靠诗意旁白堆叠,而是通过仪式、动作、沉默、换装、上妆、跪拜来表达。独白只是手段之一,不宜过多;人物少解释,多用身体语言和空间关系传递情绪。

戏台/仪式语法(陈凯歌核心标记,区别于普通文艺片)

以下元素是陈凯歌区别于普通"山河回忆文艺片"的关键,应在合适题材中主动运用:

  • 戏台与后台对照:台上角色身份 vs 台下真实身份的错位与重叠("戏里的人变成了现实中的命")。
  • 仪式化空间调度:人物被空间结构压住——站在台阶上、门框中、长廊尽头、戏台中央、祠堂正中;空间比人大,人被框住。
  • 上妆/换装/脱装:身份转换的视觉仪式,不靠台词而靠动作。
  • 跪拜/训诫/回避:师徒、父子、家族权力关系的身体语言。

时代压迫语法(第三叙事线)

除现实/回忆双时空外,时代本身是一条隐形的"第三线",通过具体画面压迫人物命运:

  • 时代符号画面:队列行进、标语墙、广播声、集体注视、公审式站位、家族规训、师徒训诫。
  • 历史事件从背景进入命运:时代不是装饰,而是直接改变人物处境——从远处广播声渐近到人物被迫跪下、换装、分离。

三线视觉系统(强制区分)

时空类型色温光质情绪现实线(冷调)7500—9500K硬分层光,高对比克制、冷硬回忆线(暖柔)2700—3600K柔光晕染,低对比温柔、消散时代压迫线5500—6500K顶光/侧顶光,硬阴影压抑、窒息
每个 shot 的 description 必须明确标注所属时空(现实冷调 / 回忆暖柔 / 时代压迫),不可混用。回忆段落以逆光剪影作为转场媒介镜头(独立 shot)开启。时代压迫段落以顶光/侧顶光硬阴影为视觉标记。

色彩体系(多元,不锁死青灰)

陈凯歌不同作品的色彩截然不同,须根据题材选择主色调:
色彩体系适用题材主色调饱和度黄土地系乡土/荒原/质朴题材青灰、沙土褐、炭黑40%—55%霸王别姬系戏曲/身份错位/时代题材红黑金、戏服彩、脸谱色50%—70%(戏台段可更高)荆轲刺秦王系权力/宫廷/刺杀题材黑、铁灰、暗金、血红40%—60%,高对比妖猫传系盛唐/华丽/幻梦题材金、朱红、翠绿、浓墨60%—80%

默认规则:若用户未指定色彩体系,根据题材自动匹配(乡土→黄土地系;戏曲/时代→霸王别姬系;宫廷→荆轲刺秦王系;华丽幻梦→妖猫传系)。色系选定后写入 Final_Video_Spec.md。

清晰度 A/B 模式(参照 Final_Video_Spec.md 中的色彩模式参数)

A模式(默认·陈凯歌风格):按选定色系执行饱和度与色调;保留轻微雾化感(黄土地系)或胶片质感,边缘不过度锐利,模拟 35mm 胶片颗粒。
B模式(用户输入包含"提高清晰度"、"高清"、"清晰"、"锐化"任一关键词时触发)仅提升细节与清晰度,不改变饱和度。4K 超分级细节增强,皮肤毛孔、睫毛、衣物织纹、背景纹理可见,不做柔化;高光保留细节,阴影提亮至中灰以上,伽马值 1.8—2.0,画面通透均匀;白平衡锁定日光模式(5500K)。饱和度保持各色系原定值不变,不因"高清"而自动提高。
B模式不改变以下已有规则:三线色温分割、仪式化调度、山河空镜缓冲、构图原则(天地大于人)、16:9 画面比例处理。

Key Elements 设计规范

element character(角色)

  • 每个主要角色建立独立 key_element。
  • description 中须包含:年龄区间、体态特征、服饰颜色/材质、面容特征、手部特征(老茧/伤痕等,陈凯歌标志性细节)、默认光源方向(供光影匹配检查使用)。
  • 角色关系模板(须在角色描述中注明关系类型):
    • 师徒:技艺传承与权力不对等
    • 父子:血缘羁绊与代际压迫
    • 三人纠缠:三角关系中的忠诚与背叛
    • 艺人与角色:戏中人变成了现实中的命,身份重叠与撕裂
    • 个人身份与时代身份冲突:被时代赋予的身份 vs 内心真实自我
  • 若角色有"现实状态"与"回忆中年轻状态"两种形象,在同一 key_element 内分别说明(Look A:现实;Look B:回忆)。
  • 角色视觉资产构成(通过 media_generator 生成并绑定至对应 key_element reference_image 槽位,标注资产类型):
    • 主视觉身份板:四视图+手部微距拼图
    • 表情库:平静/凝视/隐忍/微悲/克制怒,3—5张
    • 三线光影测试图:冷调版+暖调版+时代压迫版半脸侧光各1张
    • 戏妆/戏服图(戏曲题材时启用):脸谱全脸+戏服全身+后台便装对照
    • 服装细节图(可选)
    • key_element_audio:角色声音参考样本(3—5秒代表性台词,用于跨镜头音色一致)
  • 用户无描述时的默认模板:根据题材自动匹配关系结构——乡土题材→父子(中年父+少年子);戏曲题材→师徒(中年师父+青年学徒);时代题材→个人与时代(主角+被时代改变命运的故人);无法判断题材时→默认"现实中的主角"+"回忆中的故人/逝者"。

element scene(场景)

  • 每个主要场景建立独立 key_element。
  • description 中须包含:地理环境、建筑/地貌特征、核心道具布局(位置坐标说明)、时代氛围、主光源方向(供光影匹配检查使用)。
  • 戏台/仪式场景(戏曲/仪式题材时须包含):戏台结构(台口/台深/出将入相门)、后台(妆镜/衣架/红帘)、观众席空间关系、脸谱/戏服/道具陈设位置。
  • 时代场景:标语墙内容与位置、队列行进路线、广播喇叭位置、公审/集会空间布局。
  • 场景视觉资产构成(通过 media_generator 生成并绑定至对应 key_element reference_image 槽位,标注机位类型与时空版本):
    • 多机位参考图:正拍+航拍/高角度+细节特写+侧拍,共4张
    • 三线光影预览图:同一场景冷调版+暖调版+时代压迫版各1张
  • 用户无描述时的默认模板:根据题材匹配——乡土→老屋/荒路/山野;戏曲→戏台/后台/长廊;时代→广场/标语墙/集体空间;宫廷→殿堂/廊道/高阶。

Shot 设计规范

每个 shot 的 description 必须包含:

  • 时空标注:现实冷调 / 回忆暖柔 / 时代压迫
  • 景别与机位:(如极低地平线广角远景 / 纪实中景手持 / 居中对称平视)
  • 运镜:(如锁定 / 缓慢上升 / 手持轻微抖动 / 垂直抬升)
  • 画面内容:人物动作、核心道具、环境细节
  • 台词/声音类型:注明类型——独白(画外音,人物闭口)/ 誓词 / 训话 / 戏文吟唱 / 旧时代规矩话 / 无台词(以动作/沉默表达)
  • 关联 key_element ID:引用对应的场景与角色 element

硬性镜头规则(不可违反):

  1. 每个场景段落的首镜必须是全景环境交代(极低地平线广角远景,天地大于人)。
  2. 情绪转折点使用递进特写或仪式化空间调度(二选一或结合,不强制每次相同):
    • 递进特写:器物→面部→手部(可灵活调整顺序与数量,服务于叙事而非模板化)
    • 仪式化调度:人物站在台阶/门框/长廊/戏台中央,被空间结构框住、压住,以身体姿态(跪/站/转身/回避)传递情绪
  3. 每段沉重叙事之后必须插入1个山河空镜 shot(无人物,3—6秒,山/河/长路/落日/枯木之一)。
  4. 独白/誓词镜头:人物居中对称平视构图,人物闭口,画外音单独处理。
  5. 戏台段落(戏曲题材时):须包含"台上/台下"对照镜头以及后台上妆/脱装仪式镜头。
  6. 时代压迫段落:以集体注视、队列、标语、广播为视觉主体,人物被人群或空间结构包围。
  7. 每个 shot 预设时长:全景/空镜 4—6秒;中景/纪实 5—8秒;特写/仪式调度 3—8秒;独白/誓词 6—10秒。单个 shot 不超过30秒(模型上限)。

音频层(audio_layers)设计

与生成管线的关系: Storyboard 中的 narration audio_layer 是独白/誓词/训话/戏文的权威文本来源。在默认管线中,其文本被逐字转写入对应 shot 的视频 prompt {...} 包裹,由 Seedance 2.5(分辨率 480p) 原生音频输出,不单独生成独立旁白轨道。narration_speaker_profile 用于指导 key_element_audio 声音参考样本的生成参数及视频 prompt 中的音色描述。若 Seedance 2.5(分辨率 480p) 原生音频质量不达标,可将 narration audio_layer 文本通过 text to narration 独立生成为旁白轨道,在 video_assembler 中与视频混音(见 media_generator 降级策略)。

画外独白/誓词/训话(narration)

  • 类型:narration
  • 声音类型多样化:不限于诗意独白,可包括——誓词(庄严短句)、训话(权威压迫式)、戏文吟唱(戏曲题材)、旧时代规矩话(家族/师徒)、克制旁白。
  • 每段3—5句,融入意象但不堆砌;人物少解释,多用动作和沉默。
  • description 中注明 narration_speaker_profile(如"[沧桑男中音,语速缓慢,克制]"或"[师父口吻,低沉命令式]")。
  • 在 layout_instruction 中绑定对应 shot 范围。

戏台/仪式声音层

  • 戏曲题材须规划:锣鼓点(节奏标记)、戏曲唱腔远声、后台衣料摩擦声、木门开合声。
  • 仪式场景须规划:训练口令、跪拜磕地声、换装布料声。
  • 在 description 中注明具体音效内容与时机。

时代声音层

  • 时代压迫段落须规划:广播播报声、队列脚步声、口号齐呼声、标语张贴声。
  • 音量低于独白/誓词,作为背景压迫感存在。

环境音

  • 为每个主要场景规划一条环境音层(风声/鸟鸣/远处水声等),供后期混音使用;在 description 中注明具体音效内容。
4. 媒体生成

角色视觉资产包生成(阶段1)

使用 TextToImage / ImageToImage,推荐模型 GPT Image 2,分辨率 2K

生成顺序(分两步,先预览确认方向,再生成扩展资产):
第一步 — 主视觉身份板(TextToImage):16:9横版拼图,正面/背面/左侧/右侧全身+手部微距;纯白背景,均匀正面漫射光。展示给用户确认后再继续。
第二步 — 扩展资产(用户确认主视觉方向后执行):

  1. 表情库(ImageToImage,参考主视觉身份板):陈凯歌式5种表情——平静、凝视、隐忍、微悲、克制怒;每张正面半身肖像,背景统一。共3—5张。
  2. 三线光影测试图(ImageToImage,参考主视觉身份板):冷调版(7500—9500K硬分层光)、暖调版(2700—3600K柔晕光)和时代压迫版(5500—6500K顶光硬阴影)半脸侧光各1张。
  3. 戏妆/戏服图(戏曲题材时启用,ImageToImage,参考主视觉身份板):脸谱全脸正面图+戏服全身图+后台便装对照图各1张,描述脸谱图案、戏服色彩材质、头饰细节。
  4. 角色声音参考样本(key_element_audio):使用 text to narration(推荐模型 MiniMax Speech 2.8 HD),按角色 narration_speaker_profile 生成3—5秒代表性台词音频。生成后通过 register → bind 绑定至对应 element character 的 key_element_audio 槽位。若用户已上传声音参考素材,优先绑定用户素材,跳过此步。
    若角色有两种造型(现实/回忆),第二套主视觉身份板使用 ImageToImage(参考第一套)生成,面部结构一致,仅改变年龄/服饰特征;扩展资产同步生成第二套对应版本。声音参考样本每角色仅需一份(不随造型版本重复)。
    生成后通过 register → bind 将所有视觉资产绑定至对应 element character reference_image 槽位,描述中标注资产类型(主视觉/表情库/光影测试)。

场景视觉资产包生成(阶段2)

使用 TextToImage / ImageToImage,推荐模型 GPT Image 2,分辨率 2K
生成顺序(分两步,先多机位确认方向,再生成冷暖光影预览):
第一步 — 多机位参考图(TextToImage):

  1. 正拍机位(平视正面,全貌+核心道具布局与坐标)
  2. 航拍/高角度俯拍(空间关系+环境压迫感)
  3. 细节特写(场景内关键器物微距)
  4. 侧拍机位(场景侧面结构+纵深感)
    共4张,展示给用户确认场景方向后继续。

第二步 — 三线光影预览图(ImageToImage,参考正拍机位图):同一场景冷调版(青灰冷硬光)、暖调版(暖黄柔晕光)和时代压迫版(顶光硬阴影)各1张,构图与道具位置保持与正拍机位一致。
生成后通过 register → bind 将所有资产绑定至对应 element scene reference_image 槽位,标注机位类型与时空版本。

视频镜头生成(阶段5)

默认路径: 使用 MultiModalToVideo,推荐模型 Seedance 2.5,分辨率 480p(默认);用户明确要求更高质量时可切换至 480p(需会员)。
模型降级策略:Seedance 2.5(分辨率 480p) 生成失败,优先切换至同工具内 Seedance 2.5(仅支持 480p)重试;若 Seedance 2.5(分辨率 480p) 也失败,停止当前 shot 生成并通过 reply_to_user 告知用户失败情况,询问是否切换至 ImagesToVideo(推荐模型 Vidu(Q3))作为替代路径——但需提示该路径不支持原生音频输出,音频需改用 text to narration 独立生成。不得静默切换至不同工具。
每个 shot 的参考输入规则:

  1. scene reference_images:绑定该 shot 对应的 element scene 参考图(正拍/航拍/细节,按景别选择最匹配的1—2张)。
  2. element character reference_images:绑定该 shot 中出现的所有角色的身份板图片。
  3. key_element_audio(角色声音参考):若角色有台词/吟诵,绑定对应角色的 key_element_audio 以保持音色一致。
  4. 前镜头视频参考(reference_video):仅当本 shot 与前一 shot 存在极强连续性(同一场景同一运镜延续),才将前一 shot 的 final_shot 作为 reference_video 加入;通常情况不加,避免风格污染。
    递进特写/仪式调度组:递进特写为独立 shot(器物/面部/手部,顺序可灵活调整),每个单独调用生成,duration 建议 4—5s;仪式调度 shot(人物被台阶/门框/长廊/戏台空间框住)duration 建议 5—8s。均使用 MultiModalToVideo(模型 Seedance 2.5,分辨率 480p),以对应参考图作为视觉参考输入;音效/对白通过 prompt 包裹格式写入,由 Seedance 2.5(分辨率 480p) 原生输出。
    山河空镜 shot:无角色引用,仅绑定自然景观参考图或纯文本描述;duration 4—6s,使用 MultiModalToVideoTextToVideoSeedance 2.5(分辨率 480p));环境音通过 <...> 包裹写入 prompt,由模型原生输出。

音频生成策略与降级:

  • 默认管线:全片音频(独白、誓词、训话、戏文吟唱、环境音效、锣鼓点、广播声等)均由 Seedance 2.5(分辨率 480p) 原生音频能力输出。Storyboard 中 narration audio_layer 的文本(独白/誓词/训话/戏文),直接转写进对应 shot 的视频 prompt {...} 包裹中生成;戏台锣鼓、广播、队列脚步等音效通过 <...> 包裹写入。
  • 降级管线:若 Seedance 2.5(分辨率 480p) 原生音频质量不达标或生成失败,将该 shot 的 narration 文本通过 text to narration(推荐模型 MiniMax Speech 2.8 HD,按 narration_speaker_profile 设定音色)独立生成为旁白音频,在 video_assembler 中与视频混音。切换降级管线时需通过 reply_to_user 告知用户。

资产绑定原则

  • 用户上传的照片/影像/音频素材,优先注册为 asset_id 并绑定至对应 key_element,不重复生成。
  • 每个阶段完成后及时完成 bind/rebind,确保 Storyboard 中所有 element 和 shot 槽位均有明确资产锚定,再进入下一阶段。
5. 提示词撰写

全局原则

用中文撰写所有 prompt 正文(包括图像和视频);画外独白/誓词/戏文台词同样使用中文。prompt 只描述镜头可见/可听内容,不写心理动机、画外背景信息。

色彩体系写入规则

根据 Final_Video_Spec.md 中选定的色系,在 prompt 中写入对应色彩锚定词:

  • 黄土地系:青灰、沙土褐、炭黑,低饱和,雾化质感,35mm胶片颗粒
  • 霸王别姬系:红黑金为主,戏服彩、脸谱色点缀,舞台段高饱和,后台段低饱和
  • 荆轲刺秦王系:黑、铁灰、暗金、血红,高对比,冷硬
  • 妖猫传系:金、朱红、翠绿、浓墨,浓艳华丽

角色身份板图像 Prompt(TextToImage / ImageToImage)

结构:角色外观锚定(服装/体态/面容/手部)+ 四视图布局说明 + 光照与背景 + 风格锁定词
示例结构(单段落,不分标题):

陈凯歌电影人物造型参考图,[年龄区间],[性别],[体态]。[服饰颜色/材质/状态]。面部:[皱纹/眼神/疤痕等]。手部:[老茧/伤痕/形态]。横向四视图拼图:正面全身 / 背面全身 / 左侧全身 / 右侧全身,左下角附手掌微距。纯白背景,均匀正面漫射光,无阴影,无多余道具。写实摄影风格,35mm肖像质感。

戏妆角色(戏曲题材):额外生成脸谱全脸正面图+戏服全身图+后台便装对照图,prompt 须描述脸谱图案、戏服色彩材质、头饰细节。

场景参考图 Prompt(TextToImage)

结构:风格锚定(含色系)+ 场景内容 + 机位说明 + 光影时空 + 技术参数

陈凯歌电影风格,[色系锚定词],山河史诗感/戏台仪式感/时代压迫感。[场景名称与核心内容]。[机位说明:平视正拍/高角度俯拍/微距特写]。[光影时空:现实冷调硬分层光 / 回忆暖柔晕染光 / 时代压迫顶光硬阴影]。极低地平线广角构图,天地大于人。[色系技术参数]。35mm胶片质感,宽幅构图感(画面比例保持16:9)。

B模式追加文本(用户输入包含"提高清晰度"、"高清"、"清晰"、"锐化"任一关键词时)

清晰度执行标准:4K超分级细节增强,皮肤毛孔、睫毛、衣物织纹、背景纹理清晰可见,不做柔化。高光保留细节,阴影提亮至中灰以上,伽马值1.8—2.0,画面通透均匀,白平衡5500K。饱和度不变,仅提升清晰度与细节,不改变色彩风格。
B模式下去除"雾化质感""35mm胶片颗粒"等柔化描述词,替换为上述追加文本;构图、景别、光影时空、色系描述保持不变。

视频镜头 Prompt(MultiModalToVideo)

参考图绑定占位符:按 <<<image_1>>>、<<<image_2>>> 顺序标注(场景参考图在前,角色参考图在后)。
结构(运动栈顺序):

参考图占位 → 时空标注 → 景别/机位 → 运镜 → 主体动作与面部细节 → 场景空间变化 → 音效/对白(Seedance 2.5包裹格式)

Seedance 2.5(分辨率 480p) 音效包裹规范:**

  • 背景音乐:(...) — 几乎所有镜头均写 (no music),仅环境音。
  • 音效/环境音:<...> 格式——除风声、水声外,须主动使用陈凯歌特色音效:锣鼓点 <远处锣鼓声>、戏曲唱腔远声 <隐约戏腔>、训练口令 <教官口令>、广播 <广播播报声>、队列脚步 <整齐脚步声>、衣料摩擦 <戏服摩擦声>、后台木门 <木门吱呀声>。
  • 对白/独白/誓词/戏文(画外音):独白/誓词/训话/戏文镜头人物闭口,将 Storyboard narration audio_layer 中的文本逐字写入 {...} 包裹,由 Seedance 2.5(分辨率 480p) 原生音频输出;若该 shot 已降级为 text to narration 独立旁白管线,则视频 prompt 中不写 {...},改为 {no dialogue},旁白在 video_assembler 中混入。无台词镜头写 {no dialogue}。
  • 片名/字幕:【...】 — 所有镜头均写 【no subtitles】

仪式化调度镜头 prompt 要点:

  • 描述人物与空间结构的关系:台阶高度、门框宽度、长廊纵深、戏台尺度——让空间比人大。
  • 描述身体姿态:跪/站/转身/回避/跪拜的幅度与速度。
  • 不写情绪判断词,只写可见的空间关系与身体动作。

戏台段落 prompt 要点:

  • 台上:描述戏服色彩、脸谱、身段动作、台口光线,与台下形成色彩/身份反差。
  • 后台:描述妆镜、红帘、戏服挂架、上妆/脱妆动作,低饱和暖光。
  • 身份错位:同一角色台上台下对照,prompt 须明确"同一人"的视觉锚点。

时代压迫段落 prompt 要点:

  • 描述集体场面:队列方向、人群密度、标语内容(可渲染文字)、广播喇叭位置。
  • 人物被人群或建筑包围,空间收窄。
  • 音效以 <广播声>、<队列脚步>、<口号齐呼> 为主。

递进特写镜头 prompt 要点:

  • 器物特写:精确描述材质/状态/光线角落,构图居中,极浅景深。
  • 面部特写:描述眼神方向、皱纹纹理、微表情,不写情绪判断词,只写可见细节。
  • 手部微距:描述手指动作幅度、皮肤纹理、与道具的接触状态。
  • 顺序可灵活调整,服务于叙事节奏而非固定模板。

山河空镜 prompt 要点:
无人物,描述自然元素运动(如"枯草随风伏倒"、"远山云雾缓缓流动"),运镜多用锁定或极缓慢水平移动,duration 4—6s,(no music),<环境风声>。

固定负向词(standing negatives,每条视频 prompt 末尾附加):

(no music), 【no subtitles】, no watermark, no text overlay.

注意:有台词/独白/誓词/戏文的镜头,将文本写入 {...} 包裹;无台词镜头追加 {no dialogue}。不要在所有镜头统一写 {no dialogue}。

6. 视频合成

剪辑节奏与时空转场

整体节奏原则: 陈凯歌式剪辑不以快切见长,而以"留白—压迫—爆发—沉默"的呼吸节奏驱动。镜头时长尊重分镜表预设(全景/空镜4—6秒,中景/纪实5—8秒,特写/仪式3—8秒,独白/誓词6—10秒),不随意加速或裁剪叙事镜头。

三线时空转场规则:

  • 现实→回忆:以逆光剪影独立 shot 作为转场媒介,回忆段以暖黄柔光晕染进入。
  • 回忆→现实:回忆段末尾以山河空镜收束,自然过渡回现实冷调。
  • →时代压迫:以广播声渐入或队列脚步声渐近作为音频先行转场,画面从远景切入时代符号(标语墙/队列/广场)。
  • 时代压迫→其他:以硬切或黑场短暂停留(0.5—1秒)制造窒息感后再转入下一时空。

山河空镜缓冲: 每段沉重叙事(仪式/训诫/时代压迫/情感爆发)之后,必须保留山河空镜 shot 作为情绪缓冲,不得在剪辑中删除或缩短至3秒以下。空镜之间不叠加音乐,仅保留环境音。

音频混音规则

音量层级(从高到低):

  1. 独白/誓词/训话/戏文(核心叙事音频)— 全片最高优先级,清晰可辨。
  2. 对白/戏台唱腔 — 略低于独白,保持空间感。
  3. 戏台锣鼓/仪式音效 — 中等音量,作为节奏标记。
  4. 时代声音层(广播/队列脚步/口号)— 低于独白,作为背景压迫感存在。
  5. 环境音(风声/水声/鸟鸣)— 最低层,营造空间氛围。

降级旁白混音: 若部分 shot 降级为 text to narration 独立旁白管线,旁白音频需与对应视频段精准对齐(以 shot 起始帧为准),音量与 Seedance 2.5(分辨率 480p) 原生独白保持一致,避免音质跳变。相邻 shot 若一个使用原生音频、一个使用降级旁白,需在交界处做0.3秒交叉淡化以平滑过渡。

静音处理: 独白/誓词镜头中人物闭口,视频原生音频中不应出现人物说话声;若 Seedance 2.5(分辨率 480p) 误生成嘴部动作伴随声音,在混音阶段将该段视频音轨静音,仅保留旁白轨道。

拼接与导出

  • 按分镜表顺序逐镜头拼接,不得自行调整镜头顺序(用户在质检确认节点已逐项审核)。
  • 镜头间转场以硬切为主;时空转换处可使用0.5—1秒黑场或逆光剪影过渡。
  • 导出前确认全片时长与 Final_Video_Spec.md 中记录的总时长意向基本一致;若偏差超过20%,通过 reply_to_user 提示用户。
  • 导出比例为 16:9。