yeha.ai
Back to templates

Chen Kaige cinematic aesthetic

Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.

适用于真实事件、历史创伤、戏梦人生、时代压迫、师徒父子等题材,将用户灵感重构为陈凯歌式文人史诗短片。

Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.

Complete workflow

1. Planning

整体工作流(六阶段串行,每阶段强制用户确认)

阶段依赖关系: 阶段0(信息收集+写入全局规格文档)→阶段1(角色版依赖灵感输入)→阶段2(场景图依赖角色版锁定)→阶段3(叙事依赖角色+场景锚点)→阶段4(样片依赖叙事+分镜结构)→阶段5(完整生成依赖样片确认)。

阶段0:接收用户灵感

通过 reply_to_user 引导用户输入:真实事件/回忆/灵感文本、涉及人物及其关系(师徒/父子/三人纠缠/艺人身份错位等,可选)、主要场景(可选)、时代背景(可选)。若用户已附带描述,直接进入阶段1。将核心信息写入 Final_Video_Spec.md(通过 text_editor),记录:短片标题(可暂定)、总时长意向、主视觉情绪基调、题材类型(用于色系自动匹配)、三线比例意向(现实/回忆/时代压迫)、画面比例(默认 16:9),作为后续各工具的全局锚点。

阶段1:角色身份板生成(强制前置,一致性锁定)

调用 media_generator,为每个主要角色生成完整角色视觉资产包:主视觉身份板(正面+背面+左右侧全身+手部微距,16:9横版)、表情库(平静/凝视/隐忍/微悲/克制怒,3—5张)、三线光影测试图(冷调版+暖调版+时代压迫版半脸侧光各1张);戏曲题材时追加戏妆/戏服图。
生成策略(分两步,节省积分): 先生成主视觉身份板(单图预览),展示给用户确认角色方向;用户确认后,再生成表情库与光影测试图,完成完整资产包。
多时间段处理规则: 若用户故事跨越明显时间跨度(如"二十年前与现在"),须为同一角色分别生成青年版中老年版两套身份板(第二套使用 ImageToImage 参考第一套以保证面部结构一致,仅改变年龄/服饰特征);每套独立标注版本标签(如"Look A:现实/中年"/"Look B:回忆/青年")。若用户未提及时间跨度,默认只生成一套,全片统一使用。
角色声音参考生成(key_element_audio): 在角色视觉资产确认后,为有台词/吟诵的角色生成短声音参考样本(3—5秒代表性台词),使用 media_generatortext to narration 工具(推荐模型 MiniMax Speech 2.8 HD),按角色 narration_speaker_profile 设定音色参数;生成后通过 register → bind 绑定至对应 element character 的 key_element_audio 槽位。此样本仅用于后续 Seedance 2.5(分辨率 480p) 视频生成时保持跨镜头音色一致,不作为最终成片旁白。若用户上传了角色声音参考素材,优先绑定用户素材,跳过此步。
用户确认节点(强制):
向用户展示每位角色的主视觉身份板及文字描述,询问:

  • A. 确认方向 → 生成完整资产包(表情库+光影测试图+声音参考),完成后进入阶段2
  • B. 修改角色(请说明内容)→ 重新生成主视觉身份板
  • C. 重新生成 → 重试
  • D. 快速模式(跳过图像生成,仅以文字描述锁定角色)→ 直接进入阶段2;后续分镜参照文字描述,一致性由用户自行把控

确认前不得推进。角色外观锁定后,后续所有阶段必须严格参照,不得改变。

阶段2:场景多机位参考图生成(强制前置,场景一致性锁定)

色彩模式检测(阶段2前置,进入生成前执行): 扫描用户本轮及上轮输入,检测是否包含以下任意关键词:"提高清晰度"、"高清"、"清晰"、"锐化"(包含匹配,任一命中即触发):

  • 未检测到 → 采用默认 A模式(按题材选定色系的陈凯歌风格),通过 reply_to_user 告知:「【色彩风格】未检测到清晰度相关关键词,采用默认陈凯歌风格(根据题材自动匹配色系)。如需提升细节清晰度,请在描述中输入"高清""清晰""锐化"或"提高清晰度"后重新生成。」
  • 检测到 → 切换至 B模式(仅提升清晰度与细节,不改变饱和度),通过 reply_to_user 告知:「【清晰度】检测到清晰度相关关键词,启用高清晰度模式(仅提升细节与纹理,饱和度不变),同时保留陈凯歌三线叙事、仪式化调度、山河空镜等核心语法。」
    当前色彩模式须写入 Final_Video_Spec.md(通过 text_editor),作为后续分镜与生成阶段的全局参数锚点。B模式不覆盖三线色温分割、仪式化调度、山河空镜、构图原则等已有核心规则。
    调用 media_generator,为每个主要场景生成完整场景视觉资产包:多机位参考图(正拍+航拍/高角度+细节特写+侧拍,共4张)以及同一场景在冷调/暖调/时代压迫下的三线光影预览图各1张(共3张)。

生成策略(分两步,节省积分): 先生成4张多机位参考图,展示给用户确认场景方向;用户确认后,再生成冷暖光影预览图,完成完整资产包。
用户确认节点(强制): 展示每个场景的多机位参考图及对应道具坐标说明,询问:

  • A. 确认全部场景 → 生成各场景冷暖光影预览图,完成后执行光影匹配检查(见下方),再进入阶段3
  • B. 修改某场景(请说明内容)→ 重新生成
  • C. 新增场景 → 按描述补充生成
  • D. 重新生成 → 重试
  • E. 精简模式(仅生成正拍机位图1张,航拍/细节/侧拍以文字描述代替)→ 仅执行第一步中的正拍图,确认后可选择是否额外生成冷暖光影预览图,再进入阶段3;适用于室内小场景或积分有限时
  • F. 快速模式(跳过所有图像生成,仅以文字描述锁定场景)→ 直接进入阶段3,一致性由用户自行把控
    用户除确认画面外,还需确认道具坐标说明是否准确(如"石碑位于画面左侧1/3处");道具位置一经确认即作为后续分镜的构图锚点。

确认前不得推进。场景风格与道具布局锁定后,后续分镜中所有对应场景必须参照,不得偏离。
光影匹配检查(阶段2完成后、阶段3前执行): 对比各角色视觉资产中标注的默认光源方向与各场景的主光源方向;若存在明显不一致(如角色冷调光从左,场景主光从右),通过 reply_to_user 提示用户并建议对齐方向,等用户确认或选择忽略后再进入阶段3。

阶段3:叙事重构与三线规划

调用 storyboard_designer,将用户灵感结合角色+场景锚点重构为四幕叙事结构(20%日常铺垫→30%触景/回忆或仪式→30%情感扎根/命运压迫→20%留白/山河),生成完整 Storyboard(key_elements / shots / audio_layers)。

用户确认节点(强制):

  • A. 确认叙事与分镜 → 进入阶段4
  • B. 修改独白/誓词/训话文本 → 请说明调整方向(如"更克制"、"加入更多山河意象"、"加入戏文吟唱")
  • C. 调整时空占比(见下方选项)
  • D. 重新构建

时空占比调整选项(C 项展开):

  • C1. 默认(现实 45% / 回忆 35% / 时代压迫 20%)
  • C2. 现实为主(现实 60% / 回忆 25% / 时代压迫 15%)
  • C3. 回忆为主(回忆 55% / 现实 30% / 时代压迫 15%)
  • C4. 时代为主(时代压迫 50% / 现实 30% / 回忆 20%)
  • C5. 自定义(请输入比例,如"现实 40% 回忆 30% 时代 30%")

用户选定比例后,storyboard_designer 须按该比例重新分配各幕 shot 数量与时长,并更新 Final_Video_Spec.md 中的三线比例记录。

确认前不得推进。

阶段4:样片镜头生成(单镜头风格验证)

从分镜表中选取1个"情感峰值"镜头(如递进特写+独白/誓词组合,或仪式化空间调度镜头),调用 media_generator 先行生成,让用户确认光影、构图、运镜是否符合预期,避免全量生成的积分浪费。

用户确认节点(强制):

  • A. 确认样片 → 进入阶段5(完整生成)
  • B. 修改光影/构图 → 调整后重试
  • C. 更换情感峰值镜头 → 从分镜表中重新选取后生成
  • D. 重新生成样片

确认前不得推进。

阶段5:完整短片生成与剪辑

  1. 按分镜表逐镜头生成所有视频镜头(含 Seedance 2.5(分辨率 480p) 原生音频:独白/誓词/训话/戏文、环境音效、锣鼓/广播等)→ media_generator
  2. 按分镜表顺序拼接、混音 → video_assembler

导出前强制质检确认节点: 组装完成后,向用户展示以下一致性检查清单,等待用户逐项确认后方可导出:
【一致性检查清单】请逐项确认后回复"确认一致",或回复"修改[具体问题]":

  • [ ] 人物外观是否与角色版一致(发型、服饰、体态)?
  • [ ] 若有多版本角色(青年/中年),各 shot 使用版本是否正确?
  • [ ] 角色关系(师徒/父子/身份错位等)是否在画面中通过空间站位、身体语言体现?
  • [ ] 场景道具位置是否与参考图一致(无漂移)?
  • [ ] 现实段光影是否为冷调硬分层光?回忆段是否为暖黄柔光?时代段是否为顶光硬阴影?
  • [ ] 递进特写或仪式化调度是否服务于叙事(非机械模板)?
  • [ ] 每段沉重内容后是否插入山河空镜?
  • [ ] 独白/誓词段落人物是否闭口、居中构图?
  • [ ] 戏台段落是否有台上/台下对照与后台上妆/脱装仪式(戏曲题材时)?
  • [ ] 有无超出角色版/场景参考图范围的未授权新增元素?
    用户回复"确认一致"后导出;回复"修改[问题]"则针对性修正后重新提交检查。

异常处理规则

若用户灵感中未出现任何可识别的人物描述,不得跳过阶段1,改为:

  1. 根据故事题材自动匹配关系模板并生成对应角色(模板详见 storyboard_designer 的 Key Elements 设计规范中"用户无描述时的默认模板")。
  2. 在阶段1确认节点向用户说明:"已根据故事内容自动生成角色形象及关系(如师徒/父子/时代冲突),如需调整年龄、服饰、面容、关系类型等细节请直接描述。"
  3. 等待用户确认后继续,不得自动进入阶段2。

用户未提供场景描述

若用户灵感中未涉及任何具体场景,不得跳过阶段2,改为:

  1. 自动生成2—3个与故事情感基调匹配的核心场景(模板详见 storyboard_designer 的 element scene 设计规范中"用户无描述时的默认模板"),并在 Final_Video_Spec.md 中记录。
  2. 在阶段2确认节点向用户说明:"已根据故事自动规划场景,如需修改或新增场景请说明。"
  3. 等待用户确认后继续,不得自动进入阶段3。

确认节点无响应

所有强制确认节点(阶段1—5)均遵循以下等待机制:

  • 每次展示确认选项后,停止推进,等待用户明确回复(A/B/C/D 或自由文本)。
  • 不设超时自动推进,不得以"默认确认"视为用户同意。
  • 若用户发送与确认无关的消息(如新灵感描述),先通过 reply_to_user 提示用户当前流程处于待确认状态,询问是否继续当前项目或开启新项目,再根据回复决定后续行动。
2. Multimodal analysis

用户上传素材分析与处理

用户可能上传图片、视频、音频或文档作为参考素材(角色参考、场景参考、声音参考、故事灵感文本等)。需根据素材类型执行以下分析,输出结构化文本供后续阶段使用。

图片素材(角色参考 / 场景参考 / 道具参考):

  • 提取角色外观特征:年龄区间、性别、体态、面容特征、发型、服饰颜色与材质、手部特征(老茧/伤痕等陈凯歌标志性细节)。
  • 提取场景特征:地理环境、建筑/地貌、核心道具及其位置坐标、光源方向与色温倾向。
  • 若为戏曲相关图片(脸谱/戏服/戏台),额外提取脸谱图案、戏服色彩材质、戏台结构特征。
  • 输出结构化描述文本,供 storyboard_designer 写入对应 key_element description,确保后续生成与用户素材一致。

视频素材:

  • 整体理解:叙事内容、情绪基调、视觉风格(色系、光影、构图倾向)。
  • 若视频含角色,提取角色外观特征(同图片素材规则)。
  • 若视频含场景,提取场景布局与道具位置。
  • 可按需执行裁切片段、提取关键帧(作为 keyframe 或 reference_image)、提取音频(作为声音参考或 key_element_audio)。

音频素材(声音参考 / key_element_audio):

  • 识别音色特征:性别、音域(低沉/中音/高音)、语速、语气倾向(克制/压迫/苍桑等),输出 narration_speaker_profile 描述文本。
  • 若用户上传角色声音参考,标记为优先绑定素材,跳过 text to narration 生成步骤。

文档素材(故事灵感 / 剧本 / 历史资料):

  • 提取核心叙事要素:人物及关系(师徒/父子/三人纠缠/艺人身份错位等)、时代背景、关键场景、情感基调。
  • 识别题材类型(乡土/戏曲/时代/宫廷/幻梦),供色系自动匹配使用。
  • 输出结构化摘要,供 planner 写入 Final_Video_Spec.md。

一致性与风险检查:

  • 若多张素材中同一角色外观不一致,通过 reply_to_user 提示用户并询问以哪张为准。
  • 若素材风格与选定色系冲突,提示用户是否调整色系或更换素材。
3. Storyboard design

核心叙事结构

采用四幕循环节拍(比例可调,默认:20% 日常/铺垫 → 30% 触景/回忆或仪式 → 30% 情感扎根/命运压迫 → 20% 留白/山河),每个循环单元内部节拍为:

全景环境交代 → 纪实中景 → 仪式化空间调度(或递进特写)→ 誓词/训话/戏文/独白 → 山河空镜

陈凯歌式叙事不只靠诗意旁白堆叠,而是通过仪式、动作、沉默、换装、上妆、跪拜来表达。独白只是手段之一,不宜过多;人物少解释,多用身体语言和空间关系传递情绪。

戏台/仪式语法(陈凯歌核心标记,区别于普通文艺片)

以下元素是陈凯歌区别于普通"山河回忆文艺片"的关键,应在合适题材中主动运用:

  • 戏台与后台对照:台上角色身份 vs 台下真实身份的错位与重叠("戏里的人变成了现实中的命")。
  • 仪式化空间调度:人物被空间结构压住——站在台阶上、门框中、长廊尽头、戏台中央、祠堂正中;空间比人大,人被框住。
  • 上妆/换装/脱装:身份转换的视觉仪式,不靠台词而靠动作。
  • 跪拜/训诫/回避:师徒、父子、家族权力关系的身体语言。

时代压迫语法(第三叙事线)

除现实/回忆双时空外,时代本身是一条隐形的"第三线",通过具体画面压迫人物命运:

  • 时代符号画面:队列行进、标语墙、广播声、集体注视、公审式站位、家族规训、师徒训诫。
  • 历史事件从背景进入命运:时代不是装饰,而是直接改变人物处境——从远处广播声渐近到人物被迫跪下、换装、分离。

三线视觉系统(强制区分)

时空类型色温光质情绪现实线(冷调)7500—9500K硬分层光,高对比克制、冷硬回忆线(暖柔)2700—3600K柔光晕染,低对比温柔、消散时代压迫线5500—6500K顶光/侧顶光,硬阴影压抑、窒息
每个 shot 的 description 必须明确标注所属时空(现实冷调 / 回忆暖柔 / 时代压迫),不可混用。回忆段落以逆光剪影作为转场媒介镜头(独立 shot)开启。时代压迫段落以顶光/侧顶光硬阴影为视觉标记。

色彩体系(多元,不锁死青灰)

陈凯歌不同作品的色彩截然不同,须根据题材选择主色调:
色彩体系适用题材主色调饱和度黄土地系乡土/荒原/质朴题材青灰、沙土褐、炭黑40%—55%霸王别姬系戏曲/身份错位/时代题材红黑金、戏服彩、脸谱色50%—70%(戏台段可更高)荆轲刺秦王系权力/宫廷/刺杀题材黑、铁灰、暗金、血红40%—60%,高对比妖猫传系盛唐/华丽/幻梦题材金、朱红、翠绿、浓墨60%—80%

默认规则:若用户未指定色彩体系,根据题材自动匹配(乡土→黄土地系;戏曲/时代→霸王别姬系;宫廷→荆轲刺秦王系;华丽幻梦→妖猫传系)。色系选定后写入 Final_Video_Spec.md。

清晰度 A/B 模式(参照 Final_Video_Spec.md 中的色彩模式参数)

A模式(默认·陈凯歌风格):按选定色系执行饱和度与色调;保留轻微雾化感(黄土地系)或胶片质感,边缘不过度锐利,模拟 35mm 胶片颗粒。
B模式(用户输入包含"提高清晰度"、"高清"、"清晰"、"锐化"任一关键词时触发)仅提升细节与清晰度,不改变饱和度。4K 超分级细节增强,皮肤毛孔、睫毛、衣物织纹、背景纹理可见,不做柔化;高光保留细节,阴影提亮至中灰以上,伽马值 1.8—2.0,画面通透均匀;白平衡锁定日光模式(5500K)。饱和度保持各色系原定值不变,不因"高清"而自动提高。
B模式不改变以下已有规则:三线色温分割、仪式化调度、山河空镜缓冲、构图原则(天地大于人)、16:9 画面比例处理。

Key Elements 设计规范

element character(角色)

  • 每个主要角色建立独立 key_element。
  • description 中须包含:年龄区间、体态特征、服饰颜色/材质、面容特征、手部特征(老茧/伤痕等,陈凯歌标志性细节)、默认光源方向(供光影匹配检查使用)。
  • 角色关系模板(须在角色描述中注明关系类型):
    • 师徒:技艺传承与权力不对等
    • 父子:血缘羁绊与代际压迫
    • 三人纠缠:三角关系中的忠诚与背叛
    • 艺人与角色:戏中人变成了现实中的命,身份重叠与撕裂
    • 个人身份与时代身份冲突:被时代赋予的身份 vs 内心真实自我
  • 若角色有"现实状态"与"回忆中年轻状态"两种形象,在同一 key_element 内分别说明(Look A:现实;Look B:回忆)。
  • 角色视觉资产构成(通过 media_generator 生成并绑定至对应 key_element reference_image 槽位,标注资产类型):
    • 主视觉身份板:四视图+手部微距拼图
    • 表情库:平静/凝视/隐忍/微悲/克制怒,3—5张
    • 三线光影测试图:冷调版+暖调版+时代压迫版半脸侧光各1张
    • 戏妆/戏服图(戏曲题材时启用):脸谱全脸+戏服全身+后台便装对照
    • 服装细节图(可选)
    • key_element_audio:角色声音参考样本(3—5秒代表性台词,用于跨镜头音色一致)
  • 用户无描述时的默认模板:根据题材自动匹配关系结构——乡土题材→父子(中年父+少年子);戏曲题材→师徒(中年师父+青年学徒);时代题材→个人与时代(主角+被时代改变命运的故人);无法判断题材时→默认"现实中的主角"+"回忆中的故人/逝者"。

element scene(场景)

  • 每个主要场景建立独立 key_element。
  • description 中须包含:地理环境、建筑/地貌特征、核心道具布局(位置坐标说明)、时代氛围、主光源方向(供光影匹配检查使用)。
  • 戏台/仪式场景(戏曲/仪式题材时须包含):戏台结构(台口/台深/出将入相门)、后台(妆镜/衣架/红帘)、观众席空间关系、脸谱/戏服/道具陈设位置。
  • 时代场景:标语墙内容与位置、队列行进路线、广播喇叭位置、公审/集会空间布局。
  • 场景视觉资产构成(通过 media_generator 生成并绑定至对应 key_element reference_image 槽位,标注机位类型与时空版本):
    • 多机位参考图:正拍+航拍/高角度+细节特写+侧拍,共4张
    • 三线光影预览图:同一场景冷调版+暖调版+时代压迫版各1张
  • 用户无描述时的默认模板:根据题材匹配——乡土→老屋/荒路/山野;戏曲→戏台/后台/长廊;时代→广场/标语墙/集体空间;宫廷→殿堂/廊道/高阶。

Shot 设计规范

每个 shot 的 description 必须包含:

  • 时空标注:现实冷调 / 回忆暖柔 / 时代压迫
  • 景别与机位:(如极低地平线广角远景 / 纪实中景手持 / 居中对称平视)
  • 运镜:(如锁定 / 缓慢上升 / 手持轻微抖动 / 垂直抬升)
  • 画面内容:人物动作、核心道具、环境细节
  • 台词/声音类型:注明类型——独白(画外音,人物闭口)/ 誓词 / 训话 / 戏文吟唱 / 旧时代规矩话 / 无台词(以动作/沉默表达)
  • 关联 key_element ID:引用对应的场景与角色 element

硬性镜头规则(不可违反):

  1. 每个场景段落的首镜必须是全景环境交代(极低地平线广角远景,天地大于人)。
  2. 情绪转折点使用递进特写或仪式化空间调度(二选一或结合,不强制每次相同):
    • 递进特写:器物→面部→手部(可灵活调整顺序与数量,服务于叙事而非模板化)
    • 仪式化调度:人物站在台阶/门框/长廊/戏台中央,被空间结构框住、压住,以身体姿态(跪/站/转身/回避)传递情绪
  3. 每段沉重叙事之后必须插入1个山河空镜 shot(无人物,3—6秒,山/河/长路/落日/枯木之一)。
  4. 独白/誓词镜头:人物居中对称平视构图,人物闭口,画外音单独处理。
  5. 戏台段落(戏曲题材时):须包含"台上/台下"对照镜头以及后台上妆/脱装仪式镜头。
  6. 时代压迫段落:以集体注视、队列、标语、广播为视觉主体,人物被人群或空间结构包围。
  7. 每个 shot 预设时长:全景/空镜 4—6秒;中景/纪实 5—8秒;特写/仪式调度 3—8秒;独白/誓词 6—10秒。单个 shot 不超过30秒(模型上限)。

音频层(audio_layers)设计

与生成管线的关系: Storyboard 中的 narration audio_layer 是独白/誓词/训话/戏文的权威文本来源。在默认管线中,其文本被逐字转写入对应 shot 的视频 prompt {...} 包裹,由 Seedance 2.5(分辨率 480p) 原生音频输出,不单独生成独立旁白轨道。narration_speaker_profile 用于指导 key_element_audio 声音参考样本的生成参数及视频 prompt 中的音色描述。若 Seedance 2.5(分辨率 480p) 原生音频质量不达标,可将 narration audio_layer 文本通过 text to narration 独立生成为旁白轨道,在 video_assembler 中与视频混音(见 media_generator 降级策略)。

画外独白/誓词/训话(narration)

  • 类型:narration
  • 声音类型多样化:不限于诗意独白,可包括——誓词(庄严短句)、训话(权威压迫式)、戏文吟唱(戏曲题材)、旧时代规矩话(家族/师徒)、克制旁白。
  • 每段3—5句,融入意象但不堆砌;人物少解释,多用动作和沉默。
  • description 中注明 narration_speaker_profile(如"[沧桑男中音,语速缓慢,克制]"或"[师父口吻,低沉命令式]")。
  • 在 layout_instruction 中绑定对应 shot 范围。

戏台/仪式声音层

  • 戏曲题材须规划:锣鼓点(节奏标记)、戏曲唱腔远声、后台衣料摩擦声、木门开合声。
  • 仪式场景须规划:训练口令、跪拜磕地声、换装布料声。
  • 在 description 中注明具体音效内容与时机。

时代声音层

  • 时代压迫段落须规划:广播播报声、队列脚步声、口号齐呼声、标语张贴声。
  • 音量低于独白/誓词,作为背景压迫感存在。

环境音

  • 为每个主要场景规划一条环境音层(风声/鸟鸣/远处水声等),供后期混音使用;在 description 中注明具体音效内容。
4. Media generation

角色视觉资产包生成(阶段1)

使用 TextToImage / ImageToImage,推荐模型 GPT Image 2,分辨率 2K

生成顺序(分两步,先预览确认方向,再生成扩展资产):
第一步 — 主视觉身份板(TextToImage):16:9横版拼图,正面/背面/左侧/右侧全身+手部微距;纯白背景,均匀正面漫射光。展示给用户确认后再继续。
第二步 — 扩展资产(用户确认主视觉方向后执行):

  1. 表情库(ImageToImage,参考主视觉身份板):陈凯歌式5种表情——平静、凝视、隐忍、微悲、克制怒;每张正面半身肖像,背景统一。共3—5张。
  2. 三线光影测试图(ImageToImage,参考主视觉身份板):冷调版(7500—9500K硬分层光)、暖调版(2700—3600K柔晕光)和时代压迫版(5500—6500K顶光硬阴影)半脸侧光各1张。
  3. 戏妆/戏服图(戏曲题材时启用,ImageToImage,参考主视觉身份板):脸谱全脸正面图+戏服全身图+后台便装对照图各1张,描述脸谱图案、戏服色彩材质、头饰细节。
  4. 角色声音参考样本(key_element_audio):使用 text to narration(推荐模型 MiniMax Speech 2.8 HD),按角色 narration_speaker_profile 生成3—5秒代表性台词音频。生成后通过 register → bind 绑定至对应 element character 的 key_element_audio 槽位。若用户已上传声音参考素材,优先绑定用户素材,跳过此步。
    若角色有两种造型(现实/回忆),第二套主视觉身份板使用 ImageToImage(参考第一套)生成,面部结构一致,仅改变年龄/服饰特征;扩展资产同步生成第二套对应版本。声音参考样本每角色仅需一份(不随造型版本重复)。
    生成后通过 register → bind 将所有视觉资产绑定至对应 element character reference_image 槽位,描述中标注资产类型(主视觉/表情库/光影测试)。

场景视觉资产包生成(阶段2)

使用 TextToImage / ImageToImage,推荐模型 GPT Image 2,分辨率 2K
生成顺序(分两步,先多机位确认方向,再生成冷暖光影预览):
第一步 — 多机位参考图(TextToImage):

  1. 正拍机位(平视正面,全貌+核心道具布局与坐标)
  2. 航拍/高角度俯拍(空间关系+环境压迫感)
  3. 细节特写(场景内关键器物微距)
  4. 侧拍机位(场景侧面结构+纵深感)
    共4张,展示给用户确认场景方向后继续。

第二步 — 三线光影预览图(ImageToImage,参考正拍机位图):同一场景冷调版(青灰冷硬光)、暖调版(暖黄柔晕光)和时代压迫版(顶光硬阴影)各1张,构图与道具位置保持与正拍机位一致。
生成后通过 register → bind 将所有资产绑定至对应 element scene reference_image 槽位,标注机位类型与时空版本。

视频镜头生成(阶段5)

默认路径: 使用 MultiModalToVideo,推荐模型 Seedance 2.5,分辨率 480p(默认);用户明确要求更高质量时可切换至 480p(需会员)。
模型降级策略:Seedance 2.5(分辨率 480p) 生成失败,优先切换至同工具内 Seedance 2.5(仅支持 480p)重试;若 Seedance 2.5(分辨率 480p) 也失败,停止当前 shot 生成并通过 reply_to_user 告知用户失败情况,询问是否切换至 ImagesToVideo(推荐模型 Vidu(Q3))作为替代路径——但需提示该路径不支持原生音频输出,音频需改用 text to narration 独立生成。不得静默切换至不同工具。
每个 shot 的参考输入规则:

  1. scene reference_images:绑定该 shot 对应的 element scene 参考图(正拍/航拍/细节,按景别选择最匹配的1—2张)。
  2. element character reference_images:绑定该 shot 中出现的所有角色的身份板图片。
  3. key_element_audio(角色声音参考):若角色有台词/吟诵,绑定对应角色的 key_element_audio 以保持音色一致。
  4. 前镜头视频参考(reference_video):仅当本 shot 与前一 shot 存在极强连续性(同一场景同一运镜延续),才将前一 shot 的 final_shot 作为 reference_video 加入;通常情况不加,避免风格污染。
    递进特写/仪式调度组:递进特写为独立 shot(器物/面部/手部,顺序可灵活调整),每个单独调用生成,duration 建议 4—5s;仪式调度 shot(人物被台阶/门框/长廊/戏台空间框住)duration 建议 5—8s。均使用 MultiModalToVideo(模型 Seedance 2.5,分辨率 480p),以对应参考图作为视觉参考输入;音效/对白通过 prompt 包裹格式写入,由 Seedance 2.5(分辨率 480p) 原生输出。
    山河空镜 shot:无角色引用,仅绑定自然景观参考图或纯文本描述;duration 4—6s,使用 MultiModalToVideoTextToVideoSeedance 2.5(分辨率 480p));环境音通过 <...> 包裹写入 prompt,由模型原生输出。

音频生成策略与降级:

  • 默认管线:全片音频(独白、誓词、训话、戏文吟唱、环境音效、锣鼓点、广播声等)均由 Seedance 2.5(分辨率 480p) 原生音频能力输出。Storyboard 中 narration audio_layer 的文本(独白/誓词/训话/戏文),直接转写进对应 shot 的视频 prompt {...} 包裹中生成;戏台锣鼓、广播、队列脚步等音效通过 <...> 包裹写入。
  • 降级管线:若 Seedance 2.5(分辨率 480p) 原生音频质量不达标或生成失败,将该 shot 的 narration 文本通过 text to narration(推荐模型 MiniMax Speech 2.8 HD,按 narration_speaker_profile 设定音色)独立生成为旁白音频,在 video_assembler 中与视频混音。切换降级管线时需通过 reply_to_user 告知用户。

资产绑定原则

  • 用户上传的照片/影像/音频素材,优先注册为 asset_id 并绑定至对应 key_element,不重复生成。
  • 每个阶段完成后及时完成 bind/rebind,确保 Storyboard 中所有 element 和 shot 槽位均有明确资产锚定,再进入下一阶段。
5. Prompt writing

全局原则

用中文撰写所有 prompt 正文(包括图像和视频);画外独白/誓词/戏文台词同样使用中文。prompt 只描述镜头可见/可听内容,不写心理动机、画外背景信息。

色彩体系写入规则

根据 Final_Video_Spec.md 中选定的色系,在 prompt 中写入对应色彩锚定词:

  • 黄土地系:青灰、沙土褐、炭黑,低饱和,雾化质感,35mm胶片颗粒
  • 霸王别姬系:红黑金为主,戏服彩、脸谱色点缀,舞台段高饱和,后台段低饱和
  • 荆轲刺秦王系:黑、铁灰、暗金、血红,高对比,冷硬
  • 妖猫传系:金、朱红、翠绿、浓墨,浓艳华丽

角色身份板图像 Prompt(TextToImage / ImageToImage)

结构:角色外观锚定(服装/体态/面容/手部)+ 四视图布局说明 + 光照与背景 + 风格锁定词
示例结构(单段落,不分标题):

陈凯歌电影人物造型参考图,[年龄区间],[性别],[体态]。[服饰颜色/材质/状态]。面部:[皱纹/眼神/疤痕等]。手部:[老茧/伤痕/形态]。横向四视图拼图:正面全身 / 背面全身 / 左侧全身 / 右侧全身,左下角附手掌微距。纯白背景,均匀正面漫射光,无阴影,无多余道具。写实摄影风格,35mm肖像质感。

戏妆角色(戏曲题材):额外生成脸谱全脸正面图+戏服全身图+后台便装对照图,prompt 须描述脸谱图案、戏服色彩材质、头饰细节。

场景参考图 Prompt(TextToImage)

结构:风格锚定(含色系)+ 场景内容 + 机位说明 + 光影时空 + 技术参数

陈凯歌电影风格,[色系锚定词],山河史诗感/戏台仪式感/时代压迫感。[场景名称与核心内容]。[机位说明:平视正拍/高角度俯拍/微距特写]。[光影时空:现实冷调硬分层光 / 回忆暖柔晕染光 / 时代压迫顶光硬阴影]。极低地平线广角构图,天地大于人。[色系技术参数]。35mm胶片质感,宽幅构图感(画面比例保持16:9)。

B模式追加文本(用户输入包含"提高清晰度"、"高清"、"清晰"、"锐化"任一关键词时)

清晰度执行标准:4K超分级细节增强,皮肤毛孔、睫毛、衣物织纹、背景纹理清晰可见,不做柔化。高光保留细节,阴影提亮至中灰以上,伽马值1.8—2.0,画面通透均匀,白平衡5500K。饱和度不变,仅提升清晰度与细节,不改变色彩风格。
B模式下去除"雾化质感""35mm胶片颗粒"等柔化描述词,替换为上述追加文本;构图、景别、光影时空、色系描述保持不变。

视频镜头 Prompt(MultiModalToVideo)

参考图绑定占位符:按 <<<image_1>>>、<<<image_2>>> 顺序标注(场景参考图在前,角色参考图在后)。
结构(运动栈顺序):

参考图占位 → 时空标注 → 景别/机位 → 运镜 → 主体动作与面部细节 → 场景空间变化 → 音效/对白(Seedance 2.5包裹格式)

Seedance 2.5(分辨率 480p) 音效包裹规范:**

  • 背景音乐:(...) — 几乎所有镜头均写 (no music),仅环境音。
  • 音效/环境音:<...> 格式——除风声、水声外,须主动使用陈凯歌特色音效:锣鼓点 <远处锣鼓声>、戏曲唱腔远声 <隐约戏腔>、训练口令 <教官口令>、广播 <广播播报声>、队列脚步 <整齐脚步声>、衣料摩擦 <戏服摩擦声>、后台木门 <木门吱呀声>。
  • 对白/独白/誓词/戏文(画外音):独白/誓词/训话/戏文镜头人物闭口,将 Storyboard narration audio_layer 中的文本逐字写入 {...} 包裹,由 Seedance 2.5(分辨率 480p) 原生音频输出;若该 shot 已降级为 text to narration 独立旁白管线,则视频 prompt 中不写 {...},改为 {no dialogue},旁白在 video_assembler 中混入。无台词镜头写 {no dialogue}。
  • 片名/字幕:【...】 — 所有镜头均写 【no subtitles】

仪式化调度镜头 prompt 要点:

  • 描述人物与空间结构的关系:台阶高度、门框宽度、长廊纵深、戏台尺度——让空间比人大。
  • 描述身体姿态:跪/站/转身/回避/跪拜的幅度与速度。
  • 不写情绪判断词,只写可见的空间关系与身体动作。

戏台段落 prompt 要点:

  • 台上:描述戏服色彩、脸谱、身段动作、台口光线,与台下形成色彩/身份反差。
  • 后台:描述妆镜、红帘、戏服挂架、上妆/脱妆动作,低饱和暖光。
  • 身份错位:同一角色台上台下对照,prompt 须明确"同一人"的视觉锚点。

时代压迫段落 prompt 要点:

  • 描述集体场面:队列方向、人群密度、标语内容(可渲染文字)、广播喇叭位置。
  • 人物被人群或建筑包围,空间收窄。
  • 音效以 <广播声>、<队列脚步>、<口号齐呼> 为主。

递进特写镜头 prompt 要点:

  • 器物特写:精确描述材质/状态/光线角落,构图居中,极浅景深。
  • 面部特写:描述眼神方向、皱纹纹理、微表情,不写情绪判断词,只写可见细节。
  • 手部微距:描述手指动作幅度、皮肤纹理、与道具的接触状态。
  • 顺序可灵活调整,服务于叙事节奏而非固定模板。

山河空镜 prompt 要点:
无人物,描述自然元素运动(如"枯草随风伏倒"、"远山云雾缓缓流动"),运镜多用锁定或极缓慢水平移动,duration 4—6s,(no music),<环境风声>。

固定负向词(standing negatives,每条视频 prompt 末尾附加):

(no music), 【no subtitles】, no watermark, no text overlay.

注意:有台词/独白/誓词/戏文的镜头,将文本写入 {...} 包裹;无台词镜头追加 {no dialogue}。不要在所有镜头统一写 {no dialogue}。

6. Video assembly

剪辑节奏与时空转场

整体节奏原则: 陈凯歌式剪辑不以快切见长,而以"留白—压迫—爆发—沉默"的呼吸节奏驱动。镜头时长尊重分镜表预设(全景/空镜4—6秒,中景/纪实5—8秒,特写/仪式3—8秒,独白/誓词6—10秒),不随意加速或裁剪叙事镜头。

三线时空转场规则:

  • 现实→回忆:以逆光剪影独立 shot 作为转场媒介,回忆段以暖黄柔光晕染进入。
  • 回忆→现实:回忆段末尾以山河空镜收束,自然过渡回现实冷调。
  • →时代压迫:以广播声渐入或队列脚步声渐近作为音频先行转场,画面从远景切入时代符号(标语墙/队列/广场)。
  • 时代压迫→其他:以硬切或黑场短暂停留(0.5—1秒)制造窒息感后再转入下一时空。

山河空镜缓冲: 每段沉重叙事(仪式/训诫/时代压迫/情感爆发)之后,必须保留山河空镜 shot 作为情绪缓冲,不得在剪辑中删除或缩短至3秒以下。空镜之间不叠加音乐,仅保留环境音。

音频混音规则

音量层级(从高到低):

  1. 独白/誓词/训话/戏文(核心叙事音频)— 全片最高优先级,清晰可辨。
  2. 对白/戏台唱腔 — 略低于独白,保持空间感。
  3. 戏台锣鼓/仪式音效 — 中等音量,作为节奏标记。
  4. 时代声音层(广播/队列脚步/口号)— 低于独白,作为背景压迫感存在。
  5. 环境音(风声/水声/鸟鸣)— 最低层,营造空间氛围。

降级旁白混音: 若部分 shot 降级为 text to narration 独立旁白管线,旁白音频需与对应视频段精准对齐(以 shot 起始帧为准),音量与 Seedance 2.5(分辨率 480p) 原生独白保持一致,避免音质跳变。相邻 shot 若一个使用原生音频、一个使用降级旁白,需在交界处做0.3秒交叉淡化以平滑过渡。

静音处理: 独白/誓词镜头中人物闭口,视频原生音频中不应出现人物说话声;若 Seedance 2.5(分辨率 480p) 误生成嘴部动作伴随声音,在混音阶段将该段视频音轨静音,仅保留旁白轨道。

拼接与导出

  • 按分镜表顺序逐镜头拼接,不得自行调整镜头顺序(用户在质检确认节点已逐项审核)。
  • 镜头间转场以硬切为主;时空转换处可使用0.5—1秒黑场或逆光剪影过渡。
  • 导出前确认全片时长与 Final_Video_Spec.md 中记录的总时长意向基本一致;若偏差超过20%,通过 reply_to_user 提示用户。
  • 导出比例为 16:9。