yeha.ai
목록으로

Zhang Yimou cinematic aesthetic

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

此skill适用于国风武侠、历史史诗短片及高端国潮广告等创作领域。源自张艺谋电影中极致的色彩美学与视觉仪式感,它能精准解决AI视频画面廉价、角色频繁换脸、光影缺乏质感等痛点,帮您一键输出大师级的电影画

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

创作流程与阶段依赖

  1. 锁定全局参数:与用户确认以下输入,写入 Final_Video_Spec.md(via text_editor):

    • 核心创意(一句话灵感或剧情描述)
    • 主色调:英雄红(热烈/宿命) / 影墨黑(水墨/隐忍) / 竹林绿(清冷/杀机) / 大漠黄(风沙/生命力)
    • 节奏类型:慢节奏仪式感长镜 / 中节奏叙事流 / 快节奏蒙太奇(默认慢节奏)
    • 运镜倾向:仪式化静止 / 升格慢动作 / 混合模式(默认混合模式)
    • 总时长(默认 30 秒)
    • 是否提供参考图(人物面容、服装或场景)
      若用户仅提供文字描述,从描述中自动提炼角色外貌与场景设定写入 spec;若用户提供参考图,先调用 resource_prepare_and_analyze 解析后再写入 spec。
  2. 生成故事板:调用 storyboard_designer,设计角色 key_element(含身份板布局描述)、场景 key_element,以及完整分镜列表和跨镜音频层。

  3. 生成并确认 key_element 参考资产:调用 media_generator 为 Storyboard 中所有角色、场景、道具、载具等 key_element 生成或绑定参考图;若用户已上传参考图,先注册并绑定为对应 key_element 资产。

  4. 逐镜生成视频:仅当所有被 shot 引用的 key_element 均已拥有确认过的 asset_id / reference_image 后,调用 media_generator 按分镜列表依次生成,强制引用对应 key_element 参考图,确保跨镜人物、场景、道具与载具关系一致。

  5. 生成音频层:调用 media_generator 生成跨镜环境音或 BGM 音频层。

  6. 剪辑合成:仅在用户确认音频层后,调用 video_assembler 完成时间线组装、节奏卡点和音画同步,输出最终视频。

依赖顺序:2→1;3→2;4→3;5→2;6→3,4,5。

关键节点暂停确认

  • 全局参数写入后,向用户展示 spec 摘要,等待确认再进入故事板设计。
  • 故事板完成后,向用户展示分镜列表和 key_element 清单,等待确认后再开始生成或绑定 key_element 参考资产。
  • key_element 参考资产生成后,向用户展示角色 / 场景 / 道具 / 载具参考图并等待确认;若任一参考图缺失、未绑定或与 Storyboard 不匹配,必须先补齐或重生成,不得进入分镜视频生成。
  • 音频层生成完成后,向用户展示环境音 / BGM 的试听结果或摘要,等待用户确认后再进入剪辑合成;若用户要求修改音频,先重做音频层,不得直接进入 video_assembler
  • 不得一次性跑完整个流程。

异常处理与重试策略

  • 人物一致性失控(角色面容、服装与 key_element 身份板明显不符):

    • 首先检查该 shot 是否正确引用了角色 key_element 身份板图像作为 reference_image;若漏绑,补绑后重新调用 media_generator 生成。
    • 若已绑定但仍不一致,指示 media_generator 切换至 Kling 3.0 Omni(refer_type: feature)重试同一 shot;最多重试 2 次。
    • 重试后仍失控,向用户说明情况,询问是否接受当前结果或提供补充参考图后再生成。
  • 色彩漂移(主色调统治力不足,画面出现大面积杂色或低对比度平光):

    • write_media_prompt 重写该 shot 提示词时,强化主色调关键词权重,并在否定词中追加对应干扰色(如"no desaturated red, no cool blue cast");重新调用 media_generator 生成。
    • 若重试后色彩仍不达标,向用户说明,建议更换参考场景图或调整主色调选项。
  • 自然媒介缺失(风/雨/雪/沙动态不可见或极弱):

    • 重写该 shot 提示词,在空间/环境段明确提升自然媒介的视觉强度描述(如"暴雨砸落的密度极高,水花飞溅至膝盖"),重新生成。
  • 模型失败(生成报错或超时)

    • 优先在同工具内切换模型(如 Seedance 2.5(分辨率 480p) → Kling 3.0 Omni)重试;若同工具内所有模型均失败,停止该 shot 生成并向用户说明,不自动切换至其他工具。
2. 멀티모달 분석

分析用户上传的参考图

  • 人物参考图:提取性别、年龄感、面部特征(骨骼轮廓、肤色、眼型)、发型发色、服装材质与配色、标志性道具;输出结构化角色外貌描述,绑定至对应角色 key_element。
  • 场景参考图:提取空间类型(殿堂 / 山野 / 竹林 / 大漠等)、主色调占比、光线方向与质感、标志性建筑或道具元素;输出结构化场景描述,绑定至对应 scene key_element。
  • 服装参考图:提取材质(粗麻 / 重工甲胄 / 轻纱等)、颜色比例、装饰细节;合并入对应角色 key_element 描述。
3. 스토리보드 설계

设计角色 key_element(身份板)

  • 每个主要角色建立一个 key_element,描述须包含:
    • 外貌特征(骨骼轮廓、肤色、眼型、发型发色)
    • 服装材质与配色(如:粗麻布袍、铁锈红重工甲胄、飞扬宽袖)
    • 标志性道具或配饰
    • 角色情绪标签(如"隐忍""决绝""宿命感")
  • 身份板图像布局指导(供图像生成使用):16:9 横版,纯白背景,不对称分布,大量留白;包含四区块:
    1. 大型主视觉:全身正面或微侧,展现服装质感
    2. 轮廓研究区:2–3 个黑色剪影(正/侧/背)
    3. 表情研究区:3–4 个头像特写(静默、决绝、含泪、隐忍)
    4. 细节研究区:局部特写(衣物纤维、皮肤纹理、手部或佩剑饰物)
  • 后续所有分镜中的人物视觉,均以该 key_element 身份板资产为一致性基准。

设计场景 key_element(场景身份板)

每个主要场景建立一个 key_element,描述须包含:

  • 空间类型:殿堂庙宇 / 山野荒原 / 竹林幽径 / 大漠戈壁 / 雨中街巷等
  • 主色调统治力:标注主色调占画面比例(建议 ≥ 65%),其余元素的降饱和度或水墨化处理要求
  • 光线特征:自然光源方向(正侧光 / 强逆光 / 顶光天幕散射等)、时段(黎明金光 / 正午高反差 / 黄昏长影 / 夜景烛火点染)
  • 标志性固定元素:廊柱、屏风、竹节密度、黄沙地平线高度、建筑门洞比例等在各 shot 中须保持一致的视觉锚点
  • 常驻大自然媒介:该场景默认搭载的自然动态(如"竹林场景默认搭载流动微风,可升级为狂风"),为分镜中的媒介选择提供基准

场景身份板图像布局指导(供图像生成使用):16:9 横版,深色或与主色调呼应的纯色背景,不对称分布,大量留白;包含四区块:

  1. 大型主视觉:场景全景或大景别展示,重点呈现空间纵深、标志性构件与主色调统治力
  2. 光影研究区:2–3 张同场景不同光线条件下的缩略图(黎明 / 黄昏 / 夜景 / 暴雨),展示场景在各情绪下的色调变体
  3. 细节研究区:3–4 张局部特写——地面材质(青石板 / 黄沙 / 落叶 / 泥泞)、墙体或植被纹理、标志性道具或建筑构件
  4. 构图框架示意区:1–2 张标注了对称轴线或框架构图入口(门洞 / 廊柱间距 / 竹节间隙)的构图草图,为后续分镜构图提供参照

后续所有分镜中引用该场景时,均以此 key_element 身份板资产作为场景一致性基准,确保色调、光线方向与标志性构件在多镜头中保持视觉稳定。

设计分镜列表

依据 Final_Video_Spec 节奏类型规划镜头时长:

  • 慢节奏:单镜 6–12 秒,固定长镜头占比 ≥ 70%
  • 中节奏:单镜 4–8 秒,手持跟拍与固定长镜混合
  • 快节奏:单镜 2–4 秒,仅用于动作对决高潮段落

每个 shot 描述必须包含:

  • 场景:引用对应 scene key_element ID
  • 故事节拍:角色仪式化动作(拔剑 / 转头 / 合眼等,极度克制)与台词(如有)
  • 景别与构图:景别(远景/全景/中景/近景/特写)+ 构图类型(对称构图 / 框架构图 Frame-in-Frame)
  • 镜头运动:固定 / 缓推 / 缓拉 / 升格慢动作 / 手持微晃
  • 大自然媒介:每镜必须包含且放大一种——飞扬狂风 / 砸落暴雨 / 静谧飞雪 / 弥漫风沙
  • 光影:光源方向(大侧光 / 强逆光)与明暗对比层级要求
  • 微表情细节(含人物特写时):用生理细节描述情绪,禁止"愤怒""悲伤"等抽象词

跨镜头连续性设计

  • 若多个 shot 属于同一次奔跑、追逐、对峙、交接或情绪推进,必须标注同一个 continuity_group,并为每个 shot 写明:前一镜继承状态、本镜叙事功能、后一镜交接状态。
  • 继承状态只记录会影响画面的关键事实:角色位置、运动速度、环境强度、关键道具状态;不要复述前一镜完整构图与风格描述。
  • 特写或插入镜头如果发生在连续动作中,Storyboard 必须写出至少 2 个可见连续性证据(如载具局部、缰绳/鞍具、身体惯性、背景视差、风沙方向、道具摆动频率),避免被下游写成孤立的质感特写。

设计跨镜音频层

  • 默认设置一条环境音 audio_layer(风声 / 雷雨声 / 金属摩擦声,与主色调和场景匹配)
  • 若用户要求 BGM,增加一条 music audio_layer,描述情绪与乐器偏好(沉郁、宿命感、弦乐主导等)
  • 默认无 narration 轨道、无字幕
4. 미디어 생성

角色身份板图像生成

  • 使用 TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
  • 若用户已上传参考图,改用 ImageToImage(同模型),以上传图作为参考输入,生成标准身份板布局。
  • 生成后注册 asset_id,绑定至对应角色 key_element。

分镜视频生成

  • 使用 MultiModalToVideo,模型:Seedance 2.5,分辨率 480p(默认)。
  • 视频生成前必须读取最新 Storyboard,逐项检查每个 shot 引用的角色、场景、道具、载具等 key_element 是否都已绑定可用 asset_id / reference_image,并已通过用户确认;如有缺失、未确认或绑定错误,先生成、注册或重绑对应 key_element,不得直接生成该 shot。
  • 每个 shot 的参考输入:
    1. 强制引用该 shot 所涉角色的 key_element 身份板图像作为 reference_image
    2. 强制引用该 shot 所涉场景、道具、载具等 key_element 图像作为 reference_image
    3. 当当前 shot 与前一 shot 属于同一 continuity_group,且存在同一角色、同一载具、同一动作方向或同一道具状态时,优先将前一 shot 的 final_shot 视频加入 reference_video
  • 禁止在无参考图的情况下纯文本生成主角视频,以免丢失人物一致性。

异常重试规则(媒体生成层)

  • 人物一致性失控:确认 key_element 身份板图像已正确绑定为 reference_image 后,切换至 Kling 3.0 Omni(refer_type: feature)重试,最多 2 次;仍失控则上报 Planner 处理。
  • 色彩漂移(主色调统治力不足、杂色污染画面):强化提示词中主色调关键词权重,追加对应干扰色的否定词(如 no cool blue cast, no desaturated red),重新生成该 shot;重试最多 1 次,仍不达标则上报 Planner。
  • 自然媒介动态缺失(风/雨/雪/沙动感不可见):在提示词空间/环境段追加更强烈的自然媒介视觉描述后重试 1 次。
  • 模型级失败(报错或超时):优先在当前工具内切换备用模型重试;若工具内所有模型均失败,停止该 shot 生成并上报 Planner,不跨工具强行兜底。

音频层生成

  • 环境音 / BGM:使用 text_to_instrumental,模型:Suno 5(备选 Mureka 8),依 audio_layer 描述的情绪与乐器偏好生成。
  • 默认不生成 narration 轨道。
5. 프롬프트 작성

图像提示词——角色身份板(TextToImage / ImageToImage)

按以下模板撰写,用角色 key_element 描述中的具体信息替换占位符:

16:9横版,纯白色背景,电影级角色设计身份板,高端构图,不对称分布,大量留白。主视觉:[角色外貌/服装/道具描述],全身正面或微侧展示服装材质质感。另含2–3个黑色独立剪影(正/侧/背),3–4个面部表情特写(静默、决绝、含泪、隐忍),局部细节区(衣物纤维、皮肤纹理、手部或佩剑饰物)。整体干净优雅,禁止任何现代磨皮、塑料滤镜与堆叠裁剪。

图像提示词——场景身份板(TextToImage / ImageToImage)

按以下模板撰写,用场景 key_element 描述中的具体信息替换占位符:

16:9横版,[与主色调呼应的深色或纯色]背景,电影级场景概念设计身份板,高端构图,不对称分布,大量留白。主视觉:[场景空间类型 + 标志性构件描述],全景或大景别展现空间纵深与主色调统治力。另含2–3张同场景不同光线条件下的缩略图(如黎明金光 / 黄昏长影 / 暴雨灰调),3–4张局部特写(地面材质、墙体或植被纹理、标志性道具或建筑构件),以及1–2张标注了对称轴线或框架构图入口的构图草图。整体风格写实电影感,保留环境颗粒与光影层次,禁止糖水色调与过度锐化。

两类身份板提示词写作共同原则:

  • 主视觉区必须先描述最关键的视觉锚点(角色用"骨骼轮廓+服装材质",场景用"空间构件+主色调"),再补充次要细节
  • 各分区之间用留白隔开,不堆叠、不裁剪、不重叠
  • 禁止在身份板内出现现代感排版元素(如极简 App 风格图标、渐变色块)

视频提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))

参考图绑定:每个涉及角色/场景的参考图使用 <<<image_1>>>、<<<image_2>>> 等占位符明确标注。

提示词结构(按动作栈顺序书写):

  1. 镜头运动:固定长镜头 / 缓慢推镜 / 升格慢动作(配合仪式化动作强调宿命感)

  2. 主体动作:仪式化动作(拔剑、转头、合眼等),极度克制缓慢;情绪必须拆解为生理细节,禁止使用"愤怒、悲伤、恐惧、坚定"等抽象情绪词。以下为标准替换示例,撰写时参照此粒度:

    禁止写法(抽象)正确写法(生理细节)她很愤怒她的颧骨肌肉抽动,牙关死死咬紧,鼻翼急速扇动,眼神定住不眨他很悲伤一滴泪在强逆光下从下眼睑边缘凝聚,沿面部尘土缓缓下坠,嘴唇内侧被咬破一道细小的印痕,呼吸间隔拉长至近乎窒息她感到恐惧她的手指尖微微发颤,指甲掐入掌心留下月牙形压痕,喉结轻微上下滑动,眼白略微扩张,视线向右下角偏移他意志坚定他缓缓收拢五指,将剑柄握紧至指节泛白,抬起下颌约两度,侧颈肌肉绷紧如绳,眼皮一动不动她内心复杂她的视线在虚空中停留三秒后,缓缓垂落至手中的物件;嘴角微微下拉又立刻收回,一个细微的、未完成的表情

    写微表情时优先使用眼部(眼白扩张、眼睑颤抖、凝视方向)、口部(咬牙、嘴唇开合幅度、发音肌群)、颈部与手部(肌肉绷紧、血管浮现、指节变色) 三个区域的组合描写,形成情绪层次。

  3. 空间与环境:构图类型(对称构图 / 框架构图——透过红纱/竹叶/窗棂/刀剑缝隙窥视主体)+ 大自然媒介(飞扬的狂风 / 砸落的暴雨 / 静谧的飞雪 / 弥漫的风沙)

  4. 光影:大侧光勾勒骨骼轮廓 / 强逆光使边缘发丝与雨滴发光;明暗对比强烈,暗部呈深邃玄色;严禁大平光

  5. 色彩:以 Final_Video_Spec 主色调统领画面;非主色调元素低饱和度或水墨化处理,形成极致视觉聚焦

  6. 质感:保留皮肤毛孔、汗水与尘土痕迹,轻微电影胶片颗粒感;严禁糖水片美颜与过度锐化

固定否定词:no subtitles, no narration, no music(音频由独立音频层处理),no plastic skin, no flat lighting, no beauty filter。

多段内部剪辑:若 shot 内含多个故事节拍,按叙事顺序列出各段动作描述,不使用时间码切割。

6. 동영상 조립

输出规格

  • 画面比例:16:9,目标分辨率 1080p(生成完成后通过 super_resolution,模型 MediaKit 升级至 1080p,fps 默认不提升)
  • 视频质感:保留轻微电影胶片颗粒感(Film Grain);不额外添加锐化或美颜处理

节奏与卡点规则

  • 依据 Final_Video_Spec 节奏类型严格执行镜头时长规划:
    • 慢节奏(单镜 6–12 秒):以镜头内部自然动态(风吹、叶落、雨滴落地瞬间)作为剪切锚点,动态达到视觉峰值时出点,不提前硬切
    • 中节奏(单镜 4–8 秒):以角色关键动作节点(拔剑完成、转头到位)作为出入点,形成动作接续感
    • 快节奏(单镜 2–4 秒):严格卡环境音效峰值或 BGM 鼓点切换,强调爆发感;连续快切不超过 10 镜,之后必须插入一个 ≥ 4 秒的呼吸镜头

转场规则

  • 默认:镜头间使用直切(Hard Cut),维持克制的电影质感
  • 仪式感长镜过渡:相邻两镜均为慢节奏长镜时,可使用 0.3 秒溶解转场(Dissolve),增强时间流逝感;每片溶解转场不超过 3 次,避免节奏松弛
  • 高潮段落入口:在慢节奏转入快节奏蒙太奇之前,插入一个 0.5 秒黑场隔断,制造节奏反差与心理预期
  • 严禁使用滑动、翻页、缩放等现代感转场

音轨合成与分轨音量

  • 环境音轨(风声 / 雷雨 / 金属摩擦等):贯穿全片,设为基准音量 0dB;镜头切换时环境音不断,形成空间连续感
  • BGM 轨道(如有):整体音量比环境音低 3–5dB(视 BGM 动态范围调整),情绪高潮段可短暂拉平至与环境音等响,高潮过后 2 秒内回落
  • 音频优先级:环境音 > BGM;两轨同时存在时,BGM 中频段若与环境音冲突,对 BGM 施加轻微中频压缩,保留环境音的空间质感
  • 无旁白、无字幕轨道(默认)

淡入淡出时机

  • 片头:画面从黑场 0.5 秒淡入;环境音同步从静音渐入,与画面淡入等长(0.5 秒),BGM(如有)延迟 0.5 秒后再淡入,避免开场音效堆叠
  • 片尾:画面 1 秒淡出至黑场;BGM(如有)提前 0.5 秒开始渐出,环境音跟随画面同步在 1 秒内淡出至静音,避免 BGM 在黑场中孤立残留
  • 段落间黑场(快慢节奏切换处):黑场时长 0.5 秒,环境音在此段降至 −12dB 后恢复,不完全静音,保持空间感