yeha.ai
返回模板库

胡金铨电影美学风格

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

用于生成具有胡金铨电影美学风格(水墨画留白、京剧锣鼓剪辑节奏、明代服饰道具与框中框构图)的武侠 AI 视频及短片。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

全流程规划与执行步骤:

  1. 确立全局规范:在项目启动之初,首先通过 reply_to_user 向用户询问视频画面比例,并提供以下选项供选择(必须以卡片或列表形式呈现,推荐 16:9):

    • 16:9(推荐)— 宽银幕电影比例,最契合胡金铨山水横卷意境
    • 21:9 — 超宽银幕,极致宽银幕电影感
    • 4:3 — 复古方画幅,具有早期武侠片时代感
    • 3:4 — 竖屏竖幅,适合手机/短视频竖版呈现
    • 1:1 — 方形画幅,适合社交媒体发布

    获得用户确认后,再调用 text_editor 编写 Final_Video_Spec.md,将宽高比及其他全局参数(时长、核心视觉风格定位、输出语言等)一并写入,作为后续设计与生成的全局规范锚点。

  2. 设计故事板(Storyboard):调用 storyboard_designer 规划故事板。包括定义 key_elements(角色、场景、道具)、镜头列表(shots)和独立音频轨道(audio_layers)。

  3. 处理与分析参考素材

    • 检查并提取用户提供的任意参考素材(图片、视频、文本或音乐)。调用 resource_prepare_and_analyze 对其进行多模态分析。
    • 调用 media_generator 的 asset 管理能力,将分析提取的媒体注册为稳定 asset_id 并将其绑定(bind)到故事板对应的 key_elements(如角色形象或 key_element_audio 声音参考)或 shots 中。
  4. 建立核心元素(Elements)视觉

    • 针对没有绑定已有素材的 key_elements,调用 media_generator 选用 TextToImage 或 ImageToImage 批量生成高品质的静态元素图片,重点锁死明代服饰、妆容和标志性道具(如斗笠、飞鱼服、长剑)的视觉一致性。
  5. 生成分镜视频(Shots)

    • 针对故事板中的每一个 shot,调用 media_generator 的视频生成路径(首选 MultiModalToVideo 路径)。将生成的 key_elements 静态图像绑定为视觉参考,结合镜头运动提示词生成动态视频。
  6. 生成音频与旁白轨道(Audio Layers)

    • 调用 media_generator 依次生成独立音频层:配乐(调用 text_to_instrumental / lyrics_to_song 生成传统民乐 BGM)和旁白(调用 text to narration),并针对有对白台词的角色利用其绑定的 key_element_audio 保持音色一致。
  7. 时间线合成与剪辑

    • 调用 video_assembler 载入所有已生成的 shot 视频和音频素材(配乐、旁白、环境音),严格按照故事板中的节奏设计、音画对齐规则以及淡入淡出要求,合成最终的视频时间线。

依赖关系:

  • 2 -> 1(故事板设计依赖全局 Spec)
  • 3 -> 2(素材分析与绑定基于故事板结构)
  • 4 -> 3(元素静态图生成依赖已有素材绑定状态)
  • 5 -> 4(视频 shot 生成强依赖已建立的元素视觉参考)
  • 6 -> 2(音频生成严格对应故事板设计的音频轨道)
  • 7 -> 5, 6(时间线装配必须在所有视听素材准备就绪后进行)

暂停与确认机制:
在执行过程中,不得一气呵成跑完。必须在以下关键节点暂停,并使用 reply_to_user 向用户展示阶段性成果,获得确认后方可进入下一阶段:

  1. Final_Video_Spec.md 确立后,确认整体美学、主题与时长基调。
  2. 故事板(Storyboard)设计完成后,确认镜头序列、叙事节奏及留白规划。
  3. 核心 key_elements 画面/角色图生成后,确认视觉风格、朝代服饰与色彩色温。
  4. 视频 shot 草片及音频层生成后,确认动态张力与听觉层次。
2. 多模态分析

输入素材(Images, Videos, Audios, Text)的多模态深度解析规范:

  1. 参考图片分析 (Image Analysis)

    • 解析场景类型(如竹林、荒野、客栈室内、古寺、山水远景),判断是否符合胡氏美学地理环境。
    • 识别构图特征:优先寻找“留白”(天空/雾气占比)、“框中框”(利用门窗、树枝遮挡)、“横向卷轴感”或“深纵深三层法”构图。
    • 提取色彩与光影:记录是否为水墨灰调、暖黄古调或青绿山水,分析是否存在逆光剪影、体积雾光或柔和散射光。
    • 识别人物及道具:解析人物的服装朝代(必须校准为明代服饰特征如斗笠、褶裙、飞鱼服)、体态神情及所持兵器,将其结构化并输出。
  2. 参考视频分析 (Video Analysis)

    • 提取镜头运动模式:分析是缓慢横移、固定凝视还是纵深缓推。若包含剧烈摇晃或现代快速变焦,需在分析报告中指出并建议修正。
    • 识别剪辑节奏与转场:记录镜头平均时长,标记是否具有硬切、黑场遮挡等传统剪辑特征。
    • 关键帧提取:对长视频进行抽帧分析,提炼核心角色的视觉特征和环境色调。
  3. 文本/脚本素材分析 (Document/Script Analysis)

    • 场景拆解:将剧本提炼为结构化场景列表,细分场景的时间、地点、人物及情绪。
    • 意境映射:找出剧本中适合胡金铨美学表现的段落。例如,将“行者赶路”映射为长镜头横移跟拍;将“对决前夕”映射为静止凝视、框中框构图和沉默留白。
  4. 音频/音乐素材分析 (Audio Analysis)

    • 识别传统乐器成分:如古琴、箫、笛、打击乐(京剧锣鼓声)。
    • 记录节奏变化:标注节拍舒缓(静谧段落)或急促(打斗段落),为后续 video_assembler 锣鼓点剪辑提供节奏锚点。
3. 故事板设计

故事板(Storyboard)创意设计准则:

  1. Key Elements(关键元素)设计规范:

    • element character(角色元素):必须细致描述角色的明代装束。例如:身着素色棉麻长袍、头戴斗笠、足穿草鞋、手持铁剑的独行侠客(符合胡金铨“点景人物”特征,人物不过于张扬,融入山水)。
    • element scene(场景元素):详细描述空间层次。客栈空间须有深色木梁、纸灯笼及楼梯廊柱,以利于穿透性构图;山水场景须写明“云雾缭绕”、“竹林幽深”,保证至少 40% 的画面留白空间。
    • 一致性约束:如果用户提供了参考画面或剧本,key_elements 的文字描述必须与其严格保持一致,不得凭空捏造背离明代背景的科幻或现代元素。
  2. Shots(分镜镜头)设计规范:

    • 推崇长镜头与内切:避免过于细碎的现代微切。每个 shot 时长设计在 5s 到 30s 之间(不超过 30s 模型极限)。在镜头描述中写明“在单一镜头内完成人物由远及近的走位及镜头缓推”。
    • 经典镜头序列(慢-快-慢)设计
      • 开篇(起):设计山水空镜或大远景,人物作为山水中的点缀,确立空灵留白基调。
      • 铺垫(承):设计长镜头横移跟拍,记录人物行走或环视,展现环境的广阔与深邃。
      • 高潮(转):冲突/动作 shot。镜头切换频率加快,但画面本身保持稳重,利用门框、窗棂形成"框中框"对峙构图,写明具体的京剧锣鼓节奏点与人物身段亮相。
      • 打斗段落 shot 时长分级
        • 对峙蓄力阶段(亮相、凝视、抽刀):单 shot 时长 3–6s,给足张力蓄积空间;
        • 动作爆发阶段(交锋、身段翻飞):单 shot 时长压缩至 1–3s,以高频硬切制造凌厉节奏;爆发段落连续硬切不少于 3 刀,且每刀均须对齐锣鼓重拍;
        • 收势定格阶段(落地、亮相停顿):单 shot 时长 2–4s,以静制动,配合锣鼓收势的尾音余韵。
      • 锣鼓节拍对齐规则:在 shot 描述中须标注该 shot 对应的锣鼓点类型,例如:[锣鼓·急急风起](连续快节拍,用于追逐/连招)、[锣鼓·单锤亮相](单次重击,用于高潮定格)、[锣鼓·渐强收势](鼓点由密到疏,用于收招)。剪辑点必须精确落在对应锣鼓重拍的起点。
      • 收尾(合):再次切回大远景、空镜或天空,伴随黑场转场,留下悠远余韵。
    • 写实视觉与镜头语法:每个 shot 必须清晰指定:画面描述(含动作细节、神情)、构图方式(如:远景全景、框中框、纵深三层景)、镜头运动(如:横移跟拍、固定凝视、缓推)、以及 声音设计
    • 画风锁定(跨镜一致性约束):每个 shot 的描述中必须显式继承并重申全片统一的美学标记,包括:低饱和大地色调、偏青阴影、胶片颗粒质感、水墨留白构图基调。不得因场景切换(如从竹林到客栈)而引入与既定色温或质感相悖的描述(如"明亮霓虹"、"高饱和暖橙"、"现代打光"等)。每个 shot 的视觉风格必须与第一个已确认的 key_element 图像的色调和质感保持严格一致。
  3. Audio Layers(音频轨道)设计规范:

    • music 轨道:全局至少设计一条中式古风 BGM 轨道,以胡金铨武侠电影的听觉美学为基准——古琴主旋律、洞箫/笛子为辅、中阮/琵琶拨弦点缀,以稀疏克制的京剧锣鼓声为节奏骨架,整体呈现肃穆、悠远、气韵深沉的古意。严禁引入现代电子音效、西洋管弦或流行配器。BGM 随剧情分段设计张力:静谧段落以极弱的古琴单音维持空气感,对峙/打斗段落以锣鼓渐强推进节奏。
    • 环境音轨道:设计独立的环境音图层,作为全片的声音基底。每条环境音轨道须明确标注其覆盖的 shot 区间、声源类型及空间感描述,具体预设如下:
      • 竹林风声(Bamboo Wind):出现于竹林场景,描述为"微风穿林、竹叶摩挲沙沙声,偶有竹枝轻响,远近层次分明",营造幽深宁静感。
      • 松涛声(Pine Roar):出现于山岭、高台场景,描述为"高处松风低沉呼啸,偶夹远处鸟鸣,极具空旷纵深感"。
      • 流水声(Running Water):出现于山涧、溪边场景,描述为"细流潺潺,偶有水滴落石声,清冽透彻"。
      • 寺庙钟声(Temple Bell):可作为点缀性声效单独出现,亦可跨场景作为时空转换的听觉标记;描述为"低频余韵悠长的铜钟声,一击后延绵数秒渐弱,具禅意"。
      • 客栈/市集环境音(Inn Ambience):出现于室内客栈场景,描述为"低声人语、碗碟轻碰、木板脚步声,音量极低,仅作空间感填底"。
    • 环境音生成规范:目前 Flova 平台暂不提供独立的环境音生成工具;环境音应通过以下方式植入:
      • MultiModalToVideo 的视频 shot 提示词中,使用尖括号标记 <竹林风声,落叶沙沙,远处寺钟一响> 让模型在视频片段内同步合成,或
      • 由用户自行提供预录环境音素材上传绑定,再经 video_assembler 混入时间线。
    • 静默层设计:在紧张对峙、山水顿悟等特定 shot 区间,必须显式设计“无配乐、仅保留微弱环境音”的 [静默] 听觉通道,以“无声”传达极致的禅意。
4. 媒体生成

媒体生成与参考绑定策略:

  1. 静态图像生成 (TextToImage / ImageToImage)

    • 推荐模型:优先使用 Nano Banana Pro(Gemini 3 Pro Image),推荐分辨率为 2K,确保提示词依从度与文字/细节的高精度表现。
    • 参考图生成策略:在生成角色 key_element 图像时,必须采用“左右结构角色板”生成提示词。左侧为半身特写(锁定五官、发型、斗笠),右侧为全身站姿(锁定明代服饰、身段与标志性道具),为后续视频生成提供无死角的静态视觉参考。
  2. 动态视频生成 (MultiModalToVideo)

    • 推荐模型:首选 MultiModalToVideo 路径,采用成员专享的 Seedance 2.5(分辨率 480p)(或 Seedance 2.5),默认分辨率为 480p(若用户为高阶会员可升级至 480p)。
    • 视觉参考绑定(Reference Binding)
      • 每个 shot 视频生成时,必须在 input 中绑定该镜头涉及的 key_elements 静态参考图(包括角色板、场景板、道具板)。
      • 极端连贯性处理:仅在相邻镜头间动作连贯性极强(如连续打斗身段、同一走位的连续景别切换)时,才可将前一 shot 的 final_shot 视频作为 additional reference 引入。一般行旅、静立镜头无需绑定前镜视频,防止生成污染。
    • 运动幅度控制:严格限制运动参数(motion value)为中低级别,禁止使用过于剧烈的 3D 旋转、快速推焦或手持抖动镜头。
    • 画风色调锁定(跨镜一致性):每个 shot 视频生成时,必须将第一个已生成并确认的 key_element 图像(通常为主角色元素板)一并作为视觉风格锚点引入 reference 输入,用以强制锁定整片的低饱和大地色调、偏青阴影与胶片质感,防止模型在不同 shot 间自行漂移色温或渲染风格。
  3. 音频、配乐与旁白生成

    • 配乐 (Music):使用 text_to_instrumental 路径,优先选用 Suno 5 模型(备选 Mureka 8)。提示词须精准融合胡金铨风格中式古风 BGM 特征:Chinese ancient style instrumental BGM, King Hu wuxia film aesthetic, guqin solo melody, atmospheric dizi/xiao flute, zhongruan plucking, sparse Peking opera percussion (luo gu), mountain ink-wash ambience, meditative and austere, slow-burning tension, cinematic ancient Chinese orchestration, no modern instruments, no electronic elements, no vocals。避免在提示词中出现任何具体现代歌手或乐队名称。
    • 旁白 (Narration):使用 text to narration 路径,默认推荐 MiniMax Speech 2.8 HD(多语言支持强)或 ElevenLabs v3。在 description 中指定 narration_speaker_profile(如 [低沉沧桑的男声,饱含风霜与禅意])。
    • 台词对白 (Dialogue): shot 中包含的对话台词,必须在生成时绑定对应角色的 key_element_audio(声音参考/Timbre reference),确保多镜头间人物说话声音的一致性。
5. 提示词撰写

提示词(Prompt)工程规范:

  1. 全球语言自适应

    • 如果用户使用中文或软件处于中文界面,写媒体提示词主体时优先使用 中文(对国风水墨意境的理解更精准)。然而,故事板及 Spec 中指定的 narration / dialogue 输出语言必须严格遵循 Final_Video_Spec 的 Output Language 设定。
  2. 静态图像提示词 (TextToImage / ImageToImage) 撰写公式

    • 公式:[胡金铨风格美学前缀] + [场景环境描述] + [主体角色身段与明代装束] + [构图与光影指令]
    • 美学前缀(必须包含,每张生图提示词均须写入以下全部关键词):胡金铨电影美学,传统的中国"山水画"构图结构,层次化构图,电影感的空间深度,垂直构图线条,1970年代复古电影剧照,逆光氛围,丁达尔效应,浓重的大气雾气,粗糙的胶片颗粒感,低饱和的大地色调,偏青色的阴影,高反差明暗对照法,特艺七彩美学,高光溢出,柔和的调色板,模拟胶片片门抖动,深景深,哑光无光泽画面,无边框,视觉铺满整个画面,明朝时期,35毫米胶片质感,1.85:1宽银幕。
    • 光影与构图:使用具体的电影镜头语言。禁止使用 modern, vibrant, neon, saturated, HDR 等现代高饱和词汇。严格遵循上述美学前缀定义的色彩体系:低饱和大地色 + 偏青阴影 + 高光溢出,不得引入冷蓝或暖橙的现代调色倾向。
    • 跨镜画风冻结原则:全片所有生图与视频提示词,色调、质感、颗粒度关键词必须保持完全一致,不得因场景切换(如从室内客栈到室外山林)而替换或删减美学前缀中的任何词条。若某 shot 场景与其他 shot 差异较大,只可在前缀基础上叠加该场景的环境描述词,绝不能以环境词替换风格锚词。
  3. 动态视频提示词 (MultiModalToVideo) 撰写公式

    • 公式:[参考图像占位符] + [镜头运动指令] + [主体身段运动与空气流动]
    • 占位符规范:显式使用 <<<image_1>>> 绑定角色,<<<image_2>>> 绑定场景,并在提示词中指明:“保持 <<<image_1>>> 的明代面容与斗笠衣装不变”。
    • 运动控制栈(Motion Stack):按照 相机运动 -> 主体运动 -> 空间微动 的顺序书写。例如:慢速水平摇镜头(pan),从左至右;<<<image_1>>> 中的剑客稳健向前行走;竹林枝叶在微风中轻微摇曳,晨雾缓缓飘散。
    • Seedance 2.5(分辨率 480p) 专用标记包裹(重要)**:
      • 提示词中需要同步合成的背景音乐用圆括号 (古琴与长箫缓缓合奏) 标记。
      • 环境音与物理特效音用尖括号 <微风吹过竹林,落叶沙沙声,远处寺庙钟声敲响> 标记。
      • 人物台词用花括号 {师父,弟子已在此等候多时} 标记(台词必须与故事板中的 dialogue 文本完全一致)。
    • 否定词控制:除非需要显式声效,否则视频提示词中必须写明 no music(当使用独立 music 轨道时),并写明 no subtitles(字幕在剪辑阶段统一处理)。
  4. 山水空镜静态生图提示词范例(TextToImage · Nano Banana Pro):

    以下三套范例分别对应片头大远景开篇空镜结尾收镜三类典型山水空镜镜头。每套范例均在美学前缀基础上叠加场景描述,色调关键词不得删减,可按实际叙事需要替换括号内的场景细节词。

    【片头大远景】 — 用于全片首镜,建立空间基调与风格宣言

    胡金铨电影美学,传统的中国"山水画"构图结构,层次化构图,电影感的空间深度,垂直构图线条,1970年代复古电影剧照,逆光氛围,丁达尔效应,浓重的大气雾气,粗糙的胶片颗粒感,低饱和的大地色调,偏青色的阴影,高反差明暗对照法,特艺七彩美学,高光溢出,柔和的调色板,模拟胶片片门抖动,深景深,哑光无光泽画面,无边框,视觉铺满整个画面,明朝时期,35毫米胶片质感,1.85:1宽银幕。巍峨群山横亘至天际,三重山脊由近至远依次虚化,构成纵深三层水墨层次;天空占画面 50% 以上,云雾大面积留白,仅以淡墨晕染远峰轮廓;山腰处一条蜿蜒古道隐现,极远处有一孤行人影小如芥子,作为点景人物融入山水,不着重其面目;晨光从左侧山脊背后溢出,形成大逆光剪影,山体边缘有强烈光晕漫射;整体色调以青灰冷调为底,远山染以淡赭石暖意,天地之间呈现水墨横卷的悠远意境。

    【开篇空镜】 — 用于叙事段落起首,交代环境、渲染气氛

    胡金铨电影美学,传统的中国"山水画"构图结构,层次化构图,电影感的空间深度,垂直构图线条,1970年代复古电影剧照,逆光氛围,丁达尔效应,浓重的大气雾气,粗糙的胶片颗粒感,低饱和的大地色调,偏青色的阴影,高反差明暗对照法,特艺七彩美学,高光溢出,柔和的调色板,模拟胶片片门抖动,深景深,哑光无光泽画面,无边框,视觉铺满整个画面,明朝时期,35毫米胶片质感,1.85:1宽银幕。(以下为可替换的场景细节——竹林版示例)幽深竹林内景,竹竿密集纵向排列形成天然"框中框",远处竹梢汇向消失点,形成强烈的透视纵深;晨雾沿地面蔓延,将竹根段淹没于白雾之中,造成腾云驾雾的漂浮感;画面上方 40% 为竹叶交织的绿灰色顶冠,阳光以丁达尔光束斜刺穿透,落在雾气上形成可见光柱;无人物,纯环境叙事;整体色温偏青冷,竹竿与光柱形成高对比的明暗条纹节奏。

    【结尾收镜】 — 用于全片或段落收尾,留白余韵,回归山水

    胡金铨电影美学,传统的中国"山水画"构图结构,层次化构图,电影感的空间深度,垂直构图线条,1970年代复古电影剧照,逆光氛围,丁达尔效应,浓重的大气雾气,粗糙的胶片颗粒感,低饱和的大地色调,偏青色的阴影,高反差明暗对照法,特艺七彩美学,高光溢出,柔和的调色板,模拟胶片片门抖动,深景深,哑光无光泽画面,无边框,视觉铺满整个画面,明朝时期,35毫米胶片质感,1.85:1宽银幕。傍晚或薄暮时分的山川远眺,天空占画面 60% 以上,云层低压弥漫,呈大面积哑光灰银色留白;远山轮廓仅以极淡的笔触勾勒,几近消融于天地交界的雾气之中;画面前景以一棵遒劲枯树或巨石局部构成框架,将视线引向渺远中景;人物若存在,则为极远处孤独背影,面朝山野,体量不超过画面高度的 5%,以"人去楼空"的氛围传达故事终章;整体色调较片头更暗沉,以深灰青为主色,仅天际线残存一缕琥珀色余光,"言有尽而意无穷"。

  5. 打斗三阶段视频提示词范例(MultiModalToVideo · Seedance 2.5(分辨率 480p)):

    以下三套范例展示了"对峙蓄力→动作爆发→收势定格"的完整提示词写法。每套范例均遵循参考图占位符 → 镜头运动 → 主体身段 → 空间微动 → 音效标记的书写顺序,以及跨镜画风锁定原则。实际使用时须将占位符替换为当前 shot 实际绑定的 key_element 图像。

    【阶段一:对峙蓄力】 [锣鼓·单锤亮相] 参考时长 3–6s

    <<<image_1>>> 保持明代剑客面容、斗笠与素色长袍不变;<<<image_2>>> 保持竹林深景深场景色调不变。固定凝视长镜头,镜头锁死不动;<<<image_1>>> 中的剑客于竹林正中缓缓转身,正面亮相,双目微眯直视镜头,右手拇指轻推剑柄使剑身出鞘三寸,衣袍被山间微风徐徐撩起;竹叶在两侧轻颤,晨雾低沉流动,空气凝重静止;<沉默的竹林,远处一声低沉鸦鸣,踩踏枯叶的细碎声> no music, no subtitles

    【阶段二:动作爆发】 [锣鼓·急急风起] 参考时长 1–3s × 连续硬切

    <<<image_1>>> 保持明代剑客面容与飞鱼服不变;<<<image_2>>> 保持客栈木梁廊柱框中框场景不变。极速横移跟拍,镜头急速向右平移追踪主体;<<<image_1>>> 中的剑客猛然抬腿踢飞对手长凳,同时右臂大幅度横斩出剑,剑尖划过空气留下残影,身段于一瞬间由蹲伏弹射为正立,袍袖激烈翻飞;木屑与灰尘在利剑气流中四溅,廊柱背景急速虚化;<刀剑撞击的金属脆响,木料断裂声,重脚踏地声> no music, no subtitles

    【阶段三:收势定格】 [锣鼓·渐强收势] 参考时长 2–4s

    <<<image_1>>> 保持明代剑客面容、斗笠与素色长袍不变;<<<image_2>>> 保持竹林远景低饱和大地色调与偏青阴影不变。镜头由轻微跟随逐渐锁死,缓缓拉回至中远景全景构图;<<<image_1>>> 中的剑客完成最后一式后骤然停步,单腿微弓,剑尖朝下斜指地面,右手以布巾缓缓擦拭剑身,面无表情;倒地对手于画面左前方虚焦,竹林背景纵深三层清晰可辨,晨雾在人物轮廓四周轻缓飘散,形成逆光剪影;<远处竹枝被风拨动的沉闷声,鸦鸣渐远,大地静默> no music, no subtitles

6. 视频合成

时间线剪辑与视听合成准则:

  1. 京剧锣鼓剪辑节奏 (Peking Opera Rhythm)

    • 动静相生:剪辑节奏遵循“慢-快-慢”交替律动。行旅、思考等舒缓 shot 保持在 8-30s,剪切点保持平和。
    • 锣鼓对齐与打斗段落精确规范
      • 剪辑点锁死重拍:所有动作对峙/打斗 shot 的入点与出点必须精准对齐 BGM 轨道中锣鼓打击乐的重拍(downbeat)。严禁在鼓点之间的弱拍执行硬切,防止节奏脱节。
      • 三阶段时长压缩策略
        • 对峙蓄力阶段(凝视、亮相、抽刀):shot 时长 3–6s,剪辑节奏舒缓,对应锣鼓慢击节奏 [锣鼓·慢三击];
        • 动作爆发阶段(交锋、身段翻飞):shot 时长压缩至 1–3s;连续爆发段落最少连续硬切 3 刀以上,每一刀均须对齐锣鼓重拍,对应 [锣鼓·急急风起];
        • 收势定格阶段(落地、亮相停顿):shot 时长回弹至 2–4s,鼓点稀疏收尾,对应 [锣鼓·渐强收势];收势 shot 结束后保留 0.5–1s 的自然余音,再进入下一段落。
      • 硬切频率上限:爆发阶段连续硬切最多不超过 8 刀,超出后须强制插入一个 3s 以上的喘息 shot(固定凝视或环境空镜),防止观众视觉疲劳,同时也符合胡金铨"以静衬动"的剪辑哲学。
      • 视频 shot 时长与剪辑点的一致性:在 storyboard_designer 设计 shot 时长时,须同步标注对应锣鼓节拍类型;video_assembler 在装配时间线时,以该标注为依据精确裁切 shot 的入出点,不得随意延长或缩短。
  2. 转场与画面交替

    • 硬切为主:镜头转换 95% 以上使用直接硬切(hard cut),严格禁止使用花哨的三维翻转、滑动或现代特效转场。
    • 自然出点过渡:利用主体人物走出画面、云雾彻底遮挡镜头、或镜头摇向天空作为剪切的自然出点。
    • 黑场过渡:大段落、时间跨度或生死胜负转换时,使用 1-2 秒的黑场(fade to black)进行过渡。
  3. 声音先导与多层混音

    • 声音先导 (L-Cut / J-Cut):在段落交替时,允许下一镜头的标志性声音(如古寺钟声、马蹄声、竹叶沙沙声)提前 0.5-1 秒在当前镜头的画面结尾处响起,引导视觉切换。
    • 多轨混音层级
      • 旁白轨(Narration):处于最上层,音量最清晰。
      • 角色对白轨(Dialogue):与画面动作同步。
      • 配乐轨(Music):在行走/抒情段落音量适中;在动作打斗段落音量增大,节奏变快;在静默段落则完全淡出至零。
      • 环境音轨(Ambient):始终在底层以低音量(如 -20dB)持续播放,确保音轨即使在音乐停止时也有"空气感"和环境空间感,绝不出现绝对的死寂。各环境音类型的混音建议如下:
        • 竹林风声:持续底层铺垫,音量约 -22dB,节奏随剧情松紧轻微波动(紧张时风声可略微增强至 -18dB 以烘托氛围)。
        • 松涛声:仅在山野/高台场景中激活,音量约 -20dB,以低频气息感为主,避免掩盖配乐主旋律。
        • 流水声:仅在溪涧场景激活,音量约 -24dB,以清脆细流质感为主,不宜过于厚重。
        • 寺庙钟声:作为点缀性音效(非持续轨),在场景切换或段落结尾处单次触发;触发后留足 2-3 秒余音自然衰减,期间配乐音量同步轻微下压(约 -3dB),以突出钟声禅意。
        • 客栈/市集环境音:仅在室内客栈场景激活,音量约 -26dB,极低混入,仅为空间感填底,不可喧宾夺主。
      • 场景切换时的环境音衔接:上一场景的环境音在硬切点后做 0.5-1 秒淡出,下一场景的环境音同步淡入,避免"声音悬崖"(abrupt ambient cut)。
  4. 片头片尾淡入淡出

    • 视频开头设计 2 秒由黑入画及音频淡入。
    • 视频结尾设计 3 秒淡出至黑场,音频(配乐及余音)同步淡出,留下“言有尽而意无穷”的留白意境。