yeha.ai
返回模板库

时装展示短片

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

面向于电商或服装设计专业的展示视频:通过上传或者生成刀版图定制服装的样式,匹配模特外形的场景生成分镜生成展示视频。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

全片阶段流程与工具调度:
阶段一:全局参数锁定
创建 Final_Video_Spec.md(片名、画面比例、时长意图、视觉风格基调、语言)→ text_editor。同时依据服装类型与用户意图,在 Final_Video_Spec.md 中明确锁定拍摄风格类型:秀场走秀(Runway)买家秀/街拍(Lifestyle)。后续所有阶段(场景选择、故事板、提示词风格)均以此为分支依据,不得在后期阶段再做判断。

阶段二:服装资产解析(如有用户上传)
若用户提供服装图片或参考视频,先提取款式、面料、色彩、动态物理等结构化信息 → resource_prepare_and_analyze

阶段三:服装与角色设计确认(逐步推进,每步后必须暂停等待用户明确确认,不得自动进入下一步)

  • 步骤 3a:生成服装刀版三视图(正面/侧面/背面技术平面图,无模特,纯服装结构展示,横版宽幅三格并排)→ media_generator暂停,明确等待用户回复"确认"或提出修改意见后,方可进入步骤 3b。
  • 步骤 3b:用户确认刀版图后,以刀版图为参考,生成模特服饰卡(横版宽幅,左格:面部特写,右格:穿着服装的正面/侧面/背面全身三视图)→ media_generator;多套服装或多角色时,按 A/B/C 顺序逐一生成对应的模特服饰卡;暂停,明确等待用户确认模特形象与面料还原度后,方可进入步骤 3c。
  • 步骤 3c:用户确认模特服饰卡后,Planner 直接以文字形式向用户呈现 3 个匹配服饰风格的场景候选方案(场景类型 + 光线基调 + 核心氛围词),无需调用任何工具;若用户有自定义场景需求,直接按用户描述执行;暂停,等待用户从候选方案中选择或提供自定义方向,收到明确选择后方可进入步骤 3d。
  • 步骤 3d:用户确认场景选择后,依据所选方案生成对应的空场景图(无人物、无服装,纯环境氛围,横版宽幅)→ media_generator;多场景时每个 element scene 各生成一张;暂停,等待用户确认场景风格与光线基调符合预期后,方可进入故事板阶段。

阶段四:故事板设计、资产绑定与分镜确认(分三步)

  • 步骤 4a:声明 key_elements(模特角色、服装、核心场景及配件)、shot 列表(含景别策略)、音频轨道 → storyboard_designer。key_element 描述须与步骤 3b 模特三视图、3c 空场景图保持一致,不得矛盾。
  • 步骤 4b:将步骤 3b 生成的模特穿着三视图注册 asset_id,绑定至故事板对应的 element character;将步骤 3c 生成的空场景图注册 asset_id,绑定至故事板对应的 element scene → media_generator此步骤为视频生成前的必要前置操作,未完成绑定不得进入阶段五。
  • 步骤 4c:以已绑定的 element character 图(步骤 3b)和 element scene 图(步骤 3c)为参考输入,生成六宫格电影质感分镜预览图 → media_generator;暂停,等待用户确认分镜构图、场景搭配与景别节奏。

阶段五:视频生成
用户确认六宫格分镜后,以六宫格分镜预览图为直接参考输入,结合故事板中已锁定的模特、服装、场景 key_element 资产,一次性生成一条完整的 30 秒时装短片,无需逐镜分拆 → media_generator

阶段六:音频与组装
生成与服装风格匹配的 BGM → media_generator;全部素材就绪后执行时间线组装 → video_assembler

依赖关系: 3a→2(如有上传);3b→3a;3c→3b;3d→3c;4a→3d;4b→4a;4c→4b;5→4b,4c;BGM生成→4a;最终组装→5,BGM生成

「一轮 = 一套分镜 + 一条视频」原则:

  • 每次完整流程(阶段三→六)产出一个场景 + 一套分镜 + 一条 30 秒视频,这是一个独立的创作单元。
  • 更换场景: 当前轮视频生成完毕后,用户提出新的场景需求,Planner 从步骤 3c(场景候选)重新开始,沿用已有的模特服饰卡(element character 资产不需要重新生成),生成新的空场景图 → 新的六宫格分镜 → 新的 30 秒视频。
  • 更换服装: 用户提出新的服装需求,Planner 从步骤 3a(刀版三视图)重新开始,走完完整阶段三至六流程,产出新的服饰卡与视频。
  • 每轮生成的视频独立存在,用户可自由决定是否与其他轮次的视频合并组装;如需合并,在所有目标视频完成后进入 video_assembler 统一处理,BGM 可共用一条或按轮次分段。
  • Planner 在每轮结束后主动询问用户:是否需要更换场景或更换服装,继续新一轮创作。
2. 多模态分析

服装资产解析: 当用户提供服装图片或参考视频时,重点提取并以结构化文本输出以下信息,供故事板阶段生成场景匹配方案与镜头动态描述时使用:

  • 款式与剪裁轮廓(Silhouette): 廓形类型、领口、袖型、裙摆/裤型
  • 面料材质: 质地类型(丝绸/毛呢/皮革/纱/针织等)、光泽度、透明度、厚重感
  • 色彩特征: 主色、辅色、图案/纹样的色相与饱和度特点
  • 动态物理预判: 面料在运动中的垂坠感与摆动惯性(如真丝漂浮 vs 毛呢迟滞),为镜头动态描述提供依据
3. 故事板设计

Key Elements 声明规范:

  • 模特角色(element character): 描述面部特征、肤色、妆容风格、发型;锁定与阶段三生成的模特三视图一致,不得矛盾。
  • 服装(element): 以阶段三刀版三视图为锚点,精确描述款式廓形、面料材质(质地/光泽/厚重感)、色彩及关键细节(拉链/纽扣/刺绣/图案/特殊肌理),作为全片视觉一致性基准。
  • 核心场景(element scene): 依据用户在阶段三步骤 3c 中已确认选择的场景方案,描述空间结构、主光源方向与色温、明暗比例、视觉留白区域设计;key_element 描述须与步骤 3d 生成的空场景图保持一致;多场景时为每个场景单独声明 element scene。
  • 配件与道具(element): 显著影响视觉的饰品(首饰/包/鞋/帽)作为独立 element 声明,便于在 shot 中精准引用。

视频风格类型判断(优先在阶段一锁定):
根据服装风格与用户意图,将拍摄风格定性为以下两类之一,后续场景选择、分镜设计与提示词规范均以此为依据:
风格类型触发条件整体基调秀场走秀(Runway)礼服、晚装、高定、概念/机能装;用户明确要求"秀场感"强戏剧光影、极简背景、模特全程保持走秀步态与表情克制买家秀/街拍(Lifestyle)休闲、街头、日常穿搭、保暖、民族传统;用户明确要求"真实感/日常感"自然环境光、真实生活场景、模特有自发性互动与情绪表达

秀场走秀场景映射(Runway):

  • 礼服/晚装 → 宴会厅或古典剧院,Chiaroscuro 侧光,丝绸/亮片折射
  • 机能/概念 → 工业废墟或超现实数字空间,结构主义线条
  • 高定/民族 → 传统建筑或高反差摄影棚,高纯度色彩衬布

买家秀/街拍场景选择逻辑(Lifestyle):
根据服装特征自动匹配以下场景候选,每个场景附带推荐光线方案:

  • 休闲/通勤 → 城市街道(人行道、斑马线、玻璃幕墙反射);顺光或侧逆光,硬阴影强调质感
  • 咖啡/社交 → 独立咖啡馆、书店或画廊走廊;暖调漫射窗光,低饱和背景衬托服装主色
  • 自然户外 → 公园草坪、林间小道、海边礁石;黄金时段侧逆光,环境色渗入面料
  • 都市夜间 → 霓虹便利店门口、湿润沥青路面;混合色温(暖黄街灯 + 冷蓝天空),高光折射感
  • 居家/轻生活 → 落地窗边、书房、浴室门口;柔和自然侧光,强调面料垂坠的静态美感
  • 保暖/冬季 → 北欧雪地、暖调室内咖啡座;低色温暖光强调体积感与毛绒纹理
  • 民族/传统 → 古镇街巷、庭院回廊、自然山野;高纯度环境色、强调色彩互动

场景构图原则(Lifestyle 专属):

  • 场景内保留真实生活道具(咖啡杯、购物袋、书、自行车等),但道具不抢主体;
  • 背景允许适度虚化行人或环境元素,制造生活感景深;
  • 避免过度对称的秀场式走廊构图,优先街头/随拍感透视角度。

买家秀模特互动动作库(Lifestyle 专属):
区别于秀场走秀的克制步态,买家秀模特应呈现自发性、非表演感的真实动作。按镜头功能分类如下:
移动类(代替走秀步态):

  • 漫步过马路,随步伐裙摆自然摆动
  • 推开咖啡馆玻璃门,侧身入框
  • 骑行或推行自行车,风吹发丝与衣领
  • 上下台阶,服装廓形随重心偏移形变

停驻/等待类(静态镜头锚点):

  • 倚靠墙壁或栏杆,单脚交叉,低头看手机再抬头
  • 坐在台阶或长椅边缘,手肘支膝,若有所思
  • 驻足橱窗前,侧面观看,面部 3/4 角朝镜头

物品互动类(道具驱动细节):

  • 整理围巾或领口,手指勾住面料边缘
  • 手持咖啡杯,杯身遮半脸,眼神越过杯沿
  • 拎起或调整包带,肩部动作带动上衣肩线
  • 翻动书页或菜单,视线下沉,侧光照亮面料纹理

情绪/表情类(Lifestyle 特有,秀场禁用):

  • 浅笑转头,与镜头外虚构对话对象有眼神交流
  • 微微低头后抬眸,制造"抓拍感"直视镜头瞬间
  • 风吹乱发,用手轻拢,表情自然不刻意

多人场景(可选):

  • 两人并肩走,肢体无接触,服装对比构图
  • 一人坐一人站,视线不对称,强调层次感

六宫格电影分镜设计规范:
六宫格是呈交给用户确认的可视化分镜预览,采用竖屏(9:16)布局,3 行 × 2 列排列,代表全片六个核心画面节点,覆盖不同景别与叙事功能:

  • 格 1(全景 WS): 建立场景与模特入场,交代空间关系与整体廓形
  • 格 2(中景 MS): 走秀步态或转身,展现服装剪裁轮廓与面料动态形变
  • 格 3(近景 MCU): 上半身构图,聚焦妆容、发型与服装上部细节及配件
  • 格 4(特写 CU): 面料微观肌理、针脚、拉链、刺绣等高反差细节;或角色表情/配饰特写
  • 格 5(动态定格): 升格/甩镜瞬间,捕捉裙摆展开、外套飘动等面料受力动态;或角色互动/情绪动作定格
  • 格 6(收尾全景): 模特走远或侧背镜,与场景融合,留白收束视觉
  • 多场景时,每个场景独立规划六宫格;单场景中若有明显情绪转折可适当调整格位功能。
  • 整张分镜图为竖版宽幅(3行×2列网格),统一电影胶片色调,每格内构图须体现 9:16 竖屏视角。

每个 shot 须包含:

  • 关联的场景、模特、服装、配件 element ID
  • 景别、摄影机运动(Push-in 推轨、Pan 摇镜、Whip-pan 甩镜、Lock-off 锁定、Crane 升降等)
  • 模特动作与互动细节:步态节奏、转身角度、手部动作、表情管理(眼神方向/微表情)、与场景道具的互动
  • 光影质感描述(必须包含以下全部四项):① 主光源方向与色温;② 阴影硬度与覆盖比例;③ 高光落点(面料或皮肤的具体位置);④ 环境反射填充色(周围环境对主体的色彩渗透)
  • 视觉留白指引:画面中留白区域的位置与比例意图
  • 服饰特殊肌理标注:该镜头需重点还原的面料物理特性(垂坠感/摆动惯性/折射光谱等)
  • 时长建议(一镜到底连续 shot 合并计算,单套服装全部 shot 总时长目标约 30s,不得超出 30s 上限)
  • 景别连贯性标记: 标注该 shot 与相邻 shot 的景别关系("景别不同→剪切过渡"或"景别相同→合并一镜到底")

独立音频轨道设计:

  • 一条贯穿全片的 BGM 轨道,依服装风格选择基调:休闲/街头 → Nu-Jazz 或 Lo-fi Hip-hop;礼服/晚装 → Chamber Jazz 或交响弦乐;机能/概念 → Industrial Techno 或 Dark Ambient;民族/传统 → 融合民族乐器的当代编曲
  • 可酌情规划 Foley 音效层(高跟鞋落地、面料摩擦声)作为独立 audio_layer
4. 媒体生成

阶段三:服装资产生成

  • 步骤 3a — 服装刀版三视图: 工具 TextToImage,模型 Nano Banana Pro(Gemini 3 Pro Image),分辨率 2K。生成单张横向宽幅图,三格并排:正面 / 侧面 / 背面纯技术平面图,无模特、无背景(纯白或浅灰);精确还原款式廓形、缝线结构、拉链/纽扣/图案等工艺细节;面料材质以标注文字辅助说明。
  • 步骤 3b — 模特服饰卡: 工具 ImageToImage(以刀版图为参考),模型 Nano Banana Pro(Gemini 3 Pro Image),分辨率 2K。生成单张横向宽幅图,左右两区:左侧为模特面部特写(半身,突出妆容、骨相、发型与皮肤质感);右侧为穿着服装的三视图(正面 / 侧面 / 背面全身定格),重点还原真实面料物理质感(垂坠/折叠/反光/纹理),中性背景。多套服装或多角色时,按 A/B/C 顺序为每个角色单独生成一张服饰卡,命名规则:模特服饰卡_A、模特服饰卡_B……

步骤 3c — 场景候选方案呈现(由 Planner 直接回复用户,无需调用本工具):

  • 此步骤由 Planner 根据 Final_Video_Spec.md 中已锁定的风格类型(Runway / Lifestyle)和服装解析结果,直接以文字形式向用户呈现 3 个场景候选方案,无需调用 media_generator。
  • 每个方案包含:场景类型名称、核心氛围描述(1–2 句)、推荐光线基调(主光源方向 + 色温)、与该服装风格的匹配理由。
  • 多场景项目时,为每个需规划的场景位分别列出 3 个候选,用户可逐一选定。
  • 等待用户确认所有场景选择后,Planner 再调用 media_generator 进入步骤 3d。

步骤 3d — 空场景图生成:

  • 工具 TextToImage,模型 Nano Banana Pro(Gemini 3 Pro Image),分辨率 2K
  • 依据用户在步骤 3c 选定的方案,为每个 element scene 各生成一张空场景图:无人物、无服装,仅呈现环境氛围——空间结构、主光源方向与色温、明暗比例、景深层次。
  • Runway 场景: 突出人工布光质感(方向、阴影硬度、高光落点),背景极简,留有大面积视觉留白供后期模特入画。
  • Lifestyle 场景: 体现真实环境光与生活道具(咖啡桌、街道、窗边等),允许适度景深模糊,背景有生活气息但不杂乱。
  • 将生成结果绑定至故事板对应 element scene,作为后续六宫格分镜预览图与视频生成的场景参考输入(<<<image_2>>>)。

阶段四:故事板资产绑定与六宫格分镜预览图生成

  • 步骤 4b — 资产绑定(必须在六宫格生成前完成):

    • 将步骤 3b 生成的模特穿着三视图注册 asset_id,绑定至故事板对应的 element character(若有多套服装对应多个角色 element,逐一绑定)。
    • 将步骤 3c 生成的每张空场景图注册 asset_id,绑定至故事板对应的 element scene。
    • 绑定完成前不得进入视频生成阶段;若绑定缺失,优先补绑再继续。
  • 步骤 4c — 六宫格分镜预览图: 工具 ImageToImage(输入为已绑定的 element character 模特服饰卡 + element scene 空场景图),模型 Nano Banana Pro(Gemini 3 Pro Image),分辨率 2K

    • 生成单张竖版宽幅图(9:16 纵向构图),3 行 × 2 列六宫格排列,每格对应故事板中一个核心 shot 的静帧构图;每格内保持人物、服装、场景与 key_element 描述一致;统一电影胶片色调。
    • 绑定该图至故事板的对应 shot 序列,作为视频生成前的人工确认依据。

阶段五:视频生成

  • 工具 MultiModalToVideo,推荐模型 Seedance 2.5,分辨率 480p,时长 30s
  • 生成策略:以六宫格分镜预览图为主要参考输入,配合已绑定的 element character 模特服饰卡和 element scene 场景图,在单次生成任务中输出一条完整的 30 秒时装短片;prompt 内按六宫格分镜的叙事顺序分段描述各动作节拍与景别切换,无需拆分为多个独立 shot 生成。
  • 每次视频生成任务的参考输入(必须使用步骤 4b 已完成绑定的 asset_id):
    1. 六宫格分镜预览图(来自步骤 4c,作为核心构图与节奏参考)
    2. 模特服饰卡(element character 绑定资产,来自步骤 3b,锁定角色形象一致性)
    3. 空场景图(element scene 绑定资产,来自步骤 3d,锁定场景光线与氛围)
  • 多套服装处理: 每套服装(Outfit_01、Outfit_02……)独立完成阶段三至阶段五全流程,各自产出一条 30 秒完整视频;不同 Outfit 的 element 资产严格隔离,不得跨组引用。所有 Outfit 视频组生成完毕后,统一进入阶段六组装。

阶段六:BGM 生成

  • 工具 text_to_instrumental,推荐模型 Suno 5(提示词不得出现知名艺术家名字,否则切换 Mureka 8)。
  • 生成时长与故事板 BGM audio_layer 规划对齐,情绪弧线需覆盖开场建立 → 中段展示 → 收尾留白三段节奏。
5. 提示词撰写

全局优先: 若用户使用中文交互或加载中文界面,提示词正文以中文撰写;对白语言遵循 Final_Video_Spec 中的输出语言设定。
服装刀版三视图提示词(TextToImage):

  • 明确指定"三视图技术平面图(正面 / 侧面 / 背面)横向并排,纯白背景";
  • 描述款式廓形、结构线、缝合细节、五金配件;在图中关键细节旁可要求生成标注文字(面料名称、工艺说明);
  • 无人体、无阴影、无环境,保持工程图风格。

模特服饰卡提示词(ImageToImage):

  • 参考占位符标注刀版图 <<<image_1>>>;
  • 明确横版宽幅布局:左侧为模特面部特写(半身,突出妆容、骨相与发型),右侧为穿着服装的三视图(正面/侧面/背面全身站立);
  • 模特形象质感提升词组(必选,按风格叠加):
    • 通用基础层(所有风格必加): editorial fashion model, striking bone structure, high-contrast facial features, defined cheekbones, sharp jawline, luminous skin with subtle texture, confident yet neutral expression, elongated proportions
    • 秀场走秀(Runway)专属: haute couture posture, severe angular beauty, piercing gaze, statuesque silhouette, razor-sharp brow arch
    • 买家秀/街拍(Lifestyle)专属: approachable yet aspirational look, natural warm skin tone, soft expressive eyes, effortlessly cool demeanor, candid beauty
    • 妆容精度词(按风格选用): Runway → sculpted contouring, graphic eyeliner, editorial lip;Lifestyle → dewy no-makeup makeup, brushed-up brows, glossy natural lip
  • 面料质感强调词组(按材质选用): 真丝 → flowing liquid drape, light-catching sheen;毛呢 → dense woven texture, structured weight, matte surface;皮革 → high-gloss specular, tight grain, stiff silhouette;针织 → ribbed knit relief, soft stretch, micro-loop texture;
  • 中性摄影棚光,无风,高反差背景衬托轮廓;禁止服装形变、禁止非预期配饰。

六宫格分镜预览图提示词(ImageToImage):

  • 参考占位符标注模特服饰卡 <<<image_1>>> 及空场景参考 <<<image_2>>>;
  • 明确"竖版9:16构图,3行×2列电影故事板网格,统一银盐胶片色调,每格内为竖屏视角构图";
  • 每格依次描述对应 shot 的景别、摄影机角度、模特姿态与场景光影;
  • 光影质感词: chiaroscuro side lighting、golden hour rim light、diffused overcast fill(按场景选用);
  • 视觉留白指引: 在适当格位指定"大面积负空间留白于画面上方/侧方,主体偏置三分之一构图";
  • 服饰肌理增强词: macro fabric grain visible、thread-level weave detail、specular highlight on surface micro-texture。

视频生成提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p)):

  • 参考图占位符顺序:<<<image_1>>> 六宫格分镜预览图(构图与节奏主锚),<<<image_2>>> 模特服饰卡(角色形象一致性),<<<image_3>>> 空场景图(光线与氛围锚定);
  • prompt 按六宫格的叙事顺序分段描述各节拍(全景建立 → 走秀/互动 → 近景妆造 → 特写肌理 → 动态定格 → 收尾留白),禁用绝对时间戳(如"0–3s"),以动作节拍衔接替代;
  • Seedance 2.5(分辨率 480p) 标签规范:Foley 音效 <...>,对白 {...}(仅逐字台词),音乐 (...),字幕 【...】;
  • 固定负面约束:no clothing morphing,no subtitles,no music(BGM 独立生成时)。

光影描述核心规范(所有风格通用,每个 shot 必须包含以下光影层次):

  • 主光源定位: 明确光源方向(正侧光/侧逆光/顶光/窗光)、色温(暖 2700K–3200K / 中性 5000K–5500K / 冷蓝调 6500K+)及入射角度;
  • 阴影塑形: 描述阴影硬度(硬阴影 sharp cast shadow / 柔阴影 soft feathered shadow)与阴影覆盖比例(如"阴影占画面 40%,强化立体轮廓");
  • 高光落点: 指定高光在面料或皮肤的具体位置(如"高光沿肩线滑落,过渡至手背"、"亮片在侧逆光下形成点状散射光晕");
  • 环境反射填充: 描述周围环境对主体的色彩反射(如"玻璃幕墙将城市蓝光漫射至服装背面"、"暖调墙面向模特左颊补入环境色");
  • 光影情绪锚定: 最后一句以感性词收尾,锚定整体光影氛围(如"光影铺陈出疏离而克制的电影质感"、"漫射光让面料质感温柔浮现,如同胶片正片")。

秀场走秀风格(Runway)指令层级:
摄影机运动模特步态与肢体控制服装材质动态(垂坠惯性/摆幅/折射光谱)光影层次描述(依上方规范)场景人工布光与留白Foley 音效标签

  • 强调步态的仪式感与克制感;禁止模特自发性微笑或随意互动;
  • 光影指令优先描述人工布光的方向性与硬度,阴影比例高(≥50%),强化高反差戏剧感;
  • 推荐光影词组:single-source hard sidelight casting deep chiaroscuro、rim light tracing the garment silhouette against dark void、specular glide along silk surface with 90% shadow fill。

买家秀/街拍风格(Lifestyle)指令层级:
场景环境与自然光摄影机运动(允许手持感/轻微晃动)模特自然动作(从故事板 Lifestyle 动作库选取)服装随动态的物理形变情绪/微表情描述光影层次描述(依上方规范)环境音效标签

  • 摄影机描述可加入 handheld slight sway、candid street photography feel 等词组营造非刻意感;
  • 动作描述优先从故事板 Lifestyle 动作库抽取,保持非表演感;
  • 服装动态侧重"受重力与风力的自然形变"而非走秀式夸张摆动;
  • 情绪词组示例:genuine half-smile、lost in thought gaze、caught mid-laugh;
  • 光影优先描述自然光的方向与漫射特性,阴影柔和;
  • 推荐光影词组:golden hour backlight diffusing through fabric weave、overcast diffused daylight wrapping evenly over texture、warm window spill casting a soft elongated shadow on the wall、mixed-temperature ambient — warm tungsten bounce from pavement, cool open-sky fill from above;
  • 允许环境中有虚化路人或真实街道噪声 <ambient city murmur>,增加生活质感;
  • 禁止描述任何走秀步道或 T 台相关意象。

BGM 提示词(text_to_instrumental):

  • 描述风格基调、核心乐器配置、BPM 范围、情绪弧线(开场建立 → 中段展示 → 收尾留白);
  • 禁止出现知名艺术家姓名(Suno 5 合规要求)。
6. 视频合成

单套服装视频组装:
每套服装对应一条由阶段五直接生成的 30 秒完整视频,无需再做内部切分;直接进入多套组装流程。

多套服装分组组装:

  • 每套服装(Outfit_01、Outfit_02……)对应独立的视频组,各自组装为一段约 30 秒的完整短片,不跨 Outfit 混剪;
  • 多套服装输出时,各组视频依序排列,组间可加简短黑场过渡(0.5s)或直接硬切,依 Final_Video_Spec 风格而定;
  • BGM 可共用一条贯穿全片,也可按 Outfit 风格差异分段换轨——以故事板 audio_layer 规划为准。

节奏与音画同步:

  • BGM 节拍点对齐镜头切换点;
  • Foley 音效(高跟鞋落地、面料摩擦)可采用 J-Cut 提前入画,强化动作预感;
  • 每段 Outfit 视频收尾镜头淡出与对应 BGM 段落尾音同步;全片整体时长控制在 Final_Video_Spec 规定范围内。

音量层次:

  • BGM 作为底层背景,Foley 音效在动作峰值处短暂提升至前景,二者不抢叙事空间。