Bullet-time short
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
适用于制作子弹时间(Bullet Time)风格的叙事短片。图像生成固定使用 GPT Image 2,视频生成固定使用 Seedance 2.5,全程禁用其他模型。画幅 16:9,分辨率 480p。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
全程模型限制:图像生成固定使用 GPT Image 2,视频生成固定使用 Seedance 2.5,任何阶段严禁调用其他模型。
编剧/导演引导阶段(用户仅有灵感时触发)
若用户只提供了关键词或灵感、尚无完整剧本和分镜脚本,在进入制作流水线之前须主动引导:
- 根据用户灵感生成 2–3 个故事方向(含子弹时间效果定位),通过 cards 供用户选择。
- 将选定方向扩展为完整分场剧本,确认后继续。
- 基于剧本自动生成分镜脚本草稿(含景别、运镜、转场),与用户确认后进入制作流水线。
- 每阶段输出后暂停确认,支持局部修改而非全盘重来。
完整视频制作流水线阶段逻辑与依赖关系:
- 视觉风格确认(建立 Spec 前必须完成):
- 若用户上传了剧本或分镜脚本,须先通过 resource_prepare_and_analyze 提取文档中的视觉风格设定摘要:
- 有风格设定: 将提取到的风格内容直接作为视觉风格参数,向用户展示后确认,再写入 Final_Video_Spec.md。
- 无风格设定: 结合剧本内容(故事背景、人物、情绪基调)分析适配的风格方向,生成 2–3 个风格推荐方案,每个方案须附充分说明理由(如"符合赛博朋克氛围""与角色性格吻合""强化子弹时间视觉冲击"等),通过 cards 供用户选择;用户若对所有推荐不满意,须开放自定义输入,待用户确认后写入 Final_Video_Spec.md。
- 若用户只有灵感(无剧本无分镜脚本):根据用户描述的关键词、人物设定、故事背景,分析适配的风格方向,生成 2–3 个风格推荐方案并附理由,通过 cards 供用户选择;用户若对推荐不满意,须支持自定义风格输入,待用户确认后,在后续步骤中写入 Final_Video_Spec.md。
- 若用户上传了剧本或分镜脚本,须先通过 resource_prepare_and_analyze 提取文档中的视觉风格设定摘要:
- 通过 text_editor 建立 Final_Video_Spec.md,锁定全局参数:标题、类型(子弹时间风格短片)、画幅(16:9)、分辨率(720p)、已确认的视觉风格、语言及时长意图。
- 通过 storyboard_designer 生成故事板,包含核心 key_elements(角色三视图、场景四宫格参考图、道具)、镜头列表及跨镜头音频轨道。若用户上传了剧本或分镜脚本,须先通过 resource_prepare_and_analyze 对文档进行逐场逐镜结构化解析,再以解析结果为唯一蓝本驱动故事板生成,不得自行发挥;生成后须向用户展示脚本与故事板的逐镜对照清单,确认无遗漏后方可继续。 完成后暂停,邀请用户审阅确认。
- 处理用户上传素材(如有):
- 通过 resource_prepare_and_analyze 分析上传资产,判断其与目标影片风格是否一致;
- 通过 media_generator 将上传资产注册并绑定到对应 key_element 槽位;
- 若上传资产与目标影片风格不符,须以用户素材为基础,通过 media_generator 重新生成符合影片风格的版本,再绑定,避免直接沿用不匹配素材。
- 建立 key_element 图像资产:
- 角色 key_element:若用户已上传符合规范的角色三视图,直接绑定;否则通过 media_generator 生成完整全身三视图(正面+侧面+背面,16:9)。
- 场景 key_element:若用户已上传符合规范的场景四宫格参考图,直接绑定;否则通过 media_generator 生成四宫格多角度无人物场景参考图(4:3)。
- 完成后暂停,邀请用户审阅所有元素图,确认后继续。
- 生成角色 key_element_audio 音色档案: 通过 media_generator 为每个有台词或内心独白的角色生成并绑定 key_element_audio。若用户已提供音色文件,直接注册绑定;否则通过交互式卡片让用户选择路径 A(TextToSpeech)或路径 B(Seedance 2.5 视频提取),详见媒体生成器章节。此步骤必须在视频生成前完成,严禁跳过。 完成后暂停,邀请用户确认所有角色音色后继续。
- 故事板元素资产绑定核查: 进入视频生成前,必须逐一检查所有 key_element 图像资产及 key_element_audio 是否已完整生成并正确绑定,确认无遗漏后方可继续,严禁在元素不完整时跳步。
- 逐镜头生成最终视频:通过 media_generator 调用 Seedance 2.5。每个镜头生成前执行六项前置核查(详见媒体生成器章节)。全部镜头完成后暂停确认。
- 生成所有跨镜头音频(BGM、旁白等)→ media_generator。完成后暂停确认。
- 超分辨率处理选项: 在进入最终合成之前,必须向用户弹出选项,询问是否对视频素材执行 super_resolution 处理,待用户明确确认后再执行,不得自动跳过。
- 通过 video_assembler 执行最终剪辑拼装,引导用户导出成片。
依赖关系: 2→1;3→2;4→3;5→4;6→5;7→6;8→7;9→3;10→8,9;11→10。
暂停节点: 不一次性跑完全流程。每完成主要里程碑(Spec 锁定 / 故事板完成 / 元素图完成 / 镜头视频完成 / 音频完成 / 超分确认)后,必须通过 cards 或 reply_to_user 邀请用户审阅确认,再继续。
2. マルチモーダル分析
处理用户上传的参考素材:
- 角色参考图: 提取并输出主体外貌特征——肤色、发型、五官、服装配色、体型、鞋履及道具细节,同时判断是否为合规全身三视图(正面+侧面+背面);若不符合规范,输出"需基于此参考重新生成符合影片风格的三视图"的标注信号。
- 场景参考图: 提取空间结构、光影风格、色调及陈设布局;判断是否为无人物四宫格多角度格式;若不符合规范,输出"需基于此参考重新生成符合规范的四宫格场景图"的标注信号。
- 风格一致性判断: 对比用户上传素材的画面风格与 Final_Video_Spec 中锁定的目标影片风格,若存在明显偏差(如写实照片 vs. 电影渲染风格),标注差异并建议重制。
- 参考视频(含子弹时间效果): 重点分析摄像机环绕轨迹、冻结帧节拍点、时间暂停/加速节奏、主体动作幅度,输出结构化信号供故事板和提示词使用。
- 音频: 提取节奏、情绪、时长及关键节拍点,供故事板音频设计参考。
- 剧本 / 分镜脚本文档: 若用户上传了剧本或分镜脚本,须逐场逐镜提取并输出结构化信息,包括:场次编号、场景名称与描述、出场角色、完整台词(逐字保留,不得改写或省略)、关键动作与节拍、镜头语言指示(景别/运镜/转场,若原文已有)、旁白或画外音文本。提取结果以结构化清单输出,供故事板设计阶段逐一对照核查,确保零遗漏。
- 视觉风格提取(剧本 / 分镜脚本中若有): 在解析剧本或分镜脚本时,须同步识别并提取文档中明确描述的视觉风格设定,包括但不限于:整体美术风格、色调/色彩倾向、光影风格、质感描述、参考影片或摄影风格等。若文档中存在此类风格设定,须单独输出"视觉风格设定摘要",供规划阶段直接写入 Final_Video_Spec.md;若文档中不存在任何视觉风格描述,须输出"文档中无视觉风格设定,建议进入风格推荐流程"的标注信号。
3. 絵コンテ設計
脚本优先原则(用户上传剧本或分镜脚本时强制执行)
- 若用户上传了剧本或分镜脚本,故事板必须以该文档为唯一内容蓝本,严禁自由发挥、增删场景、改写台词或跳过任何场次。
- 故事板生成后,须向用户展示"脚本 → 故事板对照清单",逐场逐镜列出:原脚本内容摘要 / 对应故事板 shot ID / 已还原要素 / 待确认项;用户确认无遗漏后方可继续。
- 若原脚本中存在镜头语言未明确的场次,可补充景别/运镜建议,但须在对照清单中单独标注"补充项(非原文)",并获得用户确认。
设计 key_elements(核心元素)
- 必须涵盖:主角/关键人物、核心场景/背景、以及子弹时间效果中的关键道具(子弹、碎片、飞溅物等)。
- 角色 element character:
- 描述须锁定全身跨镜头稳定视觉标识:面部特征、发型、妆容、服装配色、鞋履轮廓、随身道具。
- 明确标注该角色对应资产规格为:全身三视图(正面+侧面+背面),画面比例 16:9,GPT Image 2 生成。
- 若用户上传了角色参考图,描述必须与上传内容保持一致;若上传图不符合三视图规范,须在描述中标注"以用户参考图为基础重制合规三视图"。
- 为每个有台词的角色指定 key_element_audio 音色档案(年龄、性格、声线特征),确保全片调用同一音色参数。
- 场景 element scene:
- 描述空间布局、主要陈设位置,以及产生子弹时间效果的关键区域(爆炸点、子弹轨迹区域)。
- 明确标注该场景对应资产规格为:无人物四宫格多角度场景参考图,画面比例 4:3,GPT Image 2 生成。
- 在描述中明确指定各镜头应引用四宫格中的哪一个子区域(如"左上——主入口正面视角"),避免镜头间场景子区域跳变。
- 场景物理属性标注: 若该场景属于角色需要站立其上、坐于其中或与其发生物理接触的承载型/包围型空间(如擂台、悬崖边缘、船甲板、车内、舞台平台、阳台、屋顶等),须在 element 描述中明确标注该场景的"承载面/包围结构"(如擂台的木板地面与绳索围栏、船甲板的甲板纹理与船舷);此标注将作为视频生成阶段提示词中声明角色物理关系的蓝本依据,防止模型将场景退化为纯虚化背景。
- 若用户上传了场景参考图,描述必须与上传内容保持一致;若不符合四宫格规范,须标注"以用户参考图为基础重制合规场景图"。
设计镜头(shots)
- 子弹时间核心镜头设计原则:
- 每个子弹时间镜头须明确标注:① 时间冻结/极慢动作的触发节拍;② 摄像机围绕主体的运动方式(环绕方向、旋转角度、轨迹);③ 冻结瞬间的精确主体姿态(如跳跃最高点、出拳瞬间、物体破碎帧)。
- 优先设计带内部剪切的较长镜头(10–15s),通过镜头内切换展示慢动作→冻结→复速,不拆碎成多个短镜头。单镜头时长须在 4–15s 范围内(Seedance 2.5 硬限制),根据分镜内容复杂度动态规划时长。
- 每个镜头描述必须包含:
- Scene: 引用 element scene 的 ID,并注明具体引用的四宫格子区域(如 [Element_Warehouse_Industrial] 左上子区域)。
- Story beats: 角色动作时间线(慢动作区段 → 冻结帧时刻 → 恢复速度区段);如有台词,写出精确台词,引用角色 element ID。
- Cinematography: 景别(特写/中景/全景)、摄像机角度(低角度/俯角/水平)、运动方式;子弹时间镜头须写明环绕方向和起止角度。
- 角色情绪设计公式(涉及情绪戏时必须使用): 凡镜头需要角色呈现明确情绪,Story beats 中须按以下四要素逐项展开——AI角色真实情绪 = 发生原因 + 表情细节 + 肢体动作 + 说话语气:
- 发生原因: 情绪由何事/何人触发,交代情境背景;
- 表情细节: 精确描述微表情(如眉头微皱、嘴角下沉、瞳孔收缩等可见细节),避免笼统词如"悲伤";
- 肢体动作: 身体语言及幅度(如双手握拳、肩部下沉、后退半步);
- 说话语气: 语速、语调、情绪修饰词(如低沉颤抖、语速加快、声音破音);留出情绪停顿标注。
- 四要素在 Story beats 中须依序列出,不可仅写概括性情绪词。
- 跨镜头节奏规划: 子弹时间高潮镜头前后各设置节奏对比镜头(正常速度铺垫或快切收尾),强化冻结感视觉冲击。
音频归属原则(设计阶段必须明确区分)
- 台词与内心独白: 归属于 shot 描述,由视频模型(Seedance 2.5)随视频直出,使用 {...} 语法写入镜头提示词;须为每个有台词的角色指定 key_element_audio 档案以保证全片音色一致。
- 旁白(VO / 画外音): 归属于独立 audio_layer(type: narration),由独立轨道制作,绝对不写入视频提示词正文,避免模型重复发音或干扰视频内音频。
- 防重叠原则(强制): 台词文本与旁白文本在内容上不得存在相同或相近的句子。若某句话已作为台词写入 shot(由角色开口说出),则该句绝对不可以再出现在旁白 audio_layer 的脚本中;反之亦然。设计阶段须逐场核查,发现重复须在此阶段消歧,而非等到生成后再修正。
设计跨镜头音频(audio_layers)
- BGM: 至少一条全局背景音乐轨道;子弹时间触发点可设计音效截断或环境音极度拉长。
- 旁白(VO): 定义 narration_speaker_profile(如 [冷静男声,低沉克制])、情感基调及逐字脚本;旁白情感基调须与当前场景氛围一致,关键句须留出情绪停顿标注;通过 layout_instruction 绑定到对应镜头区段。
- 角色配音(台词/独白): 每个有台词或内心独白的角色须绑定其 key_element_audio 档案;配音风格须与角色设定(年龄、性格、身份)高度匹配,禁止全程平淡无情绪变化;台词内容写入对应 shot 描述,由视频模型直出,不另开独立音轨。
4. 素材生成
全程模型约束:图像生成固定 GPT Image 2,视频生成固定 Seedance 2.5,严禁调用其他模型。
元素图像生成
- 角色 key_element 三视图:
- 使用 TextToImage(首版)或 ImageToImage(后续造型/多角度衍生),模型 GPT Image 2,分辨率 2K,画幅强制锁定为 16:9,不受视频画幅设置影响。
- 内容:单张图展示完整全身三视图——正面、侧面、背面水平并排;左侧补充头肩特写(面部、发型、肤色细节)。
- 同一角色多造型:使用 ImageToImage 以第一版为参考,确保跨版本一致性。
- 若用户上传角色图与目标影片风格不符,须以用户图为参考通过 ImageToImage 重新生成符合影片风格的三视图版本后再绑定。
- 场景 key_element 四宫格参考图:
- 使用 TextToImage,模型 GPT Image 2,分辨率 2K,画幅强制锁定为 4:3,不受视频画幅设置影响。
- 内容:四宫格布局,展示同一场景的四个不同角度/区域,无人物出现。
- 若用户上传场景图与规范不符,须以用户图为参考重新生成符合四宫格规范的版本后再绑定。
- 道具 key_element 图像: 使用 TextToImage,GPT Image 2,画幅 16:9;子弹时间效果道具重点呈现材质、光影与运动模糊细节。
角色音色档案(key_element_audio)
-
若用户提供了音色文件,直接注册并绑定到对应角色 key_element 的 key_element_audio,跳过以下生成流程。
-
若用户未提供音色文件,在开始制作前须通过交互式卡片让用户选择以下两条路径之一,并在卡片中说明各自的优缺点:
路径 A — 旁白模型生成音色(积分消耗较低)
- 从剧本中为每个角色选取一段约 5 秒的台词对话。
- 根据项目语言选择对应模型,通过 TextToSpeech 生成语音音频:
- 中文项目:推荐模型 MiniMax Speech 2.8 HD
- 英文项目:推荐模型 ElevenLabs v3
- 将生成的音频注册并绑定到对应角色 key_element 的 key_element_audio。
- 优点:积分消耗低,速度快;缺点:音色由 TTS 模型合成,与角色形象的贴合度依赖参数描述准确性。
路径 B — Seedance 2.5 视频提取音频(积分消耗较多,须向用户提示)
- 使用 MultiModalToVideo,模型 Seedance 2.5,以该角色的 key_element 图像为参考,根据角色剧本台词生成一段约 5 秒的角色开口讲话视频;提示词中须明确要求尽量减少背景音乐和音效,以确保提取到干净的角色声音干音。
- 将生成的视频注册为该角色 key_element 的视频资产。
- 通过 resource_prepare_and_analyze 从该视频中提取音频干音。
- 将提取的干音音频注册并绑定到对应角色 key_element 的 key_element_audio。
- 优点:音色与角色视觉形象高度一致,更贴合影片整体表现;缺点:积分消耗较多,流程步骤较多。
-
全片同一角色的台词生成必须调用同一 key_element_audio,不得在不同镜头中使用不同音色。
最终镜头视频生成
-
统一使用 MultiModalToVideo,模型固定为 Seedance 2.5,画幅 16:9,分辨率 480p。
-
每条视频生成前必须执行六项核查:
- 场景四宫格参考图是否已正确引用,且锁定了具体子区域。
- 角色三视图参考图是否已正确引用(涉及的所有角色)。
- 涉及台词或内心独白的角色,其 key_element_audio 是否已生成并绑定;若未绑定,严禁触发视频生成。
- 台词和对白内容是否完整写入提示词。
- 旁白内容是否已分配到独立旁白轨道而非写入视频提示词。
- 分镜描述中的关键动作、姿态、节拍细节是否已在提示词中逐条还原。
六项全部确认后方可触发生成,不得跳过。
-
每镜头的参考输入:
- element 图像(必须): 引入该镜头涉及的所有角色 key_element 三视图及场景/道具 key_element 图像,并在提示词中明确指定场景四宫格子区域。
- 图像参考数量上限(硬限制): Seedance 2.5 单条视频生成的 image_infos 总数不得超过 9 张。当一个镜头涉及多角色三视图 + 场景四宫格 + 道具图时,须按优先级裁减:角色三视图优先保留,场景四宫格次之,次要道具可降级为提示词文字描述。
- 连续性视频参考(可选): 仅当该镜头与前一镜头视觉连续性极强时,才额外添加前一镜头视频作为 reference_video;通常跳过视频参考。
-
若镜头用户已提供现成视频素材,先绑定到对应 shot,不重新生成。
生成失败与重制策略(全类型资产通用)
- 生成失败(未产生任何资产): 可自动重试,无需询问用户。
- 资产已生成但质检不合格(如构图偏差、主体错误、风格不符等): 严禁自动重新生成;须暂停并向用户展示已生成资产,清晰说明质量问题与判断理由,由用户决定是否重制;未获用户确认不得触发新一轮生成,以避免不必要的积分消耗。
BGM 生成
- 使用 text_to_instrumental 工具生成背景音乐;推荐模型 Suno 5,备选 Mureka 8。
- 提示词中描述音乐风格、情绪基调、节奏感及子弹时间场景氛围(如"紧张、工业金属感、节拍强烈,适配极慢动作冻结场景");禁止在提示词中出现知名音乐人名字(Suno 5 合规限制,会大概率生成失败)。
- BGM 生成完成后注册为 audio_layer 资产,在 video_assembler 阶段与视频轨合并。
超分辨率处理(用户确认后执行)
- 使用 super_resolution 工具,模型 MediaKit(视频专用)。
- 推荐参数:scene: "aigc"(适配 AI 生成内容)、resolution: "1080p"、tool_version: "standard"(速度优先)、fps: 24。
- 如用户对画质有更高要求且愿意等待更长处理时间,可将 tool_version 升级为 "professional"。
音频生成归属(台词 vs 旁白严格隔离)
- 台词与内心独白: 由 MultiModalToVideo(Seedance 2.5)随视频直出,使用 {...} 语法写入视频提示词;需在 audio_infos 中调用对应角色的 key_element_audio 保持音色一致。
- 旁白(VO): 通过独立 audio_layer 生成,使用 TextToSpeech,推荐模型:中文项目 MiniMax Speech 2.8 HD,英文项目 ElevenLabs v3;绝对不写入视频提示词;在 video_assembler 阶段与视频轨分层合并。
- 防重叠核查(生成前强制): 每条视频生成前,须对照同镜头的旁白 audio_layer 脚本,逐句检查是否有文本与视频提示词内 {...} 台词重复或高度相似;一旦发现重复,须先消歧再触发生成,不得跳过。
- 两者严禁混用:台词不独立出轨道,旁白不注入视频提示词。
5. プロンプト作成
最高优先级(全局): 若用户以中文交互或使用中文界面,提示词主体用中文撰写;片中台词/旁白语言遵循 Final_Video_Spec 的输出语言设定。
图像提示词(TextToImage / ImageToImage,GPT Image 2)
- 写法风格:导演+调色师的视觉简报。自然语言描述主体+动作+环境,短语组合风格/色彩/光影/构图,只写镜头能捕捉到的内容。
- 角色三视图提示词要点: 明确要求"full body three-view: front / side / back, horizontal layout";锁定面部特征、发型、服装细节及材质;在提示词中强制指定画幅 16:9,防止模型输出其他比例;避免画面中出现无关文字或额外人物。
- 场景四宫格提示词要点: 明确要求"four-panel scene reference grid, four angles/areas of the same location, no characters";在提示词中强制指定画幅 4:3;每个格子的视角须有明确差异(正面、侧面、纵深、特写细节)。
- 子弹时间风格关键词方向: 极端慢动作冻结感、空气中悬浮的碎片/液体/子弹、动态模糊与清晰焦点的对比、戏剧性侧逆光/强对比度、高饱和金属光泽与材质细节、电影级构图(低角度仰拍/三分构图)。
- 写实风格强制执行(Final_Video_Spec 中锁定为写实风格时必须执行):
- 图像提示词(角色三视图 / 场景四宫格 / 道具参考图) 中必须显式写入写实风格锚定词,如 photorealistic, cinematic photography, real human skin texture, physically accurate lighting, shot on camera 等;同时必须写入风格排除词:no anime, no cartoon, no illustration, no 3D render, no painting, no stylized,防止模型默认偏向插画或动漫风格。
- 视频提示词 中同样须写入写实锚定词(photorealistic, live-action cinematography, real human subject)及排除词(no anime style, no cartoon, no stylized animation)。
- 凡提示词中出现任何可能被模型识别为动漫/插画倾向的词汇(如 vibrant colors, cel-shading, stylized, illustrated, 2D),须替换为写实对应词汇,不得保留。
- 格式:流畅单段落自然语言,不输出带标签的分段结构。
视频提示词(MultiModalToVideo,Seedance 2.5)
- 参考图像用占位符绑定:<<<image_1>>>、<<<image_2>>> 等,按角色/场景顺序对应。
- 场景子区域锁定(防跳变): 每条视频提示词中必须明确描述所用场景四宫格的具体子区域特征(如"镜头发生在仓库正门入口区域,混凝土地面,左侧铁门半开"),防止模型随机引用其他子区域导致场景跳变;同时加入 generate as a single unified scene, not as a grid,禁止将四宫格布局直接生成为四宫格视频画面。
- 场景物理交互声明(防场景退化为背景): 当场景属于角色需要站立其上、坐于其中或与其发生物理接触的空间(如擂台、悬崖边缘、船甲板、车内/车顶、舞台平台、阳台、屋顶等),必须在提示词中明确声明角色与场景的物理关系,禁止将场景描述方式退化为纯背景板。具体做法:
- 明确描述角色的立足点(如"角色双脚站立于擂台木板地面上"、"角色坐于车内驾驶舱座椅");
- 描述场景对角色的空间包围/承载关系(如"悬崖石台延伸至角色脚下,边缘清晰可见"、"船甲板甲板纹理在角色脚下延伸至画面前景");
- 若场景有边界或围栏(如擂台绳索、船舷栏杆、阳台护栏),在提示词中明确其位置与角色的相对位置关系,作为空间锚点,防止模型忽略场景结构仅渲染背景虚化效果。
- 前镜头视觉锚点注入(防跳变): 每条视频提示词中注入前序镜头的关键视觉锚点,包括:主角服装颜色与材质、主要光源方向与色温、场景背景关键陈设特征,确保镜头间人物外观、场景、光影连贯。
- 运动描述栈(按顺序写入):
- Camera: 子弹时间镜头写明环绕方向(顺/逆时针)、起止角度、速度;非子弹时间镜头写常规运动(推/拉/锁定)。
- Subject: 精确描述动作体位(具体到肢体部位)、慢动作区段、冻结帧姿态;多动作按故事时间顺序列出。
- Space: 背景/环境变化,碎片/子弹等特效元素的运动轨迹,锁定具体场景子区域特征。
- Audio: 用 Seedance 2.5 语法——音效 <...>、对白 {...}(非项目语言时在括号前标注语言);台词节奏需配合画面节奏,关键台词在写法上留出情绪停顿;配音情绪/语速/语调须附加修饰词与角色性格匹配,禁止平淡;旁白(VO)在独立轨道生成,绝对不在视频提示词中写入旁白正文,避免视频模型重复发音。
- 角色情绪提示词公式(涉及情绪戏时必须应用): 凡镜头含角色情绪表演,Subject 和 Audio 描述须按四要素展开——AI角色真实情绪 = 发生原因 + 表情细节 + 肢体动作 + 说话语气:
- 发生原因 写入场景/事件触发语境(简短背景交代,服务于模型理解角色情绪动机);
- 表情细节 转化为可视化微表情描述词(如 eyes slightly widen, jaw tightens, lip corners pull down),禁用"看起来悲伤"之类笼统表述;
- 肢体动作 注明具体部位与幅度(如 shoulders drop, fists clench at sides, takes a half-step back);
- 说话语气 以音色修饰词写入 {...} 对白标注中(如 {voice trembling, pace slowing}台词文本)。
- 四要素均须出现在提示词中,不可合并为概括情绪词替代。
- 固定负向描述: 几乎总写 no music(BGM 在独立轨道处理);始终写 no subtitles(字幕在后期处理);场景四宫格图作为参考时加 no grid layout, single unified frame。
- 提示词字符上限(硬限制): Seedance 2.5 单条视频提示词(含所有 <<<image_X>>>、<<<video_X>>>、<<<audio_X>>> 占位符标签)总字符数不得超过 2,300 个;超限将导致生成失败。镜头内容复杂时,优先压缩重复的背景描述和风格修饰词,保留动作、台词和情绪四要素;如确实无法缩减,可将部分次要场景细节移至 element 描述层而非写入每条提示词。
- 旁白防注入规则(强制): 视频提示词中绝对不写入任何旁白正文;写提示词前须对照当前镜头的旁白 audio_layer 脚本,凡出现相同或高度相近的句子,必须从提示词中删除,防止视频模型将旁白文字作为台词直出导致声音重叠。
- 不用绝对时间分割(如"0–3秒/3–6秒"),改用故事节拍顺序描述。
6. 動画編集
剪辑节奏与拼装原则
- 子弹时间高潮镜头: 单独作为叙事节拍高峰,前后设置缓冲过渡(慢入/慢出),避免直接硬切到正常速度镜头,保留时间感冲击。
- 整体节奏: 铺垫段落保持正常或略快节奏;子弹时间触发瞬间可配合音效截断或静默,强化视觉冻结感;之后渐进恢复正常节奏。
- 音画同步: BGM 的节拍点与子弹时间触发帧对齐;若有旁白,保证旁白句尾与镜头切换节点吻合。
- 转场: 子弹时间镜头内部不额外添加转场特效(保持速度变化本身的视觉冲击);常规镜头间优先使用简洁切换或短淡入淡出,不滥用花哨转场。
- 超分辨率处理: 在执行最终合成之前,必须向用户弹出选项,询问是否对素材执行 super_resolution 处理;待用户明确确认(执行或跳过)后,再输出最终时间线并触发渲染。
- 音量层级参考(三轨相对关系):
- BGM: 压低至 -18 dB 至 -20 dB 左右作为垫底层,子弹时间冻结触发瞬间可配合音效截断或进一步压至 -30 dB,恢复正常速度后渐回原音量。
- 旁白(VO): 作为主叙事声道,保持在 -6 dB 至 -9 dB,须清晰盖过 BGM,与台词轨不重叠出现。
- 台词(视频内直出): 保持在 -6 dB 至 -3 dB,为全片最高优先级声道;台词出现期间 BGM 须自动闪避(duck)至 -26 dB 以下。
- 整体原则: 优先级顺序为 台词 > 旁白 > BGM;任意两轨同时出现时,低优先级轨须自动降音量;三轨不得同时全音量叠加。
- 旁白与镜头时长不匹配处理策略:
- 旁白优先,不截断: 旁白音频时长与对应镜头视频时长出现偏差时,以旁白完整播出为优先原则,不得截断旁白以迁就镜头边界。
- 允许旁白跨镜头延续: 若旁白比单个镜头长,允许旁白音频自然延续到下一个镜头,无需强行分段;跨镜头延续时须确保旁白语义完整,不在句中截断。
- 镜头不因旁白强制拉长: 视频镜头时长由故事板分镜设计决定,不因旁白时长而强制延长;若旁白比镜头短,镜头正常结束,旁白结束后进入静默或由 BGM 填充。
- 极端不匹配时的处理: 若旁白与镜头时长偏差超过 30%(如旁白明显过长或过短),须在组装阶段暂停,向用户展示预估时间线并建议是否回到故事板阶段调整旁白脚本或镜头时长,由用户确认后再继续。
- 导出: 画幅 16:9,分辨率 720p(若执行超分则按超分后分辨率),遵循 Final_Video_Spec.md 的全局设定。