Immersive handheld tracking shot
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
适用于短视频、微电影、Vlog等真人叙事创作。上传一张角色图或一段想法,智能解析生成呼吸感手持+跟拍音画同步短片。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
全片策划阶段逻辑与依赖关系:
- 建立全局视频简报:通过 text_editor 建立 Final_Video_Spec.md(包含:片名、画幅比例(默认 16:9)、目标时长、输出语言、视觉风格大类("写实电影手持/FPV风格")、字幕(默认关闭)、BGM(默认关闭,用户可选开启);以及两个可选模式开关——fpv_mode:是否启用FPV肩后跟拍(默认开启);one_shot_mode:是否模拟连续长镜头(默认关闭,开启后减少切镜数量,使用动作匹配/眨眼/穿越转场衔接)),作为全局参数底座。在开始剧本解析前,向用户确认 fpv_mode 和 one_shot_mode 两个模式的偏好;其余参数(16:9、无字幕、无BGM)作为默认值,仅在用户主动修改时更新。
- 角色身份板(Role Identity Board)设计:
- 检查用户输入:若用户上传了人物参考图或提供详细文字描述,调用 resource_prepare_and_analyze 提取其核心骨架、发饰特征。
- 角色元素生成:调用 media_generator 使用 Nano Banana Pro 的 TextToImage(或 ImageToImage)生成 2K 纯白背景的多视角、多表情角色身份板(Character Sheet),并注册为该角色的 key_element 资产。
- 【暂停确认节点】:展示生成的身份板图像,必须由用户确认无误并锁定后,方可进行后续步骤。
- 剧本解析与 Storyboard 构建:
- 调用 storyboard_designer 接收用户剧本/创意。将其拆解为结构化镜头(shots)、关键元素(elements,如角色 element character、场景 element scene 和道具)及独立音频轨(independent audio tracks)。
- 解析剧本中的台词情绪强度,并将其完全拆解为具体的生理动作描述与手持/FPV运镜配合。
- 【暂停确认节点】:展示结构化 Storyboard 表格,用户确认镜头切分、时长占比和动作/运镜设计。
- 媒体资产生成与绑定:
- 角色与场景资产绑定:调用 media_generator 将步骤 2 锁定的角色身份板图像、以及场景参考图绑定到 Storyboard 的 key_element 槽位中。若有声音样本,绑定为该角色的 key_element_audio。
- 逐镜头视频生成:调用 media_generator 的 MultiModalToVideo 路径(首选 Seedance 2.5(分辨率 480p)),将绑定的角色身份板、场景参考图作为视觉参考输入,结合手持/FPV运镜与动作描述生成每个 shot。
- 音频生成:调用 media_generator 进行语音(VO/对白)及音效生成。台词转换为带有生理停顿与语气标注的 TTS(使用 ElevenLabs v3 或 MiniMax Speech 2.8 HD),音效则根据分镜卡片进行生成或检索。
- 【暂停确认节点】:展示已生成的视音频片段,供用户逐批审查一致性与动感。
- 全片剪辑与质检:
- 调用 video_assembler 拼接所有资产。进行严格的无固定机位抽查、角色相似度质检,调整音频与画面的对齐、淡入淡出及音效层级,最终合成输出,并引导用户点击右上方"保存并激活"激活该 Skill。
依赖关系: 2 -> 1; 3 -> 2; 4 -> 3; 5 -> 4。
暂停确认机制: 坚决执行阶段性暂停。严禁一键跑完全部生成流。必须在角色身份板、Storyboard 剧本设计、媒体资产生成完毕后停顿,使用 cards 或回复文本提供选项,保证用户全程可控。
- 调用 video_assembler 拼接所有资产。进行严格的无固定机位抽查、角色相似度质检,调整音频与画面的对齐、淡入淡出及音效层级,最终合成输出,并引导用户点击右上方"保存并激活"激活该 Skill。
2. 멀티모달 분석
参考素材的多模态分析规范
- 角色图像分析:当用户上传人物参考图时,必须精确分析并提取:
- 核心身份特征(年龄段、性别、骨骼轮廓、眼型与眉毛特征、发色与特定发型)。
- 细节特征(皮肤毛孔粗细、有无痣/雀斑/皱纹、光影投射方向、服装材质与主色调)。
- 输出格式化文本供 key_element 描述使用,禁止使用抽象词(如"帅气"、"美丽"),必须转化为具体写实描述(如"高鼻梁,下颌线转折清晰,额头带有细微皱纹")。
- 声音样本分析:若用户上传了配音或人声参考,解析其性别、年龄感、语速基调(缓慢、急促)、音色纯净度及环境背景音。将其标注为 key_element_audio 的参考特征,以在后续 TTS 生成中选择或合成最匹配的音色。
3. 스토리보드 설계
手持拍摄与FPV镜头设计规范
1. 关键元素设计 (Elements)
- element character(角色元素):必须包含一个主身份板的详细视觉定位。当存在多个角色时,必须分别建立 key_element。在 description 中必须清晰标注角色在身份板中的服饰、体型及面部细节(如毛孔、纹理等),确保后续生成高度一致。
- element scene(场景元素):对场景中的关键光源(如路灯、窗光、霓虹灯、自然光)和色温进行标注,遵循真实场景光源(如日间自然光、阴天散射光、普通室内灯光等),允许展现多样化的色彩与氛围,不强行统一为高反差色调。
2. 镜头运镜设计规则 (Shots) - 强制手持/FPV动态
- 无固定机位禁令:在 shot 的 description 中,严禁出现"固定镜头"、"静止机位"、"Static"等描述。即使是静止不动的场景,也必须设计为"呼吸式晃动(模拟扛机者呼吸)"或"微幅手持微晃"。
- 运动摄影机动作(每个短片必须包含至少4种):
- 手持跟拍:镜头随主角前行步伐产生上下起伏和微弱的晃动感,摄影机轻微滞后主体运动,形成物理追随感。
- 缓慢推近/拉远:用于情绪渐进或视觉焦点收敛,控制推拉速度缓慢变化。
- 快速甩镜(Whip Pan):在视线转移或突发事件时使用,要求快速旋转机位掠过环境,带有短暂的运动模糊。
- 环绕推移(Orbital/Arc Shot):用于内心纠结或人物对峙,以缓慢的速度围绕主体做圆周运动。
- 急推(Crash Zoom):在情绪突变、受惊吓时使用,短促快速地向主体推进。
- 惯性过冲(Inertial Overshoot):当运镜急停或换向时,必须包含轻微的回弹回正画面动作。
- FPV 肩后跟拍(fpv_mode 开启时必用):镜头位于主角背后近距离、略高于肩部,主角肩背或后脑勺作为前景虚化入画。随主角步伐上下起伏,模拟人眼高度节奏。转弯时镜头产生轻微离心感(轻微向弯道外侧偏移后回正)。禁止穿模:前景肩背不得遮挡主角面部。适用场景:行走、奔跑、穿越门洞、上楼梯、回头等连续运动段落。
- 模拟连续长镜头转场衔接(one_shot_mode 开启时):减少镜头切分数量(全片控制在少量长镜),镜头间必须采用以下衔接方式之一:
- 动作匹配转场:上一镜结尾动作与下一镜开头动作连贯(如举手→切至手部特写)。
- 眨眼黑屏转场:短促黑屏模拟眨眼,衔接不同场景。
- 跟拍穿越转场:跟随主角穿过门/窗/走廊,自然过渡至下一场景。
- 模拟连续长镜头时长分配建议(one_shot_mode 开启时):每个长镜单次时长建议控制在 10–30s(不超过模型最大支持上限 30s)。全片总时长 ÷ 镜头数量为参考基准,优先将情绪密度最高的段落(高潮/转折)分配 13–30s,开场与收尾段落适当压缩至 10–12s,形成"慢起—紧张加速—舒缓收尾"的节奏弧线。
- 模拟连续长镜头内部节奏设计要点(one_shot_mode 开启时):每个长镜内部必须包含至少数个节奏层次,禁止全程匀速运动:
- 建立段(开篇部分):以呼吸式微晃或 FPV 入场稳定画面,交代空间与人物关系,节奏偏慢。
- 发展段(中间段):引入核心动作或台词,运镜频率提升(如从手持跟拍切换到缓慢推近或环绕),情绪递进,镜头与人物动作呼应。
- 爆发 / 收束段(收尾部分):若该镜为高潮段,使用急推或快速甩镜完成情绪顶点;若为过渡长镜,以惯性过冲自然引导至转场动作(进入下一镜的衔接手势或穿越点),避免生硬截断。
- 运镜密度控制:单个长镜内运镜类型变换不宜过多(如不超过3种),防止画面过于混乱;类型切换必须由人物动作或情绪节点驱动,而非无规律堆砌。
- 景别变化链:严禁连续两个镜头使用相同景别。镜头组合理排布:远景(环境交代)-> 全景(人物环境关系)-> 中景(肢体动作)-> 近景(表情传达)-> 特写(局部特征细节),形成视觉节奏。
3. 遵循真实场景光源与光影规范
- 每个 shot 必须明确标注主光源方向与光源属性(如:侧逆光、自然散光、顶光、室内白炽灯、散射光等)。
- 真实光影呈现:根据具体环境(如户外自然光、阴天散射光、普通室内灯光等)进行写实还原。若场景有特定戏剧性设计,允许自然光、阴天和普通室内光的质感,避免一味强加生硬的冷蓝暖橙高反差调色。光影描写须服务于场景的真实质感和叙事氛围。
- 跨镜头光线一致性:同一场景下的相邻 shot 必须锁定光源方向和色温基调。当主光源方向在 shot description 中首次确定后(如"左后方侧逆光"),后续同场景镜头必须沿用相同的方位描述,不得无故改变光源方位;如果剧情推进导致光源变化(如从室外走入室内),必须在 shot description 中显式标注光源切换节点及新光源参数,不可无声切换。
4. 道具 key_element 注册与跨镜状态追踪规范
- 注册条件:满足以下任一条件的道具,必须在 Storyboard elements 中注册为独立的 key_element prop:
- 在 2 个及以上 shot 中出现;
- 道具在剧情中发生明显状态变化(如雨伞从收起→撑开→折断,手机从亮屏→黑屏→摔碎);
- 道具作为情绪符号或叙事锚点(如信封、相框、戒指等承载剧情意义的物品)。
- key_element prop 描述规范:每个道具的 description 必须包含以下字段:
- 外观基准:材质、颜色、尺寸比例、表面纹理(如"黑色自动折叠伞,伞布有细小反光银丝,伞柄为磨砂橡胶材质")。
- 初始状态:第一次出现时的完整状态(如"收起、干燥、握于右手")。
- 状态变化节点表:按 shot 编号顺序列出每次状态切换,格式为"Shot N → 状态描述"(如"Shot 2 → 撑开,伞面被雨水打湿;Shot 4 → 摔落地面,伞骨弯折")。
- 跨镜状态追踪写法:在每个包含该道具 of shot description 中,必须在开头显式写明该道具的当前状态(与状态变化节点表保持一致),不得依赖模型自行推断。示例:"男主右手持已撑开的湿伞(伞面有雨水流痕),……"。
- 前景道具的光影一致性:当道具作为前景元素(如 FPV 跟拍中出现的肩包、伞柄)时,其受光面和阴影方向必须与 shot 中锁定的主光方向一致,在 description 中单独标注。
5. 跨镜头连续性设计规范
- 人物状态锁定:在 shot description 中,角色的服装状态(衣领、袖口、是否有汗渍等)、道具持有状态(如是否手持伞/手机)、发型状态必须在相邻镜头间保持精确一致,不可在同一场景中出现不合理的状态突变。若某 shot 中人物做出了改变外观状态的动作(如撑起雨伞),后续 shot 中的描述必须同步更新该状态。
- 场景空间锁定:标注关键道具和场景地标在画面中的相对位置(如"路灯位于主角左后方"),相邻镜头沿用该方位描述,确保空间连续感。
- 衔接预告设计:在每个 shot description 末尾加入一行"衔接提示",描述该镜头结束时人物所处位置、朝向及动作状态,为下一镜的入场提供对位参照。
6. 背景群众动态行为与自然融入规范
- 群众不是道具:背景中的人群必须具有自然、多样化的动作与行为,如同真实街拍或实景拍摄。群众的行为不能干扰主角叙事(不主动遮挡主角、不与主角产生互动,除非剧情明确要求)。
- 场景适配行为库:在 shot description 中按场景类型明确群众行为,禁止静止或全员朝同一方向走:
- 街道/旅游区:不同方向行走、驻足拍照、聊天、看手机、等公交、骑车,密度中高,偶有人回头或避让;
- 教室/课堂:听课、低头写字、转笔、轻声交谈、打哈欠,老师可在讲台活动,学生不全员僵坐;
- 餐厅/咖啡馆:用餐、喝咖啡、聊天、看手机、服务员端盘走动,杯具可有蒸汽;
- 公园/广场:散步、跑步、带孩子玩、坐长椅,动静结合;
- 办公室:打字、接电话、走动、开会比划手势,避免所有人面对屏幕。
- 外形随机化要求:禁止出现完全相同的两个群众(不可复制粘贴同一外形)。服装颜色、款式、季节与场景文化背景匹配,不可统一着装;年龄与性别比例随机分布。
- 景别分层动态:近景群众动作清晰但须景深虚化避免抢戏;中景群众动作可辨识即可;远景群众可用模糊群体表现,但须有整体动感。快速移动的群众(骑车、跑步)须标注轻微运动模糊。
7. 场景设计与人物背景融合规范
- 场景来源:优先使用用户提供的场景参考图;若无,根据剧本地点、时间、天气、情绪生成实景质感场景(如街道、咖啡馆、室内、公园等)。严禁使用纯色背景、虚拟演播室、合成感强的 CG 环境或明显重复贴图。
- 情绪适配:悲伤/压抑选阴天、雨夜、昏暗室内,冷色调;温暖/治愈选阳光或傍晚路灯,暖色调;紧张/悬疑选重阴影、单侧光的走廊或楼梯间;轻松/日常选白天自然光环境。
- 光影一致性:场景主光方向必须与人物身上光影方向严格一致(如窗外左侧阳光 → 人物左侧高光、右侧阴影);在 shot description 中明确标注主光方向,作为视觉融合的核心锚点。
- 人物融合细节:人物比例与场景透视协调(头顶留空、脚底接地);脚下阴影方向与长度匹配场景光源;若地面有反光(水面、玻璃)须描述人物倒影;近景适当景深虚化但背景不糊成色块,远景人物与背景均清晰。
- 色温一致性:人物肤色、服装色温须与环境光色温匹配(暖光下偏暖,冷光下偏冷),禁止人物冷调而背景暖调等不协调组合。
8. 情绪强度与运镜类型联动映射
情绪节点是运镜切换的唯一合法驱动源。在 shot description 中,每当出现情绪强度标注时,必须从以下映射表中选取对应的运镜方式,不得随意搭配或与情绪相悖。
情绪强度等级定义:
- 弱:情绪暗流涌动,外在克制,角色动作幅度小
- 中:情绪开始外显,有明确的肢体或表情反应
- 强:情绪爆发或临界,全身生理反应明显,场面张力最高
情绪类型强度首选运镜备选运镜禁用运镜节奏说明焦虑 / 等待弱呼吸式微晃(静止场景)缓慢推近固定机位、环绕晃动幅度控制在轻微呼吸感,周期缓慢,模拟紧绷的扛机呼吸焦虑 / 等待中手持跟拍(原地踱步)FPV 肩后跟拍急推、甩镜步伐节奏引导镜头起伏,轻微滞后,不规律的步幅变化模拟坐立不安失落 / 悲伤弱缓慢推近呼吸式微晃甩镜、急推推进速度慢速,极慢收敛,强调孤立感失落 / 悲伤中缓慢推近 + 轻微下沉(镜头重心下移)环绕(半圈,外扩)急推、甩镜环绕时向外扩散,加大人物在画面中的孤立空间,情绪向外溢出失落 / 悲伤强环绕(大弧度,极慢速度)手持跟拍(随角色蹲下/倒下)急推、甩镜镜头以极慢速度环绕,维持情绪压迫感;如角色身体下沉,镜头同步降低重心愤怒 / 压抑弱缓慢推近(锁定面部)呼吸式微晃(频率加快)环绕、甩镜推进节奏与台词节拍对齐;晃动周期缩短,模拟强行压制的情绪张力愤怒 / 压抑中手持跟拍(急促步伐)惯性过冲环绕镜头轻微滞后,过冲明显,每次停步带明显回弹,传达内心撕裂感愤怒 / 压抑强快速甩镜(Whip Pan)+ 急推(Crash Zoom)手持跟拍(激烈追随)缓慢推近、环绕甩镜短促完成,运动模糊明显;急推紧随甩镜后立即触发,双重冲击叠加情绪顶点惊吓 / 突变任意急推(Crash Zoom)快速甩镜缓慢推近、环绕快速急推,若角色有身体后退反应,镜头同步跟随并触发惯性过冲温情 / 治愈弱呼吸式微晃(极轻)缓慢推近甩镜、急推晃动幅度压至极轻微,推进速度慢速,营造温柔驻留感温情 / 治愈中FPV 肩后跟拍(平缓跟随)缓慢推近甩镜、急推FPV 步伐起伏减弱至平缓变慢的步频,模拟轻松悠闲行走;转弯时离心感极轻纠结 / 对峙中环绕(Orbital Shot,双人居中)手持跟拍(缓步踱步)固定机位以慢速围绕两人之间的张力轴;若对峙激化,速度可提升传达压迫感升级纠结 / 对峙强环绕(加速) + 急推切换(切至面部特写)快速甩镜(在两人间切视线)缓慢推近环绕加速后,以急推直接切入其中一人眼神,完成叙事焦点转移释然 / 结尾弱缓慢拉远(Pull Back)呼吸式微晃(渐弱收尾)急推、甩镜慢速拉远,镜头重心随人物背影逐渐上升,暗示故事余韵延续 - 中:情绪开始外显,有明确的肢体或表情反应
- 强:情绪爆发或临界,全身生理反应明显,场面张力最高
情绪类型强度首选运镜备选运镜禁用运镜节奏说明焦虑 / 等待弱呼吸式微晃(静止场景)缓慢推近固定机位、环绕晃动幅度控制在轻微呼吸感,周期缓慢,模拟紧绷的扛机呼吸焦虑 / 等待中手持跟拍(原地踱步)FPV 肩后跟拍急推、甩镜步伐节奏引导镜头起伏,轻微滞后,不规律的步幅变化模拟坐立不安失落 / 悲伤弱缓慢推近呼吸式微晃甩镜、急推推进速度慢速,极慢收敛,强调孤立感失落 / 悲伤中缓慢推近 + 轻微下沉(镜头重心下移)环绕(半圈,外扩)急推、甩镜环绕时向外扩散,加大人物在画面中的孤立空间,情绪向外溢出失落 / 悲伤强环绕(大弧度,极慢速度)手持跟拍(随角色蹲下/倒下)急推、甩镜镜头以极慢速度环绕,维持情绪压迫感;如角色身体下沉,镜头同步降低重心愤怒 / 压抑弱缓慢推近(锁定面部)呼吸式微晃(频率加快)环绕、甩镜推进节奏与台词节拍对齐;晃动周期缩短,模拟强行压制的情绪张力愤怒 / 压抑中手持跟拍(急促步伐)惯性过冲环绕镜头轻微滞后,过冲明显,每次停步带明显回弹,传达内心撕裂感愤怒 / 压抑强快速甩镜(Whip Pan)+ 急推(Crash Zoom)手持跟拍(激烈追随)缓慢推近、环绕甩镜短促完成,运动模糊明显;急推紧随甩镜后立即触发,双重冲击叠加情绪顶点惊吓 / 突变任意急推(Crash Zoom)快速甩镜缓慢推近、环绕快速急推,若角色有身体后退反应,镜头同步跟随并触发惯性过冲温情 / 治愈弱呼吸式微晃(极轻)缓慢推近甩镜、急推晃动幅度压至极轻微,推进速度慢速,营造温柔驻留感温情 / 治愈中FPV 肩后跟拍(平缓跟随)缓慢推近甩镜、急推FPV 步伐起伏减弱至平缓变慢的步频,模拟轻松悠闲行走;转弯时离心感极轻纠结 / 对峙中环绕(Orbital Shot,双人居中)手持跟拍(缓步踱步)固定机位以慢速围绕两人之间的张力轴;若对峙激化,速度可提升传达压迫感升级纠结 / 对峙强环绕(加速) + 急推切换(切至面部特写)快速甩镜(在两人间切视线)缓慢推近环绕加速后,以急推直接切入其中一人眼神,完成叙事焦点转移释然 / 结尾弱缓慢拉远(Pull Back)呼吸式微晃(渐弱收尾)急推、甩镜慢速拉远,镜头重心随人物背影逐渐上升,暗示故事余韵延续
联动使用规则:
- 情绪强度跨越等级时(如从"弱→强"),运镜类型必须随之升级,不可在强情绪段落维持弱情绪运镜。
- 同一 shot 内发生情绪等级跳变(如"压抑突然爆发")时,必须在 shot description 的节奏分层中标注触发时间点,并在该时间点切换运镜类型。
- 情绪类型映射表不能逆向使用(如"因为要用急推,所以设计一个惊吓节点"),运镜服从情绪,情绪不服从运镜。
9. 台词节奏与运镜速率精确同步规范
台词的停顿点、语速变化与镜头运动速率必须在 shot description 中显式对齐,而非各自独立设计。以下为对齐规则:
9.1 停顿点 → 运镜变速锚点
台词中每一处"……"或"——"停顿,必须在 shot description 中标注对应的运镜行为:
- 短停顿("……"):运镜速率减缓但不停止,控制推近速度轻微放慢,模拟呼吸间隙的微缓;若当前为手持跟拍,步伐起伏周期同步拉长。
- 长停顿("——"或较长时间的沉默):运镜完全暂停或切换为呼吸式微晃(大幅减弱晃动,保持极轻微呼吸感),镜头"屏住呼吸"等待台词重启;若下一句情绪升级,停顿结束时以惯性过冲启动新运镜。
- 气声 / 哽咽(写法:"吸气" 或无文字的空白停顿):镜头在停顿期间轻微下沉(重心轻微向下移动),配合角色生理下沉感,停顿结束后回正。
9.2 语速 → 运镜速率映射
台词语速特征运镜速率基准说明极慢(每字间隔明显,气声主导)推进/拉远速度慢速;手持晃动周期长适用于失落/悲伤/释然,镜头与角色同节奏"喘息"慢(较慢语速)推进速度中等偏慢;手持晃动周期中等适用于压抑/克制情绪,镜头保持平稳追随正常(正常语速)推进速度中等偏快;手持跟拍步频中等正常叙事性台词,镜头稳定服务内容快(急促,多用 "!" 或短句连发)手持跟拍步频加快,轻微滞后;环绕速度可升至快速适用于焦虑/愤怒,镜头节奏跟随台词"喷发"感极快(破音、尾音上扬,语速失控)触发快速急推或快速甩镜,随即惯性过冲回正适用于惊吓/崩溃节点,速率突变强化突发感
9.3 关键字词 → 运镜峰值时刻
台词中承载叙事核心重量的关键字词(如角色名、转折词、否定词),必须在 shot description 中标注为"运镜峰值时刻",并写明对应行为:
- 关键字词发音瞬间:运镜速率在该字词发出的同一帧达到峰值(如推进速率瞬时提升、甩镜触发),随后短促回落至基准速率,形成"冲击→余震"的节奏感。
- 否定/转折词("不"、"算了"、"别"、"走"等):配合急推或惯性过冲,几乎与说话同时触发。
- 情绪最高点单字(如"滚!"、"留!"):配合甩镜,甩镜启动时间与该字发音同步;甩镜完成后镜头回正时角色应已处于运镜动作结束姿态,形成视觉-声音的双重收束。
9.4 多角色对话切镜节拍规则
双人或多人对话段落中,镜头在各角色之间的切换节拍必须由台词节奏驱动,而非等待当前角色说完才切镜。以下为强制执行的切镜规范:
切镜时机
- 提前切镜原则:下一句台词的开口说话人开始发音前极短的一瞬间,镜头必须已完成切换并落稳在该角色身上。不得在对方台词已经开口后才切镜(视觉滞后感)。
- 尾音重叠设计:当说话人尾音自然衰减(句末语气词、停顿)时,镜头即可提前切出;尾音不必完整收尾后再切,轻微的尾音在下一镜中"淡出"是合理的。
- 情绪强度影响切镜速度:
- 平静对话(情绪弱):切镜节奏平缓,在对方说话说到快结尾时才切。
- 争执/对峙(情绪中强):切镜节奏加快,可在对方台词刚过半时切走,形成"话被截断"的压迫感。
- 情绪爆发(情绪强):允许在对方台词中途切镜,配合甩镜或急推,传达对话的撕裂感。
反应镜头(Reaction Shot)设计
- 每段对话中,至少安排 1–2 个反应镜头:当 A 角色正在说话时,镜头切至 B 角色的面部,捕捉其微表情(眼神游移、吞咽、咬唇、微微皱眉等),而非一直停在说话人身上。
- 反应镜头时长建议短促(数秒内),不宜过长导致说话人台词无画面支撑;若台词含重要信息点,优先保留说话人画面。
- 反应镜头中,被拍摄角色不说话,但必须有具体生理微动作描述(禁止写"沉默地看着对方"等抽象描述),例如:"B 角色嘴角微微收紧,视线短暂下移后重新抬起,喉结轻微滑动。"
景别交替原则
- 对话切镜时,相邻两个切镜之间的景别必须有变化,禁止 A 中景 → B 中景的同景别对切:
- 常规变化:A 中景 → B 近景 → A 近景 → B 特写(随情绪升级逐渐推近双方景别)。
- 对峙升级时:双方景别同步收紧(全景对切 → 中景对切 → 近景特写对切),对话越激烈景别越近,直至一方的特写填满画面。
- 若需要在对话中插入环境空镜(如对话场所的某个细节),空镜时长控制在短促时间,不得打断台词连贯性。
shot description 中的对话切镜标注格式
在包含多角色对话的 shot description 中,使用以下格式显式标注切镜节拍(写在"发展段"对应位置):
【对话切镜节拍】
T+0.0s:A 角色开口(台词起,语速正常),镜头已稳定在 A 中景,FPV 轻微呼吸式微晃。
T+1.8s:A 台词末尾尾音衰减中,切至 B 近景(提前发音前一瞬间切镜),B 面部轻微皱眉、吞咽动作。
T+2.5s:B 开口回应,镜头在 B 近景稳定,晃动周期收紧(情绪中级)。
T+3.8s:B 台词过半,切至 A 反应镜头,A 眼神下移后抬起,嘴唇微颤。
T+5.3s:切回 B 说完最后一句,切镜提前发音前一瞬间,B 尾音在 A 近景画面中淡出。
此标注为含对话段落的 shot 必填项,不得以"正反打切镜"等无时间信息的描述替代。
9.5 shot description 中的对齐标注格式
在每个含台词的 shot description 中,使用以下格式将台词节拍与运镜行为显式绑定(写在"发展段"或"爆发段"对应位置):
【台词节拍对齐】
T+0.0s:台词起始,语速慢,慢速推近启动。
T+1.2s:"……"停顿,推近速度变缓,晃动周期变长。
T+2.0s:"算了"——否定关键词,推近速度瞬时提升,惯性过冲触发。
T+2.5s:台词结束,镜头回正,切入下一转场动作(衔接提示)。
此标注为必填项,不得用"镜头随台词推近"等模糊描述替代。
10. 对话场景运镜多样化规则
- 核心原则:对话段落禁止全程单一机位(如全程正脸或全程过肩)。必须根据对话节奏和情绪使用多种运镜,每个对话段落至少使用以下 2 种:
- 正反打:A 说话时切 A 的特写或中景,B 说话时切 B 的对应景别;视线方向须匹配(A 向右看,B 画面中 A 应在左侧)。
- 过肩镜头:前景为 A 的肩背(景深虚化),焦点在 B 的面部,增强对话沉浸感。
- 缓慢环绕:情绪递进(争吵、告白)时以慢速绕两人圆周运动。
- 推近/拉远:某句关键词时缓慢推入说话者面部;情绪舒缓时拉远展示空间关系。
- 双人同框:中景或全景展示双方互动及肢体语言,切换频率不宜过高,用于节奏缓冲。
- 禁止:全程固定机位只拍单人说话,或对话段落镜头完全静止无变化。
- 与情绪联动:对话运镜类型须服从第 8 节"情绪强度 × 运镜类型联动映射表"——平静对话以正反打 + 过肩为主;争执对峙引入缓慢环绕;情绪爆发叠加急推和甩镜,不得脱离情绪驱动随意混搭。
11. 情绪台词真人感折射
- 严禁在 shot description 的 dialogue 中写入抽象感情形容词(如"紧张地说道"、"悲伤地哭诉")。每句台词必须在前方标注情绪拆解结果,格式为"[面部 + 肢体 + 声音特征] + 台词文本"。以下为标准拆解对照表,分镜时直接引用:
抽象情绪面部肢体声音生气/愤怒眉头紧锁,眼神锐利,鼻翼扇动,嘴角下撇呼吸急促,拳头微攥声音压低,语速加快,末字像砸出来,用"!"悲伤/难过眼眶泛红,下眼睑微肿,鼻头泛红,嘴角下垂肩膀下沉,手无意识绞衣角声音发颤,说到一半停顿,尾音下沉,用"……"开心/喜悦眼睛弯月形,卧蚕明显,嘴角上扬露出部分牙齿身体微微前倾,手指轻快摆动声音上扬,语速轻快,尾音带笑意紧张/焦虑眉头微蹙,眼神躲闪,眨眼频率加快,咬下唇手指互绞或轻敲桌面,脚尖点地声音放轻,呼吸变浅,语速忽快忽慢,用"……"与"——"惊讶/震惊眉毛瞬间抬高,眼睛瞪大,嘴巴微张或成 O 型身体后仰或瞬间僵住倒吸一口气,声音短促上扬,破音,用"?"恐惧/害怕瞳孔放大,眉毛上挑且聚拢,嘴唇颤抖,下巴收紧身体后缩,双臂交叉或手捂嘴声音尖细,语速极快或完全失声爱慕/心动眼神柔和,嘴角不自觉上扬,脸颊微红身体微微倾向对方,手指无意识卷发或抚衣角声音轻柔,语速缓慢,带气声嫌弃/厌恶皱眉,鼻子微皱,上唇微微上提,嘴角下拉身体后仰,手摆开或遮挡语气中带"啧"声,语速变慢,尾音下沉 - 同一句台词内情绪变化时,须分段拆解,格式为:"[第一情绪阶段的生理描述]……(过渡停顿)[第二情绪阶段的生理描述]……",两段间必须有可见的生理转折信号(如叹气、目光移动)。
- 音色一致性:全片同一角色的对白和旁白必须强制绑定在对应的 key_element_audio(若用户上传了人声样本)或一致的 narration_speaker_profile 上。
12. 台词归属强制锁定
- 每个含台词 of shot description 必须在开头显式标注说话者角色 ID(与 Storyboard key_element character 保持一致),格式为"说话者:[角色ID]"。
- 同一 shot 内有多个说话者时,必须在【对话切镜节拍】时间戳中逐句标注说话者切换,不允许一个台词块含有两名角色的台词而不注明归属。
- 反应镜头(Reaction Shot)中的非说话角色必须在 description 中明确写"[角色ID] 闭口,做出[具体生理反应]",不允许留空或依赖模型自行判断。
13. 人物动作物理真实与防穿模规范
- 关节运动要求:所有动作描述必须符合人体工学,关节弯曲方向自然。禁止出现手臂/手指穿过身体或布料、身体穿透场景道具等描述;若某动作在物理上需要额外空间(如挥臂、转身),须在 shot description 中注明动作幅度与周围空间关系(如"向左转身,背后无障碍物")。
- 大幅度运动节奏:奔跑、跳跃、挥手、转身等动作,必须在 description 中描述加速→匀速→减速的惯性节奏,以及地面接触时的重力下沉感(落地轻微屈膝,离地脚跟上提),不可描述为"平移滑动"或无惯性的瞬移。
- 衣物与道具状态:大幅运动时须注明衣物的随动状态(如"风衣下摆随转身向右飘起"),避免服装与身体完全贴合无物理感,也避免服装穿插入身体轮廓内。
- 禁用描述:无动机的抽搐、违反物理的悬浮、关节反向弯折、身体穿透场景物体。
4. 미디어 생성
手持/FPV动态镜头的媒体生成策略
1. 角色身份板生成 (TextToImage / ImageToImage)
- 默认首选模型:Nano Banana Pro (Gemini 3 Pro Image),推荐分辨率为 2K(具有出色的文字渲染、多图排版及细节还原度)。
- 生成方式:若是首次生成角色,使用 TextToImage。若用户提供单张参考图,使用 ImageToImage 进行多视角、多表情的合成。
- 绑定:生成后,必须将该身份板图像注册为 asset_id 并将其绑定至 Storyboard 对应的 element character。
2. 逐镜头视频生成 (MultiModalToVideo)
- 核心模型:默认首选使用 Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p),因为它对角色和动作一致性有最好的多模态支持。非会员用户最大支持 480p 分辨率,会员用户可升级至 480p。
- 参考资产绑定规则:
- 视觉参考一(角色):绑定该镜头包含的角色的 identity board 图像(即步骤1绑定的 element character 的主图像资产),确保面部、体型及服装一致。
- 视觉参考二(场景):绑定该 shot 的 element scene 生成的场景氛围参考图。
- 声音参考(key_element_audio):若该角色有配音台词,必须绑定并传递其 key_element_audio(音频样本 ID),确保同一角色在不同镜头里的对白口型与音色一致。
- 视频参考(邻近帧):当且仅当相邻镜头间有极强的动作连续性要求时,才将前一个生成的 final_shot 视频作为 reference 传入,否则通常不进行视频参考绑定以避免画面污染。
- 末帧提取用于衔接:对于有连续动作衔接要求(如模拟连续长镜头或动作匹配转场)的相邻 shot,使用 resource_prepare_and_analyze 提取前一个 final_shot 的末帧图像,将其作为下一个 shot 的 start_frame 参考输入,确保人物姿态、光影和空间方位的视觉连续性。
- 视频时长:每个 shot 长度严格设定在 3s - 30s 之间,由 Storyboard 设计的时长决定。
3. 跨镜头一致性强制规范
- 光线方向锁定:每个 shot 生成时,必须在提示词中明确写入与 Storyboard 中该场景光源方向完全一致的描述(方位词精确到"左/右/正后方 + 角度"),不得使用模糊的"侧光"或"逆光"等无方位信息的描述。
- 人物外貌一致性:所有涉及同一角色的 shot,必须同时绑定该角色的 identity board 图像作为视觉参考,以强制维持面部骨骼、发型、服装和皮肤纹理的跨镜一致性。不得仅凭文字描述生成角色,必须有图像参考输入。
- 道具连续性:符合注册条件的道具须已在 Storyboard elements 中建立 key_element prop,生成对应 shot 时必须绑定该道具的参考图像(asset_id)。绑定参数中须附加道具的当前状态描述(与 Storyboard 状态变化节点表保持一致),确保模型看到的是正确的道具状态,而非初始外观基准。
- 道具参考图生成策略:对注册为 key_element prop 的道具,优先使用用户提供的实物照片;若无,在元素资产生成阶段使用 TextToImage(Nano Banana Pro,2K)单独生成一张纯白背景、多角度平铺的道具参考图,注册 asset_id 后绑定到对应 key_element。如道具在剧情中有明显状态转变(如雨伞从干燥→湿透),需生成多个状态版本的参考图,分别注册不同 asset_id,并在状态切换 shot 前完成 rebind。
4. 音频与语音合成 (Text to Speech)
- 首选 TTS 模型:使用 ElevenLabs v3(英文推荐)或 MiniMax Speech 2.8 HD(多语言推荐)。
- 设定:若该角色绑定了 key_element_audio,则将其作为克隆基准音色。若无,选择具有高度真人呼吸、停顿细节的 TTS 预设,并根据剧本标记的情绪参数生成 narration。
5. 台词归属绑定与口型同步规范
- 台词归属绑定:每段 TTS 生成任务必须绑定唯一的说话者角色 asset_id(与 Storyboard 中 shot description 标注的说话者 key_element character 保持一致)。禁止将同一 TTS 音频片段同时绑定到多个角色,防止口型激活错位。
- key_element_audio 传递:在 MultiModalToVideo 生成含对话的 shot 时,必须通过 audio_infos 传入说话者对应的 key_element_audio 绑定(若已有),确保口型驱动与音色来自同一参考基准,减少口型漂移。
- 近景/特写口型优先级:景别为近景或特写的对话镜头,生成提示词中须显式强调"口型精准同步,下颌运动与音节匹配,嘴唇闭合自然";中景/远景允许下颌节奏匹配即可,不要求逐音节精确。
- 非说话者闭嘴约束:同一 shot 中有其他角色在场时,提示词中须注明"仅[说话者角色描述]说话,其余角色闭嘴或做生理反应(吞咽、眨眼、微表情),不开口"。
5. 프롬프트 작성
提示词书写及控制规范
1. 语言一致性规则
- 当用户以中文交流时,提示词中的主体描述、光影、细节指令必须使用中文书写,以保证与用户的本意高度契合;对于语气和特定镜头标签,可采用行业通用英文简称。
- 语音/旁白等台词部分必须根据 Final_Video_Spec 的 Output Language 保持一致。
2. 角色身份板提示词 (TextToImage / ImageToImage)
- 必须采用横版 16:9 结构,纯白背景,电影写实风格。
- 模型首选 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K,其多图排版与文字渲染能力最强。
2A. 单角色标准身份板模板
16:9横版,纯白背景,真人写实,电影级高画质,超高清摄影。
左半区——四视图并排(正面全身 / 左侧全身 / 右侧全身 / 背面全身),等比例等间距排布,人物完整入画,脚踩地面参考线。
右半区——四张微表情面部特写([平静] / [微笑] / [悲伤] / [深陷思考或紧张]),2×2 方格排布,每格标注表情文字标签。
人物外貌:[核心描述,例:25岁东亚男性,黑色短发,发质顺直,单眼皮,高鼻梁,下颌线清晰]。
服装:[核心服装,例:深灰色立领风衣,黑色修身长裤,黑色皮靴]。
皮肤细节保留(毛孔纹理、轻微胡茬、细微法令纹),无磨皮,无平滑塑料感。
光源:[见下方光源规范]。
禁止动漫、3D、CG、卡通、漫画风格;禁止背景杂物或多余文字水印。
2B. 多角色并排对比版式(2–3名角色时使用)
16:9横版,纯白背景,真人写实,电影级高画质,超高清摄影。
画面横向等分为 [N] 列,每列对应一名角色(从左到右依次为:[角色A名] / [角色B名] / [角色C名])。
每列内部纵向排布:上方——正面全身立姿(全身入画,比例统一);下方——2张面部微表情特写(各角色选取其剧情核心表情)。
各列等比对齐,确保不同角色身高/体型差异在同一参照坐标系内可见,便于下游镜头的比例匹配。
[角色A外貌与服装描述] / [角色B外貌与服装描述] / [角色C外貌与服装描述]。
皮肤细节保留(毛孔、痣、皱纹、胡茬),无磨皮,无平滑塑料感。
光源:[见下方光源规范]。
禁止动漫、3D、CG;禁止角色之间有遮挡穿插;禁止背景杂物或多余文字水印。
2C. 光源方向标准化写法(填入上方 [光源] 占位符)
根据剧本主场景的主光方向,从以下规范中选取并直接替换占位符:
场景类型标准光源写法(直接插入提示词)身份板通用默认柔和均匀漫反射光,无明显投影,亮度均匀,适合多视图细节还原日间室外自然光顶侧自然光,主光45°斜上方,面部轮廓清晰,眼窝有浅阴影,无强烈侧逆光黄昏/暖调室内暖橙色侧光(画面右侧45°入射),面部暖调打亮,阴影偏暖棕,背景冷暖微对比夜间街道/霓虹冷蓝色侧逆光主光(画面左后方),暖橙色霓虹辅光勾勒面部边缘,明暗对比强,颗粒感胶片质感伦勃朗光(戏剧感)伦勃朗三角光,主光45°侧上方,面部三角高光区清晰,暗侧深度落阴,情绪张力强蝴蝶光(时尚感)正面蝴蝶光,主光正上方略前倾,鼻下投射蝴蝶形阴影,颧骨提亮,适合面部精致感展示
使用规则:身份板作为角色基准图,默认优先选用"身份板通用默认"光源,保证全角度细节可见;若用户明确指定片中主场景的光源风格,则替换为对应类型,使身份板与正片色调保持一致。
3. 逐镜头视频提示词 (MultiModalToVideo - Seedance 2.5(分辨率 480p))
- 视觉参考绑定:必须使用 <<<image_1>>> 绑定角色的 identity board。
- 提示词动作堆栈结构 (Motion Stack):按照"运镜轨迹 -> 主体动作与生理反应 -> 空间与环境特征 -> 声音与台词标记"的顺序链条进行书写,融合成一个连贯、细节饱满的段落。
- 镜头运镜:在开头显式声明。例如:"手持FPV视角摄影,镜头随脚步产生上下起伏的手持呼吸式微震。镜头以轻微的惯性滞后,缓慢推向<<<image_1>>>的面部特写。"
- 主体动作与情绪表现:不要使用抽象情绪词,要写具体动作。例如:"<<<image_1>>>的面部肌肉紧绷,眼睛睁大并频繁闪烁,喉结上下滑动,嘴唇微颤,带有一丝惊恐。"
- 光影与空间:例如:"冷蓝色夜间路灯在侧后方提供主光源,投射出长长的侧逆光阴影。暖黄色的霓虹灯箱光轻微勾勒面部边缘,明暗差强烈,颗粒感电影胶片画质。"
- Seedance 2.5(分辨率 480p) 语法控制标记**:
- 音效标记:使用尖括号 <...>。例如:<雨水拍打伞面声>,<沉重急促的呼吸声>。
- 音乐标记:使用圆括号 (...)。例如:(紧张低沉的弦乐背景乐)。
- 动态台词口型标记:使用大括号 {...} 并直接塞入纯净台词文本,不得含有情绪修饰语。例如:{(中文)你……真的要走?}。
4. 画质基准标注(所有视频提示词通用)
- 每条视频提示词必须在开头声明画质基准:超写实电影质感,8K 级细节还原,胶片颗粒感,皮肤保留毛孔与纹理,无磨皮,无 CG 感,24fps 电影帧率。
- 跨镜一致性锚定:在提示词中明确写入本镜头的主光方向(与 Storyboard 一致),以及角色服装、发型的关键状态描述,作为模型生成时的视觉锚点,防止跨镜外貌漂移。
5. 场景与人物融合提示词强制要求
- 每条视频提示词中必须含有场景融合锚定语,格式为:真实场景,[场景类型与环境细节],光影方向[精确方位],人物与背景融合,阴影方向一致,景深自然,无抠图感,无虚假合成。
- 色温匹配词:根据场景情绪,在提示词中显式写入色温倾向(如"暖橙光下肤色偏暖"或"冷蓝夜景下服装与环境色温统一"),防止人物与背景色调脱节。
6. 背景群众提示词强制追加
- 凡 shot description 中存在公共场所场景(街道、广场、教室、餐厅、办公室、公园等),视频提示词中必须追加以下群众融合语,插入"场景融合锚定语"之后:
背景群众自然动态,有人行走、交谈、驻足,动作随机不重复;群众外形多样,服装颜色款式各异,符合场景设定;与主角无互动,不遮挡主角;快速移动的群众有轻微运动模糊;禁止静止不动、重复贴图、统一着装。
- 景别分层写法:近景群众(动作清晰但景深虚化到不抢主角)→ 中景群众(动作可辨识)→ 远景群众(模糊群体,有整体动感);三层依次在提示词中体现,而非仅提及"有群众"。
7. 对话镜头情绪拆解提示词写法
凡含有对话的 shot,视频提示词中的角色动作描述必须使用第 11 节情绪拆解对照表的格式,禁止残留抽象情绪词。格式为:[面部 + 肢体 + 声音特征] + 台词文本。
- ❌ 禁止写法:他愤怒地吼道:你给我走!
- ✅ 正确写法:<<<image_1>>>眉头紧锁,眼神锐利,鼻翼扇动,声音压低,每个字像砸出来:{(中文)你给我走!}
若同一句台词内情绪发生跳变(如紧张→释然),须在提示词中分段写出两个阶段的生理状态描述,并用过渡停顿动作(如叹气、目光下移后抬起)连接两段,使模型可执行。
8. 台词节奏与运镜速率同步提示词写法
当 shot description 中存在"台词节奏对齐"标注时,视频提示词中必须将时间轴对齐信息转化为可执行的运镜节奏指令,融入 Motion Stack 的"运镜轨迹"与"主体动作"段落,不得单独列为时间码块。
- 停顿对应写法:在提示词的运镜描述中直接写明速率变化,例如:"镜头匀速慢速推近,台词第一句末尾('……'停顿处)推近速度收缩放缓,模拟呼吸间隙的短暂滞留,停顿结束后恢复原速。"
- 语速极快(破音/惊吓)对应写法:在音效标记后紧接运镜标记,例如:"<急促吸气声> 镜头在该字发音瞬间触发短促快速的急推,随即伴随轻微惯性过冲后回正。"
- 关键转折词对应写法:显式标注触发时刻,例如:"'算了'二字发音起点处,镜头推近速度瞬时加快,并触发轻微惯性过冲,随后速度回落,与角色叹气动作收尾同帧。"
- 台词结束→转场衔接:台词最后一个字发音结束后,在提示词末段写入镜头回正或下沉动作,作为衔接下一镜的过渡锚点,例如:"台词收尾后镜头重心轻微下沉并稳定,角色转身动作作为进入下一镜的穿越触发点。"
- 禁止模糊写法:提示词中不得出现"镜头随台词情绪推近"、"跟随语气调整速度"等过于空泛的描述;必须给出具体的、体现“轻微、短促、慢速”等可见结果的运镜变化与动作配合描述。
9. 负面指令控制 (Standing Negatives)
- 视频提示词尾部必须强制加上:no music, no subtitles, no watermark, realistic texture, skin pores, no smoothing, no CG, no anime, no plastic skin, consistent lighting direction, no limb clipping, no body part penetration, no floating, no unnatural joint bending, no abstract motion, physically grounded movement。确保画面写实度,防止穿模、抽象动作、跨镜光线突变和角色外貌漂移。
10. 口型同步与动作物理真实提示词规范
- 含对话的近景/特写镜头:在 Motion Stack 的"主体动作"段落中,必须显式写入口型同步指令,例如:"说话时下颌运动自然,嘴唇闭合与张开与音节匹配,无机械开合感,无发呆嘴(长时间闭合不动);非说话角色完全闭嘴,面部做生理反应。"
- 大幅度运动镜头(奔跑、跳跃、挥手、转身):在"主体动作"段落中写入惯性节奏描述,格式为"动作起始→加速→匀速→减速收尾,落地时膝盖轻微屈曲,有重力下沉感";衣物须写明随动状态(如"外套随转身向右侧飘动")。
- 穿模防护写法:当 shot 中有近距离交互(握手、拥抱、持物)时,须在提示词中写明接触点状态,例如:"右手自然握住伞柄,手指完整包裹,无穿插感",避免模型生成肢体穿透道具的画面。
6. 동영상 조립
手持/FPV短片的 timeline 剪辑与合成规范
- 跨镜头一致性审查(首要步骤):在拼接 timeline 前,逐对检查相邻 shot 的以下三项一致性,发现问题须标记并反馈给用户,不得静默跳过:
- 光线方向一致性:对比相邻 shot 中主光方向,如发现光源方位产生突变等非叙事性跳变,标记为"光线断层"警告。
- 人物外貌一致性:检查角色的发型、服装细节(如衣领状态、袖口是否卷起)、随身道具(手机、雨伞)是否连续;若某 shot 角色外貌与 identity board 或上一 shot 差异明显,标记为"人物一致性"警告。
- 空间方位一致性:确认关键场景地标(路灯、墙体、门窗)在相邻镜头中位置方向未出现无故翻转,防止"越轴"问题。
- 无固定机位二重质检:在组装 timeline 时,必须对每一个 shot 进行运动性检查。如果某段视频呈现出了绝对的静止平光感,必须通过 timeline 的裁剪或微幅缩放,并在 timeline 的 X/Y 轴中注入平缓周期的水平/垂直微晃曲线,人工重构轻微的手持呼吸晃动感。
- FPV 前景连续性检查(fpv_mode 开启时):检查相邻 FPV 跟拍镜头中主角肩背前景的位置与亮度是否连续;若出现跳跃,通过裁剪微调入出点,或在 timeline 的过渡处叠加极短促的运动模糊帧以平滑衔接。
- 模拟连续长镜头转场校验(one_shot_mode 开启时):逐一检查转场类型(动作匹配/眨眼黑屏/穿越跟拍),确认动作衔接无错位、黑屏帧极其短促,整体无明显剪辑感。
- 多角色对话切镜校验:检查对话段落中每一次切镜时刻是否符合"提前极短一瞬间切入下一说话人"的节拍规则;若发现切镜时刻落后于对方开口,须通过调整入出点将切镜提前;同时检查反应镜头时长是否在合理的短暂范围内,避免遮蔽重要台词画面。
- 对话运镜多样性与情绪细节质检:对每个对话段落额外检查以下两项,发现问题须标记并反馈给用户:
- 对话段落是否至少使用了 2 种不同运镜(正反打、过肩、环绕、推近/拉远、双人同框中的至少 2 种),若全程仅用单一机位须标记"对话运镜单一"警告;
- 台词描述中是否残留抽象情绪词(如"愤怒地说""开心地笑"),若存在须标记"情绪未拆解"警告,提示用户对照情绪拆解对照表修订 shot description。
- 景别过渡衔接审查:
- 检查相邻 shot 的景别,如果发现连续出现相同景别,需通过裁剪调整其中一个 shot 的焦段级别,确保画面变化律动符合"远-中-特-全"的景别变化逻辑。
- 检查相邻镜头的色温和明暗平衡,确保画面虽然有适当对比,但在镜头切分处不会产生令人不适的视觉突变。
- 音频轨精细叠加与淡入淡出:
- 语音轨(VO/对白):优先级最高,必须放在最上层音频轨。各镜头之间的对白应设置极其短促的微量停顿,防止两镜头对白首尾碰撞。
- 环境音效轨(SFX):根据 shot 描述在特定时间戳精确对齐(如脚步声、开门声、雨声),并设置自然的淡入淡出,使得环境音过渡流畅。
- 全片背景音乐轨(BGM):通常设定在底层,音量相比语音轨合适降低。若短片中出现重大情绪转折点(如"快速甩镜"或"急推"),BGM 需在该时间戳进行瞬时的重拍对齐或突然淡出(Crescendo / Sudden Stop)。
- 场景与人物融合质检:在 timeline 拼接前,对每个 shot 额外检查以下四项,发现问题须标记并反馈给用户:
- 场景是否符合剧本描述(无自动生成的抽象/纯色/模糊背景);
- 人物脚下阴影是否存在,且方向与场景光源一致;
- 人物与背景边缘是否自然融合(无白边、无生硬抠像痕迹);
- 人物色温与环境光色温是否匹配(禁止人物与背景色调出现不协调组合);
- 背景群众是否有自然动态(非静止/重复贴图)、是否出现明显重复外形、是否遮挡主角或干扰叙事。
- 台词归属与口型同步质检:对所有含对白的 shot 逐句核查:
- 说话者口型是否与该角色的 TTS 音频节奏一致(下颌运动、头部律动与音节节拍匹配);近景/特写镜头中口型明显静止不动("发呆嘴")须标记为"口型失同步"警告。
- 同 shot 内其他在场角色是否保持闭嘴或仅做生理微反应,若出现无台词角色异常开口,须标记为"台词归属错位"警告并提示重新生成该镜头。
- 动作物理真实性质检:对每个含大幅度运动(奔跑、跳跃、挥手、转身等) of shot 逐帧抽查:
- 是否出现肢体穿透身体、衣物或场景道具的穿模现象;若发现,标记为"穿模"警告,提示用户更换随机种子重新生成。
- 运动节奏是否存在"无惯性平移滑动"或关节反向弯折等非物理现象;若存在,标记为"动作失真"警告。
- 画质重构与超分处理:
- 在输出前,评估最终 timeline。若用户需要高清晰度的成品,可针对角色面部特写或核心动态镜头应用 MediaKit 视频超分辨率,将分辨率提升至 1080p,并将帧率微调稳定在 24fps 电影帧率。