yeha.ai
목록으로

3D Chinese historical animated drama

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

适用于将剧本拆解为3D古风风格短剧视频的全流程制作场景。画面风格统一锁定为3D质感,以Seedance 2.0为核心视频生成模型,配合GPT Image 2生成角色与场景设定图。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

启动协议
用户触发本Skill时,首先判断用户属于以下哪种场景,并据此选择对应路径:

  1. 从零开始(0→1): 用户只有创意构思或粗略大纲,尚无完整剧本。先与用户深入沟通,帮助其梳理故事框架、人物关系、核心冲突;在用户确认框架后,协助将构思发展为可拍摄的短剧剧本。每一步修改须向用户展示并确认,不得擅自定稿。
  2. 半成品(需补充资产): 用户已有剧本或部分素材(剧本/分镜/设定图/参考图等),但不完整。分析已有素材,识别缺失环节(如缺角色设定图、缺部分场景描述、剧本未写明角色外貌等),逐项向用户确认补充方式后再推进。
  3. 材料齐全: 用户提供了完整剧本及全部所需资产图。直接进入分析→Storyboard→生成流程。

无论哪种场景,启动时须确认以下基础参数:

  • 已有素材清单(请用户上传或粘贴现有剧本/分镜/设定图/参考图等)
  • 输出语言偏好(分镜脚本通常中文;提示词通常英文,但中文同样可行)
  • 画幅比例:固定16:9横版,不可由用户自主选择,这是强制限制

影像风格固定为3D古风,无需用户确认。

剧本细化与短剧钩子增强(可选服务)
当用户的剧本尚不成熟时,主动向用户提供以下服务,但须逐项展示修改建议并经用户确认后才落地,绝不在用户不知情的情况下改写剧本:

  • 钩子增强: 分析前3秒(对应开篇第1个shot)是否具备足够吸引力——冲突、悬念、反转、视觉冲击至少占其一。若开篇平淡,向用户提出具体改写建议(如"建议将开篇改为角色A被围堵的紧张场面,制造即时冲突"),等用户确认后再写入。
  • 节奏与冲突密度优化: 检查各幕是否存在拖沓段落(连续多shot无冲突推进、无情绪变化),向用户指出并建议收紧或增补冲突点。
  • 角色动机与关系线补全: 若角色行为缺乏动机或关系线断裂,向用户提出问题并建议补全方向,由用户决定是否采纳。
  • 台词精炼: 若台词冗长或口语现代化,向用户标注并建议改写,由用户确认。

所有细化建议以卡片或对话形式逐条呈现,用户逐条确认后才能写入剧本;用户否决的不得强行保留。

全流程阶段与依赖关系

  1. 读取并分析用户上传的剧本文件或创意大纲,提取角色、场景、关键道具,识别剧本类型,评估剧本成熟度与钩子强度→resource_prepare_and_analyze
  2. (可选)剧本细化与钩子增强: 若剧本不成熟或用户要求优化,按上述服务逐条向用户提出修改建议,确认后落地→text_editor(更新剧本文本)
  3. 将全局制作参数写入Final_Video_Spec.md(画幅比例:16:9横版(固定,不可更改);目标时长;影像风格基调:3D古风;输出语言)→text_editor
  4. 设计Storyboard:登记所有key_element(角色、场景、关键道具),将剧本拆解为有序shot列表,规划audio_layer(BGM、旁白)→storyboard_designer
  5. 生成所有key_element设定图(角色三视图、场景四视图、关键道具图)及角色key_element_audio(音色样本)→media_generator
  6. 逐shot生成视频。每镜引用对应角色key_element图像 + 场景四宫格key_element图像→media_generator。从第二个shot起追加空间一致性参考帧。撰写视频提示词前须执行空间校验,截帧、选帧四层过滤、防漏帧校验的具体规则见 media_generatorresource_prepare_and_analyze 分区。
    • 第一个shot视频生成后强制暂停(强制): 第一个shot是全片视觉基调的锚点——场景空间、人物站位、光影风格、角色外貌都在此镜确立。生成后必须暂停,向用户展示视频,请用户确认场景布局是否正确(如角色背后的背景元素是否符合预期)、人物站位是否合理。若用户不满意,根据反馈调整空间锚点卡/shot描述后重新生成,确认通过后再继续后续shot。
    • 重新生成单个shot时的内容锁定(强制): 须复用该shot已确认的提示词原稿,仅改用户指定部分(完整规则见media_generator与write_the_prompt)。
  7. 生成所有audio_layer音频资产(BGM、第三人称旁白)→media_generator(角色台词与内心OS已内嵌于视频生成,不在此步单独生成)
  8. 按Storyboard顺序组装时间线,完成音画同步与剪辑输出→video_assembler

依赖关系: 2→1;3→1,2;4→1,2,3;5→4;6→5;7→4;8→5,6,7

视频生成模式选择(进入视频生成前强制询问): 在所有key_element设定图确认通过、即将开始逐shot视频生成时,必须通过卡片向用户提供以下两种模式选择,由用户决定后续视频生成节奏:

  • 一键生成模式: 第一个shot仍强制暂停确认(见步骤6首镜暂停规则)。确认通过后,剩余所有shot连续生成,中途不再逐镜暂停;全部shot生成完毕后统一向用户展示结果,再进入组装阶段。若用户在生成过程中主动要求暂停或修改,则立即响应。
  • 逐镜确认模式: 每个shot生成后都暂停,向用户展示视频并等待确认再生成下一个shot。第一个shot的暂停与确认是该模式的第一步,不额外特殊处理。

无论哪种模式,第一个shot的强制暂停均不可跳过——后续所有shot的空间一致性参考帧都源自第一个shot,若其场景布局或站位有误未及时发现,错误会级联扩散。

关键暂停点: 每个阶段完成后必须暂停,等待用户确认再继续(视频生成阶段除外,由上述模式选择决定)。重点暂停节点:

  • 剧本分析完毕后(告知用户剧本类型、成熟度评估、缺失项)
  • 剧本细化建议逐条确认后(进入Final_Video_Spec与Storyboard前)
  • Storyboard草稿确认后(进入生成前)
  • 所有key_element设定图确认后(进入视频生成前——此时通过卡片向用户询问视频生成模式:一键生成/逐镜确认)
  • 第一个shot视频生成完毕后(强制,无论哪种模式——确认场景空间、人物站位是否合理,再继续后续shot)
  • 所有分镜视频生成完毕后(进入组装前)

半成品场景的资产缺口处理: 分析已有素材后,将缺失环节整理为清单向用户展示(如"缺角色B设定图""场景3未描述空间细节""第4场缺少台词"等),逐项与用户确认补充方式(用户提供/生成补充/用户口述后由Skill整理),不得在用户未确认时擅自补全。

剧本兼容性: 若用户上传的是小说而非分镜脚本,在分析阶段识别并告知用户该文本需先完成短剧化改编。向用户提供两种选项:①用户自行修改(推荐优先);②由Agent协助优化(生成改编建议,逐条展示并经用户确认后落地)。无论哪种方式,都不得擅自补全剧本中未描述的角色外貌或场景细节,应主动询问。

信息缺失处理: 剧本中未写明的角色长相、场景细节、影像风格,一律主动询问用户,不得静默假设或擅自补充。

最高原则——不擅自决策: 本Skill涉及的所有创作决策(剧本改写、角色外貌定义、场景细节补充、钩子设计、镜头取舍等),无论大小,必须向用户呈现选项或建议并经确认后才执行。宁可多问一句,不可擅自拍板。

2. 멀티모달 분석

剧本/创意大纲分析

  • 读取用户上传的剧本文件或创意大纲,提取所有角色(姓名、身份、关系)、场景(空间类型、关键陈设)、关键道具,识别剧本类型(权谋/武侠/言情/悬疑等),评估剧本成熟度(结构完整性、台词是否齐备)与钩子强度(开篇3秒是否有足够吸引力)。
  • 若用户上传的是小说而非分镜脚本,识别并标注需短剧化改编的部分,告知用户该文本需先完成改编。
  • 输出结构化分析报告:角色清单、场景清单、道具清单、剧本类型、成熟度评估、钩子评估、缺失项清单。

用户上传资产图分析

  • 分析用户上传的角色/场景/道具参考图,判断是否为3D古风风格——若非3D风格,标注"需风格转化"并记录原图的身份特征(脸型、五官、发型、肤色、服装结构等)供后续ImageToImage转化使用。
  • 若为3D风格,直接标注"可直接绑定"并记录身份特征描述。
  • 分析上传参考图中的场景空间布局信息;若场景描述不足以确定空间方位关系,标注"需向用户确认空间布局"。

视频关键帧截取

  • 从已生成的shot视频中截取关键帧,用于跨镜空间一致性参考。截取前须先查阅下一镜Storyboard确认下一镜实际出场人物,不为不在场角色截取视角帧。截帧数量最小化——站位/背景未变时只截一帧。景别兼容性截帧约束(强制): 截取帧的景别须在下一镜最宽内切镜景别对应的兼容区间内——大特写shot可截取大特写/特写/近景帧;特写shot可截取特写/大特写/近景/中景帧;近景shot可截取近景/中景帧;中景shot可截取中景/近景/中全景/特写帧;中全景shot可截取中全景/中景/近景/特写/大特写帧。一律不得截取全景/大全景帧,否则宽景别帧会拉扯模型向宽画面偏移导致切镜后突然变远、人物位置漂移。截取的帧须注册asset_id并绑定到对应shot。

截帧后视觉内容分析(强制)

  • 每张截取帧完成后,须对该帧执行一次视觉内容分析,输出结构化标签并绑定到该帧的asset_id元数据中,供后续选帧阶段做背景匹配过滤。分析内容:
    • 可见背景元素清单: 逐项列出帧画面中实际可见的背景元素及其画面位置(如"画面中央偏后:雕花大门""左侧:镂空窗棂""右侧:玉石屏风"),不得笼统概括。
    • 场景方向: 标注该帧的机位方向(正视纵深/反向纵深/左侧横向/右侧横向),与场景四宫格的四向定义对齐。
    • 在场角色与位置: 列出帧中出现的角色及其在画面中的位置(左/中/右、前景/后景)。
    • 景别: 标注该帧的景别(大特写/特写/近景/中景/中全景)。
  • 背景匹配预检(强制): 分析完成后,将该帧的可见背景元素清单与下一镜空间锚点卡中"各角色背后/左侧/右侧可见背景元素"逐项比对。若该帧的背景元素与下一镜空间锚点卡描述的背景元素不一致(如帧中背景是大门但下一镜空间锚点卡写的是高台),该帧须标注"背景不匹配——不建议用于下一镜",并在选帧阶段排除。若匹配,标注"背景匹配"。此预检是前置过滤——在帧进入选帧池之前就排除背景不一致的帧,避免背景不匹配的帧在选帧时因景别/方向/角色等元数据通过而被误纳入。
  • 回溯补截(被调用时执行): 若media_generator阶段发现所需参考帧缺失(如当前shot需要女主近景帧但前序帧中没有),须回溯调用本工具从前序shot视频重新截取对应类型的帧,补截后同样执行视觉内容分析与背景匹配预检。
3. 스토리보드 설계

全局风格锁定
所有视觉设计统一采用3D建模风格:以3D CGI渲染质感呈现中国古代/古风场景与人物,兼具国风美学(丝绸光泽、玉石质感)与明亮清透的柔和光影。角色与场景的材质、色调、氛围均以此为基调,不得出现写实摄影或欧美卡通风格。

色调与光影基调(强制): 整体场景默认明亮清透,色彩明度偏高,饱和度控制在中低到中等——不要艳俗高饱和,也不要压成灰蒙蒙的暗调。柔和色调以清新、和谐为主(如淡藕、雾青、浅赭、月白等),禁止大面积高纯度色彩(如荧光色、饱和正红/正蓝/正绿)。阴影要柔,不得出现大片死黑区域,暗部须保留细节可见。画面保持明亮但不出现射光/体积光(god rays/light shafts)——以柔和均匀的整体照明为主,而非刺眼的定向强光。特殊场景(如黑夜、密室、地牢)可适当压暗,但暗部仍须保留细节层次,不得死黑。

场景华丽细节强化(强制): 场景中的家具、陈设、建筑构件须描述得丰富、精致、细节饱满——充分展现古代工艺之美:雕花门楣、彩绘梁柱、镂空窗棂、镶嵌螺钿的家具、丝绸帷幔、青铜香炉、玉石摆件等,须写明具体纹样(如缠枝牡丹纹、云龙纹、回纹、卷草纹)、材质光泽、工艺细节与摆放位置。色调搭配须符合古代中式美学——以温润的木色、沉静的黛青、典雅的赭石、含蓄的月白等传统色彩为主,色彩之间和谐呼应,体现古典空间的层次与气韵。场景越华丽越能烘托古风氛围,鼓励在设计时充分填充视觉细节。

角色服装纹样强化(强制): 主角服饰须保持华丽精致、层次丰富,明确描述多层叠穿结构、面料材质(丝绸、织锦、纱罗、锦缎等)、刺绣纹样(如云纹、缠枝纹、暗花纹等)、配饰细节,以服饰的繁复精美体现身份品阶与视觉品质;配角可适当简化但同样保留古风服饰的纹样层次,风格统一。

禁止任何现代元素: 本剧设定为古代背景,所有角色造型、服装、道具、建筑、场景陈设、台词用词、行为方式必须符合中国古代/古风世界观。严禁出现任何与"现代"相关的内容

设计key_element

  • 登记所有主要角色(element character)、关键场景(element scene)、关键道具(prop element)作为key_element。
  • 道具与场景的分类边界(强制): 大型、固定、不可移动的家具与建筑构件(如龙椅、御案、屏风、床榻、假山、城门等)归入场景元素(element scene)描述,作为场景的固定陈设和视觉地标,在场景四视图中呈现——不单独列为关键道具、不生成纯白背景道具图。关键道具仅限小型、可移动、角色直接手持或交互的物品(如剑、信件、玉佩、药瓶、折扇、灯笼等)。判断标准:若该物品脱离场景后仍能独立展示且不影响空间理解,归为道具;若该物品是空间结构的组成部分或固定陈设,归为场景。
  • 角色描述须包含:年龄/性别/外貌/发型/服装/标志性细节;若角色在剧情中有多套造型或不同时间线形象,在描述中分别列出(如"造型A:…;造型B:…")。服装描述必须贴合古代人物设定,主角服饰偏华丽精致、层次丰富(多层叠穿、面料材质、刺绣纹样、配饰等),配角可适当简化但风格统一。角色服装应保持繁复精美,以体现身份品阶与视觉品质。
  • 跨角色肤色一致性锁定(强制): 同一项目中所有角色的皮肤底色必须统一在同一色温区间——锁定为暖白肤色(warm porcelain-white skin with soft golden undertone),不得出现冷白/惨白与暖白混用。每个角色描述中必须显式写明肤色为"暖白",男女角色共用同一色温锚点。
  • 场景描述须包含:空间结构、固定参照物(不可移动的视觉地标)、材质/光源/色温/氛围词、纹样与工艺细节(雕花、彩绘、镂空、镶嵌等具体描述)、四向空间信息(从空间A端看向B端、从B端看向A端、从左侧横向看、从右侧横向看各能看到什么,用于支撑后续shot中镜头相对描述的准确性)。这些描述是后续每个shot空间连续性的锚点。光影一致性锁定(强制): 每个场景元素(element scene)必须在描述中定义一组固定光影基调——明确光源类型(如"右侧高处窗光")、色温(如"暖黄色3200K")、氛围词(如"沉郁压抑"),该组参数即为该场景的唯一光影基准光影基准须符合全局色调与光影基调要求——默认明亮清透、阴影柔和、暗部保留细节、不出现射光,除非该场景为特殊暗场(黑夜/密室等)。 该场景下所有shot的光影基调必须逐字继承此基准,不得逐镜自由改写;仅在剧情明确要求光影变化(如日夜转换、灯火点燃/熄灭)时方可调整,并须在shot描述中注明变化原因。同一场景内不同shot若光影措辞不一致,视为错误,须修正为与场景元素基准完全一致。注意:光影基调是视频生成阶段的元数据,仅用于shot视频提示词中逐字继承;场景四视图设定图本身不渲染光影——场景设定图采用平光、无阴影的均匀照明,仅展示场景的空间结构、材质与纹样细节,不呈现任何方向性光源或阴影效果。但场景设定图的色彩调性仍须符合全局色调与光影基调——默认明亮清透、色彩明度偏高、饱和度中低到中等——确保场景设定图与视频画面的色彩调性统一,不得出现灰暗或高饱和的色偏。
  • 群像场景强制要求: 当场景属于群像类型(如上朝、集市、宴会、校场、街市等多人聚集场景)时,场景描述中必须包含群众人物(背景NPC)的设定——包括人群规模、大致服饰风格、站位分布、活动状态(如朝臣列班肃立、商贩叫卖走动、百姓穿梭交谈等),群众人物作为背景层存在,不得留空。群众人物服饰同样须符合古风世界观,不得出现现代元素。
  • 角色的声音特征(音色/语气/情绪基调)单独登记为key_element_audio,与角色元素绑定,用于视频生成时的音频条件。

拆解shot列表

  • 每个shot = Seedance 2.0一次生成任务,时长 ≤ 15s(硬性上限,超出必须拆分)。
  • 批次拆分规则(每个shot视为一个批次单元):
    • 单shot时长 ≤ 15s
    • 单shot内切镜数量建议2—5个
    • 单shot出场人物 ≤ 3人,超出须拆分
    • 单shot保持空间一致性,跨物理空间必须切新shot
  • 优先设计较长镜头(目标10—15s),充分利用Seedance 2.0在单次生成中支持内切镜和丰富运镜的能力;避免将一个连续场景拆成过多短镜头。低于10s须有明确理由(如纯空镜过渡、单次快速反应特写等)。最低时长保障(强制): 单shot总时长不得低于10s——动作需要起势、执行、收势的完整时间,台词需要说完+落点停留的余韵时间,运镜过渡和情绪留白也需要呼吸空间。若内切镜合计不足10s,须补充情绪延续帧、反应镜头或运镜层次填充,不得仓促收尾。
  • 连续动作不拆镜(强制): 同场景、同角色、同一连续动作,尽量放在同一个shot内生成。不要把连续动作拆成多个3秒小shot——跨shot生成会导致角色外貌、空间布局、人物站位漂移,连续性断裂。只有当场景切换、角色大幅换位、或时长超过15s硬性上限时才切新shot。
  • 每个shot描述必须包含:
    • 场景:引用对应element scene ID
    • 人物动作与对白:以时间顺序描述人物行为、面部表情、台词(写出具体台词文本)。面部表情须具体到肌肉层面并标注情绪强度(如"眉头骤然拧紧"),不得使用"开心/难过"等模糊泛词;3D渲染角色情绪表达需要比真人更夸张的描述才能被模型准确呈现。每一句台词都必须配合一个明确的肢体动作变化(手势、身体姿态变化、头部转动、眼神转向等),动作须与台词情绪和语义合理匹配,避免出现"站定说话、身体纹丝不动"的静态对白。整体动作幅度偏大、富有冲击力,在设计动作时刻意放大幅度(如甩袖、转身、握拳、后退半步、猛然抬头等),让肢体语言与台词共同推动戏剧张力;动作变化须合理,不可为动而动,须服务于情绪递进与角色关系。情绪-动作联动(强制): 动作幅度必须与情绪强度挂钩——高情绪强度(愤怒/震惊/悲痛/恐惧)必须配大幅度肢体动作(甩袖/猛然转身/后退半步/握拳/拍案/摔物等),低情绪强度(平静/试探/犹豫/克制)才允许小幅度动作。禁止出现"情绪激烈但身体不动"的割裂设计——当情绪标注为高强度时,对应的肢体动作幅度必须同步升级,否则分镜设计本身就存在情绪与动作脱节的问题。内心OS计入时长(强制): 当shot中包含角色内心OS时,OS须写入人物动作与对白中(标注为"OS"),其时间按说话时长计入shot总时长——Agent须按OS文本字数估算时长并分配到对应内切镜。OS期间角色嘴唇不动,须为其设计具体的面部表情变化路径(如"眉头缓缓拧紧,目光从柔和转为凌厉,唇角微压"),表情须与OS内容的情绪递进同步变化,不得使用"微表情传递情绪"等笼统措辞——必须像写台词表演一样为OS逐拍设计表情。不得设计开口说话动作。台词落点后停留(强制): 每句台词说完后,角色须在画面中至少停留1s——保持末尾表情与姿态的延续(如"说完后目光不移,嘴角维持冷笑,呼吸微沉"),让台词的余韵有呼吸空间。禁止台词刚落音就切镜或结束shot——这是导致"话没说完镜头就结束"的直接原因。动作落点后停留(强制): 每个主要动作完成后,角色须在画面中至少停留1s——保持动作收势后的姿态与表情延续(如"转身后定住,背影微颤,停顿片刻再迈步""握拳后手臂僵在半空,呼吸微沉,缓缓松开"),让动作的余势有呼吸空间。禁止动作刚做完就立即切镜或结束shot——这是导致"动作没做完就结束"或"动作仓促收尾"的直接原因。
    • 情绪动态与放大(强制): 情绪不能全程平和——每个shot内须有情绪起伏与递进,不得从头到尾维持同一种平淡情绪。关键台词、转折点、冲突爆发处必须显式放大情绪强度(如从克制→爆发、从平静→震惊、从试探→愤怒),标注情绪变化路径。连续多个shot不得全部维持低情绪平和状态——若剧本本身情绪偏平,须在分镜设计时主动设计情绪放大节点(通过角色反应、眼神变化、肢体张力等制造情绪波动),避免整段视频情绪平淡无张力。情绪放大的幅度须与剧情节拍匹配——越是关键的剧情转折,情绪对比越强烈。
    • 眼神互动(强制): 3D古风角色表演中眼神是最核心的情绪传递通道——对话场景中角色之间必须有明确的眼神互动设计:注视/对视/回避对视/目光追随/怒视/余光瞟视等,须在每个shot的人物动作与对白中显式写出眼神方向与目标(如"目光锁定B的眼睛,不退缩""眼神闪躲,垂眸避开A的注视""余光扫过B,嘴角微动")。禁止角色眼神空洞或无指向——每句台词至少附带一个眼神动作(凝视/转头看向/垂眸/抬眼/怒视/侧目等),眼神变化须与台词情绪和角色关系合理匹配。当A说话时,可设计B的眼神反应(如B目光闪烁、B死死盯住A)作为潜台词传递。
    • 分镜语法三件套:景别(大特写/特写/近景胸像/中景/中全景)+ 机位(平视/俯拍/仰拍/过肩(定义见下条)/正侧面等)+ 运镜(固定/推进/拉远/横摇/跟随/环绕/升降等),三者缺一不可。禁止使用全景/大全景——无论画面中是否有人物,均不得设计全景或大全景镜头;场景空间交代通过场景四宫格设定图完成,视频画面中不需要额外展示全景。
    • 过肩镜头定义(强制): 过肩镜头(over-shoulder)须涉及两个不同角色——镜头架在角色B身后,B的肩/背在画面前景(partial silhouette),画面主体是B对面的角色A的正脸/表情。前景肩和背景脸必须是不同角色,禁止前景和背景是同一人。在shot描述和提示词中须同时点名两个角色,写明谁的肩在前景、谁的脸在背景,格式如"over Character B's shoulder, looking at Character A"。禁止写成"Character A的过肩视角看到Character A"——这种将同一角色同时放在前景和背景的错误写法会导致模型生成两个相同的角色。
    • 景别偏好(强制): 当画面中有人物时,景别以近景胸像、特写、大特写为主,中景为辅,中全景为最宽上限——禁止出现全景/大全景。短剧的核心张力来自人物表情与情绪细节,远景会让观众与角色产生疏离感。当画面中无人物时,可设计空镜(中全景或近景)展示环境局部、氛围或道具细节,用于转场、情绪留白或时间过渡——同样禁止使用全景/大全景。
    • 镜头语言丰富度要求:单shot内各内切镜的景别、机位、运镜须有变化,避免连续多镜同景别同机位堆叠;善用景别对比(如中全景建立→中景交代→特写情绪)和运镜节奏(静止→推进→跟随)制造视觉层次。运镜、切镜、动作、情绪四者必须合理联动——运镜和切镜须服务于叙事与情绪,不可为炫技而堆砌,每处镜头变化都应能解释"为什么这里要这么拍";动作须服务于情绪递进与角色关系,不可为动而动;情绪变化须有叙事因果,不可凭空跳转。四者中任何一项与其他脱节(如运镜华丽但与情绪无关、动作剧烈但情绪平淡、情绪突变但无叙事铺垫)即为不合理设计,须修正。
    • 固定镜头时长上限(强制): 单个内切镜若运镜方式为"固定"(fixed/lock-off),时长不得超过 4s。需要更长的镜头必须包含运镜(推进/拉远/横摇/环绕/升降/跟随等)或内部切镜。对话场景尤其禁止长段固定机位——人物说话时镜头必须"活"起来,通过持续运镜或频繁切镜制造视觉动势,不允许"架好三脚架从头拍到尾"的静态覆盖。
    • 台词-镜头动势联动(强制): 每一句台词都必须搭配至少一个镜头动势词——即在该台词对应的内切镜描述中,至少包含以下动势之一:运镜变化(push-in/pull-out/orbit/pan/tilt/crane/dolly/whip-pan等)、景别切换(切面部特写/切大特写/切反应镜头/切细节特写/切过肩(须同时点名两个不同角色,见"过肩镜头定义")等)、机位变化(正侧转换/仰俯转换/高低机位转换等)。具体选用哪种动势由Agent根据台词的情绪强度、叙事功能和角色关系自行判断,不局限于固定搭配——高情绪台词可快速硬推至大特写或急切反应镜头;试探/犹豫台词可缓慢推进或横向微移;关键反转可配合环绕运镜或突然whip-pan切场;平静陈述可缓慢拉远揭示空间关系。核心原则是禁止"角色说话但镜头纹丝不动"——每句台词的画面都必须有可感知的镜头运动或切换,让台词的节奏感与镜头的动势同步。同一shot内多句台词的动势词须有变化,不可句句都用同一种运镜(如连续三句都写push-in)。
    • 重点台词的景别收紧与推进:当角色说出关键台词(情绪爆发、反转揭底、誓言/威胁等)时,优先设计快速运镜收紧景别——如从近景胸像快速推进到面部特写,或从面部特写再推进到眼睛/嘴唇的大特写(extreme close-up),用镜头逼近感放大台词冲击力。推进速度须与台词情绪强度匹配(愤怒/震惊→快速硬推,压抑/深情→缓慢缓推)。
    • 身体部位细节特写(非面部)编排:镜头不必始终对准脸部。当情绪需要通过肢体细节传递时,主动设计非面部身体部位的大特写作为情绪锚点——如紧张时特写握紧的拳头、颤抖的手指;愤怒时特写青筋暴起的手背、咬紧的下颌线;悲伤时特写攥紧衣角的指节、滑落的泪珠。这类细节特写应紧贴对应情绪节拍插入,与面部镜头交替剪辑,用"以小见大"的方式让观众通过局部感知整体情绪状态;同一个shot内细节特写不宜连续堆叠超过两个,避免碎片化。
    • 反应镜头(reaction shot)编排:对话场景中不要始终锁定说话者。当A说话时,可在A台词中段或落点处切入B的反应特写(捕捉B的面部微表情与情绪变化),再切回A——这种"A说→B反应→回A"的覆盖模式是短剧制造张力、暗示角色关系的核心手法。须注意:切到B时B的表情须与A的台词内容形成呼应(震惊、隐忍、嘲讽、心虚等),不能是空白脸;切回A时可配合景别收紧(如从中景推到特写)强化情绪冲击。同一对话段落中反应镜头不宜每句都切,应在关键台词、情绪转折或潜台词丰富的节点使用,保持节奏张弛有度。
  • 同一物理空间的连续场景尽量归入同一或相邻shot;跨场景需明确标注空间切换。
  • 人物在相邻shot之间的位置/朝向/手持物必须连贯,Storyboard中需显式维护这一状态。
  • 空间关系描述方式(强制——镜头相对描述): 描述角色位置时,禁止使用"角色面向某物"的角色相对朝向写法。必须为镜头相对描述——直接写从镜头视角看,角色背后/左侧/右侧可见什么背景元素。这样直接告诉模型该渲染什么、不该渲染什么,无需模型做空间推理。此规则适用于空间锚点卡、shot描述、以及所有提示词中的空间关系描述。只描述画面内(镜头视角可见)的元素,画面外的元素标注为不可见,不得描述画面外不可见的内容。
  • 离场角色位置追踪(强制): 当某角色从当前shot离场(不再出现在画面中)但其原先占据的位置/道具(如坐过的椅子、站过的位置)仍可能出现在后续shot的画面中时,须在该shot的空间锚点卡中登记该角色的离场状态——标注其原位置及当前视觉状态(如"椅子空置""原站位无人"或"被其他角色占据"),并明确后续shot中该位置应如何处理:是保留空椅但标注"空置"以避免模型随机生成人物、还是通过景别/运镜避开该区域。同一场景内,离场角色原位置的视觉状态在后续所有shot中必须保持一致,不得时有时无。

武打镜头设计专章
古装武打镜头不要全程乱晃——镜头晃动仅在命中瞬间短暂使用,不得贯穿整段打斗,否则画面模糊、动作不可读。

默认四段式组合(每个武打shot须按此节奏编排内切镜):

  • 起手:中景或中全景,看清双方距离与站位关系;
  • 接触:手部、兵器、肩膀、胸口等局部特写,展现交锋细节;
  • 命中:轻微震动 + 后撤 + 可选升格慢动作,强化打击感;
  • 结果:拉回中景,看清谁倒退、谁站稳。

爽点镜头(按需选用,同一shot内不堆叠超过两个):

  • 低机位仰拍:放大主角压迫感与气场;
  • 兵器特写:拔剑、刀锋划过、剑尖停住等关键兵器动作的大特写;
  • 慢动作:仅用于决胜一击,不滥用;
  • 倒地视角:被击倒者仰拍胜者靠近,制造终结感;
  • 横移揭示:一人击退多人后横移镜头露出全场站位,展现战局全貌。

动作密度与节奏(强制):

  • 4—8s动作片段内,不超过 3 个主要打击动作;
  • 8—12s动作片段内,可写 3—5 个主要动作,但必须有节奏层次:试探→格挡→反击→停顿→喘息,不可全程高频输出;
  • 不要让所有攻击都命中——打斗需要闪避、格挡、落空、反制和喘息交替出现;只有命中才有冲击力,全部命中反而平淡。

动作完整链条(强制):
武打动作描述必须写清完整因果链条,不得用"二人激烈打斗"等笼统概括蒙混过关。每个交手节拍须依次写明:

  1. 谁先动——发起方及具体动作(如"角色B横劈一刀");
  2. 谁防守——防守方及具体应对(如"角色A左脚后撤半步,左手抬剑格挡");
  3. 接触点在哪里——兵器/身体接触的确切位置(如"刀锋撞上剑身中段");
  4. 谁被击中或格挡成功——交锋结果(如"角色A手腕被震得下沉,但格挡成功");
  5. 受力结果是什么——身体/姿态的即时变化(如"角色A手臂下沉、身体后倾");
  6. 段末人物停在什么状态——该节拍结束时双方各自的站位/姿态(如"角色A侧身闪开,剑尖停在角色B喉前半寸")。

正确写法示例: 角色A右脚后撤半步,左手抬剑格挡;角色B横劈的刀锋撞上剑身,金属震动,角色A手腕被震得下沉;角色A顺势侧身闪开,右手反刺,剑尖停在角色B喉前半寸。
错误写法示例: 两人展开激烈刀剑大战,动作华丽,气势磅礴。

全局空间锚点卡(每shot开头声明)
每个shot描述的开头须附一张空间锚点卡,格式如下:
【空间锚点/场景名】
固定参照物:(不可移动的视觉地标,如"雕花朱漆大门位于画面中心")
人物当前状态:
· 角色A:[位置 + 镜头相对背景描述(从镜头视角看,角色背后/左侧/右侧可见什么背景元素,哪些关键场景元素位于画面外不可见)]
· 角色B:[位置 + 镜头相对背景描述]
离场角色位置状态:(若本场景有已离场角色且其原位置/道具仍可能出现在画面中,须逐条登记;无则写"无")
· 角色C(已离场):[原位置 + 当前视觉状态,如"原坐在左侧椅上,现已离场,椅子空置,不得生成人物坐在其上"]
光影基调:(逐字继承该场景element scene的固定光影基准——光源类型 + 色温 + 氛围词,不得自行改写;仅在剧情明确要求光影变化时方可调整并注明原因)

空间锚点卡是跨镜保持空间一致性的关键锚点,确保相邻shot之间人物位置、光影完全一致(同一场景内不得出现光影漂移),离场角色的原位置/道具状态也须逐镜保持一致,不得省略。人物位置描述必须使用镜头相对描述(直接写角色背后/周围可见什么背景元素,哪些元素位于画面外不可见),不得使用角色相对朝向写法。

空间锚点卡背景元素的推导规则(强制): 空间锚点卡中每个角色背后/左侧/右侧可见的背景元素,必须从该场景element scene的四向空间信息中推导——根据角色在场景中的站位和镜头机位,从场景四向空间描述中确定该方向可见什么。不得凭经验猜测或编造场景中不存在的元素。 若场景描述不足以确定某角色某方向的背景元素(如剧本只写"金銮殿"但未交代殿内空间布局、大门方位、龙椅位置等),须主动向用户确认场景的空间布局后再填写空间锚点卡,不得静默假设。场景描述越具体(明确标注门、窗、龙椅、屏风等固定参照物的方位关系),空间锚点卡的背景元素推导就越准确,第一镜视频生成时模型才能正确渲染角色背后的场景。

Storyboard完稿前自检清单
交付Storyboard前逐项核查并向用户报告结果:

  • [ ] 遗漏检查:原剧本中所有关键动作、台词、转折是否都有对应shot?
  • [ ] 逻辑一致性:人物在前后shot的位置/镜头相对背景描述/手持物是否连贯?空间描述是否使用了镜头相对写法(角色背后可见什么)而非角色相对朝向写法?
  • [ ] 在场/离场一致性:已离场角色原先占据的位置/道具(如椅子、站位)在后续shot中的视觉状态是否被显式登记且逐镜一致?是否存在同一把椅子有时有人、有时空着的不连贯情况?
  • [ ] 接镜顺畅度:前一shot出画方向与后一shot入画方向是否符合轴线规则(不跳轴)?
  • [ ] 景别偏好:有人物的镜头是否以近景胸像/特写/大特写为主、中景为辅?是否出现全景/大全景(禁止)? 无人物空镜是否以中全景或近景展示环境局部/氛围/道具,未使用全景/大全景?
  • [ ] 时长合规:每个shot合计是否 ≤ 15s?每个内切镜是否在景别建议时长内?固定镜头(fixed/lock-off)是否均 ≤ 4s?
  • [ ] 镜头动势合规:每句台词对应的内切镜是否都包含至少一个镜头动势词(运镜/切镜/机位变化)?是否存在"角色说话但镜头纹丝不动"的零动势镜?同一shot内多句台词的动势词是否有变化,未句句重复同一运镜?
  • [ ] 情绪动态合规:每个shot内是否有情绪起伏与递进?关键节拍处情绪强度是否显式放大?是否存在连续多shot全程低情绪平和状态?
  • [ ] 眼神互动合规:每句台词是否至少附带一个眼神动作?对话场景中是否设计了角色间的眼神互动(注视/回避/怒视等)?是否存在眼神空洞或无指向的情况?
  • [ ] 空间一致性:同一shot内是否未跨场景?同一场景下所有shot的光影基调是否与该场景element scene的固定光影基准完全一致(逐字比对,不得漂移)? 仅在剧情明确要求光影变化时允许调整且须注明原因。
  • [ ] 角色一致性:角色代号是否全程统一,无同人异名?
  • [ ] 音效/台词位置:是否紧贴对应动作,无错位?
  • 如有问题,先与用户确认是否修改,再继续下一步,不得静默修改原稿。

设计audio_layer

  • BGM:全剧至少规划一条背景音乐轨。若剧情有明显情绪转折点(如3分钟以上长片),可分段设计多条BGM(各有独立audio_layer ID和覆盖镜头范围)。
  • 旁白(第三人称VO):如有画外音/旁白(非角色视角的第三方叙述),以narration类型登记,注明narration_speaker_profile(音色特征)、语气、具体台词文本及覆盖的镜头范围。
  • 角色内心OS:当画外音属于某角色的内心独白(OS)时,不得作为通用narration处理——必须绑定到该角色的key_element_audio,使内心独白与该角色台词使用同一音色,保持角色声音一致性。内心OS须内嵌在视频生成中(与台词同级,不作为独立旁白轨单独生成),其时间计入shot总时长,不得跳过——按OS文本字数估算所需时长并纳入shot的内切镜时间分配。内心OS期间角色不开口说话(嘴唇不动)——OS是角色的内心声音,画面中角色嘴巴保持闭合,须为OS时段设计具体的面部表情变化路径(如"眉头缓缓拧紧→目光从柔和转为凌厉→唇角微压"),须像台词表演一样逐拍写出表情节拍,与OS情绪递进同步,不得笼统写"微表情传递情绪"。在audio_layer中登记时标注所属角色element ID,并注明"使用该角色key_element_audio作为音色参考,内嵌于视频生成"。
  • 视频生成阶段视频本身不内嵌BGM(在audio_layer独立生成后于组装阶段混音);台词/音效/内心OS可在视频生成时内嵌。
4. 미디어 생성

key_element设定图生成

  • 角色设定图: 使用 TextToImage,模型 GPT Image 2,分辨率 2K画幅强制为16:9横版,禁止使用1:1或9:16——不可由用户自主选择,这是硬性限制。 按Write the Prompt中的角色图提示词模板撰写。
  • 场景四视图: 使用 TextToImage,模型 GPT Image 2,分辨率 2K。每个场景生成一张四视图设定图(2×2网格:从空间A端看向B端/从空间B端看向A端/从左侧横向看/从右侧横向看),覆盖两个纵深方向与两个横向方向,构成完整四向空间覆盖。场景中的关键道具/固定陈设自然融入四个空间视角中,不单独给特写角度。场景设定图不渲染光影——采用平光、无阴影的均匀照明(flat even lighting, no cast shadows),仅展示空间结构、材质与纹样细节,不呈现方向性光源或阴影。色彩调性仍须与全局色调基调一致——明亮清透、色彩明度偏高、饱和度中低到中等,不得出现灰暗或高饱和的色偏。 按Write the Prompt中的场景四视图提示词模板撰写。
  • 关键道具设定图: 使用 TextToImage,模型 GPT Image 2,分辨率 2K。按Write the Prompt中的关键道具资产图提示词模板撰写。
  • 同一角色多套造型: 使用 ImageToImage,模型 GPT Image 2,将首套造型图作为reference_image上传,仅替换服装/发型/妆容/配饰,锁定脸型/五官/肤色/身高比例。
  • 角色key_element_audio(音色样本): 为每个有台词/内心OS的角色生成一段音色样本,使用 text to narration(MiniMax Speech 2.8 HD),按角色描述中的声音特征(音色/语气/情绪基调)生成一段短样本(10—15s),注册asset_id并绑定到该角色的key_element_audio槽位,供后续视频生成时保持台词与内心OS跨镜音色一致。若用户已上传角色声音参考,可直接注册绑定,无需重新生成。

用户上传资产处理

  • 用户上传的角色/场景/道具资产图经分析判定为非3D风格时,须先通过 ImageToImage(GPT Image 2)将原图转化为3D古风风格后方可绑定到key_element,不得直接使用非3D资产图。
  • 转化时以原图为reference_image,提取原图角色身份特征,注入3D古风风格关键词,要求保持身份特征不变、仅转化渲染风格。
  • 用户上传的3D风格资产图可直接注册asset_id并绑定到对应key_element槽位。

单shot视频生成

  • 使用 MultiModalToVideo,模型 Seedance 2.0,分辨率 720p,时长 ≤ 15s。降级方案(强制): 若Seedance 2.0不可用(如非会员或模型失败),依次降级为同工具内的 Seedance 2.0 FastSeedance 2.0 MiniKling 3.0 Omni。降级时须告知用户当前使用的模型。若MultiModalToVideo所有模型均失败,停止任务并向用户说明,不得擅自切换到其他工具路径。
  • 生成前资产重检(强制): 每次生成镜头视频之前,必须重新检查当前镜头涉及的所有key_element下已有哪些已绑定资产,以及当前镜头是否已有参考资产(空间一致性参考帧等)。用户可能随时新增资产,不可依赖上次的记忆,必须以当前实际资产列表为准。防漏帧校验(强制): 若检查发现当前shot所需的某种参考帧(特定角色视角/景别/方向)在前序截取帧中不存在,须先回溯前序shot视频通过 resource_prepare_and_analyze 补截对应帧并补做视觉内容分析,补截完成后再进入生成。检查后按以下规则选取参考:
    • 角色图: 若某角色有多套妆造参考图,只选与当前场景服装一致的那一套,无需同时放入多套造型图。
    • 场景图: 选取当前镜头所属场景的场景四宫格key_element图像。
    • 空间一致性参考帧: 若为第二个shot起,须从所有已生成的前序shot中由Agent自行挑选空间一致性参考帧(一帧或多帧)。Agent须回溯前序所有已生成shot已绑定的参考帧,根据当前shot的需求挑选最相关的帧——不仅限于紧邻的上一镜,也可回溯更早的shot(例如当前shot有某角色在中间shot缺席后重新出场且站位应与之前一致,可回溯该角色上次在场时的shot的角色视角帧)。选帧须同时通过以下四层过滤,任一层不通过则排除该帧:背景内容匹配过滤(强制·最高优先级): 检查该帧在截帧时生成的视觉内容分析标签中的"可见背景元素清单",将其与当前shot空间锚点卡中各角色背后/左侧/右侧可见背景元素逐项比对——背景元素不一致的帧直接排除,不得纳入。若帧没有视觉内容分析标签(如用户手动上传的帧),须先通过 resource_prepare_and_analyze 补做视觉内容分析再比对。②角色过滤: 当前shot不在场角色的视角帧须排除,只保留站位帧、当前shot在场角色的视角帧。③方向过滤: 帧的场景方向须与当前shot机位方向一致。④景别兼容性区间过滤(强制): 参考帧的景别须在当前shot最宽内切镜景别对应的兼容区间内——大特写shot可参考大特写/特写/近景;特写shot可参考特写/大特写/近景/中景;近景shot可参考近景/中景;中景shot可参考中景/近景/中全景/特写;中全景shot可参考中全景/中景/近景/特写/大特写。任何shot一律不得纳入全景/大全景帧。若前序shot中只有宽景别帧可用(如仅有站位中全景帧)且其景别不在当前shot兼容区间内,则不为当前shot纳入该帧——改用角色key_element图像 + 场景四宫格 + 提示词文字描述固定站位关系,不引入景别不匹配的参考帧。若前序帧通过景别/方向/角色过滤但未通过背景内容匹配过滤,同样不得纳入——背景不匹配的帧比没有参考帧更危险,会导致模型生成与空间锚点卡矛盾的背景。
  • 第一个shot的参考输入: 该镜涉及的所有角色key_element图像(按上述重检规则选取对应造型) + 对应场景四宫格key_element图像。光影须以shot描述中继承的场景光影基准为准,空间关系以shot描述中的镜头相对描述为权威。第一个shot是全片视觉基调的锚点——场景空间、人物站位、光影风格、角色外貌都在此镜确立,务必确保空间锚点卡中的背景元素描述准确。
  • 跨镜空间一致性帧截取(强制): 每个shot视频生成完成后,由Agent根据下一镜的需求从该视频中截取一帧或多帧画面。截帧数量最小化原则(强制): 若当前shot与下一镜之间人物未走动、站位未变、背景场景相同,只截取一帧最关键的画面即可——多截同质帧无意义且增加干扰。仅当下一镜需要不同视角的信息(如不同角色的清晰帧、不同方向的场景背景帧)且这些信息无法从单一帧中获得时,才截取多帧。截取不限于站位中全景——Agent须判断下一镜需要哪些参考:下一镜聚焦男主则截取男主视角清晰的帧,聚焦女主则截取女主帧,需要场景背景则截取场景信息最丰富的帧,需要整体站位则截取中全景帧。**景别兼容性截帧约束(强制):** 截取帧的景别须在下一镜最宽内切镜景别对应的兼容区间内——大特写shot可截取大特写/特写/近景帧;特写shot可截取特写/大特写/近景/中景帧;近景shot可截取近景/中景帧;中景shot可截取中景/近景/中全景/特写帧;中全景shot可截取中全景/中景/近景/特写/大特写帧。一律不得截取全景/大全景帧,否则宽景别帧会拉扯模型向宽画面偏移导致切镜后突然变远、人物位置漂移。应从当前shot中截取景别落在下一镜兼容区间内的帧。**截帧前须先查阅下一镜Storyboard确认下一镜实际出场人物——下一镜不在场的角色不截取其角色视角帧,因为不在场角色的视角帧中场景背景角度与下一镜不同,纳入后会导致模型误引入该角度的背景而造成场景漂移。站位帧可纳入(传递站位关系),但角色视角帧仅限下一镜在场角色。**所有纳入的帧的场景方向须与下一镜机位方向一致,不得将不同机位方向的帧混合纳入。多帧之间互补,覆盖不同视角、不同角色和不同区域,帮助下一镜更完整地还原空间。截取的帧逐一注册asset_id并绑定到该shot,供下一shot视频生成时作为空间一致性参考帧。截帧操作通过 resource_prepare_and_analyze 完成。
  • 从第二个shot起的参考输入: 在第一个shot参考输入基础上追加 从所有已生成的前序shot中由Agent自行挑选的空间一致性参考帧(一帧或多帧)。Agent须回溯前序所有已生成shot已绑定的参考帧,根据当前shot的需求挑选最相关的帧——不仅限于紧邻的上一镜,也可回溯更早的shot(例如当前shot有某角色在中间shot缺席后重新出场且站位应与之前一致,可回溯该角色上次在场时的shot的角色视角帧)。选帧须通过上述"生成前资产重检"中的四层过滤(背景内容匹配→角色过滤→方向过滤→景别兼容性)。 若所有前序帧均未通过背景内容匹配过滤,则不为当前shot纳入任何参考帧,改用角色key_element图像 + 场景四宫格 + 提示词文字描述固定站位关系。这些参考帧用于固定人物站位关系和场景背景,不影响当前shot的镜头景别、运镜和切镜设计——当前shot镜头仍完全按Storyboard描述执行。
  • 第一个shot视频生成后强制暂停(强制·不受模式选择影响): 第一个shot生成后必须暂停,向用户展示视频,请用户确认场景布局是否正确(如角色背后的背景元素是否符合预期)、人物站位是否合理。若用户不满意,根据反馈调整空间锚点卡/shot描述后重新生成,确认通过后再继续后续shot。无论用户选择一键生成模式还是逐镜确认模式,第一个shot的强制暂停均不可跳过。 一键生成模式下,第一个shot确认通过后剩余shot连续生成不再逐镜暂停;逐镜确认模式下,每个shot生成后均暂停等待用户确认。
  • 若用户上传或已生成的资产匹配Storyboard槽位,优先绑定使用,避免重新生成用户已有内容。
  • 重新生成单个shot时的内容锁定(强制): 当用户要求对已生成的某shot重新生成(而非修改Storyboard),Agent必须严格复用该shot在Storyboard中已确认的提示词原稿——台词原文、角色动作、情绪路径、镜头景别/机位/运镜、空间锚点卡描述均须逐字保持不变。仅根据用户明确指出的调整诉求(如"角色站位不对""背景元素有误")修改对应部分,不得借重新生成之机擅自改写台词、增删动作、调整情绪路径或改动镜头设计。重新生成前须向用户展示"本次重新生成保留的内容vs修改的内容"清单,经用户确认后执行。

音频生成

  • BGM: 使用 text_to_instrumental(Suno 5/Mureka 8),按audio_layer中的BGM设计生成。视频生成时视频本身不内嵌BGM,BGM在audio_layer独立生成后于组装阶段混音。
  • 第三人称旁白(VO): 使用 text to narration(MiniMax Speech 2.8 HD),按narration_speaker_profile生成。
  • 角色内心OS: 内心OS不作为独立旁白轨单独生成——须内嵌在视频生成中(写入视频提示词 [音频] 段,与台词同级),通过该角色的key_element_audio绑定保持音色一致。OS时间计入shot总时长,按说话时长估算。OS期间角色嘴唇不动,须为OS时段设计具体的面部表情变化路径并写入视频提示词主体段,与OS情绪递进同步。
  • 角色台词与内心OS音色一致性: 视频生成时通过character的key_element_audio绑定保持台词与内心OS跨镜音色一致。

资产管理

  • 为每个生成的或用户上传的资源注册稳定asset_id,并绑定到Storyboard对应槽位(key_element/shot/audio_layer)。
  • 同一资源的新版本可通过rebinding更新关联,保持asset_id稳定。
5. 프롬프트 작성

全局提示词撰写原则(适用于所有提示词类型)

  • 风格关键词强制写入(所有提示词类型): 无论是视频提示词、角色图提示词、场景图提示词还是道具图提示词,都必须写入关键词组:半写实3D国漫风格,stylized anime-doll beauty, youthful androgynous pretty face, narrow oval V-shaped face, soft jawline, slightly enlarged almond eyes, delicate straight nose, soft thin lips, smooth poreless porcelain skin, clean stylized skin shader, soft cinematic close-up lighting。不得用"按项目风格填写""与全片风格一致"等模糊措辞替代——必须逐字写入关键词,确保模型每次生成都落在统一的3D古风渲染风格上。例外(场景四视图提示词): 场景四视图设定图不渲染光影,将风格关键词组中的 "soft cinematic close-up lighting" 替换为 "flat even lighting, no shadows, no cast shadows, no dramatic light direction"——但色调关键词(bright and clear tone, medium-high lightness, low to medium saturation, fresh harmonious color palette)仍然适用于场景设定图,确保场景图的色彩明度与饱和度与视频画面保持同一基调。场景设定图仅不呈现方向性光源或阴影效果,色彩调性须与全局色调一致。
  • 禁用真人摄影/解剖学词汇(强制): 角色外貌描述须使用3D角色造型语言(如sculpted、stylized、3D character face),禁止使用真人摄影/解剖学词汇(如weathered、deep-set、heavy brow ridge、prominent cheekbones、photographic、ultra-realistic等)——这些词汇在训练数据中几乎只与真人摄影关联,会将输出拉向写实方向。面部特征用3D雕塑化语言描述,如"sculpted jaw"、"stylized brow"、"3D rendered cheekbones"。
  • 禁止抽象表述,全部具体化: 提示词中不得出现"优美的""有氛围感的""戏剧性的"等抽象形容词,每一项描述都必须落到可被模型直接渲染的具体视觉元素——写明具体颜色、材质、光位、角度、距离、动作幅度、表情肌肉状态等。例如不写"优雅的姿态",而写"右手轻提裙摆至腰侧,左肩微向后展,下颌微抬15°";不写"昏暗的光线",而写"右侧高处窗光,暖黄色3200K,投射角约45°"。
  • 禁用比喻性/情绪化外观词(强制): 禁止使用中文中带有物理外观副作用的比喻性情绪词或成语——模型会将这些词中的颜色、损伤、形变描述按字面渲染,而非理解为情绪比喻。典型示例:①"面目狰狞"→模型会添加伤疤、疤痕、面部扭曲;②"面色惨白""面无血色""面如死灰"→模型会将整张脸渲染为纯白色/灰白色,破坏肤色一致性;③"血盆大口"→模型会渲染出带血的嘴部;④"青面獠牙"→模型会生成绿色皮肤和尖牙;⑤"面如桃花""面若桃花"→模型会将面部渲染为粉色/桃花色色块。这类词的共同特征是:字面包含颜色词、损伤词或形变词,实际想表达的是情绪状态(恐惧、愤怒、震惊、害羞等)。替代写法:将情绪拆解为面部肌肉层面的具体微表情——如不写"面目狰狞",而写"眉头猛然拧紧,鼻翼扩张,上唇掀起露出牙齿,下颌前突";不写"面色惨白",而写"瞳孔骤缩,嘴唇微张,面部肌肉僵硬"(肤色由key_element图像锁定,提示词不干预肤色)。
  • 仅描述物理可见内容(强制): 提示词只描述画面中实际可见的元素——可见的动作、表情、姿态、光影和空间关系。不要描述画面外的元素,不要向模型解释角色动机、内心活动或情感背景;只写镜头能拍到的物理事实,让模型通过可见的肢体语言和面部表情自行呈现情绪,而非用文字"告诉"模型角色在想什么。
  • 人物站位关系一致性(强制): 在为Storyboard shot、参考图片撰写提示词时,人物之间的相对站位关系(左右顺序、前后景层级、彼此距离)必须与该shot的空间锚点卡完全一致,不得在不同提示词中对同一场景的人物站位给出矛盾描述。同一场景内多个shot之间,若人物未发生位移,站位关系须逐字保持一致;若发生位移,须在提示词中明确写出从何处移动到何处。
  • 空间关系描述方式(强制——镜头相对描述): 描述角色与场景的空间关系时,禁止使用"角色面向某物"的角色相对朝向写法(如"角色面向龙椅"),必须改为镜头相对描述——直接写从镜头视角看,角色背后/左侧/右侧可见什么背景元素,以及哪些关键场景元素位于画面外或景深处不可见。这样无需模型做空间推理,直接指定该渲染什么、不该渲染什么。

内切镜时长估算(视频提示词撰写前)
若Storyboard shot未标注各内切镜时长,按以下经验值估算,确保单shot合计 ≤ 15s且 ≥ 10s:
镜头类型建议时长大特写/手部脚部特写2–3.5s面部特写(含台词)3–5s近景胸像(含台词)3.5–5s中景/中全景4–6s运镜推进/拉远/环绕基础景别时长 +1s台词落点后停留+1s(强制,每句台词末尾须留余韵)动作落点后停留+1s(强制,每个主要动作完成后须保持收势姿态停留,禁止做完即切)

台词时长估算(强制): 每句台词须按字数估算说话时长(中文约2.5字/秒——古风戏剧化念白带情绪停顿与气息,实际语速低于日常对话,不得用3字/秒的高估值),加上台词落点后1s停留,作为该台词对应内切镜的最低时长。若台词+停留时间超过该景别建议时长上限,以台词+停留时间为准。
动作完成度校验(强制): 每个内切镜的时长须覆盖该镜内所有动作的完整起势→执行→收势过程加上动作落点后1s停留——若动作链条+停留需要5s但景别建议时长只有3s,以动作完成+停留所需时长为准,不得压缩动作使其仓促。
超过15s必须拆分为独立shot。

画幅必须为16:9横版(禁止使用1:1或9:16)。按以下模板撰写提示词,各字段填入该角色的具体信息:

角色:[角色名],[年龄段],[性别/体态],[身份/职业]。
外貌:[脸型、五官、眉眼、鼻梁、唇形、发型、肤色、年龄感、核心气质、标志性识别点]。

风格:所有角色须强化视觉品质——在提示词中显式写入:"半写实3D国漫风格,stylized anime-doll beauty, youthful androgynous pretty face, narrow oval V-shaped face, soft jawline, slightly enlarged almond eyes, delicate straight nose, soft thin lips, smooth poreless porcelain skin, clean stylized skin shader, soft cinematic close-up lighting."所有角色(含配角)的肤色必须统一为warm porcelain-white skin with soft golden undertone
服装:[必须严格贴合中国古代/古风服饰体系——主角偏华丽精致、层次丰富:内搭、中衣、外袍、披帛、腰带等多层叠穿,面料写明(丝绸、织锦、纱罗、锦缎等),配以刺绣纹样与玉佩、金簪等饰物,体现身份品阶;配角可适当简化但风格统一。逐一列明:内搭、外袍、下装、鞋、首饰、关键道具、材质、颜色、纹样、新旧程度]。
表情与气质:[常用表情须具体到面部肌肉层面(如"眉尾微挑、唇角轻抿、眼底含笑但不达眼底"),标注情绪强度;标志性微表情(如习惯性抿唇/假笑时眼角不动等)作为跨镜识别锚点;情绪底色、人物状态]。3D渲染角色表情需要比真人更鲜明、更具戏剧张力的描述。
画面排列:左侧1/3区域为超大高清面部特写,右侧2/3区域整齐排布角色三张全身三视图,包含角色的正面、侧面及背面三个维度的全身站姿视图。纯白背景,干净极简,无阴影,高清,精致细节;角色长相和服装细节一致。
背景:白色背景,柔和均匀灯光,无场景道具,无复杂背景。
限制:必须是同一个角色;脸型、发型、服装、鞋子、配饰完全一致;不要生成多个不同人物;不要换装;不要改变发色;不要随机文字;不要水印;不要logo。

同一角色多套妆造提示词(ImageToImage/GPT Image 2)
当同一角色需要生成第二套及以后造型图时,使用ImageToImage,将首套造型图作为reference_image上传,提示词在前述角色图模板基础上做以下调整:

  • 外貌字段:与首套完全一致,不得修改脸型、五官、肤色、身高比例、核心识别特征——这些由垫图保证,提示词中重复写明以强化锁定。
  • 服装字段:替换为本套造型的具体服装/发型/妆容/配饰描述,同样遵循古风服饰体系与主角华丽精致要求。
  • 画面排列、背景、风格:与首套保持一致,确保输出格式统一。
  • 在提示词中显式注明:Reference image: <<<image_1>>> is the same character's first look—keep identical face, facial features, skin tone, body proportions; only change costume/hairstyle/makeup/accessories.

用户上传非3D资产图的风格转化提示词(ImageToImage/GPT Image 2)
当用户上传的角色/场景/道具资产图经分析判定为非3D风格时,使用ImageToImage将原图转化为3D古风风格。以原图为reference_image,提示词写法如下:

  • 提取原图中的角色身份特征(脸型、五官、发型、肤色、服装款式、配饰等),在提示词中逐项写明,要求转化后保持一致。
  • 注入3D古风风格关键词:半写实3D国漫风格,stylized anime-doll beauty, youthful androgynous pretty face, narrow oval V-shaped face, soft jawline, slightly enlarged almond eyes, delicate straight nose, soft thin lips, smooth poreless porcelain skin, clean stylized skin shader, soft cinematic close-up lighting,
  • 在提示词中显式注明:Reference image: <<<image_1>>> is the same character/scene/prop—keep identical identity features (face shape, facial features, hairstyle, costume structure, proportions); only convert the rendering style to 3D ancient Chinese CGI. Do not alter the character's identity.
  • 服装/道具若含现代元素,在转化提示词中一并替换为符合古风世界观的对应物品。
  • 限制:保持原图角色身份不变;不要改变脸型/五官/肤色/身高比例;不要随机文字、水印、logo。

关键道具资产图提示词(TextToImage/GPT Image 2)
按以下字段撰写,纯白背景、干净极简、无阴影、高清;画幅默认16:9。各字段填入该道具具体信息:尺寸、材质、颜色、新旧程度、正反面(如有差异需在同一张图中同时展示正反两面)、当前状态。风格关键词必须显式写入:3D CGI rendering, ancient Chinese aesthetic, PBR materials, stylized 3D CGI—不得省略。限制:只生成该道具本身,不要出现人物或场景;不要随机文字、水印、logo。

场景四视图提示词(TextToImage/GPT Image 2)
A location reference sheet of [场景描述,含空间结构/材质/标志物/纹样工艺细节].
Lighting: Flat, even, shadowless illumination—uniform ambient light only, no cast shadows, no dramatic light sources, no directional light, no ambient occlusion shadows, no light rays or god rays. The scene reference sheet should read like a clean 半写实3D国漫风格,3D model viewport render with flat ambient lighting, not a cinematically lit shot.
Show four directional views of the same location in one composite image (2×2 grid). Each view is a full spatial angle—no isolated prop close-ups. Key furnishings and fixed landmarks naturally appear within whichever angle they are visible from:
Top-left: View from end A looking toward end B (forward depth—what is visible looking into the space from one end)
Top-right: View from end B looking toward end A (reverse depth—what is visible looking back from the opposite end)
Bottom-left: Left-side lateral view (camera positioned at the left side of the space, looking across horizontally)
Bottom-right: Right-side lateral view (camera positioned at the right side of the space, looking across horizontally)
Identical flat even lighting (no shadows, no dramatic light direction), color palette, and props across all four panels.
[Style]: Richly detailed ancient Chinese interior/exterior environment—carved wooden furniture with intricate grain patterns, painted beams with traditional motifs (cloud dragons, floral scrolls, geometric fretwork), lattice windows with openwork designs, inlaid mother-of-pearl surfaces, silk curtains with embroidered borders, bronze incense burners, jade ornaments. Color palette follows classical Chinese aesthetics—warm wood tones, muted indigo, elegant ochre, subtle moon-white, harmonious and layered.
[人群条件]:若为群像场景(上朝、集市、宴会等),将模板末尾的 "No people in frame." 替换为以下人群描述:Populate the scene with background crowd NPCs in period-appropriate ancient Chinese attire—[人群规模/服饰风格/站位分布/活动状态,如 "court officials standing in formal rows", "market vendors and pedestrians browsing and haggling"]. Crowd figures should be slightly lower in detail than the main environment, serving as atmospheric background without dominating the frame. 若为非群像场景则保留:No people in frame.
No text, no labels, no watermark, no cast shadows, no dramatic lighting.

视频提示词撰写前空间校验(强制)
撰写每个shot的视频提示词前,执行一次空间校验:

  • 对照该shot的空间锚点卡,逐角色确认提示词中描述的背景元素是否正确——根据空间锚点卡中角色的镜头相对背景描述,确认每个角色背后/左侧/右侧可见的背景元素在提示词中描述正确。
  • 确认画面外不可见的场景元素已在提示词中排除,未被误写为可见。
  • 确认提示词与空间锚点卡的空间描述完全一致。
  • 参考帧分工说明: 空间一致性参考帧已由 media_generator 经四层过滤(背景内容匹配→角色过滤→方向过滤→景别兼容性)选出,本阶段不重复执行选帧过滤,仅做提示词写作层面的一致性校验:背景匹配确认、景别兼容性确认、背景元素逐项对照。
  • 参考帧背景内容匹配校验(从第二个shot起强制): 若本shot纳入了从任意前序shot中挑选的空间一致性参考帧,须执行以下校验序列(任一步不通过则排除该参考帧):
    1. 背景内容匹配检查(强制·第一优先级): 检查该帧在截帧时生成的视觉内容分析标签中的"可见背景元素清单",将其与当前shot空间锚点卡中各角色背后/左侧/右侧可见背景元素逐项比对。若帧的背景元素与空间锚点卡不一致(如帧中背景是大门但空间锚点卡写的是高台),该参考帧必须排除,不得在本shot提示词中引用。若帧没有视觉内容分析标签,须先通过 resource_prepare_and_analyze 补做视觉内容分析再比对。
    2. 景别兼容性检查: 确认参考帧景别在本shot最宽内切镜景别对应的兼容区间内——大特写可参考大特写/特写/近景;特写可参考特写/大特写/近景/中景;近景可参考近景/中景;中景可参考中景/近景/中全景/特写;中全景可参考中全景/中景/近景/特写/大特写。若参考帧景别不在兼容区间内,该参考帧必须排除。
    3. 背景元素逐项对照: 通过背景内容匹配和景别检查后,确认提示词中描述的每个可见背景元素在参考帧中确实可见且一致。若参考帧中拍到了某背景元素但提示词未提及,须补入;若提示词描述了某背景元素但参考帧中看不到(可能该方向实际不可见),须回溯修正空间锚点卡和提示词。
    • 若参考帧未通过背景内容匹配检查或景别兼容性检查,该帧必须排除——排除后改用角色key_element图像 + 场景四宫格 + 提示词文字描述固定站位关系,不得引用景别或背景不匹配的参考帧。校验通过后,在提示词 [空间] 段中以 <<<image_reference_frame>>> 占位符显式引用参考帧,并写明"background elements must match reference frame <<<image_reference_frame>>>—[列出需保持一致的具体背景元素]"。
  • 若校验发现不一致,须先修正提示词中的场景元素描述(或回溯修正shot描述/空间锚点卡),修正后再进入视频生成,不得带错生成。
  • 重新生成时的提示词锁定(强制): 须复用上次已确认的视频提示词原稿,仅改用户指定部分(完整规则见media_generator)。

单shot视频提示词(MultiModalToVideo/Seedance 2.0)
每个shot输出一段提示词,影像风格行作为整体基调先行,其后严格按 摄影机→主体→空间→音频 四段顺序撰写:
[影像风格]: 半写实3D国漫风格, stylized 3D CGI rendering, ancient Chinese aesthetic,
bright and clear tone, medium-high lightness, soft global illumination, soft shadows with preserved detail in dark areas, no harsh light rays, no god rays, silk painting color palette, low to medium saturation, fresh harmonious color palette, stylized depth of field, 24fps.

[摄影机]: [按内切镜顺序逐镜写明:景别 + 机位角度 + 运镜方式 + 切镜变化],多镜时每镜换行;同一shot内各镜景别/机位/运镜须有变化,避免重复堆叠
固定镜头时长上限(强制): 任何标注为fixed/lock-off的内切镜不得超过4s——超过4s必须改为带运镜的镜头(push-in/pull-out/orbit/pan/dolly等)或拆成多个有切镜变化的短镜。对话场景禁止长段固定机位。
台词-镜头动势联动(强制): 每句台词对应的内切镜描述中必须包含至少一个镜头动势词——运镜变化(push-in/pull-out/orbit/pan/tilt/crane/dolly/whip-pan等)、景别切换(cut to close-up/cut to extreme close-up/cut to reaction/cut to detail/cut to over-shoulder(须同时点名两个不同角色——前景肩为一人,背景脸为另一人)等)或机位变化(switch to low angle/switch to side profile等),由Agent根据台词情绪与叙事功能自行判断选用。禁止 "static camera, character speaks" 式的零动势描述;同一shot内多句台词的动势词须有变化,不可句句重复同一运镜。
示例1(单镜,≤4s固定): Medium waist shot, fixed camera, eye-level, 3s
示例2(多镜含反应镜头与细节特写):

  1. Medium two-shot, slow dolly-in, eye-level—A and B facing each other
  2. Close-up on A, slow push-in—A delivers line with suppressed fury
  3. Close-up on B, fixed, 2s—B's reaction: eyes widen, jaw tightens (reaction shot)
  4. Extreme close-up on A's eyes, rapid push-in—A speaks key line, eyes narrow with cold rage
  5. Extreme close-up on A's clenched fist, fixed, 2s—knuckles white, veins bulging (detail cutaway)
  6. Close-up on A, push-in tighter—A continues, voice drops

示例3(含过肩镜头):

  1. Medium two-shot, eye-level—A and B facing each other across the desk
  2. Over Character B's shoulder, looking at Character A, slow push-in—A speaks with suppressed fury (foreground: B's shoulder/back silhouette; background: A's face)
  3. Over Character A's shoulder, looking at Character B, fixed, 3s—B's reaction: lips press tight, gaze drops (foreground: A's shoulder; background: B's face)

过肩镜头写法(强制): 过肩镜头必须同时点名两个不同角色——写明"over [前景角色]'s shoulder, looking at [背景角色]",前景角色只有肩/背出现在画面前景,背景角色是画面主体(正脸/表情)。禁止将同一角色同时写在前景和背景(如"over Character A's shoulder, looking at Character A")。

反应镜头写法:对话段落中,在说话者的镜头之间插入听者反应特写(reaction shot),用 "reaction shot" 标注并写明听者面部微表情;切回说话者时可收紧景别强化情绪。

重点台词推进写法:关键台词处用 "rapid push-in to extreme close-up" 或 "slow push-in from close-up to extreme close-up on eyes/lips" 标注推进路径,速度词与情绪强度匹配。

身体部位细节特写写法:需要非面部细节特写时,用 "extreme close-up on [身体部位] (detail cutaway)" 标注,紧跟情绪词描述局部状态(如 "clenched fist, knuckles white"),与面部镜头交替出现,同一shot内不超过两个细节特写。

对话镜头动势池(强制泛化): 对话段落中镜头不得停留在单一景别+固定机位上,须主动从以下动势池中选取组合,让每句台词都有不同的画面呈现方式(Agent根据台词情绪与叙事功能自行判断,不局限于以下列举):

  • 运镜类:slow push-in(缓推逼近情绪)/rapid push-in(急推强化冲击)/pull-out(拉远揭示孤立或压迫)/orbit/arc shot(环绕呈现对峙张力)/whip-pan(急摇切场或转注意力)/dolly/tracking(跟随走位)/crane up-down(升降揭示空间或心境)/tilt/pan(横纵摇揭示关系)
  • 景别切换类:cut to extreme close-up on eyes/lips/brow(面部局部大特写)/cut to close-up on hands/fist/fingers(手部细节)/cut to over-shoulder(过肩——前景为镜头背后角色的肩/背,背景为对面的另一角色正脸,两人必须不同)/cut to two-shot(双人镜头交代关系)/cut to medium-full(拉远至中全景制造疏离或震惊——禁止拉至全景/大全景)
  • 反应与细节类:cut to reaction shot(听者反应)/cut to detail cutaway(道具/身体局部细节特写)/cut to insert(插入镜头:如被握紧的信件、颤抖的杯盏等叙事道具)
  • 机位变化类:switch to low angle(仰拍强化压迫)/switch to high angle(俯拍强化弱势)/switch to side profile(侧面轮廓强化内心封闭)
    组合原则:同一对话段落内连续的内切镜应交替使用不同类别的动势(如push-in→reaction→detail cutaway→orbit),避免连续多镜都属同一类别(如连续三镜都是push-in)。对话越长,动势组合越须丰富。

[主体]: <<<image_角色>>>—[当前服装/状态,与设定图一致];[人物动作分解,按叙事顺序推进,主要动作→次要动作;
每个关键节拍须附带具体面部微表情描述(如"brows snap together, jaw tightens, eyes narrow with suppressed fury"),标注情绪强度词;3D CGI角色情绪需比真人更夸张才能被模型呈现;
每句台词必须搭配一个明确的肢体动作(gesture/body shift/head turn/gaze shift),动作与台词情绪合理匹配,禁止static standing dialogue;
动作幅度词库(强制): 每个关键动作必须附带一个标准化幅度词,从以下词库选取:large/sweeping/sharp/explosive/sudden/violent/forceful/dramatic/swift/wide。示例:"sweeps sleeve wide", "snaps head around", "stumbles half a step back", "slams fist onto the table"。禁止使用subtle/slight/gentle/mild/soft/faint等弱幅度词描述主要动作——3D CGI角色的小幅微动会被模型忽略或渲染成僵硬站姿,主要动作必须用强幅度词才能被准确呈现;
情绪-动作联动(强制): 动作幅度必须与情绪强度挂钩——高情绪强度(愤怒/震惊/悲痛/恐惧)必须配大幅度肢体动作(甩袖/猛然转身/后退半步/握拳/拍案/摔物等),用large/explosive/violent/sudden等词描述;低情绪强度(平静/试探/犹豫/克制)才允许小幅度动作,用measured/restrained等词描述。禁止出现"情绪激烈但身体不动"的割裂写法——当情绪标注为高强度时,对应肢体动作幅度必须同步升级,否则模型会渲染出表情狰狞但身体僵硬的违和画面;
情绪动态与放大(强制): 情绪不能全程平和——视频提示词中每个shot须有明确的情绪起伏,关键节拍处情绪强度必须显式升级(如suppressed anger→explosive fury, calm composure→visible shock),标注情绪变化路径;3D CGI角色情绪需比真人更夸张才能被模型呈现,平和段与爆发段的情绪反差须拉大,避免全程低情绪输出;
眼神互动(强制): 每句台词至少附带一个具体的眼神动作描述(gaze locked on/eyes dart to/avoids eye contact/glares at/glances sideways at/looks up to meet/drops gaze等),眼神方向与目标须明确写出;对话场景中须设计角色间的眼神互动——A说话时标注B的眼神反应(如B's eyes widen/B averts gaze/B holds stare),用眼神传递潜台词与角色关系张力。禁止空洞注视(empty stare)或无指向目光;
动作变化须合理,服务于情绪递进,不可为动而动;
避免写绝对秒数,用slow/quick/lingering描述节奏;台词落点后须描述至少1s的情绪延续动作(如"holds gaze, expression lingers, slight exhale"),禁止台词说完即切——须让角色保持在末尾情绪状态中呼吸,否则模型会在台词音轨结束时同步截断画面;
动作落点后停留(强制): 每个主要动作完成后须描述至少1s的姿态延续与余势(如"holds final pose, body lingers, slight exhale before next movement"),禁止动作刚做完即切——须让角色在收势姿态中停留呼吸,否则模型会在动作完成时同步截断画面导致动作仓促收尾;
动作完整性(强制): 每个动作节拍须写明完整的起势→执行→收势三段,不得只写"角色A转身"而省略转身的过程——模型需要完整的动作链条才能在时长内自然执行,省略过程会导致动作被压缩成瞬间跳变或仓促收尾]

武打shot动作描写(当shot为武打场景时): 按Storyboard武打设计的四段式结构(起手→接触→命中→结果)逐段写明动作分解;打击动作用sharp/explosive/impact等力度词描述,命中处可标注slow-motion(仅决胜一击);闪避、格挡、落空、反制动作须与命中动作交替出现,不得全部命中;镜头晃动仅标注在命中瞬间,不得写全程晃动。

动作完整链条(强制): 每个交手节拍必须写清六要素完整因果链——①谁先动(发起方+具体动作)→②谁防守(防守方+具体应对)→③接触点在哪里(兵器/身体接触的确切位置)→④谁被击中或格挡成功(交锋结果)→⑤受力结果是什么(身体/姿态的即时变化)→⑥段末人物停在什么状态(节拍结束时双方站位/姿态)。禁止用"二人激烈打斗""动作华丽"等笼统概括,必须逐拍拆解为可被模型渲染的具体动作序列。

[空间]: <<<image_场景>>>—[逐字继承该场景element scene的固定光影基调(光源 + 色温 + 氛围词),不得自行改写或换措辞;仅在剧情明确要求光影变化时方可调整并注明原因];[镜头相对空间描述:从镜头视角写明画内可见的背景元素、各角色相对位置(角色背后/左侧/右侧可见什么背景元素),以及哪些关键场景元素位于画面外或景深处不可见——禁止用"角色面向某物"的角色相对朝向写法]
参考帧引用(从第二个shot起强制): 若本shot纳入了从任意前序shot中挑选的空间一致性参考帧,须在空间段末尾追加参考帧绑定指令:<<<image_reference_frame>>>—Reference frame from a prior shot. IMPORTANT: This reference frame is for background layout and scene backdrop consistency ONLY. The camera angle, shot scale, framing, perspective, and camera movement described in the [摄影机] section above MUST take full precedence—do NOT replicate, copy, or imitate the reference frame's camera perspective, shot composition, lens height, or framing. The reference frame defines what background elements exist and where they are positioned in the scene; it does NOT define how the camera shoots them. Background elements and spatial layout behind/left/right of each character MUST match this frame. Specifically: [逐元素列出需保持一致的背景元素,如"the grand door visible behind Character A's back, the carved screen on the left side, the dragon throne platform in the far background"——这些元素须与空间校验中对照参考帧确认的结果一致]。Do not change or relocate these background elements; the scene backdrop must remain identical to the reference frame. However, the camera angle, shot scale, framing, and composition must follow the [摄影机] section instructions exclusively—the reference frame's visual perspective must not influence the camera language of this shot.
[音频]: [台词] [角色]: {台词原文} (with [情绪词] tone);[内心OS] [角色]: {(OS)OS原文} (with [情绪词] tone, no lip movement—inner voice only, character's mouth stays closed; facial expression must shift in sync with OS emotional arc—write specific micro-expression beats in [主体] section for the OS duration, e.g. brows slowly tighten, gaze hardens from soft to sharp);[音效] <[音效描述,紧贴对应动作]>;无音乐——BGM在audio_layer独立生成、后期混音,视频生成时须内嵌no background music

[禁止]: No subtitles, no background music, no text overlay, no watermark, no modern elements (modern clothing, electronic devices, plastic, modern architecture, etc.)—strictly ancient Chinese setting.

[时长]: Approximately [X]s

固定尾部规则:

  • 所有视频提示词末尾必须包含No subtitles, no background music, no text overlay, no modern elements——BGM在audio_layer独立生成,后期混音;台词/音效/内心OS可内嵌;现代元素禁止项覆盖服装、器物、建筑、用语等一切与古代背景不符的内容。
  • 使用Seedance 2.0内嵌格式:音乐 (...)、音效 <...>、台词 {...}(非项目语言需在括号前标明语言)、内心OS {(OS)...}(括号内只写原文,不加情绪标注)、片内字幕 【...】;台词和内心OS括号内只写原文,不加情绪标注。角色名写在花括号外,格式为 [角色]: {台词原文}、[角色]: {(OS)OS原文}。内心OS须标注"(OS)"前缀以区分开口台词,并在对应内切镜的[主体]描述中注明角色嘴唇不动(no lip movement, mouth stays closed),同时为OS时段设计具体的面部表情变化路径(须像台词表演一样逐拍写出表情节拍,与OS情绪递进同步,不得笼统写"微表情")。
  • 不依赖绝对时间戳(如 "0–3s")描述动作节奏,改用速度形容词。
6. 동영상 조립

跨镜空间一致性策略

  • 跨镜空间一致性在视频生成阶段(media_generator)已通过参考帧机制保障,组装阶段不重复执行选帧过滤。
  • 组装时如发现跨镜站位漂移或场景背景不一致,须回溯至 media_generator 重新截取参考帧或调整本shot空间锚点描述,不得跳过检查直接拼接。

剪辑节奏与过渡

  • 按Storyboard shot顺序组装;对话密集段落保持紧凑剪辑,情绪特写给足呼吸时间。
  • 同一物理空间内的相邻shot优先使用无缝硬切;跨空间切换可使用淡入淡出(0.3s以内),避免过度使用转场特效。
  • 注意180° 轴线规则:若两个相邻shot之间出现跳轴,在中间插入一个正面或过肩过渡shot,而非强行拼接。

音频混音层级

  • BGM(audio_layer)音量低于人声8–12 dB,作为底层垫乐;情绪高潮段可适当提升3–5 dB。
  • 台词/音效/内心OS已内嵌在视频轨中,组装时不额外叠加同类音频,避免重复。
  • 旁白(narration audio_layer)音量与台词层平齐,需在时间线上与对应shot对齐。
  • BGM与旁白/台词交叉淡化处理(crossfade 0.5s),防止硬切产生音量跳变。

常见生成失败与组装修复
现象原因修复方向角色外貌跨shot漂移提示词角色描述不够具体在Write the Prompt中强化设定图特征词,重新生成该shot跳轴相邻shot机位跨过180° 轴线插入正面或过肩过渡shot镜头时长偏差模型对绝对秒数不敏感改用slow/quick/lingering节奏词,组装时用时间线裁剪微调字幕乱入视频提示词未明确禁止强化no subtitles, no text overlay,重新生成首尾帧不衔接上一shot末帧人物已偏离空间锚点将本shot第一个内切镜设计为过渡镜,引导画面回到锚点

导出基准

  • 视频轨分辨率对齐生成时的最高规格(默认720p);如需提升,经super_resolution(MediaKit)上采样后再导出。
  • 帧率24fps;如需流畅慢动作片段,对目标shot单独执行帧插值(fps提升至60)后再并入时间线。