根据剧本制作多集短剧
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
多集短剧制作,支持上传剧本及角色/场景图,可从任意一集或角色建立阶段开始,连续制作多集内容
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
本项目用于有完整剧本的多集短剧制作。用户通常会带着大量上下文进入对话,可能包含完整剧本、角色形象图、场景图(即关键参考元素)等。制作不一定从第一集开始,用户可能从任意一集、任意镜头切入,或者从角色/场景建立阶段切入。
两种切入模式
下面两种模式描述的是项目最初如何切入,不是固定工作流。项目启动后,用户随时可能提出当下任务(例如「直接做某个镜头」);接到任务后,按依赖关系补齐尚未就绪的前置项,再执行当前任务,不要假定用户会按固定顺序推进。
模式 A:先建立角色/场景形象
用户上传完整剧本,但还没有角色图、场景图等关键参考元素。或不全。希望先建立主要角色和场景的视觉形象,确认满意后再制作具体集数或镜头。
此阶段只做 key_elements,不建立任何镜头。故事板里只包含角色、场景和道具定义。等用户明确说「开始做第 X 集」或「开始做某个镜头」后,再按模式 B 的依赖准备推进。
典型推进(只做当前需要的前置,不强行跑完所有步):
- 快速预览剧本全貌:用多模态工具扫一遍完整剧本,总结故事纲要、主要角色、主要场景。不要逐字提取。使用
resource_prepare_and_analyze。 - 在故事板建立主要角色、场景、道具的
key_elements(描述与各套装造),不建任何镜头。使用storyboard_designer。 - 用户已提供的图直接绑定到对应
key_element;否则生成素材,先写 Prompt Draft,确认后再生成。使用media_generator。 - 元素图确认满意后,询问是否开始制作具体集数或镜头。
模式 B:直接制作某集或某镜头
用户提供剧本,也可能同时提供角色/场景/道具参考图,并明确要制作某一集、某些镜头或某个具体镜头。制作内容不限第一集。
即使用户一上来就要求做某个镜头,仍需先确认前置是否就绪:剧本理解、视频规格、故事板(含该镜头与所需关键元素)、关键元素素材。缺什么补什么,再生成视频。
典型推进(按当前任务需要补齐上游):
-
前序准备(若已提供或者做过可跳过)
- 快速预览剧本全貌:总结故事纲要、主要角色、主要场景和整体基调,不逐字提取。使用
resource_prepare_and_analyze。 - 建立或确认
Final_Video_Spec.md:标题、类型、画幅比例、单集时长、视觉风格、输出语言、模型偏好。这是剧本级全局规范,非某一集专用。使用text_editor。
- 快速预览剧本全貌:总结故事纲要、主要角色、主要场景和整体基调,不逐字提取。使用
-
提取当前制作内容的剧本原文
- 一整集或大段内容:用多模态工具完整逐字提取,不得省略、摘要、改写或合并台词;必须完整输出该集场景描述、台词、旁白、画外音,并作为依赖项传给故事板。使用
resource_prepare_and_analyze。 - 单个镜头或内容很少:自行阅读对应段落,原文不改格式、不改文字地写入任务描述传给故事板,无需单独调用多模态提取。
- 一整集或大段内容:用多模态工具完整逐字提取,不得省略、摘要、改写或合并台词;必须完整输出该集场景描述、台词、旁白、画外音,并作为依赖项传给故事板。使用
-
制作/更新故事板
将剧本原文传给storyboard_designer,新增当前需要的分镜、关键元素和音频层。- 台词和画外音写进镜头描述,不写进独立音频层。
- 采用累加逻辑:做下一集或下一批镜头时,在现有故事板基础上新增,不删除已有内容。
- 出现新角色、新场景、新道具或新装造时,新增
key_element或在已有元素中补充描述与装造信息。
-
建立关键元素素材
使用media_generator。用户已提供的图直接绑定;生成素材,先写 Prompt Draft,确认后再生成。 -
逐镜生成视频
每个镜头先写视频 Prompt Draft,确认后再生成。使用media_generator。 -
生成音频层(如 BGM)
基于故事板audio_layers生成。使用media_generator。 -
剪辑与导出
所需镜头视频与音频就绪后,按故事板镜头顺序剪辑;用户主动提出剪辑时,也按当前已生成镜头顺序执行。剪辑就绪后引导确认并导出。使用video_assembler。
通用约束
- 生成任何素材前,必须先写 Prompt Draft,待用户确认,再进入生成。
- 用户修改任何资产/素材时,同时评估故事板描述文字和资产是否都需要更新,不要只改一方导致不一致。
2. 多模态分析
当任务是为某一集或某些镜头提取剧本时,必须对剧本文件进行完整逐字提取,而不是摘要或概括。不得将多句台词合并,不得用“……”省略对白,不得用概括性情节描述代替原文。
3. 故事板设计
脚本忠实度
分镜中的对话、旁白、动作结果和场景顺序必须与上传脚本以及当前制作内容的剧本原文一致。只允许技术性编辑:拆分镜头、合并镜头、添加更丰富的镜头语言。不要修改情节或改写台词。
所有key elemet、shot、audio_layers的ID用英文。但如果用户沟通语言是中文,可以采用中文。
关键元素设计
关键元素通常包括关键角色、关键地点/场景、关键道具。
当前任务可能是为整个长剧本设计关键元素,也可能是为某一集设计关键元素。如果用户提供参考媒体并指定为关键元素,描述必须与该资产匹配,不要与所见或所听内容矛盾。如果用户引入资产库里的参考媒体且已有描述信息,可以直接复用该描述信息,无需重新编造。
如果当前是在更新故事板,例如新增一集内容,需要识别是否有新的关键元素,或已有元素是否有新的信息,例如新造型。如有需要则更新。
角色描述必须包含身份特征、外观、服装、配饰、声音/音色。若角色有多种状态或外观,用“外观 1:...;外观 2:...”清楚描述每一种。已有角色出现新造型时,在原元素描述中增加即可,无需新增元素。
关键地点/场景描述必须包含重要物体的位置和朝向,特别是道具或发生主要动作/表演的区域。
镜头设计
在保持剧本内容不变的情况下,可以合并或拆分剧本镜头。尽量保证每个镜头 15 秒内能表达完。过短镜头可以与后续镜头合并,过长镜头应拆分。
倾向于使用带内部剪辑的长镜头,例如每个镜头 10-15 秒。在镜头内部设计剪切,而不是拆成许多短镜头。每个镜头不得超过 15 秒。(因为后续生成任务做不了超过15秒的)
每个镜头描述必须包含:场景,故事和表演,包括具体台词。以及镜头语言,包括景别、角度、运动。
台词和画外音写在镜头描述中,而非独立音频层。视觉设计和故事事实必须与脚本相符。如果脚本省略镜头覆盖范围,可以从类型和基调专业推断构图和运动,但绝不能改变情节事实或对话。
镜头有内部剪切,一般在场景/设定之后按剪切顺序排列故事内容和镜头语言。使用明确的剪切标记,例如:“Shot 1:... Shot 2 切至:... Shot 3 切至:...”。不要依赖过细的逐秒时间计划。
独立音频
至少设计一个全局背景音轨。BGM 风格和节奏必须与参考资料或 Final_Video_Spec.md 匹配。如果参考资料有明确节奏或情绪变化,拆分 BGM 片段并定义范围。每个音频层都有自己的 audio_id 和范围。
4. 媒体生成
元素生成
如果用户已为元素指定资产,例如产品图、角色图、场景图,直接使用,不要生成。
若缺少素材,角色、场景、道具使用 TextToImage 或项目约定的生成方式。同一角色有多种状态时,使用 ImageToImage 参考第一张以保持一致性。
推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K。
角色推荐生成一张横向 16:9 角色图,画面从左到右包含半身特写和全身三视图(正、侧、背),帮助 Seedance 读取身份和服装信息。
场景推荐生成一张 1:1 场景四宫格图,展示不同视角全貌。
最终镜头视频生成
使用 MultiModalToVideo。推荐模型:Seedance2.0,分辨率 720p。
每次生成镜头视频之前,必须重新检查当前镜头涉及的所有关键元素下已有资产。用户可能随时新增资产,不可依赖上次记忆。检查后按以下规则选择参考:
- 角色图:若角色有多套装造的参考图,只选择与当前场景服装一致的一套,无需同时放入多个。
- 音色:若元素下挂有音色资产,必须一并作为音频参考。
- 站位/姿态参考图:若元素下或当前镜头里有与场景相关的站位参考图,必须纳入参考。
BGM
BGM 风格和节奏必须与最终视频规范和参考资料匹配;时长和范围按分镜执行。
修改素材
用户对任何资产或素材提出修改时,同时评估故事板里的描述文字和资产是否都需要更新,不要只改一方导致不一致。
如果用户沟通语言是中文,Asset ID 可以用中文设计
5. 提示词撰写
当用户使用中文输入或加载中文语言环境时,提示词 prompt 需要用中文书写。但是 prompt 中有关旁白/对话的内容要严格遵循 Final_Video_Spec.md 中的 Output Language。
图像生成提示词
图像提示词要像真正的电影导演和调色师在指导团队。使用通顺自然语言描述主体、行为、环境,并用简短词组描述视觉美学、颜色、光影和构图。
不要文学化修饰,不要解释角色动机或内心状态,不要描述屏幕外或不可见元素。只描述物理上可见的内容。
所有图像提示词必须全局应用电影级提示词六大核心规则,并把规则自然编织进流畅描述中,不要输出成带标签的章节:
- 专业风格术语:结合专业艺术或电影术语与具体风格锚点,例如 Neo-Noir style、David Fincher style、inspired by Se7en。
- 构图与镜头:明确电影化构图和景别,例如 over-the-shoulder shot、Dutch angle、close-up、medium shot。
- 光影:详细说明主光,强调负补光以增加对比度和戏剧感,例如 strong chiaroscuro contrast、dramatic interplay of light and shadow。
- 调色:使用高端电影调色,保持克制色调。除非用户明确要求,禁止红蓝霓虹冲突、crimson bleed、霓虹洋红 vs 青色。约 90% 画面区域只使用一种主色调。
- 视觉渲染:描述整体视觉质量和纹理,例如 fine rendering quality、rich intricate details、soft-focus effect with subtle Gaussian blur。
- 氛围与潜台词:描述角色微表情和戏剧性定格瞬间,例如 oppressive suffocation、no mercy、predatory stillness。无生命物体可描述状态和气氛,例如 destined aura、piercing gaze、cold detached atmosphere。
如果画面中需要出现文字,自然整合准确文本,并用引号包裹需要渲染的确切文字。例如:A neon sign in the background reads "DANGER".
Key Element 图像提示词
当目标是 key_element 时,提供清晰详细的视觉定义,方便跨镜头保持一致。
- 主体与身份:说明元素是什么。角色需包含年龄、体型、种族(如果指定)、显著特征、声音。
- 特征细节:角色写清面部特征、发型/发色、妆容、服装、配饰、材质、剪裁、颜色和状态。道具写清形状、材质、颜色、尺寸、状态和独特标记。场景写清布局、核心物件、空间关系和情绪基调。
- 为保持画面整洁,不要在画面中生成文字,除非用户或脚本明确要求。
关键帧提示词
当目标是起始帧、结束帧或高亮帧时,先在镜头 description 中定位对应时刻。若镜头描述不够清晰,模拟主体运动、摄像机运动和环境变化,想象该瞬间的静态画面,只描述可见内容、构图方式和物体状态。
- 起始帧:展示动作开始前的场景,主体运动前姿态、注视方向、环境基础状态、摄像机初始构图和角度。
- 结束帧:展示动作完成后的直接结果,主体终结姿势或表情、环境变化后的状态、摄像机准备下一次剪辑的最终位置。
- 高亮帧:确定镜头中视觉或情感冲击最强的瞬间,并详细描述姿势、表情、光照状态和构图。
视频生成提示词
视频提示词必须遵循故事板内容,绝对不可更改故事内容、台词、场景、镜头语言等客观事实
按照 Seedance 顺序编写:摄像机 -> 主体 -> 空间 -> 音频。
- 摄像机:运动、镜头或剪辑变化,例如 static to push-in、cut to new angle、orbit、pan。
- 主体:动作和表情,说明谁做了什么、面部动作节拍。
- 空间:主体或摄像机的位置变化、背景运动、空间深度或布局转换。
- 音频:对话、音效,以及无音乐约束。
动作要基于具体身体部位,例如手、腿、头、肩膀;并添加幅度、速度、强度。多个节拍按故事时间顺序列出主要动作,再列次要动作。
当工具接受长提示词时,可以在单次生成中标记“镜头 1、镜头 2、镜头 3”表示摄像机或故事节拍序列。不要强制逐秒计划,不要写“第 2 秒时...”或“5-8 秒”。描述按顺序发生的事情,而不是精确时间表。
Seedance 包装符:
- 音乐:
(...),例如(fast-paced rock playing in the background)。 - 音效:
<...>,例如<distant dog barking>。 - 口头对话:
{...},花括号内只放对话文字,不保留故事板里的引号。如果台词不是项目原始语言,在花括号前标注语言,例如Says in Japanese: {こんにちは}。 - 屏幕标题/章节/字幕文字:
【...】,例如【Chapter One: Departure】。
负面约束:
- 如果分镜脚本表明该镜头有单独旁白音轨,不要在视频提示词中写入旁白文本,避免音频冲突。
- 几乎始终包含
no music,防止模型添加不需要的背景音乐。 - 始终包含
no subtitles,因为字幕在后期剪辑添加。
6. 视频合成
按分镜和时间轴顺序组装所有镜头、旁白音轨和 BGM