多宫格生视频
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
故事驱动型视频。使用 GPT Image(生成多面板网格帧)+ Seedance 2.5(分辨率 480p)。在关键阶段暂停以供用户确认;这是基于单次工作流的人机协作。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
完整视频的阶段逻辑和依赖关系:
- 编写
Final_Video_Spec.md(标题、类型、宽高比、时长、视觉风格、语言)→ text_editor。 - 生成故事板 (storyboard)(关键元素 key_elements、镜头列表 shot_list、音频层 audio_layers)→ storyboard_designer。故事板准备好后,扫描上下文以查找用户提供的或先前的资源(元素图像、背景音乐等);在生成步骤前,使用 media_generator 将每个资源绑定到匹配的故事板插槽中 → media_generator。
- 元素 (Elements) - 如果用户已上传元素资源,请将其绑定到
key_elements。否则,生成元素图像 → media_generator。 - 生成所有多镜头参考合成图(每个镜头调用一次): 对于每个镜头,编写一个图像提示词,将该镜头故事板中的每个内部剪辑/节拍放置在一个画布上,作为一个多镜头拼版 (multi-cut sheet)(清晰的单元格边界)。拼版上的空间平铺顺序并不定义剪辑顺序 —— 故事顺序仅由打印的剪辑索引携带(与故事板剪辑列表中的编号相同)。每个单元格的宽高比应与为该镜头 Seedance 生成锁定的宽高比相匹配(参见
Final_Video_Spec.md/ 流水线)。 - 生成所有镜头视频: 引用多镜头合成图像 → media_generator。
- 从故事板生成所有 audio_layers → media_generator。
- 资源准备好后进行最终组装;引导导出 → video_assembler。
依赖关系: 2→1;3→2;4→3;5→2,4;6→2;7→2,5,6。
何时暂停: 不要一次性运行所有步骤。在规格说明、故事板、元素、每批或每组多镜头合成图之后(或所有合成图完成后)、镜头视频之后以及音频之后停止 —— 在阶段之间与用户确认。使用卡片或 reply_to_user 进行审核。
注意: 用户提供的媒体:在重新生成前通过 media_generator 绑定;避免重复用户已经提供的内容。
2. 故事板设计
如何设计关键元素
- 根据需要包含关键主体(角色、物体)、关键地点/场景和关键道具。
- 角色: 多种外观(服装、年龄)→ 清晰描述(例如:外观 1:…;外观 2:…)。
- 色调/色彩参考: 如果项目使用全局调色或参考片段,请在生成时注明(保持参考时长实用,例如在 ~30 秒以内以进行色调提取)。
- 地点/场景: 重要物体和表演区域的放置和方向。
- 用户提供的资源: 描述必须与参考资料匹配;绝不能与所见或所听的内容相矛盾。
如何设计镜头
- 优先使用包含多个内部剪辑的长镜头:使用模型每个镜头的完整预算(每个镜头最多 30 秒),并在故事支持时,目标是每个镜头至少包含六个内部剪辑。在长镜头内部进行设计;剪辑节奏遵循叙事。不要将可以在一个长镜头中讲述的内容拆分为第二个镜头。每个镜头最多 30 秒(模型硬限制)。
- 每个镜头描述必须包括:
- 场景: 通过元素 ID 确定的地点(例如
[Element_Office_Noir])。 - 故事内容: 动作、动态、对话 —— 适用的情况下包含准确台词;通过元素 ID 引用角色。
- 摄影: 每个节拍的镜头尺寸、角度、摄影机移动。
- 场景: 通过元素 ID 确定的地点(例如
- 内部剪辑: 按时间顺序列表列出每个节拍,并分配在下游各处(拼版标签、提示词)使用的稳定剪辑索引(1…N)。此列表是该镜头单个 GPT Image 2 图像的剪辑清单:一个网格单元 = 一个内部剪辑(关键帧/状态)。在合成图上,拼版位置可以遵循任何布局;编辑器和模型依赖于每个单元格上书写的索引,而不仅仅是左右位置。
如何设计独立音频
- 背景音乐: 至少一个全局音轨;较长的片段可以使用带有
audio_id和范围的多个段落。 - 旁白: 类型选择
narration;语音、语调、确切脚本;镜头范围的layout_instruction。
3. 媒体生成
元素资源生成
- 元素图像: 根据需要使用 TextToImage / ImageToImage。推荐模型:GPT Image 2,2K,用于快速迭代并与其他流水线保持一致。
- 角色: 每个角色一张横向的16:9角色图,画面中从左到右包含:**半身特写+全身三视图(正、侧、背)**有助于 Seedance 读取身份和服装信息。
每个镜头的多镜头参考合成图 (GPT Image 2)
- 模型: GPT Image 2。分辨率: 2K(仅在简报或流水线明确要求时使用 1K / 4K)。
- 模态: 当存在元素参考图像时,优先选择 ImageToImage —— 传入角色/场景参考,使网格与锁定的外观相匹配。否则,使用带有完整视觉细节的 TextToImage。
- 规则 —— 一个镜头,一张图像,一次调用: 提示词必须在一次生成中描述完整的多镜头拼版和每个剪辑可见的内容。
- 单元格宽高比(优先级): 每个单元格的构图必须使其宽:高与 Seedance 该镜头规定的输出宽高比相匹配(例如 16:9、9:16、1:1 —— 无论
Final_Video_Spec.md/ 生成预设为该镜头锁定了什么)。不要将单元格压缩成与最终视频几何形状不符的极端长条;匹配比例可以减少将合成图用作参考时的重构漂移。 - 布局: 单个画布;N 个单元格(每个内部剪辑一张关键静帧);细的中性分隔线;空间排列灵活(行、列或不规则网格)—— 不要暗示阅读方向等于故事顺序。
- 剪辑顺序标记(必需): 在每个单元格的固定角落,打印故事板剪辑索引(1 … N,与剪辑清单编号相同)。索引是时间顺序的真理来源;拼版顺序是可选的。
- 剪辑数量: 保持 N 可读(通常一张拼版上每个镜头 2–6 个内部剪辑)。如果故事板有更多节拍,请在故事板阶段合并微小节拍或拆分镜头 —— 不要超过一个网格能清晰读取的数量。
- 风格要求: 每个镜头的多镜头合成图必须嵌入
Final_Video_Spec.md中定义的视觉风格(类型、外观、调色板、时代、参考资料)—— 将其一致地应用于该拼版上的所有剪辑。
最终镜头视频 (Seedance 2.5(分辨率 480p))
- MultiModalToVideo,Seedance 2.5,480p —— 使用与合成图单元格和规格说明中编码相同的宽高比。
- 参考: 该镜头的多镜头合成图(节拍路线图 + 与输出比例对齐的各剪辑几何形状);
- 标记: 在视频提示词中,根据正确的
<<<image_n>>>参考对每个角色进行标记(对应元素拼版);合成图是主要的静帧参考 —— 通过拼版上可见的编号剪辑索引 (1…N) 驱动运动,不要猜测拼版顺序(参见 write_the_prompt)。
4. 提示词撰写
A. 多镜头参考合成图提示词 (GPT Image 2)
意图: 此镜头的 N 张关键静帧的联系表 (contact sheet)。每个静帧位于一个单元格内,其宽高比与镜头的最终视频宽高比相匹配(例如与 Seedance 将使用的 16:9 或 9:16 相同)。该表是一个布局参考,并不声明磁贴按位置即为时间轴顺序。
单元格几何形状(优先级): 在提示词中明确说明每个单元格都被信箱格式化或裁剪为该镜头的目标输出宽高比(写明比例,例如 “每个子帧均为原生 16:9”)。这比磁贴在画布上的排列方式更重要。
剪辑顺序标记 / 故事板索引(必需): 每个单元格必须在固定角落(整个拼版采用一种惯例,例如左上角)显示与故事板剪辑清单中相同的剪辑编号(1 … N)。编辑顺序仅遵循这些数字 —— 磁贴的空间顺序是可选的,为了布局整洁可以选择任何空间排列。标记:极简、高对比度、小巧可读;属于制作元数据,除非剧本要求,否则不要作为画面内的标牌。
开头(必需的标准模板): 示例格式:“单张图像,一张 [N] 个分隔电影静帧的拼版。每个静帧的构图均为 [目标宽高比,例如 16:9],以匹配最终视频。单元格之间有细的中性分隔线。每个单元格在 [角落] 显示一个匹配故事板剪辑列表的小索引 [1…N]。写实真人电影风格;角色和服装保持一致。”(仅为整洁排列调整行列;不要要求从左到右作为故事顺序。)
按剪辑(按清单索引): 对于每个索引 1 … N,在一个流畅的英文段落中(或清晰编号为 Cut 1 / Cut 2 / … 并与图像上的标签匹配),仅描述在该静帧中可见的内容:主体姿势、环境、镜头尺寸、角度、光线、调色、镜头感 —— 与下方的 6 大核心规则对齐(以自然语言编织,不要在输出提示词中作为带标签的要点标题)。
6 大核心规则(全局 + 每个剪辑): 专业风格锚点(必要时使用作者电影/参考电影);构图与镜头;强调负补光/对比度的光线;克制的调色(除非用户有其他要求,否则单一主色调 ~90%;除非被要求,否则避免陈词滥调的霓虹洋红/青色冲突);渲染质量(纹理、细节);戏剧性节拍上的情绪与微表情。画面内文字: 仅在必要时将确切文案放在引号内。
B. 视频提示词 (Seedance 2.5(分辨率 480p))
以 live action 开头: 当主要参考是同一多镜头合成图像时,视频提示词以短语 live action 开头(开头的小写短语)。它会微妙地引导 Seedance 走向更真实的光线、皮肤/物体纹理和运动 —— 比插图或过度的“AI 光泽”静帧更接近真实影像。它不能替代具体的运动或摄影语言;它在正确的方向上偏向了模型解释。
然后: 针对元素参考(<<<image_1>>>,…)标记角色。对于合成图,明确说明:遵循故事板上打印的剪辑编号 1→2→…→N —— 不要假设拼版位置等于时间顺序。描述这些编号节拍上的时间流 —— 对动态部分使用 摄影机 → 主体 → 空间 → 音频:
- 摄影机 — 移动、重构、节拍间剪辑(根据索引对齐到 cut 1, cut 2, …,而不是根据网格位置)。
- 主体 — 动作、表情、逐拍描述。
- 空间 — 环境 / 深度 / 背景运动。
- 音频 — 对话
{...},音效<...>,仅在有意图时使用音乐(...);否则执行下方的静音规则。
多节拍 / 镜头 1,镜头 2: 您可以标记节拍 Cut 1, Cut 2, … 与合成图上的打印索引匹配。不要依赖精确的墙上时钟计时(例如“3.0–5.0s”);按数字而不是按拼版位置描述有序的节拍。
Seedance 包装器: (...) 音乐,<...> 音效,{...} 对话(若非项目语言则需标注语言),【...】 屏幕标题。
负面约束(始终适用):
- 故事板中的独立旁白轨道 → 不要将该旁白文本放入视频提示词中。
- 除非镜头确实需要内置配乐,否则几乎总是
no music。 - 始终
no subtitles(字幕在后期添加)。