Multi-person interview
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
用于多人对话/采访视频。在关键阶段暂停以供用户确认;基于单次流水线的人机协作。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
阶段逻辑与依赖关系:
- 编写
Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、语言、模型偏好)→ text_editor。 - 生成故事板(key_elements、shot_list、audio_layers)→ storyboard_designer。
- 为所有元素生成图像 → media_generator。
- 根据故事板生成所有 audio_layers:旁白和背景音乐 (BGM) → media_generator。
- 为每个镜头生成一张关键帧图像 → media_generator。
- 为每个镜头生成最终视频;参考该镜头的关键帧(第5步)和音频(第4步) → media_generator。
- 所有资源就绪后进行最终合成;然后引导用户导出 → video_assembler。
依赖关系: 2→1;3→2;4→2;5→2;6→4,5。
暂停时机: 不要一次性运行所有步骤。在上述每个关键阶段(例如:规格确定后、分镜脚本完成后、元素生成后、镜头视频生成后、音频生成后)停下来,与用户确认,然后再进行下一步。使用卡片或 reply_to_user 在继续之前邀请用户进行审查。
2. 絵コンテ設計
如何设计关键元素
- 始终包含关键主体(人物、物体等)、关键地点/场景和关键道具(如有)。
- 人物: 如果人物在项目中具有多种状态或外观(例如不同的服装、年龄),请在描述中清楚地说明(例如:Look 1:...;Look 2:...)。包含人物的语音/音色,以便下游音频能够匹配。
- 关键地点/场景: 描述场景中重要物体的位置和朝向,特别是道具或主要动作/表演发生的区域。
- 用户提供的素材: 如果用户提供了参考媒体并将其指定为关键元素,描述必须与该素材相符;不要与所见或所听到的内容相矛盾。
如何设计镜头
- 每个镜头描述必须包含:
- 场景: 参考地点/布景(使用场景元素 ID,例如
[Element_Office_Noir])。 - 故事内容: 人物和关键物体的对话与表演。写出准确台词(口语对话或内心独白 / OS)。通过元素 ID 引用人物。
- 景别: 交替使用双人镜头 (two-shot)、越肩镜头 (OTS)、发言者单人镜头,以在不破坏连贯性的前提下增加变化。
- 场景: 参考地点/布景(使用场景元素 ID,例如
- 非对话镜头: 反应镜头、观众切镜或主持人点头——依然需要关键帧元素;如果该镜头中没有台词,则仅使用关键帧生成视频(不进行口型同步音频调节)。
- 重叠/轮流发言: 如果两个角色在一个镜头中交替对话,分镜脚本必须拆分为两个镜头。
如何设计独立音频
- 背景音乐: 设计至少一个全局背景音轨。如果视频较长(例如3分钟或以上)且有清晰的段落划分或转折点,您可以规划多个音乐片段(每个都有自己的
audio_id和范围)。 - 旁白: 始终在分镜脚本中定义旁白/配音层(类型
narration):语音身份、语调、准确脚本以及限定于相关镜头的layout_instruction。此策略中的每个项目都必须包含此层。
3. 素材生成
元素图像生成
- 使用 TextToImage。对于处于不同状态或年龄的同一角色,建议使用 ImageToImage;后续的外观应参考之前生成的形象,以保持一致性。
- 推荐模型:Nano Banana 2(Gemini 3.1 Flash Image),分辨率 2K。对于人物元素,建议使用三视图(正面/侧面/背面)以支持跨镜头的连贯性。
关键帧图像生成(每个镜头)
- 使用 ImageToImage。推荐模型:Nano Banana Pro(Gemini 3 Pro Image),分辨率 2K。参考图像必须包括 (1) 该镜头的相关元素图像,以及 (2) 对于每个镜头,同一场景中之前镜头中最相似的关键帧(批量生成时,批次中的后续镜头参考之前的镜头)作为额外参考,以加强连贯性——例如人物在场景中的站位、他们如何面对彼此以及表情:这些是元素参考所无法定义的细节。
最终镜头视频生成
分镜脚本设计了纯叙事表演 + 口型同步演唱表演的组合。
- 对于对话镜头:
使用 ImageToVideoByAudio。推荐模型:OmniHuman1.5,分辨率 1080p。参考关键帧 + 对齐的音频片段。 - 对于非对话镜头:
使用 FirstFrameToVideo。推荐模型:Kling 3.0,分辨率 1080p。参考该镜头的关键帧图像。
4. プロンプト作成
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成提示词 (TextToImage, ImageToImage) 所有图像提示词的通用原则
- 提示词不仅是描述“画面中有什么”,更像是一位真正的电影导演和调色师在向团队下达指令。
- 使用连贯的自然语言描述场景内容(主体+行为+环境等),并使用短语描述视觉美学(风格、颜色、光影、构图)。不要使用文学化的废话:不要向 AI 解释角色的动机或内心状态(例如:“仿佛他不在乎这张照片”)。不要描述画面外或不可见的元素。只描述物理上可见的内容。
- 对于所有图像提示词(任何角色):您必须在所有目标风格中全局应用“电影级提示词的 6 大核心规则”,以确保电影质感。将提示词写成流畅、自然的英文描述,将这 6 条规则交织在一起。不要将它们输出为带标签的章节:
- 专业风格术语:结合使用专业的艺术或电影术语和风格术语,以提高准确性。(例如:引入电影导演和特定的电影视觉锚点,使用 Neo-Noir 风格、David Fincher 风格,以《七宗罪》(Se7en) 为风格锚点,而不是泛泛地说明 Neo-Noir 风格)。
- 取景与镜头:明确说明电影取景(例如:越肩镜头、荷兰式倾斜镜头)和景别(例如:特写、中景)。
- 灯光:详细说明主光,并重点强调“负光”以增强对比度和戏剧性(例如:强烈的明暗对比、光影的戏剧性相互作用,或强调面部结构的深层阴影)。
- 调色:使用高端好莱坞调色来设定克制的调色板(例如:深青蓝阴影占 90%,零暖色补光或柔和的水彩感)。除非用户明确要求,否则永远不要使用红蓝霓虹冲突(例如禁止深红溢出、霓虹品红 vs 青色)。将画面限制为单一主色调,占据画面约 90%(例如深青蓝)——极度克制。
- 视觉渲染:描述内容的整体视觉质量和纹理(例如:精细的渲染质量,丰富而错综复杂的细节,带有微妙高斯模糊的柔焦效果)。
- 情绪与潜台词:描述角色的“潜台词”和微表情,将动作定格在戏剧性的瞬间(例如压抑的窒息感、冷酷无情、掠夺性的静止)。拒绝僵硬、摆拍的姿态。对于无生命物体,描述它们的状态(例如:宿命感、穿透力的目光、冷漠且疏离的氛围)。
- 条件元素(仅在相关时包含):
- 画面内准确文字:如果场景中出现文字(例如屏幕文字),请自然地整合。您必须用引号将场景中需要呈现的准确文本内容括起来以示强调。例如:'背景中的霓虹灯牌写着“DANGER”。'。
当目标角色为 key_element 时
提供清晰、详细的元素视觉定义,以便在不同镜头中保持一致。提示词结构围绕:
- 主体与身份:清楚说明该元素是什么——角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体格、种族(如指定)、显著标志、声音)。
- 特征细节:具体描述元素的关键视觉特征。优先考虑必须在各镜头中保持一致的特征:
- 角色:面部特征(眼型、下颌线、发型/颜色)、妆容和造型(如相关)、服装和配饰(材质、合身度、颜色、状态)。
- 道具/物体:形状、材质、颜色、尺寸、状态(新/风化/损坏)、独特的标记。
当目标角色为 keyframe 时
- 镜头构图:构图时让说话主体在静止画面中清晰可辨——首选胸部以上的中近景或特写,画面中脸部占比大且清晰。避免使用广角建立镜头和全景全身镜头,因为脸部太小会导致模型难以与条件音频对齐。
- 镜头语言:交替使用双人镜头、越肩镜头和活跃发言者的单人镜头,以在不破坏连贯性的前提下增加变化。
视频生成提示词
对于基于关键帧参考的视频生成,提示词的主要目的是描述“变化”和“动态”。重点在于赋予场景生命力,而不是重新描述参考图像中已经存在的静态细节。高质量的视频提示词必须描述场景在以下维度上的动态演变:
- 基本提示词结构:提示词 = 主体+动作,背景+动作,摄像机+动作等。使用简单、直接的措辞和短句结构;模型将根据您的描述及其对图像的理解进行扩展。
- 角色/物体动态:描述主体自身的动作,包括表情、动作的变化,以及相对于摄像机的任何自发性朝向改变(例如:角色从侧面转为直面摄像机)。如果主体保持静止,您必须明确描述其静态姿势或状态(例如:角色完全静止,直视前方)。
- 动作限定词:描述动作时,始终指定程度副词(例如:快速地、剧烈地、大幅度、高频率)。
- 多个连续动作:模型对时间性的、多节拍动作以及具有不同动作的多个主体反应强烈。您可以写:主体1 + 动作1 + 动作2,或主体1 + 动作1,主体2 + 动作2等。按顺序排列动作;模型将根据画面进行扩展和解读。对于 ImageToVideoByAudio:当使用音频驱动(口型同步/表演)模型时,提示词必须遵循上述维度,同时还必须遵守以下独特结构:
- 您必须明确描述由音频驱动的角色状态(例如:说话、唱歌、边哭边说、说唱)。
- 最佳实践模板:摄像机运动 + 发言者情绪 + 说话状态 + 具体肢体动作 + (可选)背景事件。
- 示例:摄像机跟随一名男子转身面对镜头并向前走,同时带着陶醉、深情的表情唱歌。他先用双手触碰衣领,然后双臂大幅张开并向后仰头,显得完全沉浸其中。背景中的光影随节奏跳动。
注意: 您必须始终在提示词中包含以下负面约束,以确保后期制作的输出干净:
- 如果分镜脚本指示该镜头有单独的旁白音轨,不要在视频提示词中写入旁白文本,以避免音频冲突。
- 为防止模型添加不需要的背景音乐,您几乎应该始终包含 'no music'。
- 字幕是在编辑过程中添加的,因此您必须始终包含 'no subtitles'。
5. 動画編集
- 对话优先: 将
audio_layers视为旁白和对话的主控;在时间轴上静音每个生成的视频剪辑中嵌入的音频,以免语音重复或与编辑混音不同步。 - 可选 BGM(轻柔的谈话节目背景音);在对话时压低音量;避免在说话声下出现冲突的音符。
- 收紧镜头之间的停顿以保持谈话节奏;如果节奏感觉平淡,添加反应镜头插入。