Standalone visual assets with video option
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
支持先生成独立资产;在关键阶段暂停以获取用户确认;通过人机协作实现一次性工作流。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
完整视频的阶段逻辑和依赖关系:
- 根据用户请求生成图像/视频剪辑/音频剪辑 → media_generator。
如果用户要求基于已生成的资产继续制作完整剧本短片 - 盘点步骤 1 的独立输出: 列出所有已生成的图像/视频/音频(视情况使用
asset_id/resource_id),并附带单行内容摘要和类型(元素引用、B-roll 剪辑、音乐分轨等)。可选择对这些文件运行 multimodal_analyze_tool / resource_analyze_and_prepare,以明确结构和时间戳。切勿丢弃此列表——它是确定视频中必须出现哪些内容的唯一事实来源。 - 基于盘点结果和用户意图,编写
Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、语言、模型偏好) → text_editor。规格说明必须声明编辑锚定于现有的步骤 1 资产,除非用户明确授权替换它们。 - 生成故事板 (key_elements, shot_list, audio_layers) → storyboard_designer。硬性规则: 分镜脚本必须为步骤 1 中的每个独立资产分配到至少一个
key_element、shot_list条目或audio_layers/ 布局说明插槽中 —— 即围绕这些素材/图像构建叙事,而不是忽略它们去规划全新的情节。仅针对步骤 5–6 中指出的缺口(缺失的内容、连续性桥接)规划新的生成内容。 - (可选)将故事板的关键元素与步骤 1 的图像/元素资产以及分镜脚本进行比较;审计缺口,并仅生成或补全缺失的元素 → media_generator。
- (可选)将故事板与步骤 1 的视频资产以及分镜脚本进行比较;审计缺口,并仅生成或补全缺失的镜头 → media_generator。
- (可选)将故事板的
audio_layers与步骤 1 的音频资产以及分镜脚本进行比较;审计缺口,并仅生成或补全缺失的音频轨道 → media_generator。 - 在所有资源准备就绪后进行最终组装;然后引导用户导出 → video_assembler。
依赖关系: 2→1;3→2;4→2,3;5→1,4;6→1,4,5;7→1,4;8→4,5,6,7。
注意 —— 独立资产 → 故事板(关键): 你必须将用户在步骤 1 中提供的独立资产串联成一个连贯的故事(完整剧本/节奏弧线)。故事板负责排列镜头、桥接它们,并添加任何连接镜头或补充镜头,以确保最终的叙事短片流畅且完整——不要将先前的资产视为可选内容,也不要用全新的规划替换它们。在生成替换内容之前,通过 media_generator / manage_*_assets 绑定到分镜目标;如果步骤 1 中已经存在可接受的资产,切勿重新生成同一个片段。
何时暂停: 不要一次性完成所有步骤。在完成盘点 + 规格说明后暂停;在完成故事板后暂停(用户必须确认步骤 1 的资产已正确分配给镜头/元素);在进行缺口填充生成后暂停;最后在最终组装前暂停。使用卡片或 reply_to_user 在继续前邀请用户进行审查。
2. 멀티모달 분석
当步骤 1 产生视频或长音频,且分镜脚本在映射镜头前需要准确的入点/出点或结构标签时使用。输出结果将提供给步骤 2(盘点)和步骤 4(分镜脚本计时)。
3. 스토리보드 설계
续写模式 —— 来自步骤 1 的独立资产(用户继续制作完整电影时强制执行)
- 不要推倒重来: 情节、镜头列表和
key_elements必须整合步骤 1 中已经制作的资产。将每个此类资产视为已承诺的媒体:要么将其附加到关键元素(外观、环境、道具),要么附加到最终镜头(例如:“Shot_03 使用resource_id… 作为主角镜头/关键视觉”)。 - 显式绑定: 对于每一个步骤 1 的
asset_id/resource_id,记录它的使用位置(元素 ID 和/或shot_id,以及必要时的layout_instruction/ 时间线)。如果剪辑是B-roll(空镜头)或建立镜头,请注明;如果是主打产品或角色转身,请在不同镜头中引用同一个元素。 - 叙事跟随资产: 编写故事顺序和节奏,使这些剪辑/图像在序列中合乎逻辑 —— 你可以仅在盘点内容不足以涵盖整个叙事弧线时添加连接镜头或新元素;**除非用户明确要求重置,否则不要用全新的计划替换用户的独立作品。
- 新与旧的区分: 命名
key_elements时,复用与步骤 1 提示词/视觉相符的描述;仅为没有任何先前资产涵盖的角色添加新元素。
如何设计关键元素
- 始终包含关键主体(角色、物体等)、关键地点/场景和关键道具(如有)。
- 角色: 如果角色在项目中具有多种状态或外观(例如不同的服装、年龄),请在描述中清晰描述每个状态(例如 Look 1: …; Look 2: …)。
- 关键地点/场景: 描述场景中重要物体的位置和方向,特别是道具或主要动作/表演发生区域。
- 用户提供的资产: 如果用户提供了参考媒体并将其指定为关键元素,描述必须匹配该资产;不要与所显示或听到的内容相矛盾。
如何设计镜头
- 优先考虑带内部剪辑的长镜头(例如每个镜头 10–30 秒)。在镜头内部设计剪辑,而不是拆分成许多短镜头;剪辑频率应遵循故事节奏。每个镜头不要超过 30 秒(当前模型最大时长限制)。
- 每个镜头描述必须包括:
- 场景: 引用位置/布景(使用场景元素 ID,例如
[Element_Office_Noir])。 - 故事内容: 角色和关键物体的动作及动态;对话和表演。写出确切台词(口语对话或内心独白/画外音 OS)。使用元素 ID 引用角色。
- 镜头语言: 景别(例如远景、中景、特写)、摄像机角度(例如低机位、高机位)、摄像机运动(例如固定、平移、推拉)。
- 场景: 引用位置/布景(使用场景元素 ID,例如
- 当镜头有内部剪辑时: 在场景/设定之后,按剪辑顺序排列故事内容和镜头语言。使用明确的时间标记和剪辑标记,例如 “首先(0–4秒):[场景],[角色]执行X,特写。然后切到(4–8秒):… 然后切到(8–12秒):…”
如何设计独立音频
- 背景音乐: 设计至少一个全局背景音轨。如果视频较长(例如 3 分钟或更长)且有明显的幕间或转折点,你可以规划多个音乐片段(每个都有自己的
audio_id和范围)。 - 旁白: 如果使用画外音或旁白来解释或推进故事,请在此处设计(类型为
narration)。定义声音身份、语调和确切脚本;使用layout_instruction将其限定在相关镜头中。
4. 미디어 생성
元素生成
- 先绑定,后生成: 如果步骤 1 或分镜脚本已经指向某个元素或镜头的图像/视频/音频,请在工具链中绑定该
resource_id/asset_id,然后再进行新的生成。仅在分镜中标注为缺口时才生成。 - 图像: 如果用户已经为元素指定了资产(例如产品图、角色图),请直接使用;不要生成。否则,对于角色、场景、道具,使用 TextToImage(或项目约定)。对于同一角色的多种状态,使用 ImageToImage 引用第一张以保持一致性。建议按项目设定分辨率和模型(例如 2K);建议角色使用多视图以保持跨镜头一致性,并为每个视图分配单独的
asset_id并分别生成。- 推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K。角色元素建议使用三视图(正面/侧面/背面)以支持跨镜头一致性。
- Voice_references: 如果参考资料包含对话/旁白且分镜脚本要求复刻语音,则生成或指定一个
voice_reference音频剪辑(例如该角色/旁白者的样本),以便在生成旁白时匹配声音和语调。- 推荐模型:对于中文 (
zh) 内容:doubao。对于英文/全球 (en) 内容:elevenlabs。
- 推荐模型:对于中文 (
最终镜头视频生成
- 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p。引用该镜头的元素图像。
旁白和 BGM
- 旁白: 内容、声音、语调和时间严格按照分镜脚本执行;如果存在 “voice_reference” 资产,生成时请与之对齐。
- BGM: 风格和节奏需符合 Final Video Spec / 参考;时长和范围根据分镜脚本设定。
5. 프롬프트 작성
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
6. 동영상 조립
按分镜脚本和时间线顺序组装所有镜头、旁白轨道和 BGM;当剪辑准备就绪时引导用户导出。
如果最终镜头没有镜头内对话或旁白,请在编辑中将镜头/视频层的嵌入音频静音,并依靠音频层(如设计的 BGM/SFX),这样镜头生成的音效就不会与混音冲突。