yeha.ai
一覧に戻る

Sound-first video creation

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

用Seed-Audio1.0先制作并锁定声音轴,再以音频时间戳驱动故事板、关键帧和 Seedance 2.0 镜头生成。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

声音先行的完整视频流程:

  1. 通过 text_editor 建立 Final_Video_Spec.md,锁定题材、总时长、画幅、视觉风格、成片语言、对白语言,以及是否需要跨段保持角色音色。
  2. 先使用 storyboard_designer 制作初版故事板:定义 key_element、固定 shot 数量与顺序、每个 shot 的预期时长、audio_layer,以及逐镜头的 dialogue、旁白、环境音、音效和背景音乐计划。初版用于编排音频,不能在音频完成后以新增或删减镜头的方式迁就结果。
  3. 依据初版故事板,通过 media_generatorMultimodalToAudioSeed Audio 1.0 生成声音资产:
    • 总成片不超过 120 秒: 在无参考路径中优先一次生成完整声音时间轴,包含 dialogue、旁白、情绪表演、背景音乐、环境音与音效;再按已规划的 shot 范围裁出对应 final_audio。
    • 总成片超过 120 秒,或后续扩写至超过 120 秒: 按既定 shot 和叙事段落制作不超过 120 秒的声音段。先为每个主要 element character 生成或提取一句干净、有代表性的台词,注册并绑定为 key_element_audio;随后按固定的角色—参考音频对应关系生成分段 dialogue。背景音乐、环境音和音效使用无参考的 Seed Audio 1.0 路径生成,再混合为每个 shot 的 final_audio。
    • 由短片扩写为长片: 从既有音频中裁出干净的单人说话片段,按角色拆分并绑定为 key_element_audio;不得把多人说话、音乐或明显环境噪声的片段当作单一角色音色参考。之后沿用长片路径。
  4. 声音资产完成后,调用 resource_prepare_and_analyze 分析每个 final_audio,输出不可改写的声音事件清单:全片时间戳、事件类型、说话者、准确 dialogue/旁白、音乐、环境音、音效、停顿及并行关系。声音中没有的事件不得推断或补写。
  5. 建立视觉 key_element:优先绑定用户已有的角色、场景和道具资产;缺失时由 media_generator 生成。视觉 key_element 必须匹配已生成音频中的说话者与表演,不得修改已锁定的声音时间轴。
  6. 角色及其他视觉 key_element 就绪后,必须再次调用 storyboard_designer 更新故事板,随后才能生成视频。 以步骤 4 的实际声音时间戳为唯一依据,将既定 shot 精确映射到音频;不新增、删减、重排或插入视觉空镜来迁就音频。若音频的时长、事件或边界无法容纳既定 shot,应重新生成或裁切音频,不得改动锁定的 shot 结构。
  7. 更新故事板确认后,逐 shot 先生成一个 keyframe,再通过 media_generatorMultiModalToVideoSeedance 2.0,绑定该 shot 的 keyframe 和对应 final_audio,生成 final_shot。只有连续性极强时,才额外引用上一镜头的 reference_video。
  8. 通过 video_assembler 将 final_shot 与 final_audio 严格对齐;final_audio 是唯一的声音主轨,保留其全部 dialogue、旁白、音乐、环境音、音效与停顿,消除 final_shot 中重复生成的音轨。

依赖关系: 2→1;3→2;4→3;5→3;6→2,4,5;7→6;8→3,7。

何时暂停: 不要一次完成全流程。依次在规范定稿、初版故事板确认、音频资产与角色音色确认、视觉 key_element 确认、音频时间戳更新后的故事板确认、关键帧确认、镜头视频确认和最终组装前暂停,取得用户确认后再继续。

已有资产处理: 在生成前检查用户上传和项目既有素材。将匹配的 resource_id 注册为 asset_id,并绑定到正确的 key_element、shot 或 audio_layer;不得重复生成用户已提供的视觉或音频素材。

2. マルチモーダル分析
  • 分析用户提供或已生成的音频,区分 dialogue、narration、背景音乐、环境音、音效、停顿和并行声部;输出每项的开始与结束时间、持续状态、声源/说话者及准确可听内容。
  • 对最终 final_audio 建立按全片绝对时间排列的声音事件清单。只记录实际可听到的声音;不得补写未出现的台词、旁白、音效、音乐变化或情绪。
  • 标记可用于 element character 的 key_element_audio:只接受干净、清晰、单一说话者的片段,并记录说话者身份、语言/口音、音色、情绪、清晰度与可裁切范围;排除混有其他说话者、音乐或明显环境噪声的片段。
  • 当项目由短片扩写为长片时,从既有 final_audio 提取并按角色拆分音色片段,保留原始声音事件的绝对时间戳,供后续音色一致性绑定。
  • 分析视觉参考时,提取角色、场景和道具的可见特征,确保后续 key_element、keyframe 和 shot 描述不与用户素材矛盾。
3. 絵コンテ設計

初版故事板:先锁定结构,再制作音频

  • 定义必要的 element character、element scene 和关键道具;角色如有不同年龄、服装或状态,分别列出 Look。对每个有对白的 element character,定义稳定的身份、年龄感、声线、口音、常用情绪和说话节奏,并标记可用的 key_element_audio 候选。
  • 在生成音频前,固定 shot 的数量、顺序、叙事用途和预期时长。音频必须围绕这些 shot 制作;不得在后续以新增、删除、重排或插入无声/纯视觉 shot 的方式调整结构。
  • 规划每个 shot 的 audio_layer:写明必要的 dialogue、narration、背景音乐、持续环境音、音效、停顿与并行关系。每句 dialogue 必须标明 element character、准确台词、语气与节奏;旁白使用类型 narration,并在描述内定义 narration_speaker_profile、准确脚本和 layout_instruction。
  • 为音频驱动的 shot 预留 4 至不足 15 秒的连续时间范围,使一条对应的 final_audio 可完整作为视频音频参考;不得依靠生成后添加或缺失声音来凑时长。

音频返回后的强制更新:以实际时间戳重写镜头细节

  • 在角色及其他视觉 key_element 生成完成后,必须依据 final_audio 的声音事件清单更新故事板;最终音频是唯一的时间与内容真相。更新只细化既定 shot,绝不新增、删减、重排 shot,也不创建没有音频依据的额外镜头。
  • 每个 shot 的全局时间范围必须与 final_audio 连续、无重叠地对应,所有 shot 合起来恰好覆盖计划使用的声音时间轴。不得遗漏任何 dialogue、narration、音乐、环境音、音效或停顿,也不得描述音频中不存在的声音。
  • 在每个 shot 中同时记录全片绝对时间shot 内相对时间。相对时间以该 shot 起点为 0:例如 shot 2 覆盖全片 15.0–29.9 秒,声音事件位于全片 15.2–16.5 秒,则该 shot 内必须写为 0.2–1.5 秒。
  • 对每一项可听事件,按其时间戳写出同步画面:发生的角色动作、视线、表情、道具互动、镜头运动或剪辑节奏。dialogue、narration、音效、音乐变化和停顿的描述、顺序、持续范围与并行关系必须逐项吻合音频,不得把事件提前、延后、增添或省略。
  • 每个更新后的 shot 必须包含:绑定的 element scene/element character、全局与相对时间范围、按时间顺序的可见动作、与每个声音事件对应的画面节拍、景别、机位、运镜,以及一个代表该 shot 最强叙事瞬间的 keyframe 设计。keyframe 要包含首段动作所需的角色、场景、道具和构图,能作为该 shot 的视觉起点。
  • 若用户提供参考素材,关键元素、keyframe 和 shot 描述必须与其所见或所听一致,不得虚构相冲突的外形、身份或声线。
4. 素材生成

声音资产生成与绑定

  • 使用 MultimodalToAudio,模型为 Seed Audio 1.0。无图片、音频或 voice_id 参考时,使用文本到音频路径生成完整声音设计;单次音频最长 120 秒。
  • 对不超过 120 秒的项目,优先一次生成含 dialogue、narration、情绪表演、背景音乐、环境音与音效的主声音时间轴,再依照锁定 shot 范围裁切、注册并绑定每个 shot 的 final_audio。
  • 对超过 120 秒的项目,先为每个主要 element character 生成或绑定 key_element_audio。每次最多选用 3 条干净的角色音色参考,每条不超过 30 秒,并始终固定角色与参考音频的对应关系。
  • 使用音频参考或 voice_id 保持角色音色时,输入文本只能是实际 narration 或 dialogue 文本;不要在同一次请求中追加情绪、音效、音乐、环境或风格指令。需要这些声音时,另以无参考的 Seed Audio 1.0 请求生成,再混合为 shot 的 final_audio。
  • 如使用图片参考,同样只输入实际 narration 或 dialogue 文本;不要把图片参考与音频参考混用。已有或提取的角色音频应注册为 asset_id,并绑定到正确 element character 的 key_element_audio。

视觉 key_element、keyframe 与最终镜头生成

  • 在音频生成后建立视觉 key_element。图像使用 TextToImage;同一角色的不同外观或年龄优先使用 ImageToImage 并参考前次元素图像,以保持一致性。推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K
  • 每个角色生成一张水平并排的参考图:左侧为紧凑头像以锁定身份特征,右侧为全身照以锁定服装、发型、妆容、鞋子与轮廓。
  • 完成音频时间戳更新后的故事板后,为每个 shot 生成恰好一张 keyframe。优先使用 ImageToImage,绑定该 shot 涉及的 element character、element scene、道具和必要的前一 shot keyframe;keyframe 必须实现故事板定义的构图、视角、角色位置和首个可见动作,不得画入与 final_audio 不一致的事件。
  • 最终镜头使用 MultiModalToVideoSeedance 2.0,推荐分辨率 720p。每个 shot 必须绑定自身 keyframe 作为 <<<image_1>>>,以及与该 shot 时间范围一一对应的 final_audio 作为 <<<audio_1>>>;默认不再额外传入元素图,除非 keyframe 无法表达必要的角色、场景或道具一致性。
  • audio_infos 最多 3 条;每条音频超过 2 秒,合计少于 15 秒。优先使用一条混合完成的 shot final_audio,并让音频驱动 shot 保持在 4 至不足 15 秒,以完整、无裁减地传入对应音频。
  • 仅当当前 shot 与前一 shot 存在极高连续性时,额外引用前一镜头的 reference_video。视频必须遵从 final_audio 的时序、声源和节拍;不得要求生成音频中没有的对白、旁白、音乐、环境音或音效。
5. プロンプト作成

音频生成提示词(Seed Audio 1.0)

根据本次生成是否使用音色或媒体参考,选择对应的提示词格式。

1. 无参考的文生音频 — 优先推荐

优先在不使用 voice_id 的情况下生成音频。不要要求用户选择或提供 voice ID;进行纯文生音频生成时,不要调用 search_voice_id

仅当未提供 voice_id、参考音频或参考图像时使用此模式。

使用自然语言编写提示词:

  • 对于旁白或对话,需包含:
    • 说话人身份,使用相关的角色 element 或旁白标签;
    • 性别、年龄、角色及其他相关身份特征;
    • 声线质感、语气、情绪、口音、语速和吐字方式;
    • 停顿、呼吸、重音、犹豫和情绪变化等表演细节;
    • 会影响表达方式的场景或对话语境;
    • 需要说出的准确文本。

所有朗读文本必须忠实于已确认的剧本或故事板。清楚区分表演指令与实际需要说出的文本。

  • 对于音效,使用自然语言描述需要生成的声音。根据需要说明声音来源、动作、环境、强度、持续时间、距离、质感、时机及随时间发生的变化。除非所需声音本身包含人声,否则不要加入口头对话。

2. 使用音色或媒体参考生成

当已有有效的 Seed Audio voice_id、参考音频或参考图像,或用户明确要求使用这些参考时,使用此模式。

不要仅为了启用此模式而要求用户提供 voice ID。除非用户或当前项目已经指定参考,否则优先使用无参考的文生音频模式。

在此模式下,生成提示词只能包含需要合成的准确旁白或对话文本。

不要加入说话人、性别、年龄、身份、情绪、语气、口音、语速、声线质感、表演、场景语境、音效、音乐、环境音或风格描述。所提供的参考将负责提供音色或角色语境。

不要混用两种提示词格式。只要存在任意 voice_id、参考音频或参考图像,就必须启用仅保留朗读文本的规则。

示例:无参考的文生音频

主播1是一名成年男性播客主播,嗓音低沉、略带沙哑,吐字清晰,语速略微偏快。他先以平缓、自然的叙事语调说道:“我是觉得亏欠这种事情,也不是说一次两次可以补偿得了的,对吧?就是说是一个……是一个终生的事情。所以就是说。”说完后稍作停顿,略微加重语气,以肯定的口吻继续说道:“这一次去迪士尼,我主要当时想的就是还是这两个原因,就去了。”随后,他稍微提高语调,带着轻微惊讶和讲故事的口吻说道:“我跟你讲,去了之后其实我是有点、有点惊讶的。大家可以看那个视频,当时那个 vlog 里面,我真的挺惊讶,因为我们去的那天是特地挑了上海今年入冬以来最冷的一天。那天最低气温是零下三度。”

全局规则: 用户以中文交互时,提示词的说明文字以中文撰写;其中 narration 与 dialogue 的语言严格遵循 Final_Video_Spec.md 的成片语言设定。视频提示词只使用故事板中已按音频时间戳确认的可见内容;不另行补写声音、时间线或创作要求。

  • 所有视频提示词都已在输入中绑定 <<<image_1>>> 作为该 shot 的 keyframe,以及 <<<audio_1>>> 作为对应 final_audio。默认结构为:以 <<<image_1>>> 为画面关键帧进行视频创作,Use <<<audio_1>>> as the timing / soundtrack / voice reference。 后面只接故事板中已确认的简洁可见动作与镜头描述。
  • 当镜头动作、对白对应动作或声音事件较简单时,使用提示词结构:“以 @图像1 为画面关键帧进行视频创作,Use @音频1 as the timing / soundtrack / voice reference”,不需要重复解释其内容。
  • 复杂镜头按事件先后而非逐秒时间码写作:只写声音实际发生时的可见反应或动作。例如先写第一句 dialogue 对应的动作;在蒸汽尖锐嘶响时写角色转身展示机车;再写角色回望镜头并对应下一句 dialogue。不得增加 final_audio 中没有的对白、旁白、音乐或音效。
  • final_audio 已承担对白、旁白、音乐、环境音和音效时,不在视频提示词中重写台词全文,也不用音乐、音效或口头 dialogue 的包装符。仅在确有画面内标题时使用【准确文字】。
  • 始终加入 no music 与 no subtitles,避免重复生成音乐与字幕;存在 final_audio 时,不要求模型另行生成台词、旁白或音效。
6. 動画編集
  • 将每个 shot 的 final_shot 与绑定的 final_audio 按更新后故事板的全局及相对时间戳对齐;每个 dialogue、narration、停顿、音效节点、环境音变化和音乐转折都必须落在对应画面节拍上。
  • final_audio 是对白、旁白、背景音乐、环境音和音效的唯一主音轨。静音或显著压低 final_shot 内重复的生成声音,避免对白、音乐或音效叠加成回声;不得删减、替换或另补 final_audio 的声音事件。
  • 不增加故事板之外的空镜、补镜或额外声画段落。对跨镜头延续的环境声和背景音乐,仅在原 final_audio 已有的持续范围内做短淡入淡出,以保持声场连续。
  • 保持原始声音的节奏、台词完整性与声画同步;不要为迁就画面而随意截断关键对白、旁白或音效。若 final_shot 无法匹配锁定时间戳,应返工该 shot,不得改动 final_audio 或已确认的故事板时间映射。