yeha.ai
一覧に戻る

Broadway aesthetic video

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

面向百老汇音乐剧风格视频项目,覆盖黄金年代、Fosse现代派、当代三大时期美学;元素图用Nano Banana Pro,镜头视频用Seedance 2.5,配乐用Suno 5,强调舞台化构图、群舞秩序与剧院声场。适用于需要电影级音乐剧画面、编舞语汇还原与管弦乐配乐的视频创作。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

全链路阶段逻辑与依赖:

  1. 通过 text_editor 先建立 Final_Video_Spec.md:标题、百老汇时期(黄金年代 / Fosse 现代派 / 当代)、画幅、时长意向、视觉风格、输出语言、Letterbox 视觉规格。在进入分镜与批量生成前锁定这些全局参数,作为后续所有阶段的共享锚点。
  2. 生成 Storyboard(key elements、shot 列表、audio_layer)→ storyboard_designer。Storyboard 完成后,扫描上下文与用户上传素材,将匹配的 key element 图、参考视频、配乐等通过 media_generator 绑定到对应 Storyboard 槽位。
  3. 建立元素:用户已上传角色 / 场景资产则直接绑定;否则生成所有元素图 → media_generator。同时为每个 element character 绑定 key_element_audio(声纹参考音频:用户已上传卡司录音则直接绑定,否则用 text to narration 生成短声纹样本),供步骤 4 镜头视频生成时通过 audio_infos 引用以保音色跨镜一致。
  4. 逐镜头生成最终视频:默认引用该镜头绑定的元素图;仅在与上一镜连续性极强时追加上一镜视频作 reference_video → media_generator
  5. 生成全部音频层(百老汇配乐 BGM、旁白 / VO)→ media_generator
  6. 全部素材就绪后做最终组装,引导导出 → video_assembler

依赖: 2→1;3→2;4→3;5→2;6→3,4,5。

里程碑暂停: 不要一次性跑完全流程。每个主要里程碑(Spec 锁定、Storyboard 完成、元素完成、镜头视频完成、音频完成、组装完成)后停下,用卡片或 reply_to_user 邀请用户确认再继续。

用户素材优先: 步骤 3–5 中,凡用户已提供或已存在的媒体,先经 media_generator 绑定到正确 Storyboard 锚点,不要重新生成用户已给的内容。

2. マルチモーダル分析
  • 分析用户上传的百老汇参考素材(剧照、服装参考、编舞视频、卡司录音、海报),按"时期—色彩—服装签名—编舞语汇—灯光情绪"五个维度输出结构化理解,供 Storyboard 与提示词阶段复用。
  • 编舞参考视频:标注可执行动作关键词(如 Fosse 的内收膝盖、爵士手、侧帽),并指出可被镜头直接复用的动作节拍点。
  • 凡用户上传素材映射到 key_element 的,描述必须与所见 / 所听一致,不得与之矛盾。
3. 絵コンテ設計

三大时期视觉语汇(每镜须声明所属时期并落实对应语汇):

  • 黄金年代(1940s–60s): 饱和 Technicolor、对称构图、宏大群舞阵列、聚光白洗光、金红主色调;如拍摄一座镜框式舞台。
  • Fosse 现代派(1960s–80s): Bob Fosse 语汇——内收膝盖、爵士手、侧帽 / 圆顶礼帽、黑色极简、斜角聚光、身体局部隔离动作;高对比黑白或单色红。
  • 当代(1990s–至今): 朱莉·泰莫《狮子王》式——木偶 / 面具、仪式质感、层叠投影、大地与图腾色;以及《Six》式流行演唱会舞台、霓虹、现代极简。

key elements 设计:

  • 角色须带"人设卡"锚定:颜色绑定 + 发型绑定 + 姿态绑定,一句话核心描述在所有分镜中保持不变更。
    • 角色锚定示例:A 20-year-old blonde actress in a signature emerald green silk dress——在每镜提示词中复用此核心描述,全程不变更。
  • 多造型 / 多年龄段角色须分条列出(造型 1:…;造型 2:…)。
  • 场景描述须写明舞台方位与关键道具 / 表演区位置。

舞台角色原型参考(角色设计时对号入座):

原型 黄金年代 Fosse 现代派 当代
主角 / 女一号 Eliza Doolittle (My Fair Lady) Charity (Sweet Charity) Elphaba (Wicked)
喜剧担当 Ado Annie (Oklahoma!) Amos Hart (Chicago) Anne of Cleves (Six)
魅力 / 反派 Harold Hill (The Music Man) Roxie Hart (Chicago) Heather Chandler (Heathers)

分镜设计:

  • 每镜描述须含:场景(引用场景元素 ID)、故事节拍(角色动作、群舞队形、对话 / 表演,引用角色元素 ID,对话写明确切台词)、摄影(景别、机位高低、运镜如推拉 / 环绕 / 锁机)、灯光提示(聚光 / 洗光 / 追光)。
  • 群舞镜头须明确队形与秩序(如"V 字阵列齐整推进"),避免无秩序堆叠——这是"像普通晚会"而非百老汇的首要成因。
  • 镜头时长配合音乐剧乐句(4–15s),单镜不超过 15s(当前模型上限)。

跨镜音频设计:

  • 至少一条全局 BGM 轨(百老汇管弦乐风格)。长片可在转折点拆分为多段(各自 audio_id 与跨度)。
  • 若有旁白 (VO) 驱动叙事,在此设计 narration_speaker_profile、语气与确切脚本。
4. 素材生成

元素图生成: TextToImage,推荐 Nano Banana Pro (Gemini 3 Pro Image) @ 2K。同一角色多造型用 ImageToImage,后造型引用前次生成以保一致;角色图采用"左半身肖像 + 右全身"横向并排版式锁定身份。

角色声纹绑定(key_element_audio): 为每个 element character 绑定 key_element_audio(角色声纹参考音频),以保证对白 / 演唱音色跨镜一致——用户已上传卡司录音则直接绑定,否则用 text to narration 生成一段该角色的短声纹样本并绑定。百老汇角色有大量对白与演唱,此绑定不可或缺。

镜头视频生成: MultiModalToVideo,推荐 Seedance 2.5 @ 480p。每镜引用:①该镜头绑定的角色 / 场景 / 道具元素图;②该镜头出场角色的 key_element_audio(通过 audio_infos 引用,使对白 / 演唱音色跨镜一致);③仅当与上一镜连续性极强时追加上一镜视频作 reference_video,通常跳过。

负面提示词规范: Seedance 2.5 及国产视频模型采用自然语言输入,不支持 --no / --negative 等 Midjourney / SD 语法,Flova 生成器也无独立负面输入框。负面意图须写成自然语言回避短语(如 "avoid CGI cartoon look, avoid amateur gala staging, avoid chaotic crowd")并入提示词正文,而非用 --no 拼接在尾部。

音频生成:

  • BGM:百老汇管弦乐用 text_to_instrumentallyrics_to_song,模型 Suno 5(注意:提示词含知名音乐人姓名时失败率高,避免点名真实作曲 / 歌手)。
  • 纯器乐(如序曲)务必在 Suno 指定为 Instrumental,避免 AI 自行吟唱无意义人声。
  • 旁白 / VO:用 text to narration,默认 MiniMax Speech 2.8 HD

会员 / 分辨率: 480p 与 Seedance 2.5均为会员专属;非会员上限 480p。用户显式要求时不要因会员限制拒绝,交由下游处理。

5. プロンプト作成

提示词组合公式(自然语言,一段成文,勿用分段标签):
[时期美学语汇] + [主体与动作 / 群舞队形] + [舞台环境与关键道具] + [灯光提示] + [摄影景别与运镜] + [色彩分级:单一主色约 90%]

  • 时期语汇须落到可执行动作:Fosse 镜须写明"内收膝盖、爵士手、侧帽、身体局部隔离";当代泰莫镜须写明"木偶 / 面具、仪式图腾质感"。
  • 角色描述须复用人设卡核心句,全程不变更。
  • 负面提示词以"【负面提示词】"标注、写为自然语言回避短语并入正文;不要使用 --no / --negative 语法。

视频提示(Seedance 2.5 类):

  • 参考图用 <<<image_1>>> 等占位符按角色绑定。
  • 动作堆叠:运镜 → 主体动作 → 空间调度 → 音频提示(若另有旁白轨,勿在视频提示里重复完整旁白)。
  • 常设回避:no subtitles(字幕后期处理);若 BGM 独立成轨,视频提示加 no music。

Suno 风格描述: 百老汇强依赖人声与管弦乐的对抗与融合,在 [Style Description] 中强调人声与乐器的空间纵深(如 "vocal forward over layered orchestral pit"),让声场更接近剧院;纯器乐段落务必启用 Instrumental。

6. 動画編集

轨道布局: 视频轨 V1–V3、音频轨 A1–A2。主画面 V1,群舞 / 特写叠加 V2–V3;BGM 入 A1,旁白 / VO 入 A2。

Letterbox: 上下黑边的电影级宽幕感作为视觉风格在生成阶段即落实(提示词写入 cinematic letterbox),不依赖导出时裁切——导出阶段画幅与分辨率不可调。

节奏与转场: 依音乐剧乐句与渐强对齐剪辑节奏;段落间用黑场切(blackout cut)模拟舞台换景。群舞高潮处保留完整乐句,不切碎。