Broadway aesthetic video
Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.
面向百老汇音乐剧风格视频项目,覆盖黄金年代、Fosse现代派、当代三大时期美学;元素图用Nano Banana Pro,镜头视频用Seedance 2.5,配乐用Suno 5,强调舞台化构图、群舞秩序与剧院声场。适用于需要电影级音乐剧画面、编舞语汇还原与管弦乐配乐的视频创作。
Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.
Complete workflow
1. Planning
全链路阶段逻辑与依赖:
- 通过 text_editor 先建立 Final_Video_Spec.md:标题、百老汇时期(黄金年代 / Fosse 现代派 / 当代)、画幅、时长意向、视觉风格、输出语言、Letterbox 视觉规格。在进入分镜与批量生成前锁定这些全局参数,作为后续所有阶段的共享锚点。
- 生成 Storyboard(key elements、shot 列表、audio_layer)→ storyboard_designer。Storyboard 完成后,扫描上下文与用户上传素材,将匹配的 key element 图、参考视频、配乐等通过 media_generator 绑定到对应 Storyboard 槽位。
- 建立元素:用户已上传角色 / 场景资产则直接绑定;否则生成所有元素图 → media_generator。同时为每个 element character 绑定 key_element_audio(声纹参考音频:用户已上传卡司录音则直接绑定,否则用 text to narration 生成短声纹样本),供步骤 4 镜头视频生成时通过 audio_infos 引用以保音色跨镜一致。
- 逐镜头生成最终视频:默认引用该镜头绑定的元素图;仅在与上一镜连续性极强时追加上一镜视频作 reference_video → media_generator。
- 生成全部音频层(百老汇配乐 BGM、旁白 / VO)→ media_generator。
- 全部素材就绪后做最终组装,引导导出 → video_assembler。
依赖: 2→1;3→2;4→3;5→2;6→3,4,5。
里程碑暂停: 不要一次性跑完全流程。每个主要里程碑(Spec 锁定、Storyboard 完成、元素完成、镜头视频完成、音频完成、组装完成)后停下,用卡片或 reply_to_user 邀请用户确认再继续。
用户素材优先: 步骤 3–5 中,凡用户已提供或已存在的媒体,先经 media_generator 绑定到正确 Storyboard 锚点,不要重新生成用户已给的内容。
2. Multimodal analysis
- 分析用户上传的百老汇参考素材(剧照、服装参考、编舞视频、卡司录音、海报),按"时期—色彩—服装签名—编舞语汇—灯光情绪"五个维度输出结构化理解,供 Storyboard 与提示词阶段复用。
- 编舞参考视频:标注可执行动作关键词(如 Fosse 的内收膝盖、爵士手、侧帽),并指出可被镜头直接复用的动作节拍点。
- 凡用户上传素材映射到 key_element 的,描述必须与所见 / 所听一致,不得与之矛盾。
3. Storyboard design
三大时期视觉语汇(每镜须声明所属时期并落实对应语汇):
- 黄金年代(1940s–60s): 饱和 Technicolor、对称构图、宏大群舞阵列、聚光白洗光、金红主色调;如拍摄一座镜框式舞台。
- Fosse 现代派(1960s–80s): Bob Fosse 语汇——内收膝盖、爵士手、侧帽 / 圆顶礼帽、黑色极简、斜角聚光、身体局部隔离动作;高对比黑白或单色红。
- 当代(1990s–至今): 朱莉·泰莫《狮子王》式——木偶 / 面具、仪式质感、层叠投影、大地与图腾色;以及《Six》式流行演唱会舞台、霓虹、现代极简。
key elements 设计:
- 角色须带"人设卡"锚定:颜色绑定 + 发型绑定 + 姿态绑定,一句话核心描述在所有分镜中保持不变更。
- 角色锚定示例:A 20-year-old blonde actress in a signature emerald green silk dress——在每镜提示词中复用此核心描述,全程不变更。
- 多造型 / 多年龄段角色须分条列出(造型 1:…;造型 2:…)。
- 场景描述须写明舞台方位与关键道具 / 表演区位置。
舞台角色原型参考(角色设计时对号入座):
| 原型 | 黄金年代 | Fosse 现代派 | 当代 |
|---|---|---|---|
| 主角 / 女一号 | Eliza Doolittle (My Fair Lady) | Charity (Sweet Charity) | Elphaba (Wicked) |
| 喜剧担当 | Ado Annie (Oklahoma!) | Amos Hart (Chicago) | Anne of Cleves (Six) |
| 魅力 / 反派 | Harold Hill (The Music Man) | Roxie Hart (Chicago) | Heather Chandler (Heathers) |
分镜设计:
- 每镜描述须含:场景(引用场景元素 ID)、故事节拍(角色动作、群舞队形、对话 / 表演,引用角色元素 ID,对话写明确切台词)、摄影(景别、机位高低、运镜如推拉 / 环绕 / 锁机)、灯光提示(聚光 / 洗光 / 追光)。
- 群舞镜头须明确队形与秩序(如"V 字阵列齐整推进"),避免无秩序堆叠——这是"像普通晚会"而非百老汇的首要成因。
- 镜头时长配合音乐剧乐句(4–15s),单镜不超过 15s(当前模型上限)。
跨镜音频设计:
- 至少一条全局 BGM 轨(百老汇管弦乐风格)。长片可在转折点拆分为多段(各自 audio_id 与跨度)。
- 若有旁白 (VO) 驱动叙事,在此设计 narration_speaker_profile、语气与确切脚本。
4. Media generation
元素图生成: TextToImage,推荐 Nano Banana Pro (Gemini 3 Pro Image) @ 2K。同一角色多造型用 ImageToImage,后造型引用前次生成以保一致;角色图采用"左半身肖像 + 右全身"横向并排版式锁定身份。
角色声纹绑定(key_element_audio): 为每个 element character 绑定 key_element_audio(角色声纹参考音频),以保证对白 / 演唱音色跨镜一致——用户已上传卡司录音则直接绑定,否则用 text to narration 生成一段该角色的短声纹样本并绑定。百老汇角色有大量对白与演唱,此绑定不可或缺。
镜头视频生成: MultiModalToVideo,推荐 Seedance 2.5 @ 480p。每镜引用:①该镜头绑定的角色 / 场景 / 道具元素图;②该镜头出场角色的 key_element_audio(通过 audio_infos 引用,使对白 / 演唱音色跨镜一致);③仅当与上一镜连续性极强时追加上一镜视频作 reference_video,通常跳过。
负面提示词规范: Seedance 2.5 及国产视频模型采用自然语言输入,不支持 --no / --negative 等 Midjourney / SD 语法,Flova 生成器也无独立负面输入框。负面意图须写成自然语言回避短语(如 "avoid CGI cartoon look, avoid amateur gala staging, avoid chaotic crowd")并入提示词正文,而非用 --no 拼接在尾部。
音频生成:
- BGM:百老汇管弦乐用 text_to_instrumental 或 lyrics_to_song,模型 Suno 5(注意:提示词含知名音乐人姓名时失败率高,避免点名真实作曲 / 歌手)。
- 纯器乐(如序曲)务必在 Suno 指定为 Instrumental,避免 AI 自行吟唱无意义人声。
- 旁白 / VO:用 text to narration,默认 MiniMax Speech 2.8 HD。
会员 / 分辨率: 480p 与 Seedance 2.5均为会员专属;非会员上限 480p。用户显式要求时不要因会员限制拒绝,交由下游处理。
5. Prompt writing
提示词组合公式(自然语言,一段成文,勿用分段标签):
[时期美学语汇] + [主体与动作 / 群舞队形] + [舞台环境与关键道具] + [灯光提示] + [摄影景别与运镜] + [色彩分级:单一主色约 90%]
- 时期语汇须落到可执行动作:Fosse 镜须写明"内收膝盖、爵士手、侧帽、身体局部隔离";当代泰莫镜须写明"木偶 / 面具、仪式图腾质感"。
- 角色描述须复用人设卡核心句,全程不变更。
- 负面提示词以"【负面提示词】"标注、写为自然语言回避短语并入正文;不要使用 --no / --negative 语法。
视频提示(Seedance 2.5 类):
- 参考图用 <<<image_1>>> 等占位符按角色绑定。
- 动作堆叠:运镜 → 主体动作 → 空间调度 → 音频提示(若另有旁白轨,勿在视频提示里重复完整旁白)。
- 常设回避:no subtitles(字幕后期处理);若 BGM 独立成轨,视频提示加 no music。
Suno 风格描述: 百老汇强依赖人声与管弦乐的对抗与融合,在 [Style Description] 中强调人声与乐器的空间纵深(如 "vocal forward over layered orchestral pit"),让声场更接近剧院;纯器乐段落务必启用 Instrumental。
6. Video assembly
轨道布局: 视频轨 V1–V3、音频轨 A1–A2。主画面 V1,群舞 / 特写叠加 V2–V3;BGM 入 A1,旁白 / VO 入 A2。
Letterbox: 上下黑边的电影级宽幕感作为视觉风格在生成阶段即落实(提示词写入 cinematic letterbox),不依赖导出时裁切——导出阶段画幅与分辨率不可调。
节奏与转场: 依音乐剧乐句与渐强对齐剪辑节奏;段落间用黑场切(blackout cut)模拟舞台换景。群舞高潮处保留完整乐句,不切碎。