Story-driven video
Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.
适用于所有故事驱动型视频。使用 Nano Banana + Seedance 2.5(分辨率 480p)。在关键阶段暂停以获取用户确认;通过“一次性(one-shot)”工作流程实现人机协作。
Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.
Complete workflow
1. Planning
完整视频的阶段逻辑与依赖关系:
- 编写
Final_Video_Spec.md(标题、类型、宽高比、时长、视觉风格、语言)→ text_editor。 - 生成故事板(关键元素、镜头列表、音频层)→ storyboard_designer。故事板准备就绪后,扫描当前上下文,查找用户提供或之前生成的、与故事板条目匹配的任何资产(例如元素图像、背景音乐)。对于每个匹配项,在进行生成步骤之前,通过 media_generator 将资产绑定并分配给相应的故事板插槽 → media_generator。
- 设置元素:
- 如果用户已经上传了元素资源(例如角色图像或引用的参考角色),直接将其绑定为相应 key_elements 的资产。
- 否则,为所有元素生成图像 → media_generator。
- 为每个镜头生成最终视频;1) 参考与该镜头相关的所有元素图像;2)(可选)如果当前镜头与前一个镜头具有极高的连贯性,则仅将前一个镜头的视频作为参考。(第4步)→ media_generator。
- 基于故事板生成所有音频层 → media_generator。
- 在所有资源就绪后进行最终组装;然后引导用户导出 → video_assembler。
依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。
何时暂停: 不要一次性运行所有步骤。在上述提到的每个关键阶段(例如:规范定稿后、故事板完成后、元素完成后、镜头视频生成后、音频生成后)停下来,在进行下一步之前与用户确认。使用卡片或 reply_to_user 邀请用户在继续之前进行审查。
注意: 用户提供或预先存在的媒体(主要影响第 3-5 步): 在填充生成内容之前,先通过 media_generator 将媒体绑定并分配到适当的故事板位置;避免重复生成用户已提供的内容。
2. Storyboard design
如何设计关键元素
- 确保包含关键主体(角色、物体等)、关键地点/场景以及关键道具(如有)。
- 角色: 如果角色在项目中具有多种状态或外观(例如不同的服装、年龄),请在描述中明确说明(例如:Look 1:...;Look 2:...)。
- 角色-音色参考: 生成或处理用户上传的音色参考素材,音频时长要在30s之内。
- 关键地点/场景: 描述场景中重要物体的位置和朝向,特别是道具或发生重大动作/表演的区域。
- 用户提供的资产: 如果用户提供了参考媒体并将其指定为关键元素,则描述必须与之匹配;不要与所见或所听到的内容相矛盾。
如何设计镜头
- 优先考虑带有内部剪辑的长镜头(例如,每个镜头 10–30 秒)。在镜头内部进行设计,而不是拆分为许多短镜头;剪辑频率应遵循叙事节奏。任何镜头不得超过 30 秒(当前模型的最大时长限制)。
- 每个镜头描述必须包括:
- 场景: 引用地点/场景(使用场景元素 ID,例如
[Element_Office_Noir])。 - 故事内容: 角色和关键物体的动作与动态;对话和表演。写出准确的台词(口头对话或内心独白/画外音 OS)。使用元素 ID 引用角色。
- 电影摄影: 景别(例如,远景、中景、特写)、摄像机角度(例如,低角度、高角度)、摄像机运动(例如,固定、平移、推入/拉出)。
- 场景: 引用地点/场景(使用场景元素 ID,例如
- 当镜头包含内部剪辑时: 在场景/设定描述之后,按照剪辑顺序列出故事内容和电影摄影。
如何设计独立音频
- 背景音乐: 设计至少一个全局背景音乐轨道。如果视频较长(例如 3 分钟或以上)并且有明显的间歇或转折点,您可以规划多个音乐片段(每个都有自己的
audio_id和范围)。 - 旁白: 如果使用大段旁白解说来推进故事,请在此处设计(将类型设置为
narration)。定义语音特征、语调和准确的脚本;使用layout_instruction将其限制在相关的镜头范围内。
3. Media generation
元素资产生成
- 图像: 使用 TextToImage。对于同一角色在不同外观或年龄下的表现,建议使用 ImageToImage;后续的外观应参考之前生成的图像以保持一致性。推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K。
- 角色图像: 为每个角色生成 1 张参考图像:使用水平并排布局。画面的左侧应显示角色的头像(紧凑构图,聚焦于面部,用于确认身份、肤色、眼睛、发际线);右侧应显示角色的全身照(展示全身,用于服装、发型、妆容、鞋子和轮廓)。
最终镜头视频生成
- 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p。
- 每个镜头的参考输入必须包括:
- 元素资产 — 对于镜头中的每个角色,参考故事板中的元素图像+根据需要参考场景/道具图像。
- 连贯性视频参考(可选)— 仅在当前镜头与前一个镜头具有极高连贯性时,才添加前一个镜头的视频参考。
4. Prompt writing
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成提示词 (TextToImage, ImageToImage)
所有图像提示词的通用原则
- 提示词不仅是描述“画面里有什么”,更像是一位真正的电影导演和调色师在指导团队。
- 使用通顺的自然语言描述场景内容(主体 + 行为 + 环境等),并使用简短的词组描述视觉美学(风格、颜色、光影、构图)。拒绝文学化的修饰:不要向 AI 解释角色的动机或内心状态(例如“仿佛他不关心这张照片”)。不要描述屏幕外或不可见的元素。只描述物理上可见的内容。
- 对于所有图像提示词(任何角色):您必须在所有目标风格中全局应用“电影级提示词的 6 大核心规则”,以确保电影质感。将提示词写成流畅、自然的英语描述,将这 6 条规则编织在一起。不要将它们输出为带有标签的章节:
- 专业风格术语:结合使用专业艺术或电影术语与风格术语以提高准确性。(例如,引入“作者”和特定的电影视觉锚点,使用
Neo-Noir style, David Fincher Style, inspired by Se7en作为风格锚点,而不是泛泛地说明Neo-Noir风格)。 - 构图与镜头:明确指出电影化构图(例如
Over-the-shoulder shot(肩后镜头)、Dutch angle(荷兰角))和景别(例如Close-up(特写)、Medium shot(中景))。 - 光影:详细说明主光,并强调“负补光”以增加对比度和戏剧感(例如
Strong chiaroscuro contrast(强烈的明暗对比)、dramatic interplay of light and shadow(光影的戏剧性交织)或deep facial shadows emphasizing facial structure(强调面部结构的深面部阴影))。 - 调色:使用高端好莱坞调色手法设定克制的色调(例如
deep teal-cyan shadows dominating 90%, zero warm fill(90% 的深青色阴影,零暖光填充)或muted watercolor wash(柔和的水彩洗色))。除非用户明确要求,否则永远不要使用红蓝霓虹冲突(例如禁止crimson bleed(深红晕染)、霓虹洋红 vs 青色)。将图像限制在 90% 左右的区域内仅使用一种主色调(例如深青色)——极度克制。 - 视觉渲染:描述内容的整体视觉质量和纹理(例如
fine rendering quality(精细渲染质量)、rich and intricate details(丰富错综的细节)、soft-focus effect with subtle Gaussian blur(带轻微高斯模糊的柔焦效果))。 - 氛围与潜台词:描述角色的“潜台词”和微表情,将动作定格在戏剧性的时刻(例如
oppressive suffocation(压抑的窒息感)、no mercy(冷酷无情)、predatory stillness(捕食者的静止))。拒绝生硬、摆拍的样子。对于无生命物体,描述其状态(例如Destined aura(宿命光环)、piercing gaze(锐利的目光)、cold and detached atmosphere(冷漠疏离的氛围))。 - 条件元素(仅在相关时包含):
- 准确的画面内文字:当相关时,如果场景中出现文字(例如屏幕文字),请自然地整合它。您必须用引号包裹需要渲染的确切文本内容以示强调。例如:'A neon sign in the background reads "DANGER".'。
- 专业风格术语:结合使用专业艺术或电影术语与风格术语以提高准确性。(例如,引入“作者”和特定的电影视觉锚点,使用
当目标角色是 key_element(关键元素)时
提供清晰、详细的元素视觉定义,以便在镜头间保持一致。提示词结构应围绕:
- 主体与身份:清楚说明元素是什么 — 角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体型、种族(如果指定)、显著特征、声音)。
- 特征细节:具体描述该元素的关键视觉特征。优先考虑在镜头间必须保持一致的特征:
- 角色:面部特征(眼睛形状、下颌线、发型/颜色)、妆容与造型(如果相关)、服装与配饰(材质、剪裁、颜色、状况)。
- 道具/物体:形状、材质、颜色、尺寸、状况(新/风化/损坏)、独特的标记。
- 氛围/情感基调:描述定义场景的情感潜台词(例如张力、忧郁、希望、宁静、不安、温暖、压迫、恐惧、怀旧、孤立、亲密)。
- 为了保持画面整洁,不要在画面中生成文字。
视频生成提示词
在 视频 提示词中,为每张参考图标记每个角色,以便 Seedance 能正确读取面部和造型。使用产品图片标签(<<<image_1>>>, <<<image_2>>> 等)。
然后按照以下 Seedance 顺序(摄像机 → 主体 → 空间 → 音频)追加运动/动态提示词:
- 在编写提示词时遵循此顺序:
- 摄像机 — 运动或镜头/剪辑变化(例如
static → push-in(从静止到推入)、cut to new angle(切到新角度)、orbit(环绕)、pan(摇镜头))。 - 主体 — 动作和表情(谁做了什么,面部动作节拍)。
- 空间 — 位置或环境变化(相对于空间的主体或摄像机位置;背景运动;深度/布局转换)。
- 音频 — 对话(如有)、音效,以及如果模型中没有音乐时的备注(见下文)。
动作细节
- 相关时,基于 特定的身体部位:手、腿、头、肩膀等。
- 添加 程度:幅度、速度、强度(例如 slowly raises one hand(缓慢举起一只手),snaps head left(头迅速向左转),pushes hard off the ground(用力蹬地))。
- 对于一个提示词中的多个节拍,列出 主要动作,然后是次要动作(按故事的时间顺序)。
多节拍与“镜头 1 / 镜头 2”(官方指南) - 当工具接受长提示词时,您可以在单次生成中标记 镜头 1, 镜头 2, 镜头 3 用于 摄像机或故事节拍 的序列。
- 精确的时钟计时(例如“0–3 秒”、“3–6 秒”)无法可靠执行 — 不要强制按确切秒数范围分割提示词,也不要编写明确的逐秒计划(例如“在 2 秒时...”,“从 5-8 秒...”)。描述 按顺序发生的事情,而不是按时间安排的镜头列表。
可选润色(当简报是电影级真人拍摄时): 您可以根据其他策略规则添加轻微的手持微抖动或微妙的胶片颗粒感 — 保持其从属于上述四层顺序。
特殊角色约定(针对 Seedance 2.5(分辨率 480p))
Seedance 接受自然语言提示词;这些包装符有助于模型区分 音乐、音效、对话 和 屏幕标题文字: - 音乐(描述正在播放的内容):
(...),例如 (fast-paced rock playing in the background)(背景中播放着快节奏摇滚乐)。 - 音效:
<...>,例如 <distant dog barking>(远处的狗叫声)。 - 口头对话:
{...},例如 {Hello, world} — 如果台词 不 是项目原始语言(例如英语短片中的日语独白),请在花括号前 标注语言,例如 Says in Japanese:{こんにちは}。不要保留故事版规划中的引号,{...}内只包含对话文字。 - 屏幕标题/章节/字幕文字:
【...】,例如 【Chapter One: Departure】(第一章:启程)。
- 摄像机 — 运动或镜头/剪辑变化(例如
注意: 您必须始终在提示词中包含以下负面约束,以确保后期制作的输出干净:
- 如果分镜脚本表明该镜头有单独的旁白音轨,请不要在视频提示词中写入旁白文本,以避免音频冲突。
- 为防止模型添加不需要的背景音乐,您几乎应该始终包含 'no music'。
- 字幕是在后期剪辑时添加的,因此您必须始终包含 'no subtitles'。