yeha.ai
Back to templates

Story-driven reusable video storyboard

Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.

适合故事驱动的视频,使用 Seedance 2.5(分辨率 480p)生成。成片视频提示词**直接复用**故事板的镜头描述——适合希望在生成前先把提示词锁定的创作者。

Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.

Complete workflow

1. Planning

完整成片阶段逻辑与依赖:

  1. 撰写 Final_Video_Spec.md(标题、类型、画幅比、时长、视觉风格、语言)→ text_editor
  2. 生成故事板(关键元素、镜头列表、音轨层)→ storyboard_designer。故事板就绪后,扫描当前上下文中用户已提供或此前已生成、且与故事板条目匹配的素材(如元素图、背景音乐)。每有一处匹配,在进入生成步骤前通过 media_generator 绑定并指派到对应故事板槽位 → media_generator
  3. 配置元素:
    • 若用户已上传元素素材(如角色图或参考角色),直接绑定为对应 key_elements 的素材。
    • 否则,为所有元素生成图像 → media_generator
  4. 逐镜头生成成片视频 → media_generator
  5. 依据故事板生成全部音轨层 → media_generator
  6. 素材齐备后进行最终合成;再引导用户导出 → video_assembler

依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。

何时暂停: 不要一次性跑完所有步骤。在上述每一关键阶段后停下(如规格定稿后、故事板完成后、元素完成后、镜头视频生成后、音频生成后),与用户确认后再进入下一步。可用卡片或 reply_to_user 邀请用户审阅后再继续。

说明: 用户自带或已存在的媒体(主要影响步骤 3–5):在填入生成内容之前,先通过 media_generator 绑定并指派到故事板对应位置;避免对用户已提供的素材做重复生成。

2. Storyboard design

如何设计关键元素

  • 须包含 关键主体(角色、物体等)、关键场地/场景,以及 关键道具(若有)。
  • 角色: 若同一角色在项目中有多种状态或造型(如不同服装、年龄),在描述中写清(如 Look 1:…;Look 2:…)。写明角色的 嗓音/音色
  • 关键场地/场景: 说明场景中重要物体的位置与朝向,尤其是承载主要动作或表演的区域与道具。
  • 用户提供的素材: 若用户提供参考媒体(图或语音)并指定为关键元素,描述 必须与素材一致;不得与画面或可闻内容矛盾。

如何设计镜头

  • 优先长镜头 + 镜内分切(如单条 10–30 秒)。在 单条镜头内 设计,不要拆成大量碎短镜头;剪切频率跟叙事节奏。单条镜头不得超过 30 秒(当前模型时长上限)。
  • 每条镜头描述须包含:
    • 场景: 指明场次/空间(使用场景元素 ID,如 [Element_Office_Noir])。
    • 故事内容: 节拍、对白、表演;写出 准确台词(对白或内心独白/OS)。角色用元素 ID 引用。
      • 主体与物体动态: 写清每个主体 自身 的动作——表情变化、肢体动作、相对镜头的 主动 朝向变化(如从四分之三侧脸转向正对镜头)。若须静止, 明确写出(如僵立、目光钉死)——勿与「未写调度」混淆。
      • 动作质感: 为动作加 程度修饰(快慢、轻重、幅度、频率等),使表演在故事板上无歧义。
      • 多拍调度: 同一段落内多个动作按 严格时间顺序 列出;多角色或关键物体并行动作时,用清晰配对:主体1 + 动作1(+ 动作2…)、主体2 + 动作2,便于后续视频继承明确调度。
    • 电影摄影(镜语):
      • 景别与构图: 景别(如 WS、MLS、MS、MCU、CU、ECU),以及双人中景、过肩、带前景单人、主构图等按需。
      • 角度与高度: 平视、仰、俯、顶视、荷兰角等。
      • 摄影机运动: 用自然语言写清意图。常见类别:环绕、航拍、变焦、摇移、跟拍/追踪、手持,以及镜内 重新构图或切换。基于画面的视频模型依赖明确镜语:镜头 在动 要用直白说法写出;不动 须写 static camerafixed shot,避免后续误以为有漂移。
      • 手持微动与胶片质感(写实/实拍默认): 除非 Final_Video_Spec 或该镜明确要求监控锁机、运动控制级精度、干净 CGI、产品级锐利或非写实风格化动画,否则可写 轻微 有机不完美以免过度顺滑——如 极轻手持微颤自然轻微漂移微弱呼吸感(幅度小且连续,非剧烈晃镜)。画面 可酌情:细 35mm 颗粒轻微化学胶片颗粒轻模拟噪点;除非风格要求,避免粗大数码噪、强雪花、VHS 质感。固定机位时不要写手持用语。
      • 镜头与光学气质(必要时): 广角/长焦气质、浅景深/深景深——仅用白话,且与板上其它部分锁定的观感一致。
  • 镜内分切: 交代场景/环境后,按 每一次分切 排列 故事内容与镜语,并写清 时间(如:先(0–4s):… 再(4–8s):… 再(8–12s):…)。
    • 单镜内复杂或多阶段动作: 必须 严格按顺序 描述——可用 First / Then / Finally分段时间(如 0–3s / 3–6s / 6–9s),或同一条 take 内跳景别/角度时的 cut to。与成片提示词的顺序一致,规划与生成共用 同一份 权威故事板正文。

如何设计独立音轨

  • 背景音乐: 至少一条全局 BGM。片长较长(如 3 分钟以上)且有明显段落或转折时,可规划多段音乐(每段自有 audio_id 与覆盖范围)。
  • 旁白(narration 轨): 仅当 故事 必须 靠旁白推进叙事,且旁白为 长段并跨越多镜 时使用——不要用于单节拍上一两句短 OS。在此设计:音色特征、语气、完整文稿。用 layout_instruction 标明旁白 从头到尾覆盖哪些镜头区间
3. Media generation

元素素材生成

  • 图像: 使用 TextToImage。同一角色不同造型或年龄建议 ImageToImage;后续造型应参考先生成的外观以保持一致。推荐模型:Nano Banana 2(Gemini 3.1 Flash Image),分辨率 2K。角色元素优先 三视图(正/侧/背)以利于跨镜一致(注意三视图是一张图)。

最终镜头视频生成

  • 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p
  • 提示词拼装: 将已定稿故事板中该镜头的 Shot description 作为创意正文 原样拷贝——不要另写一套成片提示词。
  • 每条镜头的参考输入须包含:
    1. 元素素材——本镜出现的角色、场景、道具的全部元素图。
    2. 连续性视频参考(可选): 仅当本镜头与前面某一镜在叙事或画面上存在非常强的关联(如同一拍跨剪、同一场景与调度线索、同一角色线索紧密衔接等),才把此前已完成的其中一条镜头视频纳入参考;若无此类强关联,不要为了「连贯」而强行加参考。
4. Prompt writing

图像生成提示词(TextToImage、ImageToImage)

全体图像提示词的通用原则

  • 提示词不只是「画面里有什么」,而要像导演与调色师在给团队下指令。
  • 用连贯自然语言写场景内容(主体 + 行为 + 环境等),用短语写视觉美学(风格、色彩、光线、构图)。忌文学空泛: 勿向模型解释动机或内心(如「仿佛他不在乎这张照片」)。勿写画外或不可见信息,只写画面上 物理可见 之物。
  • 对所有图像提示词(任意用途):必须在 所有 目标风格下全局套用 电影感提示词六条核心规则,写成 流畅的英文 叙述,不要用标签分段输出:
    • 专业风格用语: 结合作者性、具体影片视觉锚点等专业用语提高准确度(如用 Neo-Noir style, David Fincher Style, inspired by Se7en 之类锚点,而非泛泛写 Neo-Noir)。措辞须与 Final_Video_Spec.md(video spec)中的视觉风格及整体观感一致;
    • 构图与镜头: 明确写出电影构图(如过肩、荷兰角)与景别(如特写、中景)。
    • 光线: 写清主光并强调「负空间光」以拉开反差与戏剧性(如强明暗对照、光影交织、面部阴影强调结构)。
    • 调色: 用高端院线级调色思路约束色系(如阴影大面积青绿、几乎无暖填充;或Muted watercolor wash)。除非用户明确要求,避免红蓝霓虹对撞(禁用 crimson bleed、洋红对 cyan 等)。约 90% 画面控制在单一主导色相(如深青绿)——极度克制。
    • 画面呈现: 整体画质与质感(如细腻渲染、丰富细节、柔焦与高斯模糊感等)。
    • 情绪与潜台词: 写角色潜台词与微表情,卡在戏剧性节拍(如压迫、无情、捕食般的静止)。拒绝僵硬摆拍。静物则写其气质与氛围。
    • 条件项(仅必要时):
      • 画面上可读文字: 若画面内需出现文字,自然融入;须渲染的 确切文案 用引号包起来强调,例如背景霓虹写着 "DANGER"

当图像用途为 key_element
给出清晰、详细的元素视觉定义以便跨镜一致。围绕以下组织:

  • 主体与身份: 说明元素类型——角色、道具、场景或生物。角色须含界定性特征(年龄、体格、若指定的族裔、辨识特征、嗓音)。
  • 特征细节: 具体写关键视觉特征,优先写跨镜必须一致的点:
    • 角色: 五官(眼型、下颌、发型/发色)、妆造(若有关)、服装与配饰(材质、合身度、颜色、新旧)。
    • 道具/物体: 形状、材质、颜色、尺寸、状态(新/旧/破损)、标志性记号。
    • 情绪基调: 场景的潜在情绪(紧张、忧郁、希望、宁静、不安、温暖、压抑、恐惧、怀旧、疏离、亲密等)。

当目标为关键帧(起始帧、结束帧或高光帧)
先在镜头描述中找到对应瞬间——开场状态、收束状态、或视觉/戏剧张力最强的瞬间——以此为据。若描述未写清该瞬间,则在脑中推演该镜(主体运动 + 机位运动 + 环境变化),想象那一帧冻结时的画面并补足细节。无论哪种方式,只描述 单一静止瞬间:可见内容、构图方式、万物状态。

  • 起始帧: 动作开始前——主体的预备姿态与意图(重心、视线、肢体预加载)、环境的基准状态、镜头的初始景别与角度。
  • 结束帧: 动作落定后——主体的结束姿势或表情、环境变化后的状态、镜头停留以便下一剪的位置。
  • 高光帧: 该镜视觉或情绪最强的单帧(撞击顶点、信息击中面部、主题凝结的构图等)。将该帧冻结并极尽具体地写清——姿态、表情、光效、构图——使其可单独作为该镜最具感染力的静帧。

视频生成提示词

  • 创意正文: 与故事板该镜头的镜头描述保持一致不要再重新写一套视频提示词。
  • 语言: 提示词用中文写,但是台词/旁白/歌词如果有,这些用视频本身的目标语言(video spec里写了)
  • 风格: 视频提示词里须包含风格描述,严格沿用 Final_Video_Spec.md(video spec)里约定的视觉风格及相关观感说明;全片保持一致,
  • 参考占位符(格式): 当引用到参考图时,插入多模态/参考图占位符(如 <<<image_1>>><<<image_2>>> …)。放在应对应绑定的节拍。
  • 后期友好约束(整条提示词拼好后务必追加):
    • 若故事板为该镜头配置了 独立旁白轨不要 把旁白稿贴进视频提示词(避免双重音频)。
    • 写上 no music,避免模型自行加配乐(BGM 在别处混)。
    • 写上 no subtitles不要 在提示词里要求烧录字幕——字幕在后期剪辑中加。