yeha.ai
목록으로

Story-driven reusable video storyboard

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

适合故事驱动的视频,使用 Seedance 2.5(分辨率 480p)生成。成片视频提示词**直接复用**故事板的镜头描述——适合希望在生成前先把提示词锁定的创作者。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

完整成片阶段逻辑与依赖:

  1. 撰写 Final_Video_Spec.md(标题、类型、画幅比、时长、视觉风格、语言)→ text_editor
  2. 生成故事板(关键元素、镜头列表、音轨层)→ storyboard_designer。故事板就绪后,扫描当前上下文中用户已提供或此前已生成、且与故事板条目匹配的素材(如元素图、背景音乐)。每有一处匹配,在进入生成步骤前通过 media_generator 绑定并指派到对应故事板槽位 → media_generator
  3. 配置元素:
    • 若用户已上传元素素材(如角色图或参考角色),直接绑定为对应 key_elements 的素材。
    • 否则,为所有元素生成图像 → media_generator
  4. 逐镜头生成成片视频 → media_generator
  5. 依据故事板生成全部音轨层 → media_generator
  6. 素材齐备后进行最终合成;再引导用户导出 → video_assembler

依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。

何时暂停: 不要一次性跑完所有步骤。在上述每一关键阶段后停下(如规格定稿后、故事板完成后、元素完成后、镜头视频生成后、音频生成后),与用户确认后再进入下一步。可用卡片或 reply_to_user 邀请用户审阅后再继续。

说明: 用户自带或已存在的媒体(主要影响步骤 3–5):在填入生成内容之前,先通过 media_generator 绑定并指派到故事板对应位置;避免对用户已提供的素材做重复生成。

2. 스토리보드 설계

如何设计关键元素

  • 须包含 关键主体(角色、物体等)、关键场地/场景,以及 关键道具(若有)。
  • 角色: 若同一角色在项目中有多种状态或造型(如不同服装、年龄),在描述中写清(如 Look 1:…;Look 2:…)。写明角色的 嗓音/音色
  • 关键场地/场景: 说明场景中重要物体的位置与朝向,尤其是承载主要动作或表演的区域与道具。
  • 用户提供的素材: 若用户提供参考媒体(图或语音)并指定为关键元素,描述 必须与素材一致;不得与画面或可闻内容矛盾。

如何设计镜头

  • 优先长镜头 + 镜内分切(如单条 10–30 秒)。在 单条镜头内 设计,不要拆成大量碎短镜头;剪切频率跟叙事节奏。单条镜头不得超过 30 秒(当前模型时长上限)。
  • 每条镜头描述须包含:
    • 场景: 指明场次/空间(使用场景元素 ID,如 [Element_Office_Noir])。
    • 故事内容: 节拍、对白、表演;写出 准确台词(对白或内心独白/OS)。角色用元素 ID 引用。
      • 主体与物体动态: 写清每个主体 自身 的动作——表情变化、肢体动作、相对镜头的 主动 朝向变化(如从四分之三侧脸转向正对镜头)。若须静止, 明确写出(如僵立、目光钉死)——勿与「未写调度」混淆。
      • 动作质感: 为动作加 程度修饰(快慢、轻重、幅度、频率等),使表演在故事板上无歧义。
      • 多拍调度: 同一段落内多个动作按 严格时间顺序 列出;多角色或关键物体并行动作时,用清晰配对:主体1 + 动作1(+ 动作2…)、主体2 + 动作2,便于后续视频继承明确调度。
    • 电影摄影(镜语):
      • 景别与构图: 景别(如 WS、MLS、MS、MCU、CU、ECU),以及双人中景、过肩、带前景单人、主构图等按需。
      • 角度与高度: 平视、仰、俯、顶视、荷兰角等。
      • 摄影机运动: 用自然语言写清意图。常见类别:环绕、航拍、变焦、摇移、跟拍/追踪、手持,以及镜内 重新构图或切换。基于画面的视频模型依赖明确镜语:镜头 在动 要用直白说法写出;不动 须写 static camerafixed shot,避免后续误以为有漂移。
      • 手持微动与胶片质感(写实/实拍默认): 除非 Final_Video_Spec 或该镜明确要求监控锁机、运动控制级精度、干净 CGI、产品级锐利或非写实风格化动画,否则可写 轻微 有机不完美以免过度顺滑——如 极轻手持微颤自然轻微漂移微弱呼吸感(幅度小且连续,非剧烈晃镜)。画面 可酌情:细 35mm 颗粒轻微化学胶片颗粒轻模拟噪点;除非风格要求,避免粗大数码噪、强雪花、VHS 质感。固定机位时不要写手持用语。
      • 镜头与光学气质(必要时): 广角/长焦气质、浅景深/深景深——仅用白话,且与板上其它部分锁定的观感一致。
  • 镜内分切: 交代场景/环境后,按 每一次分切 排列 故事内容与镜语,并写清 时间(如:先(0–4s):… 再(4–8s):… 再(8–12s):…)。
    • 单镜内复杂或多阶段动作: 必须 严格按顺序 描述——可用 First / Then / Finally分段时间(如 0–3s / 3–6s / 6–9s),或同一条 take 内跳景别/角度时的 cut to。与成片提示词的顺序一致,规划与生成共用 同一份 权威故事板正文。

如何设计独立音轨

  • 背景音乐: 至少一条全局 BGM。片长较长(如 3 分钟以上)且有明显段落或转折时,可规划多段音乐(每段自有 audio_id 与覆盖范围)。
  • 旁白(narration 轨): 仅当 故事 必须 靠旁白推进叙事,且旁白为 长段并跨越多镜 时使用——不要用于单节拍上一两句短 OS。在此设计:音色特征、语气、完整文稿。用 layout_instruction 标明旁白 从头到尾覆盖哪些镜头区间
3. 미디어 생성

元素素材生成

  • 图像: 使用 TextToImage。同一角色不同造型或年龄建议 ImageToImage;后续造型应参考先生成的外观以保持一致。推荐模型:Nano Banana 2(Gemini 3.1 Flash Image),分辨率 2K。角色元素优先 三视图(正/侧/背)以利于跨镜一致(注意三视图是一张图)。

最终镜头视频生成

  • 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p
  • 提示词拼装: 将已定稿故事板中该镜头的 Shot description 作为创意正文 原样拷贝——不要另写一套成片提示词。
  • 每条镜头的参考输入须包含:
    1. 元素素材——本镜出现的角色、场景、道具的全部元素图。
    2. 连续性视频参考(可选): 仅当本镜头与前面某一镜在叙事或画面上存在非常强的关联(如同一拍跨剪、同一场景与调度线索、同一角色线索紧密衔接等),才把此前已完成的其中一条镜头视频纳入参考;若无此类强关联,不要为了「连贯」而强行加参考。
4. 프롬프트 작성

图像生成提示词(TextToImage、ImageToImage)

全体图像提示词的通用原则

  • 提示词不只是「画面里有什么」,而要像导演与调色师在给团队下指令。
  • 用连贯自然语言写场景内容(主体 + 行为 + 环境等),用短语写视觉美学(风格、色彩、光线、构图)。忌文学空泛: 勿向模型解释动机或内心(如「仿佛他不在乎这张照片」)。勿写画外或不可见信息,只写画面上 物理可见 之物。
  • 对所有图像提示词(任意用途):必须在 所有 目标风格下全局套用 电影感提示词六条核心规则,写成 流畅的英文 叙述,不要用标签分段输出:
    • 专业风格用语: 结合作者性、具体影片视觉锚点等专业用语提高准确度(如用 Neo-Noir style, David Fincher Style, inspired by Se7en 之类锚点,而非泛泛写 Neo-Noir)。措辞须与 Final_Video_Spec.md(video spec)中的视觉风格及整体观感一致;
    • 构图与镜头: 明确写出电影构图(如过肩、荷兰角)与景别(如特写、中景)。
    • 光线: 写清主光并强调「负空间光」以拉开反差与戏剧性(如强明暗对照、光影交织、面部阴影强调结构)。
    • 调色: 用高端院线级调色思路约束色系(如阴影大面积青绿、几乎无暖填充;或Muted watercolor wash)。除非用户明确要求,避免红蓝霓虹对撞(禁用 crimson bleed、洋红对 cyan 等)。约 90% 画面控制在单一主导色相(如深青绿)——极度克制。
    • 画面呈现: 整体画质与质感(如细腻渲染、丰富细节、柔焦与高斯模糊感等)。
    • 情绪与潜台词: 写角色潜台词与微表情,卡在戏剧性节拍(如压迫、无情、捕食般的静止)。拒绝僵硬摆拍。静物则写其气质与氛围。
    • 条件项(仅必要时):
      • 画面上可读文字: 若画面内需出现文字,自然融入;须渲染的 确切文案 用引号包起来强调,例如背景霓虹写着 "DANGER"

当图像用途为 key_element
给出清晰、详细的元素视觉定义以便跨镜一致。围绕以下组织:

  • 主体与身份: 说明元素类型——角色、道具、场景或生物。角色须含界定性特征(年龄、体格、若指定的族裔、辨识特征、嗓音)。
  • 特征细节: 具体写关键视觉特征,优先写跨镜必须一致的点:
    • 角色: 五官(眼型、下颌、发型/发色)、妆造(若有关)、服装与配饰(材质、合身度、颜色、新旧)。
    • 道具/物体: 形状、材质、颜色、尺寸、状态(新/旧/破损)、标志性记号。
    • 情绪基调: 场景的潜在情绪(紧张、忧郁、希望、宁静、不安、温暖、压抑、恐惧、怀旧、疏离、亲密等)。

当目标为关键帧(起始帧、结束帧或高光帧)
先在镜头描述中找到对应瞬间——开场状态、收束状态、或视觉/戏剧张力最强的瞬间——以此为据。若描述未写清该瞬间,则在脑中推演该镜(主体运动 + 机位运动 + 环境变化),想象那一帧冻结时的画面并补足细节。无论哪种方式,只描述 单一静止瞬间:可见内容、构图方式、万物状态。

  • 起始帧: 动作开始前——主体的预备姿态与意图(重心、视线、肢体预加载)、环境的基准状态、镜头的初始景别与角度。
  • 结束帧: 动作落定后——主体的结束姿势或表情、环境变化后的状态、镜头停留以便下一剪的位置。
  • 高光帧: 该镜视觉或情绪最强的单帧(撞击顶点、信息击中面部、主题凝结的构图等)。将该帧冻结并极尽具体地写清——姿态、表情、光效、构图——使其可单独作为该镜最具感染力的静帧。

视频生成提示词

  • 创意正文: 与故事板该镜头的镜头描述保持一致不要再重新写一套视频提示词。
  • 语言: 提示词用中文写,但是台词/旁白/歌词如果有,这些用视频本身的目标语言(video spec里写了)
  • 风格: 视频提示词里须包含风格描述,严格沿用 Final_Video_Spec.md(video spec)里约定的视觉风格及相关观感说明;全片保持一致,
  • 参考占位符(格式): 当引用到参考图时,插入多模态/参考图占位符(如 <<<image_1>>><<<image_2>>> …)。放在应对应绑定的节拍。
  • 后期友好约束(整条提示词拼好后务必追加):
    • 若故事板为该镜头配置了 独立旁白轨不要 把旁白稿贴进视频提示词(避免双重音频)。
    • 写上 no music,避免模型自行加配乐(BGM 在别处混)。
    • 写上 no subtitles不要 在提示词里要求烧录字幕——字幕在后期剪辑中加。