yeha.ai
목록으로

Recreate a video shot by shot

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

参考现有视频以生成最终视频。使用 Nano Banana + Seedance 2.5(分辨率 480p)。在关键阶段暂停以获取用户确认;通过单次工作流实现人机协作。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

完整视频的阶段逻辑和依赖关系:

  1. 详尽分析上传的视频。提取关键参考帧(标志性的构图、取景、时刻),并直接将其用作关键帧(key-frame)→ resource_prepare_and_analyze
  2. 编写 Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、语言、模型偏好)→ text_editor
  3. 生成故事板(key_elements、镜头列表、音频层)→ storyboard_designer
  4. 设置元素:
  • 如果用户已经上传了元素资源(例如角色图像或引用的库角色),请直接将其绑定为相应 key_elements 的资产。否则,为所有元素生成图像 → media_generator
  • 如果存在对话/旁白,生成“语音参考(voice reference)”音频资产 → media_generator
  1. 针对每个镜头生成最终视频;严格参考该镜头的元素图像 + 关键帧(步骤 1 和 4)→ media_generator
  2. 根据故事板生成所有音频层(audio_layers)→ media_generator
  3. 在所有资源准备就绪后进行最终合成;然后引导用户导出 → video_assembler

依赖关系: 2→1;3→1,2;4→1,3;5→1,3,4;6→3;7→3,4,5,6。

注意 — 用户提供或现有的媒体(主要影响步骤 3–6): 在填充生成内容之前,通过 media_generator 将其绑定并分配到适当的分镜位置;避免重复生成用户已提供的内容。

何时暂停: 不要一次性运行所有步骤。在上述每个关键阶段(例如:规格确定后、故事板完成后、元素图像完成后、关键帧完成后、分镜视频完成后、音频完成后)停下来,与用户确认,然后再进行下一步。在继续之前,使用卡片或 reply_to_user 邀请用户进行审核。

2. 멀티모달 분석

视频分析(VIDEO Analysis)指南

  • 对参考视频执行完整的镜头拆解。以以下格式输出每个片段:00:00–00:30s, 镜头描述(或相应的 MM:SS.mmm 范围)。
  • 镜头描述要求: 每段描述必须使用自然语言(不使用表格)完整包含:角色动作、对话、场景/背景及其动态、取景、摄像机运动、镜头类型和角度,以及任何其他相关的摄像机语言。要全面且详细,特别是针对摄像机语言部分。
  • 分段逻辑: 不必为源视频中的每一个剪辑点创建一个新片段;一个片段可以描述单个时间范围内多次剪辑的内容。按完整的节拍进行分段——每个片段应完整传达一个叙事节拍——但单个片段不得超过 30 秒
3. 스토리보드 설계

如何设计关键元素

  • 始终包含关键主体(角色、物体等)、关键地点/场景关键道具(如有)。
  • 如何规划 element_id: 当每个角色、道具或场景是一个独立的实体时,为每个实体分配一个 element_id(例如 [Element_Detective_Li][Element_Boss_Zhao][Element_Observation_Room][Element_Chief_Office])。
  • 如何编写描述:
    • 角色: 如果角色在项目中具有多种状态或外观(例如不同的服装、年龄),请在描述中清晰地描述每一种(例如:外观 1:…;外观 2:…)。包括角色的声音/音色,以便后续的音频匹配。
    • 关键地点/场景: 描述场景中重要物体的位置和朝向,特别是道具或发生主要动作/表演的区域。
    • 用户提供的资产: 如果用户提供了参考媒体并将其指定为关键元素,则描述必须与该资产匹配;不要与所展示或听到的内容相矛盾。

如何设计镜头

  • 每个镜头与镜头拆解中的一个片段一一对应或明确映射,保留参考视频的剪辑点、镜头类型、摄像机运动、取景、节奏;仅将“谁在做什么,什么产品/角色”替换为新主题的对应内容。
  • 优先使用包含内部剪辑的长镜头(例如每个镜头 10–30 秒)。在镜头内部设计剪辑,而不是拆分成许多短镜头;剪辑频率应遵循故事节奏。每个镜头不得超过 30 秒(当前模型的最大时长限制)。
  • 当镜头有内部剪辑时: 在描述场景/背景后,按剪辑顺序排列故事内容和摄像机语言。使用明确的时间和剪辑标记,例如:“镜头 1(0–4 秒):[场景],[角色]做 X,特写。镜头 2 剪辑到(4–8 秒):… 镜头 3 剪辑到(8–12 秒):…”
  • 每个镜头描述必须包含:
    • 场景: 参考地点/场景(使用场景元素 ID,例如 [Element_Office_Noir])。
    • 故事内容: 角色和关键物体的动作与动态;对话和表演。写出确切台词(口语对话或内心独白 / OS)。通过元素 ID 引用角色。
    • 摄像机语言: 景别、角度、运动(与该片段的拆解保持一致),以及该镜头使用的关键帧提取(例如,“构图参考 keyframe_02”)。

如何设计独立音频

  • 背景音乐: 至少有一个全局背景音轨;风格和节奏与参考视频或最终视频规格(Final Video Spec)匹配;如果参考视频有明确的段落/情绪变化,请拆分 BGM 片段并定义范围(每个都有自己的 audio_id 和范围)。
  • 旁白: 如果参考视频有旁白或对话,请在音频层(audio_layers)(类型为 narration)中设计旁白或对话,包含内容、声音/语调和时间范围;如果存在 voice_reference 资产,请将其链接到 layout_instruction 或注释中,以便后续对齐。
4. 미디어 생성

元素生成

  • 图像: 如果用户已指定了元素的资产(例如产品图像、角色图像),请直接使用;不要重新生成。否则,对角色、场景、道具使用 TextToImage(或项目约定)。对于同一个角色的多种状态,使用参考第一张图像的 ImageToImage 以保持一致性。每个项目的推荐分辨率和模型(例如 2K);建议对角色进行多视图处理,以便跨镜头保持一致性,并为每个视图分配单独的 asset_id 并分别生成。
    • 推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K。角色元素优先使用三视图(正面/侧面/背面)以支持跨镜头的一致性。
  • 语音参考 (Voice_references): 如果参考视频中有对话/旁白且分镜脚本需要复制声音,请生成或指定一个 voice_reference 音频剪辑(例如该角色/旁白者的样本),用于旁白生成以匹配声音和语调。
    • 推荐模型:对于中文 (zh) 内容:豆包。对于英语/全球 (en) 内容:elevenlabs

最终镜头视频生成

  • 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p。同时参考该镜头的元素图像关键帧图像

旁白和 BGM

  • 旁白: 内容、声音、语调和时间安排严格按照分镜脚本执行;如果存在“语音参考”资产,生成时请与之对齐。
  • BGM: 风格和节奏与最终视频规格/参考视频匹配;时长和范围按照分镜脚本执行。
5. 프롬프트 작성

优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。

图像生成提示词 (TextToImage, ImageToImage)
所有图像提示词的通用原则

  • 提示词不仅仅是描述“画面里有什么”,而是像真正的电影导演和调色师给团队下达指令一样。
  • 使用连贯的自然语言描述场景内容(主体 + 行为 + 环境等),并使用简短的短语描述视觉美学(风格、颜色、光线、构图)。不要包含文学性的废话:不要向 AI 解释角色的动机或内心状态(例如“仿佛他不在乎照片”)。不要描述画面外或不可见的元素。只描述物理上可见的内容。
  • 对于所有图像提示词(任何角色):您必须在所有目标风格中全局应用“电影级提示词的 6 条核心规则”,以确保电影质感。将提示词写成流畅、自然的英语描述,将这 6 条规则融合在一起。不要将它们作为带标签的部分输出:
    • 专业风格术语:结合专业的艺术或电影术语与风格术语,以提高准确性。(例如:引入作者(Auteur)和特定的电影视觉锚点,使用 Neo-Noir style, David Fincher Style, inspired by Se7en 作为风格锚点,而不是泛泛地陈述 Neo-Noir 风格)。
    • 取景与镜头:明确说明电影取景(例如:Over-the-shoulder shotDutch angle)和景别(例如:Close-upMedium shot)。
    • 光线:详细说明主光,并重点强调“负向补光(negative lighting)”以增加对比度和戏剧性(例如:Strong chiaroscuro contrastdramatic interplay of light and shadow,或 deep facial shadows emphasizing facial structure)。
    • 调色:使用高端好莱坞调色来设置克制的色调(例如:deep teal-cyan shadows dominating 90%, zero warm fillmuted watercolor wash)。除非用户明确要求,否则永远不要使用红蓝霓虹冲突(例如禁止 crimson bleed,霓虹洋红 vs 青色)。将图像限制为一种主色调,占据画面约 90% 的比例(例如深蓝绿色)——极致克制。
    • 视觉渲染:描述内容的整体视觉质量和纹理(例如:fine rendering quality, rich and intricate details, soft-focus effect with subtle Gaussian blur.)。
    • 情绪与潜台词:描述角色的“潜台词”和微表情,将动作冻结在戏剧性的节拍上(例如 oppressive suffocation, no mercy, 和 predatory stillness)。拒绝生硬、摆拍的样子。对于无生命物体,描述其状态(例如:Destined aura, piercing gaze, cold and detached atmosphere)。
    • 条件元素(仅在相关时包含):
      • 准确的画面内文字:相关时,如果场景中出现文字(例如,屏幕文字),请自然地整合它。您必须将场景中需要渲染的确切文本内容用引号括起来以进行强调。例如:'A neon sign in the background reads "DANGER".'。

当目标角色为 key_element
提供清晰、详细的元素视觉定义,以确保其在镜头间保持一致。提示词结构围绕:

  • 主体与身份:明确说明该元素是什么——角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体格、种族(如果指定)、显著标记、声音)。
  • 特征细节:具体描述元素的关键视觉特征。优先考虑在镜头间必须保持一致的特征:
    • 角色:面部特征(眼睛形状、下颌线、发型/颜色)、妆容与造型(如果相关)、服装与配饰(材质、合身度、颜色、状态)。
    • 道具/物体:形状、材质、颜色、尺寸、状态(新的/风化的/损坏的)、独特的标记。
  • 情绪/情感基调:描述定义场景的情感基调(例如:tension, melancholy, hope, serenity, unease, warmth, oppression, dread, nostalgia, isolation, intimacy)。

当目标角色为关键帧(开始帧、结束帧或高亮帧)时
首先,在镜头的 Description 中找到相应的时刻:识别确切的节拍——开始状态、结束状态或视觉/戏剧性最强烈的瞬间——并以此为基础。如果镜头描述没有清楚地描绘那个时刻,请在脑海中模拟该镜头(主体运动 + 摄像机移动 + 环境变化),想象场景在那个精确瞬间的样子,然后自己填充细节。无论哪种方式,只描述那一瞬间静止的图像——什么可见,它是如何取景的,以及一切处于什么状态:

  • 开始帧: 展示动作开始前的场景——主体动作前的姿势和意图(重心转移、视线方向、肢体预加载)、处于基准状态的环境,以及摄像机的初始取景和角度。
  • 结束帧: 展示动作解决后的直接结果——主体完成后的姿势或最终表情、变化后的环境,以及摄像机为下一个剪辑做准备的最终位置。
  • 高亮帧: 识别镜头中视觉或情感最强烈的单一瞬间(例如,冲击的高潮,启示落在角色脸上的瞬间,凝结镜头主题的构图)。冻结并以最大的具体性描述该帧——姿势、表情、光线状态、摄像机取景——这样它就可以作为一个镜头中最具感染力的静止画面单独存在。

视频生成提示词
使用以下 Seedance 顺序追加运动/动态提示词(摄像机 → 主体 → 空间 → 音频):

  • 在书面提示词中遵循此顺序:

    1. 摄像机 — 运动或镜头/剪辑变化(例如:static → push-in, cut to new angle, orbit, pan)。
    2. 主体 — 动作和表情(谁在做什么,面部动作节拍)。
    3. 空间 — 位置或环境变化(主体或摄像机相对于空间的位置;背景运动;深度/布局偏移)。
    4. 音频 — 对话(如有)、音效,以及如果模型中没有音乐的注释(见下文注释)。
      动作细节
    • 相关时,基于特定的身体部位:手、腿、头、肩膀等。
    • 添加程度:幅度、速度、强度(例如:slowly raises one hand, snaps head left, pushes hard off the ground)。
    • 对于一个提示词中的多个节拍,按主要动作,后跟次要动作的顺序列出(按时间故事顺序)。
      多节拍与“镜头 1 / 镜头 2”(官方指南)
    • 当工具接受长提示词时,您可以为单次生成中的摄像机或故事节拍序列标记 Shot 1, Shot 2, Shot 3
    • 精确的时钟计时(例如“0–3 秒”、“3–6 秒”)无法可靠地执行——不要强行按确切的秒数范围拆分提示词,也不要编写明确的逐秒计划(例如“在 2 秒时...”、“从 5–8 秒...”)。描述按顺序发生的事情,而不是时间表化的镜头列表。
      可选润色(当简报是电影级真人实拍时): 根据其他策略规则,您可以添加轻微的手持微抖动或细微的胶片颗粒感——但要保持其从属于上述四个层次的顺序。
      特殊角色约定(针对 Seedance 2.5(分辨率 480p))
      Seedance 接受自然语言提示词;这些包装器有助于模型区分音乐音效对话屏幕标题文本
    • 音乐(正在播放内容的描述):( ... ),例如:(fast-paced rock playing in the background)。
    • 音效:<...>,例如:<distant dog barking>。
    • 口语对话:{...},例如:{Hello, world} —— 如果台词不是项目使用的原始语言(例如,英语短片中的日语独白),请在花括号前标注语言,例如:Says in Japanese: {こんにちは}
    • 屏幕标题 / 章节 / 字幕文本:【...】,例如:【Chapter One: Departure】
  • 对于单个镜头内高度复杂或多阶段动作的特别说明:您必须按顺序描述序列。您可以使用“cut to”标记来表达过渡(Shot A..., cut to Shot B..., cut to Shot C...)。

    • 示例:Shot1: <<<image_1>>> his hands carefully open a dusty wooden box, with the sound of a soft creak. <<<image_1>>> His expression is focused and curious. The camera is a fixed shot, and the background attic is static. Shot2: cut to a bright blue light emanates from the artifact inside, casting an ethereal glow on his face and creating long, shifting shadows in the room. <<<image_1>>> His expression changes from focused to shocked awe as the camera begins a slow zoom in on his face. Shot3: cut to <<<image_1>>> he looks up with determination, the blue light reflecting in his eyes, as he slightly turns his head to the left to look past the camera. (no dialogue, no music, no subtitles)

注意: 为了确保后期制作输出干净,您必须始终在提示词中包含以下负面约束:

  • 如果分镜脚本指示该镜头有单独的旁白音轨,请不要在视频提示词中写入旁白文本,以避免音频冲突。
  • 为防止模型添加不需要的背景音乐,您几乎总是应该包含“no music”。
  • 字幕是在后期编辑期间添加的,因此您必须始终包含“no subtitles”。
6. 동영상 조립

按照分镜和时间轴顺序组装所有镜头、旁白音轨和 BGM;在剪辑准备就绪时引导用户导出。
如果最终镜头没有镜头内对话或旁白,请在编辑中将镜头/视频层的嵌入音频静音,并依赖音频层(按设计使用的 BGM/SFX),这样镜头生成的音频就不会与混音冲突。