yeha.ai
목록으로

Continuous-take advertisement

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

适用于一镜到底或高连贯性故事短片。采用首帧承接技术,逐个生成镜头,通过提取前一镜头最后一帧作为当前镜头首帧来确保无缝连贯性。使用 Seedance 2.5(分辨率 480p) 驱动镜头视频生成。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

完整视频的阶段逻辑与依赖关系:

  1. 编写 Final_Video_Spec.md(标题、类型、宽高比、时长、视觉风格、语言)→ text_editor
  2. 生成故事板(关键元素、镜头列表、音频层)→ storyboard_designer。故事板准备就绪后,扫描当前上下文,查找用户提供或之前生成的、与故事板条目匹配的任何资产(例如元素图像、背景音乐)。对于每个匹配项,在进行生成步骤之前,通过 media_generator 将资产绑定并分配给相应的故事板插槽 → media_generator
  3. 设置元素:
    • 如果用户已经上传了元素资源(例如角色图像或引用的参考角色),直接将其绑定为相应 key_elements 的资产。
    • 否则,为所有元素生成图像 → media_generator
  4. 镜头顺序连贯生成循环(严格禁止并发生成,必须按顺序逐个生成,支持以下两种可选执行流程,必须先和用户确认并告知两种方案分别的优缺点让用户选择,用户不选择不可以执行后面的步骤):
    • **方案一:首帧图衔接模式(基于关键帧提取)生成速度快、消耗积分少,但是会出现刹车感停顿 **
      • 必须按照故事板分镜列表的顺序,从第一个镜头(Shot 1)开始。
      • 对于第一个镜头(Shot 1):
        • 调用 media_generator(使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p),参考关联的关键元素图像,生成 Shot 1。
        • 强制暂停并确认: 引导用户审查 Shot 1 视频。
      • 对于后续镜头 Shot N(N > 1)循环:
        • 只有当用户显式确认对上一个镜头 Shot N-1 “满意”后,方可启动 Shot N 的制作。
        • 调用 resource_prepare_and_analyze:分析并截取 Shot N-1 视频的最后一帧(最后一秒的最终画面),输出并保存为 keyframe 图像。
        • 调用 media_generator:将该最后一帧图像注册为 asset,并绑定到 Shot N 的 start_frame 位置。
        • 调用 media_generator(使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p)生成 Shot N。其参考输入必须包含:Shot N-1 提取出的最后一帧图片(作为 start_frame)以及当前镜头的 key_elements 资产。
        • 强制暂停并确认: 引导用户确认当前镜头 Shot N 视频是否满意。满意后方可提取该镜头最后一帧并进入下一镜头的循环。
    • **方案二:前置视频参考模式(基于视频流参考)生成速度慢、积分消耗非常高(提醒用户谨慎选择),但视频更连贯流畅 **
      • 必须按照故事板分镜列表的顺序,从第一个镜头(Shot 1)开始。
      • 对于第一个镜头(Shot 1):
        • 调用 media_generator(使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p),参考关联的关键元素图像,生成 Shot 1。
        • 强制暂停并确认: 引导用户审查 Shot 1 视频。
      • 对于后续镜头 Shot N(N > 1)循环:
        • 只有当用户显式确认对上一个镜头 Shot N-1 “满意”后,方可启动 Shot N 的制作。
        • 调用 media_generator:直接将 Shot N-1 生成的 final_shot 视频作为 reference_video(前置视频参考)绑定给 Shot N。
        • 调用 media_generator(使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p)生成 Shot N。其参考输入必须包含:Shot N-1 的视频作为 reference_video,以及当前镜头的 key_elements 资产。
        • 强制暂停并确认: 引导用户确认当前镜头 Shot N 是否满意。满意后方可将 Shot N 的 final_shot 作为参考,进入下一镜头的循环。
  5. 基于故事板生成所有音频层 → media_generator
  6. 在所有资源就绪后进行最终组装;然后引导用户导出 → video_assembler
  7. 不满意镜头的重制机制(针对已完成或剪辑完毕阶段,用户要求重新生成某个 Shot N):
    • 如果用户对某个中间镜头 Shot N 不满意需要重新生成:
      • 获取后一个镜头 Shot N+1 的首帧参考图(即其 start_frame,已作为 static image asset 存在)。
      • 调用 media_generator:将 Shot N+1 的首帧图作为 end_frame(尾帧参考)绑定到 Shot N。
      • 调用 media_generator(使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p):传入 Shot N 原本的首帧参考图(方案一)/Shot N-1的视频(方案二)作为起始帧,传入新绑定的 end_frame 作为结束帧,辅以 key_elements 资产,通过首尾双帧生成模式重新制作 Shot N。
      • 强制暂停并确认: 引导用户审查重新生成的 Shot N 视频,满意后重新拼入时间线。

依赖关系: 2→1;3→2;4(内部串行循环,Shot N 依赖于 Shot N-1 渲染出的视频及最后一帧的提取或视频流绑定);5→2;6→4,5;7(重制机制,Shot N 依赖于其原本的 start_frame 及 Shot N+1 的 start_frame 作为 end_frame)。

何时暂停:

  • 必须在规范定稿后、故事板完成后、元素图像准备就绪后停下来,与用户确认后继续。
  • 最核心强制暂停: 在第 4 步的镜头生成循环中,每一个镜头视频生成后,必须强制暂停并等待用户确认。只有在用户明确确认满意后,才可进行下一个镜头的生成(方案一提取最后一帧,方案二绑定参考视频),绝对禁止跳过确认直接批量生成。
  • 重制强制暂停: 在第 7 步重制不满意镜头时,重新生成后必须暂停等待用户确认,用户满意后方可重新组装 timeline 并导出。

注意: 用户提供或预先存在的媒体(主要影响第 3-5 步): 在填充生成内容之前,先通过 media_generator 将媒体绑定并分配到适当的故事板位置;避免重复生成用户已提供的内容。

2. 멀티모달 분석

最后一帧关键帧提取规则:

  • 当上游 Planner 发起上一镜头(Shot N-1)的最后一帧提取任务时,调用 resource_prepare_and_analyze
  • 分析上一镜头的视频流,精确定位到视频最后一秒的最后一帧(通常为视频截止时刻的最后一幅清晰图像),确保其没有渲染破损、花屏或因镜头结尾淡出带来的全黑、变暗画面。
  • 提取并输出该帧作为独立的高清图片资产,以便后续步骤中 media_generator 将其绑定为新镜头的 start_frame / reference_image。
3. 스토리보드 설계

如何设计关键元素

  • 确保包含关键主体(角色、物体等)、关键地点/场景以及关键道具(如有)。
  • 角色: 如果角色在项目中具有多种状态或外观(例如不同的服装、年龄),请在描述中明确说明(例如:Look 1:...;Look 2:...)。
  • 角色-音色参考: 生成或处理用户上传的音色参考素材,音频时长要在30s之内。
  • 关键地点/场景: 描述场景中重要物体的位置和朝向,特别是道具或发生重大动作/表演的区域。
  • 用户提供的资产: 如果用户提供了参考媒体并将其指定为关键元素,则描述必须与之匹配;不要与所见或所听到的内容相矛盾。

如何设计镜头

  • 优先考虑带有内部剪辑的长镜头(例如,每个镜头 10–30 秒)。在镜头内部进行设计,而不是拆分为许多短镜头;剪辑频率应遵循叙事节奏。任何镜头不得超过 30 秒(当前模型的最大时长限制)。
  • 一镜到底首帧衔接设计规范:
    • 由于采用首尾帧图像传递技术,故事板在设计镜头时,必须让后一个镜头的开场与前一个镜头的结尾在视觉上自然衔接。
    • 自 Shot 2 开始,镜头的描述中必须包含承接性描述。即:Shot N 的开场状态(角色站位、视线方向、手势、场景光线、摄像机初始景别和角度)必须与 Shot N-1 的结束状态保持严格一致。
    • 避免在相邻镜头之间设计瞬移、场景大范围变动等破坏连贯性的设定,除非是特定的匹配剪辑(Match Cut)或艺术化平滑过渡。
  • 每个镜头描述必须包括:
    • 场景: 引用地点/场景(使用场景元素 ID,例如 [Element_Office_Noir])。
    • 故事内容: 角色和关键物体的动作与动态;对话和表演。写出准确的台词(口头对话或内心独白/画外音 OS)。使用元素 ID 引用角色。
    • 电影摄影: 景别(例如,远景、中景、特写)、摄像机角度(例如,低角度、高角度)、摄像机运动(例如,固定、平移、推入/拉出)。
  • 当镜头包含内部剪辑时: 在场景/设定描述之后,按照剪辑顺序列出故事内容和电影摄影。

如何设计独立音频

  • 背景音乐: 设计至少一个全局背景音乐轨道。如果视频较长(例如 3 分钟或以上)并且有明显的间歇或转折点,您可以规划多个音乐片段(每个都有自己的 audio_id 和范围)。
  • 旁白: 如果使用大段旁白解说来推进故事,请在此处设计(将类型设置为 narration)。定义语音特征、语调和准确的脚本;使用 layout_instruction 将其限制在相关的镜头范围内。
4. 미디어 생성

元素资产生成

  • 图像: 使用 TextToImage。对于同一角色在不同外观或年龄下的表现,建议使用 ImageToImage;后续的外观应参考之前生成的图像以保持一致性。推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K
  • 角色图像: 为每个角色生成 1 张参考图像:使用水平并排布局。画面的左侧应显示角色的头像(紧凑构图,聚焦于面部,用于确认身份、肤色、眼睛、发际线);右侧应显示角色的全身照(展示全身,用于服装、发型、妆容、鞋子和轮廓)。

最终镜头视频生成

  • 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p

  • 一镜到底首帧衔接承接策略(支持以下两种生成分支,必须按选择的流程绑定资产):

    • 方案一:首帧图衔接模式(基于最后一帧图像提取)
      • 对于第一个镜头(Shot 1): 参考输入必须包括当前镜头关联的元素资产(角色图像、场景/道具图像)。
      • 对于后续镜头 Shot N(N > 1): 参考输入必须包括:
        1. 首帧参考资产(前镜头最后一帧): 绑定并使用上一个镜头(Shot N-1)由 resource_prepare_and_analyze 截取出的最后一帧图像(作为该镜头的 start_frame / reference_image)。
        2. 元素资产: 镜头中所有角色的关键元素图像及所需的场景/道具图像。
        • 逻辑说明: MultiModalToVideo 必须将该最后一帧图片用作生成的起始点,以保证 Shot N 视频开场画面与该图片(即 Shot N-1 的结尾画面)无缝衔接。
    • 方案二:前置视频参考模式(基于前置视频参考)
      • 对于第一个镜头(Shot 1): 参考输入必须包括当前镜头关联的元素资产(角色图像、场景/道具图像)。
      • 对于后续镜头 Shot N(N > 1): 参考输入必须包括:
        1. 前置视频参考资产(前镜头视频): 绑定并使用上一个镜头(Shot N-1)的 final_shot 视频作为该镜头的 reference_video
        2. 元素资产: 关键元素图像。
        • 逻辑说明: MultiModalToVideo 将上一个镜头的 final_shot 视频作为运动及状态延续的输入,以此实现动态衔接。
  • 不满意镜头 Shot N 的首尾双帧重制策略(当全部生成或剪辑完毕,用户对 Shot N 不满意时):

    • 参考输入必须包含:
      1. 起始帧参考(原本的首帧):
      • 方案一:使用 Shot N 原本的 start_frame(对于 Shot 1 为首帧元素图像,对于 Shot N > 1 为 Shot N-1 的最后一帧提取图)。
      • 方案二:使用 Shot N-1的视频作为参考,传入新绑定的 end_frame 作为结束帧,辅以 key_elements 资产,通过首尾双帧生成模式重新制作 Shot N。
      1. 结束帧参考(后镜头的首帧): 绑定并使用后一个镜头 Shot N+1 的首帧参考图(即其 start_frame)作为 Shot N 的 end_frame。
      2. 元素资产: 镜头中所有关联角色的关键元素图像及所需的场景/道具图像。
    • 逻辑说明: MultiModalToVideo 必须将原本的首帧图片作为视频起点,将后一个镜头的首帧图片作为视频终点,进行首尾双帧生视频。这样既能保证 Shot N 完美承接 Shot N-1,又能保证其尾部与 Shot N+1 的开头无缝衔接。
5. 프롬프트 작성

优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成提示词 (TextToImage, ImageToImage)
所有图像提示词的通用原则

  • 提示词不仅是描述“画面里有什么”,更像是一位真正的电影导演和调色师在指导团队。
  • 使用通顺的自然语言描述场景内容(主体 + 行为 + 环境等),并使用简短的词组描述视觉美学(风格、颜色、光影、构图)。拒绝文学化的修饰:不要向 AI 解释角色的动机或内心状态(例如“仿佛他不关心这张照片”)。不要描述屏幕外或不可见的元素。只描述物理上可见的内容。
  • 对于所有图像提示词(任何角色):您必须在所有目标风格中全局应用“电影级提示词的 6 大核心规则”,以确保电影质感。将提示词写成流畅、自然的英语描述,将这 6 条规则编织在一起。不要将它们输出为带有标签的章节:
    • 专业风格术语:结合使用专业艺术或电影术语与风格术语以提高准确性。(例如,引入“作者”和特定的电影视觉锚点,使用 Neo-Noir style, David Fincher Style, inspired by Se7en 作为风格锚点,而不是泛泛地说明 Neo-Noir 风格)。
    • 构图与镜头:明确指出电影化构图(例如 Over-the-shoulder shot(肩后镜头)、Dutch angle(荷兰角))和景别(例如 Close-up(特写)、Medium shot(中景))。
    • 光影:详细说明主光,并强调“负补光”以增加对比度和戏剧感(例如 Strong chiaroscuro contrast(强烈的明暗对比)、dramatic interplay of light and shadow(光影的戏剧性交织)或 deep facial shadows emphasizing facial structure(强调面部结构的深面部阴影))。
    • 调色:使用高端好莱坞调色手法设定克制的色调(例如 deep teal-cyan shadows dominating 90%, zero warm fill(90% 的深青色阴影,零暖光填充)或 muted watercolor wash(柔和的水彩洗色))。除非用户明确要求,否则永远不要使用红蓝霓虹冲突(例如禁止 crimson bleed(深红晕染)、霓虹洋红 vs 青色)。将图像限制在 90% 左右的区域内仅使用一种主色调(例如深青色)——极度克制。
    • 视觉渲染:描述内容的整体视觉质量和纹理(例如 fine rendering quality(精细渲染质量)、rich and intricate details(丰富错综的细节)、soft-focus effect with subtle Gaussian blur(带轻微高斯模糊的柔焦效果))。
    • 氛围与潜台词:描述角色的“潜台词”和微表情,将动作定格在戏剧性的时刻(例如 oppressive suffocation(压抑的窒息感)、no mercy(冷酷无情)、predatory stillness(捕食者的静止))。拒绝生硬、摆拍的样子。对于无生命物体,描述其状态(例如 Destined aura(宿命光环)、piercing gaze(锐利的目光)、cold and detached atmosphere(冷漠疏离的氛围))。
    • 条件元素(仅在相关时包含):
      • 准确的画面内文字:当相关时,如果场景中出现文字(例如屏幕文字),请自然地整合它。您必须用引号包裹需要渲染的确切文本内容以示强调。例如:'A neon sign in the background reads "DANGER".'。
        当目标角色是 key_element(关键元素)时
        提供清晰、详细的元素视觉定义,以便在镜头间保持一致。提示词结构应围绕:
  • 主体与身份:清楚说明元素是什么 — 角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体型、种族(如果指定)、显著特征、声音)。
  • 特征细节:具体描述该元素的关键视觉特征。优先考虑在镜头间必须保持一致的特征:
    • 角色:面部特征(眼睛形状、下颌线、发型/颜色)、妆容与造型(如果相关)、服装与配饰(材质、剪裁、颜色、状况)。
    • 道具/物体:形状、材质、颜色、尺寸、状况(新/风化/损坏)、独特的标记。
    • 氛围/情感基调:描述定义场景的情感潜台词(例如张力、忧郁、希望、宁静、不安、温暖、压迫、恐惧、怀旧、孤立、亲密)。
    • 为了保持画面整洁,不要在画面中生成文字。

视频生成提示词
视频 提示词中,为每张参考图(包括首、尾、参考视频和角色元素图)标记每个角色,以便 Seedance 2.5 能正确读取面部、造型和起始/过渡状态。使用产品标签(<<<image_1>>>, <<<image_2>>>, <<<video_1>>> 等)。

  • 方案一:首帧承接的提示词写法(针对顺序生成 Shot N > 1):

    • 如果当前是 Shot N (N > 1),通常 <<<image_1>>> 应被指定为前一个镜头的最后一帧(首帧参考)。
    • 提示词必须明确写明:“画面从 <<<image_1>>> 开始(Starting from <<<image_1>>>, which shows ...)”
    • 随后描述摄像机、主体在此画面基础上的动作发展,保证起始画面的主体状态、位置与图片 1 保持一致,随后产生自然的动态连续。
  • 方案二:前置视频参考的提示词写法(针对顺序生成 Shot N > 1):

    • 如果当前是 Shot N (N > 1),通常将前一个镜头(Shot N-1)的 final_shot 视频作为 reference_video 并标记为 <<<video_1>>>。
    • 提示词必须明确写明承接句:“画面紧接 <<<video_1>>> 视频的结尾继续生成(Continuing from the end of <<<video_1>>>, where [描述前镜头结尾的主体状态与画面]...)”
    • 随后描述摄像机和主体在 <<<video_1>>> 结尾状态基础上的动作演变、空间位移和情节发展。
  • 首尾双帧承接的提示词写法(针对重制 Shot N):

    • 必须明确标记起始帧(通常为 <<<image_1>>>,即原本首帧)和结束帧(通常为 <<<image_2>>>,即 Shot N+1 的首帧)。
    • 提示词中必须写明:“画面从 <<<image_1>>> 首帧开始,并在结尾平滑过渡到以 <<<image_2>>> 为尾帧结束(Starting from <<<image_1>>> frame and transitioning smoothly to end frame at <<<image_2>>>...)”
    • 描述在这两幅画面之间发生的摄像机运动、主体动作节拍和环境变化,引导 Seedance 2.5(分辨率 480p) 在首尾双帧之间进行自然的动态插帧/过渡。

然后按照以下 Seedance 2.5 顺序(摄像机 → 主体 → 空间 → 音频)追加运动/动态提示词:

  • 在编写提示词时遵循此顺序:
    1. 摄像机 — 运动或镜头/剪辑变化(例如 static → push-in(从静止到推入)、cut to new angle(切到新角度)、orbit(环绕)、pan(摇镜头))。
    2. 主体 — 动作和表情(谁做了什么,面部动作节拍)。
    3. 空间 — 位置或环境变化(相对于空间的主体或摄像机位置;背景运动;深度/布局转换)。
    4. 音频 — 对话(如有)、音效,以及如果模型中没有音乐时的备注(见下文)。
      动作细节
    • 相关时,基于 特定的身体部位:手、腿、头、肩膀等。
    • 添加 程度:幅度、速度、强度(例如 slowly raises one hand(缓慢举起一只手),snaps head left(头迅速向左转),pushes hard off the ground(用力蹬地))。
    • 对于一个提示词中的多个节拍,列出 主要动作,然后是次要动作(按故事的时间顺序)。
      多节拍与“镜头 1 / 镜头 2”(官方指南)
    • 当工具接受长提示词时,您可以在单次生成中标记 镜头 1, 镜头 2, 镜头 3 用于 摄像机或故事节拍 的序列。
    • 精确的时钟计时(例如“0–3 秒”、“3–6 秒”)无法可靠执行 — 不要强制按确切秒数范围分割提示词,也不要编写明确的逐秒计划(例如“在 2 秒时...”,“从 5-8 秒...”)。描述 按顺序发生的事情,而不是按时间安排的镜头列表。
      可选润色(当简报是电影级真人拍摄时): 您可以根据其他策略规则添加轻微的手持微抖动或微妙的胶片颗粒感 — 保持其从属于上述四层顺序。
      特殊角色约定(针对 Seedance 2.5(分辨率 480p))
      Seedance 2.5 接受自然语言提示词;这些包装符有助于模型区分 音乐音效对话屏幕标题文字
    • 音乐(描述正在播放的内容):(...),例如 (fast-paced rock playing in the background)(背景中播放着快节奏摇滚乐)。
    • 音效:<...>,例如 <distant dog barking>(远处的狗叫声)。
    • 口头对话:{...},例如 {Hello, world} — 如果台词 是项目原始语言(例如英语短片中的日语独白),请在花括号前 标注语言,例如 Says in Japanese: {こんにちは}。不要保留故事版规划中的引号,{...}内只包含对话文字。
    • 屏幕标题/章节/字幕文字:【...】,例如 【Chapter One: Departure】(第一章:启程)。

注意: 您必须始终在提示词中包含以下负面约束,以确保后期制作的输出干净:

  • 如果分镜脚本表明该镜头有单独的旁白音轨,请不要在视频提示词中写入旁白文本,以避免音频冲突。
  • 为防止模型添加不需要的背景音乐,您几乎应该始终包含 'no music'。
  • 字幕是在后期剪辑时添加的,因此您必须始终包含 'no subtitles'。
6. 동영상 조립

一镜到底无缝组装规范:

  • 极简无缝转场: 连续生成的镜头(Shot N-1 和 Shot N)之间已经通过首尾帧对齐,因此在时间轴组装时,镜头之间绝对禁止使用淡入淡出、交叉溶解、闪白或任何第三方特效转场。
  • 纯切承接: 所有视频衔接点必须使用**纯切(Hard Cut)**承接,以最自然的方式体现物理动态在镜头间的无限连贯性,从而在拼合后呈现出近乎完美的一镜到底(One-Shot)长镜头效果。
  • 音轨流畅度: 全局背景音乐及旁白在这些无缝纯切点之间必须保持平滑不中断,音频不可在画面纯切处产生卡顿或音量突变。