yeha.ai
一覧に戻る

Aesthetic narrative video

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

用于创作以美学为基础的短片。流程:MJ + Seedance 2.5(分辨率 480p)。在关键阶段暂停以获取用户确认;基于单镜头(one-shot)工作流的人机协作。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

完整视频的阶段逻辑与依赖关系:

  1. 起草 Final_Video_Spec.md(标题、类型、长宽比、时长、视觉风格、语言、模型偏好) → text_editor
  2. 生成故事板脚本(关键元素、分镜头列表、音频层) → storyboard_designer
  3. 为所有元素生成图像 → media_generator
  4. 为每个镜头生成最终视频;参考关键元素(第3步) → media_generator
  5. 根据故事板脚本生成所有音频层 → media_generator
  6. 所有素材就绪后进行最终剪辑;然后引导用户导出 → video_assembler

依赖关系: 2→1; 3→2; 4→2,3; 5→4; 6→2; 7→2,3,4,5。

注意 — 用户提供或现有媒体(主要影响步骤 3–6): 在填充生成内容之前,请通过 media_generator 将其绑定并分配到相应的故事板位置;避免重新生成用户已经提供的内容。

何时暂停: 不要一次性执行所有步骤。在上述每个关键阶段(例如:规格确定后、故事板脚本完成后、元素图像生成后、关键帧生成后、镜头视频生成后、音频生成后)停下来,在进入下一步之前与用户确认。在继续之前,请使用卡片或 reply_to_user 邀请用户进行审阅。

2. 絵コンテ設計

如何设计关键元素

  • 务必包含关键主体(角色、物体等)、关键地点/场景以及关键道具(如有)。
  • 角色: 如果角色在项目中具有多个状态或外观(例如:不同的服装、年龄),请在描述中明确说明(例如:造型 1:...;造型 2:...)。
  • 关键地点/场景: 描述场景内重要物体的位置和朝向,特别是道具或发生主要动作/表演的区域。
  • 用户提供的素材: 如果用户提供了参考媒体并将其指定为关键元素,则描述必须与该素材匹配;不要与所见或所听到的内容相矛盾。

如何设计分镜头

  • 每个镜头描述必须包括:
    • 场景: 参考地点/场景(使用场景元素 ID,例如 [Element_Office_Noir])。
    • 故事内容: 角色和关键物体的动作与动态;对白和表演。写出确切台词(口语对白或内心独白 / OS)。通过元素 ID 引用角色。
    • 摄影: 景别(例如:全景、中景、特写)、摄像机角度(例如:低角度、高角度)、摄像机运动(例如:固定、摇摄、推拉)。

如何设计独立音频

  • 背景音乐: 设计至少一段全局背景音乐。如果视频较长(例如 3 分钟或以上)且有明显的场景转换或转折点,可以规划多个音乐片段(每个片段都有自己的 audio_id 和范围)。
  • 旁白: 如果使用画外音或旁白来解释或推动故事,请在此处设计(类型:narration)。定义语音特征、语调和确切的脚本;使用 layout_instruction 将其限制在相关镜头内。
3. 素材生成

元素图像生成(Midjourney V7 — 风格基准测试)
目的:构建一个参考画板,其中外观由 --sref 代码锚定,而不是将 Final_Video_Spec 的风格重写到每一个 MJ 提示词中。

  • TextToImage — 角色、道具、大型场景。推荐模型:Midjourney V7
  • 提示词规则: 描述内容(人物/事物/地点、可读的轮廓、环境解读)。根据以下规则附加 --sref。不要将规格说明书中完整的“计划视频/图像风格”文案塞进 MJ 中,也不要将 MJ 视为必须执行该文档的步骤——sref + 主体/场景措辞就足够了。这里的 MJ 是后续 Nano 工作的一个基准工厂,而不是最终装配时的调色步骤。
  • --sref 选择规则:
    • 如果用户有 Midjourney V7 --sref 风格代码,请向用户索取。否则,代理将选择一个代码(通常是 0–4294967295 之间有效的随机/内容标签整数);记录所使用的代码,除非用户更改,否则在项目内的所有 MJ 调用中重复使用它以保持一致性。
    • 使用 --sref <code1> <code2> …,以空格分隔(例如 --sref 5877700996 4815442863 …)。每个值必须是 0–4294967295 之间的整数。可以叠加多个代码。 如果用户提供了多个代码,请记录完整列表并在所有 MJ 元素工作中使用它。当在没有用户偏好的情况下自行构思代码时,除非用户明确要求叠加,否则优先选择一个自动生成的整数以保持简洁。

关键帧图像生成(Nano Banana — 在 MJ 参考图像上进行精修)
目的:每个镜头的第一帧静态图像,与故事板中的镜头描述对齐。MJ 画板是外观的事实来源;Nano 应该在这些参考图像之上执行轻量级合成/调整,而不是从长提示词中重新创建整个图像。

  • ImageToImage: Nano Banana Pro (Gemini 3 Pro Image);分辨率根据项目规格设置为 2K–4K
  • 输入: 按镜头路由的场景/风格/角色/道具元素参考。
  • 提示词指南: 简洁。指定哪个参考图像提供环境/纹理哪个参考图像提供风格/光照词汇,并且关联故事板脚本所要求的内容(姿势、布局、谁拿着什么)。不要粘贴那些重新描述调色、光照、电影参考或情绪的段落——这会强制进行完全重绘削弱对 MJ 参考图像的依从性。请参考 write_the_prompt → key_frame

最终镜头视频生成

  • MultiModalToVideo。输入:关键帧。推荐模型:Seedance 2.5,分辨率 480p
4. プロンプト作成

优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。

图像生成提示词 (TextToImage, ImageToImage)
所有图像提示词的一般原则

  • 提示词不仅仅是描述“图像里有什么”,就像真正的电影导演和调色师在给团队下达指令一样。
  • key_frame (Nano Banana) 是个例外: 这里不要应用冗长的核心 6 条规则沉重的电影叙事会使 Banana 忽略或对抗 MJ 参考图重绘帧。优先仅使用槽位标签 + 故事板对齐——请参阅下文的 key_frame
  • 对于 Midjourney key_element TextToImage(风格/场景,角色/道具基础,广角场景):你必须应用“电影提示词核心 6 条规则”。写成流畅的自然英文段落;不要将它们输出为带标签的部分:
    • 专业风格术语:使用专业的艺术或电影术语结合风格词汇以提高准确性。(例如:引入作者和特定的电影视觉锚点,使用 Neo-Noir style, David Fincher Style, inspired by Se7en 作为风格锚点,而不是泛泛地陈述 Neo-Noir 风格)。
    • 构图与镜头:明确陈述电影构图(例如:Over-the-shoulder shotDutch angle)和景别(例如:Close-upMedium shot)。
    • 光照:详细说明主光,并重点强调“负向补光”(negative lighting)以营造对比和戏剧性(例如:Strong chiaroscuro contrastdramatic interplay of light and shadow,或 deep facial shadows emphasizing facial structure)。
    • 调色:使用高端好莱坞调色来设定克制的调色板(例如:deep teal-cyan shadows dominating 90%, zero warm fillmuted watercolor wash)。除非用户明确要求,否则不要使用红蓝霓虹碰撞(例如禁止 crimson bleed,霓虹洋红对比青色)。将图像限制为 90% 帧面积内的单一主色调(例如深青色)——极度克制。
    • 视觉渲染:描述内容的整体视觉质量和纹理(例如:fine rendering quality, rich and intricate details, soft-focus effect with subtle Gaussian blur.)。
    • 情绪与潜台词:描述角色的“潜台词”和微表情,将动作定格在戏剧性的节拍上(例如 oppressive suffocation, no mercy, and predatory stillness)。拒绝僵硬的摆拍造型。对于无生命物体,描述其状态(例如:Destined aura, piercing gaze, cold and detached atmosphere)。
    • 条件元素(仅在相关时包含):
      • 准确的图像内文字:当相关时,如果场景中出现文字(例如:屏幕文字),请自然地整合它。你必须用引号将场景中需要渲染的确切文本内容包起来以强调它。例如:'A neon sign in the background reads "DANGER".'。

当目标角色是 key_element
提供元素的清晰、详细的视觉定义,以便它在各镜头中保持一致。提示词结构如下:

  • 主体与身份:明确说明元素是什么——角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体格、种族(如果指定)、显著特征、声音)。
  • 特征细节:描述元素的特定关键视觉特征。优先考虑必须在各镜头中保持一致的特征:
    • 角色:面部特征(眼睛形状、下颚线、发型/颜色)、化妆和造型(如果相关)、服装和配饰(材质、剪裁、颜色、状况)。
    • 道具/物体:形状、材质、颜色、尺寸、状况(新的/风化的/损坏的)、独特的标记。
  • 情绪/情感基调:描述定义场景的情感基调(例如:紧张、忧郁、希望、宁静、不安、温暖、压抑、恐惧、怀旧、孤立、亲密)。
  • 在项目 --sref 行下方生成首轮英雄角色和重要道具外观(见下文)。
    • --sref (所有 Midjourney V7 调用): 在主提示词文本之后,附加 --sref 和一个或多个以空格分隔的整数。遵循 Final_Video_Spec / storyboard_designer;验证每个 token 是否为 0–4294967295;将用户输入规范化为以空格分隔的形式。如果未设置,选择一个代码,记录它,并在 MJ 的所有地方重用它。

如果目标角色是 key_frame

  • key_frame (Nano Banana) 是个例外:这里不要应用核心 6 条规则。沉重的电影叙事会导致 Banana 忽略或对抗 MJ 参考图像,导致它重绘整个帧。优先仅使用槽位标签 + 故事板脚本对齐。
    核心规则: 故事板中的镜头描述是关于此静态图像中必须发生什么(谁、哪里、动作、镜头节奏)的脚本。提示词只需要添加最少的路由文本,以便模型使用 MJ 元素图像作为参考并针对该节奏进行微调——而不是用文字进行第二次全面的内容和风格处理。如果你详尽地描述你期望的外观和内容,Banana 倾向于重新生成图像,而不是保持 MJ 的风格锁定。

理想的提示词模式(简短):
Reference environment texture Element_Dark_Void_img, and style Element_Glowing_Cube_img.
(然后仅添加故事板脚本所要求的内容,例如主体位置或“cube centered, static, push in before”——保持简短。)

视频生成提示词
在视频提示词中,为每个参考图像命名角色,以便 Seedance 可以正确读取面部和造型。使用产品的图像标签 (<<<image_1>>>, <<<image_2>>>)。模板:Subject 1 — 面部特征参考 <<<image_1>>> (头部特写);发型、化妆和服装参考 <<<image_2>>> (全身照)。对于 Subject 2,继续编号(例如 <<<image_3>>> 头部特写,<<<image_4>>> 全身照,依此类推)。
然后使用下面的 Seedance 序列(镜头 → 主体 → 空间 → 音频)附加动作/动态提示词:
在书面提示词中遵循此顺序:

  1. 镜头 — 运动或摄像机/剪辑变化(例如:static → push in, cut to new angle, orbit, pan)。
  2. 主体 — 动作和表情(谁做了什么,面部节拍)。
  3. 空间 — 位置或环境变化(主体或摄像机相对于空间的位置;背景运动;深度/布局转换)。
  4. 音频 — 对白(如有)、音效,以及模型缺席时的音乐(见下文说明)。动作细节
  • 在相关时基于特定身体部位的动作:手、腿、头、肩膀等。
  • 添加程度:幅度、速度、力度(例如:slowly raises one hand, snaps head left, pushes hard off the ground)。
  • 对于一个提示词中的多个节拍,按主要动作到次要动作(按故事的时间顺序)列出。多节拍和“镜头 1 / 镜头 2”(官方指南)
  • 当工具接受长提示词时,你可以在一次生成中标记 Shot 1, Shot 2, Shot 3 以指示镜头序列或故事节拍。
  • 精确的时钟计时(例如“0–3 s”, “3–6 s”)无法可靠执行——不要按精确的秒数范围硬性拆分提示词,也不要编写精确到秒的计划(例如“at 2 s…”, “from 5–8 s…”)。描述按顺序发生的事情,而不是按时间划分的镜头列表。可选修饰符(当简报是真人实拍时):可以根据其他策略规则添加轻微的手持微抖动或细微的胶片颗粒——使其从属于上述四个层的顺序。特殊角色约定(针对 Seedance 2.5(分辨率 480p))Seedance 接受自然语言提示词;这些包装器帮助模型分离音乐、音效、对白和屏幕标题文本:
  • 音乐(所播放内容的描述):(...),例如 (fast-paced rock playing in the background)。
  • 音效:<...>,例如 <distant dog barking>。
  • 口语对白:{...},例如 {Hello, world} — 如果对白行不是项目的主要语言(例如英语视频中的日语台词),请在括号前标记语言,例如 Says in Japanese: {こんにちは}。
  • 屏幕标题 / 章节 / 字幕文本:【...】,例如 【Chapter One: Departure】
  • 对于涉及单个镜头内高度复杂或多阶段动作的特殊说明:你必须按顺序描述序列。你可以使用“cut to”标签来指示过渡(shot A..., cut to shot B..., cut to shot C...)。
    • 示例:Shot1: <<<image_1>>> his hands carefully open a dusty wooden box, with the sound of a soft creak. <<<image_1>>> His expression is focused and curious. The camera is a fixed shot, and the background attic is static. Shot2: cut to a bright blue light emanates from the artifact inside, casting an ethereal glow on his face and creating long, shifting shadows in the room. <<<image_1>>> His expression changes from focused to shocked awe as the camera begins a slow zoom in on his face. Shot3: cut to <<<image_1>>> he looks up with determination, the blue light reflecting in his eyes, as he slightly turns his head to the left to look past the camera. (no dialogue, no music, no subtitles)

注意: 你必须始终在提示词中包含以下负面约束,以确保后期制作的输出清晰:

  • 如果故事板脚本表明该镜头有单独的旁白音轨,请不要在视频提示词中写入旁白文本,以避免音频冲突。
  • 为防止模型添加不必要的背景音乐,你几乎应该始终包含 'no music'。
  • 字幕是在后期制作剪辑中添加的,因此你必须始终包含 'no subtitles'。
5. 動画編集

按故事板和时间轴的顺序组装所有镜头、旁白音轨和背景音乐;当剪辑就绪时引导用户导出。
如果最终镜头没有屏幕对白或旁白,请在剪辑中将该镜头/视频层的嵌入音频静音,并依赖于音频层(按照设计的 BGM/SFX),这样镜头生成的音频就不会与混音冲突。