Visual aesthetic film
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
基于美学的艺术短片创作。流程:MJ + Seedance 2.5(分辨率 480p)。在关键阶段暂停以供用户确认;通过一次性成片流水线实现人机协作。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
完整视频的阶段逻辑与依赖关系:
- 编写
Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、语言、模型偏好)→ text_editor。 - 生成故事板 (shot_list, audio_layers) → storyboard_designer。
- 每个镜头生成一张关键帧图像 → media_generator。
- 为每个镜头生成最终视频;参考该镜头的关键帧(步骤 3)→ media_generator。
- 基于故事板生成所有 audio_layers → media_generator。
- 所有资源就绪后进行最终剪辑;引导用户导出 → video_assembler。
依赖关系: 2→1;3→2;4→3;5→2;6→2,3,4,5。
注意 — 用户提供或现有的素材(主要影响步骤 3–5): 在填充生成内容之前,请先通过 media_generator 将其绑定并分配到对应的故事板位置;避免重复生成用户已提供的素材。
何时暂停: 不要一次性跑完全部步骤。在上述每个关键阶段(例如:规格确定后、故事板完成后、元素图像完成后、关键帧完成后、镜头视频完成后、音频完成后)停下,与用户确认,然后再进行下一步。在继续之前,请使用卡片或 reply_to_user 邀请用户进行审阅。
在确定Final_Video_Spec以及素材生成前 ,需要和用户确认使用MJ生成美学风格图片的路径:
- 路径一:
使用提示词描述确定风格。如果用户明确了风格专有名词或风格偏好,将风格描述记录在Final_Video_Spec中,并在后续的元素生成中始终复用风格描述词。 - 路径二:使用sref code作为风格标杆。
通过--sref代码构建故事板规划中的内容,而不是将Final_Video_Spec的风格重写进每一个 MJ 提示词中。--sref选择规则:- 询问用户是否有 Midjourney V7
--sref风格代码。否则,由代理选择代码(通常在 0–4294967295 范围内有效随机/贴合内容);记录所用代码,并在项目中后续的 MJ 调用中重复使用,除非用户更改。 - 使用
--sref <code1> <code2> …,token 之间用空格分隔(例如--sref 5877700996 4815442863 …)。每个值必须是 0–4294967295 之间的整数。多个代码可以堆叠。 如果用户提供了多个代码,请记录完整列表并在所有 MJ 元素工作中重复使用。在没有用户偏好而需要自行发明代码时,除非用户明确要求堆叠,否则优先选择一个自动生成的整数以保持简洁。
- 询问用户是否有 Midjourney V7
2. 絵コンテ設計
如何设计镜头
- 每个镜头描述必须包含:
- 场景: 引用地点/布景(使用场景元素 ID,例如
[Element_Office_Noir])。 - 叙事内容: 角色和关键物体的动作与动态;台词和表演。写出确切台词(口述对白或内心独白 / OS)。通过元素 ID 引用角色。
- 镜头语言: 景别(例如:全景、中景、特写)、摄像机角度(例如:仰拍、俯拍)、摄像机运动(例如:固定、摇摄、推轨)。
- 场景: 引用地点/布景(使用场景元素 ID,例如
如何设计独立音频
- 背景音乐: 设计至少一个全局背景音乐。如果视频较长(例如 3 分钟或更长)且有清晰的幕间或转折点,可以规划多段音乐(每段都有自己的
audio_id和作用范围)。 - 旁白: 如果使用画外音或旁白来解释或推进故事,请在此设计(类型设为
narration)。定义声音特征、语气和确切的脚本;使用layout_instruction将其限定在相关的镜头范围内。
3. 素材生成
关键元素图像生成
加载用户选择的生成路径
路径一:如果用户明确了风格专有名词或风格偏好,使用记录在Final_Video_Spec中的风格作为提示词中的风格描述。
路径二:使用sref code作为风格
通过 --sref 代码构建故事板规划的首帧,而不是将 Final_Video_Spec 的风格重写进每一个 MJ 提示词中。
- TextToImage。推荐模型:Midjourney V7。
- 提示词规则: 描述内容(人物/事物/地点、可辨识的轮廓、环境)。根据下述规则附加
--sref。不要将规格文档中关于“预想视频/图像风格”的长篇大论塞进 MJ,也不要将 MJ 步骤视为必须执行该文档的环节——sref + 主体/场景描述 就足够了。 --sref选择规则:- 询问用户是否有 Midjourney V7
--sref风格代码。否则,由代理选择代码(通常在 0–4294967295 范围内有效随机/贴合内容);记录所用代码,并在项目中后续的 MJ 调用中重复使用,除非用户更改。 - 使用
--sref <code1> <code2> …,token 之间用空格分隔(例如--sref 5877700996 4815442863 …)。每个值必须是 0–4294967295 之间的整数。多个代码可以堆叠。 如果用户提供了多个代码,请记录完整列表并在所有 MJ 元素工作中重复使用。在没有用户偏好而需要自行发明代码时,除非用户明确要求堆叠,否则优先选择一个自动生成的整数以保持简洁。
- 询问用户是否有 Midjourney V7
最终镜头视频生成
- MultiModalToVideo。输入:关键帧。推荐模型:Seedance 2.5,分辨率 480p。
4. プロンプト作成
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成的提示词 (TextToImage, ImageToImage)
所有图像提示词的通用原则
- 提示词不仅是描述“图像里有什么”,更像是专业的电影导演和调色师在向团队下达指令。
key_frame(Nano Banana) 是个例外: 这里不要使用长篇的6大核心原则。沉重的电影化文字会让 Banana 忽略或对抗 MJ 参考图,从而导致画面被重绘。优先使用“插槽标签 + 故事板对齐”——请参阅下文的key_frame部分。- 对于 Midjourney
key_elementTextToImage(风格/场景,角色/道具基底,大场景):必须应用“电影化提示词 6 大核心原则”。以流畅自然的英文段落撰写;不要输出为带标签的章节:- 专业风格术语:使用专业的艺术或电影术语配合风格词汇以提高准确度(例如:引入作者和特定的电影视觉锚点,使用
Neo-Noir style, David Fincher Style, inspired by Se7en作为风格锚点,而不是泛泛地只说Neo-Noir风格)。 - 构图与镜头:明确指出电影化构图(例如
Over-the-shoulder shot,Dutch angle)和景别(例如Close-up,Medium shot)。 - 光影:详细说明主光,并重点强调“负光”以产生对比度和戏剧性(例如
Strong chiaroscuro contrast,dramatic interplay of light and shadow, 或deep facial shadows emphasizing facial structure)。 - 调色:使用高端好莱坞调色来设定克制的色调(例如
deep teal-cyan shadows dominating 90%, zero warm fill或muted watercolor wash)。除非用户明确要求,否则不要使用红蓝霓虹冲突(例如禁止crimson bleed, 霓虹洋红 vs 青色)。将图像限制在一种主导色调中(约占画面 90%)——极致克制。 - 视觉渲染:描述整体视觉质量和纹理(例如:精细的渲染质量,丰富且错综复杂的细节,带有细微高斯模糊的柔焦效果)。
- 氛围与潜台词:描述角色的“潜台词”和微表情,将动作定格在戏剧性的瞬间(例如
oppressive suffocation,no mercy, 和predatory stillness)。拒绝僵硬、摆拍的姿态。对于无生命物体,描述它们的状态(例如:宿命感、穿透力的注视、寒冷且疏离的氛围)。 - 条件元素(仅在相关时包含):
- 准确的画面内文字:如果场景中出现文字(例如:屏幕上的文字),请自然地融合它。你必须用引号包裹需要渲染的确切文本内容以示强调。例如:'A neon sign in the background reads "DANGER".'。
- 专业风格术语:使用专业的艺术或电影术语配合风格词汇以提高准确度(例如:引入作者和特定的电影视觉锚点,使用
当目标角色为 key_element 时
提供清晰、详细的元素视觉定义,以确保其在各镜头间保持一致。提示词结构如下:
- 主体与特征:明确说明该元素是什么——角色、道具、场景或生物。对于角色,包含定义的身份特征(年龄、体型、种族(如指定)、显著特征、声音)。
- 特征细节:描述该元素特定的关键视觉特征。优先考虑必须在各镜头间保持一致的特征:
- 角色:面部特征(眼形、下颌线、发型/发色)、妆容和造型(如适用)、服装和配饰(材质、剪裁、颜色、状态)。
- 道具/物体:形状、材质、颜色、尺寸、状态(全新/风化/破损)、独特标记。
- 氛围/情感基调:描述定义场景的情感基调(例如:紧张、忧郁、希望、宁静、不安、温暖、压抑、恐惧、怀旧、孤立、亲密)。
- 只用当用户选择的是
路径二:通过sref code确认风格时,遵循以下规则:--sref(只应用在 Midjourney V7 调用): 在主要提示词文本后,附加--sref以及一个或多个以空格分隔的整数。遵循 Final_Video_Spec / storyboard_designer;验证每个 token 均在 0–4294967295 之间;将用户输入标准化为以空格分隔的格式。如果未设置,选择一个代码,记录下来,并在 全局生成MJ图的时候重复使用。
视频生成的提示词
在视频提示词中,为每张参考图命名角色,以便 Seedance 能正确读取面部和造型。使用产品的图像标签 (<<<image_1>>>, <<<image_2>>>)。模板:Subject 1 — 面部特征参考 <<<image_1>>> (头部特写);发型、妆容和服装参考 <<<image_2>>> (全身照)。对于 Subject 2,继续编号(例如 <<<image_3>>> 头部特写,<<<image_4>>> 全身照,等等)。
然后使用下方的 Seedance 序列(镜头 → 主体 → 空间 → 音频)附加动作/动态提示词:
在书写的提示词中遵循此顺序:
- 镜头 — 移动或摄像机/剪辑变化(例如:固定 → 推入,切至新角度,环绕,摇摄)。
- 主体 — 动作和表情(谁做了什么,面部神态)。
- 空间 — 位置或环境变化(主体或摄像机相对于空间的位置;背景运动;深度/布局转换)。
- 音频 — 对话(如有)、音效,以及模型缺失时的音乐(见下文说明)。动作细节
- 相关时基于特定身体部位的动作:手、腿、头、肩等。
- 添加程度:幅度、速度、力度(例如:缓慢抬起一只手,头向左猛转,用力蹬地)。
- 如果一个提示词中有多个节拍,按主要动作到次要动作的顺序列出(按故事发生的先后顺序)。多节拍 & "镜头 1 / 镜头 2" (官方指南)
- 当工具接受长提示词时,你可以在一次生成中标记镜头 1、镜头 2、镜头 3,以指示镜头或故事节拍的序列。
- 精确的时钟计时(例如 "0–3 s", "3–6 s")无法可靠执行 —— 不要按精确的秒数范围强行拆分提示词,也不要编写明确的逐秒计划(例如 "at 2 s…", "from 5–8 s…")。描述按顺序发生的事情,而不是按时间划分的镜头列表。可选修饰符(当简报是真人实拍时):可以基于其他策略规则添加轻微的手持微震或细微的胶片颗粒 —— 保持其从属于上述四个层的顺序。特殊角色约定 (针对 Seedance 2.5(分辨率 480p)) Seedance 接受自然语言提示词;这些包装符有助于模型区分音乐、音效、对话和屏幕标题文本:
- 音乐(描述播放内容):(...),例如 (fast-paced rock playing in the background)。
- 音效:<...>,例如 <distant dog barking>。
- 口述对话:{...},例如 {Hello, world} — 如果某句对话不是项目的主要语言(例如英语视频中的日语台词),请在花括号前标记语言,例如 Says in Japanese: {こんにちは}。
- 屏幕标题 / 章节 / 字幕文本:【...】,例如 【Chapter One: Departure】
- 对于涉及单镜头内高度复杂或多阶段动作的特殊说明:你必须按顺序描述序列。你可以使用 "cut to" 标签来表示过渡(镜头 A...,切换至镜头 B...,切换至镜头 C...)。
- 示例:Shot1: <<<image_1>>> his hands carefully open a dusty wooden box, with the sound of a soft creak. <<<image_1>>> His expression is focused and curious. The camera is a fixed shot, and the background attic is static. Shot2: cut to a bright blue light emanates from the artifact inside, casting an ethereal glow on his face and creating long, shifting shadows in the room. <<<image_1>>> His expression changes from focused to shocked awe as the camera begins a slow zoom in on his face. Shot3: cut to <<<image_1>>> he looks up with determination, the blue light reflecting in his eyes, as he slightly turns his head to the left to look past the camera. (no dialogue, no music, no subtitles)
注意: 你必须始终在提示词中包含以下负面约束,以确保输出适合后期制作:
- 如果故事板脚本表明该镜头有独立的旁白音轨,请勿在视频提示词中写入旁白文本,以避免音频冲突。
- 为防止模型添加不想要的背景音乐,你应该几乎总是包含 'no music'。
- 字幕是在后期制作剪辑时添加的,因此你必须始终包含 'no subtitles'。
5. 動画編集
按故事板和时间轴顺序组装所有镜头、旁白音轨和背景音乐;剪辑就绪后引导用户导出。
如果最终镜头没有镜头内对话或旁白,请在剪辑中将该镜头/视频层的嵌入音频静音,并依赖于音频层(按设计的背景音乐/音效),这样镜头生成的音效就不会与混音产生冲突。