yeha.ai
목록으로

Miniature world creative film

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

适用于以微缩模型场景为舞台、讲述有人物弧光的温柔情感短片(如节日祝福、生活故事);画面呈现移轴摄影美学,配轻音乐 BGM,视频比例 9:16,目标时长 60s~90s。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

目标

以微型道具与模型场景为舞台,讲述有人物弧光的温柔小故事。画风精致细腻,镜头语言克制,适合情感短片与节日祝福视频。

阶段 0 — 规格确认(必须首先完成,不得跳过)

在做任何内容规划之前,先向用户展示以下选项,收到明确选择后方可继续:
① 画面比例(单选)

  • 9:16(竖屏,推荐·适合手机观看)
  • 16:9(横屏,适合宽屏播放)
  • 1:1(方形,适合社交媒体)

② 视频分辨率(单选)

  • 480p(标准画质,所有用户可用)
  • 1080p(高清,需要会员

③ 目标时长(单选)

  • 60s(精简版,约 20~24 个镜头)
  • 90s(标准版,约 28~36 个镜头)
  • 自定义(用户输入秒数)

④ 图片生成模型(单选,用于关键元素图)

  • GPT Image 2 — 推荐,微缩场景写实感与细节还原最佳
  • Nano Banana Pro(Gemini 3 Pro Image)— 提示词跟随强,复杂布局出色
  • Nano Banana 2(Gemini 3.1 Flash Image)— 速度较快
  • Seedream 4.5 — 风格化强
  • Midjourney V7 — 美学出色,一致性略弱

⑤ 视频生成模型(单选,用于分镜视频)

  • Seedance 2.5(分辨率 480p) — 推荐,画质最佳(需要会员
  • Seedance 2.5(分辨率 480p) — 速度较快(需要会员
  • Kling 3.0 Omni — 无会员可用

收到用户选择后,通过 text_editor 建立 Final_Video_Spec.md,写入以下参数:

  • 视频类型:微缩生活故事片(情感短片)
  • 画面比例:[用户选择]
  • 目标时长:[用户选择]
  • 视频分辨率:[用户选择]
  • 图片生成模型:[用户选择],分辨率 2K
  • 视频生成模型:[用户选择],分辨率 [用户选择]
  • 视觉风格:微缩模型摄影风格,移轴镜头感,精致细腻,色调温暖柔和
  • 音频风格:轻音乐 BGM(钢琴/弦乐为主),温柔旁白或无旁白
  • 输出语言:与用户交互语言保持一致
    强制暂停(Checkpoint 0):规格写入 Final_Video_Spec.md 后,向用户展示已确认参数摘要,请用户确认无误。收到明确确认前不得进入阶段 1。

阶段 1 — 故事脚本规划 → 调用 storyboard_designer

  1. 引导用户提供故事梗概,或由 AI 自动起草(人物、场景、情感弧光)。
  2. 调用 storyboard_designer 完成:
    • 关键元素定义(主角、配角、主要场景、核心道具)
    • 分镜规划(景别、运镜、时长、叙事节奏;时长参数对齐 Final_Video_Spec.md)
    • 音频层设计(BGM 条数、旁白规则)
      强制暂停(Checkpoint 1):将完整故事脚本与分镜方案展示给用户确认,包括每个镜头的景别、运镜、叙事内容摘要。收到明确确认前不得进入下一阶段。

阶段 2 — 关键元素图生成 → 调用 media_generator

  1. 优先生成所有角色关键元素图(正面参考图 + 动作/表情变体);使用 Final_Video_Spec.md 中指定的图片生成模型。
  2. 生成场景关键元素图(微缩街景、室内布景等)。
  3. 如有旁白,在此阶段同步生成旁白音频(text to narration),供后续视频生成时作为音频条件输入。
    强制暂停(Checkpoint 2):所有元素图生成完毕后集中展示给用户,确认角色造型与场景风格符合预期。如用户要求重新生成某张图,按需重生成后再次确认。收到明确确认前不得进入视频生成阶段。

阶段 3 — 分镜视频生成 → 调用 media_generator

  1. 按分镜顺序批量生成所有镜头视频,无需逐批暂停确认;所有镜头均须携带对应角色图与场景图作为视觉参考,使用 Final_Video_Spec.md 中指定的视频生成模型。
  2. 主力工具:MultiModalToVideo;同工具所有模型均失败后方可降级至 FirstFrameToVideo
  3. BGM 生成:调用 text_to_instrumental,与视频生成并行进行。
    强制暂停(Checkpoint 3):所有镜头视频与 BGM 全部完成后,集中展示给用户预览确认,再进入组装阶段。

阶段 4 — 粗剪预览 → 调用 video_assembler

  1. 将所有镜头视频、旁白音频、BGM 组装为粗剪时间线。
  2. 告知用户以「粗剪预览」形式播放,请确认整体节奏与情绪是否到位。
    强制暂停(Checkpoint 4):收集用户反馈。如有修改,按需返回对应阶段调整后再次组装;确认满意后进入最终输出。

阶段 5 — 最终输出

  1. 确认所有资源就绪后,调用 video_assembler 进行最终合成。
  2. 告知用户点击「导出」完成最终成片下载。

依赖关系

阶段 0(Checkpoint 0)→ 阶段 1(Checkpoint 1)→ 阶段 2(Checkpoint 2)→ 阶段 3(Checkpoint 3)→ 阶段 4(Checkpoint 4)→ 阶段 5

旁白音频生成(阶段 2)须早于视频生成(阶段 3)完成,以便作为音频条件输入。BGM 生成与分镜视频生成(阶段 3)可并行推进。

2. 멀티모달 분석

用户上传图片分析

若用户上传参考图片(如真实微缩摄影、手办照片、场景布景图),分析时须提取:

  1. 视觉风格特征:色调、光线方向、景深程度、材质质感
  2. 构图规律:景别、视角(俯拍/平视/仰拍)、画面重心
  3. 微缩感来源:是否使用移轴效果、虚化程度、道具比例关系
  4. 可复用元素:角色造型、场景空间结构、核心道具
    分析结果须以「视觉参考摘要」形式输出,供后续分镜设计和提示词撰写使用。

用户上传视频分析

若用户上传参考视频,分析时须提取:

  1. 镜头结构:镜头数量、平均时长、景别分布
  2. 运镜习惯:推拉、横摇、跟拍等运镜频率
  3. 节奏特征:剪辑节奏与 BGM 关系(是否卡点)
  4. 情感弧光:开场 → 发展 → 高潮 → 收尾的情绪曲线

用户上传文档分析

若用户上传故事脚本或文字大纲,分析时须注意:

  • 不得篡改原始故事内容与节奏,忠实还原作者意图
  • 提取角色列表、主要场景、关键情节节点
  • 识别适合重点视觉化呈现的「画面感强」的段落
  • 输出结构化分镜建议(可供用户确认或修改)
3. 스토리보드 설계

主题 → 故事流程拆解指引

收到用户主题后,在展开具体分镜前,先将故事拆解为 4~6 个关键环节,形成完整叙事弧光骨架,再据此分配镜头。

拆解原则

  • 环节数量:建议 4 个(精简主题)~ 6 个(情节丰富主题),不得少于 4 个
  • 每个环节对应一个叙事功能节点,常见结构参考:
    • 建立世界触发事件情节推进情感高潮余韵收尾
    • 或针对具体主题拆分流程,如"节日礼物":寻找材料 → 制作礼物 → 包装等待 → 赠送惊喜 → 温暖余韵
  • 每个环节须包含:核心场景参与角色关键动作/道具情绪基调
  • 环节之间须逻辑连贯情绪递进,禁止出现无因果跳跃

输出格式(供内部规划,不对用户直接展示)
在调用 storyboard_designer 正式规划分镜前,先在内部形成如下结构:

环节一:[环节名称] — [场景] — [核心动作] — [情绪]
环节二:…

确认环节骨架合理后,再按各环节展开具体镜头设计(每环节通常对应 4~8 个镜头)。

主题 → 故事流程拆解指引

收到用户主题后,在展开具体分镜前,先将故事拆解为 4~6 个关键环节,形成完整叙事弧光骨架,再据此分配镜头。
拆解原则

  • 环节数量:建议 4 个(精简主题)~ 6 个(情节丰富主题),不得少于 4 个
  • 每个环节对应一个叙事功能节点,常见结构参考:
    • 建立世界触发事件情节推进情感高潮余韵收尾
    • 或针对具体主题拆分流程,如"节日礼物":寻找材料 → 制作礼物 → 包装等待 → 赠送惊喜 → 温暖余韵
  • 每个环节须包含:核心场景参与角色关键动作/道具情绪基调
  • 环节之间须逻辑连贯情绪递进,禁止出现无因果跳跃

输出格式(供内部规划,不对用户直接展示)
在调用 storyboard_designer 正式规划分镜前,先在内部形成如下结构:

环节一:[环节名称] — [场景] — [核心动作] — [情绪]
环节二:…

确认环节骨架合理后,再按各环节展开具体镜头设计(每环节通常对应 4~8 个镜头)。

关键元素(key_elements)规划原则

角色元素

  • 为每位主要角色建立独立 element,包含:
    • 正面全身参考图(清晰展示造型、服装、发型、肤色)
    • 表情 / 动作变体图(至少 1 张,展示情绪变化)
  • 角色须符合「微缩人偶」美学:比例略卡通化,材质感细腻(布料纹理、皮肤光泽),与模型场景自然融合

场景元素

  • 为每个主要场景建立独立 element,包含:
    • 全景参考图(展示空间结构、光线氛围、道具摆放)
    • 可根据剧情设置白天 / 夜晚变体

道具元素

  • 故事中有叙事功能的核心道具(如信件、花束、小桌子)单独建立 element,确保跨镜头一致

分镜(shot_list)设计规范

时长节奏

  • 单镜头建议时长:4s~8s
  • 整片目标时长:60s~90s,通常包含 20~36 个镜头
  • 情感高潮镜头可适当延长至 10s

景别与运镜

  • 开场:大远景或俯瞰全景,建立微缩世界的空间感(移轴感强)
  • 叙事推进:中景为主,展示角色互动
  • 情感特写:面部近景或道具特写,捕捉细节与情绪
  • 运镜克制,以缓慢推拉、轻微横摇为主;避免快速剪辑破坏温柔氛围

叙事结构

  • 遵循「开篇建立世界 → 情节展开 → 情感高潮 → 余韵收尾」四段式
  • 每个分镜描述须包含:景别、摄像机运动、画面内容、角色情绪、与前后镜头的叙事关联

尺寸一致性与动作主体规则(跨镜强制执行)

  • 大道具须众人合力:凡尺寸远大于单个人偶的道具(如咖啡杯、信封、花盆),描述时须明确"多人合力"完成操作;禁止出现单人轻松使用大型道具的描述,避免生成时出现比例失调的巨大手臂或人物。
  • 动作必须对应具体主体:每个动作须明确是谁(哪位角色,或"两人一同")在执行,禁止使用"有人""某人"等模糊表达。
  • 禁止违背常理的元素:不得出现发光道具、悬浮物体、骑乘虫类等破坏微缩写实感的内容。
  • 跨镜一致性:同一角色的服装、发型、道具状态须在所有分镜描述中保持一致;场景内固定道具的位置不得无故移位。

音频层(audio_layers)设计规范

BGM

  • 1~2 条 BGM 轨道(开场 + 高潮可切换)
  • 风格:钢琴独奏 / 钢琴+弦乐,轻柔温暖,无人声
  • 时长须覆盖整片,渐入渐出

旁白(可选)

  • 如使用旁白,须在分镜设计阶段标注旁白文本对应的 shot_id
  • 旁白语气:温柔叙事,第三人称或第一人称均可
  • 注意:使用 FirstFrameToVideo / VideoInterp 生成的镜头自带音频,该类镜头的旁白轨道须静音或错开,避免重叠
4. 미디어 생성

全局视觉风格基调

所有图像与视频资产须保持统一的「微缩模型摄影」美学:

  • 移轴镜头浅景深,远景虚化明显
  • 色调温暖(暖白 / 奶茶色 / 金黄)或冷调梦幻(薄荷蓝 / 月光白)
  • 材质感精致:布料纤维可见,木质纹理清晰,玻璃反光真实
  • 光线柔和漫射,避免硬阴影

图像生成

工具:TextToImage / ImageToImage
模型与分辨率:以 Final_Video_Spec.md 中"图片生成模型"字段为准,分辨率 2K

  • 若用户未明确选择,默认使用 GPT Image 2,分辨率 2K

角色参考图规格(强制)

  • 每位角色生成一张 16:9 横版拼接参考图,画面分为左右两区:
    • 左侧:人脸大头照(头颈肩特写,清晰展示面容、发型、肤色、妆容)
    • 右侧:全身三视图(正面、侧面、背面并排,完整展示服装、鞋履、轮廓剪影)
  • 分辨率:2K;比例:16:9(横版)
  • 生成第 2 个及之后角色图时,必须以第 1 张角色参考图为 image reference(ImageToImage),确保角色间造型风格统一

场景图强制参考规则

  • 场景图生成时,如已有风格参考图,须以其为参考保持视觉统一

视频生成

主力工具:MultiModalToVideo
模型与分辨率:以 Final_Video_Spec.md 中"视频生成模型"与"视频分辨率"字段为准

  • 若用户未明确选择,默认使用 Seedance 2.5(480p)
  • 同工具全部模型失败后,降级至 FirstFrameToVideo(Google Veo3.1 Fast,720p)

Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p) — 多镜头自动分镜规则**

  • 当使用 Seedance 2.5(分辨率 480p) 或 Seedance 2.5(分辨率 480p) 生成视频,且项目包含多个分镜时,须启用自动分镜功能,将整体内容拆分为若干段,每段时长不超过 30 秒,分段生成后再由 video_assembler 拼接。
  • 每段 prompt 内可利用 Seedance 2.5 的多镜头描述能力,在单次生成中包含内部切换(camera cuts);每段最长 30s,不得超出模型限制。
  • 拆分依据以 Storyboard shot_list 中的叙事节奏为准:优先在叙事环节分界点处切割,避免在情感高潮或关键动作中途强行断开。

参考绑定强制规则

  • 每个含角色的镜头,必须将对应角色关键元素图作为视觉参考输入
  • 每个含场景的镜头,必须将对应场景关键元素图作为视觉参考输入
  • 若该镜头已生成旁白音频,须将旁白音频作为 Seedance 2.5(分辨率 480p) 的音频条件输入,驱动角色口型与情绪

单镜头时长参考

  • 普通叙事镜头:4s~6s
  • 情感高潮 / 特写镜头:6s~8s
  • 余韵收尾镜头:8s~10s

旁白生成(可选)

工具:text to narration
推荐模型:ElevenLabs v3

推荐音色参考(按情绪选用):

  • 温柔女声叙事:Xiaoxi(Voice ID: 9DMBSOAnMDPiFAsz1ZGK)
  • 温暖男声叙事:Jin(Voice ID: vZZLclMx4wouUtKBRfZn)
  • 中性清澈女声:Sage(Voice ID: APSIkVZudNbPAwyPoeVO)

旁白音频须在视频生成前完成,以便作为音频条件输入。

BGM 生成

工具:text_to_instrumental
推荐模型:Suno 5(备选:Mureka 8)

  • Suno 5 的 prompt 中不可出现知名音乐人姓名
  • BGM 时长须覆盖整片目标时长,建议生成 90s 以上

模型失败处理规则

  • 某模型失败时,优先在同工具内切换其他模型重试
  • 同工具所有模型均失败,方可降级至备用工具
  • 禁止私自跨工具替代(如用 TextToVideo 替代 MultiModalToVideo)
5. 프롬프트 작성

图像提示词结构(TextToImage / ImageToImage)

默认模型:GPT Image 2,分辨率 2K(如 Final_Video_Spec.md 中指定其他模型则以规格文件为准)
图像 prompt 按以下四层依序组装:
① 主体描述:明确说明画面核心内容(人物、场景、道具),指定比例关系与尺寸感(如"与人偶等高的咖啡杯"、"众多小人合力推动的圆形岩石")
② 微缩模型美学基调(每张图必须包含)

实拍风格的微缩世界场景,移轴摄影效果,浅景深,前景与远景轻微虚化,中间主体清晰,真实材质质感,高细节,超清摄影,自然光,柔和散景
或英文版本(GPT Image 2 可使用中英双语,选一即可):
live-action style miniature world, tilt-shift photography, shallow depth of field, foreground and background softly blurred, subject in sharp focus, realistic material texture, highly detailed, ultra-sharp photography, natural light, soft bokeh

③ 光线与色调(按场景选用)

  • 日间温暖 / 黄昏金光:温暖电影感光影,金色夕阳斜射,水面金色反光,warm cinematic lighting, golden hour glow
  • 清晨柔光:gentle morning diffused light, soft warm daylight, pale golden atmosphere
  • 夜晚梦幻:soft moonlight, warm candlelight glow, tiny fairy lights bokeh
  • 室内精致:soft overhead studio light, pastel ambient light, creamy white light

④ 氛围收尾词(按需选用)
梦幻宁静氛围 / dreamy tranquil atmosphere / cinematic mood / warm and cozy feeling
场景图 prompt 完整示例(参考格式)

实拍风格的微缩世界场景,[主要角色/道具+动作+尺寸对比],[具体场景环境细节,如湖边草地、苔藓碎石、圆润岩石],[光线时段,如黄昏日落,金色夕阳从远处山脉后方照射过来],[远景描述,如起伏绿色山丘、模糊森林],移轴摄影效果,浅景深,前景和远景轻微虚化,中间主体清晰,温暖电影感光影,梦幻宁静氛围,高细节,真实材质,超清摄影,自然光,柔和散景。
角色参考图规范(16:9 拼接图)
生成角色参考图时,须明确指定 16:9 横版单张图,画面左右分区描述如下:

  • 左侧(人脸大头照):left half: close-up portrait of [角色名] as a miniature figurine, [发型+发色], [服装上半身], delicate facial features, soft skin texture, sharp focus on face
  • 右侧(全身三视图):right half: three-view full-body sheet of the same character — front view, side view, back view arranged horizontally, full costume including shoes, clear silhouette, same miniature figurine aesthetic
  • 整体收尾:single image, 16:9 aspect ratio, plain neutral background, 1:12 scale model aesthetic, highly detailed craftsmanship, no text labels

负向提示词(所有图像均须附加)
no subtitles, no text, no watermark, no harsh shadows, no blurry faces, no distorted proportions, no cartoon style, no anime style, no 3D plastic look

视频提示词结构(MultiModalToVideo — Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p))

每条视频 prompt 按以下四个区块依序组装,区块间顺序不得颠倒:

区块一:全局视觉与美学基调(每条 prompt 必须包含,内容可按故事风格调整)

描述本镜头所在整体世界的视觉锚点,至少涵盖:

  • 美学风格:微缩模型摄影风格(diorama / tilt-shift miniature photography),精致手工质感,非写实非动漫
  • 镜头与景深:微距移轴镜头,焦外呈奶油感圆形散景(creamy circular bokeh),浅景深
  • 色彩与光照:按场景选用色调词库中的具体描述(如"温暖金黄漫光,奶茶色调,窗边柔光形成轻微丁达尔效应");避免硬阴影

示例:微距移轴摄影,微缩模型世界,浅景深,焦外奶油散景,温暖金黄漫光,奶茶色调,精致手工质感,非写实非动漫

区块二:人物与场景资产锚定(参考图绑定)

将本镜头涉及的角色与场景关键元素图以 <<<image_N>>> 占位符逐一声明,并说明每张图对应的资产身份,顺序须与 media_generator 传入的图片顺序一致:
<<<image_1>>> 作为主角 [角色名],[简要体态/服装/情绪状态描述]
<<<image_2>>> 作为配角 [角色名],[简要体态描述]
<<<image_3>>> 作为场景背景 [场景名],[光线/空间氛围说明]
同时在此区块末尾写明当前镜头的尺寸对比锚定句,突出微缩感:

  • 凡涉及大于人偶身体的道具,须标注"众多人偶合力"操作,并用形容词突出尺寸落差(如"巨大的咖啡杯盖"、"与人偶等高的信封")

区块三:剧本与动作时间线

按时间段拆分镜头内的画面内容,每段至少包含镜头机位视觉画面(前景 / 主体 / 背景三层)、听觉声效三个子项。使用如下固定格式:
[00.0s - XX.Xs]\

  • 镜头机位:[景别 + 运镜,如:近景,缓慢推进]\
  • 视觉画面:\
    • [前景]:[失焦前景元素,如道具边缘、人偶轮廓]\
    • [主体]:[焦点内的核心动作,动作须指定具体角色,不得用"有人/某人"]\
    • [背景]:[虚化背景氛围,如温暖光斑、模糊场景细节]\
  • 听觉声效:[环境音 + 动作音效描述;若有旁白/对白,注明"对白轨"或"旁白轨同步",不重复写入台词全文]
  • 时间段划分须对齐 Storyboard 中该 shot 的规划时长(4s~10s),段落数量通常 1~3 段
  • 旁白(narration)严禁写入视频 prompt:旁白必须通过配音模型(text to narration)单独生成,作为独立音频轨道;视频 prompt 的听觉声效部分只允许写入环境音效与角色对白,不得出现任何旁白台词文本;prompt 末尾须附加 no music, no narration
  • 若镜头内有角色对白且使用 Seedance 2.5(分辨率 480p),用 {对白内容} 格式嵌入 prompt 正文对应动作位置,驱动口型同步;音效用 <音效描述> 格式标注

区块四:生成约束与负向提示词

每条视频 prompt 末尾必须附加以下固定负向约束,并可根据镜头内容追加特定项:
固定负向(必须包含)

  • no subtitles, no text overlay, no watermark
  • no music, no background music, no narration, no voiceover
  • no fast cuts, no shaky camera
  • no cartoon style, no anime style, no 3D plastic look, no clay feel
  • no oversized human hands, no giant figures inconsistent with miniature scale
  • no floating objects, no glowing props, no physically impossible actions

按镜头追加(如适用)

  • 若镜头无角色:no human figures
  • 若镜头为纯特写:no wide-angle distortion
  • 若镜头为夜间场景:no overexposed highlights

视频提示词 — 镜头语言词库

效果描述词缓慢推进slow push-in, camera gently moves closer轻微横摇slow pan right/left, gentle horizontal sweep俯拍全景top-down overhead shot, bird's-eye view of miniature world跟随移动smooth follow shot, tracking the character gently锁定定镜static lock-off, camera holds still微微仰拍low-angle shot, slight upward tilt

旁白文案风格建议

  • 语气:温柔、克制、有留白感
  • 句式:短句为主,适当留停顿
  • 参考示例:「那一天,阳光把整个小镇都染成了金色。他站在门口,等了很久。」
6. 동영상 조립

轨道规划

  • 视频轨道:按分镜顺序排列所有镜头片段
  • BGM 轨道:铺满全片,渐入(前 2s)渐出(后 2s)
  • 旁白轨道(如有):对齐对应镜头的时间码

音量规范

  • BGM:整体音量控制在背景感(约为旁白音量的 40%~60%)
  • 旁白:清晰可辨,为主要音量层
  • 视频原生音频(FirstFrameToVideo / VideoInterp 生成的音效):根据叙事需要保留或静音

特殊规则

  • 对口型视频(如使用 ImageToVideoByAudio 生成):不得对视频片段进行变速处理,否则口型与音频将错位
  • 含 BGM 的 MV 类剪辑:须将视频轨道原生音频静音,只保留 BGM 音频轨道
  • 旁白与自带音效镜头共存时:须将该镜头的视频原生音频静音或降低至极低音量,以旁白为主

粗剪 vs 最终输出

  • 第一次组装定性为「粗剪预览」,用于节奏与情绪确认,不作为最终成片
  • 用户确认粗剪满意后,方可定性为「最终输出」并告知导出
  • 系统不支持添加屏幕字幕、复杂转场、独立音效(SFX),如有需求建议导出后用专业软件处理