yeha.ai
목록으로

Architectural assembly animation

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

基于用户上传的建筑参考图,生成建筑建模组装全过程的动态展示视频,组装过程可见内部结构,建筑模型自旋转,伴随光影变化、组装音效与欢快 BGM。使用 Seedance 2.5 720p 生成。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

Skill 激活时的引导流程

  • 激活后以友好简洁的语气向用户介绍本 Skill 用途:上传一张或多张建筑参考图,即可生成该建筑的建模组装动效视频——部件从天上掉落/从四周聚集/3D打印/剖面图/爆炸图/折叠展开/粒子汇聚/点云重建成型/线框骨架搭建组装,组装过程可见内部结构,模型自旋转,伴随光影变化、组装音效与欢快 BGM。
  • 引导用户上传一张或多张建筑参考图(必须至少上传一张),并告知用户可以选择成片比例与时长。
  • 所有需要用户确认或选择的位置(输入提示、方案确认、阶段暂停点),优先使用卡片形式交互。
    阶段流程与依赖
  1. 需求采集:用户提供建筑参考图后,无需对其输入信息做二次确认,直接进入选择环节。通过卡片让用户选择成片比例(21:9 / 16:9 / 9:16 / 4:3 / 3:4 / 1:1)与时长(整数秒,单 shot 上限 30s,超过 30s 自动拆分多 shot)。组装方式为固定提示词的一部分("从天上掉落/从四周聚集/3D打印/剖面图/爆炸图/折叠展开/粒子汇聚/点云重建成型/线框骨架搭建"),无需用户选择。
  2. 建立全局规格:根据采集结果,通过 text_editor 写入 Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、输出语言等全局参数)。
  3. 镜头设计:调用 storyboard_designer,设计组装动效镜头序列(组装方式、自旋转节奏、内部结构展示、光影、自由运镜、音效标注)。
  4. 视频生成:调用 media_generator,使用 MultiModalToVideo + Seedance 2.5 720p,以全部建筑参考图作为 reference_image 生成组装动效视频;按"单个分镜跑满 30s、最后一个分镜为剩余时长"拆分 shot;组装音效在视频提示词中描述,由视频原生音频承载。
  5. BGM 处理:若为单 shot(时长 ≤30s),BGM 由视频原生音频直接承载,跳过本步;若为多 shot(时长 >30s),调用 media_generator 使用 text_to_instrumental 单独生成欢快 BGM 音轨。
  6. 最终合成:调用 video_assembler,将视频组装为成片——单 shot 时 BGM 已含于视频原生音频,多 shot 时将独立 BGM 轨与拼接视频合成。
  7. 引导导出:向用户展示成片并引导导出。
    依赖关系:步骤 2 依赖步骤 1;步骤 3 依赖步骤 2;步骤 4 依赖步骤 3;步骤 5 仅在多 shot(时长 >30s)时执行,依赖步骤 2(可与步骤 4 并行);步骤 6 依赖步骤 4,多 shot 时另依赖步骤 5;步骤 7 依赖步骤 6。
    暂停点:在"视频生成完成 → 最终合成前"暂停一次。暂停时必须使用卡片提供明确选项供用户选择确认,禁止以纯文本提问方式让用户自由输入确认。暂停卡片只允许提供"继续下一阶段"类的确认选项,严禁在暂停卡片或任何环节让用户选择主体风格、建筑类型、立面风格或任何内容侧重——直接以用户上传的全部参考图作为输入,按上传顺序依次使用,不做筛选或重新分组。其余阶段连续执行。
    全程以用户交互语言输出。
2. 스토리보드 설계

镜头设计

  • 按"单个分镜跑满 30s,最后一个分镜为剩余时长"规则拆分:时长 ≤30s 时为单个 shot;超过 30s 时,每个 shot 取满 30s,最后一个 shot 取剩余时长(如 70s → 30s + 30s + 10s)。
  • 每个 shot 的 description 必须包含:
    • 组装方式:固定为"从天上掉落/从四周聚集/3D打印/剖面图/爆炸图/折叠展开/粒子汇聚/点云重建成型/线框骨架搭建"(写入提示词模板的固定文本,不由用户选择)。
    • 组装顺序:按结构层次自下而上(或由内而外)逐步组装,组装过程中内部结构(梁柱、框架、楼板等)清晰可见。
    • 自旋转:建筑模型在组装过程中持续自旋转,旋转速度平稳,确保各角度结构均可展示。
    • 光影:随组装进度与旋转角度,光影在建筑表面与内部结构上产生明暗变化。
    • 运镜:自由运镜——可环绕、推拉、升降,配合自旋转展示组装全貌与细节。
    • 音效标注:标注组装音效(部件落位声、机械拼接声等),由视频原生音频承载。
      音频层
  • BGM(多 shot 时):时长 >30s 时设计一条全局背景音乐音轨,风格为欢快、轻快节奏,贯穿全片;时长 ≤30s(单 shot)时 BGM 由视频原生音频承载,不单独建轨。
  • SFX:组装音效随镜头内动作发生,在 shot description 中标注,不单独建轨。
3. 미디어 생성

视频生成

  • 使用 MultiModalToVideo,模型固定为 Seedance 2.5,分辨率 720p
  • 时长与比例由用户选择(比例 21:9 / 16:9 / 9:16 / 4:3 / 3:4 / 1:1;每个 shot 时长 4–30s,总时长超过 30s 时按"单个分镜跑满 30s、最后分镜为剩余时长"拆分,最后一个 shot 不少于 4s)。
  • 参考图绑定:将用户上传的全部建筑参考图逐一注册 asset_id 并分别绑定为本 shot 的 reference_image;在提示词中以 <<<image_1>>> <<<image_2>>><<<image_n>>> 依次引用(n = 用户上传图片数),确保生成视频忠实还原参考图中的建筑形态与结构。
    BGM 生成
  • 单 shot(时长 ≤30s):BGM 由视频原生音频直接承载,视频提示词中以 music(...) 标记写入欢快 BGM 描述,无需单独生成 BGM 音轨。
  • 多 shot(时长 >30s):使用 text_to_instrumental 单独生成欢快 BGM 音轨,风格关键词:欢快、轻快、节奏明快、电子 / 管弦混合。BGM 提示词可自由发挥,不使用固定模板。
    SFX
  • 组装音效(部件落位、机械拼接等)通过视频提示词描述,由 Seedance 2.5 原生音频生成,无需单独音轨。
    Asset Binding Contract
  • manage_item_assets 合约操作;将每张建筑参考图逐一注册 asset_id 后绑定到对应 shot 的 reference_image 槽位。
  • 绑定前先 query_assets_info,绑定后重新查询验证;保留完整绑定数组。
  • 绑定类型由参考图的实际用途与计划镜头位置决定,不凭媒体标签推断。
4. 프롬프트 작성

视频提示词规则(MultiModalToVideo + Seedance 2.5)

  • 语言:提示词正文必须使用用户交互语言撰写——用户交互语言为中文时,提示词正文即为中文。<<<image_n>>> 引用语法与 <...> 音效标记不属于用户交互语言,不影响语言一致性判断。
  • <<<image_1>>> <<<image_2>>><<<image_n>>> 绑定用户上传的全部建筑参考图(n = 用户上传图片数),作为建筑外观与结构的参考依据;除这些参考图外,提示词中不引用任何其他用户输入图片。
  • 严格使用以下固定中文参考模板(一个变量:末尾音乐指令——见下方规则;模板其余文字固定不变,包括"从天上掉落/从四周聚集/3D打印/剖面图/爆炸图/折叠展开/粒子汇聚/点云重建成型/线框骨架搭建"原样保留,不做选择或替换):

<<<image_1>>> <<<image_2>>> … <<<image_n>>> 还原上述建筑参考图中建筑的建模组装全过程:部件从天上掉落/从四周聚集/3D打印/剖面图/爆炸图/折叠展开/粒子汇聚/点云重建成型/线框骨架搭建组装,组装过程能看到内部结构,组装过程建筑模型自旋转,光影。自由运镜。音效:<部件组装音效>。[末尾音乐指令]

  • 末尾音乐指令规则
    • 单 shot(时长 ≤30s):填入 music(...),括号内为自行设计的欢快 BGM 描述(风格、节奏、配器等自由发挥,不使用固定文本),BGM 由视频原生音频直接承载,无需单独生成 BGM 音轨。
    • 多 shot(时长 >30s):填入 no music,BGM 由 text_to_instrumental 单独生成后在合成阶段加入。
  • 音效标记:组装音效以 <...> 标记写入模板,由视频原生音频承载。
  • 字符总量(含 <<<>>> 标记)控制在 2300 字以内。
    BGM 提示词(text_to_instrumental)
  • BGM 提示词不属于上述固定模板,可自由发挥;风格方向为欢快、轻快节奏。
5. 동영상 조립

合成规则

  • 将生成的组装动效视频作为主视频轨,保留其原生组装音效。
  • 单 shot(时长 ≤30s):BGM 已由视频原生音频承载,无需额外 BGM 轨,直接输出成片。
  • 多 shot(时长 >30s):将 text_to_instrumental 生成的欢快 BGM 作为独立音频轨,贯穿全片,音量适中不压过组装音效;shot 之间使用简洁硬切或快速交叉溶解,保持组装连贯感。
  • 节奏与 BGM 节拍对齐,组装关键节点尽量踩在音乐重拍上。