yeha.ai
목록으로

Transcript-driven collage animation

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

用于将用户提供的逐字稿/口播稿转化为拼贴动画短片。适用场景:用户提供文字稿,要求 Agent 自主选取适合视觉化的观点并完成拼贴动画生产。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

触发与入口识别

  • 用户发送逐字稿/口播稿 → 自动进入「分析稿件→选点→生成」完整流程。
  • 用户说「拆解一下 / analyze this」→ 进入分析阶段(步骤 1)。
  • 用户说「动态化 / animate these」→ 进入动态化阶段(步骤 4),以已有静帧为输入。

完整流程(端到端)

步骤 1 — 稿件分析与选点(Planner 执行)
读取用户提供的逐字稿,从中提炼适合拼贴动画表达的观点:

  • 每个观点必须能凝练为「一个锋利想法 / 视觉双关」(如「时钟长翅膀 = 时间飞逝」)。
  • 优先选取对比强烈、可视化潜力高、有反差或隐喻的句子。
  • 每条稿件建议选取 3~5 个观点,输出简短说明并附上对应场景/视觉双关构想。
  • 向用户展示选点列表,暂停并确认:用户可删减、调整或追加,确认后再进入下一步。

步骤 2 — 锁定风格规格(Planner 用 text_editor 写入 Final_Video_Spec.md)
为本批次锁定品牌/风格参数,写入 Final_Video_Spec.md,包含:

  • 固定字段(全批次锁死):medium、halftone_density、cut_and_shadow、composition、motion 规格。
  • 每条可变字段说明:idea(视觉双关)、color_field(本条主色)、label_text(烧录文字,可空)。
  • 同一组视频禁止修改固定字段,只允许改变 idea / color_field / label_text。

步骤 3 — 生成 Storyboard 与静帧(交由 storyboard_designer,再交由 media_generator)

  • 先用 storyboard_designer 为所有确认观点设计 key_element 和 shot。
  • 再用 media_generator 为每个 shot 生成拼贴风格静帧。
  • 静帧全部生成后,暂停展示给用户,请用户标出满意/不满意的条目;不满意的条目调整 prompt 重跑,直到用户认可后继续。

步骤 4 — 动态化(交由 media_generator)

  • 对用户选定的静帧执行「从空→满」组装式动态化。
  • 全批次统一使用 MultiModalToVideo(MiniMax H3,768p) 路线,禁止切换视频模型、分辨率或改用帧插值。
  • 生成完毕后暂停,展示所有视频,等待用户验收。

步骤 5 — 最终组装与导出(交由 video_assembler)

  • 用户验收通过后,调用 video_assembler 对所有确认的视频片段执行组装与导出。
  • 按 video_assembler 中的规范执行:单条 6~10 秒、保留 12 帧定格节拍不做平滑、音频同步、无字幕叠加、保持 768p 分辨率导出。
  • 组装完成后向用户展示最终成片,确认无误即完成本批次。

步骤 6 — 规模化复用

  • 用户若提交新逐字稿,重复步骤 1~5,固定字段直接沿用 Final_Video_Spec.md,只更换可变字段。

节点控制

每个「暂停」都是强制检查点,必须等用户明确确认后才能进入下一步,不得自动贯穿整条流水线。

2. 멀티모달 분석

参考图分析(当用户上传拼贴海报参考图时)

将参考图拆解为以下结构化字段,输出「白话拆解 + 逐字段 JSON 规格」两件套:

白话拆解:

  • 主视觉:画面主体是什么、有哪些卫星元素
  • 色彩感:背景主色是什么、元素与背景的对比关系
  • 材质感:半调网点密度、轮廓线粗细、投影厚薄
  • 创意内核:这张图想表达的「一个锋利想法」是什么

逐字段 JSON 规格(供 media_generator 生产使用):
{
"medium": "混合媒介手作纸拼贴",
"color_field": "单一平涂纯色背景,主色 #XXXXXX",
"halftone_density": "(轻/中/重)网点,(报纸/杂志/照片)印刷质感",
"cut_and_shadow": "粗黑轮廓 + 手撕毛糙边 + 厚实柔和投影",
"composition": "(中心/分散/对角线)构图 + N 个卫星元素,留白(充足/紧凑)",
"idea": "一句话视觉双关",
"label_text": "画面内烧录的短标签(可空)",
"motion": "从空背景组装,12帧定格抖动,投影位移,轻微镜头平移"
}

自检: 分析时确认参考图是否满足拼贴动画四个静态特征(半调元素、干净裁切边缘+投影、平面纯色背景、一个锋利想法);若缺失某项,在白话拆解里明确标注「该图缺少 X 特征,生产时需补充」。

3. 스토리보드 설계

每条拼贴动画的 Storyboard 结构

每条动画对应一个独立 shot,不做多镜头叙事,所有视觉信息聚焦于「一个锋利想法」。

key_element 设计:

  • 主体元素(element character 或核心物件):描述半调材质、轮廓线、投影特征,以及与「视觉双关」的关系。
  • 背景色块(element scene):单一平涂纯色,指定主色色值,无光影 / 无景深 / 无渐变。
  • 卫星元素(element prop,3~5 个):标注各自的视觉功能(强化主题 / 构图平衡 / 增加信息量)。

shot 描述(必须包含以下四项):

  • 场景绑定: 引用对应 element scene ID。
  • 核心创意: 用一句话写出这条动画的视觉双关(即 idea 字段)。
  • 组装顺序(动态叙事核心): 明确描述从「空背景」到「完整画面」的搭建顺序——哪个元素先入场、从哪个方向飞入、如何卡位,最后哪个元素收尾。这是本类型最关键的运动设计,必须逐个元素写清楚,不可省略或笼统带过
  • 标签文字: 若有烧录进画面的短标签,注明内容和位置。

音频层(audio_layer):

  • 本类型通常不需要 VO 旁白;若用户要求配音,设计一条 narration 轨,并定义 narration_speaker_profile 与品牌调性对齐。
  • 背景音乐(music/bgm):若需要,指定风格(如:轻快纸质质感节拍、复古 lo-fi)。

视觉 DNA 自检(每条 shot 设计完后逐项核对):

  1. 开场是否为空背景?
  2. 是否包含半调网点 + 粗黑轮廓 + 厚实投影三项材质特征?
  3. 背景是否为单一平涂纯色(无光影 / 无景深)?
  4. 这条是否有且只有一个清晰的锋利想法?
  5. 组装顺序是否逐个元素写明了「从空到满」?
4. 미디어 생성

静帧生成(TextToImage / ImageToImage)

  • 使用 TextToImage,推荐模型:Nano Banana 2,分辨率 2K
  • 若同组中有前一条已确认的静帧,且风格需要高度一致,可用 ImageToImage 以前帧为 reference_image,保持材质/构图风格不变,只替换核心创意内容。
  • 生成前,将 Final_Video_Spec.md 中锁定的固定字段与本条 idea / color_field / label_text 合并,交由 write_media_prompt 撰写完整 prompt。

动态化路线(全批次统一)

视频路线 — prompt 驱动(MultiModalToVideo,推荐模型:MiniMax H3,768p):

  • 将已确认静帧作为 reference_image 输入。
  • 用视频 prompt 描述「从空背景开始组装」的完整过程(详见 write_the_prompt 规范)。
  • 若组装效果不干净,先简化单次入场元素数量、强化逐个元素的方向与卡位描述,再用同一 MiniMax H3 / 768p 配置重跑;不得切换模型、分辨率或改用帧插值。

一致性铁律: 同一组视频必须全程使用 MultiModalToVideo + MiniMax H3 + 768p,不得切换视频模型、分辨率或生成路线,否则质感断裂。

资产绑定

  • 每张确认静帧注册 asset_id,绑定到对应 shot 的 final_shot 槽位。
5. 프롬프트 작성

跑图 Prompt(TextToImage / ImageToImage,生成静帧)

固定前缀(每条必带,不可删减):

混合媒介手作拼贴艺术风格,复古剪纸质感。主体呈现为带有粗黑轮廓线的半色调印刷图片裁剪贴纸,边缘带有一点手工剪刀剪裁与撕裂纸张的毛糙边缘。背景由粗糙的燕麦纸、带有 distressed 痕迹的复古网格纸、以及旧报纸碎屑拼接而成。每一个重叠的卡纸图层之间都投下清晰、厚实的重叠投影,呈现出 3D 卡纸分层叠加的真实物理厚度感。扁平 2D 纸艺布局,保留纤维纸质纹理。禁止光滑的数码渐变,禁止精细 3D 渲染,禁止透视扭曲。

可变段(每条替换):

  • 主体/创意:本条视觉双关场景的具体描述(来自 storyboard shot 的核心创意)。
  • 色彩:本条 color_field,一整块平涂纯色背景,注明色值。
  • 标签文字:需烧录进画面的短标签(可空)。

关键词命中自检(写完后核对,六项必须全部覆盖):
半色调 / halftone、粗黑轮廓线、手工剪裁毛糙边缘、厚实重叠投影、扁平 2D 纸艺、纸质纹理。

MiniMax H3 视频 Prompt(MultiModalToVideo,768p 动态化)

固定前缀(每条必带):

12 帧定格动画风格运动,画面带有些许顿挫的节拍感。遵循手工剪纸的物理法则:画面中的各个卡纸元素在帧与帧之间产生微小的颤动、摇摆和晃动。重叠纸层下方的影子随元素移动产生微妙的动态投影位移,凸显 3D 叠纸的纵深空间感。背景的纸张纤维纹理和噪点在帧间闪烁起伏。微弱的镜头缓慢平移或视差漂移。保持扁平 2D 叠纸美学,禁止平滑的数码过渡动画,禁止 3D 空间畸变。

组装叙事段(每条必写,核心):

画面从空的纯色背景开始,[元素A] 先从 [方向] 滑入卡位,接着 [元素B] 从 [方向] 飞入……最终所有元素拼成完整场景。

  • 组装顺序直接从 storyboard shot 的「组装顺序」字段复制,必须逐个元素点名,注明入场方向和卡位动作;禁止笼统写「元素依次滑入」。
  • 已确认静帧以 <<<image_1>>> 形式绑定为 reference_image,在 prompt 中标注其用途(整体风格参考)。

动效关键词自检(必须全部出现):
12帧定格、顿挫节拍、帧间颤动/摇摆/晃动、动态投影位移、纸纹噪点闪烁、镜头平移/视差。

6. 동영상 조립

拼贴动画组装规范

  • 每条时长: 单条拼贴动画建议 6~10 秒;若有多条组成系列,每条独立导出,不自动拼接成长片。
  • 节奏: 组装动作与 12 帧定格节拍感在组装层保留原样,不做平滑处理,不加缓动曲线。
  • 音频同步: 若有 bgm 轨,第一个元素入场时间点与音乐强拍对齐。若同时有 narration (VO) 轨,确保二者不重叠。
  • 无字幕: 画面内文字已在静帧生成阶段烧录进图像,assembly 层不再叠加字幕层。
  • 导出: 保持生成分辨率(768p),不做超分处理。