yeha.ai
Back to templates

Transcript-driven collage animation

Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.

用于将用户提供的逐字稿/口播稿转化为拼贴动画短片。适用场景:用户提供文字稿,要求 Agent 自主选取适合视觉化的观点并完成拼贴动画生产。

Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.

Complete workflow

1. Planning

触发与入口识别

  • 用户发送逐字稿/口播稿 → 自动进入「分析稿件→选点→生成」完整流程。
  • 用户说「拆解一下 / analyze this」→ 进入分析阶段(步骤 1)。
  • 用户说「动态化 / animate these」→ 进入动态化阶段(步骤 4),以已有静帧为输入。

完整流程(端到端)

步骤 1 — 稿件分析与选点(Planner 执行)
读取用户提供的逐字稿,从中提炼适合拼贴动画表达的观点:

  • 每个观点必须能凝练为「一个锋利想法 / 视觉双关」(如「时钟长翅膀 = 时间飞逝」)。
  • 优先选取对比强烈、可视化潜力高、有反差或隐喻的句子。
  • 每条稿件建议选取 3~5 个观点,输出简短说明并附上对应场景/视觉双关构想。
  • 向用户展示选点列表,暂停并确认:用户可删减、调整或追加,确认后再进入下一步。

步骤 2 — 锁定风格规格(Planner 用 text_editor 写入 Final_Video_Spec.md)
为本批次锁定品牌/风格参数,写入 Final_Video_Spec.md,包含:

  • 固定字段(全批次锁死):medium、halftone_density、cut_and_shadow、composition、motion 规格。
  • 每条可变字段说明:idea(视觉双关)、color_field(本条主色)、label_text(烧录文字,可空)。
  • 同一组视频禁止修改固定字段,只允许改变 idea / color_field / label_text。

步骤 3 — 生成 Storyboard 与静帧(交由 storyboard_designer,再交由 media_generator)

  • 先用 storyboard_designer 为所有确认观点设计 key_element 和 shot。
  • 再用 media_generator 为每个 shot 生成拼贴风格静帧。
  • 静帧全部生成后,暂停展示给用户,请用户标出满意/不满意的条目;不满意的条目调整 prompt 重跑,直到用户认可后继续。

步骤 4 — 动态化(交由 media_generator)

  • 对用户选定的静帧执行「从空→满」组装式动态化。
  • 全批次统一使用 MultiModalToVideo(MiniMax H3,768p) 路线,禁止切换视频模型、分辨率或改用帧插值。
  • 生成完毕后暂停,展示所有视频,等待用户验收。

步骤 5 — 最终组装与导出(交由 video_assembler)

  • 用户验收通过后,调用 video_assembler 对所有确认的视频片段执行组装与导出。
  • 按 video_assembler 中的规范执行:单条 6~10 秒、保留 12 帧定格节拍不做平滑、音频同步、无字幕叠加、保持 768p 分辨率导出。
  • 组装完成后向用户展示最终成片,确认无误即完成本批次。

步骤 6 — 规模化复用

  • 用户若提交新逐字稿,重复步骤 1~5,固定字段直接沿用 Final_Video_Spec.md,只更换可变字段。

节点控制

每个「暂停」都是强制检查点,必须等用户明确确认后才能进入下一步,不得自动贯穿整条流水线。

2. Multimodal analysis

参考图分析(当用户上传拼贴海报参考图时)

将参考图拆解为以下结构化字段,输出「白话拆解 + 逐字段 JSON 规格」两件套:

白话拆解:

  • 主视觉:画面主体是什么、有哪些卫星元素
  • 色彩感:背景主色是什么、元素与背景的对比关系
  • 材质感:半调网点密度、轮廓线粗细、投影厚薄
  • 创意内核:这张图想表达的「一个锋利想法」是什么

逐字段 JSON 规格(供 media_generator 生产使用):
{
"medium": "混合媒介手作纸拼贴",
"color_field": "单一平涂纯色背景,主色 #XXXXXX",
"halftone_density": "(轻/中/重)网点,(报纸/杂志/照片)印刷质感",
"cut_and_shadow": "粗黑轮廓 + 手撕毛糙边 + 厚实柔和投影",
"composition": "(中心/分散/对角线)构图 + N 个卫星元素,留白(充足/紧凑)",
"idea": "一句话视觉双关",
"label_text": "画面内烧录的短标签(可空)",
"motion": "从空背景组装,12帧定格抖动,投影位移,轻微镜头平移"
}

自检: 分析时确认参考图是否满足拼贴动画四个静态特征(半调元素、干净裁切边缘+投影、平面纯色背景、一个锋利想法);若缺失某项,在白话拆解里明确标注「该图缺少 X 特征,生产时需补充」。

3. Storyboard design

每条拼贴动画的 Storyboard 结构

每条动画对应一个独立 shot,不做多镜头叙事,所有视觉信息聚焦于「一个锋利想法」。

key_element 设计:

  • 主体元素(element character 或核心物件):描述半调材质、轮廓线、投影特征,以及与「视觉双关」的关系。
  • 背景色块(element scene):单一平涂纯色,指定主色色值,无光影 / 无景深 / 无渐变。
  • 卫星元素(element prop,3~5 个):标注各自的视觉功能(强化主题 / 构图平衡 / 增加信息量)。

shot 描述(必须包含以下四项):

  • 场景绑定: 引用对应 element scene ID。
  • 核心创意: 用一句话写出这条动画的视觉双关(即 idea 字段)。
  • 组装顺序(动态叙事核心): 明确描述从「空背景」到「完整画面」的搭建顺序——哪个元素先入场、从哪个方向飞入、如何卡位,最后哪个元素收尾。这是本类型最关键的运动设计,必须逐个元素写清楚,不可省略或笼统带过
  • 标签文字: 若有烧录进画面的短标签,注明内容和位置。

音频层(audio_layer):

  • 本类型通常不需要 VO 旁白;若用户要求配音,设计一条 narration 轨,并定义 narration_speaker_profile 与品牌调性对齐。
  • 背景音乐(music/bgm):若需要,指定风格(如:轻快纸质质感节拍、复古 lo-fi)。

视觉 DNA 自检(每条 shot 设计完后逐项核对):

  1. 开场是否为空背景?
  2. 是否包含半调网点 + 粗黑轮廓 + 厚实投影三项材质特征?
  3. 背景是否为单一平涂纯色(无光影 / 无景深)?
  4. 这条是否有且只有一个清晰的锋利想法?
  5. 组装顺序是否逐个元素写明了「从空到满」?
4. Media generation

静帧生成(TextToImage / ImageToImage)

  • 使用 TextToImage,推荐模型:Nano Banana 2,分辨率 2K
  • 若同组中有前一条已确认的静帧,且风格需要高度一致,可用 ImageToImage 以前帧为 reference_image,保持材质/构图风格不变,只替换核心创意内容。
  • 生成前,将 Final_Video_Spec.md 中锁定的固定字段与本条 idea / color_field / label_text 合并,交由 write_media_prompt 撰写完整 prompt。

动态化路线(全批次统一)

视频路线 — prompt 驱动(MultiModalToVideo,推荐模型:MiniMax H3,768p):

  • 将已确认静帧作为 reference_image 输入。
  • 用视频 prompt 描述「从空背景开始组装」的完整过程(详见 write_the_prompt 规范)。
  • 若组装效果不干净,先简化单次入场元素数量、强化逐个元素的方向与卡位描述,再用同一 MiniMax H3 / 768p 配置重跑;不得切换模型、分辨率或改用帧插值。

一致性铁律: 同一组视频必须全程使用 MultiModalToVideo + MiniMax H3 + 768p,不得切换视频模型、分辨率或生成路线,否则质感断裂。

资产绑定

  • 每张确认静帧注册 asset_id,绑定到对应 shot 的 final_shot 槽位。
5. Prompt writing

跑图 Prompt(TextToImage / ImageToImage,生成静帧)

固定前缀(每条必带,不可删减):

混合媒介手作拼贴艺术风格,复古剪纸质感。主体呈现为带有粗黑轮廓线的半色调印刷图片裁剪贴纸,边缘带有一点手工剪刀剪裁与撕裂纸张的毛糙边缘。背景由粗糙的燕麦纸、带有 distressed 痕迹的复古网格纸、以及旧报纸碎屑拼接而成。每一个重叠的卡纸图层之间都投下清晰、厚实的重叠投影,呈现出 3D 卡纸分层叠加的真实物理厚度感。扁平 2D 纸艺布局,保留纤维纸质纹理。禁止光滑的数码渐变,禁止精细 3D 渲染,禁止透视扭曲。

可变段(每条替换):

  • 主体/创意:本条视觉双关场景的具体描述(来自 storyboard shot 的核心创意)。
  • 色彩:本条 color_field,一整块平涂纯色背景,注明色值。
  • 标签文字:需烧录进画面的短标签(可空)。

关键词命中自检(写完后核对,六项必须全部覆盖):
半色调 / halftone、粗黑轮廓线、手工剪裁毛糙边缘、厚实重叠投影、扁平 2D 纸艺、纸质纹理。

MiniMax H3 视频 Prompt(MultiModalToVideo,768p 动态化)

固定前缀(每条必带):

12 帧定格动画风格运动,画面带有些许顿挫的节拍感。遵循手工剪纸的物理法则:画面中的各个卡纸元素在帧与帧之间产生微小的颤动、摇摆和晃动。重叠纸层下方的影子随元素移动产生微妙的动态投影位移,凸显 3D 叠纸的纵深空间感。背景的纸张纤维纹理和噪点在帧间闪烁起伏。微弱的镜头缓慢平移或视差漂移。保持扁平 2D 叠纸美学,禁止平滑的数码过渡动画,禁止 3D 空间畸变。

组装叙事段(每条必写,核心):

画面从空的纯色背景开始,[元素A] 先从 [方向] 滑入卡位,接着 [元素B] 从 [方向] 飞入……最终所有元素拼成完整场景。

  • 组装顺序直接从 storyboard shot 的「组装顺序」字段复制,必须逐个元素点名,注明入场方向和卡位动作;禁止笼统写「元素依次滑入」。
  • 已确认静帧以 <<<image_1>>> 形式绑定为 reference_image,在 prompt 中标注其用途(整体风格参考)。

动效关键词自检(必须全部出现):
12帧定格、顿挫节拍、帧间颤动/摇摆/晃动、动态投影位移、纸纹噪点闪烁、镜头平移/视差。

6. Video assembly

拼贴动画组装规范

  • 每条时长: 单条拼贴动画建议 6~10 秒;若有多条组成系列,每条独立导出,不自动拼接成长片。
  • 节奏: 组装动作与 12 帧定格节拍感在组装层保留原样,不做平滑处理,不加缓动曲线。
  • 音频同步: 若有 bgm 轨,第一个元素入场时间点与音乐强拍对齐。若同时有 narration (VO) 轨,确保二者不重叠。
  • 无字幕: 画面内文字已在静帧生成阶段烧录进图像,assembly 层不再叠加字幕层。
  • 导出: 保持生成分辨率(768p),不做超分处理。