Transcript-driven collage animation
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
用于将用户提供的逐字稿/口播稿转化为拼贴动画短片。适用场景:用户提供文字稿,要求 Agent 自主选取适合视觉化的观点并完成拼贴动画生产。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
触发与入口识别
- 用户发送逐字稿/口播稿 → 自动进入「分析稿件→选点→生成」完整流程。
- 用户说「拆解一下 / analyze this」→ 进入分析阶段(步骤 1)。
- 用户说「动态化 / animate these」→ 进入动态化阶段(步骤 4),以已有静帧为输入。
完整流程(端到端)
步骤 1 — 稿件分析与选点(Planner 执行)
读取用户提供的逐字稿,从中提炼适合拼贴动画表达的观点:
- 每个观点必须能凝练为「一个锋利想法 / 视觉双关」(如「时钟长翅膀 = 时间飞逝」)。
- 优先选取对比强烈、可视化潜力高、有反差或隐喻的句子。
- 每条稿件建议选取 3~5 个观点,输出简短说明并附上对应场景/视觉双关构想。
- 向用户展示选点列表,暂停并确认:用户可删减、调整或追加,确认后再进入下一步。
步骤 2 — 锁定风格规格(Planner 用 text_editor 写入 Final_Video_Spec.md)
为本批次锁定品牌/风格参数,写入 Final_Video_Spec.md,包含:
- 固定字段(全批次锁死):medium、halftone_density、cut_and_shadow、composition、motion 规格。
- 每条可变字段说明:idea(视觉双关)、color_field(本条主色)、label_text(烧录文字,可空)。
- 同一组视频禁止修改固定字段,只允许改变 idea / color_field / label_text。
步骤 3 — 生成 Storyboard 与静帧(交由 storyboard_designer,再交由 media_generator)
- 先用 storyboard_designer 为所有确认观点设计 key_element 和 shot。
- 再用 media_generator 为每个 shot 生成拼贴风格静帧。
- 静帧全部生成后,暂停展示给用户,请用户标出满意/不满意的条目;不满意的条目调整 prompt 重跑,直到用户认可后继续。
步骤 4 — 动态化(交由 media_generator)
- 对用户选定的静帧执行「从空→满」组装式动态化。
- 全批次统一使用 MultiModalToVideo(MiniMax H3,768p) 路线,禁止切换视频模型、分辨率或改用帧插值。
- 生成完毕后暂停,展示所有视频,等待用户验收。
步骤 5 — 最终组装与导出(交由 video_assembler)
- 用户验收通过后,调用 video_assembler 对所有确认的视频片段执行组装与导出。
- 按 video_assembler 中的规范执行:单条 6~10 秒、保留 12 帧定格节拍不做平滑、音频同步、无字幕叠加、保持 768p 分辨率导出。
- 组装完成后向用户展示最终成片,确认无误即完成本批次。
步骤 6 — 规模化复用
- 用户若提交新逐字稿,重复步骤 1~5,固定字段直接沿用 Final_Video_Spec.md,只更换可变字段。
节点控制
每个「暂停」都是强制检查点,必须等用户明确确认后才能进入下一步,不得自动贯穿整条流水线。
2. 멀티모달 분석
参考图分析(当用户上传拼贴海报参考图时)
将参考图拆解为以下结构化字段,输出「白话拆解 + 逐字段 JSON 规格」两件套:
白话拆解:
- 主视觉:画面主体是什么、有哪些卫星元素
- 色彩感:背景主色是什么、元素与背景的对比关系
- 材质感:半调网点密度、轮廓线粗细、投影厚薄
- 创意内核:这张图想表达的「一个锋利想法」是什么
逐字段 JSON 规格(供 media_generator 生产使用):
{
"medium": "混合媒介手作纸拼贴",
"color_field": "单一平涂纯色背景,主色 #XXXXXX",
"halftone_density": "(轻/中/重)网点,(报纸/杂志/照片)印刷质感",
"cut_and_shadow": "粗黑轮廓 + 手撕毛糙边 + 厚实柔和投影",
"composition": "(中心/分散/对角线)构图 + N 个卫星元素,留白(充足/紧凑)",
"idea": "一句话视觉双关",
"label_text": "画面内烧录的短标签(可空)",
"motion": "从空背景组装,12帧定格抖动,投影位移,轻微镜头平移"
}
自检: 分析时确认参考图是否满足拼贴动画四个静态特征(半调元素、干净裁切边缘+投影、平面纯色背景、一个锋利想法);若缺失某项,在白话拆解里明确标注「该图缺少 X 特征,生产时需补充」。
3. 스토리보드 설계
每条拼贴动画的 Storyboard 结构
每条动画对应一个独立 shot,不做多镜头叙事,所有视觉信息聚焦于「一个锋利想法」。
key_element 设计:
- 主体元素(element character 或核心物件):描述半调材质、轮廓线、投影特征,以及与「视觉双关」的关系。
- 背景色块(element scene):单一平涂纯色,指定主色色值,无光影 / 无景深 / 无渐变。
- 卫星元素(element prop,3~5 个):标注各自的视觉功能(强化主题 / 构图平衡 / 增加信息量)。
shot 描述(必须包含以下四项):
- 场景绑定: 引用对应 element scene ID。
- 核心创意: 用一句话写出这条动画的视觉双关(即 idea 字段)。
- 组装顺序(动态叙事核心): 明确描述从「空背景」到「完整画面」的搭建顺序——哪个元素先入场、从哪个方向飞入、如何卡位,最后哪个元素收尾。这是本类型最关键的运动设计,必须逐个元素写清楚,不可省略或笼统带过。
- 标签文字: 若有烧录进画面的短标签,注明内容和位置。
音频层(audio_layer):
- 本类型通常不需要 VO 旁白;若用户要求配音,设计一条 narration 轨,并定义 narration_speaker_profile 与品牌调性对齐。
- 背景音乐(music/bgm):若需要,指定风格(如:轻快纸质质感节拍、复古 lo-fi)。
视觉 DNA 自检(每条 shot 设计完后逐项核对):
- 开场是否为空背景?
- 是否包含半调网点 + 粗黑轮廓 + 厚实投影三项材质特征?
- 背景是否为单一平涂纯色(无光影 / 无景深)?
- 这条是否有且只有一个清晰的锋利想法?
- 组装顺序是否逐个元素写明了「从空到满」?
4. 미디어 생성
静帧生成(TextToImage / ImageToImage)
- 使用 TextToImage,推荐模型:Nano Banana 2,分辨率 2K。
- 若同组中有前一条已确认的静帧,且风格需要高度一致,可用 ImageToImage 以前帧为 reference_image,保持材质/构图风格不变,只替换核心创意内容。
- 生成前,将 Final_Video_Spec.md 中锁定的固定字段与本条 idea / color_field / label_text 合并,交由 write_media_prompt 撰写完整 prompt。
动态化路线(全批次统一)
视频路线 — prompt 驱动(MultiModalToVideo,推荐模型:MiniMax H3,768p):
- 将已确认静帧作为 reference_image 输入。
- 用视频 prompt 描述「从空背景开始组装」的完整过程(详见 write_the_prompt 规范)。
- 若组装效果不干净,先简化单次入场元素数量、强化逐个元素的方向与卡位描述,再用同一 MiniMax H3 / 768p 配置重跑;不得切换模型、分辨率或改用帧插值。
一致性铁律: 同一组视频必须全程使用 MultiModalToVideo + MiniMax H3 + 768p,不得切换视频模型、分辨率或生成路线,否则质感断裂。
资产绑定
- 每张确认静帧注册 asset_id,绑定到对应 shot 的 final_shot 槽位。
5. 프롬프트 작성
跑图 Prompt(TextToImage / ImageToImage,生成静帧)
固定前缀(每条必带,不可删减):
混合媒介手作拼贴艺术风格,复古剪纸质感。主体呈现为带有粗黑轮廓线的半色调印刷图片裁剪贴纸,边缘带有一点手工剪刀剪裁与撕裂纸张的毛糙边缘。背景由粗糙的燕麦纸、带有 distressed 痕迹的复古网格纸、以及旧报纸碎屑拼接而成。每一个重叠的卡纸图层之间都投下清晰、厚实的重叠投影,呈现出 3D 卡纸分层叠加的真实物理厚度感。扁平 2D 纸艺布局,保留纤维纸质纹理。禁止光滑的数码渐变,禁止精细 3D 渲染,禁止透视扭曲。
可变段(每条替换):
- 主体/创意:本条视觉双关场景的具体描述(来自 storyboard shot 的核心创意)。
- 色彩:本条 color_field,一整块平涂纯色背景,注明色值。
- 标签文字:需烧录进画面的短标签(可空)。
关键词命中自检(写完后核对,六项必须全部覆盖):
半色调 / halftone、粗黑轮廓线、手工剪裁毛糙边缘、厚实重叠投影、扁平 2D 纸艺、纸质纹理。
MiniMax H3 视频 Prompt(MultiModalToVideo,768p 动态化)
固定前缀(每条必带):
12 帧定格动画风格运动,画面带有些许顿挫的节拍感。遵循手工剪纸的物理法则:画面中的各个卡纸元素在帧与帧之间产生微小的颤动、摇摆和晃动。重叠纸层下方的影子随元素移动产生微妙的动态投影位移,凸显 3D 叠纸的纵深空间感。背景的纸张纤维纹理和噪点在帧间闪烁起伏。微弱的镜头缓慢平移或视差漂移。保持扁平 2D 叠纸美学,禁止平滑的数码过渡动画,禁止 3D 空间畸变。
组装叙事段(每条必写,核心):
画面从空的纯色背景开始,[元素A] 先从 [方向] 滑入卡位,接着 [元素B] 从 [方向] 飞入……最终所有元素拼成完整场景。
- 组装顺序直接从 storyboard shot 的「组装顺序」字段复制,必须逐个元素点名,注明入场方向和卡位动作;禁止笼统写「元素依次滑入」。
- 已确认静帧以 <<<image_1>>> 形式绑定为 reference_image,在 prompt 中标注其用途(整体风格参考)。
动效关键词自检(必须全部出现):
12帧定格、顿挫节拍、帧间颤动/摇摆/晃动、动态投影位移、纸纹噪点闪烁、镜头平移/视差。
6. 동영상 조립
拼贴动画组装规范
- 每条时长: 单条拼贴动画建议 6~10 秒;若有多条组成系列,每条独立导出,不自动拼接成长片。
- 节奏: 组装动作与 12 帧定格节拍感在组装层保留原样,不做平滑处理,不加缓动曲线。
- 音频同步: 若有 bgm 轨,第一个元素入场时间点与音乐强拍对齐。若同时有 narration (VO) 轨,确保二者不重叠。
- 无字幕: 画面内文字已在静帧生成阶段烧录进图像,assembly 层不再叠加字幕层。
- 导出: 保持生成分辨率(768p),不做超分处理。