yeha.ai
返回模板库

火柴人风格科普/叙事短视频

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

适用于科普讲解、知识故事、生活哲理、趣味叙事等火柴人手绘极简风格短视频(1-5分钟)的全流程自动化制作。采用「设局-困境-顿悟-收束」四幕叙事结构,依次完成策划、视觉元素生成、逐镜头视频生成、配音/B

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

整体工作流:四节点串行架构

按以下顺序依次调用工具,严格保持节点间依赖关系,每个节点完成后暂停并向用户确认,再进入下一节点

Step 0:建立全局视频规格

通过 text_editor 创建 Final_Video_Spec.md,锁定以下参数:

  • 视频主题、时长目标(1/3/5分钟)与对应分镜数量(1分钟 8-12个,3分钟 20-30个)
  • 风格预设(经典科普 / 温暖叙事 / 冷静分析 / 紧张悬疑)及对应强调色与背景色
  • 主角与配角设定(头部形状、辨识特征)
  • 旁白输出语言
  • 画面比例:默认 16:9

Step 1:需求澄清

若用户未明确上述参数,先通过提问或 cards 确认,再进入策划节点。

Step 2:策划节点 → storyboard_designer

按四幕叙事结构(设局 20% / 困境 35% / 顿悟 30% / 收束 15%)设计完整分镜与音频层。完成后暂停,等用户确认后进入下一节点。

Step 3:视觉节点 → media_generator

  1. 优先生成全部角色 key_element 参考图;等用户确认后,批量生成各场景背景图。
  2. 将所有生成图像资产 register asset_id 并 bind 到对应 key_element / shot 槽位。

Step 4:生成节点 → media_generator

逐镜头生成视频片段,每次必须引用该 shot 绑定的角色图+场景图。单分镜失败可独立重试。全部完成后暂停确认。

Step 5:音频节点 → media_generator

按 Storyboard 中 audio_layer 生成旁白(narration VO)和 BGM(music)。

Step 6:组装节点 → video_assembler

所有资产就绪后,完成转场拼接、音画同步、音量混合,输出最终成片。

节点依赖

Step 2 → Step 0;Step 3 → Step 2;Step 4 → Step 3;Step 5 → Step 2;Step 6 → Step 3、4、5。

2. 多模态分析

若用户上传了角色草稿、风格参考图或场景素材:

  • 提取视觉关键词:线条风格、色彩方案、角色辨识特征(发型、配饰、肢体比例)。
  • 若参考图为写实风格,仅提取可迁移的特征,忽略光影与材质,确保与火柴人极简手绘风格兼容。
  • 将分析结果作为文本输出,直接供 Storyboard key_element 描述与后续图像生成 Prompt 使用;Storyboard 中的元素描述必须与用户提供的素材一致,不得相互矛盾。
  • 若用户上传配音音频或 BGM 参考,提取语速、情绪基调、节奏特征,写入 Final_Video_Spec.md 供生成参考。
3. 故事板设计

四幕叙事结构

科普/叙事类火柴人视频围绕「知识缺口」展开,必须严格按四幕结构规划分镜比例:

幕功能时长占比约束设局 Setup介绍主角日常,暗示问题20%背景极简(一条地平线),传达「普通感」困境 Struggle问题爆发,反复失败35%至少 2 个 shot 展示失败;每 45-60 秒设置一次视觉幽默节拍顿悟 Insight核心知识点揭示30%顿悟 shot 前须标记 pause_after: true;背景从杂乱线条突变为整洁几何图形收束 Resolve应用新知,问题解决15%末尾 shot 定格 2-3 秒 + 金句文字

每幕仅设置 1 个 key_message;信息密度:每 30 秒只传达 1 个核心观点。

key_element 设计规范

element_character(角色)

  • 主角:圆头 + 呆毛;配角:方头 + 无呆毛;三人以上场景用头部形状(圆/方/三角)+ 1 个简单配饰区分。
  • 严禁用肤色/体型差异区分角色,保持火柴人极简本质。
  • 描述须包含:头部形状、辨识特征、线条粗细(统一 2-3px)、情绪表达基准。

element_scene(场景)

  • 描述场景核心几何元素(如:单条地平线、办公桌轮廓、窗框)及背景色规范。
  • 中下部须留白供角色站立,画面元素不超过 5 个。

shot 设计规范

每个 shot 必须包含:

  • 景别:LS(远景,人物占 10-20%)/ MS(中景,40-50%)/ CU(近景,70-80%)/ ECU(特写,单元素满屏)
  • 场景引用:标注对应 element_scene ID
  • 角色动作(含预备-主动作-缓冲三阶段;禁止使用「做一些动作」等模糊描述)
  • 情绪状态:neutral / anxious / excited / thinking / relieved
  • 运镜:方向 + 速度 + 景别变化(如:slow push-in from LS to MS)
  • key_message:本镜核心信息(一句话)
  • narration_text:旁白文本(150-170字/分钟节奏)
  • transition:cut / fade / wipe / pop_in(幕间转换用 fade;知识点出现用 pop_in;80% 场景用 cut)
  • pause_after:顿悟 shot 前及高潮 shot 后标记 true,插入 2 秒呼吸停顿

构图禁忌:角色贴边(至少留 1/6 边距)、画面元素超过 5 个、倾斜构图(仅限失衡情绪且不超过 2 秒)。

audio_layer 设计规范

旁白(类型:narration)

  • 定义 narration_speaker_profile:温暖中性音色,朋友聊天感,避免播音腔;示例:[Warm Neutral Voice, conversational, moderate pace]
  • 困境幕语调略紧张,顿悟幕明亮;知识点前停顿 0.8 秒,每幕结束停顿 1.5 秒
  • 语速 150-170 字/分钟

BGM(类型:music)

  • 风格:轻快原声吉他 / 尤克里里 / 简单钢琴,BPM 90-110,匹配手绘质感
  • 困境幕加小调元素,顿悟幕回归大调
  • 3 分钟以上或有明显情感转折时可分段,每段独立 audio_id
  • 音量不超过旁白音量的 40%
4. 媒体生成

风格预设与配色方案

根据 Final_Video_Spec.md 中锁定的风格预设,在图像/视频生成时自动套用对应配色与风格锁定词。四种预设如下:

风格预设背景色强调色线条色风格锁定词(英文,追加到 Prompt 末尾)经典科普#FFFFFF 纯白#FFD700 金黄纯黑 2-3pxclean educational style, friendly and approachable, golden yellow accent, pure white background温暖叙事#FFF8F0 暖白#FF8C69 暖橘深棕 2-3pxwarm storytelling style, cozy and inviting, warm orange accent, soft cream background冷静分析#F5F7FA 冷白#4A90D9 冷蓝深灰蓝 2-3pxanalytical style, cool and precise, steel blue accent, light gray-blue background紧张悬疑#1A1A2E 深蓝黑#FF4444 警示红白色 2-3pxtense suspenseful style, dramatic contrast, warning red accent, dark navy background, white lines on dark

使用规则:

  • 图像与视频生成 Prompt 均须包含当前风格预设对应的「风格锁定词」整段,与全局手绘极简锁定词(no realistic lighting, no shadows, no shading, flat illustration, hand-drawn minimalist style)叠加使用。
  • 紧张悬疑预设为深底白线风格,角色/场景图生成时须将线条色从黑色切换为白色,背景色切换为 #1A1A2E;其余三套预设均为浅底深线,按默认黑色线条处理。
  • 同一项目内所有 shot 使用同一风格预设,不得中途切换;若用户在 Step 0 之后要求更换风格,须重新生成全部已产出资产。

角色与场景图像生成

角色 key_element 参考图TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K

  • 每个角色生成一张横向并排对比图:左侧为头肩特写(面部识别基准),右侧为全身图(服装/配饰/姿态)。
  • 同一角色不同情绪/造型变体使用 ImageToImage(同模型),以首次生成图为参考确保一致性。

场景 element_scene 背景图TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K

  • 角色图确认后批量生成;所有场景图使用同一组风格参数。

分镜视频生成

使用 MultiModalToVideo,默认模型:Seedance 2.5,分辨率 480p,时长 5-8秒(单次调用不超过 15s)。

每次调用的参考输入:

  1. 该 shot 绑定的角色元素图(必须)
  2. 该 shot 绑定的场景背景图(必须)
  3. 上一个 shot 的视频(仅当该 shot 与上一 shot 连续性极强时才添加,默认不加)

音频生成

旁白 narration VOtext to narration,模型:MiniMax Speech 2.8 HD(支持中英文多语言)

  • 按幕分段生成,便于逐幕调整节奏。

BGMtext_to_instrumental,模型:Mureka 8

  • 若 BGM prompt 中不含知名艺人名称,也可使用 Suno 5

资产管理

  • 每张生成图像/视频/音频生成后立即 register asset_id。
  • 角色图、场景图分别 bind 到对应 key_element;shot 视频 bind 到对应 shot 槽位;音频 bind 到对应 audio_layer。
  • 若用户上传了角色参考图或音频,优先 register + bind 用户素材,不重复生成。
5. 提示词撰写

全局规则

语言:用户使用中文交互时,Prompt 正文用中文撰写;Prompt 中的风格锁定词(英文关键词组)保留英文。

全局手绘极简锁定词(图像和视频生成均必须包含):
no realistic lighting, no shadows, no shading, flat illustration, hand-drawn minimalist style

风格预设锁定词:根据 Final_Video_Spec.md 中锁定的风格预设,从媒体生成节「风格预设与配色方案」表格中取对应行的「风格锁定词」整段,追加到全局锁定词之后。配色(背景色、强调色、线条色)也须同步写入 Prompt 中对应的颜色描述位置。

角色参考图 Prompt(TextToImage)

以导演+美术指导简报风格撰写,结构:角色描述 → 辨识特征 → 构图 → 风格锁定

示例结构:火柴人角色,圆头+呆毛,纯黑轮廓线 2px,无填充,正面全身站姿,左侧头肩特写右侧全身并排,纯白背景,手绘极简线条风格,关节处标记小圆点,表情简洁有辨识度,stick figure, minimalist line art, 2-3px stroke, pure white background, no fill, no realistic lighting, no shadows, no shading, flat illustration

禁止词:realistic, 3D, shading, gradient, texture, render, ray tracing

场景背景图 Prompt(TextToImage)

结构:场景核心元素(≤5个)→ 构图留白要求 → 风格色彩 → 风格锁定

示例结构:极简办公室背景,一张桌子轮廓+一把椅子+窗框,画面中下部大面积留白供角色站立,背景 #FFFFFF 纯白,强调色 #FFD700,minimalist background, simple geometric shapes, plenty of white space, center-bottom clear, hand-drawn minimalist style, no realistic lighting, no shadows, no shading, flat illustration

禁止词:detailed, photorealistic, complex, crowded, realistic lighting

分镜视频 Prompt(MultiModalToVideo / Seedance 2.5)

结构:镜头动作(参考图绑定)→ 情绪状态 → 角色动作三阶段 → 运镜 → 风格锁定 → 否定词

  • 引用参考图使用占位符 <<<image_1>>> 绑定角色图,<<<image_2>>> 绑定场景图。
  • 角色动作必须写明「预备-主动作-缓冲」三阶段(如:先弯腿蓄力,随即向前猛冲,落地后身体前倾弹回)。
  • 运镜必须包含方向+速度+景别变化(如:缓慢从远景推进到中景,镜头微微左移)。
  • 动画物理风格词(表现弹性感):bouncy exaggerated motion, anticipation and follow-through, squash and stretch
  • 否定词(必须包含):no realistic physics, no cinematic lighting, no motion blur, no depth of field, no subtitles, no music, no realistic lighting, no shadows, no shading
  • 若该 shot 有独立旁白音频轨,不在视频 Prompt 中重复旁白文本

运动类型速查

动作Prompt 描述行走bouncy walk cycle, exaggerated arm swing跑步leaning forward 30 degrees, speed lines trailing跳跃crouch-jump-squash with rebound惊讶sudden startle, limbs extend, exclamation mark above head思考slow pacing, side-to-side sway, question mark floating

6. 视频合成

组装规则

拼接顺序:严格按 Storyboard shot 顺序拼接,不得调整。

转场执行(依据各 shot 的 transition 字段):

transition 值执行方式时长cut硬切,无过渡0帧pop_in中心放大+弹跳缓动0.3秒fade淡出→淡入0.5秒wipe从左向右擦除0.4秒

禁止:3D翻转等复杂特效;连续 3 个以上非硬切;叠化用于动作场景。

呼吸停顿:凡 shot 标注 pause_after: true,在该 shot 结束后插入 2 秒静止定格帧

音频混合

  • 旁白音轨对齐对应 shot 的起始帧。
  • BGM 贯穿全片,音量不超过旁白音量的 40%
  • 困境幕若有小调 BGM 变奏段,在该幕起始处淡入切换(0.5秒淡变)。

节奏检查:顿悟幕末尾 shot 及收束幕末尾 shot 须有明显停顿感(通过 pause_after 或手动延长末帧实现);全片旁白与画面时长差异不超过 0.5 秒/幕。