Stick-figure educational storytelling
Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.
适用于科普讲解、知识故事、生活哲理、趣味叙事等火柴人手绘极简风格短视频(1-5分钟)的全流程自动化制作。采用「设局-困境-顿悟-收束」四幕叙事结构,依次完成策划、视觉元素生成、逐镜头视频生成、配音/B
Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.
Complete workflow
1. Planning
整体工作流:四节点串行架构
按以下顺序依次调用工具,严格保持节点间依赖关系,每个节点完成后暂停并向用户确认,再进入下一节点。
Step 0:建立全局视频规格
通过 text_editor 创建 Final_Video_Spec.md,锁定以下参数:
- 视频主题、时长目标(1/3/5分钟)与对应分镜数量(1分钟 8-12个,3分钟 20-30个)
- 风格预设(经典科普 / 温暖叙事 / 冷静分析 / 紧张悬疑)及对应强调色与背景色
- 主角与配角设定(头部形状、辨识特征)
- 旁白输出语言
- 画面比例:默认 16:9
Step 1:需求澄清
若用户未明确上述参数,先通过提问或 cards 确认,再进入策划节点。
Step 2:策划节点 → storyboard_designer
按四幕叙事结构(设局 20% / 困境 35% / 顿悟 30% / 收束 15%)设计完整分镜与音频层。完成后暂停,等用户确认后进入下一节点。
Step 3:视觉节点 → media_generator
- 优先生成全部角色 key_element 参考图;等用户确认后,批量生成各场景背景图。
- 将所有生成图像资产 register asset_id 并 bind 到对应 key_element / shot 槽位。
Step 4:生成节点 → media_generator
逐镜头生成视频片段,每次必须引用该 shot 绑定的角色图+场景图。单分镜失败可独立重试。全部完成后暂停确认。
Step 5:音频节点 → media_generator
按 Storyboard 中 audio_layer 生成旁白(narration VO)和 BGM(music)。
Step 6:组装节点 → video_assembler
所有资产就绪后,完成转场拼接、音画同步、音量混合,输出最终成片。
节点依赖
Step 2 → Step 0;Step 3 → Step 2;Step 4 → Step 3;Step 5 → Step 2;Step 6 → Step 3、4、5。
2. Multimodal analysis
若用户上传了角色草稿、风格参考图或场景素材:
- 提取视觉关键词:线条风格、色彩方案、角色辨识特征(发型、配饰、肢体比例)。
- 若参考图为写实风格,仅提取可迁移的特征,忽略光影与材质,确保与火柴人极简手绘风格兼容。
- 将分析结果作为文本输出,直接供 Storyboard key_element 描述与后续图像生成 Prompt 使用;Storyboard 中的元素描述必须与用户提供的素材一致,不得相互矛盾。
- 若用户上传配音音频或 BGM 参考,提取语速、情绪基调、节奏特征,写入 Final_Video_Spec.md 供生成参考。
3. Storyboard design
四幕叙事结构
科普/叙事类火柴人视频围绕「知识缺口」展开,必须严格按四幕结构规划分镜比例:
幕功能时长占比约束设局 Setup介绍主角日常,暗示问题20%背景极简(一条地平线),传达「普通感」困境 Struggle问题爆发,反复失败35%至少 2 个 shot 展示失败;每 45-60 秒设置一次视觉幽默节拍顿悟 Insight核心知识点揭示30%顿悟 shot 前须标记 pause_after: true;背景从杂乱线条突变为整洁几何图形收束 Resolve应用新知,问题解决15%末尾 shot 定格 2-3 秒 + 金句文字
每幕仅设置 1 个 key_message;信息密度:每 30 秒只传达 1 个核心观点。
key_element 设计规范
element_character(角色)
- 主角:圆头 + 呆毛;配角:方头 + 无呆毛;三人以上场景用头部形状(圆/方/三角)+ 1 个简单配饰区分。
- 严禁用肤色/体型差异区分角色,保持火柴人极简本质。
- 描述须包含:头部形状、辨识特征、线条粗细(统一 2-3px)、情绪表达基准。
element_scene(场景)
- 描述场景核心几何元素(如:单条地平线、办公桌轮廓、窗框)及背景色规范。
- 中下部须留白供角色站立,画面元素不超过 5 个。
shot 设计规范
每个 shot 必须包含:
- 景别:LS(远景,人物占 10-20%)/ MS(中景,40-50%)/ CU(近景,70-80%)/ ECU(特写,单元素满屏)
- 场景引用:标注对应 element_scene ID
- 角色动作(含预备-主动作-缓冲三阶段;禁止使用「做一些动作」等模糊描述)
- 情绪状态:neutral / anxious / excited / thinking / relieved
- 运镜:方向 + 速度 + 景别变化(如:slow push-in from LS to MS)
- key_message:本镜核心信息(一句话)
- narration_text:旁白文本(150-170字/分钟节奏)
- transition:cut / fade / wipe / pop_in(幕间转换用 fade;知识点出现用 pop_in;80% 场景用 cut)
- pause_after:顿悟 shot 前及高潮 shot 后标记 true,插入 2 秒呼吸停顿
构图禁忌:角色贴边(至少留 1/6 边距)、画面元素超过 5 个、倾斜构图(仅限失衡情绪且不超过 2 秒)。
audio_layer 设计规范
旁白(类型:narration)
- 定义 narration_speaker_profile:温暖中性音色,朋友聊天感,避免播音腔;示例:[Warm Neutral Voice, conversational, moderate pace]
- 困境幕语调略紧张,顿悟幕明亮;知识点前停顿 0.8 秒,每幕结束停顿 1.5 秒
- 语速 150-170 字/分钟
BGM(类型:music)
- 风格:轻快原声吉他 / 尤克里里 / 简单钢琴,BPM 90-110,匹配手绘质感
- 困境幕加小调元素,顿悟幕回归大调
- 3 分钟以上或有明显情感转折时可分段,每段独立 audio_id
- 音量不超过旁白音量的 40%
4. Media generation
风格预设与配色方案
根据 Final_Video_Spec.md 中锁定的风格预设,在图像/视频生成时自动套用对应配色与风格锁定词。四种预设如下:
风格预设背景色强调色线条色风格锁定词(英文,追加到 Prompt 末尾)经典科普#FFFFFF 纯白#FFD700 金黄纯黑 2-3pxclean educational style, friendly and approachable, golden yellow accent, pure white background温暖叙事#FFF8F0 暖白#FF8C69 暖橘深棕 2-3pxwarm storytelling style, cozy and inviting, warm orange accent, soft cream background冷静分析#F5F7FA 冷白#4A90D9 冷蓝深灰蓝 2-3pxanalytical style, cool and precise, steel blue accent, light gray-blue background紧张悬疑#1A1A2E 深蓝黑#FF4444 警示红白色 2-3pxtense suspenseful style, dramatic contrast, warning red accent, dark navy background, white lines on dark
使用规则:
- 图像与视频生成 Prompt 均须包含当前风格预设对应的「风格锁定词」整段,与全局手绘极简锁定词(no realistic lighting, no shadows, no shading, flat illustration, hand-drawn minimalist style)叠加使用。
- 紧张悬疑预设为深底白线风格,角色/场景图生成时须将线条色从黑色切换为白色,背景色切换为 #1A1A2E;其余三套预设均为浅底深线,按默认黑色线条处理。
- 同一项目内所有 shot 使用同一风格预设,不得中途切换;若用户在 Step 0 之后要求更换风格,须重新生成全部已产出资产。
角色与场景图像生成
角色 key_element 参考图 → TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
- 每个角色生成一张横向并排对比图:左侧为头肩特写(面部识别基准),右侧为全身图(服装/配饰/姿态)。
- 同一角色不同情绪/造型变体使用 ImageToImage(同模型),以首次生成图为参考确保一致性。
场景 element_scene 背景图 → TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
- 角色图确认后批量生成;所有场景图使用同一组风格参数。
分镜视频生成
使用 MultiModalToVideo,默认模型:Seedance 2.5,分辨率 480p,时长 5-8秒(单次调用不超过 15s)。
每次调用的参考输入:
- 该 shot 绑定的角色元素图(必须)
- 该 shot 绑定的场景背景图(必须)
- 上一个 shot 的视频(仅当该 shot 与上一 shot 连续性极强时才添加,默认不加)
音频生成
旁白 narration VO → text to narration,模型:MiniMax Speech 2.8 HD(支持中英文多语言)
- 按幕分段生成,便于逐幕调整节奏。
BGM → text_to_instrumental,模型:Mureka 8
- 若 BGM prompt 中不含知名艺人名称,也可使用 Suno 5。
资产管理
- 每张生成图像/视频/音频生成后立即 register asset_id。
- 角色图、场景图分别 bind 到对应 key_element;shot 视频 bind 到对应 shot 槽位;音频 bind 到对应 audio_layer。
- 若用户上传了角色参考图或音频,优先 register + bind 用户素材,不重复生成。
5. Prompt writing
全局规则
语言:用户使用中文交互时,Prompt 正文用中文撰写;Prompt 中的风格锁定词(英文关键词组)保留英文。
全局手绘极简锁定词(图像和视频生成均必须包含):
no realistic lighting, no shadows, no shading, flat illustration, hand-drawn minimalist style
风格预设锁定词:根据 Final_Video_Spec.md 中锁定的风格预设,从媒体生成节「风格预设与配色方案」表格中取对应行的「风格锁定词」整段,追加到全局锁定词之后。配色(背景色、强调色、线条色)也须同步写入 Prompt 中对应的颜色描述位置。
角色参考图 Prompt(TextToImage)
以导演+美术指导简报风格撰写,结构:角色描述 → 辨识特征 → 构图 → 风格锁定。
示例结构:火柴人角色,圆头+呆毛,纯黑轮廓线 2px,无填充,正面全身站姿,左侧头肩特写右侧全身并排,纯白背景,手绘极简线条风格,关节处标记小圆点,表情简洁有辨识度,stick figure, minimalist line art, 2-3px stroke, pure white background, no fill, no realistic lighting, no shadows, no shading, flat illustration
禁止词:realistic, 3D, shading, gradient, texture, render, ray tracing
场景背景图 Prompt(TextToImage)
结构:场景核心元素(≤5个)→ 构图留白要求 → 风格色彩 → 风格锁定。
示例结构:极简办公室背景,一张桌子轮廓+一把椅子+窗框,画面中下部大面积留白供角色站立,背景 #FFFFFF 纯白,强调色 #FFD700,minimalist background, simple geometric shapes, plenty of white space, center-bottom clear, hand-drawn minimalist style, no realistic lighting, no shadows, no shading, flat illustration
禁止词:detailed, photorealistic, complex, crowded, realistic lighting
分镜视频 Prompt(MultiModalToVideo / Seedance 2.5)
结构:镜头动作(参考图绑定)→ 情绪状态 → 角色动作三阶段 → 运镜 → 风格锁定 → 否定词
- 引用参考图使用占位符 <<<image_1>>> 绑定角色图,<<<image_2>>> 绑定场景图。
- 角色动作必须写明「预备-主动作-缓冲」三阶段(如:先弯腿蓄力,随即向前猛冲,落地后身体前倾弹回)。
- 运镜必须包含方向+速度+景别变化(如:缓慢从远景推进到中景,镜头微微左移)。
- 动画物理风格词(表现弹性感):bouncy exaggerated motion, anticipation and follow-through, squash and stretch
- 否定词(必须包含):no realistic physics, no cinematic lighting, no motion blur, no depth of field, no subtitles, no music, no realistic lighting, no shadows, no shading
- 若该 shot 有独立旁白音频轨,不在视频 Prompt 中重复旁白文本。
运动类型速查
动作Prompt 描述行走bouncy walk cycle, exaggerated arm swing跑步leaning forward 30 degrees, speed lines trailing跳跃crouch-jump-squash with rebound惊讶sudden startle, limbs extend, exclamation mark above head思考slow pacing, side-to-side sway, question mark floating
6. Video assembly
组装规则
拼接顺序:严格按 Storyboard shot 顺序拼接,不得调整。
转场执行(依据各 shot 的 transition 字段):
transition 值执行方式时长cut硬切,无过渡0帧pop_in中心放大+弹跳缓动0.3秒fade淡出→淡入0.5秒wipe从左向右擦除0.4秒
禁止:3D翻转等复杂特效;连续 3 个以上非硬切;叠化用于动作场景。
呼吸停顿:凡 shot 标注 pause_after: true,在该 shot 结束后插入 2 秒静止定格帧。
音频混合:
- 旁白音轨对齐对应 shot 的起始帧。
- BGM 贯穿全片,音量不超过旁白音量的 40%。
- 困境幕若有小调 BGM 变奏段,在该幕起始处淡入切换(0.5秒淡变)。
节奏检查:顿悟幕末尾 shot 及收束幕末尾 shot 须有明显停顿感(通过 pause_after 或手动延长末帧实现);全片旁白与画面时长差异不超过 0.5 秒/幕。