Stick-figure educational storytelling
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
适用于科普讲解、知识故事、生活哲理、趣味叙事等火柴人手绘极简风格短视频(1-5分钟)的全流程自动化制作。采用「设局-困境-顿悟-收束」四幕叙事结构,依次完成策划、视觉元素生成、逐镜头视频生成、配音/B
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
整体工作流:四节点串行架构
按以下顺序依次调用工具,严格保持节点间依赖关系,每个节点完成后暂停并向用户确认,再进入下一节点。
Step 0:建立全局视频规格
通过 text_editor 创建 Final_Video_Spec.md,锁定以下参数:
- 视频主题、时长目标(1/3/5分钟)与对应分镜数量(1分钟 8-12个,3分钟 20-30个)
- 风格预设(经典科普 / 温暖叙事 / 冷静分析 / 紧张悬疑)及对应强调色与背景色
- 主角与配角设定(头部形状、辨识特征)
- 旁白输出语言
- 画面比例:默认 16:9
Step 1:需求澄清
若用户未明确上述参数,先通过提问或 cards 确认,再进入策划节点。
Step 2:策划节点 → storyboard_designer
按四幕叙事结构(设局 20% / 困境 35% / 顿悟 30% / 收束 15%)设计完整分镜与音频层。完成后暂停,等用户确认后进入下一节点。
Step 3:视觉节点 → media_generator
- 优先生成全部角色 key_element 参考图;等用户确认后,批量生成各场景背景图。
- 将所有生成图像资产 register asset_id 并 bind 到对应 key_element / shot 槽位。
Step 4:生成节点 → media_generator
逐镜头生成视频片段,每次必须引用该 shot 绑定的角色图+场景图。单分镜失败可独立重试。全部完成后暂停确认。
Step 5:音频节点 → media_generator
按 Storyboard 中 audio_layer 生成旁白(narration VO)和 BGM(music)。
Step 6:组装节点 → video_assembler
所有资产就绪后,完成转场拼接、音画同步、音量混合,输出最终成片。
节点依赖
Step 2 → Step 0;Step 3 → Step 2;Step 4 → Step 3;Step 5 → Step 2;Step 6 → Step 3、4、5。
2. マルチモーダル分析
若用户上传了角色草稿、风格参考图或场景素材:
- 提取视觉关键词:线条风格、色彩方案、角色辨识特征(发型、配饰、肢体比例)。
- 若参考图为写实风格,仅提取可迁移的特征,忽略光影与材质,确保与火柴人极简手绘风格兼容。
- 将分析结果作为文本输出,直接供 Storyboard key_element 描述与后续图像生成 Prompt 使用;Storyboard 中的元素描述必须与用户提供的素材一致,不得相互矛盾。
- 若用户上传配音音频或 BGM 参考,提取语速、情绪基调、节奏特征,写入 Final_Video_Spec.md 供生成参考。
3. 絵コンテ設計
四幕叙事结构
科普/叙事类火柴人视频围绕「知识缺口」展开,必须严格按四幕结构规划分镜比例:
幕功能时长占比约束设局 Setup介绍主角日常,暗示问题20%背景极简(一条地平线),传达「普通感」困境 Struggle问题爆发,反复失败35%至少 2 个 shot 展示失败;每 45-60 秒设置一次视觉幽默节拍顿悟 Insight核心知识点揭示30%顿悟 shot 前须标记 pause_after: true;背景从杂乱线条突变为整洁几何图形收束 Resolve应用新知,问题解决15%末尾 shot 定格 2-3 秒 + 金句文字
每幕仅设置 1 个 key_message;信息密度:每 30 秒只传达 1 个核心观点。
key_element 设计规范
element_character(角色)
- 主角:圆头 + 呆毛;配角:方头 + 无呆毛;三人以上场景用头部形状(圆/方/三角)+ 1 个简单配饰区分。
- 严禁用肤色/体型差异区分角色,保持火柴人极简本质。
- 描述须包含:头部形状、辨识特征、线条粗细(统一 2-3px)、情绪表达基准。
element_scene(场景)
- 描述场景核心几何元素(如:单条地平线、办公桌轮廓、窗框)及背景色规范。
- 中下部须留白供角色站立,画面元素不超过 5 个。
shot 设计规范
每个 shot 必须包含:
- 景别:LS(远景,人物占 10-20%)/ MS(中景,40-50%)/ CU(近景,70-80%)/ ECU(特写,单元素满屏)
- 场景引用:标注对应 element_scene ID
- 角色动作(含预备-主动作-缓冲三阶段;禁止使用「做一些动作」等模糊描述)
- 情绪状态:neutral / anxious / excited / thinking / relieved
- 运镜:方向 + 速度 + 景别变化(如:slow push-in from LS to MS)
- key_message:本镜核心信息(一句话)
- narration_text:旁白文本(150-170字/分钟节奏)
- transition:cut / fade / wipe / pop_in(幕间转换用 fade;知识点出现用 pop_in;80% 场景用 cut)
- pause_after:顿悟 shot 前及高潮 shot 后标记 true,插入 2 秒呼吸停顿
构图禁忌:角色贴边(至少留 1/6 边距)、画面元素超过 5 个、倾斜构图(仅限失衡情绪且不超过 2 秒)。
audio_layer 设计规范
旁白(类型:narration)
- 定义 narration_speaker_profile:温暖中性音色,朋友聊天感,避免播音腔;示例:[Warm Neutral Voice, conversational, moderate pace]
- 困境幕语调略紧张,顿悟幕明亮;知识点前停顿 0.8 秒,每幕结束停顿 1.5 秒
- 语速 150-170 字/分钟
BGM(类型:music)
- 风格:轻快原声吉他 / 尤克里里 / 简单钢琴,BPM 90-110,匹配手绘质感
- 困境幕加小调元素,顿悟幕回归大调
- 3 分钟以上或有明显情感转折时可分段,每段独立 audio_id
- 音量不超过旁白音量的 40%
4. 素材生成
风格预设与配色方案
根据 Final_Video_Spec.md 中锁定的风格预设,在图像/视频生成时自动套用对应配色与风格锁定词。四种预设如下:
风格预设背景色强调色线条色风格锁定词(英文,追加到 Prompt 末尾)经典科普#FFFFFF 纯白#FFD700 金黄纯黑 2-3pxclean educational style, friendly and approachable, golden yellow accent, pure white background温暖叙事#FFF8F0 暖白#FF8C69 暖橘深棕 2-3pxwarm storytelling style, cozy and inviting, warm orange accent, soft cream background冷静分析#F5F7FA 冷白#4A90D9 冷蓝深灰蓝 2-3pxanalytical style, cool and precise, steel blue accent, light gray-blue background紧张悬疑#1A1A2E 深蓝黑#FF4444 警示红白色 2-3pxtense suspenseful style, dramatic contrast, warning red accent, dark navy background, white lines on dark
使用规则:
- 图像与视频生成 Prompt 均须包含当前风格预设对应的「风格锁定词」整段,与全局手绘极简锁定词(no realistic lighting, no shadows, no shading, flat illustration, hand-drawn minimalist style)叠加使用。
- 紧张悬疑预设为深底白线风格,角色/场景图生成时须将线条色从黑色切换为白色,背景色切换为 #1A1A2E;其余三套预设均为浅底深线,按默认黑色线条处理。
- 同一项目内所有 shot 使用同一风格预设,不得中途切换;若用户在 Step 0 之后要求更换风格,须重新生成全部已产出资产。
角色与场景图像生成
角色 key_element 参考图 → TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
- 每个角色生成一张横向并排对比图:左侧为头肩特写(面部识别基准),右侧为全身图(服装/配饰/姿态)。
- 同一角色不同情绪/造型变体使用 ImageToImage(同模型),以首次生成图为参考确保一致性。
场景 element_scene 背景图 → TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
- 角色图确认后批量生成;所有场景图使用同一组风格参数。
分镜视频生成
使用 MultiModalToVideo,默认模型:Seedance 2.5,分辨率 480p,时长 5-8秒(单次调用不超过 15s)。
每次调用的参考输入:
- 该 shot 绑定的角色元素图(必须)
- 该 shot 绑定的场景背景图(必须)
- 上一个 shot 的视频(仅当该 shot 与上一 shot 连续性极强时才添加,默认不加)
音频生成
旁白 narration VO → text to narration,模型:MiniMax Speech 2.8 HD(支持中英文多语言)
- 按幕分段生成,便于逐幕调整节奏。
BGM → text_to_instrumental,模型:Mureka 8
- 若 BGM prompt 中不含知名艺人名称,也可使用 Suno 5。
资产管理
- 每张生成图像/视频/音频生成后立即 register asset_id。
- 角色图、场景图分别 bind 到对应 key_element;shot 视频 bind 到对应 shot 槽位;音频 bind 到对应 audio_layer。
- 若用户上传了角色参考图或音频,优先 register + bind 用户素材,不重复生成。
5. プロンプト作成
全局规则
语言:用户使用中文交互时,Prompt 正文用中文撰写;Prompt 中的风格锁定词(英文关键词组)保留英文。
全局手绘极简锁定词(图像和视频生成均必须包含):
no realistic lighting, no shadows, no shading, flat illustration, hand-drawn minimalist style
风格预设锁定词:根据 Final_Video_Spec.md 中锁定的风格预设,从媒体生成节「风格预设与配色方案」表格中取对应行的「风格锁定词」整段,追加到全局锁定词之后。配色(背景色、强调色、线条色)也须同步写入 Prompt 中对应的颜色描述位置。
角色参考图 Prompt(TextToImage)
以导演+美术指导简报风格撰写,结构:角色描述 → 辨识特征 → 构图 → 风格锁定。
示例结构:火柴人角色,圆头+呆毛,纯黑轮廓线 2px,无填充,正面全身站姿,左侧头肩特写右侧全身并排,纯白背景,手绘极简线条风格,关节处标记小圆点,表情简洁有辨识度,stick figure, minimalist line art, 2-3px stroke, pure white background, no fill, no realistic lighting, no shadows, no shading, flat illustration
禁止词:realistic, 3D, shading, gradient, texture, render, ray tracing
场景背景图 Prompt(TextToImage)
结构:场景核心元素(≤5个)→ 构图留白要求 → 风格色彩 → 风格锁定。
示例结构:极简办公室背景,一张桌子轮廓+一把椅子+窗框,画面中下部大面积留白供角色站立,背景 #FFFFFF 纯白,强调色 #FFD700,minimalist background, simple geometric shapes, plenty of white space, center-bottom clear, hand-drawn minimalist style, no realistic lighting, no shadows, no shading, flat illustration
禁止词:detailed, photorealistic, complex, crowded, realistic lighting
分镜视频 Prompt(MultiModalToVideo / Seedance 2.5)
结构:镜头动作(参考图绑定)→ 情绪状态 → 角色动作三阶段 → 运镜 → 风格锁定 → 否定词
- 引用参考图使用占位符 <<<image_1>>> 绑定角色图,<<<image_2>>> 绑定场景图。
- 角色动作必须写明「预备-主动作-缓冲」三阶段(如:先弯腿蓄力,随即向前猛冲,落地后身体前倾弹回)。
- 运镜必须包含方向+速度+景别变化(如:缓慢从远景推进到中景,镜头微微左移)。
- 动画物理风格词(表现弹性感):bouncy exaggerated motion, anticipation and follow-through, squash and stretch
- 否定词(必须包含):no realistic physics, no cinematic lighting, no motion blur, no depth of field, no subtitles, no music, no realistic lighting, no shadows, no shading
- 若该 shot 有独立旁白音频轨,不在视频 Prompt 中重复旁白文本。
运动类型速查
动作Prompt 描述行走bouncy walk cycle, exaggerated arm swing跑步leaning forward 30 degrees, speed lines trailing跳跃crouch-jump-squash with rebound惊讶sudden startle, limbs extend, exclamation mark above head思考slow pacing, side-to-side sway, question mark floating
6. 動画編集
组装规则
拼接顺序:严格按 Storyboard shot 顺序拼接,不得调整。
转场执行(依据各 shot 的 transition 字段):
transition 值执行方式时长cut硬切,无过渡0帧pop_in中心放大+弹跳缓动0.3秒fade淡出→淡入0.5秒wipe从左向右擦除0.4秒
禁止:3D翻转等复杂特效;连续 3 个以上非硬切;叠化用于动作场景。
呼吸停顿:凡 shot 标注 pause_after: true,在该 shot 结束后插入 2 秒静止定格帧。
音频混合:
- 旁白音轨对齐对应 shot 的起始帧。
- BGM 贯穿全片,音量不超过旁白音量的 40%。
- 困境幕若有小调 BGM 变奏段,在该幕起始处淡入切换(0.5秒淡变)。
节奏检查:顿悟幕末尾 shot 及收束幕末尾 shot 须有明显停顿感(通过 pause_after 或手动延长末帧实现);全片旁白与画面时长差异不超过 0.5 秒/幕。