群像出场动画
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
将一张群像图片转化为完整的角色集结动画视频生成提示词。识别图中所有角色的外貌、服饰、武器、道具与属性,根据角色数量计算时长,规划逐角色出场镜头与集结收尾,最终输出可直接用于视频生成的结构化提示词。适用于:用户提供群像/角色合集图片并要求生成角色登场动画、集结视频、角色出场动画提示词的场景。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
执行流程(6步,逐步确认)
按以下顺序依次执行,Step 1 和 Step 2 完成后须展示中间产物并等待用户确认,Step 3–6 在获得 Step 2 确认后可连续执行。
多图处理规则
若用户提供多张群像图,对每张图独立执行完整流程:Step 1 一次性分析所有图片(每张产出独立角色识别报告),Step 2 为每张图分别确认参数,Step 3–6 为每张图分别生成独立视频素材。一张群像图 → 一个视频素材,不合并、不拆分。
Step 1 — 图像识别
调用 resource_prepare_and_analyze 分析用户提供的群像图片(多张则一次性全部分析),每张图输出独立角色识别报告(表格形式)。
展示报告,等待用户确认或修正后进入 Step 2。
Step 2 — 参数确认
根据每张图的角色数量分别计算并向用户确认以下参数:
- 视频比例:询问用户选择 16:9(横屏)或 9:16(竖屏)
- BGM 需求:询问用户是否需要背景音乐(默认无 BGM,仅保留环境音效与动作音效)。若需要 BGM,基于 Step 1 角色识别报告中的角色属性、武器类型与整体风格,推理出贴合角色风格的 BGM 风格描述(一句话,含风格、主要乐器与情绪基调),内嵌填入 write_media_prompt 占位符 {{音效与BGM}} 的有 BGM 分支,由视频生成工具一并直出,不单独生成音频 BGM。
- 时间分配:前 80% = Phase 1 出场阶段,后 20% = Phase 2 集结收尾,最后 1 秒 = 全员微动 + 标题书写(如有)
- 单角色边缘情况:当角色数仅为 1 人时,总时长 = min(1×4, 15) = 4 秒,Phase 2 = 4×20% ≈ 1 秒。此时 Phase 2 全部 1 秒用于微动收尾,跳过 Finale A 逐一定型段(单人无需逐一集结);Phase 1 = 3 秒,仅完成该角色的个人展示与武器技能释放,景别组合压缩为特写 + 全景 + 强透视三类(受时长限制,中景可省略)。
展示参数确认表,等待用户确认后进入 Step 3。
Step 3–5 — 占位符计算与分支确认
不调用任何工具,由规划器在内部完成占位符数值计算与分支选择,不创建 Storyboard,不调用 storyboard_designer,不注册任何 key_element:
- Step 3 场景:不单独规划场景。模板中"根据人物特征自动生成符合人物风格的场景"为固定文本,场景由视频生成模型基于参考图自行推理生成,不在提示词中插入任何具体场景描述。
- Step 4 占位符计算:根据角色数与 Step 2 确认结果,计算 {{总时长}}、{{Phase1时长}}、{{Phase2时长}} 的数值,确定 {{比例}}、{{标题处理}}、{{标题书写}} 的分支选择。镜头规划、出场方式、运镜、转场、光影、强风等全部由模板固定文本承载,规划器不再进行逐角色镜头推理。
- Step 5 BGM 风格描述(仅用户选择需要 BGM 时):基于 Step 1 角色识别报告中的角色属性、武器类型、整体风格,推理贴合角色风格的 BGM 风格描述(一句话,含风格、主要乐器、情绪基调),作为 {{音效与BGM}} 占位符有 BGM 分支的内嵌填充内容传递给 Step 6。
所有计算结果作为内部上下文保留,直接传递给 Step 6。不产出任何 Storyboard 条目或 shot 条目,不展示分镜给用户。
Step 6 — 提示词合成与视频生成
调用 media_generator(经 write_media_prompt),将 Step 3–5 的占位符计算结果合成为视频生成提示词,只调用一次 MultiModalToVideo 生成唯一视频素材。
关键约束:
- 完全跳过 storyboard_designer:整个流程不调用分镜设计师工具,不产生任何 Storyboard 或 shot 条目。Step 3–5 是规划器内部计算,不是工具调用。
- 不注册、不生成角色元素图(key_element):用户已提供原始群像图作为视觉一致性参考,直接以原图作为参考输入,跳过 key_element 注册与图片生成步骤。
- media_generator 只执行一次生成:占位符计算 → 唯一提示词 → 唯一 MultiModalToVideo 调用 → 唯一视频素材。
- 音频全部直出,不单独生成:全片所有音频(BGM、环境音效、动作音效等)均由视频生成工具一并直出,不单独调用任何音频生成工具。若用户选择需要 BGM,基于 Step 1 角色分析推理 BGM 风格描述,内嵌填入占位符 {{音效与BGM}} 的有 BGM 分支。
- 多图分别生成:若用户提供多张群像图,每张图各执行一次完整的 Step 3–6,各产出一个独立视频素材。
输入兼容性
- 群像图片(仅图片):Step 1 完整流程,需确认比例与 BGM
- 群像图片 + 指定比例:Step 2 跳过比例确认,仍需确认 BGM
- 群像图片 + 比例 + 时长:Step 2 后半跳过时长计算,仍需确认 BGM
- 群像图片 + 比例 + 时长 + BGM:Step 3 所有参数已确认,直接进入占位符计算
- 多张群像图片:Step 1 一次性分别分析,每张图各产出一个视频素材
注意:本 Skill 仅支持图片输入。若用户仅提供文字描述而无群像图片,提示 Planner 引导用户先提供群像图片再继续。
2. 多模态分析
群像图片分析任务
分析用户提供的群像图片,输出结构化角色识别报告(表格形式),每个角色包含以下字段:
- 编号:从左到右或按画面构图顺序编号
- 外貌特征:发型、发色、体型、肤色、面部特征
- 服饰细节:服装款式、颜色、材质、配饰
- 武器类型:武器种类与外观描述
- 道具配置:随身道具、特殊装备
- 战斗属性:近战/远程/魔法/敏捷/力量等
- 站位顺序:在画面中的位置描述
多图处理: 若用户提供多张群像图,一次性分别分析,每张图产出独立角色识别报告,报告间明确标注所属图片。每张图后续将独立生成一个视频素材。
额外检测: 识别参考图中是否存在标题文字信息;若有,记录文字内容,供 Finale B 阶段使用。
精度要求: 服装细节、武器类型、道具配置须尽量详尽,以保障后续视频生成的角色一致性。
3. 媒体生成
视频生成配置
- 生成工具:MultiModalToVideo,推荐模型 Seedance 2.5(480p,会员专属)。若 Seedance 2.5 不可用,依次尝试同工具下 Seedance 2.5、Seedance 2.5(均限 480p);若同工具所有模型均失败则终止任务,不切换到其他工具。
- 输入参考:用户提供的原始群像图片(作为视觉一致性参考)
- 分辨率:720P
- 比例:依 Step 2 用户确认结果(16:9 或 9:16)
- 时长:依 Step 2 计算结果,min(角色数 × 4秒, 15秒),单次生成上限 15 秒
关键约束: - 跳过角色元素图生成:用户已提供原始群像图作为视觉一致性参考,直接以原图作为参考输入,不调用 TextToImage / ImageToImage 生成角色元素图。
- 一张群像图 → 一个视频素材:每张群像图生成一条完整视频,包含所有角色出场与集结收尾,不拆分为多个视频或多个分镜素材。
- 多图分别生成:若用户提供多张群像图,每张图各生成一个独立视频素材。
- 音频全部直出,不单独生成:全片所有音频(BGM、环境音效、动作音效等)均由视频生成工具一并直出,不单独调用任何音频生成工具。若用户选择需要 BGM,基于角色分析推理 BGM 风格描述,内嵌填入占位符 {{音效与BGM}} 的有 BGM 分支。
生成前,由 write_media_prompt 完成完整提示词合成,再调用 MultiModalToVideo 生成。
4. 提示词撰写
一、模板铁律
- 语言:提示词全部使用中文撰写。若参考图中的标题文字本身为外文则保留原文,其余一律中文。
- 模板文字逐字保留:除 {{占位符}} 替换外,模板中所有文字必须逐字保留,不可改写、增删、替换。禁止添加模板中不存在的任何内容。严禁在提示词任何位置插入 <<<image_1>>> 或任何形式的参考图绑定/引用语法;模板开头的"基于参考图"固定文字即为唯一的参考图指示,不得在此基础上追加任何图片引用标记。
- 无角色描述插入:模板原文"先识别参考图中所有角色数量、外貌、服饰、属性、武器和道具"保持原文逐字保留,不在其后插入逐角色清单;角色识别由视频生成模型基于参考图自行完成。
- 无场景描述插入:模板原文"根据人物特征自动生成符合人物风格的场景"保持原文逐字保留,以句号收尾后直接接下一句,不插入任何场景描述;场景由视频生成模型基于参考图自行推理生成。
- 动作/运镜/转场/强透视描述保持原文:不将模板中的通用动作、运镜、转场、强透视描述改写或替换为逐角色的详细动作叙事,保持模板原文逐字保留。
- 叙述体:提示词为一气呵成的连贯中文段落,不使用分段标签(如【场景】【光影】等),不使用时间戳分段(如 0–2.4s / 2.4–4.8s 等)。
- 占位符填充文案逐字使用:除 {{音效与BGM}} 的有 BGM 分支外,所有占位符的填充文案必须逐字填入"占位符填充规则"中指定的固定文字,不得扩展、改写、补充或增删。{{音效与BGM}} 的有 BGM 分支为唯一允许基于分析内容填写的占位符,其中 <BGM风格描述> 部分基于 Step 1 角色识别报告推理填写(一句话,含风格、主要乐器与情绪基调,贴合角色属性与整体风格),其余文字仍为固定文案逐字保留。
- 上游上下文隔离:Step 1 角色识别报告、Step 3–5 内部规划推理中的所有内容(角色外貌细节、动作设计、场景构思等)仅为内部推理参考,一律不得插入提示词。唯一例外:当用户选择需要 BGM 时,基于角色分析推理出的 BGM 风格描述可内嵌于 {{音效与BGM}} 占位符的有 BGM 分支。提示词中出现的全部文字只能来自:模板原文 + 占位符填充文案(含 {{音效与BGM}} 有 BGM 分支的分析填充内容),无任何其他来源。
- 输出前自检:最终提示词输出前,逐项检查以下内容是否出现——若出现任何一项则必须删除后重新输出:
- <<<image_1>>> 或任何 <<<image_N>>> 参考图绑定语法 ❌
- 逐角色外貌/服饰/武器/属性清单或描述 ❌
- 具体场景环境描述(如"废墟""神殿""悬崖"等地名或环境细节)❌
- 视觉风格/美学描述(如"羊皮纸水墨厚涂""概念艺术"等模板外风格词)❌
- 逐角色动作叙事(将模板通用动作描述替换为具体角色的出场故事)❌
- 时间戳分段(如 0–2.4s / 2.4–4.8s 等逐段时间标记)❌
- 任何模板原文中不存在的词句 ❌
- 最终提示词总字符数超过 2300(Seedance 2.5 / Seedance 2.5 / Seedance 2.5 的上限;本 Skill 不使用 <<<image_N>>> 标签,故为纯文本字符上限)❌ — 若超限,优先压缩模板中重复的修饰性描述,不得删除结构化约束(景别要求、转场规则、光影/强风规范等)
二、提示词模板(含占位符)
以下为模板原文,{{}} 标记处为占位符,生成时按填充规则替换,其余文字逐字保留。
基于参考图生成一条 {{总时长}}秒、720P 分辨率、{{比例}}的顶级院线 CG 动画电影质感的角色集结动画,《英雄联盟:双城之战》Arcane 风格,先识别参考图中所有角色数量、外貌、服饰、属性、武器和道具,并确保全片每个角色的人物形象、服装细节、武器类型、道具配置和战斗属性保持高度一致,不出现人设偏差、服装变化、武器替换、比例失调、表情错乱或角色混淆;{{标题处理}};根据人物特征自动生成符合人物风格的场景。整体画面为高保真影视级 CG 渲染,材质细腻,光影对比强烈(特写镜头统一采用侧光或逆光照射,光影分布不均匀,强化人物轮廓、眼神、面部表情和武器材质。中景、全景镜头保持高对比度光影基调,避免平光、柔光、过曝、灰雾。),人物动作符合物理逻辑和经典动画原理,动作夸张但不扭曲,姿态灵巧生动,避免肢体崩坏、穿模、打滑、重心不稳、武器错位和空间错乱。全片处于强风环境中,角色头发、衣摆、披风、裙摆、飘带、绳索、配饰等可飘动元素持续大幅晃动,场景中的粉尘、雾气、碎屑、旗帜、布料、植物碎片也被强风吹起并形成三层空间层次(前景碎屑粉尘、中景角色周围风效、背景雾气旗帜布料),全片风向保持一致;所有人物特写镜头采用侧光或逆光照射,光影分布不均匀,强化眼神、面部轮廓、武器高光和服饰材质。前 80% 时长(约前 {{Phase1时长}}秒)内角色按顺序逐一出场,每个角色先完成独立帅气个人展示,再释放对应武器技能,最后通过流畅转场过渡到下一位角色,所有角色最终集结到一个符合整体角色风格和世界观的统一场景中;每个角色至少包含特写、中景、全景三类景别,并至少出现一次强透视效果镜头,强透视可以表现人物全身、肢体局部、武器前端、服饰细节、跳跃姿态、坠落轨迹或场景空间压迫感。每个角色的镜头组合随机差异化分配,避免所有角色使用相同节奏或相同运镜,相邻角色之间不可使用同类出场方式,部分角色可以从天空降落、高空坠落、跳跃突入、俯冲进入、翻越障碍、踩点落地、冲刺滑行进场,也可以从烟雾、尘土、光影或场景遮挡物中出现;人物动态包括奔跑、跳跃、转身、闪避、蓄力、出招、格挡、滑步、空翻、落地、换位和短暂停顿,动作应与武器属性匹配。镜头表现需要具备丰富空间变化,不只是平面推进,部分角色可以使用全景急速推进到特写、远景快速推进到近景、特写后拉到全景、全景后拉再急速推近、人物跳起时镜头急速上摇推进表情特写、人物下降时镜头下摇跟拍并快速后拉、人物落地时低机位仰拍并轻微抖动、人物从镜头前掠过形成强透视前景压迫、武器从镜头前横扫形成遮挡转场、人物跳跃穿过画面形成纵深变化;全片自由运镜,组合使用环绕、旋转、推拉、摇移、跟拍、升落、俯冲、甩镜、后退、环绕升降和镜头抖动,竖屏构图加强纵向运镜(升落、俯冲、垂直跟拍),横屏构图加强横向运镜(环绕、摇移、横向跟拍),景别跨度从极端特写、近景、中景、全景到大全景,穿插快慢镜头变化,关键表情、武器命中、跳跃顶点、落地冲击和最终定格可以使用微慢动作,转场、冲刺、俯冲、大范围运镜和连续动作保持快节奏。转场方式优先使用动势衔接、武器轨迹衔接、遮蔽转场、相似动作转场、烟雾尘土转场、光影闪切、甩镜衔接和镜头抖动衔接,避免无相关硬切,且相邻两个角色之间不可使用相同类型的转场;角色出场衔接要自然顺滑,前一个角色的动作方向、武器轨迹、遮挡元素或运动残影可以作为下一个角色出现的视觉锚点。每个角色的登场动作必须体现大幅度位移、高动态肢体爆发和专属武器高光时刻(如剑刃划地溅火花、长枪横扫掀飞碎石、法杖蓄力释放能量光环、弓弦回弹震出气浪),与强风环境联动——衣摆披风剧烈翻飞、尘土碎屑被气流卷起、武器划过空气留下可见轨迹;禁止平淡站桩或小幅动作。最后 20% 时长(约后 {{Phase2时长}}秒)进入集结收尾:收尾阶段前半段,全体角色按照参考图中的站位顺序逐一帅气出现,每个人拥有独有的定型动作并最终停在参考图对应的位置上,角色数达到或超过 5 人时定型动作简化为快速逐一定型(每人约 0.3–0.4 秒);当角色数仅为 1 人时,收尾阶段直接进入微动定格,跳过逐一定型;收尾阶段最后 1 秒,所有角色保持站位并进行自然微动,包括呼吸、眼神变化、头发飘动、衣摆晃动、武器轻微摇晃和身体重心微调{{标题书写}};最终集结画面构图完整、人物层次清晰、站位准确、光影统一、风格一致。{{音效与BGM}}
三、占位符填充规则
- {{总时长}}:min(角色数 × 4, 15),填入数字(如"12"、"15")
- {{比例}}:依 Step 2 用户确认结果填入"16:9"或"9:16"
- {{Phase1时长}}:总时长 × 80%,四舍五入至整数秒
- {{Phase2时长}}:总时长 × 20%,四舍五入至整数秒
{{标题处理}}(位于"角色混淆;"与";根据人物特征"之间): - 有标题:参考图中存在「标题内容」文字信息,则在影片结尾背景中触发文字快速一笔一划书写出现的效果
- 无标题:参考图中无标题文字信息,不添加任何额外文字
{{标题书写}}(位于"身体重心微调"与";最终集结画面"之间): - 有标题:,同时「标题内容」文字以一笔一划快速书写的形式同步出现在背景中
- 无标题:留空(不插入任何内容,"身体重心微调"后直接接";最终集结画面")
{{音效与BGM}}(位于模板末尾): - 无 BGM:全片无背景音乐,仅保留强风环境音、武器破空声、落地冲击声等环境与动作音效。无额外字幕,不添加参考图以外的文字信息。
- 有 BGM:全片配有<BGM风格描述>,并保留强风环境音、武器破空声、落地冲击声等环境与动作音效。无额外字幕,不添加参考图以外的文字信息。(其中 <BGM风格描述> 基于 Step 1 角色识别报告推理填写,一句话概括风格、主要乐器与情绪基调,贴合角色属性与整体风格)