Akira Toriyama-inspired animation
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
当用户希望制作鸟山明漫画/动画美学风格的短片时优先路由至本 Skill,涵盖《阿拉蕾》《龙珠》《龙珠Z》《龙珠超》等不同时期视觉风格;适用场景包括:战斗热血短片、日常轻松喜剧片段、变身高潮序列、角色宣传片等。使用 GPT Image 2 生成角色与场景图像,Seedance 2.5(分辨率 480p) 制作镜头视频。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
全流程阶段与依赖关系:
- 剧情开发(编剧阶段): 本阶段目标是将用户的任意程度输入(一句灵感、角色名字、战斗场面描述等)发展为可供分镜设计使用的完整故事大纲。分以下子步骤推进,每个子步骤完成后须暂停向用户确认再进入下一步,不得跳步:
a. 提炼核心创意: 读取用户的初始输入,归纳出"谁 × 想要什么 × 遇到了什么阻碍"三要素,用 1—2 句话复述给用户确认,确保理解无误后再继续。若用户输入中三要素不完整,可主动补充合理提案(明确标注"建议"),由用户选择接受或调整,不得静默替用户做决定。
b. 确定故事类型、风格时期与输出语言: 根据创意判断最匹配的类型(战斗热血 / 日常喜剧 / 变身高潮 / 角色宣传片),并询问用户:- 风格时期:早期圆润(阿拉蕾/初期龙珠)/ 中期热血(龙珠Z)/ 后期现代(龙珠超);若用户未指定,给出推荐并说明理由;
- 输出语言:中文 / 日语(影响台词对白、旁白 VO 的语言,以及视频内字幕、配音音色方向);若用户未指定,给出推荐并说明两种选择的差异(中文更贴近国内受众,日语更贴近原版动画氛围),待用户确认后锁定,不得静默默认。
c. 建立三幕结构: 将核心创意扩展为三幕结构大纲: - 第一幕(建立):引入主角与世界观,呈现核心冲突的起因或日常状态;
- 第二幕(对抗/发展):冲突升级、角色受挫、关键转折点;
- 第三幕(高潮/结局):决战或爆发、结果与情绪落点。
大纲以段落形式展示给用户,明确每幕的情绪基调、主要动作和关键角色。用户可修改任意幕,直到整体方向确认。
d. 角色路线确认与角色场景设定: 在列出角色之前,须先通过 reply_to_user 向用户确认角色创作路线,并主动说明两条路线的差异与风险: - 原创角色路线(推荐): 设计在外形上参考鸟山明美学风格、但发色/服装配色/发型轮廓均做了差异化处理的全新角色;Skill 会全程引导完成原创化设计,生成成功率高;
- 原作角色改编路线(有风险,需告知): 若用户希望以悟空、贝吉塔等原作角色为基础,须明确告知:直接使用原作角色姓名或高度贴近原作的视觉特征(标志性发色+服装配色+发型的组合),在图像生成和视频生成两个阶段均有较高概率触发版权安全过滤而失败;Skill 会执行原创化处理(替换发色、服装配色等),最终产出的角色外观将与原作有明显差异,而非原作角色的直接复刻;用户须确认接受这一处理前提后再继续。
不得将此作为中性的二选一问题直接抛给用户,须明确说明推荐方向及原因,由用户知情后做出选择。
路线确认后,依据已确认的大纲列出短片所需的全部角色(主角/配角/对手)和场景(战场/室内/村庄等),每项给出简要描述(外形风格方向、性格/情绪基调)。若用户已提供角色或场景设定,核对并整合,不重复发明已存在的内容。
e. 场景列表(Scene List): 将三幕大纲细化为按时序排列的场景列表,每条记录:场景编号、所在幕次、核心事件(一句话)、情绪基调、涉及角色。场景列表是分镜设计的直接输入——确认场景列表后才可进入分镜阶段。目标时长与场景数量须匹配(参考:每个场景对应约 1—2 个 shot,高潮场景最多 3 个;30s 短片约 3—4 个场景,60s 短片约 5—6 个场景,2 分钟短片约 8—12 个场景)。最终 shot 总数须以分镜设计阶段的 shot 数量上限为准,不得超出。
剧情开发阶段全部确认后,通过 text_editor 建立 Final_Video_Spec.md,锁定全局参数:片名、类型、风格时期、画幅(16:9)、分辨率(480p)、目标时长、输出语言,以及已确认的三幕大纲摘要和场景列表。
- 调用 storyboard_designer 依据用户提供的剧情/构思设计分镜:完善 key_element(角色、场景、道具),规划 shot 列表及跨镜头音轨(BGM、旁白 VO)。
- 参考资产处理(用户提供优先): 分镜设计完成后,检查用户是否已上传对应的角色三视图、场景参考图或其他素材;
- 已提供且风格符合:通过 media_generator 注册 asset_id 并绑定到对应 key_element,不重新生成;
- 已提供但风格与本 Skill 目标画面风格不符(如写实照片、3D渲染、其他漫画风格等):须通过 resource_prepare_and_analyze 提取素材中的角色/场景外观信息,再通过 media_generator 以 ImageToImage 引用用户素材重新生成符合鸟山明风格的三视图或场景图;向用户说明将基于其提供的素材重新制作符合影片风格的参考图,并等待用户确认后再生成;
- 未提供:在下一阶段由 media_generator 按 Storyboard 描述生成。
- 通过 media_generator 生成尚未覆盖的 key_element 图像(角色三视图、场景图、载具图等);已绑定用户素材的条目跳过。全部生成完毕后,须逐一核查 Storyboard 中每个 key_element 条目是否均已有对应 asset_id 并完成绑定;发现任何遗漏(未生成或已生成但未绑定)须立即补齐,确认所有 key_element 均已覆盖后才可进入下一阶段。
- 生成含台词镜头前的音色确认: 在开始逐镜头视频生成之前,若 Storyboard 中存在任何含角色台词(dialogue)的 shot,须通过 reply_to_user 主动询问用户是否愿意为相关角色提供声音样本(录音片段或参考音频均可);同时说明:提供样本后系统可将其注册为该角色的 key_element_audio,在所有含台词的镜头生成时持续传入,确保跨镜头音色一致。若用户明确表示不提供或跳过,系统须依据该角色在 Storyboard 中的描述(性别、音色特征、情绪基调)通过 media_generator 调用 text to narration 生成一段 3—5s 的角色声音样本,注册为该角色的 key_element_audio 并绑定到对应 element character;生成前须向用户说明即将生成的音色方向(如"沉稳低沉男声,适合热血战斗角色"),由用户确认或微调方向后再生成;所有含台词角色均完成 key_element_audio 注册后,才可进入镜头视频生成阶段。
- 逐镜头通过 media_generator 生成最终视频,默认以 element 图像作为视觉参考。
- 通过 media_generator 生成所有音频层(BGM、旁白等)。
- 所有媒体就绪后,调用 video_assembler 完成时间线组装,引导用户导出。
依赖关系: 2→1;3→2;4→3;5→4;6→4,5;7→2;8→6,7。
关键节点暂停确认: 不得一次性执行全部流程。每完成一个重要阶段(剧情确认、规格锁定、Storyboard 完成、参考资产绑定/生成完成、镜头视频完成、音频完成)后须暂停,通过 reply_to_user 或卡片邀请用户审阅确认,再继续下一阶段。
逐资产生成确认: 在每一批新资产生成(包括 element 图像、镜头视频、BGM、旁白 VO 等)开始之前,须先通过 reply_to_user 向用户说明即将生成的内容(资产类型、数量、对应的 Storyboard 条目),明确获得用户确认后才可调用 media_generator 执行生成。不得在未经确认的情况下连续触发多批生成任务。
风格时期选择: 若用户未明确指定风格时期,在开始前询问用户选择:早期(圆润可爱,阿拉蕾/初期龙珠)、中期(硬朗热血,龙珠Z)或后期(现代重制,龙珠超)。不同时期影响 Storyboard 设计和 Prompt 描述方向,须在 Final_Video_Spec.md 中记录锁定。
2. マルチモーダル分析
处理用户上传的参考素材:
- 角色参考图(插画、截图、手绘稿): 提取角色的发型形态、瞳孔样式、肌肉比例、服装配色与褶皱特征,输出结构化描述,用于锁定对应 key_element 的外观属性,确保后续图像生成与参考一致。
- 场景参考图: 识别建筑风格(中式/日式/西式/科幻混搭)、地形特征(丘陵草原/荒野岩石/城镇)、光影基调(明亮田园/高对比战斗),记录为 element scene 描述。
- 动态/动作参考视频: 提取关键动作节点(出拳、变身、气功波蓄力)和镜头语言(低仰角、鸟瞰、快速切换),作为 shot 描述的运动参考信号。
- 音频参考(BGM/音效): 分析曲风、节奏、情绪基调(热血/轻松幽默),输出文字描述用于音频层生成。
3. 絵コンテ設計
叙事结构与导演编排原则
本节为分镜设计提供导演视角的框架,确保从场景列表到 shot 列表的转化有据可依。
开场钩子(第一幕首镜)
- 短片第一个镜头须在 4—6s 内建立"视觉钩子",让观众立即感知世界观:战斗短片以冲击力画面开场(低仰角特写、能量波纹、眼神),喜剧片段以夸张表情/荒诞情境开场;
- 避免以静态环境空镜冷开场(除非背景音乐+旁白同步起),第一帧应有角色或动态元素存在。
幕间节奏设计
- 第一幕:建立节奏宜稳,镜头时长偏中等(6—10s),重点是让观众认识角色与情境;过快切换会令初始人物关系混乱;
- 第二幕:节奏可逐步加快,战斗镜头逐渐缩短至 4—6s,配合情绪密度上升;转折点可设置一个刻意放慢的"呼吸镜头"(6—8s),让情绪落差在对比中放大;
- 第三幕:高潮段密集快切,然后在高潮顶点后给予一个较长的"稳定确认镜头"(6—10s)让情绪释放;结局镜头若有台词或情绪落点,可回归中等节奏收尾。
场景转换导演策略
- 同幕内场景切换(如战斗中变换地点):在转场前安排一个明确动作作为"推出"依据(如人物飞出画面、爆炸遮蔽视野),避免硬切带来的空间混乱;
- 幕间场景切换(如第一幕日常→第二幕战场):可设计一个情绪转折台词或旁白作为转场锚,使画面切换同时伴随情绪跃迁;
- 回忆/闪回(如有):须在 shot 描述中明确标注"[闪回]"并说明与主时间线的关系,建议不超过 2 个连续镜头,以免叙事跳出主轴太远。
各类型短片的导演优先级
- 战斗热血型:优先将最强打击感的镜头放在第二幕末(不是第三幕开头),第三幕开头设计短暂的"沉默/沉重"形成对比,随后高潮爆发效果更强;
- 日常喜剧型:优先设计"反应镜头"——主角的夸张反应往往比动作本身更有趣;每个笑点后给 1—2s 的"沉默落地时间"再进入下一拍,让喜剧节奏有呼吸感;
- 变身高潮型:变身序列须是全片最长的叙事段落,蓄力段的"克制与压抑"是爆发感的前提,不得跳过或压缩蓄力段直接进入爆发;
- 角色宣传片:以"角色特质展示"为核心,每个镜头对应一个角色维度(实力/性格/标志性动作),在全片末尾设计一个最具冲击力的定格收尾镜头。
shot 数量与总时长规划
在开始逐镜头设计前,须先根据 Final_Video_Spec.md 中的目标时长规划总 shot 数量上限,避免设计出超出时长的 shot 列表:
- 30s 短片:约 4—7 个 shot;
- 60s 短片:约 8—12 个 shot;
- 2 分钟短片:约 15—25 个 shot;
- 规划时将场景列表中每个场景映射为 1—2 个 shot(高潮场景最多 3 个),建立镜头分配草案后再逐镜设计。
设计 key_element
- 角色(element character): 须记录以下属性——
- 发型:形态(尖刺/束状)+ 方向(上竖炸开/服帖圆润)+ 颜色;
- 面部:大而圆的眼睛 + 简洁黑色瞳孔 + 高光点 + 粗犷眉毛 + 极简鼻子 + 夸张嘴型(若有表情);
- 体型:肩宽体壮肌肉夸张比例(中后期)/ Q版圆润矮胖(早期);
- 服装:精确颜色搭配与标志性配色 + 简练褶皱线条;
- 所属时期视觉风格(早期圆润 / 中期硬朗 / 后期现代)。
- 若角色存在多形态(如普通态与超级赛亚人态),逐一记录各形态描述。
- 场景(element scene): 须按以下结构记录——
- 地形与空间层次: 前景/中景/背景各层地貌(如"前景:碎裂岩石平台;中景:荒漠坑洼平原;背景:橙红天空与远山轮廓");
- 建筑与构造特征: 风格(中式亭台/西式圆顶/科幻胶囊建筑/宇宙飞船舱室)及场景内主视觉焦点;
- 光影基调: 主光方向与色温(高角度暖阳/逆光冷色轮廓光/舱内冷白人工光)、赛璐璐 2—3 级阴影层级;
- 场景状态标注: 初始状态(完好/轻度破坏/极度破坏)及跨镜头破坏程度递进方向(用于战斗进程中的场景渐进破坏表达)。
- 典型场景类型设计指引:
- 荒野战场: 前景碎裂岩石与扬尘,中景坑洼地面(战斗推进须标注弹坑/地裂分布范围),背景橙红或暗红天空;须标注破坏等级(0 级完好→3 级满目疮痍),用于链式生成不同阶段场景图;
- 田园乡村: 圆润低矮的丘陵与树木,开阔草原,远处可见圆顶农舍或中式亭台;光影明亮温暖,阴影柔和,整体带有牧歌氛围;
- 宇宙飞船内部: 记录主要功能区(驾驶舱/走廊/战斗舱)、舱壁材质(金属板/玻璃舷窗)、灯光色彩(冷白荧光/警报红光);飞船外景另立子条目,记录飞船外形特征与宇宙背景(星空/行星/星云)。
- 道具(key_element): 重要道具(龙珠、战斗铠甲、武器)须记录造型特征和配色。
- 机械载具(key_element,独立类别): 鸟山明标志性的"复古未来主义"机械须单独立为 key_element,描述须包含——
- 整体造型:圆润曲面外壳 / 流线型机身 / 复古机甲轮廓,明确主视角(正侧面/四分之三视角);
- 材质细节:可见铆钉与接缝线、金属质感高光、玻璃舱盖透明度;
- 配色方案:主色 + 副色 + 金属结构色(如银色、深灰、铜色);
- 功能标志:推进器/排气口位置、仪表盘简笔示意、胶囊公司 Logo 等标识(如有);
- 比例参照:若镜头中有角色驾驶/使用该载具,注明角色身高与载具的相对比例关系。
角色多形态跨镜头外观锁定策略
- 每个存在多形态的角色,须在 key_element 描述中为每种形态单独建立一个子条目(如 [普通态]、[超级赛亚人态]、[变身中间态]),逐项记录以下锁定属性:
- 发型变化: 颜色(黑→金色/蓝色)、形态变化(服帖→全部竖起炸开)、发丝粗细与蓬松程度;
- 眼睛/瞳孔变化: 瞳孔色(黑色实心→青绿色/蓝色透明感)、眼白是否泛光;
- 皮肤与肌肉: 肤色是否变深/泛金色光、肌肉轮廓线是否更突出;
- 气焰与光晕: 能量气焰颜色、范围、闪电弧光有无及颜色;
- 服装形变: 布料是否撕裂、铠甲是否破损,撕裂位置与程度需具体描述;
- 变身中间态(如有): 须额外描述过渡阶段的特征(如半金色发、气焰不稳定、面部肌肉抽搐)。
- 生成 key_element 图像时,同一角色不同形态须按顺序链式生成:以普通态图像为锚点,后续形态均通过 ImageToImage 引用前一形态图,确保面部基础特征(眼距、鼻型、体型轮廓)在跨形态中保持一致。
- 在 shot 描述中引用角色时,须明确标注当前使用的形态 ID(如 [Element_Goku_SSJ]),不允许形态模糊引用。
设计 shot 列表
- 每个镜头时长须动态规划,范围严格控制在 4—30s(Seedance 2.5(分辨率 480p) 模型硬限制),不得低于 4s 或超过 30s:
- 短镜头(4—6s):适用于单一冲击动作(一拳/一踢/一次台词反应)、情绪切换的定格特写,或变身蓄力段的情绪停顿;节奏紧凑,不宜塞入过多动作节拍;
- 中等镜头(6—10s):适用于含 2—3 个连续动作节拍的战斗交换、日常对话来回、场景建立镜头;是最通用的镜头时长区间;
- 长镜头(10—30s):适用于需要在单镜头内完成"起-承-转"完整弧线的高潮段落(如变身爆发核心镜头、大招蓄力释放全过程);须在 story beats 中明确列出 2—4 个内部切换节拍,确保节奏密度与时长匹配,避免画面空洞;
- 时长决策原则:优先根据叙事节拍数量与情绪密度决定时长,而非默认使用最长值;多个短促冲击宁可拆为多个 4—6s 镜头,而非强行压入一个 30s 镜头。
- 每个 shot 描述须包含:
- 场景(Scene): 引用 element scene ID,说明环境状态(战斗破坏程度、天气);
- 故事节拍(Story Beats): 按时序列出角色动作与情绪变化,引用 element character ID;战斗镜头须描述打击动作轨迹、身体扭转和重心转移;日常镜头须描述夸张表情与肢体喜剧动作;如有台词须写出精确对白;
- 分镜语言(Cinematography): 镜头规模(全景/中景/特写)、镜头角度(低仰角增强威压感、鸟瞰展现规模)、镜头运动(推/拉/横移/锁定);战斗场景优先使用低地平线仰视角度;
- 内部切换节拍(若单镜头含多个切换): 按叙事顺序依次描述各个画面阶段的动作、角度和情绪转变。
变身序列的专项分镜编排
变身是全片高潮时刻,须用 6—8 个镜头构建"蓄力 → 爆发 → 稳定"三段节奏,不得压缩为单一镜头:
- 蓄力段(2—4 个镜头,每镜 4—8s): 角色低头、双拳握紧、全身颤抖;镜头语言以紧绷的特写与中景交替为主;在 story beats 末尾标注"【BGM 降至极低音量或静音,保留蓄力气息音效】",作为 video_assembler 的混音锚点;
- 爆发帧镜头(2 个镜头,6—10s): 变身核心镜头,设计为全程高动态;须包含:金色气焰由脚底向全身蔓延、地面辐射裂纹、闪电弧光环绕、发色由黑转金、瞳孔变色;优先使用低仰角广角镜头;在 story beats 末尾标注"【BGM 随气焰爆发同步拉满音量】";必须引用变身后形态的 key_element 图像(如 [Element_Goku_SSJ])确保外观与 element 锁定一致;
- 稳定确认段(2 个镜头,4—6s): 变身完成后凝视或台词镜头,气焰稳定后角色抬头;可将"瞳孔特写变色"设计为内部切换节拍;
- 跨镜连贯性: 蓄力段末帧若需与爆发镜头姿态严格接续,可将末帧截图作为爆发镜头的 start_frame 参考输入;通常不附加 reference_video,以免限制爆发镜头的动态幅度。
设计跨镜头音轨
- BGM: 至少规划一条全局背景音乐轨道;热血战斗场景与日常轻松场景情绪差异较大时,可拆分为多段不同风格的音乐段落,各自对应不同的镜头跨度。每段 BGM 须按叙事阶段给出以下细化描述,供音频生成时使用:
- 日常/建立段(第一幕): 轻快幽默,带有80年代动画卡通感;乐器以木管/钢琴/轻弦乐为主;速度区间 90—120 BPM;节奏型宽松,留有喜剧反应镜头的呼吸空间;
- 冲突升级段(第二幕前半): 情绪逐渐紧张;打击乐层次加厚,弦乐进入高频区域;速度区间 120—140 BPM;节奏型由宽松转密集,配合镜头切换节奏加快;
- 蓄力/静默段(变身蓄力或高潮前的压抑段): BGM 降至极低音量或完全静音,保留低频嗡鸣或弦乐持续单音;节奏感弱化,让镜头内置的气息音效主导氛围;(此段对应 video_assembler 的 BGM 降音处理锚点)
- 高潮爆发段(变身完成/决战): 高能量摇滚/管弦乐混合;电吉他与铜管齐奏;速度区间 150—180 BPM;节奏型密集有力,鼓击与打击帧精准对齐;
- 收尾/情绪落点段(第三幕结局): 情绪由激昂回落;弦乐主导,节奏型舒缓;速度区间 70—90 BPM;根据结局情绪(胜利/感伤/开放式)选择大调明亮收尾或小调余韵收尾。
- 旁白 VO(若有): 类型设为 narration;须定义 narration_speaker_profile(音色特征,如 [沉稳低沉男声,带磁性颗粒感])、语言(中文/日语)、通过 layout_instruction 绑定至对应镜头段落;中文旁白与日语旁白须分别建立独立 audio_layer,不混用同一语音轨道。旁白脚本须按情绪段落拆分书写,而非整段平铺,每段标注以下信息:
- 情绪基调:该段旁白的情绪(沉郁回忆、紧张预警、热血激昂、温柔收尾);
- 语速节奏:整体语速(慢 / 中 / 快)及关键词重读提示;
- 停顿标注:在脚本文本中用"‖"标记较长停顿(约0.5—1s),用"|"标记短停顿(换气/节拍停顿),帮助 TTS 生成时更接近人工表演节奏;
- 音量变化趋势:如"从低沉起句,在'……决战!'处音量拉至最强,随后渐收";
- 示例格式:[沉稳男声旁白] 情绪:沉郁→爆发;语速:慢起渐快;"在那场战斗之后‖一切都变了。|没有人知道‖他付出了什么……‖才换来了这一刻的——‖胜利!"("胜利"重读,音量最强)
- 角色台词(dialogue): 须在 shot 的 story beats 中写出精确对白(用引号括起),并标注发言角色的 element ID;台词的故事板记录须同时包含表演方向,紧跟对白文本以括号标注:
- 情绪状态:如(愤怒压抑、轻松调侃、恐惧强撑镇定、爆发喊叫);
- 语速与音量:如(语速极慢、重音落在最后一字、音量从低到爆发、尾音拉长);
- 停顿与节拍:如(说至"……"时停顿约1秒,深吸一口气,再说后半句);
- 肢体协同:台词对应的面部微表情与肢体动作,供视频 Prompt 同步描述。
- 示例格式:[Element_Goku] "卡卡罗特……你永远都不会赢。"(声音低沉克制,语速极慢,重音落在"永远",说完后嘴角微抽,拳头缓缓握紧)
- 台词在视频 Prompt 中以 Seedance 2.5(分辨率 480p) 的 {...} 格式嵌入;若台词语言与项目语言不同须在花括号前标注语言代码;台词的声音一致性依赖角色 key_element_audio 绑定——若用户已提供角色声音样本,须通过 media_generator 注册为 key_element_audio 并绑定到对应 element character,在生成含该角色台词的 shot 视频时通过 audio_infos 传入。
镜头轴线与角色空间方位维护
同一战斗或对话场景内,多镜头切换容易因越轴导致角色左右位置颠倒,须在 shot 描述中主动锁定并维护轴线关系:
- 建立轴线(场景首镜): 在该场景第一个 shot 的"分镜语言"中明确写出轴线设定,如"主角位于画面左侧面向右,对手位于画面右侧面向左,轴线为二者连线,摄像机始终保持在轴线同侧";后续所有该场景内的 shot 须在 Cinematography 字段标注"保持与首镜轴线一致";
- 合法越轴(须主动标注): 当剧情需要刻意制造空间混乱(如角色被击飞越过轴线、爆炸摧毁空间秩序、刻意的迷失感镜头)时,须在 shot 描述中标注"[刻意越轴]"及越轴理由,后续 shot 须重新建立新的轴线设定;
- 切轴镜头过渡(非硬越轴): 若需在同一场景内合理切换至背面或侧面角度,须在该 shot 描述中写出过渡依据,如"摄像机绕至主角身后的中轴线镜头,两角色均居中背对/面对,空间方位中性化后再重建轴线";
- 多角色场景的方位锁定: 三人及以上角色的场景须在首镜 shot 描述中逐一写出各角色的初始屏幕方位,并标注哪些角色在该场景内始终保持固定方位、哪些角色允许移动换位。
风格时期对分镜设计的影响:
- 早期(阿拉蕾/初期龙珠): 多圆润构图,角色 Q 版比例,镜头节奏轻快幽默,以日常奇幻和搞笑反应镜头为主;
- 中期(龙珠Z): 大量低仰角威压镜头、鸟瞰毁灭性场景、高速残像切换;镜头情绪密度大,戏剧性强;
- 后期(龙珠超/现代重制): 在中期基础上增加更丰富的粒子特效描述和现代数字光影过渡,保留赛璐璐笔触感。
4. 素材生成
模型使用限制(全局强制):
- 本 Skill 全程仅允许使用以下两个模型,不得替换为其他模型:
- 图像生成(TextToImage / ImageToImage): 固定使用 GPT Image 2;
- 视频生成(MultiModalToVideo): 固定使用 Seedance 2.5(分辨率 480p);
- 若上述模型执行失败,不得自动切换至任何其他图像或视频生成模型;须停止当前任务,通过 reply_to_user 向用户说明失败情况,由用户决定是否重试或更换方案。
图像生成画幅独立原则(全局强制)
- 角色三视图与场景四宫格参考图的生成画幅与 Final_Video_Spec.md 中记录的视频画幅(16:9)完全独立,不得将视频画幅套用于图像生成任务。具体画幅规则如下:
- 角色全身三视图: 固定使用横向宽幅(三图横向并排,整体比例约为 2:1 至 3:1,宽大于高),确保三张全身立绘并排后不被裁切;
- 场景四宫格参考图: 固定使用正方形或接近 4:3 的横向比例,确保四格均等分布、构图完整;
- 以上画幅设置在调用 GPT Image 2 时通过 Prompt 构图声明("三图横向并排""四格宫格布局")和分辨率参数共同控制,不依赖视频画幅参数。
element 图像生成
- 使用 ImageToImage 或 TextToImage,模型固定为 GPT Image 2,分辨率 2K。
- 每个角色生成一张全身三视图(正面 / 侧面 / 背面横向并排),三视图须均为全身立绘,不得截至腰部或肩部;三视图须覆盖:发型整体形态(含后脑)、服装全貌(含鞋)、体型轮廓与肌肉比例,背景为纯色或白色,便于后续视频生成参考。
- 同一角色的多形态(如普通态→超级赛亚人态)优先使用 ImageToImage,以先生成的形态三视图作为参考,确保基础特征一致。
角色三视图原创化处理(生成阶段强制执行)
在生成任何角色三视图之前,须主动评估该角色外观是否高度贴近已有版权 IP 的视觉特征(发色、发型轮廓、服装配色方案的组合),并在图像生成阶段同步执行以下原创化调整,不得等到视频生成被拒绝后才补救:
- 发色原创化:若角色原设发色为高识别度 IP 标志色(如金色全竖发、纯黑上竖刺发、蓝色短发等),须在生成 Prompt 中主动替换为非常见 IP 配色(如深蓝、银白、棕红、暗紫等),同时保持动漫尖刺风格;替换色须在 Storyboard 的 key_element 描述中同步更新,确保跨镜头描述一致;
- 服装配色重映射:若角色原设服装配色方案与已知版权 IP 标志性配色高度重合(如橙+蓝组合、白护肩深蓝战甲等),须在生成时替换为非 IP 常见色组合(如暗绿+米色、深紫+银灰等),保留服装结构设计但改变配色;
- 发型形态微调:在保留动漫尖刺风格的前提下,调整尖刺数量、方向或蓬松程度,使整体轮廓与高辨识度 IP 角色有明显差异;
- 面部结构差异化:若角色面部特征高度贴近已知 IP(如极度棱角分明的方下巴男性战士、圆脸圆眼的 Q 版小女孩机器人),须在 Prompt 中对以下至少一项做差异化描述:脸型轮廓(方颌→圆颌/尖颌)、眉弓高度、眼距宽窄、鼻翼形态;差异化方向须在生成前向用户说明并获得确认;
- 气焰/能量特效颜色独立化:能量气焰、战斗光晕的颜色须与角色发色做差异化处理——若角色被设定为金色发,能量气焰改为蓝紫色或银白色;若角色发色为深蓝,气焰改为橙红色或青白色;避免"发色=气焰色"这一与特定 IP 强绑定的视觉规律;
- 多形态链式原创化:同一角色不同形态的三视图均须应用上述原创化调整,链式生成时以已原创化的形态图为锚点,确保各形态外观自洽;
- 生成前向用户确认方向:原创化调整方案须在生成前通过 reply_to_user 向用户展示(说明发色替换方向、服装配色调整方案),由用户确认或微调后再执行生成;不得静默修改角色外观。
- 若用户已上传角色参考图:
- 已是全身三视图且风格符合:直接注册 asset_id 并绑定到对应 key_element,无需重新生成;
- 不是三视图(单张正面图、半身图、截图等),无论风格是否符合:均须以用户提供的图为参考,通过 ImageToImage(模型 GPT Image 2,分辨率 2K)重新生成符合鸟山明风格的全身三视图;向用户说明将基于其提供的素材制作全身三视图,等待确认后再生成;重新生成的三视图注册为新 asset_id 并绑定到对应 key_element,原用户素材可保留为辅助参考;
- 是三视图但风格不符(如写实照片、3D 渲染、其他漫画风格等):同上,以用户素材为参考通过 ImageToImage 重新生成符合鸟山明风格的全身三视图。
机械载具图像生成
- 载具 key_element 图像使用 TextToImage(无参考时)或 ImageToImage(有草图/参考时),模型固定为 GPT Image 2,分辨率 2K。
- 生成构图要求:四分之三侧视角(45° 前侧面)为主视图,可附加正侧面视图;背景为纯色/深色,确保轮廓清晰;载具周围不放置角色,以免干扰比例判断。
- 若镜头中角色需驾驶/使用该载具,在 shot 生成阶段额外生成一张人车比例参照图(使用 ImageToImage,同时引用角色 element 图与载具 element 图),作为 reference_image 供视频生成参考。
- 同系列不同款式载具(如同款不同损坏程度)优先使用 ImageToImage 链式生成,以完好版为锚点。
场景(element scene)图像生成
- 所有场景参考图均须生成多角度无人物四宫格参考图,四格内容固定分配:
- 左上:全景定场 — 展示整体空间布局与地貌层次(前景/中景/背景);
- 右上:陈设特写 — 聚焦场景内关键道具、建筑构件或地表细节;
- 左下:纵深透视 — 以透视线强调空间深度,体现场景纵深感;
- 右下:气氛光效 — 突出该场景的主光方向、色温与阴影层次的情绪表达。
- 四格均不出现角色,背景、风格锚定词与单张场景图保持一致。
- 使用 TextToImage(无参考时)或 ImageToImage(有参考时),模型固定为 GPT Image 2,分辨率 2K。
- 用户已上传场景参考图的处理规则:
- 若用户上传的已是符合上述四宫格格式(多角度无人物四宫格):直接注册 asset_id 并绑定到对应 element scene,无需重新生成;
- 若用户上传的不是四宫格格式(单张截图、插画、照片等):以用户提供的图为视觉参考,通过 ImageToImage 重新生成符合四宫格规范的场景参考图(保留场景外观特征、替换为鸟山明风格并补全四格内容);向用户说明将基于其提供的素材制作四宫格参考图,等待确认后再生成;重新生成的四宫格图注册为新 asset_id 并绑定到对应 element scene。
- 荒野战场须生成两套四宫格:0 级完好版与 3 级极度破坏版,以完好版四宫格为锚点,破坏版通过 ImageToImage 链式生成;两套均注册为独立 asset_id 并绑定到同一 element scene 的不同状态子条目;
- 宇宙飞船须将舱室内景与飞船外景分别生成独立四宫格并注册为独立 asset_id,不合并为同一条目。
镜头视频生成
- 使用 MultiModalToVideo,模型固定为 Seedance 2.5,分辨率 480p,画幅比例 16:9,单镜头时长在 4—30s 之间,根据 Storyboard shot 设计决定。
- 批量生成前全局场景绑定核查(开始任何镜头视频生成之前必须执行一次): 在生成第一个 shot 视频之前,须遍历 Storyboard 中的所有 shot 条目,逐一确认每个 shot 引用的 element scene 已有对应 asset_id 并已完成绑定;发现任何 shot 缺少场景绑定(未生成或未绑定),须立即生成并绑定对应场景四宫格参考图,全部 shot 均有 element scene 绑定后才可开始任何镜头的视频生成。不允许以"该镜头没有特定场景"为由跳过——若 shot 确实无特定场景(如纯特写无环境),须在 Storyboard 中明确标注"无场景参考",视为已处理,不算遗漏。
- 生成前 Prompt 自检(每个镜头生成前必须执行): 在调用生成器之前,逐条对照当前 shot 的 Storyboard 描述,核查已撰写的视频 Prompt 是否完整覆盖以下项目——
- 场景参考: 该 shot 引用的 element scene 图像是否已作为参考输入绑定;
- 角色参考: 该 shot 中出现的全部 element character 图像(含正确的形态 ID,如 [Element_Goku_SSJ])是否均已绑定为视觉参考;
- 台词与对白: shot 的 story beats 中若含有精确对白,须确认已用 Seedance 2.5(分辨率 480p) 台词格式 {...} 嵌入 Prompt,语言代码标注无误,且发言角色的 key_element_audio(如已注册)已通过 audio_infos 传入;
- 道具与载具: shot 中出现的重要道具或载具 element 图像是否已绑定;
- 相邻镜头 start_frame: 若满足相邻镜头衔接条件,前镜头末帧截图是否已作为 start_frame 传入;
- 故事节拍覆盖完整性: 将已撰写的视频 Prompt 与 Storyboard 中该 shot 的 story beats 列表逐条对照,确认每一条节拍(动作、情绪变化、次要角色反应、台词)均在 Prompt 中有对应描述;发现遗漏须立即补入 Prompt,不得带缺口提交生成。
- 发现任何遗漏,须在生成前补齐,不得带缺口执行生成。
- 每个 shot 的参考输入:
- 必选: 该镜头涉及的所有 element character 图像 + element scene 图像(若有独立 scene 图),绑定为视觉参考;
- 可选(仅当与前一镜头连续性极强时): 将前一镜头的 final_shot 视频作为 reference_video 输入;日常情况下跳过视频参考,优先以 element 图像驱动生成。
- 相邻镜头衔接(动作连续性): 当相邻两个 shot 满足以下全部条件时——场景相同(引用同一 element scene)、涉及角色相同、且动作在叙事上直接连续——须将前一镜头 final_shot 的末帧截图作为下一镜头的 start_frame 参考输入,与 element 图像一并传入,确保两镜头姿态/构图平滑衔接;若三个条件不能同时满足(如场景切换或角色不同),则跳过此规则,仅以 element 图像驱动。
- 若用户已提供视频素材且对应某个 shot,绑定为该 shot 的 final_shot,跳过生成。
Seedance 2.5(分辨率 480p) IP 安全过滤触发时的参考图视觉离散化处理**
当镜头视频生成被 Seedance 2.5(分辨率 480p) 安全过滤器拒绝,且拒绝原因指向参考图像与受版权保护 IP 视觉特征高度相似时,按以下步骤处理——问题根源在于参考图本身,而非视频 Prompt 文字,不得仅修改 Prompt 后重试:
- 定位触发参考图: 确认本次生成中传入的所有 element character 图像,判断哪张(或哪组)图像最可能触发了过滤器(通常是标志性发型 + 服装配色的组合过于贴近原作);
- 对触发图像执行视觉离散化重生成: 通过 media_generator 调用 ImageToImage(模型 GPT Image 2,分辨率 2K),以原 element 图为参考,按以下方向之一或组合对角色外观做差异化调整,使其在视觉上明确偏离原作,同时保留鸟山明艺术风格:
- 发色替换: 将高识别度发色(金色超赛、黑色刺发)替换为非原作常用色(如深蓝、银白、棕红);
- 服装配色重映射: 将标志性配色方案(如橙+蓝、深蓝战甲+白护肩)替换为非原作常见色组合(如暗绿+米色、深紫+银灰);
- 发型形态调整: 在保留动漫尖刺风格的前提下,调整尖刺数量、方向或蓬松程度,使整体轮廓与原作角色有明显差异;
- 体型比例微调: 在不破坏风格的前提下适当调整身材比例(如身高感、肌肉分布),使角色整体辨识特征与原作拉开距离;
- 更新 element 绑定: 将重生成的离散化图像注册为新 asset_id,rebind 至对应 key_element,替换原有参考图;
- 重新提交视频生成: 使用离散化后的 element 图像重新生成该镜头,其余 Prompt 内容和参考输入不变;
- 向用户说明: 通过 reply_to_user 告知用户已对角色参考图进行视觉离散化处理(说明具体修改方向),并展示重生成的参考图供用户确认方向;若用户不接受该修改方向,与用户协商其他调整方案后再执行;
- 批量触发时的处理原则: 若同一批镜头中多个 shot 均被拒绝,优先检查是否源于同一个 element character 图像;若是,只需对该图像执行一次离散化处理并重新绑定,所有依赖该 element 的 shot 统一使用新图像重新生成,不得对每个 shot 单独执行重复的图像重生成。
音频生成
- BGM: 使用 text_to_instrumental,模型 Suno 5 或 Mureka 8(默认 Suno 5;若 Suno 5 失败则切换 Mureka 8);热血战斗段落描述为"高能量摇滚/管弦乐,快节奏,充满张力";日常轻松段落描述为"轻快幽默,带有80年代动画卡通感"。
- 旁白 VO: 使用 text to narration;默认模型 MiniMax Speech 2.8 HD(中文/日语/多语言首选);若旁白为英语且对音色质感要求高,可切换至 ElevenLabs v3;中文与日语旁白须分别调用,各自对应独立 audio_layer。
- 分段生成原则: 不得将整段旁白脚本一次性投入 TTS 生成;须按 Storyboard audio_layer 中已标注的情绪段落拆分,每个情绪段落单独调用一次 TTS,确保每段都有对应的情绪指令控制,避免整段生成时情绪被平均化拉平;
- 每段 TTS 调用须将 Storyboard 中标注的情绪基调、语速节奏、重读提示、停顿标注一并写入 Prompt(见 Prompt 写作部分的旁白 TTS Prompt 专项规范);停顿标注(‖ / |)在提交 TTS 时保留在脚本文本中,由模型解析为节奏提示;
- 分段生成完毕后,在 video_assembler 中按 layout_instruction 依序拼接为完整旁白轨道,确保段落间自然衔接而非硬切。
- 角色 key_element_audio: 若用户提供角色声音样本(录音或参考音频片段),通过 media_generator 注册为对应 element character 的 key_element_audio;在生成含该角色台词的 shot 视频时,通过 audio_infos 传入,确保台词音色在跨镜头中保持一致;若用户未提供声音样本,系统须依据 Storyboard 中该角色的描述(性别、音色特征、情绪基调)通过 text to narration(默认 MiniMax Speech 2.8 HD)生成一段 3—5s 的角色声音样本,注册为该角色的 key_element_audio 并绑定到对应 element character;后续含该角色台词的 shot 视频生成时同样通过 audio_infos 传入,确保跨镜头音色一致,不依赖 Seedance 2.5(分辨率 480p) 自动合成。
单个资产局部迭代重新生成
当用户对某个已生成资产(镜头视频、角色三视图、场景四宫格参考图)不满意时,按以下路径局部重新生成,不触发全流程重跑:
- 重新生成前确认: 通过 reply_to_user 与用户确认不满意的具体原因(构图 / 色彩 / 动作 / 角色外观 / 场景一致性等),针对性调整 Prompt 或参考输入后再重跑;不得在无修改的情况下直接重跑原 Prompt;
- 镜头视频(final_shot): 仅重新生成该 shot 的视频,生成后将新 resource_id rebind 到该 shot 的 final_shot 槽位;已完成的其他 shot 保持不变;若该 shot 是下一镜头 start_frame 的来源,新视频生成后须同步更新下一镜头的 start_frame 截图;
- 角色三视图(element character 图像): 仅重新生成该 element 的图像,rebind 后检查 Storyboard 中所有引用该 element 的已生成 shot;若新三视图与旧版差异明显,须通过 reply_to_user 向用户列出受影响的 shot,由用户决定是否对这些镜头重新生成,不得自动触发;
- 场景四宫格参考图(element scene 图像): 仅重新生成该 element scene 的四宫格图,rebind 后同上,向用户列出所有引用该场景的已生成 shot,由用户决定后续处理;
- 不触发全流程重跑原则: 单个资产的迭代修改不得级联自动重新生成所有下游资产;影响范围须向用户明确说明,逐一经用户确认后再执行,不得批量静默触发。
5. プロンプト作成
全局最高优先级: 用户使用中文交互时,prompt 正文一律用中文撰写;台词对白、旁白 VO 脚本内容须严格遵循 Final_Video_Spec.md 中锁定的输出语言(中文或日语),与交互语言无关,不得混用或自行替换。日语台词须在 Seedance 2.5(分辨率 480p) 的花括号前标注语言代码(如 jp{...});日语旁白 TTS 须单独建立 audio_layer,使用 MiniMax Speech 2.8 HD 调用,不与中文旁白混用同一轨道。
版权合规原则(所有 Prompt 均须遵守):
- 禁止直接引用受版权保护的专有名称: 在图像和视频 Prompt 中,不得直接写出受版权保护的角色姓名(如悟空、贝吉塔、比克、布尔玛、特兰克斯、阿拉蕾等原著角色名)或作品标题(如《龙珠》《龙珠Z》《龙珠超》《阿拉蕾》等);一律以外观特征描述代替,常见替换示例:
- "悟空" → "黑色竖刺发型少年,穿橙色道服,腰系蓝色腰带";
- "超级赛亚人悟空" → "金色全竖炸发少年,穿橙色道服,青绿色眼瞳,全身金色气焰环绕";
- "贝吉塔" → "黑色上竖发型,身着深色战斗铠甲,白色护肩,表情严肃的肌肉男性战士";
- "比克" → "绿色皮肤,尖耳朵,头戴白色头巾,穿白色斗篷的高挑男性战士";
- "弗利萨" → "白色光滑外壳,紫色面部,无发型,细长的尾巴,面部有紫色条纹的人形外星生物";
- "阿拉蕾" → "扎双马尾辫的小女孩,戴圆形大框眼镜,穿连衣裙,肩部有机械拼接细节";
- "龙珠" → "橙色圆形宝珠,表面刻有数量不等的红色五角星图案";
- "龟派气功" → "双手合拢从腰侧推出、掌心发射的蓝白色高密度能量光束,光束边缘有向外扩散的同心圆光晕";
- "终极闪光" → "双臂侧展蓄力后向前合拢发射的蓝紫色巨型宽幅能量光束,光束两侧有弧形电弧环绕";
- "界王拳" → "全身皮肤泛红光、散发红色气焰,肌肉线条极度突出,气焰外层带白色轮廓高光";
- "元气弹" → "从天空汇聚大量金色/橙色能量粒子,凝聚成巨型发光球体,体积远大于角色身形,球体表面有旋涡状能量流动"。
- 场景专有名词替换写法:
- "赛亚星 / 贝吉塔行星" → "红棕色天空笼罩的荒芜外星星球,地表布满高耸锐利的黑色岩石柱群,重力极高,遍地岩浆裂缝,无植被";
- "那美克星" → "翠绿色天空、三颗太阳的外星星球,地表遍布圆顶白色岩石建筑村落,海洋呈青绿色,地貌平坦辽阔";
- "界王星" → "宇宙虚空中悬浮的极小型球形星球,重力极强,地表种有一棵巨大圆冠绿树,星球外边缘有螺旋状星云环绕";
- "天下第一武道会擂台 / 武道大会场地" → "圆形八角石质格斗擂台,台面为浅灰色打磨石板,四周临海,远处可见观众看台与旗帜";
- "精神时光屋 / 时之室" → "无限延伸的纯白色虚空间,地面与天空均为纯白,无边界,地面有薄雾状云气漂浮,空间感极度空旷压抑";
- "神之神殿" → "悬浮于高层云海之上的白色柱廊神殿建筑群,建筑风格为古典圆柱廊道,俯视可见云层以下的蓝色星球曲面";
- "地狱 / 魔界入口" → "昏暗红黑色调的异界空间,漂浮的岩石平台与熔岩裂缝交错,远景有巨型骷髅状岩石构造,空气中弥漫紫色雾气"。
- 道具专有名词替换写法:
- "战斗力探测器(战斗力测量仪)" → "单眼透明镜片式面部设备,卡扣在一侧耳朵,镜片内显示绿色数字读数,镜片形状为椭圆形";
- "龙珠雷达" → "圆形掌上探测仪,机身为橙色圆柱体,正面有一块圆形屏幕显示光点坐标,顶部有短天线";
- "如意棒" → "可伸缩延长的红色金属棍棒,两端为圆形收口,表面有黑色条纹装饰";
- "胶囊 / 太空舱胶囊" → "指尖大小的白色圆柱形胶囊,投掷至地面后瞬间冒出白色烟雾,从中变出全尺寸载具或建筑";
- "战斗铠甲(赛亚战甲)" → "白色硬质高分子护胸甲,覆盖胸腹两侧,配白色圆弧形护肩,内衬深紫色或黑色紧身连体衣,腰部配白色短裤甲片";
- "重力训练舱" → "圆球形金属训练舱体,外壳为灰白色金属板件,舱体有一扇圆形舱门,外接管道与发电设备,内部光线昏暗";
- "界王的小车" → "圆润复古造型的粉红色小型轿车,车身比例矮宽,轮廓柔和,整体卡通感强"。
- Prompt 提交前版权自检(每条图像/视频 Prompt 写完后必须执行): 逐词扫描已写好的 Prompt,对照以下高风险词类,发现任何一项须立即替换为视觉描述后再提交:
- 角色固有名词(人名、外号、称号);
- 作品/系列/集数标题(包括缩写,如"DBZ""GT");
- 招式/技能名称(如"气功波""终极闪光""界王拳""元气弹"等须替换为动作/效果描述);
- 场景专有名词(如"那美克星""界王星""精神时光屋"等须替换为环境外观描述);
- 道具专有名词(如"战斗力探测器""龙珠雷达""如意棒""胶囊"等须替换为外形描述);
- 作者署名词(如"鸟山明"不可出现在 Prompt 内);
- 组织/种族专有名词(如"赛亚人""银河巡逻队""胶囊公司"等须替换为描述性语言,如"外星战士种族""星际执法机构""圆顶工业建筑企业")。
- 风格描述以视觉特征替代专有归属: 风格锚定须使用可描述的视觉语言("日本80至90年代经典少年漫画动画风格,赛璐璐着色,高饱和度,干净黑色轮廓线"),不依赖作者署名作为 Prompt 中直接生成指令的核心词;风格锚定描述已按此原则撰写,写作时保持该用法;
- 音乐 Prompt 禁止包含已知艺人/乐队名称: BGM 生成 Prompt 不得包含具体音乐人或乐队的名字(Suno 5 在此情况下高概率失败,且存在版权风险);应以风格、情绪、乐器、速度描述代替;
- 用户原创角色不受上述限制: 若角色、场景、音乐风格均为用户自主创作且不涉及已有版权 IP,无需刻意回避名称,按实际创作内容描述即可。
图像 Prompt(TextToImage / ImageToImage,GPT Image 2)
以导演+美术总监联合简报的方式撰写,自然段落描述"主体+动作+环境",短语描述"风格/色彩/光影/构图",不写心理动机或镜头外内容,只写镜头可见内容。
图像风格锚定描述(所有图像 prompt 均须植入,禁止使用作者名或作品名):
手绘动画风格,赛璐璐平面着色,高饱和度明亮色彩,干净锐利的黑色轮廓描边,无交叉排线,色块分明的两到三级阴影过渡,带有轻微复古胶片颗粒感,原创角色设计
风格描述使用原则: 不得在任何图像或视频 Prompt 中使用"鸟山明""80至90年代少年漫画""DragonBall 风格""DBZ 风格"等可直接与特定 IP 关联的标签;须以"赛璐璐平面着色""手绘动画风格""高饱和度描边动漫风"等纯技法/视觉语言描述替代。
角色图像(key_element character)Prompt 结构:
- 发型:形态(尖刺/束状)+ 方向(上竖炸开/服帖圆润)+ 原创化后的颜色(不得直接使用高识别度 IP 标志色,须使用已与用户确认的替换色);
- 面部:大而圆的眼睛 + 简洁黑色瞳孔 + 高光点 + 粗犷眉毛 + 极简鼻子 + 夸张嘴型(若有表情);
- 体型:肩宽体壮肌肉夸张比例(中后期)/ Q版圆润矮胖(早期);
- 服装:原创化后的颜色搭配(使用已与用户确认的替换色组合,不得直接使用 IP 标志性配色方案)+ 简练褶皱线条;
- 原创化声明(每条角色图像 Prompt 必须写入): 在 Prompt 末尾附加一句明确声明,如"该角色为原创设计,发色与服装配色为独立创作,非任何已有版权作品的角色复刻",强化模型识别为原创内容;
- 生成全身三视图时,明确写出:"正面 / 侧面 / 背面三图横向并排,均为全身立绘(含头顶至脚底),白色或纯色背景,无遮挡,三图比例一致";不得生成半身或头肩构图。
场景图像(element scene)Prompt 结构:
所有场景图均生成四宫格参考图。Prompt 须植入鸟山明风格锚定描述(同角色图),并按以下结构撰写:
四宫格格式声明(每条场景图 Prompt 开头必须写入):
四格宫格布局,四个格子分别为:左上全景定场、右上陈设特写、左下纵深透视、右下气氛光效;每格均为独立构图,无角色,无文字,无水印;整体为单张图像的四格拼合,非视频,非序列帧
四格内容描述层级(按顺序撰写):
- 左上—全景定场:以"前景 / 中景 / 背景"三层依次描述地貌与空间布局;
- 右上—陈设特写:聚焦场景内关键道具、建筑构件或标志性地表细节,画面紧凑;
- 左下—纵深透视:透视线明确,强调空间延伸感,前景元素引导视线向纵深延伸;
- 右下—气氛光效:主光方向 + 色温 + 赛璐璐阴影层级(两至三级)+ 情绪氛围;
- 破坏/状态标注(若有):在各格描述中明确当前状态(完好 / 极度破坏)及破坏特征;
- 全局禁止项:所有格内不出现角色、文字标识、水印;四格风格锚定词统一。
视频生成时引用四宫格场景图的注意事项:
- 在视频 Prompt 中引用四宫格场景图作为场景参考时,须在参考图说明中写入以下内容(逐条明确,防止模型在不同镜头中随机选取不同格子作为场景依据):
- 格子内容说明: "该图为四宫格场景参考图:左上为整体空间全景定场、右上为场景内陈设特写、左下为纵深透视角度、右下为气氛光效表现;四格描述的是同一个场景的不同侧面,不是四个独立场景。"
- 主构图锚定: "请以左上全景定场格为本场景的空间布局基准,将四格信息综合理解为同一场景环境;在视频中以统一的单画面场景呈现,不要在不同镜头中切换使用不同格子的构图,不要生成四格分割画面。"
- 一致性要求: 同一个 element scene 在所有引用它的 shot 视频 Prompt 中,上述说明必须保持一致,确保跨镜头场景空间布局稳定,不因参考图被不同解读而导致场景跳变。
典型场景落地语言:
- 荒野战场(完好版):
前景:灰褐色岩石地面,散落大块不规则碎石,干裂地缝延伸入画面;中景:坑洼起伏的荒漠平原,地表呈土黄色与赭石色交替;背景:橙红渐变天空,远处低矮山脉轮廓;高角度正侧光,暖橙色调,赛璐璐两级阴影;无角色,无文字
- 荒野战场(极度破坏版,基于完好版 ImageToImage 生成):
在完好版基础上:前景出现直径3—5米的辐射状弹坑,碎石碎块向四周飞散堆积;中景地面布满辐射状深裂缝,部分地块隆起错位;背景天空转为深红色,扬起的尘土云遮蔽远山;整体破坏等级3级,满目疮痍
- 田园乡村:
前景:圆润低矮的绿色草丘,零散野花点缀;中景:开阔平坦草原,远处可见圆顶农舍或中式亭台轮廓;背景:明亮蔚蓝天空,蓬松白云;高角度暖阳从右上方投射,阴影柔和,赛璐璐两级过渡,整体明亮温暖牧歌氛围;无角色,无文字
- 宇宙飞船舱室内景:
前景:金属质感地板,可见铆钉接缝与防滑纹路;中景:舱室内部,左右两侧为弧形金属舱壁板件,玻璃舷窗透出深黑色宇宙背景;背景:驾驶台或功能控制面板,冷白荧光灯管排列;冷白色人工光,赛璐璐两级阴影,金属高光明确;无角色,无文字
- 宇宙飞船外景:
飞船主体占据画面中央,四分之三侧视角;飞船外形简洁流线,可见舱盖玻璃与推进器尾焰;背景为深黑色宇宙空间,散布星点,远处可见行星轮廓或星云色彩;冷蓝色环境光,金属高光锐利;鸟山明复古未来主义飞船美学;无角色,无文字
机械载具图像(key_element 载具)Prompt 结构:
专项风格锚定词(所有载具图须植入):
复古未来主义机械设计,赛璐璐风格平面着色,工业设计图纸般的精确感,圆润曲面外壳,可见铆钉与接缝线,简洁仪表盘
描述层级(按顺序撰写,合并为自然段):
- 整体轮廓:外形轮廓特征(流线型 / 圆润曲面 / 复古机甲),主视角(正侧面 / 四分之三 45° 前侧面);
- 机身分段:舱盖/机头/机身/推进器各区域形态描述;
- 机械细节:铆钉排列、接缝线走向、仪表盘简笔示意、功能标志(排气口、推进器喷口、品牌徽章);
- 材质与配色:主色 + 副色 + 金属结构色(银/深灰/铜色),金属高光点位,赛璐璐平面着色;
- 构图要求:深色或纯色背景,突出轮廓;载具居画面中央,无角色遮挡;可附正侧面线框图于右下角作为比例参考(可选)。
风格时期差异在 Prompt 中的体现:
- 早期:圆润柔和的线条,Q版可爱体型,鹅蛋形脸型,明亮温暖色调
- 中期:硬朗锐利的线条,棱角分明的脸型,极度发达的肌肉,强烈冷暖色对比,高反差光影
- 后期:保留赛璐璐笔触感,融入现代数字光影层次,更丰富的粒子特效,色彩更鲜艳饱满
视频 Prompt(MultiModalToVideo,Seedance 2.5(分辨率 480p))
- 参考图绑定: 每个角色的 element 图像用占位符 <<<image_1>>>、<<<image_2>>> 等逐一标注。
- 视频 Prompt 风格声明(每条视频 Prompt 开头必须写入): 不得使用任何与已有版权 IP 直接关联的风格标签;须以以下模板开头,声明原创属性与风格归属:
手绘动画风格,赛璐璐平面着色,高饱和度描边动漫风,原创角色设计,非任何已有版权作品的复刻或衍生
- 高风险视觉特征组合规避(每条视频 Prompt 写完后必须自检): 以下单项特征单独出现风险较低,但多项同时出现于同一镜头时,模型识别为特定 IP 的概率急剧上升;发现以下高风险组合须主动拆分或替换其中一项描述:
高风险组合(同时出现须处理)建议处理方式全竖尖刺发 + 橙色战衣 + 能量气焰替换服装颜色,或将气焰颜色改为非金色(如蓝紫色、银白色)黑色上竖刺发 + 深色战斗铠甲 + 白护肩替换铠甲配色,或调整护肩形态绿色皮肤 + 尖耳 + 白色头巾 + 斗篷替换皮肤色(如蓝灰色)或改变头饰形态白色外壳人形生物 + 紫色面部条纹 + 细长尾巴替换外壳颜色或去除尾巴特征蓝色短发女性 + 龙珠雷达道具描述道具时用外形描述替代,且不与特定发色组合出现
处理方式:优先在 Prompt 文字层替换描述,若根源在参考图,须先对参考图执行视觉离散化处理后再重写 Prompt。
跨镜头色调与光影一致性(同一 element scene 下的所有镜头,每条视频 Prompt 均须执行)
在引用同一 element scene 的所有 shot 视频 Prompt 中,须植入统一的色调锚定描述,以 element scene 描述中的"光影基调"字段为唯一权威来源,不得在 Prompt 写作时另行发明不同的光影设定:
- 色温锚定:明确写出该场景的主光色温描述(如"暖橙色调日光"或"冷白舱内人工光,蓝白色调"),同一场景的所有 shot Prompt 保持完全一致;
- 赛璐璐阴影层级:指定阴影级数("赛璐璐两级阴影"或"三级阴影"),与 element scene 中设定的层级保持一致,不在不同镜头间随意变化;
- 整体冷暖基调声明:在同一场景的所有 shot 描述末尾统一附加一条冷暖基调锁定语(如"整体暖色调,橙红天空,暖橙环境光"或"整体冷色调,蓝白人工光,金属冷高光"),防止模型在不同镜头中随机切换光影倾向;
- 特殊状态变化:若场景存在跨镜状态变化(如战斗进程中天空由橙红转暗红),须在受影响 shot 的 Prompt 中明确写出状态变化描述,而非复用完好版锚定语,避免场景状态与实际叙事阶段不符。
镜头轴线与空间方位维护(同一战斗/对话场景内的连续镜头,每条视频 Prompt 均须执行)
在同一场景内的连续镜头中,须在视频 Prompt 中明确写出空间方位锚定,防止越轴导致角色左右颠倒或位置跳变:
- 轴线声明:在涉及两个及以上角色的镜头中,在 Prompt 运动描述层前写出角色的屏幕方位(如"主角始终位于画面左侧,对手始终位于画面右侧"),并在同一场景内的所有 shot Prompt 中保持一致;
- 切换角度时的轴线说明:若需从正面切换至背面或侧面角度,须在 Prompt 中写出明确的转换依据(如"镜头绕至主角身后,主角位于画面中央背对镜头,对手可见于远景右侧"),不得仅说"切换镜头角度";
- 轴线越轴豁免:仅当剧情需要刻意制造空间混乱感(如角色飞出画面、爆炸打乱空间秩序)时,可在 Prompt 中明确标注"越轴转场,空间方位随意",其余情况严格维护轴线一致性;
- 跨镜头一致性要求:同一场景内所有 shot 的角色屏幕方位声明须保持完全一致,不得在相邻镜头间发生无理由的方位颠倒。
故事板节拍完整性转化原则(每条视频 Prompt 生成前必须执行):
在撰写视频 Prompt 之前,先将当前 shot 的 Storyboard 故事节拍(Story Beats)列表逐条过一遍,对照以下清单确认每项都已在 Prompt 中有对应描述,不得遗漏或合并:
- 动作节拍顺序: shot 中列出的每一个动作节拍须按叙事顺序在 Prompt 中依次呈现;用"先……随后……紧接着……最终……"等时序连接词串联,而非用钟点时间切割("0—3s"这类写法不稳定,避免使用);
- 情绪变化弧线: 若 story beats 中标注了角色情绪变化(如"从愤怒压抑到爆发"),须将情绪变化转化为面部表情、肢体动作和镜头节奏的具体描述,在 Prompt 中体现情绪的起伏走向,而非只写最终情绪状态;
- 次要角色与环境反应: story beats 中若有次要角色的反应镜头(如对手被击退)或环境反应(如地面碎裂、气浪席卷),须在 Prompt 对应动作节拍后明确写出,不得因"是次要内容"而省略;
- 台词与表演同步: 含台词的节拍须同时在 Prompt 中写出台词前的身体表演状态,再附 {...} 台词格式,确保语音与肢体动作在时间轴上同步而非分离;
- 内部切换镜头(长镜头专项): 若 shot 设计含多个内部切换节拍(10—30s 长镜头),须将每个内部段落依次描述,明确各段的场景焦点和镜头角度变化,不得压缩为单一笼统描述。
撰写完成后,将 Prompt 与 Storyboard story beats 列表再对照一遍,确认每条节拍在 Prompt 中均有对应覆盖,发现遗漏立即补入,再提交生成。
- 运动描述层级(按顺序):镜头运动 → 主体动作 → 空间/环境变化 → 音效/台词
- 战斗场景必含动态描述词(按需组合):
- 低仰角镜头增强威压感;
- 放射状冲击波线条;速度线与残像表现超高速移动;
- 地面碎裂碎石飞起;画面震动线传达打击力度;
- 金色火焰状气焰环绕全身;蓝白色能量光束带扩散光晕;闪电弧光环绕;
- 身体扭转与重心夸张化的格斗姿态;
战斗特效专项 Prompt 模板(Seedance 2.5(分辨率 480p))
以下为三类标志性特效的描述模板,按需嵌入 shot 的视频 Prompt 运动描述层,与角色动作描述合并成完整段落,不单独列段。
- 气功波(龟派气功 / 终极闪光等能量光束类):
双手合拢蓄力,全身蓝白色能量粒子向掌心汇聚,掌心出现高亮能量核心;释放时蓝白色光束从双手笔直射出,光束周围有向外扩散的同心圆光晕,光束尾迹带有能量粒子散逸;光束命中目标时产生球形爆炸,中心为纯白色,向外渐变为金色-橙色-消散;<...气功波轰鸣声,爆炸冲击波音效>
- 超级赛亚人变身气焰:
角色双膝微弯低头蓄力,全身轮廓开始振动;金色气焰从脚底地面向上蔓延包裹全身,气焰外层带有蓝白色闪电弧光不规则环绕;发色由黑转金,发型逐渐竖起炸开;脚下地面出现辐射状裂纹,碎石向四周飞散;画面边缘出现高频震动线;气焰稳定后角色抬头,瞳孔呈青绿色透明感;<...能量爆发低鸣声,雷电音效,碎石飞溅音效>
- 拳脚打击冲击波:
角色出拳/踢腿瞬间,拳/脚前方产生放射状白色冲击线条向外扩散;被击中一方身体在接触点出现短暂形变凹陷,随即向后高速飞出;飞出轨迹带有多重残像;冲击点附近地面/墙面产生辐射状裂纹;全画面短暂出现1—2帧震动线,传达打击力度;<...重击音效,冲击波爆裂声>
- 日常/搞笑场景必含动态描述词(按需组合):
- 夸张面部变形的喜剧反应表情;柔和圆润的肢体动作;明亮温暖的光线;
- Seedance 2.5(分辨率 480p) 音效标注格式(按需使用):**
- 背景音乐:(...);音效:<...>;台词:{...}(若非项目语言须在花括号前标注语言);片内字幕:【...】
- 台词(dialogue)在视频 Prompt 中的写法:
- 台词文本用 Seedance 2.5(分辨率 480p) 的 {...} 格式嵌入;若台词语言与项目语言不同,在花括号前标注语言代码(如 jp{...})。
- {...} 之前用自然语言描述台词的表演状态,将故事板中标注的情绪方向、语速、停顿转化为身体语言与面部动作:重音对应握拳或凝视,停顿对应低头/深呼吸/目光转移,音量爆发对应身体前倾/眼神聚焦;
- 示例:角色低头,双拳握紧,肩膀微颤,缓缓抬头,眼神极度克制,嘴唇轻颤,极慢开口,{卡卡罗特……你永远都不会赢。}(语速极慢,重音在"永远",说完后嘴角微抽)
- 固定负向描述(每条视频 prompt 均须附加):
- no subtitles(字幕在后期处理);no music(BGM 由独立音轨覆盖);旁白 VO 若已有独立轨道,不在视频 prompt 中重述完整 VO 内容。
旁白 TTS Prompt 写法(text to narration,每个情绪段落独立撰写)
每段旁白 TTS Prompt 须包含以下三层,合并为一段自然语言指令:
- 音色锚定:从 Storyboard narration_speaker_profile 直接引用,如"沉稳低沉男声,带磁性颗粒感,中文";
- 情绪与表演指令:该段的情绪基调 + 语速 + 音量变化趋势,如"情绪由沉郁缓慢起句,随叙事推进逐渐转为激昂,在最后一句时音量拉至最强,随后短暂停顿后以低沉收尾";
- 脚本文本:将故事板脚本原文(含 ‖ / | 停顿标注)直接嵌入,保留所有停顿标记供模型解析节奏;重读关键词可用【】标注强调,如"才换来了这一刻的——【胜利】!"。
示例完整 Prompt:
沉稳低沉男声,带磁性颗粒感,中文。情绪由沉郁平静起句,逐渐积聚张力,在"胜利"处音量爆发至最强,随后渐收。语速慢起渐快。脚本:在那场战斗之后‖一切都变了。|没有人知道‖他付出了什么……‖才换来了这一刻的——【胜利】!
6. 動画編集
节奏与剪辑基调:
- 战斗序列:切换节奏快,每个动作节拍紧密衔接,优先保留打击帧;冲击音效与视频打击帧精准对齐;
- 日常序列:节奏宽松,允许镜头在喜剧反应表情上多停留;
- 变身/能量爆发场景:在金色气焰爆发帧前保留"蓄力静默"段,具体参数见下方变身序列联动规则。
音频分层与混音:
- BGM 作为底层连续轨道;旁白 VO 在 BGM 之上,BGM 在旁白出现时自动降低音量(ducking);
- 镜头内置音效(Seedance 2.5(分辨率 480p) 生成的打击声、能量声)保留,不与 BGM 完全叠压;
- 片头/片尾:BGM 淡入淡出,时长 1—2s。
转场偏好:
- 同一战斗序列内的镜头间使用硬切,保持打击感的即时性;
- 场景切换(如战斗→日常)可使用短淡出或快速黑场过渡(0.3—0.5s);
- 变身序列允许使用闪白转场强化视觉冲击。
变身序列联动规则(与分镜设计蓄力/爆发/稳定三段直接对应):
- 蓄力段 BGM 处理: 在蓄力段起始点将 BGM 音量在 0.5—1s 内渐降至原音量的 10—20%(接近静音但保留气息感);整个蓄力段维持该低音量,配合镜头内置的蓄力气息音效;
- 爆发帧硬切 + BGM 拉起: 蓄力段末帧与爆发镜头首帧之间使用硬切(不加淡入),在硬切点同步将 BGM 音量在 2—4 帧(约 0.08—0.17s,24fps 基准)内拉升回满音量,形成爆发式冲击感;
- 闪白转场参数: 蓄力段末帧→爆发帧之间若需加闪白,闪白持续时长为 2—3 帧(约 0.08—0.13s);闪白帧为纯白色全屏叠加,第 1 帧不透明度 100%,后续帧线性衰减至透明;不宜超过 3 帧,否则破坏打击感的即时性;
- 稳定确认段衔接: 爆发镜头结束→稳定确认段之间使用硬切;稳定段 BGM 保持满音量持续播放,无需额外处理;
- Storyboard 锚点对应: 分镜设计中标注的"【BGM 降至极低音量或静音】"对应上述蓄力段处理,"【BGM 随气焰爆发同步拉满音量】"对应上述爆发帧硬切+拉起操作,组装时直接依据这两个锚点定位时间线位置。
最终交付前质量核查清单(导出前必须逐项确认):
在执行最终渲染导出之前,须逐项检查以下核查项,发现问题须返回对应阶段修复,确认全部通过后再导出:
- 场景一致性: 逐镜检查同一 element scene 下的所有 shot,确认场景空间布局、色调、光影方向无跳变;重点检查战斗场景中破坏程度是否与叙事阶段对应;
- 角色方位一致性: 检查同一战斗/对话场景内的连续 shot,确认角色屏幕方位未发生无理由的左右颠倒;
- 音画同步: 确认镜头内置打击音效与视频打击帧精准对齐;台词 {...} 与角色口型/表演动作同步;旁白 VO 与对应镜头画面内容匹配;
- BGM 音量曲线: 确认蓄力段 BGM 已降至低音量、爆发帧处已拉回满音量;旁白出现时 BGM 已自动闪避(ducking);片头片尾淡入淡出正常;
- 总时长与规格: 核对时间线总时长是否与 Final_Video_Spec.md 中的目标时长吻合(允许 ±5% 偏差);画幅与分辨率是否为 16:9 / 480p;
- 音轨完整性: 确认所有 audio_layer(BGM、旁白 VO)均已加载并覆盖对应镜头跨度;无静音空缺或轨道缺失;
- 转场类型正确性: 战斗序列内硬切、场景切换短淡出/黑场、变身序列闪白是否按分镜设计执行;无错误应用柔和淡入淡出至战斗镜头间;
- 发现任何核查项不通过,通过 reply_to_user 告知用户问题所在及建议修复方案,由用户确认后再执行修复和重新导出。
跨镜头色彩校正(组装阶段统一执行):
多批次生成的镜头视频之间可能因模型随机性导致色调漂移(如同一场景的相邻镜头出现冷暖偏差、饱和度不一致),须在组装阶段对全片做统一色彩校正,而非逐镜单独调整:
- 色调基准锁定: 以 Final_Video_Spec.md 中记录的风格时期为全局色调基准——早期(明亮温暖高饱和)、中期(高对比冷暖分明)、后期(鲜艳饱满带数字光影层次);选取视觉效果最稳定的一个镜头作为全片色彩参考帧;
- 场景组内校正优先: 同一 element scene 下的所有 shot 优先对齐至该场景的主光色温与赛璐璐阴影层级(以 Storyboard 中 element scene 的"光影基调"字段为准),确保组内一致后再进行全片整体统一;
- 统一调整参数(全片整体): 对比度、饱和度、色温三项基础参数做全片统一微调;动漫赛璐璐风格整体饱和度宜偏高(避免低饱和度导致色块发灰);避免对单个镜头单独强化,防止局部过饱和与其他镜头形成明显断层;
- 特殊状态镜头豁免: 蓄力/静默段(低亮度、低饱和)和变身爆发段(高亮度、高对比)在叙事上本身需要与常规镜头形成对比,不做强制色调对齐,以叙事阶段标注为依据保留其差异感;
- 色彩校正与质量核查联动: 完成色彩校正后须重新过一遍"场景一致性"核查项,确认调整后无新增的跨镜色调跳变,再进入导出流程。
导出设置: 16:9,480p,与 Final_Video_Spec.md 保持一致。