Original designer-toy IP concept package
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
面向泡泡玛特风格潮玩IP的全案创作:从基础角色生成、四视图规范、表情/穿搭延展、排版美化、周边文创设计到动态展示视频。适用于IP孵化、品牌授权与文创产品开发场景。使用GPT Image 2生成图像、Seedance 2.5(分辨率 480p) 生成视频
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
全流程阶段与依赖关系:
- 建立IP设计brief — 通过 text_editor 建立Final_Video_Spec.md,锁定全局参数:IP角色概念描述(若用户未明确角色方向,触发灵感辅助——IP角色概念)、潮玩风格基调、品牌名称(固定值"BLUEPURPLE GIRL",不可覆盖)、主色调(固定值蓝紫渐变,不可覆盖)、周边产品品类清单(默认:手提袋、手机壳、抱枕、保温杯、遮阳帽、雨伞、贴纸、眼罩)、目标画幅(图像16:9与3:4、视频16:9)、输出语言。品牌名与主色调为固定值,后续所有步骤须严格引用,不可覆盖或更改。若用户上传已有IP角色参考图,通过 resource_prepare_and_analyze 提取角色核心特征(面部轮廓、发型发色、头身比、肤色、服装风格、主色调)并记录于brief中,作为后续步骤的一致性约束依据,同时跳过步骤2的基础形象生成。若用户上传多张参考图,按分析模块多图处理策略执行(主图选取+多角度互补+冲突处理)。
- 基础IP形象生成(如用户已上传IP角色参考图则跳过本步)→ media_generator(TextToImage,GPT Image 2)。同时生成3D渲染版(立体质感)与扁平矢量版(色块分明)两个版本。上传分支下,以用户上传图作为基础形象,直接进入步骤3。
- 四视图规范 → media_generator(ImageToImage,GPT Image 2,参考图=基础形象)。生成正视图/侧视图/后视图/45°侧面合集,白色背景,16:9。将基础形象与四视图注册为IP角色的 key_element 核心资产。
- 表情动作延展(默认8个)→ media_generator(ImageToImage,GPT Image 2,参考图=四视图)。2行×4列,3:4。用户可指定数量与表情类型;若想自定义但无方向,触发灵感辅助(表情类型扩展库);若调整数量,按行列网格自动排版(如6个=2×3,9个=3×3)。
- 穿搭方案(默认6套)→ media_generator(ImageToImage,GPT Image 2,参考图=四视图)。全身像,3:4。用户可指定数量与风格方向;若想自定义但无方向,触发灵感辅助(穿搭风格扩展库);多套穿搭之间须覆盖差异化主题(如潮流/古风/休闲/正装/可爱/运动),避免风格过于相近。
- 排版美化与表情系列展示 → media_generator(ImageToImage,GPT Image 2,参考图=表情延展图)。白色细线条圆形外框包裹半身表情,渐变底色(若用户对底色无想法,触发灵感辅助——排版美化底色方向),16:9。
- 周边文创设计 → media_generator(ImageToImage,GPT Image 2,参考图=基础形象/四视图)。4个不同展示方案,产品品类引用brief中锁定的清单,品牌名与主色调须与brief一致,16:9。
- 动态展示视频——Storyboard设计 → storyboard_designer。设计元素(IP角色各穿搭look、周边产品项、空场景)、镜头序列、音频层(BGM + 出场SFX)。若用户对展示视频场景无想法,触发灵感辅助(视频场景方向)。
- 空场景生成(双模式) → media_generator(ImageToImage,GPT Image 2)。若用户在Storyboard阶段选定了场景方向(灵感辅助或自定义),基于该场景描述生成新背景场景(依赖步骤8);若用户未选定场景方向,以周边展示图为参考图,去除画面中所有物品和人物,仅保留空场景背景(依赖步骤7,可与步骤8并行)。
- 展示视频生成 → media_generator(MultiModalToVideo,Seedance 2.5(分辨率 480p))。分两类镜头:① 角色动态蒙太奇短镜头(默认生成,用户可整体跳过;每个穿搭look一个,4–5s,参考图=对应穿搭图);② 主展示镜头(10–30s,参考图=穿搭形象图 + 周边产品图 + 空场景图)。SFX通过Seedance 2.5音频能力内嵌于视频(提示词 <...> 包装符),不单独生成SFX音轨。每个镜头生成后通过 resource_prepare_and_analyze 执行视频生成一致性校验(穿模/崩坏、面部与服装漂移、元素出场完整性),不通过的镜头标记问题类型与时间点并重新生成。
- 背景音乐生成 → media_generator(text_to_instrumental,Suno 5 / Mureka 8)。根据Storyboard中BGM音频层设计生成背景音乐;若用户对BGM风格无想法,触发灵感辅助(BGM音乐风格方向)。BGM时长须匹配视频总时长(上限30s),超出时裁剪至视频长度。与步骤10可并行。
- 最终装配 → video_assembler。
依赖关系: 3→2;4→3;5→3;6→4;7→2或3;8→5,7;9→7或8(选定场景方向时→8,未选定时→7);10→5,7,8,9;11→8;12→10,11。其中4、5、7在3完成后可并行推进;8与9在7完成后可并行(8依赖5,7;未选定场景方向时9仅依赖7,可与8并行;选定场景方向时9依赖8,不可并行);步骤10内蒙太奇短镜头(仅需穿搭图)与主展示镜头(需穿搭图+周边图+空场景图)可并行生成;10与11在Storyboard完成后可并行。
暂停点与交互方式: 不一次性跑完全流程。每个里程碑暂停时,先简要汇报已完成内容与产出物,再通过卡片征求用户确认。具体交互如下:
- brief锁定后: 汇报IP角色概念描述、潮玩风格基调、品牌名(固定值"BLUEPURPLE GIRL")、主色调(固定值蓝紫渐变)、产品品类清单、画幅与输出语言。若用户上传了IP参考图,同步汇报提取的角色特征摘要。
- 卡片选项:① 确认无误,开始生成基础形象 ② 调整brief参数 ③ (上传分支)确认无误,开始生成四视图
1b. 基础形象双版本生成完成后(步骤2完成,步骤3开始前): 并排展示3D渲染版与扁平矢量版,汇报两个版本的风格差异(渲染质感、色块分明程度)与角色一致性情况。此为四视图生成前的最后形象确认节点——基础形象是后续所有步骤的一致性锚点,若此时存在偏差,在进入四视图前修正成本最低。
- 卡片选项:① 两个版本均满意,开始生成四视图 ② 重新生成(可调整角色描述或风格基调) ③ 保留其中一个版本,开始生成四视图
- 四视图完成后: 展示四视图合集(正/侧/后/45°侧面),汇报已注册为IP角色key_element核心资产。
- 卡片选项:① 确认一致性,继续表情/穿搭/排版/周边 ② 重新生成四视图 ③ 调整后继续
- 表情/穿搭/排版/周边全部完成后: 分组展示表情延展系列、穿搭方案系列、排版展示图、周边文创4方案,汇报各系列数量与风格覆盖情况。
- 卡片选项:① 全部确认,进入Storyboard设计 ② 某系列需调整(提示用户指定哪一项及调整方向;若调整的是表情延展,排版美化须联动重新生成) ③ 补充生成
- Storyboard完成后: 汇报镜头序列(蒙太奇短镜头数量+主展示镜头时长+主展示镜头穿搭look)、音频层设计(BGM风格+SFX出场方案)、总时长预估。若用户已选定场景方向,同步说明空场景将基于选定方向生成。
- 硬前置条件(进入视频生成前必须全部满足,缺一不可):
- 所有 key_element(IP角色、所有穿搭look、所有周边prop、element scene)均已注册 asset_id,且 source_resource_ids 非空——即每个 key_element 至少绑定一个具体的 resource_id;
- Storyboard 中所有镜头与音频层的 visual_res_asset_bindings 非空——即每个 shot 的参考图槽位已绑定对应 asset_id,不存在空悬槽位;
- 主展示镜头所使用的穿搭 look 已由用户确认,且对应 asset_id 已在上述绑定中体现。
- 若上述任一条件未满足,不得向用户提示"开始生成视频",须先通过 media_generator 补全缺失的注册/绑定,补全后再次自检,全部通过后方可提示用户确认进入下一步。
- 卡片选项:① 确认Storyboard,开始生成空场景(蒙太奇短镜头同步启动,主展示镜头待空场景确认后启动) ② 调整镜头规划 ③ 调整音频设计
- 硬前置条件(进入视频生成前必须全部满足,缺一不可):
4b. 空场景生成完成后(步骤9完成,在步骤10主展示镜头开始前): 展示生成的空场景图,汇报生成模式(新背景场景生成 / 从周边展示图提取背景)与自动校验结果(是否存在残留物品/人物)。此为主展示镜头启动前的最后视觉资产确认节点。蒙太奇短镜头可在暂停点4确认后与步骤9并行生成,无需等待本确认节点;主展示镜头须等本节点用户确认通过后方可启动。
- 卡片选项:① 空场景效果满意,开始生成主展示镜头 ② 重新生成空场景(可调整场景方向或强化去除指令) ③ 微调场景描述后重新生成
- 视频与音频生成完成后: 展示动态展示视频与BGM音轨,汇报SFX内嵌情况与总时长。
- 卡片选项:① 全部确认,进入最终装配 ② 重新生成某镜头 ③ 调整BGM风格
- 最终装配完成后(交付验收): 对照最终交付物清单逐项展示产出物(基础形象→四视图→表情系列→穿搭系列→排版展示图→周边方案→动态视频+BGM),每项展示后等待用户确认,全部确认后完成验收。汇报总产出数量、视频时长与BGM风格。
- 卡片选项:① 全部验收通过,完成本次IP全案创作 ② 某项产出需重新生成(提示用户指定具体项目及修改方向) ③ 补充生成额外变体
灵感辅助(用户缺乏设计方向时):
当用户在任一设计决策点未给出具体方向(描述模糊、表示"你来设计"、"不知道"等),主动提供灵感辅助——通过卡片呈现结构化选项而非追问开放式问题,降低决策成本。
灵感辅助触发时机映射:
-
IP角色概念 → 步骤1(brief阶段),用户未明确角色方向时触发
-
表情类型 → 步骤4(表情延展),用户想自定义但无方向时触发
-
穿搭风格 → 步骤5(穿搭方案),用户想自定义但无方向时触发
-
排版美化底色 → 步骤6(排版美化),用户对底色无想法时触发
-
视频场景 → 步骤8(Storyboard设计),用户对展示视频场景无想法时触发
-
BGM音乐风格 → 步骤11(背景音乐生成),用户对BGM风格无想法时触发
-
IP角色概念: 用户未明确角色概念时,提供灵感方向供选择,每个方向附带1–2句角色描述(外形关键词+性格设定+主色调建议):
- 动物系:猫耳少女、兔叽精灵、熊猫团子、水母女孩、柴犬小子、鹦鹉公主
- 食物系:草莓蛋糕精灵、抹茶团子、西瓜气泡女孩、甜甜圈天使、棒棒糖骑士、刨冰雪人
- 植物系:仙人掌精灵、向日葵少女、蘑菇姑娘、樱花仙子、捕蝇草猎人、蒲公英旅人
- 职业系:宇航员、魔法师、赛博朋克骇客、深海探险家、甜品厨师、星际快递员
- 幻想系:星之精灵、云朵仙子、暗夜女巫、梦境编织者、极光使者、时光钟表匠
- 节日系:圣诞精灵、万圣南瓜、新年锦鲤、情人节丘比特、中秋月兔、万圣幽灵猫
- 星座系:白羊战士、双子双胞胎、天秤少女、双鱼美人鱼、狮子王者、水瓶发明家
用户选定后写入brief作为角色概念锚点。
-
表情类型: 用户未指定时使用默认8个;若想自定义但无方向,提供扩展表情库供勾选替换,替换后触发表情差异化校验。扩展库分三组:
- 开心系:得意、心花怒放、飞吻、星星眼、偷瞄、花痴、墨镜酷笑
- 负面系:嘟嘴、暴怒、感动哭、委屈巴巴、被吓到、尴尬笑、抱头痛哭
- 搞怪系:吐舌、打喷嚏、做鬼脸、发呆、口水流、傲娇哼、迷惑不解、打哈欠
-
穿搭风格: 用户未指定时使用默认6套;若想自定义但无方向,提供扩展风格库供勾选替换,替换后触发风格差异化校验。扩展库分四组:
- 街头潮流:赛博朋克、运动街头、机车甜酷、嘻哈oversize、街头工装
- 东方韵味:和风巫女、国潮、和风花魁、民国旗袍、汉服少女
- 幻想奇境:蒸汽波、哥特洛丽塔、魔法少女、森林精灵、甜妹lolita
- 学院通勤:学院风、日系jk、未来机能、芭蕾舞者、赛博忍者
用户可同时从多组中混搭选取,只要通过三维度差异化校验即可。
-
排版美化底色: 用户对表情系列展示图的排版底色无想法时,提供底色方向建议:
- 蓝粉渐变天空(淡蓝→淡粉,柔和梦幻)
- 紫橙渐变日落(深紫→暖橙,潮玩活力)
- 薄荷绿渐变(浅绿→白,清新自然)
- 马卡龙拼色(粉/黄/蓝/绿四宫格分区,糖果感)
- 星空深蓝(深蓝底+星点,神秘酷感)
- 奶油暖白(暖白底+细碎光斑,极简高级)
- 彩虹流光(七色渐变流动,活泼缤纷)
- 赛博霓虹(深紫底+霓虹光带,赛博朋克)
-
视频场景: 用户对展示视频场景无想法时,提供场景方向建议,每个方向附带氛围关键词与光源描述,供Storyboard设计参考:
- 梦幻星空舞台(深蓝渐变+星点光斑+顶部柔光)
- 糖果色实验室(马卡龙粉黄墙+荧光灯带+气泡装饰)
- 未来感展厅(冷白金属+霓虹蓝紫光带+全息投影底纹)
- 浮空岛屿花园(云层环绕+暖阳逆光+漂浮花瓣)
- 梦幻海底宫殿(蓝绿渐变+水波折射光+珊瑚气泡)
- 复古像素世界(像素马赛克背景+扫描线+暖黄CRT光晕)
- 四季花园(四季同框+柔和自然光+蝴蝶萤火点缀)
- 水晶宝石矿洞(紫晶簇+折射星光+底部幽蓝冷光)
- 云上城堡(棉花云层+金色日落+彩虹拱桥)
- 霓虹夜市(赛博招牌+暖橙街灯+雨夜地面反射)
-
BGM音乐风格: 用户对背景音乐风格无想法时,提供音乐方向建议,每个方向附带BPM范围与音色关键词:
- 时尚电子(BPM 120–128,合成器lead+鼓机+钢琴点缀,适合科技可爱调性)
- 梦幻流行(BPM 100–115,Pad铺底+轻柔电子鼓+铃声琶音,甜美梦幻感)
- 活力日系(BPM 128–140,明亮合成器+欢快钢琴+手拍节奏,元气少女风)
- 虚拟歌姬(BPM 115–130,电子人声切片+合成bass+8-bit音色,二次元感)
- 轻快爵士融合(BPM 110–125,电钢琴+轻swing鼓+brass点缀,俏皮时髦感)
- 8-bit复古芯片(BPM 120–135,方波+三角波+噪声打击,像素游戏复古风)
- 空灵氛围电子(BPM 90–105,Pad+空灵铃声+慢节奏beat,仙气飘渺感)
- 节日庆典(BPM 120–135,铃铛+铜管+欢快旋律,节日欢庆氛围)
资产管理: 每一步生成的图像都应通过 media_generator 注册 asset_id 并绑定到对应Storyboard元素(IP角色 → key_element character;周边产品 → key_element prop)。后续步骤引用前序资产时使用已注册的asset_id,确保角色一致性。
最终交付物清单与展示方式:
- 基础形象双版本(3D渲染版 + 扁平矢量版,或用户上传图)— 并排展示两个版本,标注版本类型;上传分支展示原图并标注"用户上传"
- 四视图合集(正/侧/后/45°侧面)— 单图展示,标注各视图方向
- 表情动作延展系列(默认8个)— 网格展示,每个表情下方标注名称
- 穿搭方案系列(默认6套)— 网格展示,每套下方标注风格名称
- 排版美化表情系列展示图 — 单图展示
- 周边文创设计4方案 — 逐方案展示,标注各方案展示形式差异
- 动态展示视频(含内嵌SFX)+ BGM音轨 — 视频播放预览,汇报总时长、镜头构成(蒙太奇段+主展示镜头)、BGM风格
完成最终装配后,进入暂停点6(交付验收)——按上述清单逐项展示,每项展示后等待用户确认,全部确认后完成验收。
2. 멀티모달 분석
参考图分析:
- 当用户上传已有IP角色参考图时,逐维度提取并记录角色核心特征,每项须输出可量化的描述词,供后续ImageToImage步骤作为一致性约束依据:
- 面部轮廓: 脸型(圆/方/尖/鹅蛋)、脸颊宽高比、下巴弧度——作为面部一致性的比对基准。
- 眼睛: 眼睛形状(圆/杏眼/细长)、瞳色、眼距比例(宽/标准/窄)——三项均须记录,缺一不可。
- 发型与发色: 发型结构(短发/长发/双马尾/丸子头等)、发量(多/中/少)、发色(精确色名或色号)、刘海形态(齐刘海/斜刘海/无刘海)——四项均须记录,缺一不可。
- 头身比: 头部高度与全身高度的比值(如1:2.5),精确到小数点后一位——后续生成偏移>5%标记不通过。
- 肤色: 肤色色名或近似色号(如浅肤色/小麦色/冷白皮)——作为皮肤一致性的比对基准。
- 服装风格: 当前穿着的服装品类、配色、图案、饰品——作为换装步骤的"基线穿搭"参照。
- 主色调: 提取画面主色调——若与brief锁定主色调(蓝紫渐变)冲突,在反馈中标注冲突并建议用户确认以哪一方为准。
- 当用户上传周边产品参考图或场景参考图时,提取产品类型、配色方案、排版风格、品牌标识位置。
多张参考图处理策略:
- 主图选取: 用户上传多张IP角色参考图时,以分辨率最高、角色正面完整可见的图像作为主参考图;其余作为辅助参考,用于补充主图遮挡或模糊维度的特征。
- 多角度互补: 若上传图覆盖不同角度(正面+侧面+背面),交叉验证各维度特征——以正面图提取面部、眼睛、发型正面信息;以侧面/背面图补充发型结构、头身比侧面轮廓。
- 特征冲突处理: 若多张图在同一维度存在冲突(如发色不一致、服装不同),在反馈中标注冲突项并请用户确认以哪张为准,不自行取舍。
- 非角色素材识别: 若上传素材中混入风格参考图、场景参考图等非角色素材,将其归类为风格方向参考(记录但不作为key_element身份锚点),仅角色图参与特征提取。
上传素材可用性校验:
- 图像质量门槛: 上传图分辨率不低于1K、画面清晰无遮挡、角色主体完整可见(头脚均在画面内)。不满足任一项时,在反馈中标注问题并建议用户重新上传更高清或更完整的参考图。
- 特征提取完整性: 上述七个维度须全部成功提取。若任一维度因遮挡、模糊或角度问题无法提取,在反馈中标注缺失维度,并建议用户补充该角度的参考图——不建议在缺失特征的情况下直接进入四视图步骤。
- 上传图作为一致性基准: 上传分支下,上传图替代步骤2的生成结果成为key_element character的身份锚点。后续所有ImageToImage步骤的一致性校验均以提取的特征记录为比对基准,而非生成图比对生成图。
- 各步骤一致性校验标准: 每个ImageToImage步骤完成后,自动比对生成结果与IP基础形象(key_element character)的一致性,逐项检查以下维度:
- 面部特征: 脸型轮廓、眼睛形状与大小、瞳色、嘴型是否一致——偏差超出微调范围(如脸型从圆变尖)即标记不通过。
- 发型与发色: 发型结构、发量、发色、刘海形态是否一致——换装类步骤允许饰品遮挡,但不允许改变发型本体。
- 头身比: 头部与身体比例是否与基础形象一致——头身比偏移>5%标记不通过。
- 画风一致性: 渲染质感(3D/扁平)、线条风格、色彩饱和度是否与基础形象统一——画风偏移(如从3D渲染变为水彩)标记不通过。
- 品牌规范一致性(周边设计步骤): 品牌名拼写、主色调是否与brief锁定值一致——品牌名缺失或主色调偏移标记不通过。
- 校验不通过时,在反馈中明确标注偏差维度与建议调整方向(重新生成/修改提示词/更换参考图),供media_generator执行修正。
穿搭风格差异化校验(步骤5):
- 穿搭方案生成后,逐一比对所有穿搭look,在主题、配色、饰品三个维度上检查差异化程度——每两套之间至少有两个维度明显不同。若两套在三个维度均高度相似,标记不通过并建议替换其中一套的风格方向,供media_generator执行修正。
空场景校验(步骤9):
- 空场景生成后,自动检查画面中是否仍残留物品或人物——若检测到任何产品、道具、角色或文字标识残留,标记为不通过。两种模式(选定场景方向生成 / 从周边展示图提取)均须通过此校验。
- 校验不通过时,标注残留物位置并建议重新生成:未选定场景方向模式下强化提示词中"去除所有物品和人物"指令;选定场景方向模式下检查提示词中是否混入了无关物品描述,供media_generator执行修正。
视频生成一致性校验(步骤10):
- 每个视频镜头生成后,自动逐项检查以下维度——任一维度不通过即标记该镜头需重新生成:
- 穿模与崩坏: 检测角色肢体穿插物体、肢体断裂/扭曲、面部五官畸变、周边产品形状崩坏等渲染异常——出现任一即标记不通过,优先建议重新生成(而非修改提示词),因为此类问题通常源于模型随机性而非提示词缺陷。
- 面部一致性: 将视频中角色面部与key_element character身份锚点(基础形象/上传参考图特征记录)比对——脸型轮廓、眼睛形状与瞳色、嘴型是否保持一致。面部漂移(如脸型从圆变尖、瞳色变化)标记不通过。
- 服装与造型一致性: 穿搭look的服装品类、配色、饰品是否与对应穿搭参考图一致——服装材质突变、配色偏移、饰品丢失或变形标记不通过。
- 头身比一致性: 角色头部与身体比例是否与基础形象一致——头身比偏移>5%标记不通过。
- 画风一致性: 渲染质感是否与基础形象统一——画风从3D渲染突变为水彩/2D等标记不通过。
- 元素出场完整性(仅主展示镜头): 检查Storyboard中规划的周边产品是否全部按顺序出场且可辨认——若关键元素缺失、出场顺序混乱或产品无法辨识,标记不通过。
- 校验不通过时,在反馈中明确标注问题类型、出现时间点(如"第3秒角色左手穿模")与建议修正方向:
- 穿模/崩坏类 → 建议重新生成(同模型重试),若连续2次仍不通过可尝试微调提示词中动作幅度描述(降低动作复杂度)。
- 面部/服装/画风漂移类 → 建议重新生成并强化提示词中一致性约束措辞,同时确认参考图绑定是否正确。
- 元素出场不完整类 → 建议检查提示词中出场顺序描述是否与Storyboard一致,必要时简化元素数量或拆分为多个镜头。
- 蒙太奇短镜头与主展示镜头分别独立校验;蒙太奇短镜头额外检查动作是否与穿搭风格主题呼应、不同look之间动作是否重复。
3. 스토리보드 설계
元素设计:
- key_element character(IP角色): 以基础形象与四视图为身份锚点;穿搭方案作为该角色的多个look变体(Look 1–N,默认6),每个look绑定对应穿搭图像的asset_id。
- key_element prop(周边产品): 产品品类引用brief中锁定的清单,逐一列为独立prop元素(手提袋、手机壳、抱枕、保温杯、遮阳帽、雨伞、贴纸、眼罩),每项绑定周边展示图中的对应素材。
- element scene(空场景): 描述空场景背景的视觉特征(渐变色调、空间布局、光源方向),作为动画的舞台基础。若用户选定场景方向(灵感辅助或自定义),element scene描述须完整反映该方向的氛围关键词与光源特征,并作为步骤9空场景生成(选定模式)的描述依据。
镜头设计:
- 角色动态镜头(默认生成,1:1映射穿搭look): 每个穿搭look一个镜头,镜头时长4–5s,用于开场蒙太奇展示角色多样性。用户可整体跳过蒙太奇段(直接从主展示镜头开始),但一旦启用则数量固定——严格等于穿搭look数量,不额外增减。
- 动作设计: 每个镜头动作须与穿搭风格主题呼应——西部牛仔→甩帽致敬+侧步;古风仙侠→挥袖转身+抬手;夏日潮酷→比酷手势+头部微晃;可爱小熊→双臂抱抱+左右摇摆;可爱西瓜→原地蹦跳+双手捧脸;酷冷黑西装→整理领带+自信回眸。动作幅度明显,肢体语言可爱但有辨识度,不同look之间动作不得重复。
- 开场节奏: 以快节奏蒙太奇开场,每个短镜头1–2s快切(单个镜头生成时长4–5s,装配时裁切至1–2s使用),前3秒内完成至少2个look展示以制造视觉冲击;总时长按look数量等比缩放(2个≈4s,4个≈8s,6个≈12s),结尾留0.5s节奏缓冲再进入主展示镜头,避免快切到长镜头的突兀感。
- 镜头衔接: 短镜头之间以硬切为主,辅以少量0.3s淡入淡出做节奏变化;最后一个短镜头与主展示镜头之间用1s渐变过渡,由快节奏自然收束至主镜头的从容展开。
- 主展示镜头(核心镜头,10–30s): 充分利用Seedance 2.5(分辨率 480p)长镜头能力,单镜头内完成全部展示。
- 穿搭选择: 不设默认值——Storyboard设计时通过卡片让用户指定主展示镜头中角色穿哪套穿搭look,选定的look作为该镜头的角色外观参考图。
- 元素出场顺序: ① IP角色从画面中央淡入/弹出登场,居中站定 → ② 手提袋(品牌主视觉,最先出现,尺寸最大)→ ③ 手机壳 → ④ 抱枕 → ⑤ 保温杯 → ⑥ 遮阳帽 → ⑦ 雨伞 → ⑧ 贴纸/眼罩(最小物件最后出现,点缀收尾)。每个元素间隔约1–1.5s。
- 角色互动节拍: 角色登场后保持居中;每出现一个新元素,角色头部转向该元素方向并配合一个表情反应(发现→惊喜→开心互动→回正),形成"发现—回应"的节奏循环,避免角色长时间静止。
- 机位设计: 固定中景机位,角色站位画面中央偏下;最后一个元素出现时镜头轻微推进(push-in),收束视觉焦点。
- 出场方式: 每个元素以差异化方式出现(弹出/滑入/发光浮现/缩放进场),避免雷同。
- 每个镜头描述须包含:场景(引用element scene)、故事节拍(元素出场顺序 + 角色互动动作)、摄影(机位固定/轻微推进)。
- 总时长约束: 蒙太奇段总时长按look数量等比缩放(2个≈4s,4个≈8s,6个≈12s),单镜头不超过5s。全片总时长上限30s(蒙太奇段+主展示镜头+缓冲),若超出则优先压缩蒙太奇段短镜头时长,保留主展示镜头完整时长。
音频层设计:
- BGM(audio_layer): 时尚科技可爱风格背景音乐,贯穿全片。节拍明快(BPM 110–130),以电子合成音色为主基调,融入轻快钢琴点缀;开场段(角色动态蒙太奇)节奏紧凑、鼓点突出,进入主展示镜头后转为旋律主导、略带梦幻感,结尾处加一拍收束音。音量在SFX触发时自动降低(ducking),SFX结束后300ms内恢复(与video_assembler ducking规则一致)。
- SFX(视频内嵌音频规范,非独立音轨): 为每个周边产品出场设计独立音效,作为视频生成提示词中 <...> 包装符的输入规范——SFX由Seedance 2.5音频能力在视频生成时内嵌,不单独生成音轨。须与元素出场方式及时间点精确对齐——弹出→短促"啵"弹跳音(0.3s);滑入→轻盈"嗖"滑音(0.4s);发光浮现→柔和"叮"亮音+持续微嗡(0.6s);缩放进场→低频"咚"渐强音(0.5s)。每个SFX在元素开始出现的首帧触发,音量不超过BGM的-6dB;相邻SFX间隔不小于0.8s,避免音效堆叠混乱。角色登场时配一个标志性"叮咚"出场音,作为IP声音签名。SFX时间点同时作为video_assembler中BGM ducking的参考。
4. 미디어 생성
图像生成(步骤2–7、9):
- 基础形象生成(步骤2): 使用 TextToImage,模型 GPT Image 2,分辨率 2K。同时生成3D渲染版与扁平矢量版两个resource_id。
- 参考图生成(步骤3–7、9): 使用 ImageToImage,模型 GPT Image 2,分辨率 2K。每步参考图按Planner各步骤指定的来源使用(基础形象/四视图/表情延展图/周边展示图等),在提示词中明确指定参考图的角色一致性约束。
- 空场景生成(步骤9,双模式): 使用 ImageToImage,模型 GPT Image 2,分辨率 2K。若用户选定了场景方向,以周边展示图为风格参考,基于Storyboard中element scene描述生成新背景场景;若未选定,以周边展示图为参考图,提示词要求去除所有物品和人物仅保留背景场景。
视频生成(步骤10):
- 使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p(如用户明确要求更高质量可用480p)。
- 角色动态蒙太奇短镜头: 每个穿搭look独立生成一个4–5s片段,参考图为对应穿搭形象图;动作幅度明显,不同look动作不重复。短镜头内SFX(如有)通过Seedance 2.5音频能力内嵌生成。
- 主展示镜头: 10–30s单镜头,参考输入:穿搭形象图(角色外观一致性)+ 周边产品图(产品外观)+ 空场景图(背景一致性)。元素出场SFX按Storyboard SFX设计内嵌生成(详见下文SFX规则)。
- 单镜头时长不超过30s。
音频生成(步骤11):
- BGM: 使用 text_to_instrumental,模型 Suno 5(默认)或 Mureka 8。根据Storyboard中BGM音频层描述生成:时尚科技可爱风格,BPM 110–130,电子合成+钢琴点缀,开场紧凑→主镜头旋律主导→结尾收束。BGM时长须匹配视频总时长(上限30s),超出时裁剪至视频长度。若Suno 5失败,切换Mureka 8(同工具内模型切换)。
- SFX: 不单独生成——SFX通过Seedance 2.5音频能力在视频生成时内嵌,提示词中用 <...> 包装符按Storyboard SFX设计指定。
资产绑定与一致性:
- 基础形象和四视图注册为IP角色的 key_element 核心资产;穿搭图绑定为角色look变体;周边产品图绑定为prop元素。
- 所有ImageToImage步骤的参考图优先使用已注册的key_element资产,避免角色面部/发型/头身比漂移。
- 模型使用约束: 全程仅使用 GPT Image 2 生成图像、Seedance 2.5(分辨率 480p) 生成视频,不使用其他模型。若模型生成失败,在同一模型内重试,不切换至其他模型;连续多次失败则停止该步骤并向用户反馈,不自动替换模型。
5. 프롬프트 작성
图像提示词(TextToImage / ImageToImage,GPT Image 2):
- 基础形象风格锚点: 全身照,正面视角,超可爱,激萌,泡泡玛特风格,盲盒手办,潮玩,可爱风格化乙烯基玩偶,大头小身,极简。可选风格参考:moonlab_studio风格。
- 双版本输出: 基础形象需同时覆盖3D渲染版(立体质感、光影细腻)与扁平矢量版(色块分明、轮廓清晰),在提示词中分别描述。
- 一致性约束(所有参考图步骤必含): "严格保持角色面部、头发、头身比及身体形象特征的一致性,严格保持画风一致性"。
- 四视图: 明确指定正视图、侧视图、后视图、45°侧面视图全部置于一张图上,白色背景,16:9。
- 表情延展(默认8个): 默认涵盖8种表情动作(亲亲、开心、馋了、生气、困了、害羞、害怕、哭了),强调动作幅度明显。用户可增减数量或替换类型(可从灵感辅助扩展表情库中选取替换);调整后按行列网格自动排版,3:4。
- 自定义表情流程: 当用户指定全新表情类型(非默认8种)时,按以下规则处理:
- 表情定义: 为每个自定义表情撰写1–2句描述,覆盖情绪关键词、面部表情变化(眉毛/眼睛/嘴巴状态)、配套肢体动作,写入brief作为该表情的锚点。
- 差异化校验: 生成前,逐一比对所有表情(含默认与自定义),确认每两个表情在情绪类别、面部变化、肢体动作三个维度中至少有两个维度明显不同;若两个表情在三个维度均高度相似,须合并或替换其中一个。
- 动作联动: 为每个自定义表情同步设计一个与情绪呼应的标志性肢体动作(如"得意"→叉腰+仰头微笑),作为该表情的视觉描述锚点;动作须与既有表情不重复。
- 排版联动: 调整数量后按行列网格自动排版(4个=2×2,6个=2×3,9个=3×3,12个=3×4),保持画面均匀分布;提示词末尾标注全局一致性约束。
- 穿搭延展(默认6套): 默认涵盖6套差异化风格穿搭(西部牛仔、古风仙侠、夏日潮酷、可爱小熊、可爱西瓜、酷冷黑西装),强调饰品同步适配。用户可增减数量或指定新风格方向(可从灵感辅助扩展风格库中选取替换);多套穿搭之间须保持风格差异化,避免雷同,3:4。
- 自定义穿搭风格流程: 当用户指定全新风格方向(非默认6套)时,按以下规则处理:
- 风格定义: 为每个自定义风格撰写2–3句描述,覆盖主题关键词、服装品类、配色倾向、标志性饰品/配件,写入brief作为该look的锚点。
- 差异化校验: 生成前,逐一比对所有风格(含默认与自定义),确认每两套在主题、配色、饰品三个维度中至少有两个维度明显不同;若两套在三个维度均高度相似,须合并或替换其中一套。
- 动作联动: 为每个自定义风格同步设计一个与主题呼应的标志性动作,写入Storyboard角色动态镜头;动作须与既有look不重复。
- 提示词写法: 每套单独描述时,先写风格主题词 → 服装品类与配色 → 饰品细节;多套整合于一张图时,按行列网格逐位置描述风格,末尾标注全局一致性约束。
- 排版美化: 白色细线条圆形外框包裹每个IP人物,仅展示半身脸部表情,渐变底色背景(引用用户从灵感辅助中选择的排版底色方向;若用户未选择则默认使用蓝粉渐变天空),表情延展系列中的全部表情整合进同一场景,16:9。
- 周边设计: 产品品类引用brief锁定清单(手提袋、手机壳、抱枕、保温杯、遮阳帽、雨伞、贴纸、眼罩),主色调与品牌名为固定值,严格遵循brief锁定值(品牌名"BLUEPURPLE GIRL"、主色调蓝紫渐变),不可覆盖,简约可爱图案风格,品牌名以英文大字印刷体出现在手提袋等主视觉产品上,生成4个形式完全不同的展示方案,16:9。
- 空场景生成: 双模式——若用户选定了场景方向,基于Storyboard中element scene描述(氛围关键词+光源+空间布局)生成新背景场景,提示词须包含场景方向的所有视觉特征;若未选定场景方向,以周边展示图为参考图,提示词要求"去除画面中所有物品和人物,仅保留背景场景"。两种模式均须注明"不出现任何角色、产品、道具或文字"。
视频提示词(MultiModalToVideo,Seedance 2.5(分辨率 480p)):
- 蒙太奇短镜头: 用 <<<image_1>>> 等绑定对应穿搭参考图;动作描述命名具体身体部位,加入幅度与速度,与穿搭风格主题呼应;短镜头不写元素出场,聚焦角色动作表演。
- 主展示镜头运动栈: 固定机位(可轻微推进)→ 角色互动动作(依次看向出现的元素)→ 元素逐一出场(弹出/滑入/发光浮现/缩放进场,按故事顺序)→ SFX提示(每个元素出场配合相应 <...> 包装符,引用Storyboard SFX设计,不另写BGM脚本)。
- 质量约束: 禁止穿模和崩坏,保持人物一致性。风格关键词:时尚、科技、可爱。
- Seedance 2.5(分辨率 480p)包装符:** SFX <...>,对话 {...},BGM (...)。BGM在独立音频层处理,视频提示词中不重复BGM脚本;SFX通过 <...> 内嵌于视频生成,不在独立音轨生成。
- 语言: 提示词正文使用用户交互语言;品牌名、对话内容遵循Final_Video_Spec的输出语言。
蒙太奇短镜头提示词模板(每个look一个):
<<<image_1>>>(对应穿搭look参考图)
[角色身份引用] 身着[穿搭风格主题]的IP角色,在[场景描述]中执行[标志性动作]。
动作:[命名具体身体部位] + [幅度/速度],多拍动作按故事顺序排列,先主后次。
风格:时尚、科技、可爱。禁止穿模和崩坏,保持人物一致性。
<音效描述(如有)>
主展示镜头提示词模板:
<<<image_1>>>(穿搭形象图)<<<image_2>>>(周边产品图)<<<image_3>>>(空场景图)
固定中景机位,[角色]从画面中央淡入居中站定。周边元素按Storyboard出场顺序逐一出现:
① [元素A]以[出场方式]出现,角色[表情反应] <对应SFX>;
② [元素B]以[出场方式]出现,角色[表情反应] <对应SFX>;
③ ……(按出场顺序逐项展开)
最后一个元素出现时镜头轻微推进(push-in)。
风格:时尚、科技、可爱。禁止穿模和崩坏,保持人物一致性。
模板中出场顺序与SFX须引用Storyboard中锁定的设计;BGM在独立音频层处理,不写入此提示词。
6. 동영상 조립
装配偏好:
- 角色动态短镜头(默认生成,用户可整体跳过)作为开场快速蒙太奇,每个1–2s快切,营造角色多样性展示节奏。
- 主展示镜头保持完整长镜头节奏,不拆分。
- BGM为独立音频层,贯穿全片;SFX来自视频轨,不单独挂载SFX音轨。
- 角色动态镜头与主展示镜头之间用1s渐变过渡衔接(引用Storyboard转场设计),由快节奏自然收束至主镜头的从容展开。
- 输出16:9,与Final_Video_Spec锁定画幅一致。
- 总时长约束: 全片总时长上限30s(蒙太奇段+主展示镜头+缓冲),引用Storyboard时长约束;装配时若超出则优先压缩蒙太奇段短镜头时长,保留主展示镜头完整时长。
音频同步与ducking时间轴规则:
- SFX触发ducking: 根据Storyboard中每个SFX的首帧触发时间点,在该时间点前0.1s启动BGM音量下降,200ms内平滑降至BGM基准音量的-9dB(约原音量的35%);SFX播放期间维持该低音量;SFX结束后300ms内平滑恢复至基准音量。相邻SFX间隔若<0.8s,BGM保持低音量不反复升降,避免音量抖动。
- 角色登场签名音: IP角色"叮咚"出场音触发时,BGM同样执行ducking(降-9dB,恢复300ms),但作为全片首个SFX,其ducking起点与BGM淡入起点重合——BGM以低音量入场再恢复,营造"先声后乐"的开场效果。
- 蒙太奇段音量: 蒙太奇段BGM维持基准音量+2dB boost(鼓点突出,节奏紧凑感);进入主展示镜头前0.5s,BGM音量从boost值平滑回落至基准音量,同时风格从鼓点主导切换为旋律主导,过渡区不设静音间隙。
- 主展示镜头段音量: 主展示镜头BGM维持基准音量,仅在SFX触发时执行ducking;最后一个元素出场SFX结束后,BGM在300ms内恢复基准音量并维持至结尾收束音。结尾收束音(一拍)触发时BGM不再ducking,收束音与BGM叠加后整体淡出500ms结束。
- 音量过渡曲线: 所有ducking升降均使用S形曲线(ease-in-out),避免线性升降产生的生硬听感;蒙太奇段→主展示镜头的音量回落使用500ms线性渐变,配合镜头渐变过渡的视觉节奏。