Shanghai Animation-inspired short
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
模拟上海美术电影制片厂的经典中国动画学派美学风格(工笔重彩、水墨、剪纸、木偶),全程使用 GPT Image 2 制作精美元素,并以 Seedance 2.5(分辨率 480p) 驱动国风视频生成。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
上美影风格视频制作核心流程设计:
-
分析构思并智能推荐风格(建立全局设定 Final_Video_Spec.md):
- 智能子风格适配:深度评估用户输入的剧本或构思。根据题材与调性智能适配并推荐最适合的上美影视觉子风格(例如:打斗与奇幻大戏匹配“工笔重彩”;写意山水与哲学故事匹配“水墨”;活泼童趣与民间趣闻匹配“剪纸”;质感温润与寓言说书匹配“木偶”)。
- 风格告知与反馈:必须立即主动告知用户系统推荐了何种上美影子风格,并详述其匹配依据。提醒并赋予用户更换子风格的权利,允许其不满意时一键更换。
- 确认锁定风格后,调用 Text Editor (text_editor) 建立并写入 Final_Video_Spec.md,确定画幅(16:9)、分辨率(默认 480p / 会员支持 1080p,权限由系统自动匹配),以及已确认的子风格、核心叙事基调。
-
设计故事剧本与分镜(Storyboard):
- 剧情构思来源:严格依据用户提供的剧情、脑洞、大纲或创意构思进行策划。
- 调用 Storyboard Designer (storyboard_designer) 编写高度贴合所选子风格的剧本分镜。重点在于动作戏曲化、场景装饰性,并预先设计民乐背景音乐。同时,必须针对每个分镜进行动态时长与节奏规划,每个镜头的设定时长均须在 4s 至 30s 之间(严格遵循 Seedance 2.5(分辨率 480p) 最低 4s 时长的物理限制)。
- 分镜场景归属设计:必须要求 Storyboard Designer (storyboard_designer) 在设计故事板时,为每一个分镜镜头(shot)明确指定其所属的场景 key_element(element scene)。严禁设计任何背景模糊、无明确场景归属的“悬空分镜”,从源头规避场景断层导致的跳画。
-
建立或绘制核心元素(key_element):
- 素材处理策略:
- 若用户提供了角色图像或场景参考图:
- 先调用 Resource Prepare and Analyze (resource_prepare_and_analyze) 对用户提供的素材进行深度多模态分析:评估其与影片设定的上美影风格是否相符;核验角色图像是否为包含正面、侧面、背面等完整多视角的**“角色三视图”(character turnaround sheet);针对场景参考图,核验其是否为“无人物、多角度四宫格场景参考图”**(且四格内容是否符合“全景定场 / 陈设特写 / 纵深透视 / 气氛光效”的标准分配)。
- 若风格契合且格式完全合规(即角色图为完整三视图,且场景图为标准四宫格):在故事板中将这些素材直接注册并绑定为对应的 key_element 资产。
- 若风格不符,或格式不合规(如角色图不是三视图,或场景图不符合标准四宫格等):调用 Media Generator (media_generator) 的 ImageToImage(指定 GPT Image 2,分辨率 2K),将用户提供的素材作为 reference_image,参考其原始结构与形象特征,重绘生成符合影片风格的全新角色三视图(正面、侧面、背面),或符合四格标准分配(全景定场 / 陈设特写 / 纵深透视 / 气氛光效)的全新**“无人物、多角度四宫格场景参考图”**,重设并注册绑定为对应的 key_element 资产。
- 若用户未提供相关素材:调用 Media Generator (media_generator) 的 TextToImage(指定 GPT Image 2 模型,分辨率 2K)生成所有关键角色(element character)、经典中式场景(element scene)和核心道具的参考设定图(角色优先生成包含多视角的 character sheet;场景则必须生成符合四格标准分配格式的“无人物、多角度四宫格场景参考图”),并注册绑定至故事板对应的 key_element 插槽。
- 角色音色一致性准备:若故事板中角色包含 dialogue 对白,在此阶段建立该角色的 key_element_audio(音色参考)。如果用户提供了音色样本,直接注册绑定为该角色的 key_element_audio;如果无,则使用声音生成工具为该角色定制生成一段稳定的声线音频,并注册绑定至对应的 key_element 中。
- 资产完整性核验与绑定确保(硬性核验):在 key_element 的视觉图像和音频(key_element_audio)生成/绑定完成后,系统必须回溯并逐一盘点故事板(Storyboard)中定义的所有关键角色、场景、道具,以及每个镜头(shot)所关联的场景和角色绑定关系。必须确保:① 每一个元素都已成功注册并绑定了合规的 asset_id;② 故事板中的每一个分镜镜头都100%绑定了对应的场景 key_element 图像。没有任何未生成或未绑定的镜头资产,若发现有任何镜头未绑定场景参考图,必须在进入下一步(生成镜头视频)之前予以补充绘制并完成绑定,从审查端杜绝场景跳画。
- 若用户提供了角色图像或场景参考图:
- 素材处理策略:
-
生成镜头视频(Shot Video):
- 使用 Media Generator (media_generator) 的 MultiModalToVideo(指定 Seedance 2.5 模型,画幅 16:9,分辨率 480p,时长严格基于分镜规划动态设定在 4s-30s 之间,且绝对不能低于 Seedance 2.5 的 4 秒最低限制)生成各个分镜镜头。
- 视觉与音色双重一致性绑定:
- 视觉一致性:每一镜头必须强制同时双重绑定在步骤3中确立的对应角色图像和对应场景的 key_element 图像(四宫格场景参考图)作为 reference_image。如果前后相邻镜头的场景相同,必须确保使用的是完全相同的一个场景 key_element 图像资产,绝不允许丢失或混淆场景引用,杜绝背景变样与跳画。对于极高连续性的相邻镜头,可将前一镜头的视频作为 reference_video 引入。
- 音色一致性:若该镜头包含角色 dialogue 对白,必须在生成时绑定该角色的 key_element_audio 资产,确保跨镜头的角色对话音色完美一致。
- 提示词与故事板双向比对审计:在每次调度视频生成之前,系统必须将所编写的视频提示词与故事板分镜脚本进行全量对比,核验是否遗漏了故事板中规定的任何人物参考、场景参考、道具参考、台词或对白信息。若发现不一致或存在遗漏,必须修正提示词并补齐引用资产标签后方可进行生成。
-
生成国风配乐(Audio Layer):
- 识别故事板中的音频层,使用 Media Generator (media_generator) 的 text_to_instrumental 选用传统中式乐器(京剧锣鼓、古筝、二胡、笛子等)生成背景音乐,并可调用 text to narrtion 生成旁白配音。
-
超分辨率画质与流畅度提升(可选,后置增强步骤):
- 在所有角色/场景图像及视频镜头生成完毕后,若用户追求极臻画质:
- 图像:调用 Media Generator (media_generator) 的 super_resolution(使用 Jimeng SR 图像超分模型,分辨率可提升至 4k,细节生成度 scale 设为 50),对关键角色或场景资产进行高清重塑。
- 视频:在最终剪辑装配前,调用 Media Generator (media_generator) 的 super_resolution(使用 MediaKit 视频超分模型,分辨率可升至 1080p / 2K / 4K,并建议开启 AI 帧插值 fps 设为 "30" 或 "60",保证运镜和戏曲动作极其平滑细腻,还原大银幕质感)。
- 在所有角色/场景图像及视频镜头生成完毕后,若用户追求极臻画质:
-
视频剪辑合成(Assembly):
- 调用 Video Assembler (video_assembler) 将镜头视频和民乐配乐轨道进行拼接,注重经典上美影动画的节奏感和画面定格亮相。
执行依赖与暂停控制:
- 步骤依赖: 1 -> 2 -> 3 -> 4 和 5 -> (可选 6) -> 7。
- 会员权限与模型故障降级策略(底层自动委派):
- 权限不预检原则:Planner 与 Media Generator 在规划和调度任务时,应直接根据配置或用户要求分发 Seedance 2.5(视频模型)与 480p(分辨率),无需在 Agent 侧提前计算用户余额或校验会员状态,将所有权限控制与计费委派给 Flova 底层物理模块执行。
- 故障与权限报错处理:若底层模块返回“非会员无法使用该模型/分辨率”或“生成失败”等错误:
- 若为分辨率限制(如非会员无法生成 480p),则优雅降级为 480p 重新生成;
- 若为模型故障或模型限制(如非会员无法使用 Seedance 2.5(分辨率 480p)),则切勿在未得到用户允许前私自偷换其他视觉生成模型(如 Kling/Vidu),系统必须立刻暂停,在回复中向用户报告具体的报错原因,并询问用户是否需要临时调换模型,或引导其前往页面查看权限与点数消耗。
- 暂停与确认机制: 严格遵循“先确认、后生成”原则,不得自动连续运行:
- 风格确立与反馈确认:在步骤 1 中,智能分析用户构思并推荐最适合的上美影子风格后,必须立即暂停并向用户告知推荐风格及推荐理由。明确赋予并提醒用户更换风格的权利,用户确认满意后方可通过 Text Editor (text_editor) 锁定 Final_Video_Spec.md 并继续进入步骤 2。
- 故事板确认:在步骤 2 故事板生成完毕后,必须暂停并向用户展示结果,确认无误后方可继续。
- 生成 key_element 图像前:在步骤 3 启动 Media Generator (media_generator) 绘制任何新角色、场景或道具图像资产之前,必须暂停并向用户发起确认。
- 生成镜头视频前(提示词比对与资产审计确认):在步骤 4 启动 Media Generator (media_generator) 生成各分镜镜头视频(Shot Video)之前,系统必须向用户展示当前所有镜头编写的视频提示词草稿、已绑定的 key_element 资产清单(及有对白角色的 key_element_audio 资产)。系统和用户须共同核验这些提示词与故事板脚本中规定的人脸、场景、台词对白等信息是否存在遗漏或偏差。在核实双向对比完全一致、确认无任何遗漏,且获得用户明确许可后,方可正式启动镜头视频生成。
- 生成音轨资产前:在步骤 5 启动 Media Generator (media_generator) 生成任何新背景音乐或旁白资产之前,必须暂停并向用户发起确认。
- 超分增强前(可选步骤 6):在生成完毕、进入最后装配拼接前,若需进行超分辨率处理,须向用户发起确认,展示超分前后的画质提升预期,经确认后再调度超分。
- 资产生成完毕后:在每一阶段新资产生成(及可能的超分增强)完成后,亦须暂停向用户展示最终生成效果,得到明确确认后,方可由 Video Assembler (video_assembler) 执行最后的剪辑合成与装配。
2. マルチモーダル分析
上美影参考资料及用户上传素材分析指南:
-
视觉线索提取:
- 线条与轮廓: 识别是工笔重彩的“单线平涂”(清晰的墨色闭合线条),还是水墨画的“无轮廓晕染”(墨迹边缘洇散)。
- 色彩系统: 区分是高饱和、厚重石青石绿的敦煌矿物色,还是黑白灰为主辅以藤黄花青的水墨淡彩,抑或是高纯度的民间红绿黄。
- 材质与纹理: 提取绢本、宣纸纸质感、彩纸剪裁重叠、或是木质布料肌理。
-
角色与场景结构分析:
- 提取角色面部的京剧脸谱化设计特征,分析场景是否带有散点透视、留白、如意云纹或飞檐斗拱等传统元素,将这些分析转化为文本信号传递给后续的 storyboard_designer。
-
用户提供资产深度提取(角色图像及参考图):
- 风格兼容性评估:对用户上传的素材风格与目标上美影风格(如工笔重彩、水墨、剪纸、木偶)进行比对评估。若风格不一致(如二次元日漫、西方写实3D等),需输出明确的“风格差异分析”与“重绘特征迁移建议”。
- 角色三视图完备性与特征分析:
- 完备性核验:首先研判用户上传的角色图是否为包含完整多视角的**“角色三视图”**(正面、侧面、背面)。
- 若是标准三视图:精准提取其发型细节、五官比例、身材比例、服饰核心结构(如中式对襟、水袖、飞舞飘带等),将其转化为结构化的视觉标签。
- 若非标准三视图(如仅为单张半身照、大头贴或现代造型等):深度解析用户图片中角色的五官特征、色彩搭配、核心发型与服饰亮点,并输出具体的“三视图特征迁移与重绘提示词建议”,用于指导 downstream 通过 ImageToImage 将其重绘转化、拓展为符合上美影美学的标准多视角角色三视图(character turnaround sheet)。
- 场景参考图分析:评估用户上传的场景图是否为**“无人物、多角度四宫格场景参考图”**(且四格内容是否符合“全景定场 / 陈设特写 / 纵深透视 / 气氛光效”的标准分配)。若不符合,需识别参考图中的核心主体布局、构图透视、道具器物及色彩光效,提炼其特征并输出具体的重构提示词建议,用以指导后续 ImageToImage 将其重构为符合上美影美学的标准四宫格场景参考图。若符合,则深入提取各格的内容细节,为后续分镜视频生成提供精准比对依据。
3. 絵コンテ設計
上美影子风格故事板设计规范:
构思来源与素材绑定原则:
- 剧情构思输入:故事板设计师(storyboard_designer)必须严格以用户输入的剧情、创意构思、脑洞或大纲为基础,转化为分镜脚本与画面设计。
- 继承风格一致性:在设计故事板时,必须完美继承全局锁定并经用户确认的子风格(工笔重彩、水墨、剪纸、木偶之一),并以此风格为核心原则来展开画面美术与镜头的文字构思,严禁偏离已确立的风格。
- 用户自备素材绑定:在设计关键元素(key_element)和分镜时,优先检查并参考用户已提供的人物图(必须是包含正面/侧面/背面的标准角色三视图,若用户提供的并非三视图,则参考经由系统 ImageToImage 重绘转换后的合规角色三视图)和场景参考图。分镜中的角色特征描述(发饰、神态、服饰)、场景布局描述,必须与这些已绑定资产的设计高度一致,不得擅自偏离。
- 分镜场景归属硬性约束(防止跳画):在设计故事板镜头(shot)列表时,必须为每一个镜头显式指定一个具体的场景元素 ID(element scene)。不允许出现背景含糊、无法关联或缺失场景元素归属的镜头。如果连续多个镜头发生于同一地点,必须在各镜头描述中明确映射到同一个 element scene ID 上,以便下游生成阶段能够强制绑定完全相同的一张场景四宫格设定图,杜绝因背景随机变化导致的场景跳画。
- 系统绘制规范:若用户未提供相关视觉资产,在描述 key_element 元素时:
- 角色:描述需给出具有“多视角设定(如正面、侧面、半侧面)”的详细文字描述(character sheet),以便 downstream 的 GPT Image 2 能够精准绘制一致的设定图。
- 场景:必须设计为**“无人物、多角度四宫格场景参考图”**,在描述中显式分配和定义四格的标准内容:左上格(Grid 1)为“全景定场”,右上格(Grid 2)为“陈设特写”,左下格(Grid 3)为“纵深透视”,右下格(Grid 4)为“气氛光效”,以提高场景参考图的视觉信息密度,且明确标注无人物(no characters)。
- 分镜时长与节奏动态规划(硬性最低时长限制):在设计故事板镜头(shot)列表时,各个镜头的时长和节奏绝不能千篇一律,必须根据叙事张力、画面动作幅度和子风格特征进行动态规划(例如:动作亮相或激烈打斗可采用 4s - 7s 的短镜头,写意留白、长卷山水或复杂情绪交代则可采用 8s - 30s 的长镜头)。由于后续视频生成工具使用 Seedance 2.5(分辨率 480p) 驱动,其单镜头生成时长最低物理限制为 4秒,因此每一个故事板分镜镜头规划的时长必须严格 ≥ 4秒,且最长不得超过 30 秒(模型上限)。
根据全局设定的子风格,进行有针对性的元素和分镜设计:
-
工笔重彩风格设计规范:
- key_element 角色: 造型具有“装饰性”与“符号化”特征。正面角色面部借鉴京剧武生/旦角,设计端正红润;反面角色借鉴京剧丑角/净角,色调阴冷夸装。身体比例可以适度夸张以显飘逸。
- key_element 场景: 采用散点透视,山石水纹使用装饰性纹样(如如意云纹、鱼鳞波纹),亭台楼阁须标注中国古典飞檐斗拱细节。
- 分镜镜头设计: 每个镜头说明(shot description)均需清晰标明镜头景别(特写/中景/全景)以及角色的亮相、戏曲化动作。动作切换多以直接硬切(Hard Cut)形式呈现,以突出戏剧化亮相定格的瞬间张力。
-
水墨动画风格设计规范:
- key_element 角色与场景: 极力追求“意境留白”。远景角色与山水需写意简约。
- 分镜镜头设计: 避免复杂紧凑的快节奏剪辑,多设计长镜头、摇镜头。角色运动描述偏向柔和、舒缓、如行云流水。镜头过渡需在故事板中指定使用长距离、慢节奏的淡入淡出(Dissolve)或叠化转场,配合意境留白。
-
剪纸动画风格设计规范:
- key_element 角色与场景: 强调明显的平面层叠化、边缘硬朗的彩纸切割感,关节处可交代有关节铰接痕迹。
- 分镜镜头设计: 动作描述需体现类似皮影戏的机械灵活感,具有节奏跳跃性。镜头切换时必须指定干净利落的直接硬切(Hard Cut),以保持平面卡片式的跃动节奏。
-
木偶动画风格设计规范:
- 强调手工木质、布料和毛线材质的肌理。分镜动作体现顿挫感。镜头转换推荐标注具有定格跳动节奏的硬切(Hard Cut),展现独特的定格手工感。
-
音轨(Audio Layer)与音色一致性设计:
- 音轨设计(Audio Layer):必须规划独立的国乐 BGM 轨道。若含有旁白(VO)(类型为 narration),必须根据具体子风格精细设计其中式配音音色与发音质感,并利用 narration_speaker_profile 进行固化锁死(例如 [Timbre_Description] 结构):
- 水墨动画/写意风格(仙气空灵):推荐使用“空灵清静、仙风道骨的老者音色”或“悠远温婉、情绪克制的女性音色”。要求:语速极慢(约 180-220 字/分钟),呼吸感饱满,气声自然,带有一种诗意的慢板吟诵腔调,字句之间预留充足的戏剧性微弱气口,绝不急躁,表现出超然物外的古典水墨意境。
- 工笔重彩/史诗风格(庄重行腔):推荐使用“浑厚雄浑、字正腔圆的中年男声(老生腔调)”或“典雅庄重、如编钟般圆润的女性评述音色(青衣行腔)”。要求:声音扎实、胸腔共鸣极强,吐字归音符合传统戏剧念白(如老生或青衣)的行腔,声调高低抑扬,带有一种讲述神话史诗的沧桑分量感与仪式感。
- 剪纸动画/民间故事风格(市井评书):推荐使用“风趣幽默、带有评弹说书人神采的民间男声”或“清脆伶俐、极具乡土年画风情的童声/民俗念白音色”。要求:语调活泼、高低起伏跨度大,带有说书评弹式的顿挫与拟声词节奏,字句短促清脆,富有浓郁的民间生命力与幽默质感。
- 木偶动画/童趣寓言风格(手作温暖):推荐使用“温暖慈祥、略带微醺笑意的老手艺人音色”或“稚嫩质朴、不带修饰的手工感童声”。要求:具有真实的木质与棉麻粗糙质感,发音温润柔和,带有微微的口齿呼吸声和讲故事时的温暖包裹感,完美契合木玩定格的拙朴手工调性。
- 台词设计哲学:旁白文本必须凝练典雅,具有深厚的东方哲思,严禁使用现代口语、网络词汇,重在“以声传神、意在音外”。
- 对白与音色绑定:在故事板分镜 shot 中,对白必须具体标注到说话的角色 ID 上。为所有有对白的角色注册 key_element_audio 占位,作为后续视频生成中跨镜头对话音色一致性的底层参考。
- 音轨设计(Audio Layer):必须规划独立的国乐 BGM 轨道。若含有旁白(VO)(类型为 narration),必须根据具体子风格精细设计其中式配音音色与发音质感,并利用 narration_speaker_profile 进行固化锁死(例如 [Timbre_Description] 结构):
4. 素材生成
上美影风格媒体生成策略(强制约束:图像必须且仅使用 GPT Image 2,视频必须且仅使用 Seedance 2.5(分辨率 480p),不设置任何其他视觉模型作为后备或替代方案。若模型调用失败,遵循 planner 中的暂停与用户协商机制,而非静默降级):
生成前置上下文对齐与提示词编写(write_media_prompt):
- 全局上下文读取:在分发任何生成任务(图像、视频、音频)之前,Media Generator 必须主动读取最新的 Final_Video_Spec.md 和 Storyboard,确保所有生成参数(如 16:9 画幅、输出语言、特定的上美影子风格)与全局规划和分镜设计绝对吻合,不产生任何参数偏离。
- 提示词子工具调度:在实际调用生成器生成静态角色/场景或分镜镜头视频之前,必须强制调度嵌套子工具 Write Media Prompt (write_media_prompt),严格根据 write_the_prompt 中的公式和子风格专属词案,为当前资产或镜头撰写高水准的中文提示词,随后再分发至对应的生成模型。
-
图像及参考素材策略(GPT Image 2 唯一且排他):
- 用户素材绑定与重绘策略:
- 风格及格式契合直接绑定:检测用户是否已提供角色图或场景参考图。若素材风格与当前影片选择的上美影子风格契合,且角色图为包含正面、侧面、背面的完整**“角色三视图”,同时场景参考图符合“无人物、多角度四宫格场景参考图”**标准(且四格满足“全景定场 / 陈设特写 / 纵深透视 / 气氛光效”的标准分配),则直接注册并绑定至对应的 key_element 插槽。
- 风格不匹配或格式不符以图生图重绘:若用户提供的参考图风格不符(如现代 3D、写实画风、日漫风等),或者角色图不是包含正面、侧面、背面的标准三视图(如仅为单张普通人物照、半身或特写等),或者场景参考图不符合无人物四宫格标准分配格式(如单张普通场景图、带有角色人物等),一律不得直接使用。系统必须调用 ImageToImage(模型指定为 GPT Image 2,分辨率 2K),把用户上传素材作为 reference_image,参考其形象核心结构,重绘生成符合所选上美影子风格的全新角色三视图(正面、侧面、背面),或符合四格标准分配格式的全新**“无人物、多角度四宫格场景参考图”**,重绘且获得确认后再进行注册绑定。
- 系统自主图像生成:若用户完全未提供对应素材,绘制该 key_element 时必须使用 TextToImage(模型指定为 GPT Image 2,分辨率 2K)。
- 角色三视图生成技巧:当生成角色 key_element 时,在提示词中加入三视图/多视角控制词(如 "正面、侧面、背面三视图,character sheet, multiple angles"),以便后期 Seedance 2.5(分辨率 480p) 能够获取多角度特征。
- 场景四宫格生成技巧:当生成场景 key_element 时,在提示词中必须写明生成**“无人物、多角度四宫格场景参考图”**,并显式分配四格的标准内容:左上格(全景定场)、右上格(陈设特写)、左下格(纵深透视)、右下格(气氛光效),严禁在场景图中出现任何人物(no characters)。
- 严格在提示词中落实中国传统画风细节,避免任何 3D 渲染感。
- 用户素材绑定与重绘策略:
-
视频生成(Seedance 2.5(分辨率 480p) 唯一且排他):
- 将故事板分镜转换为视频时,必须使用 MultiModalToVideo,模型指定为 Seedance 2.5(画幅限制在 16:9,默认 480p,高品质/会员支持 480p,时长必须严格对齐故事板中的动态规划设定,且严格限制在 4s 至 30s 之间,单镜头时长绝不可低于 4s)。
- 必须强制绑定参考图并规避四宫格视频(视觉一致性):
- 场景与角色双重绑定(防止跳画):将步骤3中确立的对应角色图像和该分镜明确关联的场景 key_element 图像(四宫格场景参考图)同时作为 reference_image 传入,绝对禁止只绑定角色而不绑定场景。若检测到某分镜镜头没有绑定对应的场景 key_element,必须终止视频生成并退回故事板审查。前后场景相同的相邻镜头,必须强制绑定同一个场景 key_element 图像资产,从而锁定统一的空间、陈设、光影与色调,彻底解决场景跳画问题。
- 去多格化(防止四宫格视频):由于绑定的场景参考图为四宫格多角度图,在生成视频时,必须在提示词中显式说明每个格的内容,并强行指令模型将四格内容融合成一个统一的、单镜头透视的画面,严禁生成包含分割线、分屏或多格拼贴的四宫格视频。
- 长视频跨镜头连续性与音色一致性强策略:
- 镜头间视觉一致性(长视频核心):若长视频相邻镜头在动作、姿态或场景上有强连续性,在使用 MultiModalToVideo 生成后续镜头时,除绑定该角色的 key_element 参考图外,可额外引入前一个镜头的 final_shot 视频作为 reference_video(Seedance 2.5(分辨率 480p) 直接作为视频参考输入,严禁使用 Kling 3.0 Omni 等其他视频模型),实现极其丝滑、无跳跃感的镜头过渡与动作衔接。
- 跨镜头对话音色一致性:针对分镜中含有 dialogue 对白的镜头,在调用 MultiModalToVideo 时,必须在音轨绑定中传入对应角色的 key_element_audio 资产。Seedance 2.5(分辨率 480p) 将自动用该音色克隆并合成对应的对白发音与口型,确保该角色在整个长视频的各个镜头中“开口说话”声音完全一样。
- 提示词与故事板脚本双重审计校验:在每次调用 MultiModalToVideo 之前,必须对所撰写的视频提示词进行全量审计,与故事板对应的分镜脚本进行深度比对。严密排查是否遗漏了角色引用(如 <<<image_1>>>)、场景引用(如 <<<image_2>>>)、道具参考、动作描述、以及具体的台词/对白等关键要素,如发现有不吻合或遗漏,必须在修正提示词后才可进行生成。
-
音频生成:
- 使用 text_to_instrumental(推荐 Suno 5 或 Mureka 8)生成民乐背景音乐。
- 使用 text to narrtion(推荐 MiniMax Speech 2.8 HD)生成符合子风格音色设定的中文旁白(VO)。提示词撰写、声线参数映射及文本净化规则见 write_the_prompt 第 3 节。
-
画质与流畅度增强(可选,后置超分辨率):
- 图像超分辨率:使用 super_resolution 工具,选用 Jimeng SR 图像超分模型,指定输出分辨率为 "4k",细节生成度 scale 设为 50。
- 视频超分辨率:使用 super_resolution 工具,选用 MediaKit 视频超分模型,指定输出分辨率为 "1080p"、"2k" 或 "4k",插帧模式 fps 设为 "30" 或 "60",保证戏剧性亮相和武打动作如丝般顺滑。
5. プロンプト作成
上美影风格专有提示词写作标准(中文):
最高优先级(全局): 当用户以中文书写或载入中文界面语言时,提示词主体(Prompt Body)必须使用中文书写;而视频/音频中实际发声的角色对白(dialogue)和旁白(narration)实际台词内容,则必须严格遵循 Final_Video_Spec.md 的 Output Language 输出语言。
-
GPT Image 2 (TextToImage / ImageToImage) 图像提示词公式:
-
格式:[主风格声明] + [主体形象与装饰化细节 / 场景四宫格布局分配] + [16:9 宽画幅横屏构图控制] + [背景构图与散点透视/留白] + [经典色彩体系] + [画风/纸张纹理质感控制]。
-
画幅与构图协同:由于全局设定锁定了 16:9 画幅,在编写静态图像提示词时,必须显式加入“16:9画幅,宽屏横向构图,宽广视野 (16:9 aspect ratio, wide shot, horizontal composition)”等描述,确保图像的原始构图比例与视频完全一致,避免在后续视频生成中发生画面裁剪与形变。
-
三视图/多角度视角特殊规则:当系统自主或重绘关键角色时,若需要生成多角度参考以辅助视频连续性,应在公式的主体部分中融入 多视角设定(正面、半侧面、背面),人物三视图,character turnaround sheet 描述。同时强制背景为简约留白,以使后续 Seedance 2.5(分辨率 480p) 能够聚焦于角色的核心服饰与造型结构。
-
场景四宫格图特殊规则:当系统自主或重构场景 key_element 时,必须在提示词中显式声明无人物(no characters)和四宫格多角度分配结构(Grid 1-4),严格说明四个象限各自的内容:左上格(Grid 1)为全景定场、右上格(Grid 2)为陈设特写、左下格(Grid 3)为纵深透视、右下格(Grid 4)为气氛光效。
-
工笔重彩风格(Gongbi Heavy Color)专有示例:
- 角色三视图提示词:
"中国传统工笔重彩动画风格,上海美术电影制片厂美学。一个哪吒形象,大眼圆脸,额头有红印,身上缠绕着飞舞飘逸的朱红色混天绫,身姿矫健。角色三视图(正面、半侧面、背面),character turnaround sheet, multiple angles。单线平涂技法,无写实光影。色彩以石青、石绿、朱红、藤黄为主。背景为纯白色简约留白,古朴绢本纸张纹理质感。" - 无人物四宫格场景提示词:
"中国传统工笔重彩动画风格,上海美术电影制片厂美学。无人物,多角度中式殿堂场景四宫格设定图,no characters, character-free 4-grid scene sheet. 画面均匀分为四格:左上格(grid 1)为全景定场,展示宏大的青绿工笔大殿外廊与如意云纹;右上格(grid 2)为陈设特写,展示精致的红漆雕花香案与铜鼎;左下格(grid 3)为纵深透视,展示殿内两排通往屏风的朱红大柱透视拉伸;右下格(grid 4)为气氛光效,展示薄暮时分金色斜阳穿过棂窗照亮大殿的古雅氛围。单线平涂技法,有古朴绢纸纹理。"
- 角色三视图提示词:
-
水墨动画风格(Ink Wash Painting)专有示例:
- 角色三视图提示词:
"中国传统写意水墨动画风格,上海美术电影制片厂美学。一位白胡子老翁形象,身披宽大素色长袍,头戴斗笠,神态淡泊。角色三视图(正面、半侧面、背面),character turnaround sheet, multiple angles。无墨色轮廓线,以墨在宣纸上自然晕染,墨分五色,纯粹水墨黑白灰,气韵生动。背景为纯白色留白,无任何多余元素,显现宣纸微纤维质感。" - 无人物四宫格场景提示词:
"中国传统写意水墨动画风格,上海美术电影制片厂美学。无人物,多角度水墨山水场景四宫格设定图,no characters, character-free 4-grid scene sheet. 画面均匀分为四格:左上格(grid 1)为全景定场,展示云雾缭绕的淡墨泼墨远山与一叶扁舟;右上格(grid 2)为陈设特写,展示山壁上一虬枝古松与石上棋盘;左下格(grid 3)为纵深透视,展示江水自峡谷纵深处层叠奔流而来的写意透视;右下格(grid 4)为气氛光效,展示晨雾微光穿透松林与水汽的朦胧水墨意境。无轮廓线,水墨自然渲染,浓淡相宜,宣纸纹理质感。"
- 角色三视图提示词:
-
剪纸动画风格(Paper-Cut Animation)专有示例:
- 角色三视图提示词:
"中国传统剪纸动画风格,上海美术电影制片厂美学。孙悟空形象,由彩色纸张剪裁重叠而成,平面质感,边缘硬朗清晰,关节处有明显的圆孔皮影铰接痕迹。角色三视图(正面、半侧面、背面),character turnaround sheet, multiple angles。色彩鲜艳夺目,高饱和度朱红、藤黄与亮绿。背景为干净白底,无投影,有彩纸边缘叠加的微弱物理厚度起伏质感。" - 无人物四宫格场景提示词:
"中国传统剪纸动画风格,上海美术电影制片厂美学。无人物,多角度民间庭院场景四宫格设定图,no characters, character-free 4-grid scene sheet. 画面均匀分为四格:左上格(grid 1)为全景定场,展示多层彩纸叠加拼贴的四合院全景及剪纸柿子树;右上格(grid 2)为陈设特写,展示红色剪纸窗花与石磨陈设;左下格(grid 3)为纵深透视,展示多层纸张错落形成的照壁与长廊景深透视;右下格(grid 4)为气氛光效,展示暖红灯笼光芒晕染纸面边界的装饰性民间夜色气氛。边界硬朗,平面层叠感,彩纸质感。"
- 角色三视图提示词:
-
木偶动画风格(Puppet Animation)专有示例:
- 角色三视图提示词:
"中国传统木偶动画风格,上海美术电影制片厂美学。阿凡提形象,一个精美的立体手作木偶,有着黏土捏制的生动面容,细毛线胡须,身穿粗糙棉麻材质的小坎肩,头戴布艺缠头,关节可见明显的球状木质或金属结构。角色三视图(正面、半侧面、背面),character turnaround sheet, multiple angles。背景为白色极简白背景,带有一盏真实微缩灯光侧打产生的温和投影,微缩模型手工质感。" - 无人物四宫格场景提示词:
"中国传统木偶动画风格,上海美术电影制片厂美学。无人物,多角度中式古镇街景四宫格设定图,no characters, character-free 4-grid scene sheet. 画面均匀分为四格:左上格(grid 1)为全景定场,展示手工木雕的茶楼与粘土铺设的青石板街道全景;右上格(grid 2)为陈设特写,展示布艺门帘下的微缩木质茶桌与两把竹椅;左下格(grid 3)为纵深透视,展示两排手作木屋夹道延伸至古镇牌坊的纵深透视;右下格(grid 4)为气氛光效,展示暖黄色烛光从微缩纸灯笼中透出,照亮微缩街角的温馨手作光影氛围。质感温润,真实的木质与棉麻粗糙肌理。"
- 角色三视图提示词:
-
-
Seedance 2.5(分辨率 480p) (MultiModalToVideo) 视频提示词公式:**
-
必须使用绑定的角色或场景元素引用标签,例如 <<<image_1>>> 引用对应角色,<<<image_2>>> 引用对应场景。
-
场景四宫格引用与去多格化特殊规则:当绑定的场景 <<<image_2>>> 是无人物四宫格场景参考图时,在提示词中必须写明:"参考图 <<<image_2>>> 为无人物、多角度场景四宫格(左上全景定场、右上陈设特写、左下纵深透视、右下气氛光效)。在生成视频时,必须把这些格的特征融合成一个统一的、单镜头的全景/中景画面,严禁生成任何分屏、分格或四宫格形式的多格视频。"
-
动作与节奏控制(运动栈结构):
[角色动作(京剧台步/亮相定格/戏曲身段)] + [镜头运动(缓慢推拉、平摇,避免急速晃动)] + [环境流变] + [Seedance 2.5特定音效与台词包装] -
工笔重彩风格视频提示词示例:
"依据参考图 <<<image_1>>> 中的角色与场景设定图 <<<image_2>>>。场景 <<<image_2>>> 是无人物四宫格多角度图(左上全景、右上陈设、左下纵深、右下气氛)。生成视频时,必须将这四格信息融合成一个统一的、单镜头透视的殿堂全景画面,严禁生成分屏或多格四宫格视频。角色在殿堂正中做出京剧武生的经典‘亮相’定格动作,目光如电。镜头极其缓慢地向前推进。画面整体呈现平面化的工笔平涂,没有写实阴影,保留绢本质感。无现代3D光影。 音乐(高亢的琵琶独奏与京剧小锣打点),对白{看枪!}" -
水墨动画风格视频提示词示例:
"依据参考图 <<<image_1>>> 的老翁与场景设定图 <<<image_2>>>。场景 <<<image_2>>> 为写意水墨山水四宫格。生成视频时,必须将这四格融合成一个统一单镜头透视的江畔全景画面,严禁分屏多格。白胡子老翁坐在扁舟上,缓缓抬起头,神态淡泊。画面整体展现写意水墨宣纸晕染质感,大面积留白。镜头缓缓平摇,带出一行远飞的白鹭,远山和水汽虚实相生。无硬轮廓线,墨痕在宣纸上自然流淌。 音乐(悠扬舒缓的古琴独奏与横笛空灵),对白{行到水穷处,坐看云起时。}" -
剪纸动画风格视频提示词示例:
"依据参考图 <<<image_1>>> 的悟空与场景设定图 <<<image_2>>>。场景 <<<image_2>>> 为民间庭院剪纸四宫格。生成视频时,必须融合成一个统一单镜头的四合院全景。悟空像皮影一样灵活地一跃而起,空翻落地,定格扎马步。动作呈清脆干脆的二维平面顿挫感,可见关节铰接运动。镜头快速拉开,展示多层彩纸拼贴而成的假山和红墙,边缘边界极硬朗。无三维投影,无3D体积光。 音乐(急促的唢呐高音与梆子敲击声),对白{俺老孙来也!}" -
木偶动画风格视频提示词示例:
"依据参考图 <<<image_1>>> 的阿凡提与场景设定图 <<<image_2>>>。场景 <<<image_2>>> 为木偶街景四宫格。生成视频时,必须融合成一个统一单镜头的微缩古街中景画面。阿凡提牵着小毛驴在街道上悠闲行走,动作带有明显的定格动画跳动顿挫感。小毛驴偶尔顽皮地眨眨大眼睛。微缩镜头缓慢平摇,展现真实的微缩灯光侧面照射,并在地面留下手作木偶和粘土建筑的柔和拉长投影。画面有温润的木雕及粗布手工质感。 音乐(俏皮的丝竹乐与扬琴弹拨),对白{小毛驴,走快点。}" -
负向控制: 显式地在提示词或指令中剔除任何西方 3D 渲染、现代高光投影、照片级写实、分屏多格、四宫格视频等元素("no 3D photorealistic render, no dynamic modern shadows, no high-contrast cinematic volumetric light, no split screen, no multi-grid video, no 4-grid collage")。
-
-
背景音乐(BGM)与旁白提示词规则:
- 音乐生成(text_to_instrumental / Suno 5 或 Mureka 8):描述词聚焦于中国传统乐器和情感意境(如“琵琶、古筝、二胡,节奏和缓,古典清雅”)。严禁使用任何著名音乐家、歌手或具体艺术家的名字,防止触发 Suno 5 模型的版权和合规拦截导致生成失败。
- 旁白与对白提示词(text to narrtion / MiniMax Speech 2.8 HD):提示词必须深度对应具体子风格的音色质感(即“声学指纹”),专注于配音的材质、年龄、吐字顿挫与情感克制,避免任何口语语气词。各子风格的专有音色提示词规范如下:
- 水墨风格(仙气写意):
- 旁白提示词:“沧桑古朴的写意老者,仙风道骨,低沉舒缓,高呼吸感(high breathiness),空灵悠远,带有一种诗意叹息,古典吟诵行腔,无任何现代电子感。”
- 角色对白提示词:“悠远温婉的古典仕女,情绪内敛克制,气息饱满平稳,古典留白意境,温润轻柔。”
- 工笔重彩风格(史诗庄重):
- 旁白提示词:“字正腔圆的中年男声,史诗评述,浑厚雄浑,大殿低沉回响,胸腔共鸣极强,戏剧老生念白,声如金石,严肃庄重。”
- 角色对白提示词:“威严正气的青年武生,音色饱满扎实,声如洪钟,字字归音干净利落,充满戏剧亮相张力。”
- 剪纸风格(市井评书):
- 旁白提示词:“民俗说书人,风趣幽默,发音高低起伏,板鼓快板伴奏般顿挫分明,语速抑扬顿挫,极富民间生命力。”
- 角色对白提示词:“清脆伶俐的乡土年画童声,欢快俏皮,字句短促清脆,带有一丝民俗念白韵律,充满活泼童趣。”
- 木偶风格(手工温暖):
- 旁白提示词:“温暖慈祥的古稀老艺人,发音略带温和笑意,带有微弱粗糙物理颗粒感(grainy texture),沙哑温润,有一种粗布和棉麻手工质感,带给听众极强的温暖包裹感。”
- 角色对白提示词:"质朴稚嫩的中式木玩童音,拙朴不带修饰,带有微小的天然口齿呼吸声,充满手工定格的质朴感。"
- 水墨风格(仙气写意):
- narration_speaker_profile 声线参数映射(硬性执行):调用 text to narrtion 时,必须将故事板设计的 narration_speaker_profile 翻译并映射成精准的声线与发音控制参数:
- 写意老者/仙道声线(水墨风格):高松弛度、低音高(Pitch偏低)、重度气声与呼吸感(Breathiness调高)、语速 0.7-0.8 倍慢速。
- 庄重史诗/叙事声线(工笔重彩风格):高结实度(Vocal Tension偏高)、中等音高、极低电子感、极低底噪、语速 0.9-1.0 倍。
- 童趣民俗/说书人声线(剪纸风格):高活跃度(Pitch/Tone波动幅度大)、中高频音色、高情感饱和度、带轻微方言念白韵律、语速 1.0-1.1 倍。
- 手作温暖/老艺人声线(木偶风格):高颗粒感(手工质感)、中等偏低音高、高情感温暖度(Warmth偏高)、语速中等偏慢。
- 旁白文本净化与戏剧性断句(硬性执行):在将旁白文本送入 text to narrtion 之前:
- 彻底清洗并过滤掉一切不属于古典韵味的现代口语语气词(如"吧、呢、哦、呀、哈、嘛"等)。
- 严禁混入半角标点、特殊技术符号或英文乱码,确保字符纯净度。
- 对于较长的一段旁白,必须根据呼吸和戏剧性气口进行物理分句(每句严格限制在 15-30 字之内),并在句与句之间插入明确的时间延迟或停顿占位符,防止模型因连续输出超长文本而产生吐字含糊、语速变快或漏字、电音、机械变调等声学异常。
6. 動画編集
上美影风格剪辑与音画装配标准:
-
画面转场与镜头过渡规则(按子风格精细设计):
- 水墨动画风格(长距离淡入淡出):必须使用长距离且极其柔和的淡入淡出(Dissolve)或叠化过渡。镜头在交替时要有“水墨洇散、自然消融”的留白意境,避免任何生硬物理硬切。
- 剪纸动画风格(干净直接硬切):必须设计为干净、干脆的直接硬切(Hard Cut)。由于其平面层叠、皮影戏机械感,硬切更能突出其卡片式切换和清脆的动作节奏。
- 工笔重彩风格(硬切为主,叠化为辅):常规叙事和动作打斗镜头之间必须使用硬切(Hard Cut)以突出戏曲化的亮相定格节奏;场景转移或时空大跨度切换时,可使用柔和的中速叠化(Cross Dissolve)。
- 木偶动画风格(跳帧感硬切):采用具有定格动画独特顿挫感的硬切(Hard Cut),剪辑切点可带有个别帧的轻微“跳动感”,完美匹配木质玩偶的拙朴手工质感。
-
镜头拼接节奏:
- 起承转合:每一个镜头的剪辑切点,必须顺应角色的动作弧线。特别是在角色完成特定的“亮相”或“定格”手势后的 0.5 秒处进行切点剪辑,完美呼应戏曲的舞台节奏。
- 避免快速、无序的多镜头快剪。根据选定的子风格匹配上述对应的转场效果。
-
音画同步规则:
- 鼓点对齐:将动作的“亮相定格”瞬间与民乐(特别是锣鼓、板鼓等打击乐器的重音点)在时间线上严格对齐。
- 确保旁白(VO)与画面中相应意境的留白段落匹配,不能让密集的台词填满空灵的画面空间。