yeha.ai
一覧に戻る

Masaaki Yuasa-inspired animation

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

专为制作汤浅政明导演风格的迷幻、狂躁、童真动画短片设计。提供全套编剧与导演创作指导,支持从灵感闪现到分镜细化,全程使用 GPT Image 2 制作 16:9 的图像元素与 4:3 的四宫格场景参考图,并使用 Seedance 2.5 制作 480p 视频镜头。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

任务编排与协同逻辑:
🚨 视觉生成模型排他红线

  • 全程严禁混用、调用或自动降级至任何其他视觉生成模型。
  • 图像生成仅限 GPT Image 2(推荐分辨率 480p),视频生成**仅限 Seedance 2.5(默认分辨率 480p,时长 4s-30s)。
  1. 确立全局规格 (Global Spec):Planner 必须首先使用 text_editor 工具创建或更新 Final_Video_Spec.md,将画幅(aspect_ratio)锁定为 16:9,视频分辨率设定为 480p,输出语言(Output Language)允许用户在“日文 (Japanese)”或“中文 (Chinese)”之间进行自主选择(若用户未明确指定,默认锁定为“日文 (Japanese)”以达到最地道、最具表现力的汤浅风戏剧张力,避免不贴合口型的问题),并将视觉风格确立为 “汤浅政明风格表现主义动画(Masaaki Yuasa Style Expressionist Animation)”。
  2. 导演与编剧协同(灵感孵化与方案设计)
    • 当用户仅提供粗糙灵感或大纲时:Planner 必须发挥“导演兼编剧”的引导与创作能力。绝不直接套用模板或生硬进入分镜,而是以汤浅政明的“迷幻、狂躁、童真”美学为核心,先进行剧本共创
      • 概念拓展:优先套用或融合故事板设计中定义的 ‘梦境循环’模板 (Dream Loop)‘公路奔跑’模板 (Road Run) 经典叙事结构,为主角色、核心冲突、以及富有表现力的关键场景构思 2-3 个极具个性的汤浅式写意创意方案,大幅降低创作门槛。
      • 交互确认(Pause Checkpoint):将这些融入经典叙事模板的创意方案(含故事主线、所套用的模板结构、角色设定、奇幻视觉设计)呈现给用户进行选择和微调,确认后再行推进。
    • 当用户已提供完整剧本或指定构思时:严格遵循用户构思,直接进行下一步。
  3. 构建故事板:调用 storyboard_designer 规划故事板。
    • 必须将剧本创意转化为高度细节化的分镜蓝图(写明场景归属、具体的四宫格 Panel 视角、情绪驱动的夸张动作、运镜张力等)。
    • 镜头的时长必须在 4s - 30s(Seedance 2.5(分辨率 480p) 物理硬边界)之间,并根据叙事起伏进行长短镜头的动态时序规划(静谧流淌长镜头 vs 狂躁运动短镜头)。
    • 暂停确认点:生成故事板后,必须暂停向用户展示,获得确认方可进行后续资产生成。
  4. 准备或生成元素资产 (Key Elements Preparation)
    • 角色与场景图像资产(画幅比例硬性隔离规则与超分增强)
      • 图像生成画幅控制角色全身三视图必须使用 16:9 画面比例生成,场景四宫格参考图必须使用 4:3 画面比例生成。由于图像生成工具(TextToImage / ImageToImage)不支持 aspect_ratio 参数,必须通过提示词中的构图描述来强制控制画面比例(角色三视图写明"16:9 宽幅画面,全身三视图横向排列排版";场景四宫格写明"4:3 画幅,2×2 四宫格排版"),严禁套用或继承视频全局的画面比例用于场景图
      • 优先使用并适配用户素材:优先检测用户是否已提供核心角色的**正面、侧面、背面的全身三视图(而非半身像)**或场景参考图。若已提供且风格契合,通过 media_generator 直接注册绑定。若规格不完整(如仅有单一视角或为半身像)或画风不符(如写实风格),则自动判定为不符,必须调用 media_generator 的 ImageToImage 能力(模型 GPT Image 2,分辨率 2K),以原图身份特征为参考,在提示词中写明画面比例描述来控制画幅,重新重绘为符合汤浅风格的全身三视图及无人物多角度四宫格场景图,并注册绑定新资产。
      • 系统补充生成(需单步确认):若用户未提供任何图像,在暂停获得用户确认后,调用 media_generator 的 TextToImage,指定模型 GPT Image 2(分辨率 2K),在提示词中写明画面比例描述来控制画幅,补充生成符合汤浅风格的 key_element 图像。
      • 图像高级超分增强 (Jimeng SR,可选):所有角色全身三视图 (16:9) 与场景四宫格 (4:3) 图像资产生成或重绘完成后,必须暂停并向用户完整展示全部已生成的图像,并以如下措辞发起确认询问:"以上图像资产已全部就绪。您是否需要对它们进行 4K 超分增强?超分可凝练手绘杂乱线条、蜡笔炭笔颗粒及剪纸拼贴边缘的细节质感,使手工肌理更加饱满立体。如无需要,可直接跳过进入下一步。" 若用户确认,则通过 media_generator 调用 super_resolution(模型 Jimeng SR,分辨率 4K,scale 参数 50)进行重建。若用户跳过,则直接使用当前图像资产继续后续流程。
    • 角色音色资产 (key_element_audio):对于有对白的角色,检查并绑定专属 key_element_audio(音色参考资产),确保前后音色一致。
    • 元素资产完备性与绑定检查(核心拦截红线):图像与音色元素准备结束后,Planner 必须逐一检查故事板中规划的所有 key_element,确保每一个都已绑定 asset_id。严禁在任何元素资产有遗漏、未生成或未绑定的状态下直接进入下一步(镜头视频生成)。若发现遗漏,必须提示用户并补齐全部元素资产。
  5. 镜头视频生成 (Shots Video)(需逐镜确认)
    • 生成前置对比核对(提示词与参考完整性):在每一个镜头生成前,Planner 必须将拟用的提示词、参考资源与故事板分镜脚本进行深度对比核对,重点检查:
      • 视觉参考核对:检查是否漏掉了该镜头涉及的任何角色、场景参考图像。必须确保每一个分镜镜头都显式绑定了其对应的场景四宫格参考图,并锚定具体的 Panel 视角,杜绝背景跳画与严重漂移。
      • 台词对白核对:检查提示词中是否完整、准确地包含了故事板规划的台词文本、发言角色及专属音色(key_element_audio)。
      • 发现遗漏必须先进行纠正与补齐。
    • 核对后暂停确认:核对无误后,必须暂停向用户展示本镜头的提示词、关联的参考图像、台词脚本等。获得用户明确确认后,方可调用 media_generator 的 MultiModalToVideo 能力(模型 Seedance 2.5,分辨率为 480p)。
    • 链式视频参考(按需使用,非强制每镜):生成连续场景中的 Shot N ($N \ge 2$) 时,仅当前后两个镜头之间存在极强的连续性需求(如角色身体动作在两镜间无缝衔接、同一机位的时间流逝、场景形变过渡)时,才将前一镜头的 final_shot 视频作为 reference_video 传入。对于机位切换、情绪跳切、场景转换等镜头,不应传入前镜视频,避免模型对前镜画面产生过度模仿,导致新镜头与前镜高度相似。当确实传入 reference_video 时,必须在提示词中显式注明本镜头与前镜的核心差异点(如新的机位视角、新的角色动作阶段、不同的情绪节拍),明确引导模型在继承衔接状态的同时生成具有充分视觉新鲜感的镜头内容。
  6. 镜头高级超分与插帧 (Post-processing Enhancement,可选)
    • 所有镜头视频生成完毕后,必须暂停并向用户完整展示全部已生成的视频镜头,并以如下措辞发起确认询问:"全部镜头已生成完毕。您是否需要对视频进行 480p 超分与高帧率插帧增强(会员专属)?超分可将画质从 480p 提升至 1080p,帧插补可将帧率提升至 60fps(或 30fps),让高速群舞与阻尼滑行的动态更为丝滑流畅、无卡顿。如无需要,可直接跳过进入下一步。" 若用户确认,则调用 media_generatorsuper_resolution(模型 MediaKit,分辨率 1080p,fps 6030)进行增强。若用户跳过,则保持 480p 原始视频直接进入下一步。
  7. 音频与歌舞歌曲制作(需确认)
    • 所有音频层规划就绪后,必须暂停并向用户完整展示音频规划方案(包括 BGM 风格描述、高潮歌舞歌词草稿、旁白脚本及配音音色设定),并以如下措辞发起确认询问:"以上音频规划已全部就绪。其中包含:① 怪诞迷幻背景音乐(BGM);② 高潮歌舞段落原创歌曲(含歌词与演唱风格);③ 角色配音(已绑定专属音色)。请确认以上规划是否符合您的预期,或告知需要调整的部分。确认后将正式开始音频生成。" 获得用户明确确认后,方可使用 media_generator 依次制作各独立音频层。对高潮歌舞段落,使用 lyrics_to_song 工具(模型 Suno 5)将确认后的歌词生成为完整原创歌曲。对白配音在生成时必须通过绑定的 key_element_audio 锁定角色声线,保持音色一致性。
  8. 视频装配与渲染:调用 video_assembler 将最终确认的镜头(480p 原始视频,或用户已确认超分后的 1080p 高帧率版本)与所有的音频轨(BGM、配音、生成的歌舞歌曲等)进行高强度的快速剪辑蒙太奇装配,确保音画同步并凸显汤浅风的爆发力,引导用户最终导出。

依赖关系:2 -> 1; 3 -> 2; 4 -> 3; 5 -> 4; 6 -> 5; 7 -> 3,4; 8 -> 6,7.

2. マルチモーダル分析

参考素材的多模态分析规范:

  1. 线条与手工质感提取:当用户上传手绘草图、蜡笔涂鸦、水彩画、剪纸拼贴或参考插画时,工具必须敏锐识别其不规则线条、抖动质感、粗细不均的手工特征、纸张纹理(如水彩纸、斑驳剪纸等拼贴接缝与边缘特征),将其提炼为可在故事板及提示词中复用的结构化特征描述(例如:极简手绘线条、毛刺炭笔、蜡笔涂抹微粒、水彩纸颗粒、拼贴色块叠层与剪切拼缝)。
  2. 表情与动态表现力分析:对于输入的人像或角色,分析其面部特征与表情潜力,输出在不同情绪状态下的面部夸张表现方案(如圆睁的大眼睛、夸张的大笑嘴等童真滑稽的表情变化),以便在 storyboard_designer 中进行表情与动作节奏设计。角色四肢与身体比例保持正常,不进行肢体形变分析。
  3. 色彩与空间畸变分析:若输入参考图包含平面色块或透视畸变,分析其主导色调(2-3 个平面主色的分布关系)及空间透视特征(从轻微变形到极端畸变的程度谱系),确保下游角色设计及场景图生成能精准承接该视觉张力。
  4. 风格与规格适配性判定及重构分析:对用户提供的人物三视图或场景参考图进行完整度、规格与风格契合度判定。必须严格校验角色图是否为完整的全身三视图(正面全身、侧面全身、背面全身,不能为半身像或单一视角)。若角色图不属于完整的全身三视图,或风格偏离汤浅风格(如过于写实、工整、工业化线条),需深入解析并提取原图中的关键身份特征(如发型、标志性衣着、场景几何主体),并输出结构化的转换描述,作为下游 ImageToImage 重绘与重构的参考,确保在风格"汤浅化"(转化为不规则手绘风格)及重构成完整全身三视图的同时保持角色与场景主体的一致性。
  5. 场景参考图多角度与无人物校验:识别用户提供的场景参考图是否为“多角度、无人物、四宫格(4-grid)”结构。如果不是,必须详细分析用户场景图中的地标、透视、氛围等核心视觉元素,并提炼为下游重构场景图所需的结构化提示,明确告知生成器按“四宫格标准分配(全景定场/陈设特写/纵深透视/气氛光效)”进行多角度无人物重构设计。
3. 絵コンテ設計

汤浅政明风格故事板设计规范(编剧与导演创作蓝图):

  1. 导演思维:非自然运动与视角畸变设计

    • 场景现实锚点 (Real-Life Grounding):场景必须锚定在可辨识的现实生活空间——街道、车站、教室、居酒屋、出租屋、海边小镇、商店街等。汤浅风格的本质不是"每一帧都是荧光霓虹梦境",而是"现实生活空间在角色情绪推动下逐步失控"。普通段落应呈现可辨认的、有生活气息的日常场景;空间变形仅在情绪升级时才逐步显现。建筑可以像纸片或橡皮一样弯曲,透视可以歪斜,但场景的现实根基不能丢失。背景线条应带有手绘抖动感,可融入拼贴质感、照片颗粒、粗糙色块与水洗色彩——不局限于霓虹高饱和,日常段落可使用更柔和、洗练的水洗色调。
    • 镜头与视角(渐进式畸变规则):畸变程度必须跟随情绪强度逐级递进,而非每镜一律极端:
      • 普通段落(沉静、日常、铺垫):使用轻微变形——略带倾斜的地平线、轻微夸张的比例、自然透视即可,保持画面可读性与叙事呼吸感。
      • 情绪升高段落(冲突升级、节奏加快):逐步加重鱼眼畸变与画面倾斜度,建筑比例开始明显失调,地平线扭曲加剧。
      • 高潮段落(爆发、狂喜、梦境坍塌):才使用极端鱼眼畸变、极度倾斜地平线、摇摇欲坠的非对称建筑比例与不规则几何结构,极致释放空间压迫感与超现实张力。
        避免任何平庸、死板、工整、对称的传统透视与构图——但畸变强度始终由情绪驱动,由低到高自然攀升。
    • 动作表现力(Expression & Energy,非肢体形变)角色四肢与身体比例始终保持正常——不进行橡胶管式拉伸、无限肢体延长、身体液化或碎裂。汤浅风格的动作张力来自以下要素的组合:① 面部表情生动夸张(丰富的卡通式表情变化——圆睁的大眼睛、夸张的大笑嘴、生动的微表情,充满童真与荒诞);② 动作速度与节奏的弹性对比(极速爆发→骤停→滞空);③ 空间与环境的扭曲变形(建筑弯曲、透视畸变、色彩突变);④ 运镜的侵入性与律动感(俯冲、螺旋旋转、贴身追踪);⑤ 手工质感的狂躁闪烁(线稿抖动、笔触交替)。夸张但不恐怖,怪诞但充满游戏感。
    • 平面与立体切换:场景在特定的情绪高潮点可以从具有深度纵深的场景突然变为完全扁平的2D手绘插画,通过视觉形态的突变来强化情绪张力。
    • 狂热群舞(Energetic Group Dance):歌舞场景中,群舞角色保持正常的四肢与身体比例,通过高度同步、充满爆发力的编舞释放狂热能量。群舞的视觉张力来自:多角色动作的整齐与错位交替、极速加减速的节奏对比、运镜的高速穿梭与旋转、色彩与手绘质感的高频闪烁(Line-art flashing)。在情绪最高潮的瞬间,画面可整体切换为2D扁平手绘风格或让环境色彩爆裂飞溅,但角色身体本身不液化、不碎裂、不拉伸。镜头调度(Camera Directives)必须极具侵入性与律动,强行撕裂传统的静态空间距离:
      • 主观穿梭运镜 (POV fly-through):镜头快速俯冲,直接穿透角色编舞阵型形成的视觉通道与几何空隙。
      • 螺旋旋转升降 (Helical Spinning Pan):镜头紧贴舞群,伴随高速 360 度垂直或水平旋转螺旋上升/下降,将狂躁舞蹈的动力离心力最大化释放。
      • 动作动力贴身追踪 (Dynamic Action Tracking):摄像机贴死在某一角色的快速运动轨迹或面部表情残影上,随其在画面中极速、突兀地进行往复位移。
  2. 编剧思维:动态节奏与情绪爆发结构

    • 时序与节奏动态规划:镜头时长必须根据剧情和情绪进行动态调整。分镜时长严格限制在 4s - 30s(Seedance 2.5(分辨率 480p) 限制)。
      • 安静/流淌段落:规划 8s - 30s 的长镜头,让角色动作以流畅写意的方式缓慢游弋,展现梦境与迷幻感。
      • 狂躁/爆发段落:规划 4s - 6s 的高频动作镜头,镜头内设计爆发性的折线或弹射运动、瞬间加减速以及环境色彩的剧烈突变。
    • 情感极致外放:对白、旁白以及动作设计要极致外显(狂喜、暴怒、大哭),避免含蓄内敛。
    • 核心视觉母题贯穿(叙事连贯红线):全片必须确立 1-2 个核心视觉母题(如一个反复出现的物件、形状、色彩符号或动作姿态),并在分镜中持续变奏贯穿。所有超现实变化——场景形变、空间坍塌、色彩爆发——必须由前一镜中已有的动作、物件或视觉元素自然变形演化而来。严禁突然切到与前镜无任何视觉或叙事关联的超现实意象——禁止无理由地突然出现无关的鱼、怪物、宇宙、黑洞或爆炸色块。每一次怪诞变形都必须来自角色当下的情绪、动作或一个前面已经出现过的物件,应是"前一个画面的自然延伸被拉伸到荒诞程度"的结果,而非凭空插入。
  3. 经典叙事结构模板(汤浅式编剧结构):当用户仅提供零散灵感或粗糙构想时,优先套用以下经典结构引导剧本与镜头规划:

    • ‘梦境循环’模板 (Dream Loop Template):适用于意识流、自我觉醒、无限循环的迷幻主题。
      • 结构起伏与视觉暗示:童真梦境(8s-30s写意长镜头,2-3 个柔和平面主色,镜头首尾两端出现核心视觉母题的微妙变形呼应,作为宿命闭环的视觉暗示) → 线条液化与形变(8s-12s,场景空间开始歪斜蠕动、建筑弯曲变形,由前一镜的某个动作或物件自然变形引出) → 意识狂飙与碎裂(4s-6s高频动作镜头,空间折叠,爆发性变焦,色调在此处升级为高饱和撞色) → 宿命闭环(返回首镜):色调在高饱和撞色中爆发,并必须伴随由前镜动作自然演化的极端视觉异变
        • 角色面部滑稽夸张表情:五官生动的卡通式夸张变化——眼睛圆睁发亮、嘴巴大大张开的滑稽笑脸或惊讶的O形——表情充满童真与荒诞的生命力,而非恐怖感。
        • 空间几何颠覆性折叠重组:重力如弹簧般失效又恢复,三维楼宇和场景物体如纸牌般翻转折叠,透视网格线弯曲纠缠后重新拼合成新的滑稽几何,空间最终从四角向中心螺旋溶解成流淌的手绘颜料滴,以最震撼的音画与结构坍塌宣告梦境循环的彻底觉醒。
    • ‘公路奔跑’模板 (Road Run Template):适用于展现主角追求自由、冲破束缚、情感宣泄的超高速度高潮段落。
      • 结构起伏:极致压抑(4s-6s极低角度仰拍,特写紧咬的牙关或流汗的面部,色调以 2-3 个低饱和平面主色为主) → 弹射起步(4s-6s,采用强有力的动作加速与减速时序控制,展现极具弹性的动态律动:在第1-2s角色如紧绷弹簧般在极速挣扎中蓄力屈身,并在第3s瞬间松开产生爆炸性的弹射加速向前飙进,随后在第4-6s伴随一个突兀的阻尼减速滑行,留下动态残影,展现汤浅式"起跑冲刺-骤停滑行"的怪诞弹性) → 狂飙突破(4s-6s,连续多镜头 N≥2 强绑定 reference_video 链式递进,建筑物随主角奔跑而扭曲融化重组,色调在此高潮段落升级为高饱和撞色,且每镜内部必须贯彻'极速爆发1-2s -> 空中慢镜滞空2s -> 落地再次瞬间加力弹射1-2s'的交替时序律动,彻底避免匀速、死板的奔跑动作) → 终点升华(8s-30s写意慢动作镜头,画面瞬间扁平化为完全平面的2D手绘涂鸦风格,或环境色彩如颜料般爆裂飞溅,情感与怪诞BGM在这一刻完美爆发重合)。
  4. 故事板三部分实体构建规范:

    • elements(核心元素设计)
      • element character(角色元素):必须定义角色的外形特征(发型、服饰色彩、独特面部)、面部表情在不同情绪下的夸张变化方案,以及绑定的音色描述。其中,角色的服饰色彩须与所在场景的 2-3 个平面主色保持可辨识的对比关系(不必强制互补撞色,只要角色在背景中清晰可辨即可)。服装须以日常生活服饰为主——校服、宽松外套、旧运动鞋、雨衣、睡衣、运动衫、皱巴巴衬衫、围巾、普通背包等;避免机能战斗服、赛博装甲、潮酷偶像服、过度精修的二次元人设服饰。汤浅风格的角色魅力来自平凡日常与荒诞表现力的反差,而非华丽服装本身。对包含对白的角色,必须留有 key_element_audio 槽位,并写明“极具戏剧张力和夸张起伏的配音特质”。
      • element scene(写意场景元素):场景必须锚定在可辨识的现实生活空间(街道、车站、教室、居酒屋、出租屋、海边小镇、商店街等),透视可以歪斜、建筑可以像纸片或橡皮一样弯曲,但现实根基不能丢失。必须设计为多角度、无人物、高信息密度的四宫格(4-grid)场景参考图,每场使用 2-3 个平面主色构建色域基底(高饱和撞色仅保留给高潮段落使用;日常段落可使用更柔和的水洗色调)。背景线条应有手绘抖动感,可融入拼贴质感、照片颗粒与粗糙色块。四格内容强制固定为标准分配:Panel 1 — 全景定场Panel 2 — 陈设特写Panel 3 — 纵深透视Panel 4 — 气氛光效
    • shots(镜头规划)
      • 每一个分镜镜头(shot)必须明确声明所属的场景ID:“场景归属 (Scene Association): [Element_Scene_ID]”
      • 每一个分镜镜头必须强行指定它锚定场景四宫格中的哪一个特定子格(Panel 1 / 2 / 3 / 4),以独立标注字段的形式写明,格式为:"场景子格锚点 (Panel Lock): Panel [编号] — [子格名称,如:全景定场 / 陈设特写 / 纵深透视 / 气氛光效]",严禁省略、模糊描述或让模型随机发挥。
      • Panel 跨镜一致性规划:在规划相邻镜头时,必须主动审查 Panel 分配的合理性——切换类镜头应优先选用与前镜不同的 Panel,确保背景视角的视觉新鲜感;续接类镜头若刻意保持同一 Panel,必须在镜头描述中显式注明"同 Panel 续接"意图,使下游生成器能明确区分"刻意相同"与"意外跳画"。严禁在未作说明的情况下,对相邻切换类镜头分配同一 Panel
      • 包含角色出场的镜头,必须列出其引用的 element character ID。

    📋 标准分镜描述模板(切换类 vs 续接类)
    所有 shot 描述必须严格套用以下对应模板,不得省略任何字段:
    【切换类镜头模板】(适用于机位切换 / 情绪跳切 / 场景转换)
    镜头类型:切换类
    时长:[Xs]
    场景归属 (Scene Association):[Element_Scene_ID]
    场景子格锚点 (Panel Lock):Panel [编号] — [子格名称,如:纵深透视]
    (与前镜 Panel [前镜编号] 完全不同,确保视角新鲜感)
    出场角色:[Element_Character_ID, ...](无则填"无")
    情绪基调:[新情绪节拍,如:极度狂热 / 沉寂压抑]
    主色调配置:[2-3 个平面主色;高潮段落可升级为高饱和撞色](切换类应与前镜色调有区分)
    故事节拍 (Story Beats):
    [详细描述动作与台词,含肢体变形方案、情绪语气标签、对白文本]
    台词(如有):{[情绪语气标签] 对白内容}
    运镜 (Cinematography):
    [镜头规模 + 摄像机角度 + 运动轨迹,如:极低角度仰拍鱼眼广角,镜头急速俯冲并旋转 45°]

    【续接类镜头模板】(适用于动作无缝衔接 / 同机位时间流逝 / 场景形变过渡)
    镜头类型:续接类
    时长:[Xs]
    场景归属 (Scene Association):[Element_Scene_ID]
    场景子格锚点 (Panel Lock):Panel [编号] — [子格名称]
    (同 Panel 续接 / 或与前镜 Panel [前镜编号] 不同,原因:[说明])
    出场角色:[Element_Character_ID, ...]
    情绪基调:[继承自前镜的情绪 + 本镜演进方向]
    主色调配置:[2-3 个平面主色;高潮段落可升级为高饱和撞色]
    继承状态 (Inherited State):
    [明确描述从前镜继承的具体视觉/动作状态,如:角色仍处于弹射蓄力屈身阶段,同一鱼眼机位]
    演进阶段 (Evolving Into):
    [明确描述本镜相较前镜的新演进内容,如:蓄力瞬间释放,极速弹射冲出,残影遍布画面]
    台词(如有):{[情绪语气标签] 对白内容}
    运镜 (Cinematography):
    [运镜轨迹,须标注与前镜的继承关系或演进差异]

    📌 填写范例(切换类)
    镜头类型:切换类
    时长:5s
    场景归属 (Scene Association):Element_Scene_SubwayStation
    场景子格锚点 (Panel Lock):Panel 3 — 纵深透视
    (与前镜 Panel 1 完全不同,确保视角新鲜感)
    出场角色:Element_Character_Hana
    情绪基调:极度狂热(与前镜"沉寂压抑"完全反转)
    主色调配置:荧光粉红与荧光绿高饱和撞色(高潮段落升级,与前镜低饱和色调形成反差)
    故事节拍 (Story Beats):
    Hana 双腿猛然发力弹射,以极速向纵深隧道狂奔,面部表情生动夸张、充满狂热与兴奋,留下层叠动态残影;背景隧道灯柱随其奔跑节奏瞬间扭曲融化成粉红色流体并向两侧飞溅重组。
    台词(如有):{[极度狂热大喊] 我不管了——!}
    运镜 (Cinematography):
    极低角度仰拍鱼眼广角(Panel 3 纵深透视视角),镜头以极速俯冲方式沿隧道纵深轴急速推进,同时伴随顺时针倾斜旋转 30°,将空间压迫感与奔跑动势最大化释放。

    📌 填写范例(续接类)
    镜头类型:续接类
    时长:8s
    场景归属 (Scene Association):Element_Scene_SubwayStation
    场景子格锚点 (Panel Lock):Panel 3 — 纵深透视
    (同 Panel 续接,原因:继承前镜奔跑纵深轴,动作无缝衔接)
    出场角色:Element_Character_Hana
    情绪基调:继承狂热奔跑 → 本镜演进为短暂失重滞空的迷幻张力
    主色调配置:荧光粉红与荧光绿高饱和撞色(与前镜一致,刻意延续高潮色调连贯性)
    继承状态 (Inherited State):
    延续前镜的极低角度仰拍鱼眼机位,Hana 仍处于极速狂奔状态,双腿动态残影横贯画面纵深。
    演进阶段 (Evolving Into):
    Hana 在第 2s 时双脚突然腾空,身体在空中以极慢速滞空飘浮,表情从狂热兴奋转为惊喜与恐惧并存的瞪大眼状态;随后在第 5s 重力骤然恢复,以爆炸性速度坠地并弹起,在落点留下蜡笔颜料飞溅的圆形印记,随后立刻弹射加速冲出画面。
    台词(如有):{[颤抖、既惊又喜] 我……飞起来了?!}
    运镜 (Cinematography):
    继承前镜极低角度仰拍鱼眼机位,演进差异:在 Hana 滞空阶段镜头转为超慢速上推凝视,将飘浮的 Hana 充满画面;坠地瞬间骤然切回俯冲加速。

    • 动作描述(story beats)必须详细说明角色的动作速度与弹性节奏(如"极速蓄力屈身后瞬间弹射冲出,留下层叠残影")、面部表情变化、以及相机的运镜轨迹。

    • 包含台词对白的镜头,文本中必须嵌入明确的情绪语气标签,并对拉伸的长音进行拼写延长。语气标签与长音写法按输出语言分两套规范:

      中文对白语气标签规范:

      • 情绪语气标签格式:[极度狂热大喊]、[颤抖、抽泣]、[低沉神经质自语]、[惊喜与恐惧并存]
      • 长音拼写延长示例:{快跑——啊啊啊!}、{我不管了——!}、{你骗——人——!}

      日文对白语气标签规范:

      • 情绪语气标签格式:[絶叫]、[震え、狂喜]、[低くぶつぶつと自語]、[息を切らす、狂ったような笑い]、[声が裂ける、絶望的な叫び]、[神経質にぼそぼそ]
      • 长音与感叹词拼写延长示例:{やめてーーー!}、{うそだろーーーっ!}、{走れーーっ、はやくーーー!}、{うわあああっ!}
      • 标签必须使用日语描述(禁止中日混写),并随原文一同传入下游 TTS,确保 TTS 引擎逐一识别并在对应位置做出音调跳变、长音拉伸与破音处理。
    • audio_layers(音频层设计)

      • BGM(背景音乐):设计充满变奏、不协和和弦、神经质电子或古怪乐器的实验性音乐轨。
      • Song / Musical Climax(歌舞高潮歌曲轨):专为经典汤浅式狂热歌舞高潮设计。在此音频层中直接编写充满童真、怪诞、极具诗意或意识流的歌词,并规定其曲风特征(如不规则节拍的民谣、迷幻摇滚、前卫合成器流行等),以配合分镜中角色的夸张表情动作与狂热群舞。
      • Narration(旁白/VO):剧本要像“意识流散文”一样,长短句交错,充满戏剧性停顿,避免大段平铺直叙的念白。
      • SFX(音效):对画面爆发点(弹射、爆裂、色彩飞溅、滑稽表情变化)规划极具弹性、质感独特的音效。对滑稽表情变化或弹射场景,指定使用高弹性的橡胶摩擦与空气爆破音效(如弹性蓄力释放的撕扯声、滑稽的空气弹跳爆破声)。
4. 素材生成

汤浅风格图像与视频生成策略:
🚨 视觉模型硬性排他约束(最高优先级红线)

  • 图像生成:所有涉及图像生成的任务(包括 key_element 补充生成、ImageToImage 风格重绘、角色全身三视图和场景四宫格生成等)必须全程且仅限使用 GPT Image 2 模型(分辨率统一为 2K)。严禁切换至 Seedream 4.5、Nano Banana 等任何其他图像模型。
  • 视频生成:所有分镜镜头(shots)的生成任务必须全程且仅限使用 Seedance 2.5 模型(分辨率统一为 480p,时长控制在 4s-30s 之间)。严禁切换至 Kling、Vidu、Google Veo 等任何其他视频模型。
  1. 元素资产生成与注册 (Key Elements & References)

    • 画幅比例硬性隔离规则(防止图像拉伸变形):图像生成工具(TextToImage / ImageToImage)不支持 aspect_ratio 参数,画面比例必须通过提示词中的构图描述来强制控制:
      • 角色全身三视图:无论是 ImageToImage 重绘还是 TextToImage 补充生成,提示词中必须显式写明"16:9 宽幅画面,全身三视图横向排列排版(16:9 aspect ratio, full-body 3-view turnaround laid out horizontally)"。严禁套用或继承视频全局选择的画面比例。
      • 场景四宫格参考图:无论是 ImageToImage 重绘还是 TextToImage 补充生成,提示词中必须显式写明"4:3 画幅,2×2 四宫格排版(4:3 aspect ratio, 2×2 grid layout)"。4:3 是展现多角度无人物四宫格场景参考图的最佳画幅,严禁套用或继承视频全局选择的画面比例,彻底避免因比例拉伸导致拼贴排版错乱。
    • 用户素材校验、重塑与绑定:首先检测并核对用户是否提供了角色全身三视图(character turnarounds,必须包含正面、侧面、背面的全身人设而非半身像)或场景参考图。
      • 若已提供且规格契合:直接通过 media_generator 注册为 asset_id 并绑定到对应的 key_element 上,无需重复生成。(注意:角色图需为完整的全身三视图;场景参考图必须是无人物、多角度、标准分配的四宫格场景参考图。若是普通的、包含人物或单一角度场景图,或者角色图不包含全身三视图,即使风格契合,也应判定为规格不符,进入下方的重绘/重构路径)。
      • 若已提供但规格或风格不符:绝对不能直接绑定。必须调用 ImageToImage(指定模型为 GPT Image 2,分辨率设定为 2K),将用户原图作为基础参考,配合汤浅政明风格提示词(粗糙手绘笔触、不规则涂鸦线条、蜡笔涂鸦、斑驳手工剪纸拼贴及水彩纸纹理、写意透视等)重绘:
        • 角色重绘:将用户提供的非三视图角色图,重新重塑为符合影片风格的人物全身三视图(正面全身、侧面全身、背面全身,绝不可生成半身像,展现不规则线条与弹性形体)。提示词中必须显式写明"16:9 宽幅画面,全身三视图横向排列排版(16:9 aspect ratio, full-body 3-view turnaround laid out horizontally)"来控制画面比例
        • 场景重绘:以用户原始场景为底,重构成多角度、无人物、高信息密度的四宫格场景参考图,融入 2-3 个平面主色构建的色域(高饱和撞色仅用于高潮段落)。四格内容强制遵循标准分配:1. 全景定场(Establishing Shot),2. 陈设特写(Prop/Decor Close-up),3. 纵深透视(Depth Perspective),4. 气氛光效(Lighting & Atmosphere)提示词中必须显式写明"4:3 画幅,2×2 四宫格排版(4:3 aspect ratio, 2×2 grid layout)"来控制画面比例
    • 系统完全补充生成:若用户未提供任何参考素材,才调用 TextToImage 工具补充生成。指定模型为 GPT Image 2,分辨率统一设定为 2K
    • 角色三视图/概念图生成:在生成角色 key_element 时,提示词需包含手绘粗糙线条、不规则涂鸦风格、融入质感粗糙的水彩纸纹理与带有剪裁痕迹的手工剪纸拼贴元素,且发色或服饰色彩须与对应场景的 2-3 个平面主色保持可辨识的对比关系,并指示单张图像内必须展示角色的标准全身三视图(正面全身、侧面全身、背面全身,不可只展示半身),以确保角色具备极高的视觉辨识度。提示词中必须显式写明"16:9 宽幅画面,全身三视图横向排列排版(16:9 aspect ratio, full-body 3-view turnaround laid out horizontally)"来控制画面比例
    • 场景概念图生成:场景必须锚定在可辨识的现实生活空间(街道、车站、教室、居酒屋、出租屋、海边小镇、商店街等)——不要把所有场景都做成荧光霓虹梦境,普通段落应更生活化,情绪爆发时再让空间明显变形。建筑可以像纸片或橡皮一样弯曲,透视可以歪斜,但现实根基不能丢失。提示词需强调歪斜倾斜、比例失调的非对称夸张建筑比例与斜角构图(畸变程度根据该场景在剧情中的情绪定位决定:日常场景轻微变形,高潮场景极端畸变),融入拼贴剪纸缝隙、照片颗粒及重度蜡笔质感,铺满粗糙水彩纸颗粒底纹,每场使用 2-3 个平面主色构建色域(高饱和撞色仅用于高潮段落;日常段落可使用更柔和的水洗色调),且必须是无人物、多角度的标准分配四宫格场景参考图(1. 全景定场,2. 陈设特写,3. 纵深透视,4. 气氛光效)。提示词中必须显式写明"4:3 画幅,2×2 四宫格排版(4:3 aspect ratio, 2×2 grid layout)"来控制画面比例
    • 图像高级超分 (Jimeng SR,可选):无论是完全补充生成还是风格重绘的角色三视图(16:9)与多角度场景图(4:3),在确定资产并绑定后,必须向用户展示已生成的图像,并询问是否需要进行超分增强。若用户确认,则调用 super_resolution 功能(模型 Jimeng SR),指定重建分辨率为 4k,细节生成等级 scale 参数设为 50。这有利于把 GPT Image 2 输出的手绘潦草线条与纸张杂点、蜡笔涂鸦颗粒、水彩纸颗粒及拼贴接缝细节进行边缘凝聚与细节补足,增强原始纸绘与拼贴画的粗粝感和爆发力。若用户跳过,则直接使用原始资产继续。
    • 角色音色注册 (key_element_audio):若角色具有台词:
      • 若用户提供了该角色的声音采样(声线样本),通过 media_generator 注册为 asset_id 并绑定为该 element character 的 key_element_audio。
      • 若用户未提供,调用 generate_audio_resource 生成一段符合故事板音色设定的干净人声短样本,将其注册并绑定为该角色的 key_element_audio。在生成参数中,必须显式要求极强的情感表现力、夸张的性格特征与戏剧冲突度(如“充满疯狂戏剧张力、情绪大起大落的手绘动画风配音”),从源头卡死任何平淡、机械、生硬的 AI 通用音色。
  2. 镜头视频生成 (Shot Video Generation)

    • 分镜脚本双向对比校验(逐字段结构化核查):在发起 MultiModalToVideo 生成之前,必须将已起草的提示词与该镜头的故事板分镜脚本进行逐字段对比核查,不得仅做整体印象判断。核查清单如下,每项均须明确"已覆盖 / 缺失待补":
      • 镜头类型开头声明:提示词首行是否有 Full cut / Continuing from 声明,且与故事板镜头类型一致;
      • Panel Lock 防错锁定语:提示词中是否写明了与故事板"场景子格锚点"完全一致的 Panel 编号与四宫格防漂移声明;
      • 角色参考完整性:故事板"出场角色"字段中列出的每个角色 ID,是否均有对应的 <<<image_X>>> 图像绑定,无一遗漏;
      • 场景参考绑定:场景四宫格图像资产是否已显式绑定,严禁仅绑定角色而遗漏场景图;
      • Story Beats 覆盖:提示词中的动作描述是否完整承接了故事板 Story Beats 的每个阶段(含肢体变形方案、弹性时序关键节点);
      • 台词与语气标签:故事板中的每条台词是否以 {[语气标签] 对白内容} 格式完整出现,语气标签不得简化或删除;
      • 运镜轨迹:提示词中的运镜描述是否与故事板"运镜 (Cinematography)"字段完全对应,不得用泛化描述代替;
      • 主色调配置:提示词末段是否声明了与故事板一致的色调配置(2-3 平面主色或高潮撞色)。
      • 发现任何字段缺失,必须补写完整后方可提交生成,严禁跳过或留白。
    • 调用 MultiModalToVideo 工具,指定使用 Seedance 2.5,默认分辨率为 480p,时长严格控制在 4s - 30s 范围内。
    • 视觉与音频参考绑定规则 (跨镜头一致性核心)
      • 视觉参考与子格视角锁定(场景参考强绑定红线):每一个生成的镜头(shot)必须精准、同时绑定该镜头涉及的角色和其在故事板中归属场景(element scene)的 asset_id(优先使用用户提供的三视图/场景图注册的 asset_id;无用户素材时使用系统通过 GPT Image 2 生成的资产)。严禁出现仅绑定角色、遗漏场景四宫格图像资产绑定的情况。同时,必须在发起生成时,强制读取并对齐故事板中该分镜指定的场景四宫格具体子格视角(Panel),确保生成视频时背景与镜头机位完全锚定在特定的单一子图视角上,杜绝因四宫格存在多角度而在不同镜头间发生随机视角跳画。
      • 链式视频参考(按需使用,非强制每镜):在生成连续场景中的 Shot N ($N \ge 2$) 时,仅当前后两镜存在极强的连续性需求(如动作无缝衔接、同机位时间流逝、场景形变过渡)时,才将前一镜头的 final_shot 作为 reference_video 传入,并在提示词中显式注明本镜头与前镜的核心差异点(新机位、新动作阶段、新情绪节拍),引导模型在继承衔接状态的同时生成具有充分视觉新鲜感的内容。对于机位切换、情绪跳切、场景转换等镜头,不传入前镜视频,避免模型过度模仿前镜画面导致新镜头与前镜高度相似。
      • 口型与音色对齐 (音色一致性):若当前镜头内角色有 dialogue 对白,必须在 MultiModalToVideo 的 audio_infos 参数中,传入该角色绑定的 key_element_audio。Seedance 2.5(分辨率 480p) 将据此生成具有正确嘴形同步(lip-sync)且音色与参考完全咬合的镜头视频。
    • 镜头视频超分与插帧 (MediaKit,可选):镜头生成完成后,必须向用户展示生成的视频,并询问是否需要进行超分与插帧增强。若用户确认,则调用 super_resolution 功能(模型 MediaKit),指定输出分辨率为 1080p(会员专属高画质),并将 fps 参数强制设为 60(或 30),进行 AI 帧插补处理,将高动态形变的液态流畅度提升到院线级动态感。若用户跳过,则保持 480p 原始视频继续。
  3. 音频与高潮歌曲生成

    • 歌舞高潮歌曲生成 (Lyrics-to-Song):对于故事板中规划的歌舞高潮段落,调用 lyrics_to_song 工具,指定使用 Suno 5 模型,将故事板中编写的怪诞歌词转化为完整的原创歌唱歌曲(包含人声和伴奏)。在生成提示词中必须写明汤浅风不规则节奏、疯狂高亢或童真写意的手绘动画风演唱风格。严禁提示词中包含任何知名音乐艺术家的姓名(Suno 5 敏感词红线),避免生成失败。
    • 背景音乐生成 (Text-to-Instrumental):调用 text_to_instrumental (支持 Suno 5) 生成充满变奏、古怪节奏和迷幻电子风格的纯音乐音轨。
    • 独立配音一致性与情感爆发保障:若需生成独立的配音轨道(VO),调用 text to narration (指定 MiniMax Speech 2.8 HD 或 ElevenLabs v3) 时,必须强制加载该角色 key_element 绑定的 key_element_audio 作为音色克隆/声音参考源
      • 极速演播与情感度卡死:为确保配音与汤浅风格的“狂躁、童真、迷幻”高度咬合,在生成时必须在参数或文本前置描述中增加语速、语调大张大合的戏剧化演播风格提示。
      • 日文配音怪诞演播规则(杜绝标准播音腔红线):当配音语言为日文(Japanese)时,绝对严禁生成标准、克制、四平八稳的 NHK 播报腔、旁白体或温和角色配音腔调。必须在生成前置提示中,强制注入以下极度夸张的戏剧演播特质:
        • 音调与声线极端起伏:指示语速在疯狂飙音节与突然哑然静止之间反复拉扯;音调设计为大幅度突兀跳跃,时而极度尖锐高亢(如嘶吼、高亢失控的笑声 "あははははっ!"、绝望长音 "うそだろーーーっ!"),时而极其低沉、神经质般喃喃自语(paranoid murmuring);要充分利用日语特有的语调助词末尾上扬或骤降(如 "だろ?" "だよ!" "でしょ?!")来制造极度不稳定的情绪张力。
        • 呼吸拟真与声线失控:强行提示加入不稳定的情绪颤抖(感情の震え)、气喘吁吁(息を切らす)、声音破裂(声が裂ける)、失控笑意或哭腔交织,使日文演播呈现出如手绘动画中那种怪诞、写意、非标准化的极致声演质感。
        • 长音与感叹词的物理拉伸:对白中所有拉伸长音(如 "やめてーーー!" "走れーーっ!")与感叹词(如 "えっ!?" "うわあああっ!")必须原样传入 TTS,引导引擎在对应位置做出极度延长的尾音拉伸、音高跳变或破音,还原汤浅式日语配音的标志性夸张弧度。
      • 中文配音怪诞演播规则(杜绝播音腔红线):当配音语言为中文(Chinese)时,绝对严禁生成常规、字正腔圆、温和、四平八稳的传统播音腔、朗诵腔或客服腔。必须在生成前置提示中,强制注入极度歇斯底里的戏剧感、狂躁神经质或充满稚气的童真表现力:
        • 音调与语气剧烈变调:指示语速在极速飙字与突然迟滞、卡顿间反复拉扯;音调设计为大幅度的突兀跳跃,时而尖锐高亢(如大笑、尖叫、狂热呐喊),时而极其低沉、神经质般自言自语(whispering paranoia)。
        • 呼吸拟真与质感失控:强行提示加入不稳定的情绪化发颤(trembling tone)、气喘吁吁(panting)、破音、失控的笑意或抽泣,使中文演播呈现出怪诞、写意、非标准化的动画声演质感。
      • 完美传递语气标签(核心红线):输入给 TTS 工具的文本必须完整保留并传递故事板规划的所有语气/动作指示标签(如 [大喊]、[气喘吁吁,颤抖地]、[极度狂热大喊]、[颤抖、既惊又喜])严禁在传入 TTS 之前对语气标签进行任何简化、删除、合并或替换——每一个标签都是给声音合成引擎的直接行为指令,一旦省略将直接导致情绪塌陷为平淡播报腔。同时,对白文本中的拉伸长音拼写(如"我不管了——!"、"快跑——啊啊啊!")也必须原样保留并传入,以引导 TTS 引擎在对应位置拉长尾音并上扬或破音,呈现出汤浅风格标志性的夸张戏剧弧度。每一条台词的最终输出,都必须在情感浓度上超越"正常人讲话",达到"舞台剧演员爆发瞬间"的极限表现力水准。
5. プロンプト作成

汤浅风格提示词撰写规范:
最高优先级(全局): 当用户编写中文或使用中文界面时,提示词主体也必须以中文撰写,但台词与配音对白等输出语言必须严格遵循 Final_Video_Spec.md。

  1. 图像提示词(GPT Image 2)
    • 角色全身三视图规范 (16:9)
      • 提示词中必须显式指定画面比例与构图排版:"16:9 宽幅画面,全身人设图,标准的正面全身、侧面全身、背面全身三视图横向排列排版,背景为纯白或极简纯色 (16:9 aspect ratio, full-body character sheet, standard 3-view turnaround laid out horizontally, front view, side view, back view, solid minimalist background)"。
      • 汤浅风格笔触:“不规则粗糙手绘线条 (irregular sketchy hand-drawn lines),蜡笔和炭笔涂鸦质感轮廓 (crayon and charcoal graffiti contours),融入质感粗糙的水彩纸纹理 (textured watercolor paper grain) 与斑驳、带有手工剪裁边缘的手工剪纸拼贴质感 (mottled handcrafted papercut collage textures with raw uneven scissor-cut edges),无繁复数码细节,突出原始、粗粝的手工生命力与触觉温度 (raw, primal handmade vitality with tactile warmth and minimalist hand-drawn charm)”。
      • 服装与色彩:指定鲜明的高饱和色块(如:“明黄大衣与大红围巾”),且发色或服饰色彩须与对应场景的 2-3 个平面主色保持可辨识的对比关系,以此在形变的动态背景中牢牢锚定角色的视觉辨识度,防止角色被背景大色块所吞噬。服装须限定为日常生活服饰(校服、宽松外套、旧运动鞋、雨衣、睡衣、运动衫、皱巴巴衬衫、围巾、普通背包),严禁机能战斗服、赛博装甲、潮酷偶像服或过度精修的二次元人设服饰——汤浅风格的角色辨识度来自平凡日常与荒诞形变的反差。
    • 场景多角度四宫格规范 (4:3)
      • 提示词中必须强制约束“四宫格”画面排版,明确指定每个 Panel 的内容,严禁画面混淆:
        • "4:3 画幅,一张四宫格(2×2)的多角度、无人物、高密度场景参考图 (4:3 aspect ratio, a 4-grid multi-angle character-free scene reference sheet)"。
        • Panel 1 (top-left) — 全景定场 (establishing wide landscape view)。
        • Panel 2 (top-right) — 陈设细节 (close-up of signature props/decor)。
        • Panel 3 (bottom-left) — 纵深透视 (distorted deep perspective view)。
        • Panel 4 (bottom-right) — 气氛光效 (dramatic lighting and moody color palette)。
      • 汤浅风格背景美学:场景必须锚定在可辨识的现实生活空间(街道、车站、教室、居酒屋、出租屋、海边小镇、商店街等)——不要把所有场景都做成荧光霓虹梦境,普通段落应更生活化,情绪爆发时再让空间明显变形 (scenes must be grounded in recognizable real-life spaces — streets, stations, classrooms, izakayas, cramped apartments, seaside towns, shopping arcades — not every scene is a neon dreamscape; ordinary scenes should feel slice-of-life, with spatial distortion emerging only as emotion escalates)。"歪斜倾斜、比例失调的怪异非对称建筑,建筑可像纸片或橡皮一样弯曲 (wildly crooked, tilted, and asymmetrical warped buildings that bend like paper or rubber),透视畸变程度由该场景的情绪强度决定——日常场景仅轻微变形,高潮段落才使用极端鱼眼与广角畸变 (degree of perspective distortion scales with emotional intensity: mild deformation for everyday scenes, extreme fisheye and wide-angle distortion reserved for climactic moments),背景线条带有手绘抖动感,融入拼贴质感、照片颗粒与粗糙色块 (background lines carry hand-drawn jitter, incorporating collage texture, photo grit, and rough color blocks),狂放的表现主义色块拼接与斑驳手工剪纸拼贴质感 (expressionist color blocking combined with mottled handcrafted papercut collage textures, featuring raw layered paper edges),底层透出重度蜡笔涂抹的颗粒感与粗糙水彩纸纹理 (rough watercolor paper grain and heavy crayon stroke textures under the paint),每场使用 2-3 个平面主色构建色域,高饱和撞色仅用于高潮段落,日常段落可使用更柔和的水洗色调 (2-3 flat dominant colors per scene, with high-saturation clashing colors reserved exclusively for climax sequences; everyday scenes may use softer washed-out watercolor tones)"。
  2. 视频提示词(Seedance 2.5(分辨率 480p) / MultiModalToVideo)
    • 故事板字段强制映射清单(提交生成前逐项必检):每条视频提示词在最终提交前,必须对照该分镜的故事板脚本逐一核查以下映射关系,确保所有字段均在提示词中有明确的对应表达,发现任何字段缺失必须补写后方可提交,禁止以"模型自行发挥"替代遗漏字段:
      故事板字段提示词中的对应表达位置镜头类型(切换类 / 续接类)提示词开头的 Full cut / Continuing from 强制声明场景子格锚点 (Panel Lock)四宫格防错锁定语,明确写明 Panel 编号与视角名称出场角色<<<image_X>>> 角色全身三视图绑定,与角色 ID 一一对应情绪基调运动栈"主体动作"层的情绪语气标注(如"极度狂热"、"沉寂压抑")主色调配置(2-3 平面主色 / 高潮撞色)提示词末段的色调声明,切换类应与前镜有区分故事节拍 (Story Beats)运动栈"主体动作"层的完整动作序列(含面部表情变化与弹性时序)台词(如有){[语气标签] 对白内容} 格式封装,不得省略语气标签运镜 (Cinematography)运动栈"运镜"层的完整轨迹描述(镜头规模、角度、运动路径)手工质感动态水彩纸纹理与剪纸色块沿运动与形变方向拉伸的质感控制词对音效(如有)<...> 格式封装,与 Story Beats 动态点精准对应
    • 提示词长度与优先级管控:当分镜内容极度丰富导致提示词过长时,若必须取舍,严格按以下优先级保留,低优先级内容可适度精简但不得完全省略
      1. Panel Lock 防错声明(最高,省略即背景跳画)
      2. 角色参考绑定 <<<image_X>>>(省略即角色一致性崩溃)
      3. 镜头类型开头声明(Full cut / Continuing from,省略即相邻镜头趋同)
      4. 运镜轨迹(省略即镜头语言失效)
      5. 主体动作与弹性时序(省略即动态节奏特征消失)
      6. 台词与音效(省略即对白轨失控)
      7. 主色调配置(可精简为简短声明)
      8. 手工质感控制词对(可精简,但至少保留一组核心词)
    • 场景多宫格防错锁定(核心防多格视频红线)
      • 当引用四宫格场景图像 <<<image_X>>> 作为参考资源时,提示词内必须自动追加一段自然语言解释,强制锁定视角,防止模型直接渲染出多宫格拼接视频:
        • "This reference is a 4-grid multi-angle environment sheet. You must strictly focus on and match ONLY the camera angle, perspective, and architectural geometry of [指定 Panel 子格,例如: Panel 1 - top-left establishing view] of <<<image_X>>>. Do not generate a split-screen or multi-grid video; generate one continuous, unified single-camera scene. Do NOT drift to, blend with, or switch to any other panel within this shot."
      • Panel 编号与故事板强制对应:提示词中声明的 Panel 编号必须与故事板该分镜的"场景子格锚点 (Panel Lock)"字段严格一致,严禁填写不同编号。相邻切换类镜头各自使用不同 Panel 时,两条提示词的场景参考声明必须分别独立更新,严禁直接复制上一镜头的场景参考描述段落
    • 角色参考绑定:使用 <<<image_Y>>> 绑定对应的角色全身三视图。
    • 运动栈结构 (Motion Stack):按照 运镜 -> 角色主体动作 -> 空间/背景液态变化 -> 手工质感动态流动 的顺序书写:
      • 运镜:如“镜头极速俯冲并伴随倾斜旋转 (camera rapidly pitches down with tilted rotation)”。
      • 主体动作:描述情绪化的生动夸张面部表情及强有力的动作速度/弹性节奏控制,如"人物动作具有极致的速度弹性与阻尼感,前1-2秒蓄力屈身,随后伴随瞬间的爆炸性弹射冲出 (subject's actions possess extreme velocity elasticity, crouching to compress for 1-2s then instantly catapulting forward),或在极速狂飙中插入短暂的慢动作滞空飘浮 (inserting brief slow-mo suspended floats mid-dash)"。角色四肢与身体比例始终保持正常,严禁橡胶管式拉伸、肢体无限延长或身体液化碎裂。
      • 背景变化:描述非自然运动,如“背景的楼房随之扭曲、融化并重组 (surrounding buildings warp, melt and reassemble)”。
      • 手工质感动态流动:必须显式约束在背景发生强烈形变或角色高速运动时,其表面的手绘纸纹与拼贴色块需呈现物理拉伸与质感闪烁,以防止画面出现生硬、冰冷的通用数码平滑过渡。提示词需追加特定的控制词对,描述:"水彩纸纹理与斑驳剪纸色块沿运动与形变方向呈黏滞的不规则连续拉伸,并融合局部笔触与手绘线稿的高频交替闪烁,展现狂躁的手工动态质感 (watercolor paper textures and mottled papercut collage color blocks exhibit viscous, irregular continuous stretching along the direction of motion and deformation, seamlessly blending with high-frequency alternating flashing of local brushstrokes and sketchy line-art, expressing manic handcrafted kinetic textures)"。
      • 群舞镜头运镜与动作封装 (Group Dance Stack):当提示词用于歌舞高潮的"狂热群舞"时,必须整合高度同步的爆发力编舞、环境色彩在情绪最高潮的瞬间颜料飞溅、极速动力学摄像机穿梭以及高频闪烁的狂躁手绘质感。角色四肢与身体比例保持正常。
        • 描述与控制词对:"多名角色保持正常身体比例,以高度同步、充满爆发力的编舞释放狂热能量,动作在极速与骤停间交替,面部表情生动夸张;在情绪最高潮瞬间,环境色彩与画面整体爆裂飞溅为具有极强冲击力度的写意泼墨与斑驳颜料颗粒,颗粒边缘呈现粗糙的纤维纸张质感,且在泼溅的颜料中融合了饱和度极高的色彩渐变与晕染,随后画面瞬间恢复,在2D扁平与3D立体质感间剧烈突变;同时伴随局部笔触高频闪烁、手绘线稿闪烁的狂躁质感变换 (multiple characters maintain normal body proportions, releasing manic energy through highly synchronized explosive choreography, alternating between extreme speed and sudden stops, with exaggerated facial expressions; at the peak of emotional climax, environmental colors and the entire frame burst with high-impact explosive force and splatter into abstract ink-wash streaks and raw paint particles with fibrous, rough-textured deckled paper edges, showcasing highly saturated bleeding color gradients across the splashing droplets before the frame instantly recovers, violently shifting between 2D flat style and 3D forms, featuring high-frequency local brushstroke flickering and vibrating sketchy line-art flashing to express manic texture changes);镜头作高速螺旋升降或俯冲主观穿梭,擦过编舞阵型与飞溅颜料的间隙 (helical spinning POV pan, camera flying directly through the gaps of their choreography formations and splattering paint, extreme dynamic rhythm)"。
        • 特定视觉暗示(宿命首尾镜):当撰写‘梦境循环’的首发或收尾镜头提示词时,必须显式在背景或全画幅中加入高潮撞色的色彩指令;对于宿命闭环的收尾镜头,还必须显式加入由前镜动作自然演化的滑稽夸张形变与空间折叠重组指令(如“角色面部生动的卡通式夸张表情——眼睛圆睁发亮、嘴巴大大张开的滑稽笑脸 (character shows vivid cartoon-style exaggerated expressions — eyes wide and bright, mouth stretched into a comically big grin);重力如弹簧般失效又恢复,三维楼宇如纸牌般翻转折叠,透视线弯曲纠缠后重新拼合成新的滑稽几何,空间如颜料般流淌溶解 (gravity fails like a released spring, 3D buildings flip and fold like playing cards, perspective lines bend and tangle before reassembling into whimsical new geometry, space dissolves and drips like melting paint)”),并配合色彩指令:"画面在高潮段落的高饱和撞色之间进行瞬时交替闪烁 (the frame flashes momentarily between high-saturation clashing colors at the climax)"。所有形变必须由前镜已有的动作或物件自然演化而来,禁止凭空插入无关意象。
    • 镜头类型差异化控制词对(切换类 vs 续接类):每个分镜提示词必须在正文开头显式声明镜头类型,并套用对应的控制词对结构,从源头阻断相邻镜头内容趋同:
      • 切换类镜头(机位切换 / 情绪跳切 / 场景转换):
        • 提示词开头强制注入"完全切断"声明:"Full cut — completely new camera angle and position. New [scene/emotional beat/character action phase]. No visual continuity or compositional inheritance from the previous shot."
        • 紧随其后必须显式描述新镜头的独特视觉锚点:新场景 Panel 子格编号、新角色姿态与动作阶段、新情绪色调与主色调配置;严禁与前镜使用相同的构图描述词或色块主色比例措辞,以最大化视觉差异信号。
      • 续接类镜头(动作无缝衔接 / 同机位时间流逝 / 形变过渡):
        • 提示词开头强制注入"继承 + 演进"双重声明,先继承,后差异化:"Continuing directly from previous shot — [具体继承状态,如:same low-angle fisheye camera, character still in crouching launch-ready stance]. NOW EVOLVING INTO: [本镜头的新演进阶段,如:the character instantly catapults forward with explosive acceleration]."
        • 严禁只写继承声明而省略演进描述——缺少演进指令时,模型将趋向完全复刻前镜静帧,造成画面停滞。
    • 📌 填写范例(切换类提示词)

      Full cut — completely new camera angle and position. New emotional beat: manic euphoria. No visual continuity or compositional inheritance from the previous shot.

      <<<image_1>>>(Element_Scene_SubwayStation 场景四宫格图)This reference is a 4-grid multi-angle environment sheet. You must strictly focus on and match ONLY the camera angle, perspective, and architectural geometry of Panel 3 - bottom-left distorted deep perspective view of <<<image_1>>>. Do not generate a split-screen or multi-grid video; generate one continuous, unified single-camera scene. Do NOT drift to, blend with, or switch to any other panel within this shot.

      <<<image_2>>>(Element_Character_Hana 角色全身三视图)

      极低角度仰拍鱼眼广角(Panel 3 纵深透视),镜头以极速俯冲方式沿隧道纵深轴急速推进,同时伴随顺时针倾斜旋转 30°。Hana 双腿猛然发力弹射,以极速向纵深隧道狂奔,面部表情生动夸张、充满狂热与兴奋,留下层叠动态残影;背景隧道灯柱随其奔跑节奏瞬间扭曲融化成粉红色流体向两侧飞溅重组;水彩纸纹理与斑驳剪纸色块沿运动与形变方向呈黏滞的不规则连续拉伸,融合局部笔触与手绘线稿的高频交替闪烁,展现狂躁的手工动态质感 (watercolor paper textures and mottled papercut collage color blocks exhibit viscous, irregular continuous stretching along the direction of motion and deformation, seamlessly blending with high-frequency alternating flashing of local brushstrokes and sketchy line-art)。主色调:荧光粉红与荧光绿高饱和撞色(高潮段落)。{[极度狂热大喊] 我不管了——!} <弹性蓄力释放的撕扯声,随即空气弹跳爆破声> no subtitles no music

    • 📌 填写范例(续接类提示词)

      Continuing directly from previous shot — same low-angle fisheye camera locked to Panel 3 deep perspective axis, Hana still sprinting at extreme speed with motion trails across the frame. NOW EVOLVING INTO: at 2s her feet suddenly leave the ground; body floats upward in ultra-slow motion suspended in air; at 5s gravity snaps back, she impacts the ground with explosive force and catapults out of frame.

      <<<image_1>>>(Element_Scene_SubwayStation 场景四宫格图)This reference is a 4-grid multi-angle environment sheet. You must strictly focus on and match ONLY the camera angle, perspective, and architectural geometry of Panel 3 - bottom-left distorted deep perspective view of <<<image_1>>>. Do not generate a split-screen or multi-grid video; generate one continuous, unified single-camera scene. Do NOT drift to, blend with, or switch to any other panel within this shot.

      <<<image_2>>>(Element_Character_Hana 角色全身三视图)

      继承前镜极低角度仰拍鱼眼机位。第 2s 镜头转为超慢速上推凝视,将飘浮的 Hana 充满画面,表情从狂热兴奋转为惊喜与恐惧并存的瞪大眼状态;第 5s 重力骤然恢复,镜头骤然切回俯冲加速——以爆炸性速度坠地并弹起,在落点留下蜡笔颜料飞溅的圆形印记,随即弹射加速冲出画面;水彩纸纹理与斑驳剪纸色块沿运动与形变方向呈黏滞不规则连续拉伸,融合手绘线稿高频闪烁,展现狂躁手工动态质感。主色调:荧光粉红与荧光绿高饱和撞色(与前镜一致,刻意延续高潮色调连贯性)。{[颤抖、既惊又喜] 我……飞起来了?!} <短促的空气失重漂浮音,随即骤降爆裂的橡胶弹跳爆破声> no subtitles no music

    • 台词与音效封装 (Seedance 2.5 格式)
      • 音乐 (...),音效 <...>,台词 {...}。
      • 示例:{大喊:快跑——啊啊啊!} <极具弹性的蓄力释放与爆裂音效>。
      • 限制:若画面外另有单独旁白轨道,严禁在视频提示词内重复生成旁白配音。no subtitles 是默认负向提示。
6. 動画編集

汤浅风格后期剪辑与装配规范:

  1. 节奏与高强度剪辑 (Montage & Pacing)
    • 汤浅风格的核心在于高速剪辑与节奏的剧烈起伏。对于动作高潮或情绪爆发段落,必须采用极短时间的快速蒙太奇(每切仅 8-12 帧,即 0.3-0.5s),配合高潮段落的高饱和撞色色块,制造极其狂躁的感官冲击。
    • 在安静段落与狂躁段落之间形成极端反差,剪辑节奏不可温和平缓。
  2. 变形与液化转场 (Transitions)
    • 避免使用普通的淡入淡出(fade in/out)或标准硬切。多设计利用色彩流淌、背景融化或画面整体2D/3D风格切换的方式进行无缝镜头变焦转场。
    • 手绘流淌变焦转场 (Hand-drawn Flowing Zoom Transitions)
      • 标准时长:严格控制在 6–12 帧 (约 0.24s–0.48s) 之间,极大压缩过渡时间,确保镜头切换带有极致的狂躁感与瞬时撕裂感。
      • 快–慢–快弹性时序律动 (Asymmetric Elastic Timing)
        • 启动(1–2 帧 / 约 0.04s–0.08s):瞬时变焦或色彩爆裂。场景线条与色块以爆炸般的超高速极度形变拉伸,在极短时间内铺满至少 80% 画面并完成视觉遮挡。
        • 流动(3–6 帧 / 约 0.1s–0.2s)(原为 4–12 帧):极速压缩的粘滞期。画面转为扁平、融化的色彩流淌状态,伴随 手绘线稿闪烁 (Line-art flashing) 与笔触高频抖动,形成极其短促、如弹簧压到极限般的“瞬时阻尼感”,随即立刻被下一镜撕裂。
        • 切出(7–10 帧 / 约 0.12s–0.2s):瞬间爆发与释放。流动色彩如同松开的强力弹簧般呈放射状或螺旋状极速弹射收缩,瞬时切出并导入至下一个镜头的空间几何。
  3. 音画同步与声音消长规则 (Audio-Visual Sync & Ducking)
    • 将生成的变奏背景音乐与短片剪辑点紧密对齐。每次画面发生爆发性动作(如弹射、爆裂)或画面大面积变色时,必须在时间轴上精确对齐弹性音效(SFX)或极速音乐重拍,强化"非自然运动"的能量感。针对滑稽表情变化或弹射场景,装配时必须精准指定并对齐高弹性的橡胶摩擦与空气爆破音效(例如:弹性蓄力释放的撕扯声、空气弹跳爆破声),以滑稽且充满阻尼感的弹性声学反馈紧密咬合动态画面,提升汤浅式视听的夸张表现力。
    • 公路奔跑、梦境循环与歌舞高潮特化音画对齐 (Specialized Audio-Visual Alignment):在时间轴装配时,必须智能识别以下特定动作特征帧、形变点或时间点,并自动进行精确到帧的音效(SFX)与音乐重拍对齐:
      • 公路奔跑 (Road Run):必须在分镜第3s"弹射加速"发生瞬间,精准对齐高张力极速风驰(catapult whoosh)或弹性蓄力释放的音效;并在第4-6s的"阻尼减速"曲线区间,自动对齐带粘性残影的液态摩擦、急刹滑行音效,完美渲染汤浅式"起跑冲刺-骤停滑行"的怪诞弹性。
      • 梦境循环尾镜 (Dream Loop End Shot):必须在画面启动"面部滑稽夸张表情与空间折叠重组"瞬间,精准对齐弹力橡胶音效与滑稽表情声效;同时在场景"重力弹簧式失效与几何空间溶解重组"的物理结构突变时,对齐大范围低音轰鸣、坍塌(glitch collapse)或碎裂变调的撞击音效,达到最强的声学震撼度。
      • 歌舞高潮群舞 (Musical Climax Group Dance):必须精准识别群舞分镜中的高度同步编舞的节奏爆点、环境色彩飞溅为抽象颜料颗粒的瞬间、手绘线稿高频闪烁、扁平与立体质感切换等关键视觉动态点(Dynamic Points),并将这些视觉突变突颤帧强制与 Suno 5 生成的原创歌曲重拍(Heavy Beats)、强节奏鼓点或变奏节拍进行毫秒级的精准卡点对齐,且在颜料颗粒飞溅瞬间叠加高频闪烁的碎裂或水滴爆散音效,让画风闪烁与编舞节奏的动力与歌曲旋律形成强烈的视听共鸣。
    • 人声与环境音效消长律动 (Vocal & SFX Ducking):在角色对白(dialogue)或旁白(narration)发出时,在时间轴上实施精细的声级避让控制。必须瞬时自动压低(ducking)背景音乐与嘈杂环境音效的音量(让出清晰的人声通道),在台词/旁白结束后再迅速回升。这确保了人声微小而真实的情感细节(颤音、喘息、微弱笑意)不被庞杂的实验电子乐与狂躁动态音效淹没,极大地提升配音的声音实体感与节奏真实感。
  4. 画幅与导出
    • 严格维护 Final_Video_Spec.md 中的 16:9 画幅,并将最终 timeline 的音画分轨信息以实际视频规格(480p,或用户已确认超分后的 1080p)交付给后端渲染器。