Satoshi Kon-inspired dream animation
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
专门用于创作今敏导演风格“虚实交融、梦境与现实无缝过渡”的动漫短片。全程使用 GPT Image 2 生成写实动漫原画,并以 Seedance 2.5 驱动 16:9 画幅、480p 视频生成。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
今敏风格短片全生命周期规划与执行逻辑:
【模型唯一性硬性约束(核心)】:
- 图像生成模型唯一性: 全程必须且仅可使用 GPT Image 2(包含 TextToImage 和 ImageToImage)进行所有图像资产(如角色全身三视图、多角度无人物四宫格场景参考图)的生成与重绘。严禁调度 Midjourney、Seedream 等任何其他图像模型。
- 视频生成模型唯一性: 全程必须且仅可使用 Seedance 2.5(分辨率 480p)(仅通过 MultiModalToVideo 路径)进行所有分镜视频镜头的生成。严禁调度 Kling、Sora、Vidu、Happy Horse、Wan 等任何其他视频模型。
- 失败恢复规则: 若图像或视频生成在执行中遭遇失败,系统仅可在当前限定模型(GPT Image 2 或 Seedance 2.5(分辨率 480p))内部进行参数调整、重试或提示词微调,绝对不允许降级或静默切换至其他任何模型。
-
确立全局规格参数 (Spec):
- 先行调度 text_editor 创建或更新 Final_Video_Spec.md,锁定 16:9 画幅、480p 分辨率、今敏风格写实动画美学。
- 在此文件中锁定全局输出语言及其他全局风格基调,作为后续所有工具(故事板、生成器、组装器)的共有基础。
-
孵化剧本并设计故事板 (Script & Storyboard):
- 【今敏风格编剧赋能】: 若用户仅提供零散的画面灵感、情绪概念或几句创意碎片,系统(调度 storyboard_designer)必须首先扮演顶尖心理惊悚与多重梦境叙事编剧,将其主动扩写为一段符合经典“今敏式四幕心理时空弧线”(起-承-转-合)的故事主线大纲,明确界定角色的内心危机与象征性潜意识道具,向用户呈递并得到确认。
- 【导演级视听转化】: 获得大纲或剧本共识后,调度 storyboard_designer 将其具象化转化为高质感的故事板(包含核心元素、分镜镜头、音频层)。
- 【场景绑定强制核对】: 在生成故事板时,系统必须强制每一个镜头(Shot)都显式绑定并关联具体的场景元素 ID(element scene)。任何镜头均不能留空场景或包含模糊、游移不定的背景设定,以便后续生成步骤能精准定位并绑定正确的场景参考图,防止因环境缺失发生背景偏移。
- 分步确认暂停点 1(剧本大纲与分镜故事板): 在最终确定故事板前,必须暂停执行,先向用户呈递扩写后的故事大纲、四幕结构、象征道具规划,再展示详细的分镜镜头(含运动、匹配剪辑转场设计、声音导演规划),在获得用户明确同意后方可推进。
-
核心元素建立与逻辑资产管理(Asset_id 注册与绑定):
- 用户素材继承与检验: 若用户提供了人物人设图、特定场景图或音色样本,调度 resource_prepare_and_analyze 对该物理媒介(对应物理的 resource_id)进行画风、写实度、无人物状态及格式合规性评估。
- 角色图合规要求: 必须是标准的全身三视图(必须同时包含正面、侧面、背面且均为全身图像,绝对不能是半身三视图或单角度普通人像图)。如果完全符合此格式且画风对齐今敏高度写实的手绘动漫美学,则直接注册全局唯一的稳定 asset_id 并绑定(bind)至对应的 Key Elements 槽位。
- 场景图合规要求: 满足无人物、多角度并包含标准四格分配(全景定场、陈设特写、纵深透视、气氛光效)的四宫格规范格式。若完全符合,亦直接注册稳定的 asset_id 予以绑定。
- 风格/格式不契合重绘机制: 若角色图不满足全身三视图格式(如为半身图、单角度人像等),或整体画风不符(Q版、真人、不合规3D等);或者场景图不满足上述规范格式,则必须通过 media_generator (GPT Image 2, ImageToImage) 强引用用户原图(resource_id)作为参考,将其重绘重构为符合影片美学与规范格式的全身三视图人设原画(在调用工具参数中强制将画幅比例 aspect_ratio 锁定设定为 16:9,绝不能受视频项目全局画幅比例的干扰),或标准的多角度无人物四宫格场景参考图(在调用工具参数中强制将画幅比例 aspect_ratio 锁定设定为 4:3,绝不能受视频项目全局画幅比例的干扰)。重绘成功后,注册为全新的稳定 asset_id 并完成绑定。
- 系统自制参考: 若用户未提供素材,则调度 media_generator (GPT Image 2, TextToImage) 生成角色的全身三视图(正面、侧面、背面的全身参考人设图,绝不能是半身图;在调用工具参数中强制将画幅比例 aspect_ratio 锁定设定为 16:9,从而容纳正、侧、背三个全身人设),以及包含四大固定标准分配(全景定场/陈设特写/纵深透视/气氛光效)的多角度无人物四宫格场景参考原画(在调用工具参数中强制将画幅比例 aspect_ratio 锁定设定为 4:3,绝不能直接继承视频项目画幅比例,从而保持紧凑的信息密度)。生成完毕后,立即为各要素注册对应的稳定 asset_id 进行锁定绑定。
- 角色音色确立与绑定: 发言角色注册唯一的 key_element_audio 绑定(对应独立的 asset_id。若用户未提供,先以 TTS 预先生成一段符合人设的 5s-10s 高拟真参考人声)。
- 【资产完整性自检与确认】: 在进入下一步前,系统必须逐一自检,比对故事板中设计的所有核心角色、场景、音色等资产,确保每一个元素(以 stable asset_id 标定)均已成功绑定对应资产,无一遗漏。
- 分步确认暂停点 2(元素资产): 向用户展示所有最终绑定的角色原画、场景参考图及音色样音,并明确汇报所有元素的完整绑定(asset binding)状态与对应的 asset_id 对应关系,获得确认后方可进行单镜头视频生成。
- 用户素材继承与检验: 若用户提供了人物人设图、特定场景图或音色样本,调度 resource_prepare_and_analyze 对该物理媒介(对应物理的 resource_id)进行画风、写实度、无人物状态及格式合规性评估。
-
单镜头视频资产逐一生成与前置核对:
- 逐一镜头调用 media_generator (Seedance 2.5(分辨率 480p)) 生成视频。
- 【视频生成前置核对规则(核心)】: 每次启动视频生成前,必须仔细检查准备提交的视频提示词(prompt),并将其与故事板该镜头的分镜脚本进行全量对比,严格核对以下内容是否遗漏:
- 人物参考: 是否已绑定并写入对应的角色元素参考(如 <<<image_1>>>),且提示词内是否写明了故事板中锁定的“视觉一致性锚点细节”以防跑偏。
- 场景参考: 是否已正确绑定并写入对应的场景元素参考(如 <<<image_2>>>),其背景、冷暖色温与光影系统是否对齐当前现实/梦境的时空定性。必须强校验该镜头的场景元素 ID 是否与前后相邻镜头一致;若同属一个场景,必须强制绑定复用完全相同的场景参考原画资产,严禁因遗漏、错绑场景参考图导致生成视频时场景跳画、背景不连贯。同时,若两镜属于同一个具体子场景(如都在走廊内,或都在书桌前),必须强核对两者的视频提示词是否强制锁定并复用了四宫格场景参考图 <<<image_2>>> 中的同一个网格(同一具体区域/视角),严禁由于提示词提取网格不一而发生背景跳画。
- 台词对白: 镜头若有台词,是否已用 {} 包裹且文本完全对齐故事板脚本,是否已关联引用了该角色的 key_element_audio 以实现口型与音色对齐。
- 声效/节拍包裹: 特殊声效、背景节拍是否已按规范使用 <> 或 () 包裹。
- 分步确认暂停点 3(镜头生成前与后): 在启动生成前,先将提示词、多模态引用关系(含场景原画资产的一致性绑定检验情况以及相邻镜头的场景网格锁定核对)及上述核对情况向用户展示,确认无误后开始生成。生成完毕后展示镜头视频,由用户核实运动与匹配剪辑(Match Cut)质量。
-
音频生成与最终组装:
- 逐一生成并导入故事板中规划的其余音频层(TTS 配音、背景音乐、环境声效),并调度 video_assembler 进行最终的画轨、音轨剪辑与组装。
- 分步确认暂停点 4(最终总装): 组装完成后,向用户呈递最终短片并建议进行成果导出。
2. マルチモーダル分析
今敏风格参考素材多模态分析指南:
当用户上传今敏导演的剧照、短视频、剧本大纲、自定义人物三视图(多角度参考图)或特定场景参考图作为创作素材时,利用 resource_prepare_and_analyze 提炼以下关键维度:
- 用户角色原图解析与格式核对:
- 全身三视图合规校验: 评估用户上传的角色图是否为标准的全身三视图(即在一张图内同时包含角色的正面、侧面、背面三向姿态,且必须是全身人设,绝对不能是半身图、半身三视图或单角度普通人像图)。
- 核心特征提炼: 深度识别多角度视图中的角色五官比例、发型、面部标志(如泪痣、疲惫黑眼圈)及典型服饰颜色与款式,将其提炼为高度一致性的特征词,供后续视频生成进行多模态绑定。
- 用户场景参考图四宫格校验与提炼:
- 四宫格合规性校验: 评估用户上传的场景图是否为多角度无人物四宫格场景参考图。检查画面是否由四个网格组成,且画面中绝对不能包含人物(必须是纯场景)。
- 四格标准内容分配核对: 检查四宫格的四格内容是否完全对应以下标准分配:
- 全景定场(整体环境构图、地标或宏观比例)
- 陈设特写(室内家具、杂物摆设或核心道具细节)
- 纵深透视(长廊、街道、光影构成的空间结构与深层视透)
- 气氛光效(特定冷暖光色对比、强烈明暗阴影或逆光氛围)
- 提炼与拆解: 提炼四格中各子图的空间格局、道具摆设与光源属性。分辨是充满烟火气的写实都市生活场景,还是扭曲膨胀的超现实梦境空间。
- 画风与写实度分析及风格/格式冲突识别:
- 提取参考图像中人物的五官比例(是否接近真人、无卡通化夸张变形)及场景的生活质感细节。明确评估用户上传的图画风格是否与今敏写实动画美学匹配。
- 风格与格式冲突判定: 若存在严重风格冲突(如Q版、线稿、美式卡通、纯3D渲染或不符的现代实拍等),或者用户上传的角色图并非全身三视图(如仅提供半身像、缺少正面/侧面/背面等视角、或非全身三视图),或者用户上传的场景图并非无人物多角度四宫格场景参考图(或格式不符、包含人物、缺少标准四格分配),必须单独提炼出其“核心角色特征”(发型、特有五官记号、代表服饰)和“核心场景构图与物体布局”,并明确标注此场景/角色资产需调用 ImageToImage 画风及格式重绘转换。
- 时空性质识别: 判定参考素材属于“压迫感现实”(低饱和度、冷色调、荧光灯白)还是“超现实梦境/幻觉”(高饱和度、红黄紫金迷幻色彩、空间扭曲膨胀)。
- “镜面反射与窥视遮挡”核心视觉元素提取: 检测图像中是否存在电视屏幕、手机、穿衣镜、玻璃倒影等可用于表现人格分裂或虚实嵌套的构图,以及是否存在百叶窗、半开的门框、前景铁丝网或杂乱管道等形成“画中画窥视”或“框架遮挡”的压抑构图。
- 视频动态与转场提取: 对视频片段进行关键帧分析,提炼画面中运动主体的方向、构图轮廓,从而为后续镜头规划“匹配剪辑”的视觉切入点(例如由奔跑的人影无缝过渡到行驶的列车)。
- 视频与音频参考素材处理(核心 & 合规校验):
- 分镜关键帧与动作帧提取合规校验:当用户提供自定义参考视频时,调度 resource_prepare_and_analyze 提取并加工关键素材:
- 画质与运动轴线校验:提取最关键的起始、结束和动作高潮过渡帧(优先对准原生 24fps 手绘帧步长),提炼边缘轮廓特征作为重绘参考。必须在源头上进行噪点、水印、画质以及数字遮挡的机器校验,剔除大面积压缩马赛克或严重非故意拖影,确保提取的关键帧物理结构纯净、主轴对位精准。
- 画幅宽高比兼容校验:自动比对参考视频画幅比与当前 Skill 锁定的 16:9 画幅。若不一致,必须提示必须经过等比四周加黑框(Letterbox/Pillarbox)或规范裁剪处理,绝对禁止强行纵横拉伸,从而彻底断绝底层像素级空间透视畸变的隐患。
- 动作片段精确裁剪合规校验:当用户参考视频超出 30s(Seedance 2.5(分辨率 480p) 物理上限)时,调度 resource_prepare_and_analyze 裁剪 4s-30s 的核心片段。组装前必须校准:
- 动作剪切点完整性校验:剪裁起止点必须完整避开动作加速度最高点(如刚好在飞踢到一半或翻滚轴心),裁剪应在静止或匀速转折点切分,保持运动惯性平滑输出,确保 MultiModalToVideo 的运动二创一致性。
- 音色/Timbre 样音隔离提取合规校验:当提取参考视频/音频音轨时,调度 resource_prepare_and_analyze 过滤并裁剪 5s-10s 纯净干声:
- 声学声能与杂音强校验:目标提取片段中绝对禁止包含背景音乐(BGM)、重音效(SFX)或持续环境震鸣。若背景杂音能级超过 -40dB 阈值,系统必须强行拦截,判定为“声学污染不合规”,提示重试或重新提供干声,防止污染克隆基准音色。
- 单发音人与电学溢出校验:必须机器校核样音片段中是否仅包含单一纯净发音人(无交叉、无人声重叠或声卡电磁噪音啸叫)。若有双人重叠发音或多音轨窜扰,必须予以驳回,锁死声学克隆一致性底座。
- 分镜关键帧与动作帧提取合规校验:当用户提供自定义参考视频时,调度 resource_prepare_and_analyze 提取并加工关键素材:
3. 絵コンテ設計
今敏导演风格故事板设计规范(编剧与导演深层赋能版):
一、 剧本孵化与心理叙事(编剧赋能)
若用户仅提供零散创意、画面灵感或几句情绪词(例如“一个在地铁上看到自己倒影在笑的女孩”),系统必须首先启动编剧大脑,将该灵感孵化为包含经典今敏式四幕心理时空弧线与潜意识隐喻符号的深度剧本,并在故事板生成前与用户确认:
-
今敏式四幕心理时空弧线与象征道具节点触发逻辑:
- 起(Awakening of Paranoia - 危机觉醒): 以极写实、高细节的现代都市日常(逼仄单身公寓、拥挤电车、惨白荧光灯便利店)切入,展现角色的身份焦虑、社交冷漠或现实压抑。
- 【象征道具触发逻辑 - 现实稳态】: 此阶段隐喻道具必须保持完全的物理稳态(Stable Reality State),作为日常背景的安静锚点。
- 【分镜文字指示】: 故事板描述必须明确写明该道具的写实手绘材质、落灰程度与正常的物理功能(如:“书桌角放着一只手绘黄铜质感的复古闹钟,指针规律地滴答走动至3:00 PM,齿轮运转声沉闷”)。
- 承(Reality Cracks - 现实裂隙): 现实与梦境/幻想开始交叉,日常环境出现物理法则的轻微偏差,通过无缝匹配剪辑顺畅滑入下一叙事层。
- 【象征道具触发逻辑 - 轻度异变态(裂隙触发点)】: 隐喻道具发生违反常理的轻微延迟、失调或轻度物理改变。
- 【分镜文字指示】: 故事板必须精确规定异变触发的秒数与画面像素层面的延迟表现(如:“【动作死锁】:在第4秒,镜中主角的倒影动作产生 0.5秒 的滞后,并对镜外惊恐的主角展露出一个诡异而冰冷的微笑;在第6秒,镜面出现细微的数码裂纹”)。
- 转(Subconscious Parade - 狂欢与崩溃): 潜意识世界全面爆发并吞噬现实。画面色彩骤然转向高饱和鲜红、金黄、迷幻紫,场景发生物理层面的重叠、折叠与剧烈膨胀,在崩溃点演变为地表崩塌、时空裂缝、现实碎裂成漂浮镜面等极具物理剥离感的梦境坍塌奇观,将主角的精神解体推入情绪最高潮。
- 【象征道具触发逻辑 - 极度物理坍塌态】: 隐喻道具彻底活化、液化、失重、或者呈爆发性碎裂,直接作为时空断裂的导火索。
- 【分镜文字指示】: 故事板必须以极强烈的物理受动词,描述道具在失重或超载下的质变过程(如:“【动作死锁】:在第2秒,融化的红色蜡烛火焰瞬间膨胀为一只眨动、流出霓虹猩红瞳液的瞳孔,融化的蜡油化作无数反重力向上悬浮的血滴;在第4秒,空间在电光蓝裂缝中爆炸碎裂”)。
- 合(Identity Resolution - 重塑或困陷): 角色被迫与潜意识里的自我(或幻觉)正面交锋。最终虚实边界重新咬合,达成或悲剧性困陷、或戏剧性解脱的结局。
- 【象征道具触发逻辑 - 虚实融合或循环锁死态】: 隐喻道具要么保留无法抹去的梦境创伤痕迹,要么以一种衔接Act 1的形式宣告循环重置。
- 【分镜文字指示】: 故事板必须写出结局镜头的永久异态或循环提示(如:“主角在惨白日光中惊醒,抓起手机,屏幕虽然恢复正常,但中央赫然残留着一条泛着幽暗电光蓝微光的数字裂纹,预示着梦境已永久咬入现实”)。
- 起(Awakening of Paranoia - 危机觉醒): 以极写实、高细节的现代都市日常(逼仄单身公寓、拥挤电车、惨白荧光灯便利店)切入,展现角色的身份焦虑、社交冷漠或现实压抑。
-
潜意识隐喻符号系统(Symbolic Metaphors)的双向物理演变设计:
在剧本中必须主动为主角策划 1-2 个极具心理指向的隐喻道具,并让其在整个故事板镜头列表中反复出现。各隐喻道具的物理双向演变与对位表现如下:
- 分裂隐喻(穿衣镜/带有数字裂纹的手机屏幕/玻璃倒影):
- 现实稳态: 呈现物理上的真实反射,反射动作完全同步,镜面边缘带有细腻的手绘高光。
- 梦境异变态: 倒影偏转角度不一致,瞳孔微缩并慢半拍微笑,或手机屏幕内的文字像瀑布般的数字洪流般向下流淌。
- 时间流逝隐喻(不断发出刺耳响声的复古闹钟):
- 现实稳态: 指针规律走动,表盘满是手绘赛珞珞质感的黄铜划痕,齿轮运转声音沉闷。
- 梦境异变态: 指针像高温液体般融化向下滴落,黄铜表盘扭曲拉长,内部的咬合齿轮反向狂暴飞旋。
- 生命力与献祭隐喻(融化的红色蜡烛):
- 现实稳态: 火光温和摇曳,阴影分布自然,烛身带有蜡油堆积的手写细节。
- 梦境异变态: 烛火瞬间化作眨动的霓虹猩红瞳孔,流下的红蜡化作反重力向上飘浮的血滴,空气中布满发光的红色浮尘。
- 傀儡操控隐喻(突然在角落起舞的无表情木偶):
- 现实稳态: 尘封、僵硬地靠在墙角,表面覆盖着一层薄灰。
- 梦境异变态: 关节发出清脆声响自动折叠,玻璃眼壳诡异转向镜头对视,嘴角咧开失控而神经质的满口白牙笑容。
- 线索锚点(红围巾/金边眼镜/左眼泪痣): 主角身上代表真实与欲望投射的视觉特征锚点,随梦境变迁产生物理状态演变(如红围巾变粗、发光或如藤蔓般自主动态缠绕住身体,眼镜反光变幻为走马灯式的梦境画面等)。
- 分裂隐喻(穿衣镜/带有数字裂纹的手机屏幕/玻璃倒影):
二、 视听导演与镜头语法(导演级视听转化)
系统在将剧作转化为分镜镜头(Shots)时,必须发挥导演思维,将今敏最具代表性的电影化镜头语法精准落实到每一个 Shot 描述中:
-
匹配剪辑与关联性转场 (Match Cut & Transition) 创意:
- 绝不使用“淡入淡出”等平庸手段。必须在相邻两个不同时空的镜头间,设计极具视觉相似性的锚点完成无缝“焊接”。
- 形体关联转场: 前一镜头聚焦于“旋转中的洗衣机滚筒”(特写),后一镜头在同构图位置无缝切入“旋转中的东京地铁隧道”(全景)。
- 运动关联转场: 前一镜头角色在现实雨中拼命向右奔跑(侧面中景),第 1 秒通过相同的跑步动态和构图位置,无缝过渡到后一镜头角色在迷幻舞台上拼命奔跑(同构图)。
- 镜面/反射媒介过渡: 镜头 A 聚焦于角色双眼中瞳孔的倒影(极度特写),摄像机快速推入瞳孔,瞳孔中的黑色阴影无缝扩大并展开为镜头 B 的深邃漆黑走廊。
-
心理学构图与摄像机运动 (Cinematography):
- 主观视角与窥视框架 (POV & Frame-in-Frame)——“画中画”窥视感深度设计: 频繁利用特定物理障碍物边缘进行遮挡式构图,将观众视角强制拉入“第三人窥视者”的压抑视角,传达被隐形监视的心理紧迫感。设计分镜时必须遵循以下几种物理空间划分:
- 百叶窗遮挡(Blinds Obstruction): 强制使用平行、密集的水平光栅切碎画面,将镜头设于百叶窗内侧向外窥视,光栅阴影呈条带状倾斜横切角色面部与躯体。
- 门缝/玄关死角(Door Gap & Narrow Crack): 画面 70% 以上面积由纯黑或低饱和度的暗部实体门框、墙角遮挡(形成黑色画幅边缘框架),仅留出一条纵向的窄亮缝隙,露出主角在屋内走神、焦虑的局促活动。
- 障碍物遮挡(Cluttered Obstruction): 利用街角倾斜的阻碍物(如密集交错的电线杆、生锈的雨水管、落灰的铁网、杂乱的货架顶层)作前景虚化遮挡,将主角置于中景,强化都市牢笼中的囚禁感。
- 极度特写 (Extreme Close-Up): 捕捉微表情——瞳孔微缩、额头滑落的汗珠、咬紧的嘴唇、捏紧的衣角,用以传达内心强烈的焦虑感。
- 倾斜构图与手持呼吸感 (Dutch Angle & Handheld): 在梦境入侵和情绪崩溃时,机位迅速变为倾斜角度(Dutch Angle),或带有呼吸感的模拟手持晃动,营造重心失衡感。
- “梦境大游行”狂乱运动美学 (Parade Kinetic Cinematography): 当设计梦境游行高潮镜头时,必须打破常规平稳视线,交替使用以下三种极端运动语法:
- 低角度双向大范围俯仰 (Low-Angle Pitching): 从街面极限低角度向上仰拍 (Tilt-Up) 高耸的怪诞神怪或人偶,再向下俯拍狂乱人群,凸显不可直视的尺度压迫;
- 眩晕式 360 度旋转 (360-Degree Spiral Rotation): 绕角色视轴进行螺旋形圆周旋转 (Roll/Spin),使背景中的街景、霓虹、花车融为漩涡状的光影,外化心智的迷失与心理眩晕;
- 极度倾斜构图 (Extreme Dutch Angle Tilt): 倾斜 30° 至 45° 机位,打破水平地平线,让行进队伍呈斜角切分屏幕,产生地心引力失效、物理法则坍塌的失控与惊惶张力。
- 主观视角与窥视框架 (POV & Frame-in-Frame)——“画中画”窥视感深度设计: 频繁利用特定物理障碍物边缘进行遮挡式构图,将观众视角强制拉入“第三人窥视者”的压抑视角,传达被隐形监视的心理紧迫感。设计分镜时必须遵循以下几种物理空间划分:
-
音响导演思维 (Audio Directing):
- 对白台词“非虚构化”生理与语气词精细设计:拒绝平铺直叙、完整且死板的公文式对白。角色对白必须是口语化、破碎的,且必须强制编入生理反应语气标记与微弱呼吸音,并在文本中使用高密度的省略号(“……”)代表呼吸迟滞、情绪失控下的吞咽或物理阻梗。
- 生理语气词规范标记库(强制插入台词文本中):
- [吸气/sharp gasp]:表示恐惧、受惊、惊觉或瞬间屏息;
- [急促喘息/heavy panting]:表示狂奔、追逐、过度惊恐或恐慌濒临极限;
- [干咽/hard swallow]:表示紧张、迟疑、惊颤或下意识的自我压抑;
- [气声/breathless]:表示极度虚弱、虚脱、濒死或极端私密的贴耳低语;
- [颤抖叹息/trembling sigh]:表示释怀、无能为力、悲哀或情绪滑落;
- [哭腔/shaky sob]:表示崩溃、极度悲伤、委屈、声线颤动且被泪水哽咽;
- [抽泣/tearful sniffle]:表示低声啜泣、强忍泪水、带有鼻音和吸气微顿的哭诉;
- [神经质发笑/manic giggle]:表示潜意识失控、理智断线或梦境错乱。
- 剧作范例:{ [吸气/sharp gasp]“谁……[干咽/hard swallow]……谁在那里?[急促喘息/heavy panting] 别躲了……” }
- 生理语气词规范标记库(强制插入台词文本中):
- 多阶段生理语气渐变设计(Multi-stage Tone Transition Staging):
- 当角色的对白涵盖剧烈的情绪起伏或生理状态转折(例如:从压抑冷漠 -> 突发惊恐慌乱 -> 彻底崩溃大哭)时,故事板必须将台词文本进行分段/拆分编排(如 Part 1, Part 2, Part 3),并各自声明其独立的主情绪及生理状态(例如,第一段标注【冷漠克制】,第二段标注【急促喘息】,第三段标注【崩溃哭腔】)。严禁将情绪跨度极大的对白合在一个不可分割的文本长句中,以确保下游语音生成能够执行精确的分段拟真渲染与后期拼接,彻底避免单一设定导致的情感扁平。
- 旁白与内心独白的多重情绪定性:故事板规划旁白/独白时,必须显式附加包含生理动作的复合情绪标记(如:[颤抖低语并伴有深重叹息]、[哭腔抽泣且声线紧绷]、[神经质般尖锐自言自语]、[冰冷空洞的潜意识审判]),作为后续配音生成工具(TTS)的强约束情感特征参数。
- 多重幻听声谱交错逻辑(Auditory Hallucination Layout):设计专门的“今敏式多轨心理幻听”。在故事板中将幻听独立分配至至少 3 条独立的音轨(independent audio tracks)中(如 Audio_Track_Main_VO 主声轨、Audio_Track_Subconscious_Whisper 潜意识贴耳声轨、Audio_Track_Delayed_Echo 延迟回声轨),并明确其在空间与时间上的错位重叠逻辑。规定不同声轨之间必须有 0.5秒至1.5秒 的延迟差,重叠播放相同的关键词(如“醒来”、“不是我”),从而在听觉上构建出令人眩晕的潜意识旋转漩涡。
- 对白台词“非虚构化”生理与语气词精细设计:拒绝平铺直叙、完整且死板的公文式对白。角色对白必须是口语化、破碎的,且必须强制编入生理反应语气标记与微弱呼吸音,并在文本中使用高密度的省略号(“……”)代表呼吸迟滞、情绪失控下的吞咽或物理阻梗。
三、 核心元素 (Key Elements) 策划
-
角色元素 (element character): 追求人体比例和面部线条的高度写实(武藏野美大写实基底)。女性角色通常纤细但有力量;男性角色应有写实的生活疲态或焦虑感。
- 视觉一致性锚点(长视频防跑偏): 必须为主角设定一到两个在长视频中绝不发生变化的视觉特征锚点(如:红色的长围巾、标志性的金边细圆框眼镜、左眼下的泪痣),并在故事板该角色描述及后续所有相关镜头描述中强力咬合此特征,将其作为 AI 视频生成时跨镜头追踪的核心视觉线索。
- 音色一致性设定: 凡在片中有台词或旁白的发言角色,必须规划并描述其音色风格(如“沙哑疲惫的20岁都市男青年声线”或“带着神经质和紧迫感的年轻女偶像声线”),在角色属性中明确声明将使用 key_element_audio 实施跨镜声线锁定。
-
场景元素 (element scene):
- 规范化四宫格标准分配描述: 场景设计必须与绑定的多角度无人物四宫格场景参考图深度对齐。故事板在刻画特定场景时,必须涵盖并映射该场景四宫格参考图中的标准四格内容:
- 全景定场(如:现代东京密集高楼、逼仄单身公寓的宏观空间比例);
- 陈设特写(如:桌上堆积的书籍、CD、杂乱衣服等生活痕迹);
- 纵深透视(如:被切碎的电线杆长街、深不可测的拥挤走廊带来的空间压迫感);
- 气氛光效(如:便利店惨白荧光灯、黄昏暖斜照、霓虹混合光影带来的冷暖色温)。
- 时空冷暖高反差色温美学法则(场景极高反差对位): 场景的主色彩与光影色温设计必须在现实日常与梦境崩溃之间建立起强烈、递进且极具物理受动感的冷暖对比,以此直接外化主角的心理异动与人格撕裂:
- 现实日常的“低对比、局部冷暖微光冲突”:
- 单身公寓: 惨白且略带霉质感的荧光绿/青色(pale fluorescent blue-green/teal,极高色温,大面积铺设代表都市囚笼与冰冷无机现实)与书桌上台灯映射出的温暖、脆弱且暗淡的琥珀橘光(dim amber/warm orange,极低色温,局部点缀代表主角微弱的生机与孤独自守)形成激烈的局部对立。
- 便利店: 惨白刺眼、冷冰冰且无影的荧光灯白(sterile clinical white)与店外深夜漆黑、潮湿阴冷的雨夜深空(pitch-black rainy night)形成极致的干冷与湿黑明暗反差,渲染无处可逃的虚空。
- 梦境大游行的“高能饱和、猩红金黄撕裂冲突”:
- 彻底打破现实的惨白与暗淡。空间背景被高能、极度饱和的猩红(saturated neon crimson/scarlet)与眩目的琥珀金黄(vibrant amber-gold)完全占领,冷色调被彻底驱逐或压缩至极深邃的迷幻紫色(hallucinatory purple)阴影中,用极致张扬的高温色温呈现无意识狂欢爆发。
- 梦境崩溃的“高对比、虚空蓝紫与落日夕阳交织冲突”:
- 虚空都市与废墟列车: 虚空深空呈现完全死寂的宇宙黑(deep cosmic void black)或斑驳生锈的金属红褐色,大面积撕裂天空和墙壁的电光蓝、高能闪烁霓虹紫(neon violet/electric blue rifts,极高色温,代表物理空间瓦解的高维能量)同车窗外、铁轨一侧斜斜切入的最后一抹温暖、残破、甚至带有些许血色的落日余晖金黄(amber-gold sunset,极低色温,代表理智消亡前凄美的回光返照)在失重空间中大范围、立体式冲撞对立,形成极致宽广的冷暖色温交织。
- 现实日常的“低对比、局部冷暖微光冲突”:
- 规范化四宫格标准分配描述: 场景设计必须与绑定的多角度无人物四宫格场景参考图深度对齐。故事板在刻画特定场景时,必须涵盖并映射该场景四宫格参考图中的标准四格内容:
-
画中画道具元素: 专门设计电视屏幕、电脑显示器、手持镜、窗户反射等媒介元素,将其作为虚实切换和窥视感的视觉装置。
四、 镜头列表 (Shots) 深度编排
-
【镜头场景绑定硬性规范(防跳画)】: 故事板中的每一个分镜镜头(Shot)描述均必须显式标注其所属的场景元素 ID(如 [Element_Scene_X])。禁止任何镜头留空场景或含有游离不定的模糊环境描述。所有属于同一地点、房间、或同一时空的连续镜头,必须强制关联至完全相同的场景元素 ID。这从剧本设计源头上确保下游媒体生成阶段,这些分镜强制、无一例外地复用同一张多角度无人物四宫格场景参考图,彻底断绝背景在镜头切换时发生无端“跳画”和前后不一的隐患。
-
匹配剪辑与无缝转场 (Match Cut Transition) 的镜头实现:
- 在镜头描述(shot description)中明确写出过渡手法。例如:“【无缝转场设计】:镜头 A 最后的屏幕反光,在第 1 秒无缝过渡为镜头 B 的玻璃窗反射。”
-
分镜时长与节奏动态规划: 故事板分镜的单镜头(Shot)设计时长必须根据叙事节奏进行动态规划,并严格契合视频模型 Seedance 2.5(分辨率 480p) 的限制(单条视频最低 4秒,最长 30秒)。
- 日常压抑、现实沉思或平稳铺垫段落: 设计为较长的镜头(通常每镜 8-30秒),以留出充足的运镜和微表情呼吸空间。
- 日常无意识微动作与小道具把玩设计: 必须在故事板镜头中主动为主角安排无意识的身体微动作和小道具把玩(如揉眼睛、看手表、旋转/捏拿钥匙、抚摸硬币),用以作为展现角色在写实日常中神游、疲惫或内心焦虑的绝佳视觉载体。
- 心理崩溃、幻觉或梦境入侵的高速剪辑段落: 故事板规划的单个视频镜头生成时长仍必须精确设定为最低 4秒(由于模型硬限制,单镜生成不得低于4秒)。但在故事板中应明确指示后期裁剪建议(例如:标记“本镜头由 video_assembler 截取前 1-2秒进行高速拼接”),通过后续时间线硬切组装实现窒息般的极速闪回节奏。
五、 跨镜头音轨 (Audio Layers) 设计
- 背景音乐 (BGM): 根据短片的不同发展阶段(起/承 现实裂隙、转 梦境大游行、合 虚实咬合)分段或分层规划对应的背景音乐。在故事板中明确指定各阶段的乐器、调式、节拍与核心心理意境,并声明将动态调用对应的场景自适应 BGM 模板,确保音乐调性与镜头叙事深度咬合。
- 配音与旁白(物理语气与声学多层级规划): 声明发言角色的对白、喘息及旁白必须使用与其绑定的统一 key_element_audio 资产进行高逼真声音合成(采用统一音色描述符 narration_speaker_profile 承接)。
- 分级情绪设计与多轨脚本协同:
- 现实日常轨道:采用写实、冷漠、压抑的都市日常对白。脚本中强制插入中低频度的 [干咽/hard swallow]、[颤抖叹息/trembling sigh] 和省略号。
- 梦境/幻听多重重叠轨道(多音轨拼贴):对于涉及主角心理崩溃的段落,故事板中必须建立多个并行的 audio_layer。每个音轨必须显式写出空间指向标记与内容。
- audio_layer_1(中央主线区):标记 [中央主声道/dry],脚本包含主情绪对白,如:{ [吸气/sharp gasp]“我到底是谁……?[急促喘息/heavy panting]” };
- audio_layer_2(左耳幻听区):延迟 0.6s 入轨,标记 [左声道贴耳/wet-reverb, pan-left],脚本以极低的气声低语重复、嘲笑或拆解主线词,如:{ [气声/breathless]“……到底是谁……谁在笑……” };
- audio_layer_3(右耳幻听区):延迟 1.2s 入轨,标记 [右声道空间反射/wet-reverb, pan-right, pitching-up],脚本以尖锐或延迟的回声效果重合,如:{ [神经质发笑/manic giggle]“……是你……[吸气/sharp gasp]……哈哈,是你……” }。
- 分级情绪设计与多轨脚本协同:
4. 素材生成
今敏风格媒体生成与模型绑定策略:
【图像与视频生成模型唯一性硬性约束】:
- 图像生成: 严格限定只能调用 GPT Image 2。
- 视频生成: 严格限定只能调用 Seedance 2.5(分辨率 480p)(通过 MultiModalToVideo 路径)。
- 严禁任何调用 Midjourney、Seedream、Kling、Sora、Vidu、Happy Horse、Wan 等其他图像与视频生成模型的行为。在系统自制、素材重绘或视频生成时,必须严格贯彻此要求。
1. 图像资产与参考绑定策略 (GPT Image 2)
-
用户提供素材的注册、绑定与重绘策略:
- 风格与格式契合时直接绑定: 若用户上传了自定义的角色三视图(多角度设计图)或特定场景参考图,且其画质和格式符合要求(即:角色图必须是标准的全身三视图,同时包含正面、侧面、背面且均为全身图像,绝对不能是半身图、半身三视图或单角度图;场景参考图必须是无人物、多角度且具有标准四格内容分配的四宫格图像),且其画风符合今敏高度写实的手绘赛珞珞动画美学,media_generator 优先执行资产注册,将其直接绑定至故事板对应的 key_element 槽位中。
- 风格/格式不契合重绘转换机制(核心): 若判定用户上传的素材与影片美学冲突(如极简Q版、真人照片、不合规3D渲染等),或者用户上传的角色图并非全身三视图(如仅有半身像、缺少正面/侧面/背面等视角),或者用户上传的场景参考图并非多角度无人物四宫格场景参考图(包含人物、单图非网格、非标准四格分配等),media_generator 严禁直接绑定原图。必须调用 ImageToImage 图像重绘工具,选用 GPT Image 2 模型(推荐分辨率为 2K),将用户原图作为 reference_image 强引用输入:
- 重绘转换为四宫格场景参考图规则: 提示词中必须写明,严格继承用户原图的物理场景结构与色彩基调,并将其在无人物(no characters, pure scenery)的前提下,重塑为包含以下标准分配的多角度四宫格场景参考图(4-grid panel scene reference sheet)。在此 ImageToImage 重绘工具调用中,必须强制将生成画幅比例参数 (aspect_ratio) 锁定设定为 4:3,无视视频项目的全局画幅比例:
- 左上-全景定场(Wide-angle establishing shot / overall space layout)
- 右上-陈设特写(Close-up of props/furniture/indoor debris details)
- 左下-纵深透视(Deep corridor / receding perspective structure)
- 右下-气氛光效(Cinematic lighting, high contrast and key color temperature)
- 重绘转换为全身三视图人设图规则: 必须在提示词中写明继承用户上传原图的核心人设(发型特征、五官记号、服饰细节和代表色彩),并重构转化为符合今敏写实美学的角色全身三视图(在一张横向画布中同时、无分割并排展示正面、侧面、背面的全身角色形象,绝对不能生成半身图、特写图或单角度图)。在此 ImageToImage 重绘工具调用中,必须强制将生成画幅比例参数 (aspect_ratio) 锁定设定为 16:9,无视视频项目的全局画幅比例。重绘生成确认通过后,再注册并绑定为 key_element 资产。
- 重绘转换为四宫格场景参考图规则: 提示词中必须写明,严格继承用户原图的物理场景结构与色彩基调,并将其在无人物(no characters, pure scenery)的前提下,重塑为包含以下标准分配的多角度四宫格场景参考图(4-grid panel scene reference sheet)。在此 ImageToImage 重绘工具调用中,必须强制将生成画幅比例参数 (aspect_ratio) 锁定设定为 4:3,无视视频项目的全局画幅比例:
-
系统自制原画生成:
- 若用户未提供任何视觉参考图,则调用 TextToImage 图像生成工具,选用 GPT Image 2 模型(推荐分辨率为 2K)自制参考图。
- 角色原画自制: 对于主角元素,提示词中必须强制写明生成符合今敏风格的全身三视图(必须在一张图内以横向并排呈现正、侧、背三向的全身角色人设参考图,绝对不能是半身图或单角度图),确保全方位锁定人设细节、全身骨骼比例与服饰版型。在调用 TextToImage 工具时,必须强制将生成画幅比例参数 (aspect_ratio) 锁定设定为 16:9,无视并覆盖视频项目的全局画幅比例。
- 场景原画自制: 对于场景元素,提示词中必须强制写明生成一个不包含任何人物(no characters, pure scenery)的、多角度四宫格场景参考图(4-grid panel scene reference sheet),并将四个网格的内容精确固定分配为下面的四项。在调用 TextToImage 工具时,必须强制将生成画幅比例参数 (aspect_ratio) 锁定设定为 4:3,无视并覆盖视频项目的全局画幅比例,以确保四宫格中每一格都能呈现出标准的、不被拉伸变形的空间格局:
- 全景定场(整体环境、宏观比例);
- 陈设特写(陈设、家具与生活杂物道具细节);
- 纵深透视(深邃走廊、长街、纵深空间几何透视);
- 气氛光效(今敏风格的戏剧性光源对比、冷暖色温)。
-
图像一致性演变(长视频防跑偏):
- 角色在不同场景、不同表情和 looks 间变化生成时,调用 ImageToImage 工具,将上述绑定(无论是用户提供还是系统自制)的原始角色三视图/原画作为 reference_image 引用输入,锁定核心五官比例、发型与标志性配饰。
2. 角色音色一致性保持 (key_element_audio 绑定与情感拟真度提升)
-
音色资产确立与注册(注入情绪底色,具有情感弹性的样音):
- 凡涉及发言的角色,均必须在故事板中指定唯一的 key_element_audio(注册名称形式如 Character_Voice_[Name])。
- 若用户提供了配音样本,直接注册为 key_element_audio。
- 男女主角专属音色先验模板设计(自制样音核心):
若用户未提供,在 media_generator 中,选用 ElevenLabs v3(英文/写实极端情绪)或 MiniMax Speech 2.8 HD(多语言情绪)生成 5s-10s 的基准样音,必须采用以下高弹性脚本与声学锁定词,使克隆基准在声学源头上具备极端情绪表达的张力:- 女主角音色 (Anxious Tokyo Idol/Woman - Character_Voice_Female):
- 声学描述词 (narration_speaker_profile): youth female voice with high emotional volatility, vulnerable and trembling timbre, capable of transitions from cold whispers to intense gasping, choked with heavy tearful weeping
- 基准样音生成脚本: { [吸气/sharp gasp]“(惊恐地)是谁……[干咽/hard swallow]……是你吗?[哭腔/shaky sob]……别留我一个人在梦里……” }
- 男主角音色 (Fatigued Salaryman/Lost Man - Character_Voice_Male):
- 声学描述词 (narration_speaker_profile): tired mid-20s male voice with a slight raspy texture, low-pitched chest resonance, heavy breathy tail, capable of delivering slow desaturated sighs, dry throat swallows, and weary monotone whispers
- 基准样音生成脚本: { [颤抖叹息/trembling sigh]“(疲惫地)又来了……[干咽/hard swallow]……这根本不是现实……[吸气/sharp gasp]……醒来啊……” }
- 女主角音色 (Anxious Tokyo Idol/Woman - Character_Voice_Female):
- 精准生理气声停顿时间控制 (Precise Timing Boundaries for Physiological Pauses):
为保证生理语气词在声音合成时的物理真实性,必须在生成或组装时间轴中严格锁定以下静音/生理停顿毫秒级参数,杜绝喘息声与字音、说话声发生无逻辑的交叉叠压:- [吸气/sharp gasp] 停顿:吸气音结束与下一个文字音节启动之间,必须强制预留 350毫秒 - 500毫秒 的物理静音空隙,让空气吸入声(gasp)在听觉上完全独立。
- [干咽/hard swallow] 停顿:干咽标记处必须强制在音频中插入 500毫秒 - 700毫秒 的绝对静音空隙,模拟喉部肌肉收缩、声带死锁的生理停顿感。
- [哭腔/shaky sob] 停顿:在哭腔音节出现前,预留 250毫秒 - 400毫秒 的滞后切入空隙,使气流震颤与由于哽咽导致的吞咽延迟相匹配。
- [颤抖叹息/trembling sigh] 停顿:叹息音必须在句子末尾处发生,叹息音与下一个句段之间必须强制追加 600毫秒 - 900毫秒 的物理衰减静音轨迹,完全释放肺部余气。
- [气声/breathless] 停顿:在亲密贴耳或极度虚弱的台词启动前,强制插入 300毫秒 - 450毫秒 的纯空白呼吸准备段。
-
音色一致性跨镜应用与生理语气转化约束(喘息、哭腔与分段渐变):
- 视频生成端(口型同步): 视频生成调用 MultiModalToVideo (Seedance 2.5(分辨率 480p)) 时,在 input 调用的 audio_infos 参数中,必须强制绑定该角色的 key_element_audio 资产。Seedance 2.5(分辨率 480p) 模型将根据该音色和台词直接生成口型对齐且音色相同的角色发言视频镜头,保证视频内的角色原声一致。
- 音频合成端(生理标记的声学转换与多阶段语气渐变):
- 哭腔与泣不成声(Weeping & Sobbing Tone Coercion):当分镜对白标注有 [哭腔/shaky sob]、[抽泣/tearful sniffle] 等标记时,调用 generate_audio_resource 必须强制在 narration_speaker_profile 中注入声学锁定词(如 desperate weeping, choked with tears, sobbing tone, trembling vocal cords, high emotional distress),强制 TTS 引擎产生哭泣时的嗓音沙哑、声带颤动及气息受阻感,拒绝顺畅平稳的发音。
- 喘息气声的延迟与时间节奏控制(Panting & Gasping Timing Rules):对于 [急促喘息/heavy panting] 和 [吸气/sharp gasp],TTS 引擎不得将其作为文字读出,且提示词中必须写明呼吸停顿指令(如 insert natural breathy pauses, heavy gasping breath sound, no speaking during gasps)。在生成时,必须严格遵循前述的**“精密生理气声停顿时间指标”**(如吸气/gasp预留 350毫秒 - 500毫秒,干咽/swallow预留 500毫秒 - 700毫秒 的物理静音空隙),确保呼吸喘息声和对话语音具有物理上的先后顺序,严禁气声与说话声无物理逻辑地生硬叠压。
- 多阶段生理语气渐变转换(Multi-stage Emotional Dynamic Rendering - 核心):
若故事板对白被设计为多阶段情绪渐变(如:从冷漠克制 -> 突发惊恐慌乱 -> 彻底崩溃大哭),media_generator 必须强行拦截,绝对禁止将其作为单一文本长句一次性生成。系统必须根据情绪划分,拆分为独立的多段生成任务:- 阶段1(压抑日常):调用工具参数中设置语速为较慢的 speed = 0.9x,narration_speaker_profile 锁定为 hollow, cold, quiet flat voice, low chest resonance。
- 阶段2(突发慌乱):调用工具参数中设置语速为偏快的 speed = 1.15x,narration_speaker_profile 锁定为 breathless, panic-stricken, rapid speech, high-pitched vocal instability, trembling and gasping。
- 阶段3(彻底崩溃):调用工具参数中将语速设为不稳定的 speed = 0.8x,narration_speaker_profile 锁定为 desperate weeping, choked with tears, high emotional breakdown, unstable sobbing pauses。
分段生成完这几段独立的物理声学资产后,为其各自注册逻辑 asset_id,并由 video_assembler 在后期时间线上进行按序拼接和无缝焊接。
- 多轨幻听资产独立生成:针对故事板中规划的今敏式多轨幻听,media_generator 严禁合并为单一音轨。必须针对 audio_layer_1(中央主线)、audio_layer_2(左耳幻听)、audio_layer_3(右耳幻听)分别调用三次 generate_audio_resource 任务:
- 对于 audio_layer_1:使用标准音色,生成清晰的主对白音频资产。
- 对于 audio_layer_2(左耳贴面):在提示词中附加 whispering, intimate, very low breathy volume 描述,单独生成一段贴耳、气声感极强的音轨资产。
- 对于 audio_layer_3(右耳空间反射):在提示词中附加 manic, echo-like, high-pitched trembling laughter 描述,单独生成一段空洞、带有些许回音颤抖的惊惶笑声轨资产。
- 生成后置参数微调:压抑悬疑段落降低语速(0.85x)并拉长字间停顿,崩溃慌乱段落(尤其是多轨重合点)将主声轨语速调高(1.15x),幻听轨保持重叠状态,确保声学空间具有完美的今敏式层次感。
3. 视频资产生成与镜头一致性保持 (Seedance 2.5(分辨率 480p))
-
全程视频生成必须调用 MultiModalToVideo 视频生成工具,选用 Seedance 2.5(分辨率 480p) 模型。
-
视频分辨率固定输出为 480p,时长控制在 [4s-30s]。
-
跨镜头/长视频视觉与动态一致性策略 (Reference Strategy):
- 多模态视觉强绑定(防角色走样): 每一个包含特定角色或特定场景的镜头视频生成时,必须在 input 的 image_infos 中强制绑定对应的角色三视图/原画及场景 key_element 图像。不允许通过无图的 TextToVideo 生成重要角色镜头。
- 局部时空/运动强连续(镜头微调参考): 当遇到“无缝转场/匹配剪辑(Match Cut)”或相邻两镜间动作高度连贯的情况,在调用 MultiModalToVideo 时,除了绑定 key_element 图像外,必须额外将前一镜生成的 final_shot 视频资产作为 reference_video 输入。配合文本提示词指令对前后镜衔接动作进行精准微调,确保时空过渡极其平滑。
- 背景元素与光影锁定(彻底防止跳画并锁死色温反差): 在视频生成时,通过 input 的 image_infos 强制绑定对应的场景 key_element 图像作为环境基准。如果故事板中标明连续镜头处于同一场景元素下,系统在调用视频生成工具时必须百分之百绑定并复用该场景对应的同一个场景参考图(<<<image_2>>>,即多角度无人物四宫格场景参考图),从而保证长视频背景中的建筑轮廓、房间陈设摆设、家具及整体光影色温(如单身公寓内荧光绿与台灯橘的比例、便利店白与夜黑的反差、废墟车厢电光蓝与落日金的平衡)高度稳定,绝对不允许出现无场景参考的镜头生成,杜绝因未绑定、漏绑或错绑参考导致视频镜头切换时发生场景“跳画”和背景前后不一。特别注意:为彻底防止角色在连续镜头间于四宫格内不同的子场景/视角中“瞬移”跳画,且为锁死时空的色温等级,若相邻镜头属于同一具体子场景(如都在书桌前,或都在走廊深处),在编写提示词和调用生成时,必须强制指定并锁定四宫格场景图 <<<image_2>>> 的同一格(同一个具体区域/视角)作为唯一的背景与色温基准,严禁无故跳格,确保冷暖色温光比完全一致。
- 生成前置提示词自检核对规则: 在调用 MultiModalToVideo (Seedance 2.5(分辨率 480p)) 生成视频镜头前,必须强制对照分镜脚本核对提示词。核对重点:① 人物参考: 是否已绑定 <<<image_1>>> 并包含了该角色的视觉一致性锚点细节描述;② 场景参考: 是否已在 input 的 image_infos 中正确绑定该镜头对应的场景 key_element 图像(即 <<<image_2>>>),其对应的场景元素 ID 是否与前后同场景分镜保持完全一致并共用同一张场景参考图,同时提示词内是否描述了与场景参考图相符的光影/色彩系统;且当相邻镜头属于同一具体子场景时,是否在提示词中强制锁定并复用了四宫格场景参考图 <<<image_2>>> 中的同一格(同一个具体区域/视角),并确保该镜头的冷暖色温配比、光比比例与画面色调严格对齐对应场景公式中的美学法则,防止发生冷暖颠倒或色彩失衡;③ 台词对白: 镜头若有台词,是否已用 {} 正确包裹,台词文本是否完整无误,是否关联引用了该角色的 key_element_audio;④ 声效/节拍: 特殊声效与背景节拍是否按规范用 <> 或 () 正确包裹。若发现遗漏或不一致(尤其是同场景镜头的场景参考绑定不统一、相邻镜头锁定网格不一致、或色温色彩描述有偏差),严禁直接生成,必须重写补全。
4. 音乐资产生成与氛围锁定策略 (BGM & Instrumental Music)
-
工具与模型选择: 统一调用 text_to_instrumental 音乐生成工具,首选 Suno 5 或 Mureka 8 模型。
-
三套场景自适应动态生成机制: 必须结合故事板分镜当前所处的发展阶段(起、承、转、合)和情绪走势,在编写音乐生成提示词时动态匹配并调用专属于该场景的声学模板:
- 【心理悬疑】阶段(现实裂隙): 重点提取低频合成器铺底、时钟滴答与破碎竹笛,营造压抑紧迫感。
- 【狂欢游行】阶段(梦境爆发): 重点堆叠狂乱太鼓、明亮合成器琶音、歌剧合唱,引爆潜意识失控狂热。
- 【时空史诗】阶段(虚实咬合): 重点组合怀旧弦乐、未来感音序器与高亢歌剧 solo,渲染看透虚实的大气释怀感。
-
提示词规避限制: 在编写 BGM 音乐生成提示词时,严禁包含任何著名音乐艺术家、歌手或乐队的真实姓名(如“平泽进/Susumu Hirasawa”等),以防触发 Suno 5 的安全合规拦截导致生成失败。必须根据上述三大模板的声学物理词进行对位拆解和生成。
5. 画质高精重塑与超分辨率策略 (Super-Resolution - 高帧率流畅梦境方案)
-
图像超分辨率(画人设图/场景参考图阶段):
- 生成的角色全身三视图或多角度场景参考图,推荐在绑定前调用 super_resolution 工具,选用 Jimeng SR 模型进行画质重塑。
- 参数规范: 图像分辨率参数(resolution)必须设定为 4k,像素重构细节级别(scale)设定为 50。这可以极大增强手绘赛璐珞线条的锐利度与色彩纯度,为视频生成器提供最纯净、高清晰度的视觉先验参考。
-
视频超分辨率(分镜视频总装前阶段):
- 最终分镜视频生成后,或在最终剪辑组装前,推荐针对关键视频镜头调用 super_resolution 工具,选用 MediaKit 模型进行画质与帧率重塑。
- 参数规范: 视频分辨率参数(resolution)锁定为 1080p(若由于会员权限等限制,也可自适应降级为 720p 等其他下游支持的分辨率),视频帧率(fps)必须设定为 60。以高帧率保障流畅、丝滑的视觉动态,完美呈现今敏风格中梦境大游行、空间扭曲与折叠等高速运镜及动作切换。
5. プロンプト作成
今敏导演风格多模态提示词(Prompt)撰写指南:
1. 图像生成提示词公式(GPT Image 2)
- 角色全身三视图人设图(TextToImage / ImageToImage):
- 公式: [角色核心人设描述] + character sheet, full body model sheet, 3 view rendering showing front view, side view, and back view simultaneously side-by-side, clean white background, 武藏野美大 90s hand-drawn cel anime style, visible hand-drawn charcoal pencil outlines, organic cel-paint texture, tactile paper grain, high-precision hand-inked cel-shading without digital gradients, desaturated 90s retro film color wash, highly realistic facial proportions, extremely detailed anime key art --ar 16:9
- 注意: 绝对禁止加入任何网格分割线或不连贯背景,确保在一幅画布中无缝并排放置,锁定纯手绘有机笔触,锁定角色核心视觉一致性锚点。
- 多角度无人物四宫格场景图(TextToImage / ImageToImage):
- 公式: pure scenery with no characters, 4-panel split grid reference sheet, panel 1 (wide-angle establishing shot of [场景名], asymmetric framing with dramatic negative space, split-level vertical layering, organic watercolor wash), panel 2 (macro close-up of domestic furnishings and props, shallow depth-of-field, dusty paper grain texture, tactile cel-paint layering), panel 3 (deep receding linear perspective corridor, off-center lens alignment, cold metallic industrial tones clashing with warm-tinted pools of light, visible ink outlines), panel 4 (dramatic cinematic lighting with high-contrast desaturated shadows and extreme temperature clash, muted retro film color palette with a 90s vintage warm-tinted wash, 85% teal and 15% amber ratio), Tokyo urban realism, Satoshi Kon anime style, visible hand-drawn outlines, organic paper texture overlay, highly detailed cel animation environment --ar 4:3
- 注意: 强行在公式头部锁死“无人物”指令,并在提示词中通过排版构图与质感修饰词(如 asymmetric framing, watercolor wash, paper grain, desaturated shadows)清晰划分各网格的物理美学。
2. 视频生成提示词与画面物理动作死锁公式(Seedance 2.5(分辨率 480p) - MultiModalToVideo)
- 角色生理与口型物理同步机制(核心): 当镜头包含对白台词、省略号或生理语气词(如喘息、干咽、大笑、哭腔)时,视频提示词中必须用英文精确描摹相应的面部肌肉、下颌、嘴唇及体腔呼吸动作,实现声音与视觉画面的像素级物理拟真对齐:
- 对白喘息与气声(Gasping & Whispering):lips slightly parted in a quiet breathless gasp, chest rising and falling rapidly in sync with heavy breathing, eyes trembling, delicate mouth-sync motion representing shaky speaking
- 吞咽与干咽(Swallowing / Hesitation):throat muscles visibly contracting in a hard swallow, trembling lower lip, mouth opening and closing hesitantly as if struggling to find words
- 哭腔、抽泣与悲泣面部动作(Weeping, Sobbing & Tearful Facial Movements - 悲痛情感对齐):lips trembling violently, mouth gasping slightly as if choked by tears, subtle sniffle causing the nostrils to flare briefly, chest heaving unevenly, tearful glint in the wide eyes, throat muscles contracting rapidly to swallow a sob, capturing a raw emotional breakdown and painful weeping sync
- 神经质笑意(Manic Laughter / Disorientation):eyes widening in psychological panic, a subtle manic and nervous twitching grin forming, mouth opening in hysterical laughter, facial muscles showing sudden tension and madness
- 瞳孔微缩与微颤(Pupil Constriction & Eye Trembling - 极端窥视与惊恐反应):
- 瞬间惊惧微缩:extreme close-up of a single eye, the pupil constricting suddenly to a tiny pinprick, the iris trembling with psychological shock, rapid micro-saccades, subtle twitching of the lower eyelid, veins slightly visible in the sclera, capturing the raw terror of sudden realization
- 虚实破裂微缩:sudden dramatic contraction of the pupil, constricting rapidly into a small black dot, reflecting a flickering light, eyelids twitching in silent terror, capturing an intense moment of psychological realization
- 心理惊恐与面部肌肉死锁(Psychological Panic & Facial Muscle Lock - 惊悚特写定格):
- 窒息式惊恐死锁:facial muscles locking in sudden rigid terror, eyebrows drawing tightly together and upward, vertical lines forming between the brows, the jaw freezing slightly open, subtle twitching around the corners of the mouth, pale skin with beads of cold sweat forming along the hairline, capturing an expression of profound existential dread
- 绝望麻痹死锁:a paralyzed facial expression of sheer panic, muscles around the eyes and mouth tightening into a rigid frozen state, cold sweat glistening on the forehead, the corners of the mouth twitching downward, expressing a trapped and helpless psychological breakdown
- 四宫格场景子区域锁定句式:
- 走廊/深空间:specifically expand and lock onto the deep perspective from the bottom-left panel of <<<image_2>>> as the background space of this unified shot, keeping the background extremely consistent with the previous shot.
- 书桌/陈设特写:specifically implement and lock onto the desk and furnishings details from the top-right panel of <<<image_2>>> as the background space of this unified shot, ensuring zero scene displacement from the previous shot.
- 今敏式无缝转场(Match Cut)画面物理动作死锁句式(核心):
- 瞳孔穿梭推镜头转场(Pupil Zoom-In/Push Transition):
- 转场前镜(A镜:吸入)提示词物理描述: extreme close-up of a single eye, camera rapidly zooms in along an exponential speed curve, pushing deep into the pupil's center with extreme radial motion blur, the pitch-black pupil expanding exponentially at 2.0x velocity to consume 100% of the screen, shifting focal depth directly into the iris, sub-pixel centered axis alignment, transforming the entire frame into a deep black void in the final frame, smooth seamless transition
- 转场后镜(B镜:展开)提示词物理描述: camera starts inside a complete pitch-black void, then smoothly pulls back along an inverse-exponential curve (deceleration) with 3D spatial alignment, revealing [next scene space] expanding outward from the sub-pixel exact center of the screen, shifting from a narrow pinhole depth-of-field to deep-focus composition, seamless wormhole transition matching the previous pupil axis
- 镜面与反射介质过渡转场(Mirror & Reflection Transition):
- 虚实交织镜面(A镜)提示词物理描述: starting with a sharp mirror reflection of the character's face on [reflective surface], camera initiates a slow linear dolly-in with subtle parallax shift (0.05m offset per second) between the reflective plane and the deep background, slowly shifting focal range from the glass surface to the distorted, surreal environment emerging from behind, matching 1:1 scale, seamless transition
- 镜面穿梭切入(B镜)提示词物理描述: camera pushes straight through the reflective boundary, camera motion perfectly aligned on the sub-pixel translation vector, transitioning seamlessly as the surface reflection dissolves and the physical space of [next scene] expands, shifting perspective from 2D reflection plane to deep 3D physical coordinate space, zero positional drift, rendering the transition boundary completely invisible
- 瞳孔穿梭推镜头转场(Pupil Zoom-In/Push Transition):
- 潜意识隐喻道具在虚实切换中的画面物理描述公式(核心):
- 复古时钟/闹钟的梦境异化转场 (Metaphorical Clock Transition):
- 前镜(A镜:现实稳态)物理描述: extreme close-up of a vintage mechanical brass clock on a wall, the clock hands ticking steadily and realistically under natural lighting, sharp cel-shaded lines, 武藏野美大 90s hand-drawn cel anime style
- 后镜(B镜:梦境异化)物理描述: extreme close-up of a warping clock, the clock hands melting and flowing downwards like liquid wax, the mechanical gears inside spinning violently in reverse direction under a hallucinatory golden glow, smooth seamless transition
- 红色蜡烛的潜意识扭曲转场 (Melting Red Candle Transition):
- 前镜(A镜:现实稳态)物理描述: close-up of a burning red wax candle, a steady warm yellow flame flickering gently, casting realistic soft ambient shadows, highly detailed hand-drawn texture, Satoshi Kon style
- 后镜(B镜:梦境异化)物理描述: close-up of a melting red candle, the flame transforming into a tiny blinking neon-crimson eye, hot scarlet wax dripping rapidly in reverse gravity, floating upwards into small blood-like droplets, changing to a surreal hallucinatory glow, seamless transition
- 无表情木偶/玩偶的活化异化转场 (Expressionless Puppet Awakening):
- 前镜(A镜:现实稳态)物理描述: medium close-up of an expressionless porcelain doll sitting static on a wooden shelf, covered in fine dust under pale cold fluorescent light, depressing contemporary Tokyo realism
- 后镜(B镜:梦境异化)物理描述: medium close-up of the porcelain doll, its glass eyes suddenly twitching and rotating to look directly at the camera, a creepy and subtle manic grin slowly widening on its painted mouth, shadows warping around its silhouette, intense psychological tension
- 穿衣镜与手机屏幕的虚实碎裂转场 (Mirror/Phone Screen Shattering Transition):
- 前镜(A镜:分裂/变态)物理描述: close-up of a character staring at [reflective surface, e.g., a hand mirror / a cracked smartphone screen], the reflection slowly drifting out of sync by half a second with a creepy smiling expression, or the screen text warping into a digital river of glowing binary code, Satoshi Kon style, intense psychological tension
- 后镜(B镜:碎裂/崩塌态)物理描述: extreme close-up of the glass mirror or phone screen suddenly shattering, hundreds of tiny glass shards blasting outward along explosive radial velocity vectors, each fragment possessing a high angular rotational speed (spinning rapidly at 180 degrees/sec) in 3D spatial turbulence, each shard reflecting a different tiny distorted fragment of the character's wide-open panicking eyes with progressive motion blur relative to velocity, pieces slowly drifting upwards in zero gravity, split focal depth layers across the shattered plane, electric blue spacetime fissures glowing in the background, seamless transition
- 复古时钟/闹钟的梦境异化转场 (Metaphorical Clock Transition):
- 多模态绑定前缀: 在提示词头部强力声明:Referencing the character design in <<<image_1>>> for the primary subject, and matching the background style, layout, and colors from <<<image_2>>>.
- 包装语法约束: 视频提示词尾部强制绑定 Seedance 2.5(分辨率 480p) 专用包装符:
- 音效以 <...> 包裹(如 <heavy breathing panting>);
- 配音台词以 {...} 包裹(如 {怎么会这样……我不是已经醒来了吗?});
- 隔离指令(避免污染):由于旁白配音与BGM已拥有独立的 audio_layer 轨道,视频生成提示词中必须强制加入负向排除词 no background music, no text captions, raw atmospheric audio only,防止生成重复杂音。
3. 现实日常场景(压抑公寓、荧光灯便利店)视觉公式(GPT Image 2 & Seedance 2.5(分辨率 480p))
- “压抑单身公寓”专属四宫格场景图公式(GPT Image 2):
- 公式: pure scenery with no characters, 4-panel split grid reference sheet, panel 1: wide-angle establishing shot of a cramped messy single apartment room, stacks of unwashed dishes and messy clothes on floor, panel 2: macro close-up of a cluttered work desk with scattered pill bottles, a glowing phone screen, and trash, panel 3: deep receding perspective from a claustrophobic hallway looking into the dark room, panel 4: dramatic cinematic lighting with a cold, oppressive pale fluorescent blue-green teal wash (85% area) clashing sharply with a single warm, lonely dim amber-orange desk light pool (15% spot), casting long, deep melancholic desaturated shadows, Tokyo urban isolation, Satoshi Kon style, highly detailed cel animation environment --ar 4:3
- 色彩与美学法则(低对比冷暖对抗): 画面色调必须被强行锁定在大面积冷色调的惨白荧光绿/青色(pale fluorescent blue-green/teal,占主导面积~85%,外化现代都市逼仄空间的无机压抑) 与 温暖孤独的黄昏台灯光/电脑屏幕微光(dim amber/warm orange,占局部点缀~15%,代表残存的人性温度与焦躁防线) 的高反差冲突中。阴影区域呈深沉压抑的灰黑色,用微弱的温差交织,渲染都市人极端封闭、压抑且孤独的心理暗流。
- “荧光灯便利店”专属四宫格场景图公式(GPT Image 2):
- 公式: pure scenery with no characters, 4-panel split grid reference sheet, panel 1: wide-angle establishing shot of a brightly lit empty convenience store interior, long aisles with shelves of colorful products under sterile lights, panel 2: macro close-up of refrigeration glass shelves with canned drinks showing condensation droplets, panel 3: deep receding linear perspective looking down the store aisle toward the glass doors showing dark rainy streets outside, panel 4: cold clinical lighting under flickering overhead white fluorescent tube lights casting a sterile white glare (90% dominance), stark high-contrast clash with the pitch-black cold rainy night visible through the glass door (10% edge), harsh reflections on steel and glass surfaces, lonely Tokyo urban atmosphere, Satoshi Kon style, highly detailed cel animation environment --ar 4:3
- 色彩与美学法则(极干冷高反差对比): 画面色调必须被锁定在大范围刺眼惨白的荧光灯白(sterile clinical white/flickering fluorescent light,占~90%) 与 店外深夜冷寂无垠的雨夜漆黑(pitch-black rainy night,占~10%) 的极高反差明暗对比中。便利店内部高饱和多彩商品所散发出的无序杂色,同冰冷刺骨的主光源白光、店外死水般的深渊漆黑交织,产生强烈的心理惊悚级反差,烘托出角色在冷光暴晒下无处躲藏的空虚与惊惶。
- “现实日常场景”分镜视频镜头提示词公式(Seedance 2.5(分辨率 480p) - MultiModalToVideo):
- 公式: Referencing the character design in <<<image_1>>> for the primary subject, and matching the background style, layout, and colors from <<<image_2>>>. + [分镜特定主体与镜头动态描述] + depressing contemporary Tokyo realism, heavy sense of urban isolation, quiet melancholic atmosphere + subtle cinematic lighting, harsh cool fluorescent glare, deep shadows, rich atmospheric details + slow static shot or very slow camera push-in, 武藏野美大 90s hand-drawn cel anime style, Satoshi Kon style, highly detailed key art, fluid motion + no background music, no text captions, raw atmospheric audio only
- 多模态与细节死锁(日常生活流):
- 四宫格场景子区域锁定句式:
- 单身公寓乱桌前:specifically implement and lock onto the desk and furnishings details from the top-right panel of <<<image_2>>> as the background space of this unified shot, ensuring zero scene displacement from the previous shot.
- 便利店长通道:specifically expand and lock onto the deep perspective from the bottom-left panel of <<<image_2>>> as the background space of this unified shot, keeping the background extremely consistent with the previous shot.
- 角色疲惫、走神与无意识日常微动作物理死锁: 角色在日常压抑中的心理异动,必须通过眼角下垂、无神空洞凝视、缓慢无力的叹息、无意识揉眼睛、焦虑地看手表、或紧张地把玩钥匙/硬币等身体与手部道具动作进行精准刻画:
- 走神与分裂: tired eyes with dark circles under eyes, blank vacant expression reflecting extreme psychological fatigue, a slow subtle sigh with mouth slightly open and shoulders slumping down, subtle reflections on the window glass showing a double of the self
- 无意识揉眼睛: unconsciously rubbing tired closed eyes with a hand, shoulders slightly slumping, head slightly tilted down in deep exhaustion
- 焦虑看手表: unconsciously glancing down at a wristwatch on the wrist with a subtle anxious frown, fingers gently grazing the clock face
- 把玩钥匙/硬币: fingers nervously fidgeting and playing with a set of brass keys, constantly turning and twisting the keys, subtle metallic glints capturing the dim room light
- 画中画窥视与边缘遮挡框架物理死锁公式(Peeping & Frame-in-Frame Obstruction): 当镜头表现窥视感时,提示词必须在 Subject 和 Camera 描述中,强行咬合遮挡物的物理材质、透光度及画中画框架的几何构图,实现声画物理同构:
- 百叶窗遮挡窥视(Blinds Obstruction): looking through the horizontal slats of partially open window blinds, dramatic linear shadows of blinds slicing diagonally across the room and character's face, frame-in-frame composition, heavy foreground blinds obstruction, extremely blurry foreground slats, voyeuristic slow camera drift
- 门缝/玄关夹缝窥视(Door Gap / Narrow Crevice): camera positioned deep inside a pitch-black hallway looking through a slightly ajar door, narrow vertical sliver of light revealing the brightly lit room, voyeuristic POV, heavy dark door frame occupying 70% of the screen as a thick black frame, focus on the distant character, psychological claustrophobia
- 前景杂物虚化遮挡(Cluttered Edge Obstruction): voyeuristic high-angle POV looking from behind blurred vertical rust-stained pipes and hanging wires, heavy foreground clutter obstruction in the corner of the frame, capturing the character walking below, handheld camera tremor
从而让 Seedance 2.5(分辨率 480p) 完美呈现日常生活流下的心理暗流。
- 四宫格场景子区域锁定句式:
4. “梦境大游行”狂乱祭典感与红黄迷幻色调视觉公式(GPT Image 2 & Seedance 2.5(分辨率 480p))
-
“梦境大游行”专属四宫格场景图公式(GPT Image 2):
- 公式: pure scenery with no characters, 4-panel split grid reference sheet, panel 1: wide-angle establishing shot of an endless surreal parade street with glowing red neon signs and golden festival lanterns, panel 2: macro close-up of grotesque parade objects like marching tea kettles and brass trumpets, panel 3: deep receding linear perspective of a street warped by swirling red and yellow light, panel 4: dramatic cinematic lighting with high-contrast saturated neon crimson and vibrant amber-gold clash, Tokyo surrealism, Satoshi Kon style, highly detailed cel animation environment --ar 4:3
- 色彩与美学法则: 画面主色调必须被强行锁定在极度饱和的猩红色 (saturated neon crimson/scarlet) 与明亮炫目的琥珀金黄 (vibrant amber-gold/fiery yellow) 的戏剧性对比中,背景配合少许深邃的迷幻紫色 (hallucinatory purple) 阴影,用极高对比度的明暗光影、漫天飞舞的金色火星与热浪烟雾渲染不详而又狂热的梦境狂欢氛围。
-
“梦境大游行”分镜视频镜头提示词公式(Seedance 2.5(分辨率 480p) - MultiModalToVideo):
- 公式: Referencing the character design in <<<image_1>>> for the primary subject, and matching the background style, layout, and colors from <<<image_2>>>. + [分镜特定主体与镜头动态描述] + frantic dream parade carnival, a massive chaotic procession of grotesque objects, marching band of hollow-eyed porcelain dolls, giant grinning frogs beating traditional taiko drums, waving golden beckoning cats, floating telephone poles drifting in a warped crimson sky, distorted streetlights, chaotic crowd of faceless onlookers + saturated psychedelic red and yellow color palette, surreal neon crimson glow, golden amber sparks, swirling heavy smoke, melting physical reality, extreme hallucinatory atmosphere + [狂乱运动美学运镜物理描述] + 武藏野美大 90s hand-drawn cel anime style, Satoshi Kon masterpiece, highly detailed key art, fluid motion + no background music, no text captions, raw atmospheric audio only
- 多模态与细节死锁:
- 提示词头部必须显式声明提取 <<<image_2>>> 的指定网格(如 specifically expand and lock onto the chaotic festival perspective from the bottom-right panel of <<<image_2>>> as the background space of this unified shot),使角色在连续镜头间拥有完美咬合的子场景空间。
- 角色在游行中的恐慌或被梦境吞噬的狂热状态,必须通过眼部急遽放大、嘴角抽搐、神经质笑意与面部肌肉物理动作死锁(如 wide-open eyes in psychological panic, a nervous manic grin twitching in sync with hysterical laughter, facial muscles displaying intense tension and madness)与配音台词包装符 {...} 紧密锚定,用画面物理动态将狂乱感演绎到极致。
- “梦境大游行”狂乱运动美学运镜物理死锁公式(低角度俯仰、眩晕旋转、倾斜构图): 当镜头描述需要强化狂欢段落的运镜时,必须将以下特定的英文描述段落拼接入视频提示词中,使 Seedance 2.5(分辨率 480p) 生成具有强烈空间失衡感的运动画面:
- 低角度仰拍与动态俯仰 (Low-Angle Pitching & Tilt): dynamic extreme low-angle tracking shot, tilting and panning dramatically from street level up towards the towering colossal puppet floats, capturing the giant distorted figures marching overhead against a swirling crimson and gold sky, monumental scale perspective, intense visual oppression (从街面极端低角度向上的仰拍与动态俯仰,极力放大高耸怪诞人偶的尺度压迫,展现红黄扭曲天空下行进的庞然大物,渲染纪念碑式的心理巨压)
- 眩晕式360度螺旋旋转运镜 (Dizzying 360-Degree Spiral Rotation): disorienting 360-degree Dutch roll and spiral camera rotation, spinning rapidly on a central axis around the character, the surrounding neon signs, parade lights, and grotesque floats blurring into swirling chaotic trails, rendering extreme psychological vertigo and sensory overload (绕角色中心视轴进行的 360 度倾斜滚转与螺旋形圆周旋转,使周围的霓虹招牌、祭典花车融为眩晕的光影轨迹,展现极端心理眩晕与感官过载)
- 倾斜构图与不平衡斜角追踪 (Extreme Dutch Angle Tilt & Diagonal Tracking): heavily tilted Dutch angle shot, imbalanced composition with the camera canted at a steep 45-degree angle, destabilizing the horizon line, tracking the fast chaotic parade movement diagonally across the screen, casting long warped slanted shadows, representing loss of physical and mental balance (机位陡倾 45 度的极端倾斜构图,使地平线彻底失衡,沿对角线方向追踪队伍行进,拉长扭曲的斜向投影,传递物理与精神失衡感)
5. “梦境崩溃与虚实坍塌”超现实碎裂几何视觉公式(GPT Image 2 & Seedance 2.5(分辨率 480p))
-
“梦境崩溃·虚空都市”专属四宫格场景图公式(GPT Image 2):
- 公式: pure scenery with no characters, 4-panel split grid reference sheet, panel 1: wide-angle establishing shot of a crumbling Tokyo city with shattered concrete ground and gaping space-time cracks revealing a swirling deep cosmic void, panel 2: macro close-up of shattered glass mirrors and building debris floating upwards in zero gravity, panel 3: deep receding linear perspective of a city corridor splitting apart with massive dark fissures glowing with neon purple and electric blue light, panel 4: dramatic cinematic lighting with high-contrast high-energy electric blue and fluorescent violet spacetime rifts (60% dominance) clashing violently with brilliant saturated neon crimson flares and burning amber sparks (40% clash) against a deep void black background, floating glass mirror shards reflecting tiny warped fire fragments, Satoshi Kon surrealism style, highly detailed cel animation environment --ar 4:3
- 色彩与美学法则(极高反差高能冷暖撕裂): 画面色调必须被强行锁定在冷色调的高能电光蓝、荧光霓虹紫时空裂口(electric blue/neon violet rifts,占~60%,极高色温代表高维时空物理剥离的撕裂能量) 与 大范围不祥闪烁的猩红狂澜、燃烧的琥珀火星(saturated neon crimson flares/burning amber sparks,占~40%,极低色温代表意识崩溃时的狂乱怒火与潜意识余烬) 的宏大冷暖撕裂对立冲突中。背景死锁在纯粹空洞的深邃虚空黑(deep cosmic void black)中,冷暖强对比以绝无仅有的色彩张力,渲染心智彻底粉碎倒塌的窒息感。
-
“梦境崩溃·废墟列车与失重铁轨”专属四宫格场景图公式(GPT Image 2):
- 公式: pure scenery with no characters, 4-panel split grid reference sheet, panel 1: wide-angle establishing shot of an abandoned rusty train cabin sitting on shattered railway tracks floating in a void of swirling space-time cracks, panel 2: macro close-up of train interior with shattered windows, floating seat cushions and debris drifting upwards in zero gravity, panel 3: deep receding linear perspective looking down the empty rusted train aisle with passenger seats warping and twisting, panel 4: dramatic cinematic lighting with a stark, violent clash between crackling high-voltage electric blue electromagnetic fissures (70% cold dominance) slicing through the cabin and warm, thick, heavy amber-gold sunset light (30% warm contrast) pouring slantedly from shattered window frames, casting sharp contrasting shadows on floating zero-gravity debris, Tokyo realism in decay, Satoshi Kon surrealism style, highly detailed cel animation environment --ar 4:3
- 色彩与美学法则(极致高反差夕阳与电光交织): 画面色调必须被强行锁定在车厢内割裂虚空、刺骨冰冷的电光蓝电磁裂纹(electric blue fissures,占~70%,极高色温象征冷酷无情的空间剪裂与理智死亡) 与 从车窗、铁轨缝隙中斜斜洒入、浓重黏稠的琥珀落日夕阳暖金(warm amber-gold sunset light,占~30%,极低色温象征生命消亡前凄美的黄昏救赎与最后一抹执念残温) 的极端高反差冷暖色温冲突中。冷暖边界极其锋利(sharp boundary),将日常电车车厢在零重力下的废墟化,雕琢为一幕充满悲美史诗挽歌质感的物理瓦解。
-
“梦境崩溃·通用都市坍塌”分镜视频镜头提示词公式(Seedance 2.5(分辨率 480p) - MultiModalToVideo):
- 公式: Referencing the character design in <<<image_1>>> for the primary subject, and matching the background style, layout, and colors from <<<image_2>>>. + [分镜特定主体与镜头动态描述] + apocalyptic dream collapse, the physical reality shattering into floating jigsaw pieces, massive space-time cracks fracturing the sky like broken glass, ground cracking open and collapsing into a bottomless glowing violet abyss, cars and telephone poles breaking apart and drifting upwards in zero gravity, swirling vortex of wind and neon dust, disintegrating building facades + dark hallucinatory violet and deep indigo palette, blinding electric blue flashes, glowing purple fissures, floating glass shard reflections + dizzying camera rotation, panning low-angle tilting shot, Dutch angle, violent screen shake, 武藏野美大 90s hand-drawn cel anime style, Satoshi Kon masterpiece, highly detailed key art, fluid motion + no background music, no text captions, raw atmospheric audio only
- 多模态与细节死锁:
- 四宫格场景子区域锁定句式:
- 坍塌走廊/深空裂隙:specifically expand and lock onto the fracturing corridor perspective from the bottom-left panel of <<<image_2>>> as the background space of this unified shot, ensuring zero scene displacement from the previous shot.
- 碎玻璃/漂浮陈设:specifically implement and lock onto the floating shattered glass shards and debris details from the top-right panel of <<<image_2>>> as the background space of this unified shot, keeping the background extremely consistent with the previous shot.
- 角色极端恐慌与反物理失重动态死锁: 角色在梦境坍塌中的极端恐慌、失重或与虚无正面冲突的状态,必须通过眼球急遽放大颤动、张口无声惊呼或躯体在无重力下的漂浮翻滚动作进行像素级刻画:
- 无声恐惧与瞳孔颤动: wide-open eyes with pupils dilated and trembling in extreme terror, mouth open in a silent scream with head tilted backwards, hair and clothing floating upwards and drifting wildly in zero gravity
- 失重悬浮漂浮: primary subject weightlessly floating upside down in zero gravity, body slowly turning and spinning, arms outstretched reaching for vanishing shattered particles of reality, hair drifting in slow motion
- 四宫格场景子区域锁定句式:
-
“梦境崩溃·废墟列车与失重铁轨”分镜视频镜头提示词公式(Seedance 2.5(分辨率 480p) - MultiModalToVideo):
- 公式: Referencing the character design in <<<image_1>>> for the primary subject, and matching the background style, layout, and colors from <<<image_2>>>. + [分镜特定主体与镜头动态描述] + surreal abandoned railway collapse, a rusted train cabin splitting apart, floating metal plates and railway tracks drifting upwards in zero gravity, massive glowing blue electromagnetic fissures slicing through the train walls, train passenger seats warping and twisting in slow motion, shattered glass shards floating like glittering dust + high-contrast electric blue energy flashes clashing with amber-gold sunset light, deep violet shadows, melting metal textures, intense hallucinatory atmosphere + [失重列车/镜头运镜描述] + 武藏野美大 90s hand-drawn cel anime style, Satoshi Kon masterpiece, highly detailed key art, fluid motion + no background music, no text captions, raw atmospheric audio only
- 多模态与细节死锁:
- 四宫格场景子区域锁定句式:
- 废墟车厢深处/纵深过道:specifically implement and lock onto the warping train aisle perspective from the bottom-left panel of <<<image_2>>> as the background space of this unified shot, keeping the background extremely consistent with the previous shot.
- 悬空铁轨/碎裂车窗:specifically expand and lock onto the floating tracks and shattered debris details from the top-right panel of <<<image_2>>> as the background space of this unified shot, ensuring zero scene displacement from the previous shot.
- 角色在失重列车中的虚空漂浮与惊恐反应:
- 车厢失重漂浮物理死锁: primary subject weightlessly floating upside down inside the drifting train cabin, body slowly spinning in zero gravity, hair and clothing floating upwards, eyes wide-open in psychological panic with pupils dilated, hands reaching out toward floating glass shards reflecting glowing blue fissures, capturing absolute disorientation in a crumbling physical reality
6. 平泽进式场景自适应背景音乐(BGM)提示词模板(Suno 5 / Mureka 8)
- 车厢失重漂浮物理死锁: primary subject weightlessly floating upside down inside the drifting train cabin, body slowly spinning in zero gravity, hair and clothing floating upwards, eyes wide-open in psychological panic with pupils dilated, hands reaching out toward floating glass shards reflecting glowing blue fissures, capturing absolute disorientation in a crumbling physical reality
- 四宫格场景子区域锁定句式:
-
【心理悬疑】篇: eerie slow tempo instrumental music, shivering low-frequency synthesizer drone pads, slow ticking mechanical clockwork rhythm, sporadic shivering Japanese shakuhachi flute, breathless whispers drifting in the background, creeping psychological dread, dark ambient suspense theme, high-contrast emotional tension
-
【狂欢游行】篇: upbeat 135bpm frantic energetic theatrical march, massive driving tribal drum beats, heavy chaotic traditional Japanese taiko drum rhythms, bright flashing synthesized techno arpeggios, overlapping ecstatic theatrical vocal chanting, chaotic brass sections clashing, divine madness, subconscious parade festival theme
-
【时空史诗】篇: nostalgic majestic cinematic orchestral strings, epic driving retro synthesizer sequencer loop, futuristic arpeggiators running fast, sacred soaring operatic female vocal solo, profound spiritual release, transcending time and space theme, emotional and sweeping resolution
-
限制: 绝对禁止在提示词中包含“Susumu Hirasawa”、“平泽进”或任何著名乐团名称,完全通过上述声学物理与乐器排列词来再现大师风格。
6. 動画編集
今敏风格视频时间线组装与节奏规范:
-
心理剪辑节奏 (Psychological Montage Pacing) 与视频裁剪及时间重映射规范:
-
【高潮蒙太奇时序递减硬切规则(Montage Hard Cuts)】:
在大游行、梦境崩溃等高潮心理段落中,组装器必须强行打破常规匀速剪辑,部署时序递减数学剪辑骨架(Descending Dynamic Rhythm)。通过极速无过渡硬切(100% Straight Hard Cuts,严禁使用任何淡入淡出、划像、叠化、黑场过渡等桥接手段),在极短时间轴内对用户感官进行高密度的心理重击:- 递减帧长控制(以 24fps 帧率为物理基准):
一组高潮段落的切分链条必须遵循以下帧长度递减序列:镜头 1(48帧 / 2.0秒) -> 镜头 2(36帧 / 1.5秒) -> 镜头 3(24帧 / 1.0秒) -> 镜头 4(12帧 / 0.5秒) -> 镜头 5 至 8(每镜固定在 6-8 帧 / ~0.25秒 - 0.33秒,极致闪回),形成螺旋向下的感官压迫感。 - 三轨交替插切与隐喻道具锚定(Inter-cutting & Symbolic Anchoring):
在高潮极速闪回链中,组装器必须按序将以下三类截然不同的视觉图层进行交替插切,以碎片化的拼贴模拟心智的解体:- 图层 A(角色受动/微表情特写): 聚焦于主角惊恐瞪大的双眼、微缩颤动的瞳孔、下颌抽搐、或颤抖捏衣服的极限特写。
- 图层 B(环境崩塌/狂乱大游行): 狂乱行进的怪诞人偶、扭曲错位的重彩长街、倒塌浮空的建筑 facade、或带电光蓝的时空裂缝。
- 图层 C(潜意识隐喻道具异变态): 熔化滴落的闹钟齿轮、眨眼发光的红蜡烛、自动折叠起舞的木偶。
插切链条公式: [图层 A] -> [图层 B] -> [图层 C] -> [图层 A 极窄局部] -> [图层 B 极速位移] -> [图层 C 物理瓦解],用规律的视觉符号跳跃,为无序的混乱提供潜意识叙事锚点。
- 递减帧长控制(以 24fps 帧率为物理基准):
-
【生成视频多模式动态裁剪与重映射(Sub-clip Extraction & Remapping)】:
鉴于模型生成的原始镜头最低时长限制(Seedance 2.5(分辨率 480p) 强制最低生成 4 秒),组装器绝对禁止将 4 秒以上的视频整段铺在时间轴上,必须应用以下高精度的子片段提取与变加速物理法则进行二次重塑:- 峰值速度段提取(Peak Velocity Extraction - 用于运镜/大范围运动):
若故事板镜头包含 360 度旋转、大范围俯仰或角色奔跑,组装器必须通过分析视频运动矢量(Motion Vectors),精准剪裁并提取视频中段运动速度最高、张力最强的 1.0秒 - 1.5秒 片段(通常为第 1.5秒 至 3.0秒 区间),舍弃生成视频前段的惯性启动以及尾段 of 减速留白,确保硬切切入时即是最高动态能量。 - 尾帧爆发段提取(End-frame Collision Extraction - 用于撞击/异变发生点):
若镜头承载物理碰撞、镜面碎裂、道具活化、或虚实过渡临界点,组装器必须截取该 4 秒视频的最后 1.0秒 - 1.2秒(含尾帧),确保视觉的切断点精准对准生成视频中运动幅度和物理改变最彻底的最后一帧,实现零延迟、高能量的撞击接续。 - 变加速时间重映射(Time Remapping / Speed Ramps):
在表现虚实错乱、时空拉扯时,组装器应对所截取的视频片段应用非线性时间重映射(Speed Ramping)。例如在 1.5 秒的镜头内,前 1.0 秒以 0.5x 慢速播放(突出赛璐珞动漫手绘线条的凝滞感和窒息感),后 0.5 秒呈指数级暴增至 3.0x 极速播放(视觉向边缘拉伸模糊),瞬间硬切入下一镜头,实现“先屏息凝神,后时空撕裂”的体感张力。
- 峰值速度段提取(Peak Velocity Extraction - 用于运镜/大范围运动):
-
【压抑现实时空的长镜头留白规范】:
在日常压抑现实(如单身公寓、便利店)中,则必须采用与上述高潮完全相反的剪辑策略。采用极慢、克制的时间线节奏,完整保留 8秒 - 30秒 镜头生成的完整呼吸感。在镜头内绝不进行任何剪切,用大面积静止机位和极微弱、持续不断的低频都市环境音(如空调室外机震鸣、远方列车碾过铁轨的低频回响)来累积角色的绝对孤独与冷漠。
-
-
音画精确同步与情绪化呼吸感剪辑 (Audio-Visual Synch & Breath Pacing):
- 声画微差错落入轨(J-Cut 与 L-Cut 电影级剪辑):拒绝死板的“声画同切”(即音轨与视轨完全在同一帧切断),这会产生极强的人工假象。video_assembler 组装时,必须采用声画错位机制:
- J-Cut(声先入):在画面切换到新镜头前,允许该镜头的对白、惊呼或场景特征声(如地铁呼啸声)提前 0.2秒至0.5秒 切入,以此引导观众视线,形成天然的时空吸引力。
- L-Cut(声留存):在前一镜头切走后,前一镜角色的未完余音或情绪叹气在后续画面中继续留存 0.2秒至0.5秒。
- “声景真空”动态强对比(Audio Void):避免背景音乐自始至终以恒定音量覆盖全片。当出现关键的低语对白、主角屏息、深沉叹气或省略号停顿(“……”)时,必须对 BGM 轨道进行瞬时大衰减(直接下拉至 -30dB 或静音)。这种突如其来的声学寂静(即“声景真空”)能将所有细节聚焦于高拟真参考音色中的呼吸微颤、唇齿音,瞬间将悬疑压迫感推向极致。
- 声效联动视觉微颤(Sound-Driven Tremors):当遇到高振幅的心理学声效(如狂乱的 <heartbeat thumping louder> 或 <sharp high-pitched ringing>)时,组装器应在时序上将这些音效强拍点与画面的微弱镜头抖动、曝光度微调或冷暖色温微瞬变进行精确对位,使声学细节深度渗透进物理画面中。
- 旁白多轨重叠幻听与立体声像时间线剪辑(Multi-track Stereo Hallucination Editing):
- 时间轴延迟错位编排:在组装时间线时,将 audio_layer_1(中央主对白)、audio_layer_2(左耳贴面气声)和 audio_layer_3(右耳空间反射)进行重叠与交错入轨,绝对不能在同一起始时间节点播放。audio_layer_2 必须比 audio_layer_1 延迟 0.6秒 至 0.8秒 入轨;audio_layer_3 必须比 audio_layer_2 再延迟 0.5秒 至 0.6秒(即较主声道延迟 1.1秒 至 1.4秒)错位入轨,实现今敏电影中思维脱节、时空碎裂的重唱幻听效果。
- 立体声像定位(Spatial Panning):
- audio_layer_1 强制锁定声像在中央(Pan = 0),音量设为主控高亮(如 -3dB);
- audio_layer_2 声像强制极向左拉(Pan = L90 至 L100),音量下调(如 -10dB 至 -12dB),营造角色在左耳畔、贴近颅骨低声喘息低语的生理空间逼真感;
- audio_layer_3 声像强制极向右拉(Pan = R90 至 R100),音量大幅压低(如 -15dB 至 -18dB),并配合由远及近的微弱淡入,营造潜意识深处魔障般的右侧声学回响。
- 声能潮汐涌动包络(Audio Tidal Ducking):在三轨幻听爆发点,组装器必须应用动态交互的音量包络(Envelope Control)。当中央主对白 audio_layer_1 由于文本中的生理语气标记(如 [吞咽/hard swallow]、[干咽]、[吸气]、省略号 ……)产生 0.5秒 以上的语音留白停顿时,左右两个幻听轨 audio_layer_2 和 audio_layer_3 的音量必须在 0.1秒 内同步向上突增 +6dB 至 +10dB 进行“声景真空”的强制填补;而当主对白再次发声时,幻听轨音量瞬时回落(Ducking),形成吞噬主角现实神智的潮汐式声音搏动。
- 声画微差错落入轨(J-Cut 与 L-Cut 电影级剪辑):拒绝死板的“声画同切”(即音轨与视轨完全在同一帧切断),这会产生极强的人工假象。video_assembler 组装时,必须采用声画错位机制:
-
今敏式无缝“匹配剪辑”(Match Cut)后期对位与视听焊接规范:
- 瞳孔穿梭推镜头转场对位 (Pupil Zoom-In/Push Transition Alignment):
- 画面对位 (Visual Alignment):
- 变加速时间重映射 (Explosive Zoom Remapping): 确保前镜(镜头 A,聚焦于瞳孔特写)的最后 15-24 帧(约 0.5-1.0 秒)应用由慢到极快的 Ease-In-Out 指数级缩放曲线(Zoom Scale Interpolation),缩放比例(Scale)从 1.0x 急遽拉升至 16.0x,在第 A_last_frame 帧将瞳孔中心的黑洞无限放大为全屏纯黑。
- 子像素级中心点对齐 (Sub-pixel Centroid Registration): 组装时计算镜头 A 瞳孔几何重心的精确 Sub-pixel 坐标偏移 (dx, dy),并在镜头 B 的起始 8 帧内,对画面应用微弱的 2D 空间位移平移 (Pan/Translation) 补偿,使后镜 A_axis 与 B_axis 在 sub-pixel 级别重咬合,彻底消除画面剪切时的无端位置跳跃。
- 径向模糊与焦距渐变 (Radial Blur & Focal Depth Morphing): 在切分帧前 5 帧,沿推焦方向施加最大长度为 50px 的径向运动模糊 (Radial Motion Blur);并将虚拟镜头的焦深(DOF)从眼球表面极浅焦距无缝插值变换到后镜的无穷远,营造时空折叠的空间穿梭感。
- 声音焊接 (Audio Welding): 在转接点前 0.5 秒切入低频穿梭声(如 <whoosh>),其声能包络在切分帧(Cut Frame)达到绝对峰值,并与后镜起始帧(镜头 B)的场景音或高频颤音(如 <high-pitched ringing>)实施无缝交叉淡化(Cross-fade),形成强烈的时空拉扯感。
- 画面对位 (Visual Alignment):
- 镜面与反射介质过渡对位 (Mirror & Reflection Transition Alignment):
- 画面对位 (Visual Alignment):
- 视差运动插值 (Parallax Coordinate Interpolation): 前镜(镜头 A,看着反射介质)进行慢速推近时,在时间线上对前景玻璃反射层与深景背景层应用非对称的位移坐标插值,产生微弱的 3D 景深视差效果 (Dolly Parallax)。
- 非线性余弦叠化 (Non-linear Cosine Cross-Dissolve): 在切分帧前后的 3-4 帧范围内,应用 5% - 15% 极微弱的非线性余弦不透明度叠化(Cosine Opacity Transition),而非普通的线性淡入淡出,消除由于 AI 生成所产生的面部边缘位置偏移(Positional drift)。
- 匹配透镜虚焦 (Matched Lens De-focusing Curve): 在叠化过渡阶段,将前镜反射人脸与后镜背景同时应用同等斜率的镜头虚焦滤镜(Gaussian Lens Blur),在第 Cut_frame 帧达到最大虚化,切入后镜再以相同曲线极速恢复清晰(Re-focusing),实现现实与梦境在空间物理上的完美“折射模糊”。
- 声音焊接 (Audio Welding): 在镜面切换的精确切分帧(Cut Frame),重叠嵌入一个清脆空灵、带有长回音的声效(如 <sharp metallic ring> 或 <glass shattering echo>)。同时,BGM 音轨在此帧必须实现声场与频宽的瞬间突变(如由极窄的单声道瞬间爆开为 3D 宽立体声),用听觉的“豁然开朗”标志现实与梦境在空间物理上的瞬间重咬合。
- 画面对位 (Visual Alignment):
- 体态与运动关联转场对位 (Physical & Motion Match Cut Alignment):
- 画面对位 (Visual Alignment): 两个镜头主体在横向或纵向运动的方向、运动速度及在屏幕中的构图比例必须严密对位。组装器剪辑点必须落在运动的中段(In-Motion Cut),绝对不能落在动作静止、起跑或停止的瞬间,使角色动作的物理惯性产生无缝拼接。
- 声音焊接 (Audio Welding): 运动物体的运动声效(如奔跑脚步声、衣物摩擦声)必须在切分帧前 0.2s 提前交叉淡化并向后镜重叠,以声音的动力学连贯性确保视觉惯性的真实感。
- 瞳孔穿梭推镜头转场对位 (Pupil Zoom-In/Push Transition Alignment):
-
【梦境大游行与狂欢祭典】音画动力学共振与微颤对位规范:
- 太鼓强拍与镜头物理颤动对位 (Taiko Downbeat Camera Shake Alignment):
- 画面震颤振幅与衰减 (Tremor Amplitude & Decay Curves): 太鼓强拍点(Downbeats,如 135BGM 的重音拍)必须与画面的三维微颤动(Micro-Camera Shake)实现 0帧绝对对齐。重音落下的第 0 帧,画面产生随机的水平与垂直位移振幅(Amplitude = 8px - 12px,方向随机摆动),并采用指数衰减曲线在后续的 3-4 帧内迅速收缩归零,模拟鼓点声波震击镜头的物理介质颤动。
- 声能振幅比例控制 (Acoustic Amplitude Mapping): 镜头位移像素振幅与太鼓音轨的瞬态声能(Transient Peak Volume)呈 1:1 线性正比。鼓点声压级(dB)每提升 3dB,画面最大抖动位移增加 2 像素,形成“鼓声越响,镜头抖动越剧烈”的视听物理共振。
- 重音拍点曝光瞬变与电光闪变 (Transient Exposure Flashes & Chromatic Pulses):
- 微过曝闪烁 (Micro-Exposure Shimmer): 在大游行游进重拍(拍点起始帧),组装器必须对该单帧施加微弱的曝光过曝(过曝参数设定为 +1.5 EV 至 +2.0 EV),并在接下来的 2 帧内呈对数衰减恢复。这在视觉上再现了鼓点敲击瞬间,游行街道霓虹灯、灯笼在气压震荡下产生的瞬时电学闪变(Flicker)。
- 色差瞬态溢出 (Transient Color Aberration): 重拍敲击的单帧上,同步施加微弱的 RGB 镜头分色差(Chromatic Aberration,位移 3px),并在 2 帧内恢复。这极好地外化了狂乱游行中由于声能过载导致的心智短路。
- 冷暖色温色相瞬变与反差裂变 (Color Temperature Phase Shifts & Hue Clashes):
- 色温瞬时偏移脉冲 (Color Temp Shift Pulse): 当太鼓声效打出连续急促的鼓点滚奏(Drum Rolls / Rolls)时,画面主色调色温必须在 0.1秒 至 0.2秒(3-6 帧)内,随声能波动进行冷暖极速交替瞬变。在鼓声冲击最强点,主色调瞬间向饱和度极高的猩红 (Saturated Neon Crimson) 极速偏移(色温拉高,色彩大面积偏红),而在鼓声减弱或停顿间隙,瞬间回弹或偏向耀眼的琥珀金黄 (Vibrant Amber-Gold) 甚至迷幻的极高色温霓虹紫 (Neon Violet),形成大范围冷暖色温与色相的剧烈震荡,渲染梦境空间随着祭典乐器节拍不断膨胀、收缩的物理受动感。
- 光比反差瞬时撕裂 (Dynamic Contrast Mutation): 伴随强拍点落下,画面暗部(Shadows)的黑电平(Black Level)和亮部(Highlights)的白电平同时拉开 20% 的极限对比度反差,鼓点间隙恢复正常。这种高反差的突变令画面像心脏般随音乐脉动。
- 多轨道节奏强排视听锁定 (Multi-track Rhythmic Audio-Visual Synch):
- 肢体运动/道具异变与拍点焊接: 故事板中人偶关节折叠、花车浮空摆动、以及神怪神像的脚步下落等视觉关键帧,必须死锁在音轨强拍(Downbeats / Accents)上。人偶关节每一次咯吱折叠、神像重重跺脚的帧,必须精准焊接在太鼓合奏、铜钹敲击的 0 帧瞬态上,绝不能发生 1 帧以上的时序偏差,实现完美的“音画舞蹈”偶合。
- 太鼓强拍与镜头物理颤动对位 (Taiko Downbeat Camera Shake Alignment):
-
【梦境崩溃与虚实坍塌】高维声学重构与多轨音效焊接规范:
- 多轨分层声场架构与剪辑定位 (Multi-Track Layered Sound Field Structure):
- 高频碎裂与晶体撕裂轨 (Track 1 - High-Frequency Shattering/Crystalline Fissures):专门用于放置 <glass shattering echo>、<sharp crystal cracking> 等高频脆性音效。声像(Panning)必须采用非物理的剧烈左/右摆动(Pan L100 至 R100 快速扫频),模拟碎裂的现实镜像碎片和镜片在空间中高速切削、划破耳际的凌厉动态。
- 中频时空撕裂与巨构崩塌轨 (Track 2 - Mid-Frequency Reality Tearing/Structural Collapse):放置 <space-time cracking fissure>、<heavy concrete collapsing rumble> 等声效。此轨道必须作为空间变形的能量核心。当画面出现物理撕裂(如天空像玻璃般产生巨大裂缝)时,在裂缝张开的起始帧,该音轨切入一个高强度的 <tearing whoosh>,声能包络在 0.3s 内急剧攀升达到峰值。
- 低频失重与次声深渊轨 (Track 3 - Low-Frequency Weightlessness/Cosmic Infrasound Abyss):放置 <deep cosmic void drone>、<sub-bass gravity distortion> 等超低频合成器声能。当角色在无重力下颠倒悬浮、物体反物理漂浮时,此轨道音量以“缓慢涨潮”形式进行波荡放大(Volume swelling from -20dB to -6dB),而在镜头突然硬切的瞬间(Cut Frame),低频声能必须瞬间截断/熔断(0帧静音),产生心跳骤停的真空坠落感。
- “玻璃震碎”与“时空崩塌”的动态包络与侧链压限对位:
- 瞬时冲击点对齐 (Instantaneous Crash Frame Alignment):视觉上现实碎裂或镜面破裂的精确帧,必须与 Track 1 的 <glass shattering explosion> 冲击波瞬态(Transient Attack)实现 0帧像素级绝对对齐。
- 声能瞬时闪避 (Side-chain Ducking / Dynamic Muting):在玻璃震碎的轰鸣炸裂帧,为了确保高频玻璃残片的清脆金属质感不被浑浊的背景音乐遮蔽,组装器必须对 BGM 轨道应用瞬时强衰减(直接下拉 -24dB 至 -30dB,释放时间 Release Time 设为 1.5s - 2.0s 缓缓恢复),让尖锐的碎裂高频残响在中高频段实现完美的物理透射,形成“现实在此碎落一地”的极致干净听感。
- 反物理“声学倒放预兆”焊接 (Anti-Physical Reverse Sweep):在碎裂切分帧前 1.0s - 1.5s,于 Track 1 叠入一段倒放的玻璃碎裂残响(<reversed glass shattering sweep>),音量呈指数级向上爬升,在切分帧顶点与真实的破碎撞击声瞬间咬合。通过这种反物理的听觉倒流,在画面碎裂前先在听觉上拉满物理坍塌的宿命感。
- “声景碎裂”与“画面几何撕裂”的物理运动共振 (Acoustic Fissure & Geometric Tearing Resonance):
- 视轴轨迹空间映射 (Visual Trace to Panning Mapping):当画面中时空裂缝(fissure)产生并蔓延时,音响组装必须根据裂缝的几何走向动态编写立体声声像轨迹。若裂缝从左上角斜向撕裂至右下角,Track 2 中的 <space-time cracking fissure> 音效声像必须在相同帧长(如 15 帧内)从 L80 匀速推移至 R80,实现听觉上的“空间被物理拉扯并撕开”的位移共振。
- 镜面/手机屏幕瞬时碎裂崩溃后期对位与高频焊接规范:
- 画面对位与冲击颤跃 (Visual Shock Alignment & Shake):
- 曝光闪变与色彩偏离 (Flash Cut & Chromatic Aberration): 在镜面/手机屏幕碎裂的瞬间,组装器必须对切分帧进行 1-2 帧的曝光瞬时过曝处理(曝光参数设定为 +5.0 EV),并在该过曝帧期间应用 RGB 分离色差滤镜(Chromatic Aberration),使红色通道向左偏移 5px、蓝色通道向右偏移 5px,模拟理智碎裂瞬间的高阶视觉数字啸叫(RGB Glitch Split)。
- 高频手持视震颤与衰减 (High-Frequency Shudder & Decay Curves): 对切分帧后续的 8 帧画面施加剧烈的手持视震颤(violent camera shake effect),该震颤频率锁定为 24Hz,初始水平/垂直平移振幅设为 15 像素(Amplitude = 15px),并依对数衰减曲线在 8 帧内迅速衰减至零。
- 三维碎片子像素轨迹追踪 (3D Shard Sub-pixel Translation): 组装器需在时间线上对 2D/3D 镜面碎片图层进行空间位移映射,让前景玻璃碎片的子像素级运动矢量 (Motion Vectors) 沿放射状向四周爆开,各碎片位移速度与离心半径呈正比,以 sub-pixel 级别贴合视频生成端(Seedance 2.5(分辨率 480p))产生的碎裂动态。
- 音频高频突发与多重反射音轨拼接 (Audio Transient Shattering & Shard Reflections):
- 在碎裂切分帧(Cut Frame)的 0 帧位置,Track 1 的 <glass shattering explosion> 必须以绝对最大的瞬态冲击(0dB Limit)切入。
- 多重反射声像扫频 (Spatial Shard Reflections):由于碎裂产生了大量漂浮的反射碎片,组装器必须在 Track 1(高频轨)上,将多个连续的细碎玻璃划切声(如 <sharp crystal shard scraping>)以 0.05秒至0.1秒 的极短延迟重叠排列。每个划切声的声像(Panning)必须执行极向相反的扫频运动(例如:第1片从 L100 扫至 R50,第2片从 R100 扫至 L50),构建出耳朵周围无数镜片在反重力下飞旋、划切,且各自反射着心理残片的 3D 环绕声像。
- 声能瞬时闪避与数字啸裂:若为手机屏幕碎裂,可在 Track 1 中叠入高频 <digital glitch screech>。在碎裂的瞬间,必须通过侧链压限(Dynamic Side-chain Ducking)将 BGM 和 VO 声轨瞬间压低 -30dB,让这些干脆、尖锐的物理碎裂与数字啸叫声在 0.3s 的绝对真空中彻底穿透,拉满理智碎裂的窒息感。
- 画面对位与冲击颤跃 (Visual Shock Alignment & Shake):
- 多轨分层声场架构与剪辑定位 (Multi-Track Layered Sound Field Structure):
-
【时空史诗与虚实咬合】终幕声音焊接与淡化曲线规范:
- 非对称对数级无缝淡化曲线 (Asymmetrical Logarithmic Cross-fade Curves):
- 低频次声/深渊轨对数衰减 (Low-Frequency Infrasound Logarithmic Decay):在虚实咬合的绝对切分帧(Cut Frame,即主角神智觉醒、冲破梦境藩篱的瞬间),低频次声轨(Track 3,如 <sub-bass gravity distortion> 或 <deep cosmic void drone>)必须在 1.5s - 2.0s 内进行对数级骤降式衰减 (Logarithmic Decay)(在切分后的前 0.5s 内,音量迅速由 -6dB 骤降至 -24dB,后 1.5s 缓慢滑落至静音 -∞)。这既能确保瞬态的重力坍塌感迅速抽离,又避免了音频断裂产生的爆音 (click/pop)。
- 圣洁女声高音指数级淡入 (Opera Solo Exponential Fade-in):终幕史诗配乐中的圣洁女声高音轨(如 <sacred operatic female vocal solo>)必须执行 2.5s - 3.0s 的指数级渐强淡入 (Exponential Fade-in)。淡入必须在切分帧前 1.0s 提前入轨(作为梦境最深处觉醒的先兆,在崩塌废墟声下隐约可闻),并在切分帧后 1.5s - 2.0s 达到声能最高峰(-3dB),形成圣光从深渊裂缝中缓慢而坚定地漫溢并最终喷薄而出的听觉救赎。
- 频段重叠互补与动态避让 (Frequency Separation & Dynamic Side-chaining):
- 频段压限避让:在切分帧后 0.0s - 1.0s 的频段重叠交织区,对女声高音轨施加动态 EQ(或高通滤波器),将 200Hz - 400Hz 中低频共鸣暂切削 6dB,把空间物理余震留给次声轨的低频谐波;待 1.0s 后低频次声衰减至 -24dB 以下时,高通滤波器自动旁路释放,女声重获温暖饱满的胸腔共鸣。
- 立体声场渐宽演变 (Stereo Field Spatial Expansion):
- 声像轨迹演变 (Spatial Panning Evolution):在女声高音提前入轨的 1.0s 区间,其声像(Panning)必须死锁在正中央(Pan = 0),音色作窄频单声道(Mono)干声(Dry)处理,外化为主角紧缩脑内的潜意识微弱火花;自切分帧起,在接下来的 3.0s 内,声像向极左与极右双向极速拓宽(动态演变为 Pan L100 与 Pan R100 宽立体声),同时注入超长尾音的湿混大空间混响(Wet-Reverb with space-delay),听觉空间瞬间开阔,象征神智完全超脱,融入无尽的时空。
- 非对称对数级无缝淡化曲线 (Asymmetrical Logarithmic Cross-fade Curves):