Continuous-take cinematic short
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
专用于电影级纯物理一镜到底(长镜头)视频创作。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
一镜到底视频项目执行逻辑与依赖关系:
- 确立全局参数:首先调用 Text Editor (text_editor) 创建 Final_Video_Spec.md,锁定 16:9 画幅、480p 分辨率、总视频时长以及一镜到底的视觉风格。若用户在启动项目时未明确提出视觉风格需求,Planner 必须在第一步主动向用户列出并推荐本项目原生支持的十三大经典风格列表(写实电影、二次元动漫、赛博朋克、科幻废土、蒸汽朋克、国风水墨、哥特暗黑、超现实梦境、吉卜力手绘、黏土定格、极简包豪斯、70年代复古、华丽巴洛克),引导用户进行风格交互选择,待风格明确后再将其写入 Spec 配置文件。
- 分析用户素材:若用户提供了角色参考图或场景参考图,调用 Resource Prepare and Analyze (resource_prepare_and_analyze) 对参考图进行多模态深度分析,提取人物的核心特征(发型、服饰、五官等)与场景的空间布局及光影特征。在此,必须分别重点校验角色图是否为标准的全身人物三视图,以及场景图是否为多角度无人物四宫格布局。
- 设计分镜故事板:调用 Storyboard Designer (storyboard_designer) 规划一镜到底分镜故事板。如果总时长不超过 30s,规划为 1 个 shot;如果总时长超过 30s,则将其科学拆分为多个连续的 shot(每个不超过 30s),并在 shot 间设计无缝的纯物理直接续接(基于像素首尾锁定与物理轨迹接续,严禁遮挡、甩镜、穿门等刻意的视觉转场花招)。在故事板中定义 key_element(包含角色 element character 和场景 element scene),并详细描述长镜头的相机运动轨迹与角色动作流。若角色包含对话,需在故事板中明确设计其声线与台词意图。
- 生成角色、场景与声音参考资产(如用户未提供,或用户提供的角色图非标准三视图、场景图非标准四宫格图):调用 Media Generator (media_generator)。
- 角色三视图补全与转换:若用户完全未提供角色素材,使用 TextToImage 路径生成标准全身三视图。若用户提供了非三视图的角色图(如单人半身照、立绘),则使用 ImageToImage 路径,以用户图为 reference_image,选用 Nano Banana Pro(Gemini 3 Pro Image) 或 GPT Image 2(2K 分辨率)在保持人物特征的同时,转换并生成符合短片风格的标准全身角色三视图。
- 场景四宫格补全与转换:若用户完全未提供场景素材,使用 TextToImage 路径,选用上述推荐模型生成标准的无人物多角度四宫格参考图。若用户提供了非四宫格的场景图,则使用 ImageToImage 路径,以用户提供的场景图为 reference_image,在保持场景核心要素和风格的同时,转换并重构为标准的无人物多角度四宫格参考图。四宫格四格内容采用标准分配:左上全景定场、右上陈设特写、左下纵深透视、右下气氛光效。
- 声音资产生成:若角色有台词对白,选用 MiniMax Speech 2.8 HD 生成符合描述的短音色样本,注册并保存为该角色的声音资产 key_element_audio。
- 绑定与严格校验资产参考:调用 Media Generator (media_generator) 将用户提供或生成的角色参考图、场景参考图及角色专属声音 key_element_audio 绑定到故事板对应的 key_element 槽位中。在此阶段,Planner 必须对所有设计好的关键元素进行完整性自检,逐一核对每个 key_element 是否已经完成了图片资产绑定和(如有台词)key_element_audio 声音资产绑定。严禁有任何元素遗漏,如发现未绑定资产的元素,必须立即补全生成或绑定,确保万无一失后再进入下一步。
- 生成一镜到底视频:调用 Media Generator (media_generator) 的 MultiModalToVideo 图像视频生成路径,选用 Seedance 2.5(分辨率 480p) 核心模型。
- 音色一致性注入:在视频生成参数中,必须将绑定的 key_element_audio 作为声音特征参考引入,确保角色在生成视频中说话时的音色绝对稳定。
- 连续性生成与首帧绝对锁定:
- 对于首个 shot,输入绑定的角色与场景参考图生成。
- 对于后续的 shot N (N > 1),在生成前必须先调用 Resource Prepare and Analyze (resource_prepare_and_analyze) 在极精细的时间点截取上一镜头 shot N-1 视频的最后一帧图像作为首帧参考(需剔除可能存在的生成极限缩水、粘滞或静止尾帧,定位到物理动作的最后饱满动态瞬间/峰值模糊帧)。随后向用户展示该帧,明确指出所截取的时间点与画面关键衔接特征(如主体手部微观位置、运镜速度矢量及光影落点),待用户确认无误后再调用 Media Generator (media_generator) 将该帧图像注册并绑定为 shot N 的 start_frame(首帧)。在生成时,必须同时输入此经过精细确认的 start_frame 图像、上一个 shot N-1 的最终视频(作为 reference_video)以及角色与场景的全局参考图,根据故事板的一镜到底连续动作和无缝衔接描述生成,实现首尾像素级严密锁合。
- 时间轴组装与输出:调用 Video Assembler (video_assembler) 进行剪辑组装,通过精细的首尾帧对齐和无缝拼合,确保多镜头之间过渡自然、无任何多余的硬切和黑屏,从而呈现完美的‘一镜到底’长视频视觉效果。
- 极致丝滑超分与插帧(选做):在剪辑组装完成后,调用 Media Generator (media_generator) 的 super_resolution 路径。选用 MediaKit 模型对拼合后的最终视频进行超分(推荐 1080p 或 2K/4K)与 AI 插帧(强制选择 60fps),使大范围运镜与动作衔接的光流过渡达到院线级丝滑,并提示用户导出。
分阶段停顿与确认:
本 Skill 实行严格的“先确认、后生成”交互机制。在以下关键节点必须暂停并向用户确认,在得到用户的明确许可后,方可启动相应的生成步骤或进入下一步:
- 确立 Final_Video_Spec.md 前后:若用户未指定风格,在写入参数前必须主动展示风格列表推荐供其选择;在锁定 Spec 后,暂停并向用户确认全局画幅、分辨率及风格参数;
- 完成故事板设计后:暂停并向用户确认单镜头、关键元素、角色声音声线及相机的运动轨迹设计;
- 每次开始生成任何媒体资产之前:
- 在第4步生成角色与场景参考图及角色声音样本之前,必须向用户确认图像与声音样本生成计划;
- 在第5步因遗漏需要补全生成参考资产之前,必须向用户说明并确认;
- 在第6步生成一镜到底首个镜头 final_shot 之前,必须向用户确认最终的视频生成参数与提示词;对于后续的 shot N (N > 1),在截取上一镜头 shot N-1 视频作为首帧参考(start_frame)时,必须向用户展示该帧并明确指出提取的具体时间点(时间戳精确至毫秒级)和关键衔接点特征(如骨骼重力状态、关节位置、运镜模糊方向和光影流度等),待用户核对并确认此关键点及提取时间点无误后,方可注册绑定并进行后续生成;
- 在生成任何音频资产(BGM 或 narration 旁白)之前,必须进行确认;
- 在第8步对组装后的视频进行超分插帧优化之前,必须向用户展示当前拼接预览并确认超分分辨率和帧率配置。
- 完成参考图生成/分析后,以及完成全部关键元素资产生成与绑定校验(确认无任何遗漏)后:向用户展示当前的资产绑定状态(包含图片资产与 key_element_audio 声音资产),确认无误。
2. 멀티모달 분석
用户提供素材的多模态分析规范:
-
人物三视图分析:
- 三视图布局校验:首先校验用户上传的角色参考图是否为标准的“三视图”(front, side, and back views)多视角全身投影布局。若用户提供的不是三视图(如单张人脸、半身照、立绘或非全身多角度参考),应判定为不符合一镜到底的全局一致性参考规范,并输出判定结果以指示 Planner 在后续阶段通过 ImageToImage 路径,以此图为特征参考自动将其转换为符合短片风格的标准角色三视图。
- 特征提取:提取角色的发型(颜色、长度、质感)、脸型、五官特征、代表性表情。
- 细节分析:细致分析三视图中的正面、侧面、背面服装细节(材质、剪裁、配色、特殊标识或配饰)。
- 体态总结:总结角色的体型比例与姿态风格,将其提炼为高度结构化的文本特征,输出给下游生成任务。
-
场景多角度无人物宫格图分析:
- 四宫格布局校验:首先校验用户上传的场景参考图是否为标准的四角度“四宫格”(4-quadrant grid)多视点布局且四格内容符合标准分配。若用户提供的不是四宫格(如单张视角普通风景照、不完整的拼图或无多角度参考),应判定为不符合规范,并输出判定结果以指示 Planner 在后续阶段使用 ImageToImage 路径,以此图为特征参考自动将其转换为符合短片风格、四格内容标准分配(左上全景定场、右上陈设特写、左下纵深透视、右下气氛光效)的标准场景四宫格图。
- 风格识别:识别场景的建筑或自然风格(如现代极简、科幻赛博、复古中式、科幻废土、蒸汽朋克、国风水墨武侠、哥特暗黑奇幻、超现实梦境空间、吉卜力手绘童话、黏土定格动画、极简包豪斯、70年代复古胶片、华丽巴洛克式)。
- 空间与光影分析:分析宫格图中不同角度所展示的空间立体结构、透视关系、主要物件摆放;提取主导光源的方向、色温、阴影对比度以及整体环境氛围,确保多角度的空间特征可在连续镜头中重建。
3. 스토리보드 설계
一镜到底长镜头故事板设计规范:
- 角色与场景元素(Key Elements)定义:
- 创建唯一的 element character:描述需绝对符合三视图特征;若有台词对话,必须在角色描述中追加定义其声音特征(声线、音色描述,例如:[低沉磁性男声],用于指导声音生成)。
- 创建唯一的 element scene:描述需包含空间多角度的几何关系、标志性物件及光影基调。
- 镜头(Shot)设计与多镜头无缝拼接规范:
- 时长与镜头拆分机制:
- 若总视频时长 <= 30秒,规划为 1 个 shot,时长控制在 4s - 30s 之间。
- 若总视频时长 > 30秒,必须科学拆分为多个连续的 shot(每个 shot 保持在 4s - 30s 之间,避免单镜头过长)。
- 连续性叙事与禁用词:每个 shot 的 镜头描述(Shot Description) 必须采用连续叙事,不得出现显性的“切到”、“硬切”等转场中断词汇。
- 首尾状态级联对齐:在多镜头故事板设计中,相邻 Shot 的首尾状态描述必须形成镜像闭环。例如,如果 Shot N-1 结束于“角色右脚迈出、身体向前倾斜、视线投向右下方、身处于走廊中段”,则 Shot N 的起始描述必须精准对接为“角色保持右脚迈出、身体前倾、视线投向右下方的姿态,身处于走廊中段继续行进”。必须将角色的物理姿态、空间绝对位置以及视线朝向在文字描述中做到像素级的前后接续。
- 多镜头纯物理直接续接规范(Pure Direct Continuation Spec):若存在多个 shot,必须弃用所有刻意或人工感明显的“视觉转场花招”(严格禁止遮挡过渡、同向甩镜、空镜过渡、穿门而过等非自然的虚设镜头技巧),确保整个视频链条是由纯粹、连贯、未受干涉的单一机位在空间中持续流动而成的。故事板描述必须为“直接接续”提供以下维度的精确特征衔接锚点:
- 相机运动惯性咬合(Camera Momentum Continuation):
- 前一 Shot 结尾:必须明确当前运镜的精确矢量状态(如:镜头以 1.2m/s 的恒定速度沿水平轨道向右跟拍主体,保持中景画幅,视轴与行进方向垂直)。
- 后一 Shot 开头:起始运镜必须声明完全继承前一 Shot 的末尾速度与方向矢量(如:承接前一镜头向右的恒速跟拍轨道,速度保持 1.2m/s,无停顿地继续向右平移推进),在文字层面实现相机运动的无阻尼惯性咬合。
- 角色肢体动力学接续(Biomechanical Kinetic Match):
- 前一 Shot 结尾:必须精准锁定角色运动在最后一帧的重力分配与骨骼关节空间坐标(如:角色左脚跟刚触地,脚尖向上翘起 15 度,身体重心前移 60%,右臂向后摆动至最高点)。
- 后一 Shot 开头:必须以此物理状态作为起点像素和动力学约束(如:承接左脚跟触地、重心前移 60% 的一瞬间,顺势将重心平滑过渡到前脚掌,右臂自然向前回摆),确保角色肌肉张力、动作动能在跨视频边界时符合纯粹的牛顿力学,无瞬间位移或“动作滑步”现象。
- 空间微观物理连续(Micro-Environmental Continuity):
- 相邻 Shot 边界描述:对环境中的动态物理细节进行强一致性复述。必须指明两个 Shot 切换瞬间,光源的入射角度、色温分布、风力风向(如:迎面刮来的 3 级微风,使角色发丝持续向后飘动)、空气介质密度(如:空中悬浮的微尘或烟雾密度)处于绝对等值状态,使 AI 生成时不会在衔接处产生突兀的“环境突变”或“光影跳闪”。
- 相机运动惯性咬合(Camera Momentum Continuation):
- 细化相机轨迹(运镜轨迹)设计与多轨迹镜头运动组合:
- 单一运镜轨迹需明确镜头在空间中的物理路径、高度与速度度量。
- 多轨迹运镜组合设计:故事板必须避免单一呆板的运动,应针对长镜头的叙事节奏,设计多维相机轨迹的无缝组合,并在文本中按时序连接:
- “推近 + 180度环绕”组合(Dolly-In & Orbit):例如,“镜头首先缓慢平滑地向主体脸部推近(Dolly In)直至中近景,无停顿地,顺畅过渡为以主体面部为轴心进行180度顺时针水平环绕(180-degree horizontal orbit),揭示其背后原本隐藏的场景元素”。用于强化主体心理状态并扩展空间维度。
- “横移跟拍 + 低角度仰拍仰摇”组合(Tracking & Low-Angle Tilt-Up):例如,“镜头与角色保持平行、以稳定均速向右横移跟拍(Tracking)其侧面行进过程;当角色停下脚步仰望时,相机顺势降低高度至地平线视角,平滑向上仰拍(Tilt-up)其面部微表情并展现实景天花板的宏大纵深”。用于表现主体与环境的体量对比。
- “拉远 + 航拍/吊臂摇移”组合(Dolly-Out & Crane/Jib Move):例如,“镜头从角色的手部特写开始,平稳向后拉远(Dolly Out)至全景,紧接着镜头高度垂直上升(Crane Up)并向下俯拍,使整个迷宫般的场景空间在画面中完全展开”。用于叙事段落的大气收尾或场景空间感的极致释放。
- “同向平移 + 变焦/景深平滑过渡”组合(Pan & Rack Focus):在镜头保持同向匀速横摇或平移的同时,焦点在前景角色(浅景深特写)与背景线索元素(深景深远景)之间进行平滑切换(Rack Focus),引导观众视线在一镜到底中无缝流转。
- 必须细致描述角色的连续动作流、微表情与身体姿态过渡:
- 动作与运镜过渡点对齐:角色的动作转折、姿态调整需与相机轨迹的变换节点精准对齐。例如,在镜头进行环绕(Orbit)过渡时,主体应伴随身体重心的转移或视线随镜头方向的细腻偏转;当镜头推近(Dolly In)至特写时,必须明确刻画角色的微表情变化(如:从最初的警惕疑惑过渡到松弛微笑,伴随眼神的闪烁或眼睑的微垂)。
- 姿态与空间连贯性:明确角色在不同镜头角度下的身体姿态细节(如:双肩微微下沉表示放松、身体前倾以示专注、双手抱臂显露戒备),确保相机环绕至侧面或背面时,主体的肢体形态与正面情绪流完全契合。
- 时长与镜头拆分机制:
- 独立音频层与音效设计规范:
- 多轨音频结构规划:
- 背景音乐层(BGM):规划 1 个全局的背景音乐层,选用符合故事画面和情感氛围的轻音乐、氛围乐(Ambient)或器乐。
- 环境音效与动态声效层(SFX):在故事板中明确标注各镜头所需的动态环境音效(如脚步声、风声、雨声、衣物摩擦声、开关门声等)。环境声效分为“背景环境音”(持续性,如风声、远处的环境杂音)与“同步动作音效”(瞬态,如走廊脚步声、推门声),并在 shot description 中注明其发生时机。
- 声学空间坐标标注:在设计动态音效(SFX)时,必须在故事板中显式标注动作主体相对于相机的物理距离(如:近景 1m、中景 3m、远景 10m)与画面水平方位(左、中、右)。例如:[SFX: 走廊脚步声, 距离 8m 递减至 1.5m, 方位 从左至右],为下游剪辑器提供精确的声学衰减参数。
- 独白/旁白层(Narration):若包含旁白,设计对应的 narration 音频层,并配置明确的 narration_speaker_profile。
- 音量配比与声场层级意图描述:
- 在故事板设计中,以文字明确定义各音频轨道的主次与声场层次,确保:语音对白/旁白(Narration)最清晰、最具主导性;环境音效(SFX)紧贴画面动作,具有空间物理质感;背景音乐(BGM)保持低电平,仅作氛围渲染,避免干扰人声与音效。
- 多轨音频结构规划:
4. 미디어 생성
一镜到底资产生成与绑定策略:
- 角色与场景参考图生成:
- 生成时机:
- 角色参考图:当用户完全未提供角色素材时,使用 TextToImage 自动为其生成标准三视图;若用户提供了角色素材但经 Resource Prepare and Analyze 校验判定其不是标准三视图(如单张肖像图、普通立绘),则必须启动生成,采用 ImageToImage 路径以用户图为视觉参考,转换并重构为符合短片风格的标准三视图。
- 场景参考图:当用户完全未提供场景素材时,使用 TextToImage 自动为其生成标准场景四宫格参考图;若用户提供了场景参考图但经 Resource Prepare and Analyze 校验判定其不是标准四宫格图(或四格分配不标准),则必须启动生成,采用 ImageToImage 路径以用户图为视觉参考,转换并重构为符合短片风格的、具有固定四格内容标准分配的场景四宫格图。
- 模型选择:首选 Nano Banana Pro(Gemini 3 Pro Image) 或备选 GPT Image 2(分辨率推荐为 2K,该配置在复杂三视图和多宫格多角度排版中拥有极佳画质、特征对齐度和结构遵循度)。
- 生成内容:
- 人物三视图(无参考/全新生成):采用 TextToImage 生成一张包含“正面、侧面、背面”三维透视的全身角色白底设计图。
- 人物三视图(有非三视图参考/转换生成):采用 ImageToImage,将用户提供的单视角/非三视图作为 reference_image 绑定,在保持原角色五官、发型、基本服饰等核心辨识度特征的前提下,将其重构为一张包含“正面、侧面、背面”全身三视图的精美白底设计图,使其既保留用户原角色的灵魂特征,又与短片指定的十三大风格完美咬合。
- 场景宫格图:生成一张**四宫格(4-quadrant grid)**的场景多角度无人物环境概念图。由于图像生成模型在保持空间一致性上的技术限制,四宫格是保证场景细节一致性与多角度立体透视的最佳平衡点(避免九宫格因细节过载导致透视崩溃)。
- 资产注册:将生成的参考图注册为对应的 asset_id,并绑定至 key_element。
- 生成时机:
- 一镜到底视频生成与多镜头连续性保障(Seedance 2.5(分辨率 480p)):
- 使用 MultiModalToVideo 路径。
- 模型选择:Seedance 2.5(画幅比例 16:9,分辨率 480p,单 shot 时长在 4s - 30s 之间)。
- 参考约束绑定与连续性策略:
- 单镜头(<=30s):必须将角色三视图 asset_id 与场景多角度宫格图 asset_id 绑定并作为视觉参考,确保人物和环境一致性。
- 多镜头无缝拼接(>30s):
- 第 1 个 shot 仅参考角色三视图与场景宫格图。
- 从第 N 个 shot (N > 1) 开始,除了必须绑定角色三视图和场景宫格图外,必须额外将前一镜头(shot N-1)所生成的最终视频(final_shot)作为 reference_video 绑定输入(利用 MultiModalToVideo 的视频参考模式,保持 feature 连续)。
- 三重超级锚定机制(首帧像素锁 + 静态特征锁 + 动态过渡锁):为了彻底消除多镜头拼接时,上一个视频尾帧与下一个视频首帧之间因为 AI 随机性导致的动作跳变、位置偏移或姿态不连贯,生成后续镜头(Shot N,N > 1)时必须执行三重超级锚定机制。系统绝不能只输入视频或静态图作为参考,必须同时输入并绑定:
- 首帧像素锁(start_frame):调用 resource_prepare_and_analyze 提取的上一镜头 Shot N-1 的最后一帧图像,由 Planner 注册并绑定为 Shot N 的 start_frame,作为生成器的首帧起点强约束。
- 静态特征锁(Global Static Feature Lock):初始生成的角色三视图和场景四宫格参考图,用于锁死人脸五官、服装材质和场景的基础立体透视,防止随迭代产生角色长相渐变(Face Drifting)或场景环境失真漂移。
- 动态过渡锁(reference_video):上一镜头 Shot N-1 的最终视频,用于让生成器继承镜头的运动惯性、物体的速度矢量和最后一秒的动态趋势。
- 优先使用 MultiModalToVideo 模式,以保证镜头轨迹、角色服饰、面部、动态趋势和环境光影实现绝对的物理过渡与继承,严防资产漂移。
- 背景音乐与音效生成路径:
- BGM 生成:调用 text_to_instrumental 工具,推荐选用 Suno 5 模型。根据故事板中设计的音乐风格(如 ambient synth, slow piano theme),生成符合时长要求的原创乐器曲。
- 环境音效生成:
- 画面同步音效:主要依托 Seedance 2.5(分辨率 480p) 在 MultiModalToVideo 生成过程中的“画音同步生成”能力。通过在视频提示词中嵌入 SFX 专用包裹器,让模型在生成一镜到底动作画面时,同步物理合成本地化的动作音效。
- 持续环境背景音:如有需要,可通过 text_to_instrumental 生成特定的持续环境白噪音(如:wind howling, rain falling),作为独立的 audio_layer 进行绑定。
- 角色专属音色(key_element_audio)生成与注入策略:
- 音色样本生成:若故事板中包含角色对白设计,在开始视频生成前,调用 text to narration 工具(推荐使用 MiniMax Speech 2.8 HD 或 ElevenLabs v3),根据故事板中的角色声音特征描述生成一段 1-30秒 干净的短语音频样本。
- 声音资产绑定:将生成的参考音色注册为专属 key_element_audio 并绑定至该角色 key_element 槽位上。
- 视频生成音色注入:在调用 Seedance 2.5(分辨率 480p) 进行 MultiModalToVideo 视频生成时,必须将该 key_element_audio 作为声音特征参考传入(通过 audio_infos 参数绑定角色占位符),促使生成的视频在渲染角色说话动作时,嘴形与配音音色完美对齐并保证跨镜头的一致性。
- 最终视频超分与插帧高动态优化(MediaKit):
- 超分与插帧时机:在一镜到底长镜头拼合完成后,大范围的相机运动(如 Whip Pan 甩镜、Dolly In 快速推近)在标准帧率(如 24fps/30fps)下可能产生微小的视觉抖动或卡顿。应在输出前调用 Media Generator (media_generator) 的 super_resolution 路径。
- 模型与参数选择:
- 模型:选用 MediaKit 视频超分插帧模型。
- 分辨率(resolution):推荐将 480p 的拼接生成素材超分至 "1080p" 或更高分辨率(如 "2k"/"4k"),显著提升画面微观质感(如写实风的皮肤漫反射、赛博朋克风的霓虹水面反射细节)。
- 帧率(fps):必须强制配置为 "60" 帧。通过高精度 AI 插帧,将直切拼接处的动作重合帧以及连续运镜过渡帧中的光流进行物理级补帧,使“一镜到底”长镜头呈现绝对顺畅、无阻尼感的高帧率流动画面。
5. 프롬프트 작성
图像与视频提示词(Prompt)撰写规范:
- 全局视觉风格引导规范:
- 风格对齐:提示词中必须显式加入并贯穿 Final_Video_Spec.md 中锁定的视觉风格,确保图像(Nano Banana Pro / GPT Image 2)和视频(Seedance 2.5(分辨率 480p))风格高度统一。
- 写实风格(Realistic / Cinematic):在基础写实词(photorealistic, hyper-detailed, movie cinematography, professional lighting, 35mm photograph)之上,重点渲染镜头物理变化与环境微观质感以适配一镜到底。必须细化:
- 镜头物理表现:随相机推拉(Dolly)或环绕(Orbit),显式描述焦距与景深的平滑过渡(dynamic depth of field, subtle chromatic aberration, realistic lens flare, natural motion blur)。
- 材质与光影细节:刻画皮肤毛孔与漫反射(subsurface scattering of skin)、衣物纤维纹理在不同角度下的反光;增加光束中飞舞的微尘(drifting dust motes in volumetric light beams),以及阴影随镜头移动产生的物理拉伸。
- 二次元/动漫风格(Anime / Illustration):在基础动漫词(anime style, key animation, cel-shaded illustration, clean line art, high-quality Japanese animation studio aesthetic)之上,重点渲染手绘光影张力、极高张力的多层空间视差与动感纹理以适配一镜到底。必须细化:
- 多层空间视差(Multi-layered Spatial Parallax):强制提示词通过明确的前、中、后景速率异步关系,在扁平的手绘画面中模拟极深的空间立体感。必须具象描述:前景遮挡物(如:近端滑过的发丝、飘落的花瓣、高大樱花树枝、古朴日式立柱)以极快的相对位移掠过(rapid sliding foreground elements),产生强烈的推焦感;中景主体角色动作与镜头保持平移锁定;背景(如:层叠的青翠山峦、黄昏时的厚重云层、微光闪烁的远景街区)以极其缓慢的角速度异步平移(asynchronous background shifting with slow parallax, slow multi-layered panning),拉开数十米的空间深度物理级层次感。
- 动感线与模糊缓冲帧(Speed Lines & Kinetic Smear Frames):在极速运镜或镜头快速平移的动作衔接处,禁止使用CGI感浓厚的渐变模糊,必须指定手绘专属的力学视觉缓冲。要求写入:极速运镜切入点使用粗细不一、呈放射状或平行排布的手绘同向高速动感线(stylized kinetic speed streaks, hand-drawn horizontal speed lines),覆盖画面边缘以集中观众视线;动作瞬态突变处(如挥刀、急停回头)使用经典的拉伸变形手绘剪纸模糊帧(expressive smear frames, dynamic motion smears on characters),通过夸张的肢体拉长变形来柔化两帧间的物理断层。
- 动态发丝高光与边缘溢光(Dynamic Hair Highlights & Stylized Rim Lights):针对二次元最具代表性的天使环高光(angel ring highlights / halo hair shine),必须显式指明其随相机运镜环绕(Orbit)而产生的位移与形态演变(如:当相机向侧后方环绕时,发梢的天使环高光沿发丝曲率平滑移动并自然拉窄,呈现有机的流变感,而非贴在发丝上的静态贴图);强化服装与发丝的动态手绘边缘溢光(glowing stylized rim lighting, soft backlighting),在暗部环境中勾勒出角色分明的剪影线。
- 手绘赛璐璐渲染与质感厚度(Cel-Shaded Rendering & Artistic Textures):明确定位双色硬核赛璐璐阴影阴面(sharp 2-tone cel-shaded drop shadows),但在阴影边界以及脸部下颌、颈部交界处点缀温和的微晕染渐变(subtle airbrushed gradient blends in shadow crevices),增添画面的高级感;要求背景环境使用手绘质感明显的粗糙水彩或油画笔触(textured watercolor wash, organic hand-painted background texture),并可在提示词中微量融入纸张纹理叠加层(delicate paper grain overlay),彻底滤除冰冷平滑的数码向量感,提供温暖丰厚的胶片质感。
- 赛博朋克风格(Cyberpunk / Sci-Fi):在基础赛博词(cyberpunk style, neon-drenched environment, high-tech low-life, holographic overlays, dark synth aesthetic, rain-slicked surfaces, volumetric cyan and magenta lighting)之上,重点渲染冷暖对比光源的动态漫反射、悬浮全息图层透视视差与环境介质物理干涉以适配一镜到底。必须细化:
- 冷暖色温交融与雨水漫反射(Cool-Warm Color Temp & Wet Reflections):强调极端对立的色温交织与物理反射。必须具体描述高纯度冷色光(如青荧光 cyan neon, 炫目霓虹 magenta)与温暖色光(如橙色钠灯 warm orange sodium glow, 街头摊位昏黄弧光 street food yellow light)在雨湿、积水路面(rain-slicked asphalt, puddled alleys)上的动态漫反射与波度流动。当相机推拉或环绕时,这些霓虹倒影应随光线夹角偏转而拉伸或扭曲(stretching and shimmering reflections, real-time light path distortion),展现液体表面的油膜斑驳感与流光的折射变化,增强镜头的立体环境写实度。
- 悬浮全息图层的透视视差(Holographic Parallax & Glitch HUD):一镜到底穿行空间时,全息图层不能像死板的2D平面贴图。提示词必须精确定义悬浮全息广告、裸眼3D屏幕(floating 3D neon holographic advertisements, translucent neon holograms)在镜头平移与偏转时的空间立体视差(three-dimensional volumetric parallax)。要求描述:全息影像与背景建筑物之间随运镜产生的前后速率不对等,并在相机切过其侧翼或背后时,全息光流呈现精确的厚度压缩与逆向透视扭曲;必须细节化描述其表面的物理介质特征(如:高频半透明波纹 scanlines, 脉冲式干扰频闪 minor visual glitch flicker, 投影质点在半空中的光晕扩散 localized light scatter in dust-filled air)。
- 环境蒸汽介质与多维度干涉(Atmospheric Steam & Dynamic Volumetric Particles):为一镜到底注入饱满的空气体积厚度。强制提示词必须具象刻画在环境空间中无规则流动的各式蒸汽、雨雾与尘雾(swirling atmospheric steam plumes, heavy rising neon-lit steam, dense wet drizzle haze)。当相机或主体角色从中穿过时,描述蒸汽和尘雾随动作气流产生的扰动与发散(interfering with air currents, localized aerodynamic turbulence, particle drift around passing character);雾气粒子必须能深度捕捉并折射环境中的强冷暖光源,显化其体积光束(shafts of vibrant neon light passing through drifting steam),从而彻底打破空洞干净的数码空间感。
- 科幻废土/末日美学风格(Post-Apocalyptic Wasteland / Sci-Fi Wasteland):在基础废土词(post-apocalyptic wasteland style, crumbling ruins, overgrown decayed structures, desolate desert, retro-futuristic wreckage, weathered metal, cinematic tragedy aesthetic)之上,重点锁定锈蚀斑驳材质、高浓度动态尘埃介质、深层空间透视视差与强丁达尔光束的悲壮镜头美学以适配一镜到底。必须细化:
- 锈蚀金属与风化材质(Corroded Metal & Weathered Textures):精准刻画金属表面由于数十年风化产生的红褐色粗糙锈斑(heavy reddish-brown oxidation, textured rust flakes)、剥落油漆边缘与暴露的暗哑合金。当相机推拉或环绕时,光线需在锈蚀孔隙与残存镜面间产生不均匀的高光漫反射(heterogeneous specular reflections, matte rust contrasting with metallic glints),展现厚重的历史残损与时间侵蚀质感。
- 动态沙尘暴与风沙介质干涉(Dynamic Dust Storms & Sand Turbulence):具象描述在一镜到底运镜中无规则狂扫的沙尘暴、风卷残砂与飘动碎片(swirling sand dust storms, airborne grit, flying wind-blown debris)。风沙粒子必须能够高度捕捉逆光,在强光照下显化出高密度的空气体积厚度;当主体角色或相机在沙尘中穿行时,周围应产生微型的空气阻力流体扰动(localized aerodynamic sand turbulence around moving subjects)。
- 废墟巨构的深层空间视差(Deep Spatial Parallax of Ruined Megastructures):一镜到底穿行时,必须拉开极深的空间维度。强制描述:前景横扫过倾覆的锈蚀巨轮、钢筋裸露的钢架(rapidly passing ruined steel beams in foreground);中景是角色在断壁残垣中艰难前行;远景是地平线上风化半塌的摩天大楼废墟、荒凉的核电站冷却塔(weathered half-collapsed skyscrapers, decayed mega-cooling towers in far background),随着运镜产生极为宏大的异步平移视差(gigantic asynchronous spatial parallax panning),展现人类文明遗迹的广袤荒凉。
- 强丁达尔光束与悲壮逆光(Tyndall Beams & Cinematic Backlit Tragedy):为长镜头注入强烈的史诗悲壮感。必须刻画强烈的太阳光束穿过断壁残垣的裂缝、破碎穹顶投射而下(heavy Tyndall beams piercing through shattered domes, majestic volumetric sunbeams, divine light shafts),在昏暗、沙尘弥漫的空间中形成分明的体积光柱;光柱中必须能看见漂浮旋转的尘埃颗粒(glowing drifting dust particles in light shafts);伴随相机运动,射入镜头的强逆光需产生自然的变形镜头宽画幅眩光(cinematic anamorphic lens flares, warm sun flares),并在地面上拉出极度拉伸、变幻不定的昏暗狭长投影(extremely elongated dramatic moving shadows)。
- 蒸汽朋克/复古工业风格(Steampunk / Retro-Industrial):在基础蒸汽朋克词(steampunk style, retro-futuristic industrial aesthetic, brass pipes, rotating gears, clockwork machinery, steam-powered apparatus, copper valves, amber lighting)之上,重点锁定复杂联动机械、黄铜光泽与红铜风化、高压蒸汽气动喷射及多轴相机轨道穿行美学以适配一镜到底。必须细化:
- 复杂联动齿轮与发条结构(Complex Interlocking Gears & Clockwork Mechanics):精细刻画大小不一、层叠嵌合的黄铜齿轮组(interlocking brass gears of various scales, complex gear trains)、咬合旋转的棘轮(rotating ratchets)与往复运动的金属连杆(reciprocating metal pistons)。当相机推拉或横移时,齿轮必须保持精确的物理联动咬合,其齿侧、轴承边缘需展现出高精度的润滑油膜微光(glistening thin film of lubricating oil on gear teeth)与机械微颤运动动能。
- 黄铜管道与红铜风化斑驳(Brass Piping & Copper Weathering Patina):具体描述错综复杂缠绕延伸的黄铜管道(tangled networks of polished brass pipes)、重型红铜阀门手轮(heavy copper handwheels)与青铜压力表盘(bronze pressure gauges with glass lenses)。管壁和阀体需呈现不均匀的材质反光,点缀受潮形成的浅绿色铜锈斑驳(pockets of greenish oxidized copper patina)、油污冷凝产生的暗色斑点与抛光磨损处的耀眼金属高光。
- 高压蒸汽气动喷射与紊流干涉(High-Pressure Steam Jets & Pneumatic Turbulence):具象描述从管道接缝、排气阀和气缸喷嘴中高速、间歇性喷出的高压白蒸汽(high-pressure white steam plumes, dense jetting steam bursts)。蒸汽必须具备清晰的紊流和扩散物理轨迹(turbulent aerodynamic dispersion);当相机或主体角色穿过时,气流需形成动力学干涉,卷动周围的尘埃或衣角;蒸汽粒子必须能够捕捉环境中的琥珀色(warm amber glow)或煤油灯光,呈现出发光的体积光晕与漫反射质感。
- 多轴机械轨迹的空间视差(Multi-Axis Rail Parallax inside Machinery):一镜到底相机穿行于宏大工厂内部时,需拉开极致的空间进深。强制描述:前景极速掠过粗大的铜管、排气风扇或巨大的机械吊臂(rapidly sweeping copper conduits and large industrial fan blades in foreground);中景是角色在钢架廊桥或操作台上行进;远景是无尽延伸的齿轮迷宫、高耸的锅炉熔炉与升腾的烟囱群(infinite towering furnaces, industrial smokestacks in deep background),随着多轴相机轨道运动产生极其宏大的异步透视差(gigantic asynchronous mechanical parallax panning)。
- 国风写意水墨/东方新武侠风格(Traditional Chinese Ink / Oriental Wuxia):在基础国风写意与武侠词(traditional Chinese ink wash painting, ethereal wuxia aesthetic, dynamic ink bleeding, calligraphic brushstrokes, minimalist composition, poetic atmosphere, flowing silk robes)之上,重点锁定水墨有机晕染流变、飘逸半透明纱幔、写意空间视差与风力流动轨迹以适配一镜到底。必须细化:
- 水墨晕染与有机流变(Ink Bleeding & Organic Fluidity):墨色的焦、浓、重、淡、清五色在空间中随运镜产生微妙而平滑的干湿晕染过渡;背景环境保留细腻有机的宣纸纸张纤维质感(subtle raw paper grain texture)与恰到好处的“留白”艺术意境。当相机或主体角色运动时,雾气与风痕需如流动的散墨般飘逸(diffused dynamic ink wash flows, organic bleeding edges at shadow borders),呈现有机的生命力与写意画质。
- 飘逸纱幔与空气重力拉扯(Flowing Silk & Physics-Based Wind Currents):极度强化主体角色身上半透明汉服纱幔、斗笠发带、阔袖长袍在高速或慢速行进中的空气动力学表现(elegant counter-directional draping movement, physics-based wind fluttering on silk robes)。衣摆随风起伏的阻尼运动轨迹、摆动幅度,需与相机的位移方向和旋转速率形成优雅的交互拉扯与空气流阻感(glowing semi-translucent chiffon layers capturing rim lighting)。
- 竹林与山水巨构的写意空间视差(Expressive Parallax of Bamboo Forests & Ink Landscapes):一镜到底穿行于古朴雨中竹林、陡峭山水绝壁或悠长木质廊桥中。前景极速滑过翠绿欲滴的竹叶、带有墨斑的粗糙毛竹或飞溅的雨滴(rapid foreground bamboo blades and splashing rain droplets sweeping by);中景为角色在古桥或碎石古道上提剑前行;远景是以极淡墨色渲染、重峦叠嶂的苍茫山水剪影(pale mountain silhouettes, sprawling misty valley in deep background),随着多维相机的平滑运镜产生节奏空灵的异步平移视差,展现深邃的意境进深。
- 哥特暗黑/黑暗奇幻风格(Gothic Dark / Dark Fantasy Medieval):在基础哥特与暗黑奇幻词(gothic architecture, dark fantasy aesthetic, gritty medieval atmosphere, dramatic chiaroscuro, cold moody tone, decaying structures, flickering candlelight)之上,重点锁定烛火微光投影流变、高浓度迷雾介质、彩绘玻璃体积光束与冷硬物理瑕疵材质以适配一镜到底。必须细化:
- 烛光微光与动态投影流变(Flickering Candlelight & Moving Shadows):以极弱的低位单光源(如摇曳的烛火、昏暗的壁挂火把)为主导。光线需在冷硬粗糙的斑驳石砖墙、布满刀痕的深色老橡木壁板上产生高衰减的琥珀色暖色调漫反射;随着相机轨迹的平移、推近或环绕,场景中高耸的哥特肋架券、主体角色的影子必须在地面和起伏的墙面上产生高度戏剧性、实时物理偏转拉伸与几何变形(flickering candlelight casting real-time elongated warping shadows)。
- 迷雾介质与彩绘玻璃强丁达尔光束(Heavy Fog & Stained Glass Tyndall Beams):在昏暗的古堡内部或宏大教堂中弥漫带有微小浮尘颗粒的冰冷浓雾(swirling cold haze with microscopic drifting dust particles)。惨白或幽暗的月光穿过高耸的斑驳彩绘玻璃窗,折射出带有绚丽而破碎色彩的体积光束(highly defined colored Tyndall beams, majestic volumetric light shafts through stained glass),在积水石地板上投射出异形而流变的光斑图案,并随镜头位移产生精确的折射角度漂移。
- 冷硬石质、斑驳铁锈与潮湿青苔(Cold Stone, Corroded Iron & Damp Moss Textures):精准刻画中世纪环境中的潮湿与风化感。石墙边缘和古老雕塑上需呈现受潮形成的细密冷凝水珠(beads of condensation)、划痕与深绿色的湿滑青苔斑块(damp moss textures inside cold stone crevices);场景中的铸铁吊灯、生锈的重型铁栅栏和钝质锁链需表现出粗糙的哑光暗色红褐铁锈颗粒(coarse matte dark-red rust oxidation)以及不规则的金属漫高光,彻底滤除平滑现代感。
- 超现实主义/梦境空间风格(Surrealism / Dreamcore / Liminal Space):在基础梦境与后室空间词(surrealist dreamcore aesthetic, liminal space style, unsettling nostalgia, soft diffuse lighting, physics-defying floating elements, repetitive clean architecture)之上,重点锁定非欧几何漂浮介质、弱对比无影柔光、无限纵深视差与时空材质异质流变以适配一镜到底。必须细化:
- 非欧几何与逆重力漂浮介质(Non-Euclidean Geometry & Floating Mediums):场景中存在大量违反常规重力物理定律的漂浮物件(如在半空中缓缓旋转的沙漏、静止悬空的破碎镜片、微型漂浮水泡、逆向升空的钟表零件)。当相机穿过、推近或环绕这些漂浮介质时,光流需精准捕捉其折射率与高光点的多维物理偏转(specular highlight shifts on floating shards, real-time light refraction distortion across suspended liquid spheres)。
- 弱对比无影柔光与无限空间进深(Soft Low-Contrast Lighting & Infinite Liminal Depth):采用不带任何明确方向性、极为均匀的冷暖无影柔光(类似阴天室外自然散射光,或后室空间内发出微弱嗡鸣声的白色嵌入式格栅顶灯)。场景材质(如泛黄且带有重复几何图案的过时壁纸、无缝平铺的浅米色PVC地板)呈现出极高的一致性、低噪点漫反射;通过无限延伸的空旷过道、层层套嵌的对称门洞或无限循环的楼梯间(repeating clean doorways, infinite hallway perspective stretching into far background),随着相机的绝对匀速平移产生催眠般、剥离现实的极深层空间视差。
- 梦境微观异质感与时空材质流变(Surreal Micro-textures & Spatiotemporal Material Shift):在相机运动过程中,将常规的硬质表面与意想不到的液态流体特征进行有机结合(例如:当角色踩过坚硬的大理石地板时,地面如液态水面般泛起一圈圈极其真实的物理波纹与折射倒影;或者古老的挂钟指针在相机偏转扫过时,如液态水银般向下平滑溶解、流淌滴落)。这种梦境质感的流变过程必须在提示词中精确描述,从而展现出惊悚荒诞、时间凝滞的艺术美感。
- 吉卜力手绘童话/温馨治愈风格(Studio Ghibli / Cozy Gouache Aesthetic):在基础治愈词(cozy Ghibli style, vintage anime aesthetic, detailed gouache painting, soft hand-painted illustration, nostalgic watercolor wash)之上,重点锁定动态叶隙光斑位移、风吹植物物理流体阻尼以及水粉纸张纤维感以适配一镜到底。必须细化:
- 动态树影斑驳与位移(Dynamic Komorebi & Dappled Light):当相机推拉或在林间/窗前横移时,林梢和枝叶缝隙漏下的暖黄色斑驳太阳光斑(Komorebi, warm dappled sunlight)必须随运镜在草地、泥土和角色身上产生物理位移,投影和光亮区随角度平滑伸缩。
- 风吹草浪物理流体(Physics-Based Grass Waves):草叶、野花、麦浪在微风中产生层层递进、连绵不断的流体阻尼波动,其摆动轨迹、回弹幅度与相机的运动风阻形成有机的交互拉扯(delicate grass swaying in wind, flowing meadow layers)。
- 手绘水粉粗糙触感(Textured Gouache & Watercolor Wash):保留温馨手绘插画特有的微观宣纸或粗糙水粉纸张纤维纹理,以及边缘微带干扫的笔触质感(cozy gouache illustration texture, visible paper grain, soft dry-brush edges),彻底滤除冰冷的数字向量光滑度。
- 黏土定格动画/手工微缩模型风格(Claymation / Tactile Stop-Motion Miniature):在基础定格词(stop-motion animation, claymation style, handmade miniature world, tactile felt textures, charming physical craftsmanship)之上,重点锁定手工指纹压痕、纤维毛毡质感与微距移轴景深平滑过渡以适配一镜到底。必须细化:
- 手工物理指纹压痕(Clay Fingerprint Indentations):精细刻画黏土角色、硬质道具表面凹凸不平的手工捏制指纹、微小划痕与泥刀刮痕(visible clay fingerprints, subtle hand-molded indentations, tactile clay texture),在镜头横摇折射反光时呈现真实的凹凸触感。
- 纤维毛毡与硬纸板微观材质(Miniature Fiber & Cardboard Textures):微缩环境中的树木、建筑细节需带有毛毡的毛糙纤维绒毛感、纸板裁剪缝隙的粗糙接合(felt fabrics, miniature cardboard joints),以及微小模型灯泡发出带有温暖暗晕的折射光晕。
- 微距移轴景深平滑过渡(Extreme Tilt-Shift Defocus):随着相机在微缩世界中推近或横移,焦点在极窄的范围内快速平滑过渡(shallow tilt-shift depth of field, extreme macro bokeh),使未合焦的前背景呈现奶油般化开的极致虚焦,凸显微缩世界的物理比例张力。
- 极简包豪斯/现代几何空间风格(Minimalist Bauhaus / Geometric Light & Shadow):在基础包豪斯词(minimalist Bauhaus style, crisp geometric architecture, clean symmetrical lines, raw concrete surfaces, industrial functionalism aesthetic)之上,重点锁定线性硬核投影流变、清水混凝土微孔与对称空间几何视差以适配一镜到底。必须细化:
- 线性硬核投影流变(Crisp Architectural Shadows):以强烈、单一方向的强光(如正午直射阳光或强定向侧射灯)为主导。建筑投影的阴影边缘极致锐利(sharp architectural shadow lines, high-contrast chiaroscuro),并随相机匀速平移在清水混凝土墙面、折线阶梯上呈现无可挑剔的线性拉伸变形。
- 清水混凝土微孔与漫反射(Raw Concrete Micro-pores):混凝土墙面细小的蜂窝气孔、极细的干缩发丝裂缝(raw concrete micro-pores, hairline shrinkage cracks),以及拉丝拉线金属与抛光大理石之间的反光率异质性(brushed steel vs polished marble specular heterogeneity),凸显静谧、无瑕的工业材质质感。
- 冷淡无人物几何视差(Empty Symmetrical Parallax):场景内不设任何琐碎陈设,完全通过高大对称门洞、极长廊柱与楼梯的对角构图,配合相机匀速前推或横移,拉开如几何乐章般催眠、深邃的极深层空间视差(perfect symmetry, clean mathematical lines, smooth linear dolly parallax)。
- 胶片颗粒公路/70年代复古纪实风格(70s Retro Film / Road Trip Documentary):在基础复古词(70s retro cinematic style, grainy analog film look, vintage Kodak Portra grading, nostalgic road trip aesthetic, dusty golden hour lighting)之上,重点锁定动态暖阳漫反射、边缘红晕漏光以及物理颗粒划痕以适配一镜到底。必须细化:
- 动态暖阳漫反与边缘红晕(Warm Halation & Light Leak):强烈低角度夕阳(Golden Hour)直射镜头。当相机旋转或横摆越过树木、反光镜等障碍物时,在画幅边缘产生不规则缩放的暖橘红溢光、模拟漏光与宽画幅暖调镜头眩光(warm analog halation, organic light leaks, orange lens flares)。
- 化学颗粒感与有机划痕(35mm Film Grain & Organic Scratches):保留70年代经典化学胶片特有的化学银盐粗颗粒质感、微量的有机霉斑杂质,以及伴随运镜产生的极轻微物理抖动与跳帧感(pronounced 35mm film grain, analog color grading, warm golden hour tones),坚决滤除一切数字化高清纯净。
- 华丽巴洛克/唯美宫廷复古风格(Ornate Baroque / Palace Romanticism):在基础巴洛克词(ornate baroque style, lavish palace interior, gilded wood carvings, romantic rococo romanticism, warm candlelight, grand imperial aesthetic)之上,重点锁定金属高光流变、多维镜面反射视差以及重质丝绒与蕾丝微观细节以适配一镜到底。必须细化:
- 镜面反射视差与黄金高光(Gilded Specular & Mirror Reflection):高大墙面贴附的巨型水晶镜面与精致鎏金雕花。随着镜头横移,镜中倒影折射出层层套嵌的深邃镜像深渊视差(gilded gold carvings, infinity mirror effect),金属雕饰反光边缘需产生随运镜角度起伏的耀眼物理高光(shimmering gold specular highlights)。
- 丝绒与蕾丝微观材质(Velvet & Lace Textures):精细刻画丝绒裙摆、幔帐特有的重质感与吸光性,以及半透明蕾丝花边、流苏在相机环绕旋转时随风或角色转身产生的物理阻尼运动(heavy rich velvet textures, semi-translucent lace fringes, physics-based fabric movement),表现极具触感厚度的古典华丽。
- 图像生成提示词(三视图与宫格图 - 适用于 Nano Banana Pro / GPT Image 2):
- 人物三视图提示词模板(常规/首套外观):
"Character sheet, three-view orthographic projection showing full body from front view, side view, and back view. [特定风格核心词, 如: anime style / photorealistic], [角色外貌与服饰的详细文本描述], clean studio background, high detail, professional character concept art." - 人物三视图提示词模板(多套服装/发型变更 - 基于 ImageToImage 路径):
"Character sheet, three-view orthographic projection showing full body from front view, side view, and back view. [特定风格核心词], [特征锁定词, 如: same facial features as <<<image_1>>>], [服装或发型变更描述, 如: dressed in a new outfit / with a new hairstyle], clean studio background, high detail." - 人物非三视图转三视图提示词模板(有非三视图参考/转换生成 - 基于 ImageToImage 路径):
"Character sheet, three-view orthographic projection showing full body from front view, side view, and back view. [特定风格核心词], [特征承接词, 如: inheriting identical facial features, expression, hair style, and color from <<<image_1>>>], [详细服饰与体型描述], clean studio background, high detail, professional character concept art." - 角色特征锁定与变更专有英文词汇库(多外观/多发型设计时选用):
- 核心身份锁定(Identity Locking):identical facial features, same facial structure and bone geometry, perfectly consistent facial identity, unchanged face model, consistent eyes and expression across all panels.
- 发型锁定(Hairstyle Locking - 仅换装):identical hairstyle and hair color, same hair texture and volume, perfectly matched hair cut across all angles.
- 服装变更引导(Outfit Swapping - 面部一致,换衣服):preserving the exact facial features from reference <<<image_1>>> while wearing [新服装描述], same face and body shape but dressed in a different costume: [新服装描述], identical identity wearing a brand-new outfit.
- 发型及配饰变更引导(Hairstyle Swapping - 面部一致,换发型/配饰):same character face and outfit from reference <<<image_1>>> but with a different hairstyle: [新发型描述], keeping the same facial identity while changing headwear and hair style to [新发型描述].
- 场景多角度宫格图提示词模板:
"Multi-angle architectural blueprint and concept art layout, 4-quadrant grid (quad-view split-screen) showing the exact same empty environment from four distinct camera angles: top-left quadrant shows the eye-level front view; top-right quadrant shows the 90-degree side-angle profile view; bottom-left quadrant shows the high-angle overhead view; bottom-right quadrant shows the 3D isometric 45-degree corner perspective. [特定风格核心词], [场景设计、空间陈设、光源与材质的详细英文描述], empty scene, no people, no characters, absolute spatial consistency, matching objects and synchronized lighting across all quadrants, unified color grading, ultra-precise geometric layout." - 四宫格场景一致性专有英文词汇库(提示词撰写时应酌情组合使用):
- 画面布局控制:4-quadrant grid with fixed angles, top-left front view, top-right side-angle view, bottom-left overhead view, bottom-right 45-degree perspective, quad-view split-screen, symmetrical quad layout.
- 空间与光影对齐:the exact same room from 4 directions, hyper-consistent spatial layout, synchronized light sources and shadows, perfectly matching architectural elements, identical texture rendering, unified color temperature.
- 场景排除性限制:unpopulated space, completely empty scene, no humans, no characters, static environment.
- 人物三视图提示词模板(常规/首套外观):
- Seedance 2.5(分辨率 480p) 视频提示词(一镜到底长镜头)**:
- 风格融合:在视频提示词开头除了镜头运动外,必须融入风格核心修饰词(如:in cyberpunk style, under dramatic cinematic lighting),保证与参考图 asset 风格完美贴合。
- 参考图与占位符绑定与首帧绝对继承描述:
- 单镜头或首个镜头:用 <<<image_1>>> 绑定角色三视图,用 <<<image_2>>> 绑定场景多角度宫格图。
- 多镜头连续拼接:对于第 N 个 shot (N > 1),除角色图 <<<image_1>>>、场景图 <<<image_2>>> 外,必须用 <<<image_3>>> 绑定通过 resource_prepare_and_analyze 提取的上一镜头 Shot N-1 最终视频的最后一帧图像(即 start_frame),并用 <<<video_1>>> 绑定上一镜头的生成视频(即 reference_video)。
- 首帧像素锁定与时空衔接指令(Pixel-Locked Head-to-Tail Conjunction):在 Shot N (N > 1) 的提示词开头,必须硬编码极高强度的首帧一致性指令,指引模型以前一镜头的尾帧作为像素级起点。例如:“Seamlessly and continuously transition from the previous shot. The first frame of this video must strictly lock and perfectly align with the pixels, posture, expression, and environment shown in <<<image_3>>> with 100% precision. Starting exactly from <<<image_3>>>, continuing the motion flow and camera movement trajectory from <<<video_1>>>...”
- 时空特征继承提示词控制(Spatiotemporal Feature Inheritance):在 Shot N (N > 1) 的提示词中,除了动作与镜头的物理接续,必须一致性复述前一镜头结尾处的环境微观特征(如:相同的光源入射角、光影色温、相同的烟雾或微尘密度、材质表面的干湿质感)。在描述主体时,应强调「wearing the exact same clothes and hairstyle as seen in <<<video_1>>> and <<<image_3>>> with identical facial structure and geometry」,从而在提示词文本层锁死因多轮视频迭代所导致的服饰或五官漂移倾向。
- 防止生成多宫格视频控制(Anti-Split-Screen Constraint):
- 单视角镜头强力引导:由于输入了四宫格场景参考图 <<<image_2>>>,视频生成模型极易产生混淆,在生成视频时也渲染成多宫格、分屏或带有黑边拼接的画面。为了强制模型只渲染一个单一、完整且连续的单镜头画面,必须在提示词的首段镜头运动描述中融入高强度的单视角约束指令,例如:“The video is a single continuous shot. Render a single, unified camera perspective from one viewport only. No split-screen, no grid layout, no multi-angle panels, no side-by-side views. The camera must remain inside the scene as a single eye-level view.”
- 负面词强力排除:在最后的负面排除提示中,必须在原有词汇的基础上,追加排除分屏多格的英文词汇,形成:“no music, no subtitles, no cuts, no transitions, no split-screen, no grid, no multi-view panels, no side-by-side views, no quad-view”。
- 纯物理直接续接提示词控制(Pure Physical Continuation Prompts):
- 严禁任何非自然转场词(Transition Word Blacklist):在前后镜头的视频提示词中,严禁出现任何打破单一镜头持续流动的视觉转场或花招指令(不准使用 "whip pan", "dolly into black", "panning to blank sky", "fade to black", "cut to", "transition" 等)。
- 极高强度的像素连贯性声明(Strict Pixel Continuity Mandate):在 Shot N (N > 1) 的提示词开头,必须硬编码极高强度的首帧像素起点、物理姿态、空间方位和运动趋势的直接咬合指令。例如:“Seamlessly and continuously resume the movement from <<<image_3>>>. The first frame of this video must strictly lock and perfectly align with the pixels, posture, expression, and environment shown in <<<image_3>>> with 100% precision. Starting exactly from <<<image_3>>>, continuing the motion flow, momentum, and camera movement trajectory from <<<video_1>>> with zero interruption, zero deviation, and absolute spatial-temporal continuity...”
- 相机匀速过渡控制(Steady Camera Progression):为确保跨视频接缝处相机没有速度剧烈突变,必须在提示词中显式描述恒定或渐变平滑的运动。例如:“The camera maintains a steady, continuous, and uniform forward tracking motion, matching the exact speed of <<<video_1>>> without any sudden acceleration or deceleration...”
- 微观物理特征复述锁定(Micro-environmental Sync):在后续镜头的提示词中,除了描述主要动作,必须 100% 复述前一镜头结尾处的微观特征,如:“under the exact same directional lighting with identical shadow mapping, identical atmospheric haze density, and the same wind force blowing the character's clothing...”
- 动态动作与镜头轨迹堆叠(Motion Stack):
- 相机运动(Camera):开头必须写明主导一镜到底的相机运动,且必须将故事板中的运镜指令翻译为标准的英文运镜术语(如:dolly in, dolly out, horizontal panning, tracking shot, low-angle tilt-up, 360-degree camera orbit)。例如:Continuous single-take camera movement, smooth low-angle tracking shot starting from front, slowly orbiting 180 degrees to the back while dollying in...
- 主体动作与情绪微表情(Subject Action & Micro-expressions):描述角色在连续镜头中的动作序列与微表情演变。
- 使用时序连词(then, subsequently, while, at the transition point of...)构建连贯的动作与表情链。
- 微表情与运镜深度结合:在提示词中显式描述与运镜匹配的情绪/表情流动。例如,配合镜头 Orbit/Dolly In,加入微表情与姿态过渡词:"...while the camera orbits to the side, the character's facial expression shifts from subtle tension to a relieved smile, with a slight tilt of the head, then shoulders visibly relax as the camera dollies in...".
- 环境变化(Space):描述光影、风力、烟雾等环境在镜头移动过程中的微小流动。
- Seedance 2.5(分辨率 480p) 专用包裹器**:
- 旁白或对白使用 {} 包裹(如:{I have been waiting for this moment.})。
- Environment sound effects (SFX) are wrapped in < > (e.g., <footsteps on wooden floor>, <soft wind blowing>).
- 负面排除提示:
- 提示词末尾必须包含 no music, no subtitles, no cuts, no transitions, no split-screen, no grid, no multi-view panels, no side-by-side views, no quad-view,防止视频生成器自作主张加入镜头硬切、音乐或分屏分栏画面。
- 音频与音效提示词撰写规范:
- BGM 乐器提示词(text_to_instrumental):
- 结构化描述:[主要乐器] + [节奏/速度] + [情绪与氛围形容词] + [特定的流派/风格风格关键词]。例如:ambient cinematic synthesizer, slow tempo, lonely and nostalgic mood, science fiction background theme。
- 合规约束:严禁在提示词中包含任何著名音乐家、歌手或特定乐队的名称(如 Hans Zimmer, Joe Hisaishi 等),防止模型因版权政策生成失败。
- Seedance 2.5(分辨率 480p) 内置音效(SFX)包裹器**:
- 高物理还原度描述:包裹在 <...> 内的音效词必须极具物理细节、空间方位和材质感。
- 瞬态动作声:写明动作主体和介质。例如:<heavy boots squeaking on wet wooden floor>, <metallic click of door opening>,而非简单的 <footsteps>, <door sound>。
- 环境持续声:在镜头描述的对应时间点,描述环境介质的物理波动。例如:<low rumbling wind howling through concrete corridor>, <soft constant rain pattering on glass window>。
- BGM 乐器提示词(text_to_instrumental):
6. 동영상 조립
一镜到底视频剪辑与渲染策略:
- 镜头组装与无缝物理拼合:
- 主轨道硬切排列:整个一镜到底长视频必须严格按照故事板顺序,放置在主视频轨道。对于多镜头拼接,严禁使用任何视频剪辑软件内置的转场效果(Transitions)、黑屏淡入淡出、闪白或交叉溶解。必须采用绝对硬切(Hard Cuts)无缝拼合。
- 首尾帧极端纯净化裁剪(Pruning Static & Glitch Frames):
- 视频生成模型在生成每一段 Shot 时,其首尾可能存在“启动卡顿”、“首帧画面黏滞静态”或“尾帧运动骤停/像素噪点坍缩”等非连贯帧。
- 裁剪规则:剪辑组装时必须逐帧排查。首帧(In Point)向后裁剪掉 1-2 帧,直至画面出现明显的物理运镜/主体运动趋势;尾帧(Out Point)向前裁剪掉 1-3 帧,彻底移除任何生成极限处的画面凝固或像素抖动,确保参与拼合的两端画面均处于饱满、平滑的动态速度流中。
- 衔接部分的物理速度(Velocity Alignment)一致性对齐:
- 相机运镜角速度对齐:相邻 Shot N-1 与 Shot N 拼接处,镜头的物理位移速率、推进(Dolly)速度、平移(Pan/Tracking)角速度等必须在视觉上保持绝对连贯或极其平滑的无阻尼过渡。
- 运动速度微调与光流补偿:若 Shot N 起始的运镜物理速度与 Shot N-1 的结束运镜速度存在微弱的生成偏差,允许对衔接处前后 5-10 帧应用高精度的变速(Speed Ramp)处理(例如:将 Shot N 前段微调至 1.05x - 1.15x,或对 Shot N-1 尾部进行平滑极速缓入),使其运动速率在切点实现物理级无感咬合。
- 动作匹配拼接(Match Action Alignment)精细化裁剪规则:
- 消除动作重复(重合多帧剔除):由于 Shot N 生成时参考了 Shot N-1 的最终视频,其起始段通常会生成一部分与 Shot N-1 尾部高度重合的重复动作。严禁直接首尾相连导致动作产生“倒带、重复两次”的鬼畜现象。
- 不同动作速率的精准剔除帧数标准:根据动作的速度和幅度,实施分类量化剔除:
- 快速/爆发性动作(如出拳击打、急速奔跑、惊恐回头、物件坠落、极速运镜衔接):此类动作视觉残留短,重合段落较窄。必须精准剔除 Shot N 头部 6 - 12 帧(约 0.2 - 0.4 秒,按 30fps 计算),防止过度剪辑导致动作瞬间“瞬移”或丢失爆发力。
- 中速/常态肢体动作(如步行迈步、推门侧身、伸手拿取、起立坐下):此类日常动作轨迹均匀。必须精准剔除 Shot N 头部 15 - 28 帧(约 0.5 - 0.9 秒),使两段素材中骨骼关节和重心轨迹完美咬合。
- 慢速/微表情过渡动作(如缓慢转头、视线低垂、轻微呼吸、沉思对视):此类动作位移极小,但模型容易生成冗长的静态粘滞帧。必须精准剔除 Shot N 头部 24 - 40 帧(约 0.8 - 1.3 秒),彻底滤除多余的静止帧,确保情感流动不中断。
- 黄金剪切点(Golden Cut Point)定位法:
- 光流与轮廓对齐:对比 Shot N-1 的最后 30 帧与 Shot N 的前 45 帧,寻找主体物理轮廓、骨骼关节位置、视线朝向以及光流矢量(Motion Vectors)重合度最高(相似度 > 95%)的一帧,将其定义为“动作重合终点”。
- 切点锁定:将 Shot N 中该“动作重合终点”之前的所有帧全部剪除。切点(Cut Point)必须精准落在该动作惯性释放的最流畅瞬间(例如:迈步时脚掌即将着地、但仍悬空 1 厘米的瞬间;或推门旋转至 30 - 45 度、重力能正在释放的瞬间),完美承接前后的物理运动动能,实现视觉上的无缝接力。
- 纯物理接缝处光影与色彩平滑微调(Pure Continuation Lighting & Color Micro-keyframing):
- 接缝亮度/色温无感补偿(Splicing Exposure & Color Matching):即使我们在生成端使用了 <<<image_3>>> 进行首帧像素锁定,AI 视频生成依旧可能在接缝直切处的第 1 帧产生极其微弱的全局曝光或色度抖动。为实现 100% 电影级无感过渡,剪辑组装时必须逐帧分析直切点前后各 5 帧。若两端色温、曝光存在微弱肉眼差异,必须在这共 10 帧 的时间区间内应用高精度曝光度(Exposure)与色温(Color Temperature)的关键帧淡化插值(Keyframe Interpolation),让光影在一瞬间极缓、极均匀地平滑演变,彻底干掉任何瞬间“跳闪”或“偏色脉冲”。
- 多轨音频混合与音量高精度控制:
- 音视频轨对齐与同步:
- 如果视频轨道中包含通过 Seedance 2.5(分辨率 480p) 内置生成的动作音效或角色对白(使用 <...> 或 {...} 包裹),在 timeline 组装时,其音频流与视频流必须保持 1:1 帧级绝对对齐,不进行任何非线性的错位剪辑或断开。
- 高精度音量配比(Volume Levels Scaling):
- 在装配整体时间轴音轨时,对不同轨道实施精准的分级音量增益/衰减控制,建立清晰的听觉金字塔:
- 主语音层(Narration / Dialogue):保持最高清晰度,音量增益设置为 1.0 (0dB),作为听觉绝对主体。
- 环境音效与动态声效层(SFX):标准基准音量控制在 0.3 至 0.5 (-10dB 至 -6dB) 范围。一镜到底中,动作音效(脚步声、碰撞声、呼吸声等)必须根据相机与主体的相对距离和水平位置,实现精确的空间声学衰减与声道平衡定位:
- 距离衰减曲线(Distance Decay Curve):
- 极近距离(特写/微距,<1m):增益提升至原波形的 0.7 至 0.9 (-3dB 至 -1dB),且增加高频瞬态细节(Transient Details),强化视觉贴近感。
- 常态中景(中近景,2m - 4m):保持标准基准 0.3 至 0.5 (-10dB 至 -6dB)。
- 远景大景(全景/远景,>10m):增益成对数衰减至原波形的 0.05 至 0.1 (-26dB 至 -20dB),并应用微量高频切除(Low-Pass Filter)来模拟空气吸音效应。
- 动态过渡(运镜变化过程):在推拉镜头(Dolly In/Out)时间区间内,音量增益必须以 每0.1秒为步长进行对数插值(Logarithmic Interpolation)平滑过渡,严禁出现音量突变。
- 水平方位与声道平衡(Lateral Panning & Balance):
- 当动作主体在画面偏左/偏右侧运动时,其声音必须在左右声道间进行动态声像(Pan)偏移。
- 若主体偏向单侧边缘(占比画面水平 80% 以上位置),对应声道平衡比例锁定为 8:2(或 2:8),即一侧声道分量增益调至 0.8,另一侧衰减至 0.2,完美对齐视觉位置,使观众产生“音随影动”的绝对沉浸感。
- 距离衰减曲线(Distance Decay Curve):
- 背景音乐层(BGM):音量整体压低至 0.15 至 0.25 (-16dB 至 -12dB),使其温和地衬托于声场底层,绝不掩盖人声与动作音效。
- 在装配整体时间轴音轨时,对不同轨道实施精准的分级音量增益/衰减控制,建立清晰的听觉金字塔:
- 动态避让(Ducking)与淡入淡出平滑过渡:
- BGM 自动避让(Ducking):在旁白(Narration)或对白出现的时间段内,背景音乐(BGM)轨道音量需自动进行避让,衰减 3dB - 6dB,在语音结束后平滑复原。
- 首尾平滑淡入淡出:为防止音频开场和收尾突兀,全局 BGM 及持续环境音层在时间轴开端添加 1.5秒 的线性淡入(Fade-in),在时间轴末尾添加 1.5秒 的线性淡出(Fade-out)。瞬态动作音效在相邻切换点需进行 0.2s - 0.5s 的微型淡入淡出交叉平滑,确保声场平稳衔接。
- 音视频轨对齐与同步: