Ridley Scott-inspired short
Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.
制作雷德利·斯科特导演风格叙事短片;全程使用 GPT Image 2 生成图像、Seedance 2.5 生成视频,画幅 16:9、分辨率 480p。项目启动时由用户选定一部斯科特代表作作为主风格锚点
Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.
Complete workflow
1. Planning
全流程阶段逻辑与依赖:
- 先让用户选择主风格锚点影片(用卡片提供选项:《异形》《银翼杀手》《角斗士》《黑鹰坠落》《普罗米修斯》《火星救援》《天国王朝》或"混合不限"),确认后建立 Final_Video_Spec.md(标题、类型、画幅 16:9、分辨率 720p、雷德利·斯科特视觉风格、主风格锚点、输出语言)→ text_editor。
- 编剧引导(按需): 若用户只有灵感或创意、尚无完整剧本,先根据关键词生成多个故事方向供选择,再扩展为完整分场剧本;每个阶段输出后与用户确认,支持局部修改而非全盘重来。
- 生成 Storyboard(关键元素、镜头列表、音频层),注入斯科特美学要求 → storyboard_designer。Storyboard 完成后,逐一检查所有元素资产是否已完整生成并正确绑定,严禁在有遗漏元素未生成的情况下进入下一步。
- 建立元素(用户素材优先,逐类确认):
- 角色三视图: 若用户已上传角色图,先用 resource_prepare_and_analyze 分析其形象;若非全身三视图或与斯科特风格不符,参考用户素材重新制作符合短片风格的全身三视图。否则用 TextToImage + GPT Image 2 生成 → media_generator。
- 场景参考图: 若用户已上传场景图,分析其内容;若不符合无人物四宫格标准或风格不符,参考用户素材重新制作。否则用 TextToImage + GPT Image 2 生成 → media_generator。
- 音色文件: 若用户提供了音色文件则直接绑定到对应角色的 key_element_audio;未提供则根据角色设定生成匹配音色 → media_generator。
- 每生成一类资产前先与用户确认,生成后暂停确认再进入下一类。
- 逐镜头生成最终视频:使用 MultiModalToVideo + Seedance 2.5(480p),时长 4–15s 根据分镜复杂度动态分配。每镜生成前执行核查清单: ①场景参考图已正确引用 ②人物参考图已正确引用 ③对白内容完整 ④旁白内容完整 ⑤分镜描述的关键动作与细节已完整体现在提示词中。仅当与前一镜连续性极高时才额外引用前一镜视频 → media_generator。
- 生成所有音频层(旁白 / BGM / 对白)→ media_generator。
- 合成前跨镜一致性审查: 全部镜头与音频就绪后、超分与合成前,统一审查全部已生成镜头——逐项检查①人物外观跨镜一致性 ②光影方向统一(同场景主光源方向不可反转)③调色基调匹配锚点题材分支 ④场景空间连续性(布局、道具位置不可跳变)。发现偏差时优先修正偏差镜头(调整提示词重做或局部修补),修正后再进入下一步 → video_assembler。
- 超分辨率选择: 一致性审查通过后、最终合成前,用卡片询问用户是否进行超分辨率处理。若确认,通过 media_generator 执行 super_resolution(视频用 MediaKit,推荐 1080p)。然后执行最终剪辑组装 → video_assembler。
依赖: 3→1,2;4→3;5→4;6→3;7→5,6;8→7。
暂停点: 严禁跳步操作。首先用卡片让用户选择主风格锚点影片,确认后再锁定规格;此后在每生成新资产之前(剧本方向、Storyboard、每类元素、每个镜头、每条音频)暂停与用户确认后再继续。全部镜头与音频就绪后、合成前执行跨镜一致性审查,发现偏差先修正再进入合成。支持局部修改而非全盘重来。
用户素材处理: 剧情和构思由用户提供;角色三视图和场景参考图优先由用户提供,用户无法提供时由系统生成。若用户提供的素材与斯科特目标风格不符,以用户素材为基础重新制作符合影片风格的版本。用户提供的音色文件直接使用。
镜头返工迭代流程: 当用户对某一镜不满意时,根据偏差程度选择返工路径:
- 微调提示词重做(触发条件:整体构图/运镜/氛围正确,仅局部细节偏差——如动作幅度、烟雾浓度、光源位置、服装褶皱):保留原有参考图与 Storyboard,仅修改提示词中对应描述后重新生成该镜。
- 更换参考图重做(触发条件:人物外观偏差较大或场景空间不对,但 Storyboard 分镜设计本身无误):先修正或重新生成对应元素参考图(角色三视图 / 场景四宫格),再以新参考图重新生成该镜。
- 修改 Storyboard 后重做(触发条件:分镜设计本身存在问题——如景别选择不当、故事节拍缺失、镜头顺序需调整):先在 storyboard_designer 中修改对应分镜描述,确认后再重新生成。修改 Storyboard 后须重新检查是否影响相邻镜头的连续性。
- 返工后须重新执行该镜的核查清单(第 5 步五项),确保修正后的镜头仍满足绑定与内容完整性要求。
2. Multimodal analysis
- 分析用户上传的参考素材时,提取斯科特视觉签名:烟雾与体积光束、明暗对比(chiaroscuro)、潮湿质感、使用磨损痕迹(lived-in)、去饱和泥土色调、青橙对比配色、宏大空间尺度与构图、缓慢运镜风格。
- 对角色参考图,捕捉身份细节、服装材质、表面纹理;判断是否为全身三视图(正面/侧面/背面),若不是则标记需重新制作。
- 对场景参考图,判断是否符合无人物四宫格标准,若不符合则标记需重新制作。
- 风格一致性检查: 若用户素材与斯科特目标影片风格不符,记录差异点,作为重新制作时的参考依据。
- 元素描述必须与素材来源一致,不得矛盾。
- 分析时以用户选定的主风格锚点影片为参照,优先提取与该锚点视觉签名匹配的特征。
- 音色参考文件分析: 若用户上传音色参考文件,提取音色特征(性别、年龄感、音高范围、沙哑度/清亮度、语速倾向、语调起伏、情绪色彩),并与对应角色的设定(年龄、性格、身份)进行匹配度评估;记录匹配结论作为 key_element_audio 绑定依据。若用户提供的是多角色音色样本,逐一标注归属角色。
- 视频参考片段分析: 若用户上传视频参考片段(如斯科特电影片段),提取可执行信号:①运镜类型与速度(推轨/横移/升降/固定,快/慢)②光影方案(光源方向、明暗对比强度、体积光/烟雾程度)③剪辑节奏(镜头时长分布、长短交替模式)④调色基调(色温倾向、饱和度、暗部/亮部色相)⑤构图特征(景别偏好、仰拍角度、前中后景分层)。将提取结果转化为可写入 Storyboard 与提示词的结构化描述,供下游环节引用。
3. Storyboard design
主风格锚点驱动
项目启动时用户选定一部斯科特代表作作为主风格锚点(记录于 Final_Video_Spec.md)。默认全量应用斯科特视觉签名,但按所选锚点加权强化对应特征:
- 《异形》: 幽闭工业哥特、生物机械美学、极端明暗对比、冷凝水潮湿、压迫性封闭空间。
- 《银翼杀手》: 赛博朋克霓虹、永恒雨夜、烟雾弥漫室内、巨大广告屏、潮湿反光街道。
- 《角斗士》: 金黄/土棕史诗调色、阳光穿透沙尘、泥泞血腥、竞技场尺度。
- 《黑鹰坠落》: 灰绿/烟灰战争纪实、手持紧迫感、尘土巷战。
- 《普罗米修斯》: 外星遗迹巨物恐惧、冷峻太空美学、庄严废墟。
- 《火星救援》: 赭红荒原广袤、科学理性、太空孤独。
- 《天国王朝》: 中世纪金沙铁血、十字军史诗、沙漠要塞。
- 混合不限: 均衡应用全部签名,按题材自行匹配调色规则。
锚点选择同时驱动下方"调色基调"的题材分支——科幻锚点走青橙冷暗部,历史锚点走金黄棕褐,战争锚点走灰绿烟灰。
编剧引导(当用户仅有灵感时)
- 根据用户提供的关键词或灵感,生成多个故事方向供选择。
- 选定方向后扩展为完整分场剧本,注入斯科特叙事美学(存在主义孤独、个体与命运的尺度对比、仪式感时刻)。
- 基于剧本自动生成分镜脚本,包含景别、运镜、转场等镜头语言。
- 每个阶段输出后与用户确认,支持局部修改而非全盘重来。
关键元素设计
- 角色: 元素描述需包含服装磨损细节与材质质感(锈迹、污渍、修补痕迹);若同一角色有多种造型或年龄变化,逐一列出。角色参考图格式为全身三视图(正面、侧面、背面),画面比例强制 16:9。
- 场景: 元素描述以工业哥特空间为主——巨大金属走廊、密布管道的天花板、教堂穹顶般的空间结构;标注场景内实际光源位置(窗户、门、火把、显示器、霓虹灯牌)及潮湿/蒸汽区域;描述关键道具与动作区的空间布局,强调人与环境的尺度对比。场景参考图格式为无人物四宫格,画面比例强制 4:3。
- 道具: 风化、功能性、有可见使用历史(锈蚀、污渍、胶带修补)。
镜头设计
- 长短交替的混合节奏: 以长镜(10–15s)为主铺陈氛围与空间尺度,在关键叙事节拍(冲突爆发、转折、揭示)穿插短切(3–5s)制造张力对比。短切应紧邻长镜前后,形成"沉浸—冲击"的呼吸感,避免连续短切导致碎片化;单镜不超过 15s(模型上限)。分镜时长须根据内容复杂度动态分配,而非机械统一。
- 每个镜头描述必须包含:
- 场景: 用场景元素 ID 引用,并指明所绑定的四宫格场景参考图中的具体子区域,确保全片场景空间统一。
- 故事节拍: 角色动作与动态、对白与表演;写出确切台词;用元素 ID 引用角色。
- 摄影: 景别(远景 / 中景 / 特写 / 极特写)、机位角度(仰拍 / 俯拍 / 平视)、运镜方式(缓慢推轨 / 横移 / 升降 / 固定)。
- 氛围: 烟雾/水汽浓度、光源方向与类型(逆光 / 侧光 / 实景光源)、潮湿程度——这些与故事节拍同等重要,必须逐镜指定。
- 细节镜头: 穿插微距特写(手指触碰屏幕、眼睛反射、机械运转、水滴滑落)以增强世界观可信度。
- 构图: 史诗级尺度——人物被环境压缩;前中后景分层;深焦构图;极低角度仰拍增强威压感。16:9 画幅内可唤起变形宽银幕美学(椭圆形焦外光斑、水平镜头光晕)。
- 资产绑定: 每个分镜必须绑定对应的场景参考图;未绑定会导致视频场景跳画,造成与前后镜头场景不一致。
跨镜音频设计
- BGM: 至少一条全局氛围音乐轨,基调庄严、仪式感、压迫感;长片(3 分钟+)可在转折点拆分多段。
- 旁白(VO): 若旁白驱动叙事,在此设计 narration_speaker_profile、语调与确切脚本。
- narration_speaker_profile: 偏好低沉、沙哑、历经沧桑的男性嗓音(如 [低沉沧桑男声]);女性旁白则用冷静、克制、略带疏离感的声线(如 [冷静克制女声])。
- 旁白节奏: 缓慢、留白丰富;句间有明显的停顿与呼吸;每句旁白留出画面呼吸空间,不密集输出信息;语调庄严如布道,不急不躁。
- 旁白内容风格: 哲思性、存在主义色彩;关注个体与命运/宇宙的尺度关系;用词精炼克制,避免过度解释。
- 声音表现力: 情绪随剧情变化调整语气、语速、语调,禁止全程平淡;情感基调须与当前场景氛围一致;增加呼吸感与自然语言特征,减少机械感。
- 对白: 镜头内对白通过 key_element_audio 绑定以保持音色一致。
- 对白风格: 极简、功能性——角色不直白解释情感,而是通过行动与环境传达;台词暗含潜台词,表面简短但内含张力。
- 对白节奏: 慢节奏对白,角色反应之间留有沉默与停顿;避免连续快速对话交锋;关键台词须留出情绪停顿。
- 声音表现力: 配音风格须与角色设定(年龄、性格、身份)高度匹配;台词节奏配合画面节奏;减少机械感,增加呼吸感与语气词。
调色基调
- 全局基底: 电影级去饱和(整体饱和度压低约三成);暗部偏冷(深青、暗蓝),亮部偏暖(琥珀、金黄);高光带柔和漫射光晕,阴影浓郁但保留细节。
- 科幻题材: 青橙双色对比(teal & orange)为主导——环境冷青/蓝绿,皮肤与暖色光源偏橙;霓虹点缀仅作暗色基调上的局部高光(品红、电光蓝、亮橙),面积控制在画面 15% 以内,避免色彩泛滥。
- 历史题材: 金黄/棕褐主调,沙尘雾化增加暖色弥漫;金属反光偏古铜;阴影偏深褐而非冷蓝,区别于科幻的青冷暗部。
- 战争题材: 灰绿/烟灰进一步降饱和;尘土与汗水增加粗粝颗粒;火光与爆炸作为画面中唯一的暖色点光源。
- 胶片颗粒: 全程施加细腻中等强度颗粒,模拟 35mm 高感胶片质感;各镜头颗粒统一,避免数字噪点感。
4. Media generation
核心模型限制: 图像生成全程使用 GPT Image 2,视频生成全程使用 Seedance 2.5,禁用其他模型。
元素图像生成
- 角色三视图: 使用 TextToImage + GPT Image 2,分辨率 2K。必须为全身三视图(正面、侧面、背面),严禁半身三视图;画面比例强制 16:9,不受视频画幅影响。若用户上传的角色图非三视图,参考其形象重新制作符合短片风格的全身三视图。同一角色的不同造型/年龄变体,使用 ImageToImage + GPT Image 2,引用早期生成以保持一致性。
- 场景参考图: 使用 TextToImage + GPT Image 2,分辨率 2K。必须为多角度、无人物的四宫格场景参考图;画面比例强制 4:3,不受视频画幅影响。若用户上传的场景图不符合四宫格标准,参考用户素材重新制作。
- 风格统一: 若用户提供的三视图或场景参考图与斯科特目标风格不符,以用户素材为基础重新制作符合影片风格的版本。
资产绑定与检查
- Storyboard 生成后,逐一检查所有元素资产是否已完整生成并正确绑定;严禁在有遗漏元素未生成的情况下进入下一步。
- 每个分镜必须绑定对应的场景参考图;未绑定会导致视频场景跳画。
- 用户上传的素材优先绑定到正确 Storyboard 槽位,避免重新生成用户已有的内容。
镜头视频生成
- 使用 MultiModalToVideo + Seedance 2.5,分辨率 480p,时长 4–15s,根据分镜内容复杂度动态分配。
- 每镜生成前核查清单: ①场景参考图已正确引用 ②人物参考图已正确引用 ③对白内容完整 ④旁白内容完整 ⑤分镜描述的关键动作与细节已完整体现在提示词中。
- 每镜引用输入:
- 元素资产 — 该镜头涉及的所有角色三视图 / 场景四宫格参考图 / 道具图像。
- 连续性视频引用(可选)— 仅当与前一镜连续性极高时加入前一镜视频。
- 场景空间一致性: 即使多镜引用同一张四宫格场景图,必须在提示词中锁定具体的子场景区域,防止人物在不同子场景间跳变。
- 镜头间视觉一致性: 在每条视频提示词中注入前序镜头的关键视觉锚点(服装、光线、环境细节),防止前后镜头人物外观、场景、光影跳变。
- 角色对白需绑定 key_element_audio 以保持音色一致;全片同一角色统一调用同一音色参数或文件。
音频生成
- 音色管理: 若用户提供了音色文件则直接使用;未提供则根据角色设定自动生成匹配音色,并绑定到 key_element_audio。
- 旁白:text_to_narrtion,默认模型 MiniMax Speech 2.8 HD(多语言),英语可用 ElevenLabs v3。
- BGM:text_to_instrumental,模型 Suno 5 或 Mureka 8(注意 Suno 5 提示词中不可含知名音乐人姓名)。
超分辨率
- 最终合成前,根据用户选择执行超分辨率处理;视频使用 super_resolution + MediaKit(推荐 1080p),图像使用 Jimeng SR(推荐 4K)。
5. Prompt writing
锚点加权: 根据用户选定的主风格锚点影片,优先使用该片对应的风格标签(如《银翼杀手》→ neon-lit, rain-soaked, smoke-filled;《角斗士》→ golden hour, dust-filled sunlight, epic arena;《异形》→ claustrophobic industrial gothic, biometric, condensation)。锚点未覆盖的签名仍作为基底保留,但不喧宾夺主。
语言规则: 用户使用中文或加载中文界面时,提示词正文用中文撰写;对白 / 旁白台词仍遵循 Final_Video_Spec 的输出语言。
图像(TextToImage / ImageToImage · GPT Image 2)
- 以导演+调色师口吻撰写:主体 + 动作 + 环境用自然语言;风格 / 光影 / 色彩 / 构图用短语。
- 将以下斯科特视觉签名融入每张图像提示词(融合为一段流畅描述,不分行罗列):
- 烟雾 / 水汽 + 体积光束(God Rays)
- 明暗对比:强侧光 / 逆光、深邃但保留细节的阴影、场景内实际光源
- 潮湿质感:雨水浸湿、冷凝水、蒸汽、反光表面
- 使用磨损质感:风化金属、石材锈蚀、污渍
- 色彩:去饱和泥土色调、青橙对比、暖琥珀高光、冷蓝阴影、细腻胶片颗粒
- 构图:史诗远景压缩人物、深焦、前中后景分层、极低角度仰拍
- 角色三视图提示词: 明确指定"full-body character turnaround sheet, front view / side view / back view, three-panel layout, 16:9, neutral background";锁定身份、面部、服装、材质纹理;严禁半身;避免画面中出现无关文字。
- 场景参考图提示词: 明确指定"4-panel grid scene reference sheet, multiple angles, no characters, 4:3";四宫格分别展示场景的不同角度/区域;锁定光源位置、潮湿区域、空间布局。
视频(MultiModalToVideo · Seedance 2.5)
- 引用图像: 用 <<<image_1>>>、<<<image_2>>> … 按角色绑定。
- 运镜栈: 摄影机(缓慢沉稳推轨 / 横移 / 升降 → 切)→ 主体(动作与面部节拍)→ 空间(走位 / 环境 / 氛围变化)→ 音频(对白 / 音效备注;若有独立旁白轨则不在视频提示词中重复完整旁白)。
- 斯科特运镜语言:缓慢、庄严、从不急躁;逐步揭示空间尺度。
- 氛围动态:描述烟雾飘移、光束流动、雨落、蒸汽升腾作为活的元素。
- 分镜还原: 逐条还原 Storyboard 分镜脚本的描述要素——场景、故事节拍、摄影、氛围均需在提示词中完整体现,防止最终镜头与分镜设计差异过大。
- 场景子区域锁定: 引用四宫格场景图时,在提示词中明确指定"reference panel [位置/区域] of the scene sheet only",防止人物在四宫格不同子区域间跳变;防止模型将四宫格参考图直接生成为四宫格视频画面。
- 前序镜头视觉锚点: 注入前序镜头的关键视觉锚点(服装细节、光线方向、环境特征),保持镜头间视觉一致性。
- Seedance 2.5 包装符: 音乐 (...)、音效 <...>、对白 {...}(非项目语言时在花括号前标注语言)、屏幕标题 【...】;{...} 内仅写确切台词。
- 常驻负向词: 无平光 / 均匀照明、无洁净崭新表面、无明亮乌托邦未来感、无四宫格分屏画面;若有 BGM 轨则几乎总是 no music;始终 no subtitles。
6. Video assembly
节奏与呼吸
- 长短交替的混合节奏——长镜(10–15s)铺陈氛围,短切(3–5s)在关键叙事节拍制造张力冲击。
- 长短镜呼吸处理: 长镜结尾保留 0.5–1s 环境余韵(角色离场、空镜、声音尾音)再切,让画面"呼出"后进入短切;短切直接以动作或冲突切入,不设前导铺垫,形成"沉浸—冲击—呼吸"三段呼吸感。避免长镜被切短导致氛围未建立就中断,也避免短切之间无缓冲地堆叠。
- 让长镜充分呼吸,短切果断利落;避免无节制的连续快切。
镜头修剪策略
- 保留开头氛围建立段: 斯科特镜头常以环境/空镜起手建立空间感,修剪时勿裁掉镜头前 1–2s 的环境交代。
- 修剪尾部冗余: 若镜头尾部出现角色定格、动作完成后多余停顿,可适度裁剪,但保留角色情绪余韵。
- 短切修剪至动作核心: 短切镜头修剪到动作/冲突的核心瞬间,去除前摇和后摇,最大化冲击力。
- 微距特写不入独立段: 细节插入镜(手指、眼睛反射、水滴)时长极短(1–2s),作为前后镜之间的节奏点缀,不单独成段。
转场
- 硬切跟随叙事节拍;避免花哨转场效果。
- 长镜→短切用硬切制造冲击;短切→长镜可留 2–3 帧黑场或环境声过渡,缓冲冲击后回归沉浸。
环境音效分层设计
- 三层环境声结构: 底层——空间持续音(引擎低鸣、风声、雨声、金属共振);中层——间歇性环境声(水滴、蒸汽嘶嘶、远处机械、脚步回响);高层——叙事关键音效(门开启、警报、对话触发声)。三层独立可控,随场景氛围动态调节音量比例。
- 斯科特场景的湿润/工业质感须通过环境声强化:潮湿空间的滴水回响、金属走廊的共振混响、雨夜街道的雨打表面声——这些环境声是画面质感的听觉延伸,不可省略。
声音闪避
- BGM 衬托氛围但不压过对白/旁白;对白/旁白出现时自动闪避 BGM(降低 6–8dB),对白结束后 0.3–0.5s 平滑恢复。
- 环境声层在对白出现时降低但不完全静音(保留底噪氛围感),仅降低 3–4dB。
- 旁白与对白不同时出现;若叙事需要叠加,旁白音量高于对白 3dB 且旁白为先导、对白为回应,避免声音混乱。
色彩与质感一致性
- 全片维持去饱和泥土色调——冷暗部、暖亮部;确保各镜头调色统一。
- 施加细腻颗粒以保持质感统一;各镜头颗粒强度一致,避免数字噪点感。
合成前跨镜一致性审查
- 最终合成前,统一审查全部已生成镜头,逐项检查:①人物外观(服装、妆容、体型)跨镜是否一致 ②光影方向是否统一(同一场景内主光源方向不可反转)③调色基调是否匹配锚点影片的题材分支 ④场景空间连续性(同一场景的布局、道具位置不可跳变)。发现偏差时,优先修正偏差镜头(调整提示词重新生成或局部修补)后再进入合成,严禁带病合成。
超分辨率与导出
- 最终合成前必须用卡片询问用户是否进行超分辨率处理,待用户明确确认后再执行最终合成。
- 导出默认 720p,16:9;若用户确认超分则提升至 1080p。