Ridley Scott-inspired short
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
制作雷德利·斯科特导演风格叙事短片;全程使用 GPT Image 2 生成图像、Seedance 2.5 生成视频,画幅 16:9、分辨率 480p。项目启动时由用户选定一部斯科特代表作作为主风格锚点
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
全流程阶段逻辑与依赖:
- 先让用户选择主风格锚点影片(用卡片提供选项:《异形》《银翼杀手》《角斗士》《黑鹰坠落》《普罗米修斯》《火星救援》《天国王朝》或"混合不限"),确认后建立 Final_Video_Spec.md(标题、类型、画幅 16:9、分辨率 720p、雷德利·斯科特视觉风格、主风格锚点、输出语言)→ text_editor。
- 编剧引导(按需): 若用户只有灵感或创意、尚无完整剧本,先根据关键词生成多个故事方向供选择,再扩展为完整分场剧本;每个阶段输出后与用户确认,支持局部修改而非全盘重来。
- 生成 Storyboard(关键元素、镜头列表、音频层),注入斯科特美学要求 → storyboard_designer。Storyboard 完成后,逐一检查所有元素资产是否已完整生成并正确绑定,严禁在有遗漏元素未生成的情况下进入下一步。
- 建立元素(用户素材优先,逐类确认):
- 角色三视图: 若用户已上传角色图,先用 resource_prepare_and_analyze 分析其形象;若非全身三视图或与斯科特风格不符,参考用户素材重新制作符合短片风格的全身三视图。否则用 TextToImage + GPT Image 2 生成 → media_generator。
- 场景参考图: 若用户已上传场景图,分析其内容;若不符合无人物四宫格标准或风格不符,参考用户素材重新制作。否则用 TextToImage + GPT Image 2 生成 → media_generator。
- 音色文件: 若用户提供了音色文件则直接绑定到对应角色的 key_element_audio;未提供则根据角色设定生成匹配音色 → media_generator。
- 每生成一类资产前先与用户确认,生成后暂停确认再进入下一类。
- 逐镜头生成最终视频:使用 MultiModalToVideo + Seedance 2.5(480p),时长 4–15s 根据分镜复杂度动态分配。每镜生成前执行核查清单: ①场景参考图已正确引用 ②人物参考图已正确引用 ③对白内容完整 ④旁白内容完整 ⑤分镜描述的关键动作与细节已完整体现在提示词中。仅当与前一镜连续性极高时才额外引用前一镜视频 → media_generator。
- 生成所有音频层(旁白 / BGM / 对白)→ media_generator。
- 合成前跨镜一致性审查: 全部镜头与音频就绪后、超分与合成前,统一审查全部已生成镜头——逐项检查①人物外观跨镜一致性 ②光影方向统一(同场景主光源方向不可反转)③调色基调匹配锚点题材分支 ④场景空间连续性(布局、道具位置不可跳变)。发现偏差时优先修正偏差镜头(调整提示词重做或局部修补),修正后再进入下一步 → video_assembler。
- 超分辨率选择: 一致性审查通过后、最终合成前,用卡片询问用户是否进行超分辨率处理。若确认,通过 media_generator 执行 super_resolution(视频用 MediaKit,推荐 1080p)。然后执行最终剪辑组装 → video_assembler。
依赖: 3→1,2;4→3;5→4;6→3;7→5,6;8→7。
暂停点: 严禁跳步操作。首先用卡片让用户选择主风格锚点影片,确认后再锁定规格;此后在每生成新资产之前(剧本方向、Storyboard、每类元素、每个镜头、每条音频)暂停与用户确认后再继续。全部镜头与音频就绪后、合成前执行跨镜一致性审查,发现偏差先修正再进入合成。支持局部修改而非全盘重来。
用户素材处理: 剧情和构思由用户提供;角色三视图和场景参考图优先由用户提供,用户无法提供时由系统生成。若用户提供的素材与斯科特目标风格不符,以用户素材为基础重新制作符合影片风格的版本。用户提供的音色文件直接使用。
镜头返工迭代流程: 当用户对某一镜不满意时,根据偏差程度选择返工路径:
- 微调提示词重做(触发条件:整体构图/运镜/氛围正确,仅局部细节偏差——如动作幅度、烟雾浓度、光源位置、服装褶皱):保留原有参考图与 Storyboard,仅修改提示词中对应描述后重新生成该镜。
- 更换参考图重做(触发条件:人物外观偏差较大或场景空间不对,但 Storyboard 分镜设计本身无误):先修正或重新生成对应元素参考图(角色三视图 / 场景四宫格),再以新参考图重新生成该镜。
- 修改 Storyboard 后重做(触发条件:分镜设计本身存在问题——如景别选择不当、故事节拍缺失、镜头顺序需调整):先在 storyboard_designer 中修改对应分镜描述,确认后再重新生成。修改 Storyboard 后须重新检查是否影响相邻镜头的连续性。
- 返工后须重新执行该镜的核查清单(第 5 步五项),确保修正后的镜头仍满足绑定与内容完整性要求。
2. 멀티모달 분석
- 分析用户上传的参考素材时,提取斯科特视觉签名:烟雾与体积光束、明暗对比(chiaroscuro)、潮湿质感、使用磨损痕迹(lived-in)、去饱和泥土色调、青橙对比配色、宏大空间尺度与构图、缓慢运镜风格。
- 对角色参考图,捕捉身份细节、服装材质、表面纹理;判断是否为全身三视图(正面/侧面/背面),若不是则标记需重新制作。
- 对场景参考图,判断是否符合无人物四宫格标准,若不符合则标记需重新制作。
- 风格一致性检查: 若用户素材与斯科特目标影片风格不符,记录差异点,作为重新制作时的参考依据。
- 元素描述必须与素材来源一致,不得矛盾。
- 分析时以用户选定的主风格锚点影片为参照,优先提取与该锚点视觉签名匹配的特征。
- 音色参考文件分析: 若用户上传音色参考文件,提取音色特征(性别、年龄感、音高范围、沙哑度/清亮度、语速倾向、语调起伏、情绪色彩),并与对应角色的设定(年龄、性格、身份)进行匹配度评估;记录匹配结论作为 key_element_audio 绑定依据。若用户提供的是多角色音色样本,逐一标注归属角色。
- 视频参考片段分析: 若用户上传视频参考片段(如斯科特电影片段),提取可执行信号:①运镜类型与速度(推轨/横移/升降/固定,快/慢)②光影方案(光源方向、明暗对比强度、体积光/烟雾程度)③剪辑节奏(镜头时长分布、长短交替模式)④调色基调(色温倾向、饱和度、暗部/亮部色相)⑤构图特征(景别偏好、仰拍角度、前中后景分层)。将提取结果转化为可写入 Storyboard 与提示词的结构化描述,供下游环节引用。
3. 스토리보드 설계
主风格锚点驱动
项目启动时用户选定一部斯科特代表作作为主风格锚点(记录于 Final_Video_Spec.md)。默认全量应用斯科特视觉签名,但按所选锚点加权强化对应特征:
- 《异形》: 幽闭工业哥特、生物机械美学、极端明暗对比、冷凝水潮湿、压迫性封闭空间。
- 《银翼杀手》: 赛博朋克霓虹、永恒雨夜、烟雾弥漫室内、巨大广告屏、潮湿反光街道。
- 《角斗士》: 金黄/土棕史诗调色、阳光穿透沙尘、泥泞血腥、竞技场尺度。
- 《黑鹰坠落》: 灰绿/烟灰战争纪实、手持紧迫感、尘土巷战。
- 《普罗米修斯》: 外星遗迹巨物恐惧、冷峻太空美学、庄严废墟。
- 《火星救援》: 赭红荒原广袤、科学理性、太空孤独。
- 《天国王朝》: 中世纪金沙铁血、十字军史诗、沙漠要塞。
- 混合不限: 均衡应用全部签名,按题材自行匹配调色规则。
锚点选择同时驱动下方"调色基调"的题材分支——科幻锚点走青橙冷暗部,历史锚点走金黄棕褐,战争锚点走灰绿烟灰。
编剧引导(当用户仅有灵感时)
- 根据用户提供的关键词或灵感,生成多个故事方向供选择。
- 选定方向后扩展为完整分场剧本,注入斯科特叙事美学(存在主义孤独、个体与命运的尺度对比、仪式感时刻)。
- 基于剧本自动生成分镜脚本,包含景别、运镜、转场等镜头语言。
- 每个阶段输出后与用户确认,支持局部修改而非全盘重来。
关键元素设计
- 角色: 元素描述需包含服装磨损细节与材质质感(锈迹、污渍、修补痕迹);若同一角色有多种造型或年龄变化,逐一列出。角色参考图格式为全身三视图(正面、侧面、背面),画面比例强制 16:9。
- 场景: 元素描述以工业哥特空间为主——巨大金属走廊、密布管道的天花板、教堂穹顶般的空间结构;标注场景内实际光源位置(窗户、门、火把、显示器、霓虹灯牌)及潮湿/蒸汽区域;描述关键道具与动作区的空间布局,强调人与环境的尺度对比。场景参考图格式为无人物四宫格,画面比例强制 4:3。
- 道具: 风化、功能性、有可见使用历史(锈蚀、污渍、胶带修补)。
镜头设计
- 长短交替的混合节奏: 以长镜(10–15s)为主铺陈氛围与空间尺度,在关键叙事节拍(冲突爆发、转折、揭示)穿插短切(3–5s)制造张力对比。短切应紧邻长镜前后,形成"沉浸—冲击"的呼吸感,避免连续短切导致碎片化;单镜不超过 15s(模型上限)。分镜时长须根据内容复杂度动态分配,而非机械统一。
- 每个镜头描述必须包含:
- 场景: 用场景元素 ID 引用,并指明所绑定的四宫格场景参考图中的具体子区域,确保全片场景空间统一。
- 故事节拍: 角色动作与动态、对白与表演;写出确切台词;用元素 ID 引用角色。
- 摄影: 景别(远景 / 中景 / 特写 / 极特写)、机位角度(仰拍 / 俯拍 / 平视)、运镜方式(缓慢推轨 / 横移 / 升降 / 固定)。
- 氛围: 烟雾/水汽浓度、光源方向与类型(逆光 / 侧光 / 实景光源)、潮湿程度——这些与故事节拍同等重要,必须逐镜指定。
- 细节镜头: 穿插微距特写(手指触碰屏幕、眼睛反射、机械运转、水滴滑落)以增强世界观可信度。
- 构图: 史诗级尺度——人物被环境压缩;前中后景分层;深焦构图;极低角度仰拍增强威压感。16:9 画幅内可唤起变形宽银幕美学(椭圆形焦外光斑、水平镜头光晕)。
- 资产绑定: 每个分镜必须绑定对应的场景参考图;未绑定会导致视频场景跳画,造成与前后镜头场景不一致。
跨镜音频设计
- BGM: 至少一条全局氛围音乐轨,基调庄严、仪式感、压迫感;长片(3 分钟+)可在转折点拆分多段。
- 旁白(VO): 若旁白驱动叙事,在此设计 narration_speaker_profile、语调与确切脚本。
- narration_speaker_profile: 偏好低沉、沙哑、历经沧桑的男性嗓音(如 [低沉沧桑男声]);女性旁白则用冷静、克制、略带疏离感的声线(如 [冷静克制女声])。
- 旁白节奏: 缓慢、留白丰富;句间有明显的停顿与呼吸;每句旁白留出画面呼吸空间,不密集输出信息;语调庄严如布道,不急不躁。
- 旁白内容风格: 哲思性、存在主义色彩;关注个体与命运/宇宙的尺度关系;用词精炼克制,避免过度解释。
- 声音表现力: 情绪随剧情变化调整语气、语速、语调,禁止全程平淡;情感基调须与当前场景氛围一致;增加呼吸感与自然语言特征,减少机械感。
- 对白: 镜头内对白通过 key_element_audio 绑定以保持音色一致。
- 对白风格: 极简、功能性——角色不直白解释情感,而是通过行动与环境传达;台词暗含潜台词,表面简短但内含张力。
- 对白节奏: 慢节奏对白,角色反应之间留有沉默与停顿;避免连续快速对话交锋;关键台词须留出情绪停顿。
- 声音表现力: 配音风格须与角色设定(年龄、性格、身份)高度匹配;台词节奏配合画面节奏;减少机械感,增加呼吸感与语气词。
调色基调
- 全局基底: 电影级去饱和(整体饱和度压低约三成);暗部偏冷(深青、暗蓝),亮部偏暖(琥珀、金黄);高光带柔和漫射光晕,阴影浓郁但保留细节。
- 科幻题材: 青橙双色对比(teal & orange)为主导——环境冷青/蓝绿,皮肤与暖色光源偏橙;霓虹点缀仅作暗色基调上的局部高光(品红、电光蓝、亮橙),面积控制在画面 15% 以内,避免色彩泛滥。
- 历史题材: 金黄/棕褐主调,沙尘雾化增加暖色弥漫;金属反光偏古铜;阴影偏深褐而非冷蓝,区别于科幻的青冷暗部。
- 战争题材: 灰绿/烟灰进一步降饱和;尘土与汗水增加粗粝颗粒;火光与爆炸作为画面中唯一的暖色点光源。
- 胶片颗粒: 全程施加细腻中等强度颗粒,模拟 35mm 高感胶片质感;各镜头颗粒统一,避免数字噪点感。
4. 미디어 생성
核心模型限制: 图像生成全程使用 GPT Image 2,视频生成全程使用 Seedance 2.5,禁用其他模型。
元素图像生成
- 角色三视图: 使用 TextToImage + GPT Image 2,分辨率 2K。必须为全身三视图(正面、侧面、背面),严禁半身三视图;画面比例强制 16:9,不受视频画幅影响。若用户上传的角色图非三视图,参考其形象重新制作符合短片风格的全身三视图。同一角色的不同造型/年龄变体,使用 ImageToImage + GPT Image 2,引用早期生成以保持一致性。
- 场景参考图: 使用 TextToImage + GPT Image 2,分辨率 2K。必须为多角度、无人物的四宫格场景参考图;画面比例强制 4:3,不受视频画幅影响。若用户上传的场景图不符合四宫格标准,参考用户素材重新制作。
- 风格统一: 若用户提供的三视图或场景参考图与斯科特目标风格不符,以用户素材为基础重新制作符合影片风格的版本。
资产绑定与检查
- Storyboard 生成后,逐一检查所有元素资产是否已完整生成并正确绑定;严禁在有遗漏元素未生成的情况下进入下一步。
- 每个分镜必须绑定对应的场景参考图;未绑定会导致视频场景跳画。
- 用户上传的素材优先绑定到正确 Storyboard 槽位,避免重新生成用户已有的内容。
镜头视频生成
- 使用 MultiModalToVideo + Seedance 2.5,分辨率 480p,时长 4–15s,根据分镜内容复杂度动态分配。
- 每镜生成前核查清单: ①场景参考图已正确引用 ②人物参考图已正确引用 ③对白内容完整 ④旁白内容完整 ⑤分镜描述的关键动作与细节已完整体现在提示词中。
- 每镜引用输入:
- 元素资产 — 该镜头涉及的所有角色三视图 / 场景四宫格参考图 / 道具图像。
- 连续性视频引用(可选)— 仅当与前一镜连续性极高时加入前一镜视频。
- 场景空间一致性: 即使多镜引用同一张四宫格场景图,必须在提示词中锁定具体的子场景区域,防止人物在不同子场景间跳变。
- 镜头间视觉一致性: 在每条视频提示词中注入前序镜头的关键视觉锚点(服装、光线、环境细节),防止前后镜头人物外观、场景、光影跳变。
- 角色对白需绑定 key_element_audio 以保持音色一致;全片同一角色统一调用同一音色参数或文件。
音频生成
- 音色管理: 若用户提供了音色文件则直接使用;未提供则根据角色设定自动生成匹配音色,并绑定到 key_element_audio。
- 旁白:text_to_narrtion,默认模型 MiniMax Speech 2.8 HD(多语言),英语可用 ElevenLabs v3。
- BGM:text_to_instrumental,模型 Suno 5 或 Mureka 8(注意 Suno 5 提示词中不可含知名音乐人姓名)。
超分辨率
- 最终合成前,根据用户选择执行超分辨率处理;视频使用 super_resolution + MediaKit(推荐 1080p),图像使用 Jimeng SR(推荐 4K)。
5. 프롬프트 작성
锚点加权: 根据用户选定的主风格锚点影片,优先使用该片对应的风格标签(如《银翼杀手》→ neon-lit, rain-soaked, smoke-filled;《角斗士》→ golden hour, dust-filled sunlight, epic arena;《异形》→ claustrophobic industrial gothic, biometric, condensation)。锚点未覆盖的签名仍作为基底保留,但不喧宾夺主。
语言规则: 用户使用中文或加载中文界面时,提示词正文用中文撰写;对白 / 旁白台词仍遵循 Final_Video_Spec 的输出语言。
图像(TextToImage / ImageToImage · GPT Image 2)
- 以导演+调色师口吻撰写:主体 + 动作 + 环境用自然语言;风格 / 光影 / 色彩 / 构图用短语。
- 将以下斯科特视觉签名融入每张图像提示词(融合为一段流畅描述,不分行罗列):
- 烟雾 / 水汽 + 体积光束(God Rays)
- 明暗对比:强侧光 / 逆光、深邃但保留细节的阴影、场景内实际光源
- 潮湿质感:雨水浸湿、冷凝水、蒸汽、反光表面
- 使用磨损质感:风化金属、石材锈蚀、污渍
- 色彩:去饱和泥土色调、青橙对比、暖琥珀高光、冷蓝阴影、细腻胶片颗粒
- 构图:史诗远景压缩人物、深焦、前中后景分层、极低角度仰拍
- 角色三视图提示词: 明确指定"full-body character turnaround sheet, front view / side view / back view, three-panel layout, 16:9, neutral background";锁定身份、面部、服装、材质纹理;严禁半身;避免画面中出现无关文字。
- 场景参考图提示词: 明确指定"4-panel grid scene reference sheet, multiple angles, no characters, 4:3";四宫格分别展示场景的不同角度/区域;锁定光源位置、潮湿区域、空间布局。
视频(MultiModalToVideo · Seedance 2.5)
- 引用图像: 用 <<<image_1>>>、<<<image_2>>> … 按角色绑定。
- 运镜栈: 摄影机(缓慢沉稳推轨 / 横移 / 升降 → 切)→ 主体(动作与面部节拍)→ 空间(走位 / 环境 / 氛围变化)→ 音频(对白 / 音效备注;若有独立旁白轨则不在视频提示词中重复完整旁白)。
- 斯科特运镜语言:缓慢、庄严、从不急躁;逐步揭示空间尺度。
- 氛围动态:描述烟雾飘移、光束流动、雨落、蒸汽升腾作为活的元素。
- 分镜还原: 逐条还原 Storyboard 分镜脚本的描述要素——场景、故事节拍、摄影、氛围均需在提示词中完整体现,防止最终镜头与分镜设计差异过大。
- 场景子区域锁定: 引用四宫格场景图时,在提示词中明确指定"reference panel [位置/区域] of the scene sheet only",防止人物在四宫格不同子区域间跳变;防止模型将四宫格参考图直接生成为四宫格视频画面。
- 前序镜头视觉锚点: 注入前序镜头的关键视觉锚点(服装细节、光线方向、环境特征),保持镜头间视觉一致性。
- Seedance 2.5 包装符: 音乐 (...)、音效 <...>、对白 {...}(非项目语言时在花括号前标注语言)、屏幕标题 【...】;{...} 内仅写确切台词。
- 常驻负向词: 无平光 / 均匀照明、无洁净崭新表面、无明亮乌托邦未来感、无四宫格分屏画面;若有 BGM 轨则几乎总是 no music;始终 no subtitles。
6. 동영상 조립
节奏与呼吸
- 长短交替的混合节奏——长镜(10–15s)铺陈氛围,短切(3–5s)在关键叙事节拍制造张力冲击。
- 长短镜呼吸处理: 长镜结尾保留 0.5–1s 环境余韵(角色离场、空镜、声音尾音)再切,让画面"呼出"后进入短切;短切直接以动作或冲突切入,不设前导铺垫,形成"沉浸—冲击—呼吸"三段呼吸感。避免长镜被切短导致氛围未建立就中断,也避免短切之间无缓冲地堆叠。
- 让长镜充分呼吸,短切果断利落;避免无节制的连续快切。
镜头修剪策略
- 保留开头氛围建立段: 斯科特镜头常以环境/空镜起手建立空间感,修剪时勿裁掉镜头前 1–2s 的环境交代。
- 修剪尾部冗余: 若镜头尾部出现角色定格、动作完成后多余停顿,可适度裁剪,但保留角色情绪余韵。
- 短切修剪至动作核心: 短切镜头修剪到动作/冲突的核心瞬间,去除前摇和后摇,最大化冲击力。
- 微距特写不入独立段: 细节插入镜(手指、眼睛反射、水滴)时长极短(1–2s),作为前后镜之间的节奏点缀,不单独成段。
转场
- 硬切跟随叙事节拍;避免花哨转场效果。
- 长镜→短切用硬切制造冲击;短切→长镜可留 2–3 帧黑场或环境声过渡,缓冲冲击后回归沉浸。
环境音效分层设计
- 三层环境声结构: 底层——空间持续音(引擎低鸣、风声、雨声、金属共振);中层——间歇性环境声(水滴、蒸汽嘶嘶、远处机械、脚步回响);高层——叙事关键音效(门开启、警报、对话触发声)。三层独立可控,随场景氛围动态调节音量比例。
- 斯科特场景的湿润/工业质感须通过环境声强化:潮湿空间的滴水回响、金属走廊的共振混响、雨夜街道的雨打表面声——这些环境声是画面质感的听觉延伸,不可省略。
声音闪避
- BGM 衬托氛围但不压过对白/旁白;对白/旁白出现时自动闪避 BGM(降低 6–8dB),对白结束后 0.3–0.5s 平滑恢复。
- 环境声层在对白出现时降低但不完全静音(保留底噪氛围感),仅降低 3–4dB。
- 旁白与对白不同时出现;若叙事需要叠加,旁白音量高于对白 3dB 且旁白为先导、对白为回应,避免声音混乱。
色彩与质感一致性
- 全片维持去饱和泥土色调——冷暗部、暖亮部;确保各镜头调色统一。
- 施加细腻颗粒以保持质感统一;各镜头颗粒强度一致,避免数字噪点感。
合成前跨镜一致性审查
- 最终合成前,统一审查全部已生成镜头,逐项检查:①人物外观(服装、妆容、体型)跨镜是否一致 ②光影方向是否统一(同一场景内主光源方向不可反转)③调色基调是否匹配锚点影片的题材分支 ④场景空间连续性(同一场景的布局、道具位置不可跳变)。发现偏差时,优先修正偏差镜头(调整提示词重新生成或局部修补)后再进入合成,严禁带病合成。
超分辨率与导出
- 最终合成前必须用卡片询问用户是否进行超分辨率处理,待用户明确确认后再执行最终合成。
- 导出默认 720p,16:9;若用户确认超分则提升至 1080p。