yeha.ai
목록으로

David Fincher-inspired short

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

用于制作大卫·芬奇导演风格的叙事短片——冷峻黑暗的风格化现实主义,低饱和黄绿色调,固定机位与极缓慢推轨,封闭压抑空间。使用 GPT Image 2 生成图像元素,使用 Seedance 2.5 生成视频

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

全片阶段逻辑与依赖关系:

  1. 建立 Final_Video_Spec.md(标题、类型、画幅 16:9、分辨率 720p、目标帧率 24fps、目标总时长、视觉风格:大卫·芬奇风格化现实主义、输出语言)→ text_editor
  2. 剧本开发(编剧阶段): 若用户已有完整剧本则跳过此步。若用户仅提供灵感、概念或粗略想法,按以下流程协助发展为完整剧本:
    • 与用户确认核心创意:主题、基调、大致情节走向、主要角色及关系。
    • 基于芬奇风格叙事原则(详见下方"编剧指引")生成故事大纲——包含冷开场钩子、缓慢升温的张力曲线、关键揭示节点、宿命感收束。
    • 将大纲细化为剧本初稿:场景描述、角色动作与走位、对白(遵循芬奇风格——潜台词丰富、克制自然,角色说出的永远少于心里想的)、旁白(如有)。
    • 将剧本初稿写入 Final_Video_Spec.md → text_editor
    • 暂停: 剧本初稿须呈现给用户审阅修改,获得确认后方可进入下一步——剧本是后续所有视觉设计的叙事根基,未经用户确认不进入 Storyboard 设计。
  3. 生成 Storyboard(关键元素、镜头列表、音频层)→ storyboard_designer。Storyboard 完成后,扫描上下文中用户提供的或已生成的资产,为匹配条目绑定 asset_id 到对应 Storyboard 槽位 → media_generator
  4. 建立元素资产(角色三视图、场景参考图、角色音色参考):
    • 若用户已提供且风格与芬奇影片风格相符,直接绑定到对应 key_element。
    • 若用户已提供但风格不符,以用户素材为参考重新生成符合影片风格的三视图/场景参考图 → media_generator
    • 若用户未提供,则为所有元素生成图像 → media_generator
    • 场景参考图格式: 场景参考图须为多角度无人物四宫格格式。若用户提供的场景图非四宫格格式,以用户素材为参考重新生成符合格式的版本 → media_generator
    • 角色音色绑定: 为 Storyboard 中有对白的角色建立 key_element_audio(音色参考)——若用户提供角色语音样本则直接绑定,否则生成参考音频 → media_generator
    • 元素完整性校验: 元素资产全部处理完成后,逐一核对 Storyboard 中所有 key_element(角色、场景、道具),确认每个元素均已生成图像并绑定 asset_id 到对应槽位;场景元素须特别确认其四宫格场景参考图已生成并绑定,这是防止镜头跳画的前提;同时确认所有有对白的角色均已绑定 key_element_audio。若发现遗漏(图像未生成/未绑定、音色未绑定),必须先补齐再进入下一步;禁止在元素不完整的情况下直接进入镜头生成。
  5. 逐镜头生成最终视频:引用该镜头涉及的元素图像(角色 + 场景/道具)及有对白角色的 key_element_audio(音色参考);相邻同场景镜头可将前序镜头 end_frame 作为后续镜头 start_frame 参考以维持视觉连续性;仅当与前序镜头连续性极强时附加前序镜头视频作为参考 → media_generator
  6. 生成所有音频层(BGM / 旁白 VO)→ media_generator
  7. 超分辨率选择(用户自主决定): 所有镜头视频和音频层就绪后、最终组装之前,向用户提供超分辨率(super_resolution)选项——用户可选择对镜头视频进行超分以提升分辨率和清晰度(可选帧率提升),也可选择跳过直接进入组装。须清晰说明超分的效果与代价,获得用户明确选择后执行;若用户选择超分,对镜头视频逐条执行 → media_generator
  8. 全部媒体就绪后(含可能的超分结果),执行最终组装并引导用户导出 → video_assembler

依赖关系: 2→1;3→2;4→3;5→4;6→3;7→5;8→4,5,6,7。

暂停节点: 不要一次性运行全部步骤。除在每个主要里程碑(规格锁定、剧本定稿、Storyboard 完成、元素完成、镜头视频完成、音频完成)后暂停等待确认外,每次生成新资产之前(元素图像、镜头视频、音频层、超分辨率等均适用)都必须先向用户说明即将生成的内容,获得明确同意后再执行生成,完成后再进入下一步——不连续自动生成多项资产。超分辨率步骤本身即为用户自主选择环节——须先询问是否超分,用户确认后才执行。

素材分工(概览): 各素材类型的详细处理规则见步骤 2(剧本)和步骤 4(元素资产)。核心原则:用户提供的素材优先使用——风格/格式相符则直接绑定,不符则以用户素材为参考重新生成;用户未提供的由系统生成。避免无谓地重新生成用户已提供且格式风格均匹配的内容。

编剧指引(芬奇风格叙事原则)

  • 叙事结构: 采用冷开场(cold open)制造悬念——以犯罪现场、异常事件或未来时间线开场,再切入主线叙事。主线采用缓慢升温(slow burn)节奏,信息逐层揭示,不急于给出答案,让真相在观众的不安中逐渐浮出水面。
  • 主题内核: 选择一个明确的主题锚点——执念、制度化腐败、道德灰区或人性暗面。表面是一个具体事件(谋杀案、调查、心理博弈),深层是对人性或体制的审视,两者并行。
  • 角色弧线: 主角设计为偏执者或被体制磨损的人——执念驱动其行动,执念也最终吞噬或改变他们。角色不必讨喜但行为逻辑必须自洽。
  • 对白原则: 潜台词大于台词——角色说出的永远少于心里想的。对白克制、自然、带有职业特征(警察用术语、调查员谈逻辑)。关键信息通过角色回避的话题或沉默传递,而非直接陈述。
  • 信息控制: 明确每个叙事节点观众应知道的信息量,刻意制造"比角色知道更多"或"比角色知道更少"的认知落差来驱动悬念。在剧本中标注每个节点的信息状态(观众已知/角色已知/双方未知),有助于后续分镜设计。
2. 멀티모달 분석

用户参考材料分析:

  • 若用户提供参考图像或视频,分析其是否包含芬奇风格视觉特征(低饱和黄绿色调、暗部为主的曝光、几何构图、荧光灯/台灯等实用光源),并在 Storyboard 元素描述中如实记录,不与用户素材矛盾。
  • 若用户提供角色三视图,提取各视角身份特征(正面/侧面/背面、肤色、发型、服装风格、面部状态);同时评估其风格是否与芬奇影片风格相符(低饱和黄绿色调、暗部为主的曝光、几何构图、实用光源)。若风格不符,明确标注"风格不符,需以用户素材为参考重新生成符合影片风格的版本"。
  • 若用户提供场景参考图,先检查其是否为多角度无人物四宫格格式(同一场景多个视角拼接为一张四宫格图,画面中无人物)。若非四宫格格式,标注"格式不符,需以用户素材为参考重新生成多角度无人物四宫格场景参考图";同时评估风格是否与芬奇影片风格相符(标准同角色三视图),若不符标注"风格不符,需重新生成"。
  • 若用户提供角色语音样本,提取音色特征(性别、音高、沙哑度、语速、语气基调),记录为该角色的 key_element_audio 描述依据,确保后续镜头中对白音色与用户样本一致。
3. 스토리보드 설계

导演指引(从剧本到画面)

  • 视觉叙事优先: 能用画面传达的信息不用对白——桌上的文件、角色的微表情、空间中的物件位置都是叙事工具。设计每个镜头时先问"这个画面在讲什么故事",确保画面本身承载叙事功能。

  • 走位与权力关系: 角色在空间中的位置反映权力动态——审讯室中谁坐着谁站着、办公桌两侧的距离、角色被墙壁和天花板挤压的程度,都在无声传递权力与压迫信息。设计走位时将空间政治纳入考量。

  • 静止即张力: 芬奇的张力来自凝视而非运动。让固定机位的长时间凝视承担情绪积累——观众被迫在沉默和静止中感受不安,而非靠快速剪辑制造虚假紧张。

  • 信息揭示节奏: 视觉信息揭示须与剧本的信息控制配合——关键道具(文件上的文字、桌上的照片)在恰当时机才进入景深或被推近,过早揭示消解悬念,过晚失去冲击力。

  • 环境即角色: 将空间视为半个角色——荧光灯嗡鸣、雨水模糊的窗户、低矮压迫的天花板都在参与叙事。设计场景时赋予环境情绪表达功能,而非仅作为背景板。

  • 色调统一与孤立色彩: 同一场景内将整体色调压向统一的暗、中性基底——同一房间同一时段的所有镜头共享同一色调基准(同一组低饱和黄绿/烟灰底色、同一光源色温)。正因如此,偶尔出现的单一强调色(一件红色衬衫、一盏橙色台灯、一张黄色便条)才会在整体中性背景中格外刺眼——这种"割裂感"是芬奇用色彩制造孤独与异化的核心手法。设计场景时规划:哪些场景维持完全中性无重点色,哪些场景允许引入一个强调色作为叙事焦点——强调色须与场景的信息揭示节点对应,而非随机出现。

总时长与镜头数量规划

  • 以 Final_Video_Spec.md 中确定的目标总时长为锚点,自上而下反推镜头数量并分配叙事节奏曲线,避免镜头数量失控或叙事节奏失衡。
  • 节奏曲线分配(参考比例): 冷开场(cold open)约占 15%——以悬念钩子快速建立不安;缓慢升温(slow burn)约占 50%——信息逐层揭示、张力缓慢累积;揭示与收束约占 35%——真相浮出水面、宿命感收尾。具体比例可随故事调整,但须遵循"慢大于快、积累大于爆发"的芬奇节奏感。
  • 镜头数量推算: 根据目标总时长和单镜头时长(4–15s)估算镜头数量范围——如目标 3 分钟(180s)约需 12–30 个镜头(均值约 18–20 个)。在 Storyboard 中为每个镜头标注编号、规划时长,并标注其所属叙事段落(冷开场 / 升温 / 揭示收束),使节奏曲线可追踪、可校验。
  • 若推算出的镜头数量过多(如超过 30 个),与用户确认是否缩减总时长或合并镜头,避免工作量失控。

关键元素设计

  • 角色(key_element character): 服装以深色系为主——深灰西装、黑色外套、深色衬衫,风格务实低调。面部状态为疲惫、紧绷、若有所思,肤色偏灰偏黄,眼下有阴影,传达长期精神压力。若同一角色有多种造型或年龄变化,逐一描述。
  • 角色音色(key_element_audio): 为有对白的角色定义音色参考——但 key_element_audio 仅锁定角色的基础音色(性别、音高、沙哑度、语速基调),确保同一角色跨镜头音色一致。芬奇风格角色基础音色偏低沉、疲惫、克制:中年男性声音沙哑低沉、语速偏慢;女性角色声音冷静、疏离。若用户提供语音样本则如实记录其音色特征,不与用户素材矛盾。角色的情绪表达不在 key_element_audio 中体现——情绪随故事变化,应在每个镜头的对白描述中以情绪标签动态标注(见"故事节拍"中的对白情绪标注要求),使同一角色在不同场景中呈现不同的情绪状态,而非全程一个语调。
  • 场景(element scene): 优先设计封闭压迫性空间——办公室、审讯室、警察局、阴暗公寓、雨中城市街道、荧光灯走廊。描述天花板高度(常低矮)、墙壁颜色(灰暗)、关键光源位置(台灯/荧光灯管/窗户)及主要道具摆放区。场景参考图须为多角度无人物四宫格格式——同一场景多个视角(正面、侧面、俯视、细节特写)拼接为一张 4:3 四宫格图,画面中无人物,便于跨镜头保持空间布局一致。
  • 道具: 纸质文件、老式电话、台灯、烟灰缸、咖啡杯、打字机或早期电脑终端。细节考究但绝不华丽。

镜头设计

  • 景别偏好: 大量使用中景和远景,以冷静、冷漠的观察者距离审视角色。特写镜头极为克制,仅在情绪爆发或关键信息传递时推近——这种距离感制造窥视般的观看体验。

  • 构图原则: 严格几何构图,人物置于画面几何中心或三分法交叉点;背景建筑线条、家具边缘、门窗框架形成引导线。经常纳入天花板,低角度拍摄让人物被天花板和墙壁"挤压",强化幽闭感。使用前景遮挡物(门框、窗框、栏杆、家具)框住主体,营造偷窥式视觉隐喻。

  • 镜头运动: 优先固定机位,以监控摄像头般的冷静凝视注视场景。运动时仅用极缓慢推轨(dolly in)或平稳跟拍(tracking shot),速度慢到观众几乎察觉不到——压迫感在不知不觉中累积。禁止手持晃动、快速变焦、花哨环绕。

  • 变焦镜头(zoom)的克制使用: 芬奇惯用变焦镜头拍摄而非定焦——但变焦的使用极度克制,速度极缓,在画面上近乎不可见,靠空间感的微妙挤压/拉伸持续作用于观众潜意识,制造隐性心理张力。当分镜需要时可规划缓慢变焦,在镜头描述中标注"极缓变焦(几乎不可见)";禁止快速推拉或明显的变焦感——变焦若被观众清晰察觉即为失败。

  • 广角克制: 避免夸张广角——广角带来的空间畸变会破坏芬奇压抑但真实的空间感;优先使用标准焦段至中长焦。广角仅在少数特定场合使用:需要强化封闭幽闭感的俯视全景,或明确的构图需要。

  • 视点剪辑(POV-driven cuts): 镜头切换的时机紧密跟随人物的注意力转移——当角色视线或注意力发生变化时,随即切换到下一镜头,让观众与角色共享感知视角,看到角色在意的事物。设计 Storyboard 时在镜头描述中标注"触发切换的人物视点变化"(如"角色视线转向桌上文件→切入文件特写"、"角色听见门响→切至门口"),使剪辑节奏服从角色的内心节奏而非机械时间分割。视点切换的连续性使观众下意识地代入角色感知,是芬奇制造窥视感与认知悬念的重要剪辑手段。

  • 镜头时长与节奏动态规划: 不要机械地统一时长,而是根据每个镜头的叙事功能和情绪角色动态分配。积累势能的凝视镜头、复杂动作或多角色对话场景可分配较长时长(10–15s);信息快速传递、冲击性反应或内部剪辑节奏紧凑的镜头可适当缩短(4–10s)。每条镜头视频须遵守 Seedance 2.5 时长限制——最低 4 秒、最高 15 秒,超出此范围无法生成;Storyboard 中为每个镜头显式标注规划时长。

  • 单镜头叙事容量控制: 一条 4–15 秒的视频只能可靠地执行有限的故事节拍。每个镜头应聚焦 1–3 个核心动作或叙事节拍——若分镜中塞入过多独立事件,模型将不可避免地丢失部分内容。设计镜头时先确定该镜头最重要的 1–2 个节拍作为必须呈现的核心内容,其余降为辅助;若核心节拍过多,拆分为多个镜头而非挤在一条视频中。故事节拍描述须具体到可见的身体动作和面部表情,而非抽象概括——"他缓慢翻开文件,目光停在第三行,手指无意识地敲击桌面"优于"他查看文件并陷入思考"。

  • 每个镜头描述必须包含:

    • 场景: 用场景元素 ID 引用位置/场景。每个镜头必须显式绑定其所在场景的元素 ID,且该场景元素的四宫格场景参考图必须已生成并绑定 asset_id——若场景参考图缺失或未绑定,该镜头不得进入生成,否则模型会自行脑补场景导致跳画。此外,须在镜头描述中指定本镜头对应四宫格参考图中的哪个视角(正面/侧面/俯视/细节特写),使该视角与镜头的机位角度和景别相匹配——这能引导模型聚焦于正确的空间布局,防止模型将四宫格中的不同格子误解为不同房间而造成跨镜头场景不一致。
    • 故事节拍: 角色动作、表演、对白(写出确切台词),用元素 ID 引用角色。对白须附带情绪标签——在每句台词前标注该角色此刻的情绪状态与说话方式(如"[压抑低语] 台词"、"[疲惫但试图镇定] 台词"、"[克制的愤怒,语速加快] 台词"),情绪标签须贴合角色在该场景中的心理状态与叙事张力,随故事推进动态变化,而非全程使用同一语气。台词本身应反映自然说话节奏——允许停顿、打断、语尾消散、句子不完整,避免书面化的完美句式,使对白听起来像真人说话而非朗读。
    • 摄影: 景别(中景/远景/特写)、机位角度(平视/低角度/高角度)、镜头运动方式(固定/极缓慢推轨/平稳跟拍)。

镜头内部剪辑(in-shot cuts)

  • 单镜头内使用内部剪辑时,切点必须跟随叙事节拍,而非均匀时间分割——服务于"积累—爆发—收束"的情绪曲线。

  • 典型节奏模式:先以固定机位中远景长时间凝视场景积累势能(约占镜头时长 60–70%),在角色做出关键动作或真相揭示时硬切到更近景别释放张力,再切回原景别或以极缓慢推轨收束。

  • 内部切点一律硬切,景别跳跃要明确(如中景→特写),制造视觉冲击;禁止花哨转场。

  • 当镜头存在内部剪辑时,在镜头描述中按剪辑顺序依次列出每个片段的场景/故事节拍/摄影,并标注切点意图(如"切点:揭示桌上文件内容")。

  • 跨镜头连续性标注: 当连续多个镜头发生在同一场景同一时段时,在镜头描述中标注"连续镜头组"并标明组内顺序。组内所有镜头必须引用同一场景元素 ID(即同一张四宫格场景参考图),确保场景布局、道具位置、光线方向跨镜头一致;仅靠 end_frame 衔接不足以锁定场景,四宫格场景参考图是场景一致性的首要锚点。组内相邻镜头可将前序镜头的 end_frame 作为后续镜头的 start_frame 参考,作为额外的连续性保障。

场景转换与匹配剪辑

  • 当场景切换时(非同一连续镜头组),可设计构图匹配的硬切作为转场手段——利用前后镜头在构图上的相似性(相似形状、主体位置、运动方向或视觉重心)实现无缝衔接。例如:前一镜头结尾角色推门的动作,硬切到后一镜头新场景中门被推开的特写;或前一镜头桌上的圆形咖啡杯,硬切到后一镜头中圆形时钟的特写。
  • 匹配剪辑须在 Storyboard 镜头描述中标注"匹配剪辑转场",并说明匹配元素(形状 / 位置 / 运动 / 光影),使后续提示词写作和组装阶段能准确执行。
  • 芬奇风格的匹配剪辑应保持冷静克制的视觉逻辑——匹配的是几何关系和运动轨迹,而非花哨的视觉特效。

画面内时间地点标注

  • 芬奇叙事常以画面内字幕标注时间和地点(如"1995年1月14日 凌晨3:17"、"萨克拉门托 警局地下室"),以冷峻的纪录片式手法交代时空信息,增强真实感与制度感。
  • 在 Storyboard 中规划这些标注:标注出现在哪些镜头(通常是场景首次出现时)、显示什么内容、停留时长。标注内容须与剧本的时间地点设定一致。
  • 标注风格须克制——无装饰字体、简洁排版、画面左下或底部居中、短暂停留后消失,不干扰叙事节奏。

跨镜头音频设计

  • 背景音乐: 规划至少一条全局 BGM 轨。芬奇风格 BGM 以极简、氛围化、工业质感为特征——低频持续音(drone)、不协和弦乐、稀疏钢琴、电子噪声音景;参考 Trent Reznor 与 Atticus Ross 的配乐美学。基调不祥、压抑、暗流涌动,避免旋律化或情绪外放的音乐。长片(3 分钟以上)有明确段落转折时可拆分为多条音乐段。
  • 环境音效: 芬奇的声场以环境音为情绪支柱。在每个场景的 Storyboard 中标注关键环境音:荧光灯管嗡鸣、雨打窗声、远处车流、钟表滴答、纸张翻动、硬质地面脚步声、老旧暖气管道低鸣。这些声音应在 audio_layer 或镜头描述中明确规划,与画面共同营造制度化冷漠与幽闭感。
  • 旁白(VO): 若旁白驱动叙事,在此设计。定义 narration_speaker_profile(如 [低沉冷静男声,语速偏慢,语气如法医报告般克制抽离])、语气和确切脚本,用 layout_instruction 关联到相关镜头区间。旁白整体保持临床式冷静,像在陈述事实而非倾诉——与芬奇影像的旁观者视角一致。但**"克制"不等于"平淡机械"**,需在以下维度增强表现力:
    • 节奏变化: 叙事张力低时语速可稍缓、留白多;信息密集或情绪升温的段落适度加快;关键揭示或转折处加入明显停顿后再继续——用节奏的松紧制造呼吸感,避免从头到尾匀速朗读。
    • 情绪底色微调: 整体基调克制抽离,但允许随故事推进出现极细微的情绪偏移——如描述犯罪现场时略带凝重,回忆段落略带疲惫,结局处略带宿命感。这种偏移是克制的暗示而非外放的情感宣泄。
    • 脚本标注: 旁白脚本中用标注引导 TTS 交付——[停顿] 表示短暂沉默,[长停顿] 表示戏剧性留白,[加重] 标记需要强调的词句,[语速放慢]/[语速加快] 标记节奏切换点。这些标注使生成出的旁白有自然的呼吸和停顿,而非机械连贯的播报。
4. 미디어 생성

模型锁定: 全程仅使用 GPT Image 2 生成所有图像,仅使用 Seedance 2.5(通过 MultiModalToVideo)生成所有视频。禁止替换为其他模型——若生成失败,优先使用同一模型重试;若多次重试仍失败,停止任务并向用户说明情况,由用户决定后续处理,不得自行切换到其他模型。

元素图像生成

  • 角色三视图:
    • 用户已提供且风格相符:直接绑定,不重新生成。
    • 用户已提供但风格不符:以用户素材为参考,用 ImageToImage(GPT Image 2)重新生成符合芬奇影片风格的版本——保留角色身份特征(五官、肤色、发型、体型),将色彩、光影、氛围转换为芬奇风格。
    • 用户未提供:用 TextToImage 生成。角色三视图采用 16:9 水平并排布局:从左至右依次为正面全身侧面全身背面全身三个视角——锁定角色身份特征(五官、肤色、发型、体型)、服装细节(衣物剪裁、材质、鞋)、整体轮廓与比例,确保跨镜头一致性。
    • 同一角色不同造型时,用 ImageToImage(GPT Image 2),后续造型引用前次生成以保持一致。
  • 场景参考图: 须为多角度无人物四宫格格式——同一场景多个视角(正面、侧面、俯视、细节特写)拼接为一张 4:3 四宫格图,画面中无人物。
    • 用户已提供且为四宫格格式、风格相符:直接绑定,不重新生成。
    • 用户已提供但非四宫格格式或风格不符:以用户素材为参考,用 ImageToImage(GPT Image 2)重新生成多角度无人物四宫格场景参考图——保留用户素材中的场景空间结构与布局,转换为四宫格多视角构图并叠加芬奇风格色彩光影。
    • 用户未提供:用 TextToImage 直接生成多角度无人物四宫格场景参考图。
  • 图像生成通用参数: 模型 GPT Image 2,分辨率 2K。各图像类型的画幅比例固定且独立于视频画幅——角色三视图 16:9,场景四宫格参考图 4:3——不得继承或沿用视频所选画幅比例。

角色音色绑定(key_element_audio)

  • 为 Storyboard 中有对白的角色绑定 key_element_audio(音色参考):用户提供语音样本时直接绑定,不重新生成。
  • 用户未提供时由系统生成: 使用 text_to_narration 生成一段简短的角色音色样本(约 5–10 秒的一句话),将 Storyboard 中该角色的 key_element_audio 音色描述(性别、音高、沙哑度、语速基调)作为声音特征传入;生成内容选取该角色最具代表性的一句对白或能体现角色语气特征的通用语句;生成后绑定到该角色的 key_element_audio 槽位。模型选择与旁白生成一致:中文项目用 MiniMax Speech 2.8 HD,英文项目用 ElevenLabs v3
  • 生成镜头视频时,将该镜头中有对白角色的 key_element_audio 加入参考输入(audio_infos),确保同一角色在不同镜头中对白音色一致。

旁白生成(narration / VO)

  • 使用 text_to_narration 生成旁白。推荐模型:中文项目用 MiniMax Speech 2.8 HD,英文项目用 ElevenLabs v3
  • 将 Storyboard 中 narration_speaker_profile 作为旁白生成的声音描述传入;旁白脚本中的节奏标注([停顿]、[长停顿]、[加重]、[语速放慢] 等)须一并传入,引导 TTS 引擎在对应位置生成自然的停顿、强调和节奏变化,避免匀速机械播报。
  • 若旁白脚本较长,可按叙事段落分多次生成后拼接,使每段的节奏和情绪底色更贴合该段落的叙事功能,而非用同一节奏处理整段旁白。

背景音乐生成(BGM)

  • 使用 text_to_instrumental 生成背景音乐。推荐模型:Suno 5(备选 Mureka 8)。
  • 将 Storyboard 中 BGM 轨的风格描述作为生成输入——芬奇风格 BGM 以极简、氛围化、工业质感为特征:低频持续音(drone)、不协和弦乐纹理、稀疏钢琴点缀、电子噪声音景;基调不祥、压抑、暗流涌动,避免旋律化或情绪外放。
  • Suno 5 合规注意: 不得在生成提示词中包含知名音乐人姓名——Suno 5 遇到知名艺术家姓名有高失败概率。Storyboard 中"参考 Trent Reznor 与 Atticus Ross 的配乐美学"仅作为风格设计参考,生成时须转化为纯描述性语言(如 "industrial ambient soundtrack, low-frequency drone, dissonant string textures, sparse piano, electronic noise soundscape, ominous and oppressive"),不可直接传入艺术家姓名。
  • 长片(3 分钟以上)有明确段落转折时,可按叙事段落分多次生成 BGM 段——每段风格一致但情绪强度随叙事曲线变化:升温段落更压抑密集,揭示段落可引入不协和高潮,收束段落回归空寂。各段在组装时用交叉淡化衔接。

镜头视频生成

  • 生成前提示词校验: 每次生成镜头视频前,将写好的提示词与 Storyboard 中该镜头的分镜脚本逐项比对,确认以下内容均已包含且与分镜脚本一致——若发现遗漏或不一致,先补齐提示词再执行生成,禁止在提示词不完整的情况下直接生成:

    • 场景参考(强制): 镜头所在场景的四宫格场景参考图是否已作为参考输入绑定——这是每个镜头的强制参考项,缺失将导致场景跳画;同时确认场景描述与分镜脚本一致。
    • 故事节拍(核心): 分镜"故事节拍"中列出的每个角色动作和表演指示是否已在提示词中逐条转化为可见的动作描述——不可遗漏、不可概括合并。若分镜列出 3 个节拍而提示词只概括为 1 句,须补全后再生成。
    • 人物参考: 镜头中出现的所有角色是否均已绑定对应元素图像参考。
    • 台词/对白: 分镜脚本中标注的台词是否已完整写入提示词({...} 内逐字台词),无遗漏。
    • 音色参考: 有对白的角色是否已绑定 key_element_audio 并加入生成输入。
    • 摄影与运动: 景别、机位角度、镜头运动方式是否与分镜脚本一致。
    • 内部剪辑: 若分镜指定内部剪辑,各片段描述与切点标注是否完整。
    • 四宫格防泄漏: 提示词中是否已包含"单一连续画面、禁止四宫格/分屏/拼贴"的约束,防止模型将场景参考图的四宫格结构复制到视频中。
    • 四宫格场景一致性声明: 提示词中是否已明确声明四宫格参考图是"同一场景的多角度视角"而非多个不同场景,并指定本镜头应参考的视角——缺失此声明会导致模型将不同格子当作不同房间,使同一连续镜头组内角色出现在不一致的空间中。
  • 使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 480p。时长根据 Storyboard 中该镜头的动态规划设定,每条视频须在 4–15 秒范围内(Seedance 2.5 下限 4s、上限 15s),不得超限。

  • 每个镜头的参考输入须包含该镜头涉及的所有 元素图像(角色 + 场景/道具),以及有对白角色的 key_element_audio。其中场景四宫格参考图为强制项——无论镜头是否含角色、是否使用 end_frame 衔接,都必须绑定当前场景的四宫格参考图;场景参考图缺失时模型会自行脑补场景,导致与前后镜头场景不一致(跳画)。

  • 同一元素复用: 同一角色/场景/道具在所有涉及该元素的镜头中必须引用同一组元素图像,禁止为同一元素在不同镜头中使用不同参考图。

  • 相邻同场景镜头连续性: 当相邻镜头属同一"连续镜头组"(同一场景同一时段)时,将前序镜头的 end_frame 作为后续镜头的 start_frame 或 reference_image,维持空间布局、光线方向与色温的一致过渡。

  • 长视频风格锚定: 长视频(3 分钟以上)应在元素生成阶段确立一张芬奇风格基准图,作为所有镜头视频生成的隐性风格参照,防止后期镜头风格漂移。

  • 仅当与前序镜头连续性极强(同一场景连续动作)时,添加前序镜头视频作为额外参考;通常以元素图像 + end_frame 参考为主,避免过度依赖视频参考导致风格退化。

超分辨率(super_resolution)

  • 仅在用户明确选择超分后执行——不自动超分。
  • 使用 super_resolution 工具,模型 MediaKit(视频超分)。推荐分辨率 1080p,除非用户明确要求其他分辨率(可选 2k / 4k)。
  • 可选帧率提升:默认不提升。项目目标帧率为 24fps(电影感),超分时可指定 24fps 保持帧率一致;若用户需要更流畅画面可提升至 30 或 60 fps。
  • 仅对用户选择超分的镜头视频执行;未选中的镜头保持原始 720p 资产不变。
  • 超分后的视频替换为对应镜头的最终资产供组装使用。
5. 프롬프트 작성

全局语言规则: 用户使用中文交互时,提示词正文用中文撰写;对白/旁白台词遵循 Final_Video_Spec 输出语言。

图像提示词(TextToImage / ImageToImage)

  • 以导演和调色师的口吻撰写:自然语言描述主体 + 动作 + 环境;短语描述风格/色彩/光线/构图。
  • 芬奇视觉签名(融入一段流畅描述,不分小节): 低饱和度黄绿色调为主色——灰黄、荧光灯绿、暗橄榄绿、烟灰、褪色琥珀黄;室内偏暖暗黄、窗外冷蓝形成微妙色温对抗;整体大幅去饱和,肤色偏灰偏黄,如被时间褪色的影像。实用光源照明(台灯、荧光灯管、窗户日光、街灯),大面积阴影占据画面,暗部细节若隐若现,高光被压制成发灰的柔和亮。中等偏低对比度,明暗过渡被雾气或颗粒柔化。精密几何构图,严格水平/垂直线,人物居中或三分法。空间封闭压抑。默认大景深(deep focus)——前景到背景全部清晰锐利,这是芬奇视觉风格的核心特征,区别于浅景深的虚化背景;仅在特定叙事需要时使用选择性焦点。画面带有细腻的数字胶片颗粒质感,如经过精细底片扫描的纹理。
  • 场景内色调统一与孤立强调色: 同一场景的图像须将整体色调统一到相同的暗、中性基底——同一组低饱和黄绿/烟灰底色、相同光源色温贯穿该场景所有生成图像。若 Storyboard 规划了场景强调色(如一件红色衣物、一盏橙色台灯),将该强调色作为画面中唯一的饱和色出现,其余元素须维持充分去饱和的中性基底——强调色的冲击感来自周围的中性沉默,而非整体高饱和。提示词中明确指定哪一元素携带强调色,其余区域保持中性。
  • key_element 图像: 锁定身份、肤色、服装、面部状态、道具材质,保持跨镜头稳定。
  • 图像画幅(独立于视频画幅): 角色三视图提示词须明确 16:9 横向布局(正面全身、侧面全身、背面全身三视角水平并排);场景四宫格参考图提示词须明确 4:3 画幅(2×2 四宫格拼贴)。图像画幅不得继承视频所选画幅——即便视频选了其他比例,图像仍各自使用 16:9 / 4:3。

视频提示词(MultiModalToVideo / Seedance 2.5)

  • 提示词与分镜保真度(首要原则): 视频提示词是对 Storyboard 镜头描述的忠实翻译,而非概括性改写——分镜中的每个核心故事节拍、角色动作和摄影设定都必须在提示词中找到对应表述。保真度优先于文采:宁可直白重复分镜中的具体动作描述,也不要用笼统的文学化语言替代。具体规则:

    • 节拍逐条保真: 分镜"故事节拍"中列出的每个角色动作和表演指示,须逐条转化为提示词中可见的动作描述,不得遗漏或合并——若分镜列出 3 个节拍,提示词中须出现 3 个对应动作描述,不可概括为一句。
    • 优先排序: 将该镜头最重要的 1–2 个核心节拍放在提示词主体最前面——模型对开头内容的执行权重最高;次要内容靠后排列,避免核心动作被淹没在冗长描述中。
    • 具体化表达: 用"角色缓慢翻开桌上文件,目光停留在第三行,手指无意识敲击桌面"替代"角色查看文件并思考"——模型需要可执行的具体动作而非抽象意图。
    • 信息密度控制: 提示词不追求面面俱到,而是确保核心节拍被清晰、具体地表达。过度堆砌细节会稀释每条指令的执行权重,导致模型只呈现部分内容;优先确保最重要的内容被完整呈现,次要细节可适当压缩。
  • 参考图像绑定: 用产品占位符 <<<image_1>>>、<<<image_2>>> 等,按角色绑定参考图像。

  • 四宫格防泄漏: 场景参考图为多角度无人物四宫格格式,仅作为空间参考使用,不得复制到视频输出。视频提示词中必须明确指示输出单一连续画面——加入"single continuous shot, no grid layout, no split screen, no collage"等约束,防止模型将四宫格参考图直接渲染为分屏或拼贴式视频。

  • 四宫格场景一致性声明(关键): 四宫格场景参考图展示的是同一个场景的多个拍摄角度(正面、侧面、俯视、细节特写),绝非四个不同的房间或地点。模型极易将四宫格中的不同格子误解为不同场景,导致同一"连续镜头组"内角色出现在不同空间中。因此视频提示词中必须包含以下两类声明:

    1. 单一场景声明: 明确告知模型"参考图中的四格是同一房间的四个视角,本镜头发生在这个单一空间内"(如 "the reference grid shows the same room from four angles; the scene takes place entirely within this single room")。
    2. 当前镜头视角指定: 根据 Storyboard 中该镜头的摄影设定(机位角度、景别),明确指出本镜头应参考四宫格中的哪个视角(如"本镜头为低角度中景,参考四宫格中的正面视角")。这使模型聚焦于正确的空间布局而非在不同格子间游移。
  • 运动堆栈: 摄影机(固定/极缓慢推轨/平稳跟拍)→ 主体(动作与面部节拍)→ 空间(走位/环境变化)→ 音频(对白/SFX 备注;若有独立旁白轨,不在视频提示词中重复完整旁白)。

  • 对白与音色: 视频提示词中用 {...} 标注的对白台词,其音色由该角色的 key_element_audio 绑定控制,不在提示词中描述基础音色特征;确保每个有对白的角色在生成前已绑定 key_element_audio。但对白的情绪表达须写入提示词——在 {...} 前以方括号标注情绪与说话方式(如 [压抑低语] {台词}、[疲惫但试图镇定, 语速偏快] {台词}),情绪标签取自 Storyboard 中该镜头的对白情绪标注。台词内容应保留自然说话的节奏痕迹——停顿用省略号、打断用破折号、语尾消散用省略号收尾——使对白听起来有真人说话的呼吸感而非机械朗读。

  • 芬奇风格核心描述模板: 大卫·芬奇电影风格,冷峻黑暗的风格化现实主义,低饱和度黄绿色调,画面整体偏暗偏灰,去饱和色彩处理,如同被时间褪色的影像。自然光源照明,大面积阴影,低照度环境,人物半隐于暗处。精密几何构图,冷静克制的固定机位或极缓慢推轨镜头,中远景为主。空间封闭压抑,雨夜城市或灰暗室内。大景深,前后景全部清晰锐利。细腻数字胶片颗粒质感。整体氛围:不祥、紧张、压抑、暗流涌动。

  • Seedance 2.5 包装符号(按需使用): 音乐 (...)、SFX <...>、对白 {...}(非项目语言时在花括号前标注语言)、屏幕文字 【...】;{...} 内仅放逐字台词。

  • 画面内时间地点字幕渲染: 当 Storyboard 指定某镜头包含时间地点标注时,用 【...】 包装标注文本(如 【1995年1月14日 凌晨3:17】、【萨克拉门托 警局地下室】)。在提示词中说明字幕显示位置(画面左下或底部居中)、字体风格(无衬线、无装饰、灰白色)和显示时机(镜头开头短暂出现后淡出),确保字幕作为叙事元素而非视觉干扰。

  • 镜头内部剪辑表达: 当 Storyboard 指定镜头包含内部剪辑时,在提示词中按剪辑顺序分段描述每个片段的摄影与动作,段落间明确标注切点(如"硬切至:");不要用时间戳分割,以叙事节拍为切分依据。

  • 环境音效标注: 在 SFX <...> 中标注芬奇风格环境音(如 <荧光灯嗡鸣>、<雨声>、<远处车流>),与 Storyboard 音频层规划保持一致;若有独立 BGM 轨,视频提示词中仍包含 no music。

负面约束(适用于所有生成)

  • 色彩禁止: 高饱和度色彩、鲜艳红色或粉色、明亮洋红、糖果色调、赛博朋克霓虹灯、大面积白色高光、HDR 超宽动态范围。
  • 场景禁止: 明亮阳光场景、蓝天白云、浪漫温馨氛围。
  • 运动禁止: 手持晃动、快速变焦、花哨运镜。
  • 表演禁止: 过度戏剧化的表情、夸张肢体动作、喜剧化节奏。
  • 景深禁止: 浅景深虚化背景、奶油化散景、大面积模糊光斑——芬奇风格默认大景深全画面清晰,仅在分镜明确指定选择性焦点时例外。
  • 格式禁止: 四宫格、分屏、拼贴式视频画面——场景参考图虽为四宫格,但视频输出必须为单一连续画面,禁止复制参考图的网格结构。
  • 旁白与字幕: 若有独立旁白轨,视频提示词中省略完整旁白脚本;几乎总是包含 no music;始终包含 no subtitles——此处的"subtitles"仅指对话字幕(应在后期添加),不影响用 【...】 指定的画面内时间地点标注(属于叙事性屏幕文字,应由视频模型渲染)。
6. 동영상 조립

超分资产处理

  • 若用户在组装前选择对镜头视频执行了超分辨率,组装时使用超分后的高分辨率资产;若用户选择跳过超分,则使用原始 720p 资产组装——两者不影响剪辑节奏与混音规则。

剪辑与节奏

  • 以干净利落的硬切为主,极少使用花哨转场特效。淡入淡出节制使用,偶尔用叠化暗示时间流逝或心理过渡。
  • 视点剪辑: 切换时机跟随人物视点变化——当角色视线或注意力转移时随即切换,让观众看到角色在意的内容,而非等到镜头时长用尽才切。Storyboard 中标注了"触发切换的人物视点变化"的镜头,须在组装时精确对准该视点转换的瞬间执行切换。
  • 匹配剪辑转场: 当 Storyboard 标注了匹配剪辑转场时,在对应镜头切换处执行——确保前后镜头的匹配元素(形状 / 位置 / 运动 / 光影)在构图中对齐,使硬切产生无缝衔接的视觉连续性。匹配剪辑的时机须精确:前镜头匹配元素在画面中的位置和运动轨迹,须与后镜头的匹配元素对接,误差控制在最小范围内。
  • 节奏沉稳,信息密度大但不急于推进;让场景在看似缓慢的节奏中积累情绪势能,关键时刻剪辑突然加速形成对比。
  • 优先保留长镜头完整时长,尊重 Storyboard 设定的镜头时长,不过度碎片化。
  • 目标帧率 24fps: 最终输出帧率设定为 24fps 以获得电影感——这是芬奇影片的标准帧率,能呈现轻微的运动模糊和胶片质感,区别于高帧率的电视 / 数字感。若源视频帧率高于 24fps,在组装时降至 24fps;若源视频帧率低于 24fps,保持原始帧率不做插值。

音频混音

  • 层次与避让: BGM、环境音效、对白/旁白三层音频须有清晰的主次关系——对白和旁白为前景时 BGM 须自动降低音量(ducking),确保人声清晰可辨;无对白的段落可适当提升 BGM 和环境音的存在感,让声音本身承担叙事。
  • 节奏匹配: 剪辑节奏与音频节奏须协同——硬切点可与音效冲击(如关门声、电话铃)同步以强化冲击感;长镜头凝视段落让环境音主导,营造沉浸式压迫感。
  • 音量过渡: 镜头切换时避免音量突变;BGM 跨镜头时用交叉淡化保持连贯,环境音可随场景切换而自然变化。
  • 音频转场技巧:
    • J-cut(声音先行): 下一镜头的声音(对白、环境音或 SFX)在当前画面结束前 0.5–2 秒提前切入——观众先听到声音再看到画面,制造信息悬念和叙事牵引力。适用于揭示性镜头切换或角色台词先于画面出现的场景。
    • L-cut(声音延续): 当前镜头的声音延续到下一镜头画面开始后 0.5–2 秒——声音"拖"过画面切换,使转场更流畅。适用于角色对话中的反应镜头切换或情绪延续。
    • 声桥(sound bridge): 用持续的环境音(雨声、荧光灯嗡鸣、远处车流)横跨场景切换——画面变了但声音连续,将不同空间缝合为统一的情绪氛围。芬奇风格中声桥尤为有效,因为环境音本身就是叙事支柱。
    • 以上技巧须根据叙事需要选择使用,非每个切换都施加——过度使用反而削弱效果。优先在关键叙事转折或情绪转换处使用。