Cyber megastructure hard sci-fi
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
此 Skill 适用于未来硬科幻概念片、文明层级视觉短片、赛博巨物奇观视频。适用于科幻导演、概念设计师、短视频博主,解决“想拍宏大科幻但不知从哪下手”的问题
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
完整工作流逻辑及依赖关系:
- 锁定全局规格(第一步,最高优先级)→ 使用 text_editor 创建 Final_Video_Spec.md (视频规格文档),输入:标题、类型(硬科幻短片)、纵横比 16:9、分辨率 4K (4096×2160)、帧率 24fps、目标时长 45–60 秒、视觉风格(超写实电影感、高对比度、巨型与微型物体间的比例差异)、调色板(冰蓝/暖金/淡紫/琥珀/淡粉)以及输出语言。与用户确认关键参数(时长、标题、输出语言);用户可在此阶段进行修改。仅在锁定后继续。
- 分析用户上传素材(如有)→ resource_prepare_and_analyze:从科幻参考资料中提取视觉风格信号,并从脚本中提取世界观构建细节,输出结构化文本以供后续阶段使用。
- 设计故事板(关键元素 + 分镜 + 音频层)→ storyboard_designer。向用户展示完整草案,重点标注可调整项目(叙事节奏、镜头序列、种族比例、背景音乐风格、旁白语调等)。在继续之前,等待用户确认或反馈。
- 生成关键元素(四个部落的代表性角色、机械鲲鹏、钢铁森林场景、废弃区场景)→ media_generator。如果用户上传了参考图片,注册 asset_ids 并将其绑定到相应的关键元素,跳过生成。仅在参考图与故事板存在视觉冲突时提示用户。每批元素生成后暂停,向用户展示,并允许重新生成或调整。
- 逐个镜头生成视频 → media_generator(在每个镜头生成后展示结果,仅在确认或修改后继续;用户可要求重新生成当前镜头)。
- 生成音频层(背景音乐 + 旁白,如适用)→ media_generator(预览音频以供用户确认;允许风格调整或重新生成)。
- 组装最终视频 → video_assembler。为用户预览时间轴结构(镜头序列 + 音频轨道)。仅在确认后进行渲染,然后引导用户导出。
依赖关系图: 2→1(素材分析需在全局规格确立后进行);3→1,2;4→3;5→4;6→3;7→4,5,6。
暂停节点(每个里程碑后必须暂停;禁止自动执行):
- 全局规格草案展示后(用户可修改标题、时长、语言等)
- 故事板设计完成后(用户可调整叙事结构、族群比例、背景音乐基调等)
- 所有关键元素生成后(用户可要求重新生成特定角色/场景)
- 每个镜头生成后(逐一核对;用户可要求重新拍摄单个镜头)
- 所有音频层生成后(用户可调整背景音乐风格或旁白语调)
- 时间轴结构预览后(用户必须在渲染前确认最终结构)
用户上传处理: 通过 resource_prepare_and_analyze 解析用户提供的所有参考图片、脚本和音频,然后将其绑定到相应的故事板槽位以避免重复生成。如果上传的素材与内置规格冲突,以用户上传的内容为准,并向用户明确告知冲突以便其决策。
2. 멀티모달 분석
处理用户上传的参考素材时,重点提取以下信号:
- 科幻参考图像: 提取光照结构(主光源方向、对比度)、色彩调色板(主色/强调色、黑白场级别)、巨物与角色的比例关系、材质分级(天际级/增殖级/荒原级)以及摄影风格(景别、低机位、景深)。
- 剧本/世界观文本: 提取场景名称及分布、部落类型及出场顺序,以及核心叙事节点(开篇/冲突/结局),将其转化为结构化的“分镜”输入。
- 参考音频(如有): 提取情感基调(史诗、压抑、悲壮)、BPM范围及核心音色特征,为背景音乐生成提供风格基准。
- 输出格式: 以结构化文本形式输出分析结果,明确标注原始素材ID,以便“故事板设计”和“媒体生成”工具直接参考。
- 禁忌: 不得对参考素材进行风格迁移或创意重构;仅忠实提取可量化的视觉/音频信号。
3. 스토리보드 설계
世界观基调
3025年以后,天空不再属于人类。一只巨大的机械鲲鹏(翼展518米)悬停在钢筋丛林上方900-1100米处,其底部结构将阳光切割成平行的阴影带。地面上,四个不同的群体共享同一套基础设施;繁荣与废墟之间的界限不是墙,而是光。本短片聚焦于宏观切片而非微观叙事。
世界观设计原则(强制):
- 始终保持宏大叙事视角:切勿将场景局限于单一室内或封闭小空间;每个镜头的背景必须反映城市深度、天空层级或群体生态,视觉信息密度需始终覆盖多个空间层级。
- 尺寸对比是核心视觉语言:每个镜头必须展示至少一种比例对比(巨人vs人类 / 摩天大楼vs行人 / 天空vs地面);孤立的主体特写之后必须跟随宏观空间镜头,以防止叙事收窄。
- 空灵氛围(可选规则):在情感过渡片段(如:从敬畏到沉思,或当鲲鹏阴影覆盖城市时),光源散射区域允许存在一层薄薄的散射雾——仅限物理光源(穿透鲲鹏装甲缝隙的光束、能量体周围的低密度粒子光雾);禁止使用迷幻彩色雾气或无光源的人造光污染风格镜头光晕。
关键元素设计规范
element character — 四大群体代表人物
每个群体必须至少有一个设计为 key_element 的代表人物:
- 原始人类: 0%身体改造,纯有机体。穿着21-25世纪休闲装(棉/麻/牛仔/涤纶)。皮肤保留真实质感(毛孔密度 80–120/cm²,细纹深度 0.05–0.1mm)。亚裔与西方面孔各占一半。
- 赛博人类: 40–70%身体改造。暴露的关节(金属骨架材质),皮下发光电路纹路(脉冲频率 0.8Hz),穿着工业模块化服装。亚裔/西方面孔 1:1。
- 基因融合者: 100%改造(基因层面)。皮肤覆盖生物纹理(鳞片厚度 0.5–2mm / 羽毛长度 1–5cm),能够随环境改变颜色(响应时间 0.3–0.5s)。
- 数字意识(赛博永生者): 无实体,呈现为人形光雾(透明度 40–60%,尺寸 1.7–2.2m),形态随机波动。这是通过将生物意识上传至机器载体而实现永生的存在——描述时,光雾中可见微弱的原人类面部特征残影,作为“曾是人类”的叙事锚点。
element scene — 场景元素
- 钢筋丛林(繁荣区): 摩天大楼间距 20–40m(平均 32m),占地 45m×45m。垂直分层:地面 0–12m(磁悬浮车道、半透明金属叶行道树),中部 12–150m(绿色信息光脉冲,流速 2m/s,脉冲宽度 0.8m),高层 150–800m(浮动平台间距 150–200m,空中光带宽 3–5m)。天顶级建筑:全哑光黑钛合金 + 镜面玻璃(反射率 72–85%)。
- 废弃区: 信息光脉冲中断率 40–60%,建筑锈迹覆盖率 ≥30%,无浮动车辆,无全亮度光脉冲。
- 过渡区: 宽度 30–50m,渐变过渡;建议帧比例 5:5 或 6:4。
- 巨型机械鲲鹏(天空巨兽): 翼展 518m,体长 322m,主体高度 78m。悬停高度 600–1400m(稳定于 900–1100m)。鳞片装甲板 2.5m×4m,间隙 3cm,深蓝色能量纹路宽 1.5cm,脉冲 0.5Hz。底部引擎阵列:12组(直径 6m,排气喷嘴 4个同心环,环间距 0.3m)。水平移动 28–52m/s,垂直移动 0.5–1.2m/s。
专业空灵运镜规范(仅限情感过渡片段)
触发条件: 在情感弧线过渡时启用,典型场景包括:压抑→沉思,鲲鹏阴影缓慢覆盖城市,群体对视后的沉默停滞,从震惊转向内心崩塌等。禁止在无情感转折点的镜头中使用空灵运镜。
物理光源限制(铁律): 空灵感必须来自真实物理光源产生的空气散射——
- 允许: 阳光穿透鲲鹏装甲缝隙形成的平行光束(投影宽度与地面3cm间隙成比例)、因气压差在能量体周围产生的低密度粒子雾(透明度 ≤25%)、夜间建筑自发光自然扩散至雾中(扩散半径 ≤ 实际光源尺寸的3倍)。
- 禁止: 无光源的迷幻彩色光雾、非物理辉光、大面积类似人造光污染的镜头光晕扩散、任何与光源位置不符的散射光效果。
专业运镜节奏(三段式):
- 压抑开启: 缓慢手持平移(速度 ≤3cm/s),摄像机轴线偏移 15–25°,保持轻微手持抖动,光束或阴影边界从画面外缓慢进入,角色处于光影交界区(半身亮,半身暗)。
- 沉思核心: 平移速度降至 ≤1.5cm/s(近乎静态但从不锁定),镜头随呼吸轻微浮动;切至眼部或手部特写(捕捉皮肤毛孔/虹膜反射/手指颤抖);空气散射光束在背景中缓慢位移,与角色情感共鸣而非抢占画面。
- 冲击转折: 摄像机从低角度向上倾斜(倾角 20–35°),手持抖动略微增加(非刻意晃动,保持呼吸节奏),巨物或光束完全进入画面,完成情感释放。
与其他运镜的协作规则: 空灵片段期间禁止突变或快速跳切;若需切换至其他视角,使用 ≥0.8s 的渐变过渡;仅在空灵片段结束后恢复标准运镜决策树。
通用运镜指南(全局强制,所有镜头严格执行)
严格禁止: 锁定三脚架镜头、简单的线性推/拉(无惯性/无情感意图的推拉)、正面平视中景镜头、正面平视全景镜头。
全程手持呼吸感: 所有镜头必须带有轻微手持抖动(呼吸式微颤,非刻意摇晃),模拟人持摄像机感,反映角色与场景的真实共存。
运镜决策树(根据上下文选择,禁止“简单推拉+锁定”组合)
| 上下文 | 优先运镜技术 |
|---|---|
| 角色特写(情感爆发/崩溃/震惊) | 荷兰式倾斜(Dutch Tilt)+ 极端面部特写,倾斜角 10–25°,突出心理失衡 |
| 角色特写(压抑/无助/被俯视) | 高机位(俯角 30–60°)+ 手持微颤,角色位于画面下1/3处 |
| 角色特写(觉醒/重燃/对峙) | 低机位(仰角 20–45°)+ 缓慢推入,角色占据画面 60–80%,天空/巨物作为压抑背景 |
| 走路/奔跑/追逐 | 肩部追踪(Over-Shoulder)+ 手持跟随,保持角色后颈/肩线在画面内 |
| 对话/正反打 | 正反打,切换角度差 ≥30°,禁止完全面对面的切镜 |
| 巨物揭示/震撼展示 | 低机位环绕(Orbit)+ 摄像机从侧向上方逐渐旋转至全仰角,配合手持抖动增强冲击力 |
| 场景宏观展示 | 高空广角俯拍(俯角 45–75°)或侧高位平移,禁止直接平视锁定镜头 |
| 光影切割/氛围渲染 | 侧逆光倾斜拍摄(轴线偏移 15–40°),光影边界穿过角色身体 |
每个镜头描述必须包含以下六个字段:
- 场景: 引用对应的场景元素 ID(例如:[Element_SteelForest_Prosperous])。
- 故事节拍: 具体动作和角色行为,引用群体角色 ID;写入准确的对话文本;描述角色情感弧线(例如:从麻木→突然抬头→瞳孔放大→嘴唇颤抖)。
- 电影摄影(必须从运镜决策树中选择,禁止写“锁定中景”或“推/拉”):
- 景别(特写/极端特写/全景/空中广角)
- 摄像机角度(仰角 / 俯角 / 荷兰式倾角 / 肩扛视角)
- 运动(手持跟随/环绕/肩部追踪/旋转倾斜/快速多机切换)
- 特写说明: 明确主体(眼睛/手/装甲缝隙/颤抖的嘴唇/瞳孔反射等)及叙事目的。
- 情感-镜头映射: 解释该位置/运动如何服务于角色的内心状态(例如:荷兰式倾斜 18° 强化了角色的信念崩塌)。
- 光影: 主光方向(侧逆光/顶光/底部反射),阴影边缘特征(硬切/渐变),明暗对比(6–7档)。
- 多机位标记(如适用): 指示此镜头是否涉及多机位切换,说明各机位角度及切换时机。
标准五镜头结构(导演剪辑版,基础模板,可根据脚本调整)
- 宏观揭示 (4–6s):高空 45–60°俯拍钢筋丛林 + 机械鲲鹏入画。摄像机有手持微颤配合缓慢平移(非锁定),鲲鹏占据画面 20–30%,城市 40–50%。通过巨物与城市的尺寸反差建立压抑的世界观基调。
- 压抑特写 (3–4s):切至地面角色。荷兰式倾斜 15–20° + 低仰角(30–40°)面部特写;背景中鲲鹏底部结构占据画面 50–60%。眼部特写——虹膜反射鲲鹏轮廓,传达压抑下的麻木或震惊。
- 光影切割 (4–6s):鲲鹏阴影扫过建筑群。侧逆光倾斜角(偏移 20–30°),带阴影边界的手持跟随,缓慢平移;光暗边界穿过角色身体,角色半亮半暗。阴影覆盖城市区域的 40–60%。
- 多群体同框 (4–5s):环绕跟随(弧形运动,半径 2–4m)将多个群体带入同一画面。f/11 大景深,四个群体清晰可辨;群体密度 3:3:2:1(原始人类:赛博人类:基因融合者:数字意识)。环绕中切换正反打,捕捉群体间的对视或刻意回避。
- 高空总结 (4–6s):以手持低位仰拍(45°)开始,摄像机缓慢向上旋转(手持弧线升)至俯瞰视角;鲲鹏从一角出现(60–70%),城市缩小至底部 10–20%。全程手持抖动不间断,保留人类呼吸感。
单镜头多机位设计规范(适用于 7–14s 镜头)
Seedance 2.5 支持单镜头内的多机位叙事;充分利用此点可在不增加镜头数的情况下显著提升叙事张力。适用范围: 7–14s 镜头;5s 以下短镜头保持单一机位,不强制切换。
触发依据(叙事优先,而非时间划分):
- 情感弧线达到转折点(例如:从麻木到震惊,或压抑到释放);
- 巨物入画或阴影覆盖范围大,需要从广角切换到角色反应;
- 多群体对视达到张力峰值,需要正反打捕捉双方情绪;
- 需要展示空间尺度(宏观→微观→宏观三切叙事)。
单镜头切分格式(分镜描述规范):
[Cam A] 景别 / 角度 / 运镜 — 画面描述 + 情感状态
→ 切换依据:(叙事事件或情感转折点,例如:“鲲鹏阴影边界入画”)
[Cam B] 景别 / 角度 / 运镜 — 画面描述 + 情感状态
→ 切换依据:(例如:“角色瞳孔收缩,情感临界点”)
[Cam C] 景别 / 角度 / 运镜 — 画面描述 + 情感状态(总结)
- 相邻机位角度差 ≥30°(遵循运镜决策树,禁止使用同角度平移重切);
- 切点必须有叙事正当性,禁止使用“3s后切”或“6s处切”等纯时间锚点;
- 每个机位需标注景别 + 仰/俯角 + 运镜(例如:低仰角30°手持跟随→荷兰式倾斜18°特写→高空50°平移)。
推荐三切模板(7–14s 镜头):
- 宏观揭示(广角/俯拍,建立场景)→情感触发(切特写/极端特写,情感爆发)→宏观回溯(恢复仰/俯角,收拢叙事结构);
- 压抑仰拍(仰角+手持)→角色特写反应(荷兰式倾斜极端特写)→光影切割(侧逆光倾斜,情感扩散至环境);
- 肩部追踪(运动)→正反打(对话/对视张力)→低位环绕(巨物揭示,情感升华)。
巨物与比例规则(所有包含巨物的镜头强制执行):
- 对于单体尺寸 ≥100m 的结构,同一画面必须出现至少一个人类或车辆作为比例参照物,参照物占画面面积 ≥0.5% 且 ≤2%。
- 当画面包含从地面到高空的垂直透视时,必须出现至少一个中间高度的参照物(如中层建筑、浮动通道),视觉落差 ≥500m。
- 包含巨物的镜头优先采用低位仰拍环绕或荷兰式倾斜,通过镜头倾斜强化巨物对角色的心理统治力;禁止使用锁定的平视镜头拍摄巨物。
光学系统(全局固定,注入所有镜头描述)
- 景深: f/11 大景深,背景清晰可辨,禁止过度虚化。
- 焦距: 标准镜头 35mm–50mm(自然人眼视角),禁止超广角或长焦。
- 快门: 1/250s,冻结运动,禁止动态模糊。
- ISO: 100–400,画质纯净,禁止噪点。
- 色彩: 高饱和度与透明感,主色调为冰蓝 #4A9BC7 / 暖金 #E8B84B / 淡紫 #9B7BB8 / 琥珀 #D4A05A / 淡粉 #DDB5B5。
- 黑白深度: 最暗区 RGB≥15(禁止纯黑),最亮区 RGB≤245(禁止纯白)。
- 对比度: 同一画面明暗差 6–7档,亮部与暗部均保留纹理细节。
- 阴影规则: 每个镜头必须有方向明确的阴影;柔光边缘模糊,硬光边缘锐利,多光源产生的阴影可重叠。
跨镜头音频层设计
- BGM: 至少一个全局背景音乐轨道(类型:music),史诗感、低频压抑基调,BPM在60–90区间。若短片有明确的情感转折(如压抑到震惊),可拆分为2段BGM,每段指定覆盖镜头范围。
- 旁白VO(若脚本有叙事文本): 类型:narration,设定 narration_speaker_profile(例如:[低沉男声旁白,克制、史诗感]),写完整VO脚本,layout_instruction 对应镜头范围。
- 环境音层: 为每个主要场景设计独立的环境音描述(例如:钢筋丛林地面—磁悬浮车道低频电磁嗡嗡声 + 信息光脉冲高频脉冲 + 嘈杂人群;废弃区—风啸穿过锈迹结构 + 破损光脉冲间歇电弧;鲲鹏上方—超低频引擎压抑震动 + 装甲板气流切割声)。设计为对应镜头范围内的独立 audio_layer,在 video_assembler 阶段与BGM分轨混音。
- 禁止: BGM 在视频生成阶段不得与生成的同步音效/对话轨道在未混音状态下重叠;音量及淡入/淡出控制必须在 video_assembler 阶段统一执行。
4. 미디어 생성
关键元素生成
- 工具: TextToImage, 首选模型: GPT Image 2, 分辨率: 2K, 长宽比: 16:9。
- 角色关键元素: 为每个角色生成一张横向多视角参考图(白色背景,16:9):画面左侧为半身特写(清晰展示面部特征、皮肤纹理、发型及细节修饰);右侧展示正面、侧面、背面的全身视图,并横向排列。所有四个视图需在同一白色背景下并排呈现,以清晰展示角色的整体外观与轮廓。
- 场景关键元素: 分别为以下场景生成一张关键元素图:钢铁森林(繁荣区)、废弃区、过渡区(繁荣/废弃交界)以及机械鲲鹏(仰视视角)。这些图片将用于后续视频镜头的参考绑定。
- 当用户上传参考图时: 直接将对应的参考图注册为 asset_id 并绑定至相关关键元素,跳过生成步骤。仅在参考图与故事板描述存在视觉冲突时,提示用户确认以哪一方为准。
- 多版本迭代: 若初始元素图像与世界观设定存在显著偏差(例如:伪影、过度磨皮、材质分级错误),请使用 ImageToImage(首选模型: GPT Image 2)进行针对性修正,同时保持身份特征一致。
最终镜头视频生成
- 工具: MultiModalToVideo, 首选模型: Seedance 2.5, 分辨率: 480p, 长宽比: 16:9。
- 单镜头时长: 不超过 15 秒(Seedance 2.5 上限);标准镜头应按照故事板设计,控制在 3–6 秒范围内。
- 每个镜头的参考输入:
- 元素图像(必选): 镜头中出现的所有角色之关键元素 + 对应的场景关键元素(包括巨型物体/环境/道具)。
- 连续视频参考(慎用): 仅在当前镜头与上一镜头具有极强视觉连贯性时(例如:同一角色的连续动作、同一机位无缝衔接),才将上一镜头的 final_shot 作为 reference_video 添加。通常情况下,不要添加视频参考,以避免风格同质化。
- 音频处理: Seedance 2.5 支持 audio_infos。若角色绑定了 key_element_audio(用户上传或之前生成的角色语音参考),请将其传入对应的镜头生成中,以保持各镜头间对话语调的一致性。若镜头内无角色对话,则将 audio_infos 留空;音频将在后续视频剪辑阶段统一叠加 BGM / VO。
音频层生成
- BGM: 使用 text_to_instrumental,根据故事板“音频层”中定义的氛围描述、BPM 范围及基调进行生成。若故事板定义了多个 BGM 区段,则分段生成。
- 旁白 VO: 使用 text_to_narration,根据故事板 narration_speaker_profile 中描述的声线特征进行生成。严格遵守 VO 脚本文字,严禁即兴发挥。
5. 프롬프트 작성
全局最高优先级
- 当用户使用中文进行交互时,提示词主体必须使用中文编写;对话/配音文本语言必须遵循 Final_Video_Spec.md 中的输出语言设置。
关键元素提示词 (TextToImage / ImageToImage → GPT Image 2)
结构: 主体描述(身份 + 修改程度 + 材质细节)→ 光影(主光源方向 + 色彩基准)→ 纹理细节(毛孔 / 金属分级 / 电路图案)→ 镜头语言(景别 + 构图)→ 光学规则(f/11,无磨皮,无假镜头光晕)。
群像类关键元素提示词要点:
- 角色描述必须包含具体的身份细节;禁止仅使用角色姓名。 描述顺序:年龄(例如,“约22岁”)→ 性别与外貌(例如,“富有魅力的女大学生,身材完美”、“1.9米高的肌肉猛男”、“60岁左右的中年男性”)→ 发型(例如,“长卷发”、“寸头”、“银白色短发”)→ 身高与体格(例如,“1.72米,细腰长腿”)→ 修改特征 → 服装。示例:“约22岁,迷人的亚裔女大学生,1.68米,深棕色长卷发,穿着宽松棉麻上衣和牛仔裤(原始人类,修改率0%)”;“约35岁,1.9米高的健壮白人男性,寸头,左臂暴露金属骨骼关节,穿着工业风机能夹克(赛博人类,修改率55%)”。
- 锁定稳定的身份特征:面部轮廓、肤色、修改部位的材质状态(天穹级/增强级/废土级)、服装颜色和材质;禁止出现与场景无关的背景文字或杂乱图案。
- 皮肤描述必须包含:可见毛孔(直径0.1–0.2mm)、可见细纹(深度0.05–0.1mm)、生理色差(额头较亮、下颚较暗、鼻翼微红);禁止皮肤磨皮。
- 修改角色必须描述:金属骨架的材质分级、电路图案的光色及脉动(0.8Hz)、皮肤与金属之间的过渡接缝处理。
- 数字意识:人形光雾,40–60% 不透明度,边缘随机扰动;禁止实体化呈现。
场景类关键元素提示词要点:
- 明确主光源:阳光(透过鲲鹏护盾缝隙射入) / 建筑自发光信息光脉冲 / 废弃区冷白散射光。
- 色彩基准:主色冰蓝 #4A9BC7,副色暖金 #E8B84B;同一画面中,主色调占比约60–70%,副色占比20–30%,其余为中性过渡色。
- 材质量化:信息光脉冲(绿色,流动感,宽度0.8m),反射率(镜面玻璃72–85%),锈迹覆盖率(废弃区域 ≥30%)。
视频片段提示词 (MultiModalToVideo → Seedance 2.5)
参考图占位符绑定: 针对每个参考输入使用产品占位符 <<<image_1>>>、<<<image_2>>> 等,按角色/场景顺序排列,并在提示词开头说明“<<<image_1>>> 是 [角色/场景名称]”。
运动堆叠结构(按顺序书写):
- 摄像机运动(严禁使用“固定”或“简单推拉”,必须从以下类型中选择):
- 手持微抖动追踪 / 手持环绕(圆弧半径 + 方向) / 肩扛追踪 / 荷兰角(注明度数) / 低角度旋转上升 / 快速剪切;为每种运动注明速度(慢速/平稳/快速)和情感意图。
- 主体动作与情感弧线: 具体肢体动作 + 幅度/速度 + 情感节拍(例如,肩膀下垂 → 眼神抬起 → 嘴角颤抖),按叙事顺序排列;不要使用类似“0–3秒 / 3–6秒”的时间戳拆分。
- 特写焦点(如有): 明确指定特写对象(瞳孔反射/紧握的拳头/装甲接缝等) + 特写所承载的情感目的(例如,特写瞳孔中鲲鹏底部结构的反射,传达无助感)。
- 空间变化: 场景内元素的位移或遮挡关系(例如,鲲鹏阴影从左至右扫过建筑群);对于多次摄像机角度切换,需注明每次剪切的时间点和角度偏移量(≥30°)。
- 音频描述(仅限 Seedance 2.5 专用格式):
- 音乐:(...) 括号内描述
- 音效:<...> 方括号内描述
- 对话:{...} 方括号内插入逐字对话;非英语对话需在括号前注明语言(例如,中文{...})
- 屏幕字幕:【...】 方括号内插入字幕文本
- 如果已计划独立的音频层(VO),请勿将 VO 文本写入视频提示词,以免重复渲染。
空灵/梦幻序列提示词写作(专用情感过渡片段):
当镜头被标记为“空灵情感过渡片段”时,提示词必须遵循以下结构,不得简化:
- 物理光源锚定(必须在运动堆叠之前书写):明确光束来源(例如,“阳光穿透鲲鹏装甲的3厘米缝隙,在地面投射出平行光柱”),以及雾气的成因(例如,“低密度粒子雾,不透明度 ≤25%,仅出现在光束边缘的散射区”);禁止使用诸如“漫射雾”、“梦幻光辉”、“迷幻光效”等没有光源锚定的描述。
- 运动节奏标注:慢速手持追踪(注明速度 ≤3cm/s 或“近乎静止”)→ 插入眼睛/手的极端特写(注明对象和情感意图)→ 低角度上升(注明角度和进入画面的巨大物体比例);书写三段之间的叙事过渡依据,禁止书写时间戳。
- 音效协调:使用 <...> 描述气流穿过光束的低频共鸣或粒子雾的极低底噪,避免空灵片段音效与 BGM 主旋律冲突(此处音效为物理声场背景,而非音乐)。
- 负向约束添加:在此提示词段落末尾添加“no psychedelic colors, no glowing mist without light source”。
单镜头内多次剪切提示词写作(Seedance 2.5 多镜头叙事格式):
对于故事板中标记有多次摄像机切换的镜头,提示词必须采用以下格式:
-
摄像机块结构(按叙事顺序排列,每个机位是一个独立段落):
[摄像机 A] <<<image_1>>> 是 [角色/场景名称];[景别/角度/运动],[主体动作与情感],[光影描述]
→ 切换:[叙事依据,例如,“鲲鹏阴影边界进入画面的时刻”]
[摄像机 B] <<<image_2>>> 是 [角色名称];[景别/角度/运动],[主体反应与情感弧线],[特写焦点]
→ 切换:[叙事依据,例如,“角色情绪达到临界点,嘴唇微微颤抖”]
[摄像机 C] [景别/角度/运动],[结尾镜头描述] -
角度差异标注:在每次切换的叙事依据后注明角度偏移量(例如,“角度偏移 ≥30°,切换至 18° 荷兰角”);
-
禁止写法:cut to + 固定机位描述、时间戳拆分、相同角度连续剪切;
-
音频格式统一写在最后一个摄像机块之后,不在每个摄像机块内重复。
固定负向约束(添加到每个视频提示词末尾):
- no subtitles(字幕用于后期,不在视频中渲染)
- no music(BGM 在视频编辑阶段叠加,不在单镜头中生成)
- no motion blur(快门1/250秒,冻结运动)
- no fake lens flare(无光源即无光晕)
- no skin smoothing(不磨皮,真实皮肤纹理)
- no overexposure(最亮区域 RGB≤245)
强化光学规则:
- 每个视频提示词必须包含:f/11 大景深,背景清晰;极致对比度(6–7档);真实物理光源(阳光/建筑自发光/反射光),主光源方向明确。
- 允许真实镜头光晕:主光源位置的三层渐变光晕;最外层直径不得超过光源实际显示尺寸的1.5倍;不透明度从中心40%向边缘均匀衰减至0%;光晕相对于光源的位移 ≤2°。
- 禁止描述:外发光、神圣光芒、无源光晕、假漫射光晕、假霓虹灯。
强化宏大尺度描述:
- 每个包含机械鲲鹏的镜头提示词必须包含:翼展518m / 机身322m / 悬停高度900–1100m;同画幅内必须包含人类/载具作为尺度参考,参考物占画幅面积 ≥0.5% 且 ≤2%。
- 当画幅包含从地面到高空的垂直视角时,书写中高度参考物(中层建筑/浮空通道),视觉垂直落差 ≥500m。
6. 동영상 조립
剪辑节奏与逻辑
- 基础剪辑节奏: 对齐背景音乐(BGM)的低频鼓点。开篇全景镜头(4–6秒)→ 快速切换不同景别(3–4秒)→ 光影剪辑(4–6秒)→ 群像镜头(4–5秒)→ 结尾航拍镜头(4–6秒)。总时长:45–60秒。
- 转场: 优先使用硬切(配合光影节奏变化);仅在情绪转变时(如:从紧张到震撼)使用0.5–1秒的叠化。严禁使用花哨的转场特效。
- 节拍对齐: 将鲲鹏阴影掠过建筑的运动帧与最强烈的低频BGM鼓点对齐。将多组镜头进入点与旋律节点对齐。
音轨混音
- BGM音轨: 全程垫底,设为-12 dB(相对于满量程)。开头3秒淡入(0 → -12 dB),结尾3秒淡出(-12 dB → 静音)。
- 旁白(VO)音轨(如有): 设为-6 dB。当旁白开始时,BGM自动降低3 dB,旁白结束后恢复。旁白严禁与镜头内的同步对白重叠。
- 镜头内生成的音效(如有): 保留原始音效轨道,混音至-18 dB,以避免与BGM和旁白产生频率冲突。
- 环境音层混音: 环境音作为独立轨道,垫底设为-20 dB。鲲鹏头顶飞过时,将环境音提升至-14 dB(超低音引擎的张力必须高于物理感知阈值),此段BGM降低4 dB。废弃区域镜头(风声/电弧声)的环境音设为-16 dB,保留高频清晰度,以与繁华区的电磁嗡嗡声形成频率对比。
导出设置
- 宽高比: 16:9,分辨率4K(4096×2160),帧率24fps。
- 色彩空间: 最终导出应保持高饱和度、色调清晰,确保RGB黑位深度≥15,白位深度≤245。