Beat-synced camera movement
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
适用于电商产品TVC卖点展示、车辆机车全方位展示、宠物萌态捕捉、建筑美学与地标视觉冲击,以及一切值得被看见的万物。只需上传一张任意参考图,AI立即生成18秒360°快节奏运镜,自动锁定主体中心,卡点音乐。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
全局规划与多智能体协作:
-
锁定全局规格参数:优先调用 text_editor 创建 Final_Video_Spec.md,初始写入:时长 18 秒(TVC 模式启用时可由用户声明覆盖,最长 30 秒);画幅自适应原图或默认 9:16 竖屏;执行模式(TETO 动感模式 / 产品 TVC 模式,由步骤 1.5 确认后写入);视觉风格与音频策略随模式写入对应描述;TETO 默认风格为"暗黑病态胶片质感、高对比冷青电影调色、重音炸裂卡点、高级故障风";TVC 模式默认风格为"莫兰迪低饱和柔光、高级灰调色、平滑推拉微距展示";TETO 模式禁用匀速运镜、柔和叠化、过度磨皮;TVC 模式禁用硬切、强运动模糊、高对比彩色闪烁。
-
参考图前置分析:调用 resource_prepare_and_analyze 对参考图执行主体类型识别(PRODUCT / ARCHITECTURE / LANDSCAPE / ANIMAL / HUMAN / VEHICLE),输出像素级锚点坐标(单点,非区域或轴线)。完成后向用户展示识别结果并请用户确认锚点;若用户不满意,支持手动指定任意点覆盖。
2.5. 模式选择(仅 PRODUCT 类主体触发):若识别结果为 PRODUCT,在完成背景质量评估之前,Planner 暂停并通过 cards 询问用户选择执行模式(产品 TVC 模式 / 默认 TETO 动感模式);选定后将执行模式写入 Final_Video_Spec.md,后续所有模块按对应模式执行;非 PRODUCT 类主体直接沿用 TETO 动感模式,跳过本步骤。
2.6. 背景质量评估与场景替换(可选,按需触发):若 resource_prepare_and_analyze 判定背景不佳,Planner 暂停并通过 cards 询问用户是否更换背景(两选一:替换 / 保留原背景)。- 选择替换:调用 media_generator(TextToImage)按主体类型生成 3 个候选场景背景图,再通过 cards 供用户选择(含"AI 自动最优"选项);选定后调用 media_generator(ImageToImage)将主体与新背景合成,展示合成预览供用户确认;确认后以合成图替代原图注册为 Element_Subject_01 的视觉根基,后续所有生成步骤均使用合成图。
- 选择保留:直接跳过本步骤,使用原图继续。
- LANDSCAPE 类主体强制跳过:全景航拍类图像不进行背景替换,直接保留原图。
-
音频来源自动判定(无感处理,无需用户选择):
- 用户已上传音频:调用 resource_prepare_and_analyze 执行 BPM 判定、前奏落点定位与重拍节拍时码提取;若识别为 93BPM Dark Trap,自动启用专属卡点预设,前奏铺垫段固定为 5s,蒙太奇段固定 13s(与分镜设计模块 93BPM 专属时轴对齐);其他 BPM 档位:环绕段时长 = 前奏结束点(最短 2s、最大 5s,默认 3s),蒙太奇段 = 18s 减去环绕段时长。若时长 < 18s,尾部循环补齐(保持音高);若 > 18s,从最强能量起点截取 18s。若分析失败,回落至默认时轴(环绕 0–3s / 蒙太奇 3–18s,爆发点 11s / 13.5s / 16s)。
- 用户未上传音频:调用 media_generator(text_to_instrumental)自动生成 18s TETO 专用电子 BGM(结构:0–3s 无重拍舒缓段 / 3–18s BPM=120 快节奏段);环绕段固定 3s,蒙太奇段固定 30s;无需用户干预,如用户后续不满意可申请重新生成(最多 3 次)。
-
构建结构化 Storyboard:调用 storyboard_designer,按识别出的主体类型匹配专属机位逻辑,规划两段式 18 秒分镜(建立段 + 高速蒙太奇段)与 1 条 music 轨道。
-
绑定资产与分镜生成:调用 media_generator:注册主图 asset_id 并绑定 key_element;按分镜依次生成视频片段;提示词全程融入像素级锚点锁焦、冷青胶片、暗部压黑等视觉约束。
-
时间轴拼装与特效渲染:调用 video_assembler 按鼓点时码对齐拼装,执行变速、硬切、球面畸变、RGB 色散、白闪、暗角特效链;全程强制锚点偏差 ≤ 2px,输出 18 秒完整成片。
-
超分辨率增强(可选):video_assembler 完成全片输出后,可调用 media_generator(super_resolution · MediaKit)对最终成片整体执行一次超分增强;按媒体生成模块中的主体类型分辨率表与 BPM 档位帧率表选取参数。若用户在意生成速度或无会员资格,可跳过此步骤。
人机协同与确认节点:
- 节点 2.5(模式选择,仅 PRODUCT 类主体):主体识别完成后,通过 cards 询问用户选择执行模式——产品 TVC 模式(高级感、舒缓节奏、莫兰迪调色)或默认 TETO 动感模式(高对比、爆发快剪);用户选定后写入 Final_Video_Spec.md,不得跳过;若用户同时声明自定义时长(15–30 秒),一并写入覆盖默认 18 秒。
- 节点零:背景质量评估完成后,若判定为不佳,暂停并通过 cards 询问是否替换背景;若选择替换,展示 3 个场景候选供用户选择,生成背景并完成合成后再次暂停展示合成预览,用户确认满意后方可继续;全程不得跳过用户确认直接推进。背景判定为优质或用户选择保留时,本节点静默跳过。
- 节点一:锚点推荐完成后暂停,展示锚点位置预览,请用户确认或手动覆盖;确认后无需任何其他音频操作,继续执行。
- 节点二:Storyboard 完成后暂停,展示规划简报(主体类型、锚点坐标、机位方案、节奏分配),使用 cards 供用户确认特效强度(普通 / 高能 / 狂暴)。
- 节点三:最终渲染完成后生成预览,引导用户点击右上角"保存并激活"在实际项目中使用此 Skill。
2. マルチモーダル分析
主体类型识别与机位标签输出:
对用户上传的参考图执行主体分类,输出对应机位适配标签:
- 产品静物(鞋服、水杯、数码、摆件等桌面单品)→ 标签 PRODUCT;平视微俯 45° 电商机位,禁用垂直俯拍与远距离大广角。
- 建筑场景(楼宇、古建筑、地标、室内结构)→ 标签 ARCHITECTURE;低角度仰拍 + 平视纵深构图,少量中景平拍。
- 风景外景(山水、城市全景、旷野、自然场景)→ 标签 LANDSCAPE;全程高空航拍视角,禁用近距离微距与低位怼脸镜头。
- 动物宠物(猫、狗及各类萌宠)→ 标签 ANIMAL;贴地平视,与动物眼睛高度齐平,跟随式运镜。
- 人物人像(人物、人像、人体出镜)→ 标签 HUMAN;标准人像构图,平视 + 微仰,聚焦五官体态,规避畸形透视。
- 车辆交通(机车、跑车、汽车、摩托等)→ 标签 VEHICLE;低位贴地仰拍 + 侧平机位,凸显车身低趴线条张力。
背景质量评估:
完成主体类型识别后,对背景区域执行质量判定。满足以下任一条件即判定为"背景不佳",触发 Planner 节点零的背景替换询问流程:
- 杂乱背景:背景中存在明显杂物、无关文字、水印、密集线条或不相关物体,干扰主体视觉焦点。
- 光线平淡:背景无明暗对比层次,整体曝光均匀平坦,缺乏戏剧性光影结构。
- 色彩失调:背景色彩脏乱、偏色,或与主体色调形成不协调冲突,难以支撑冷青电影调色风格。
- 空间层次缺失:背景为纯色墙壁、白纸、单色布幕等无景深/空间感环境,不利于环绕运镜展示纵深。
- 用户手动标记:用户在交互中主动要求更换背景(预留接口,优先级最高)。
判定结果输出为布尔值(背景不佳:是 / 否)及简要说明原因,供 Planner 决策是否触发节点零。LANDSCAPE 类主体强制跳过本评估,直接输出"否"。
像素级锚点定位(单点,非区域/轴线):
锚点必须是图像上的一个具体像素坐标 (x_anchor, y_anchor),按以下优先级自动选取:
- 高对比边缘交点:如车灯边缘尖角、车标尖端、产品 logo 角落、建筑棱线顶点。
- 高光点:金属反光中心、水珠高光、瞳孔高光点。
- 几何特征点:螺丝中心、轮毂中心、瞳孔中心、产品品牌图案几何中心。
- 主体视觉重心(前三者均无显著特征点时备用):人物眉心、动物鼻尖、建筑主立面中心交点、风景地平线视觉焦点。
LANDSCAPE 航拍锚点专属逻辑(大场景无明显物理锚点时的分级回退策略):
风景外景类主体因画面信息弥散、缺乏近景硬边缘,锚点选取须遵循以下优先级,逐级回退直至确定唯一锚点坐标:
- 第一优先:标志性地物——若画面中存在孤立山峰顶端、灯塔尖顶、岛屿最高点、瀑布核心水柱入水点等单一且位置稳定的地标物,直接将其视觉顶端或几何中心作为锚点;该类锚点高对比且跨视角稳定,优先级最高。
- 第二优先:光影汇聚点——若无标志性地物,寻找画面中光线最强烈的聚焦区域:如日落/日出时太阳触及地平线的切点、水面最强反光中心(glint center)、云隙透射光束(god rays)的地面落点;选取亮度峰值像素坐标。
- 第三优先:几何汇聚点——若无光影汇聚,识别画面中透视消失点或视觉引导线的交汇坐标:如河流蜿蜒的透视消失方向、道路延伸的灭点、梯田/等高线的视觉汇聚点;选取线条交汇的估算坐标。
- 第四优先:色彩密度中心——若前三级均无法定位,计算画面中色彩饱和度与明度对比最集中的 100×100px 区域的几何中心作为锚点;通常对应植被边界、水陆交界线的高对比区域。
- 最终回退:黄金分割交叉点——当图像整体平坦、无任何视觉焦点特征(如极简云海、均质沙漠、平静湖面)时,自动取画面左上黄金分割交叉点(约 x × 38.2%,y × 38.2%)作为默认锚点;同时向用户说明图像缺乏显著锚点特征,建议手动指定或改用局部特写区域作为参考图输入。
LANDSCAPE 锚点辅助规则:
- 所有航拍运镜须保持锚点持续可见(不得飞出画框),即使在 360° 全域环绕段,也须通过镜头旋转而非平移来保持锚点居中;若某方向运镜导致锚点超出画幅,该方向环绕角度须限制在锚点可见阈值以内。
- 黄金分割回退锚点生效时,分镜设计模块须将蒙太奇段的极限俯冲次数限制为不超过 2 次(避免无锚点区域的拉近暴露画面空洞),其余时长以高空横移与大弧度缓速环绕填充。
输出锚点像素坐标及选取依据说明,向用户确认;用户可手动点击任意点覆盖。确认后锚点固化,全程不再变更。
音乐节奏与属性提取(仅用户已上传音频时执行):
- 音频特征分析:通过对音频进行多维特征识别,输出以下结构化音频信号:
- 音频的 BPM(每分钟拍数)及节拍拍号(如 4/4 拍)。
- 精确的前奏结束点时码(识别为第一个强节拍或音频能量突增点,限制在 2s–5s 之间,若未识别到则默认取 3s;93BPM Dark Trap 固定为 5s)。
- 高潮/副歌段落的起始点与强音爆发点。
- 提取高对比度底鼓(Kick)、踩镲(Hi-hat)及人声等特定音色或歌词在时间轴上的瞬态能量落点,输出完整的强瞬态鼓点与关键节拍时码轴。
- 对于特殊音乐风格(如 93BPM Dark Trap 包含人声特定歌词 "I know my guy" 及 "I'm in cheetah" ),额外输出对应的关键人声起始与结束时码。
- 数据输出与对齐:仅输出客观时码轴数据,自身不包含任何剪辑变速、镜头切换或特效触发等执行规则,完全交由时间线拼装模块 (video_assembler) 读取并处理。
用户未上传音频时,本模块仅执行参考图主体分析,跳过音乐解析流程。
3. 絵コンテ設計
设计关键元素 (key_element):
- 将用户上传的参考图注册为 key_element(ID:Element_Subject_01),类型根据识别结果取 element character 或 element scene。
- 描述中须完整贴合原图的材质、色彩、轮廓与几何中心,并标注主体类型标签(PRODUCT / ARCHITECTURE / LANDSCAPE / ANIMAL / HUMAN / VEHICLE)及其 3D 锚点位置。
机位适配规则(按主体类型):
- PRODUCT:平视微俯 45°;细节微距特写(纹理/Logo)→ 主体居中平视 → 微俯全景轮廓;贴物小范围环绕 + 近距离瞬爆推拉。
- ARCHITECTURE:低角度仰拍;低位仰拍凸显高大张力 → 中景平视全貌 → 局部线条/光影特写;大范围慢环绕 + 纵深瞬爆推拉,不扭曲建筑透视比例。
- LANDSCAPE:全程高空航拍视角;高空远景大广角铺垫 → 中高空渐进俯冲 → 航拍 360° 全域环绕;禁用近距离微距与低位怼脸镜头。
- ANIMAL:贴地平视(与动物眼睛齐高);脸部五官微距特写 → 全身动态中景 → 环境适配全景;跟随式环绕 + 跟踪式瞬爆推拉,贴合动物运动轨迹。
- HUMAN:标准人像构图,平视 + 微仰;眼部/脸部微距特写 → 半身中景 → 全身全景;小半径体态环绕,规避畸形透视,保留人体比例美感。
- VEHICLE:低位贴地仰拍 + 侧平机位;车头/车灯细节特写 → 车身侧颜中景 → 整车道路全景;贴地环绕 + 向前冲刺式推拉 + 平行跟车运镜。
两段式分镜时间线(全品类通用):
- ① 建立段(0–3s):2–4 个镜头,缓慢水平顺时针 180° 环绕 + 匀速前推(速度约 6°/s),全景展示主体与环境;单镜 1.5–2s,无扭曲/白闪,仅微量 RGB 色偏(±0.5px);镜头始终以锚点为中心。
- ② 高速蒙太奇段(3–18s):以锚点为圆心进行多角度高速运镜组合;必须覆盖至少 4 个主要方向(正面、侧面、背面、俯视或仰视),每个方向至少出现 2 次。分镜数量与单镜时长按 BPM 档位精确分配(见下表):
以下仅补充分镜规划专属参数(蒙太奇段可用时长、总镜头数、分配公式);BPM 档位定义与单镜时长基准以 video_assembler BPM 分档规则为权威来源,不在此重复;特效触发密度与像素级特效参数均由 video_assembler 统一执行,分镜设计不涉及此类参数。
BPM 档位蒙太奇段可用时长单镜默认时长规划总镜头数分配公式BPM > 120(高速电子/EDM)30s0.4s约 35–38 个30s ÷ 0.4s ≈ 37;预留 3 处高潮强制节点(11s/13.5s/16s)各占 0.4s,剩余镜头均匀填充BPM 80–120(标准节奏/R&B)30s0.6s约 22–25 个30s ÷ 0.6s ≈ 25;弱拍处允许最多 3 个延长镜(≤0.9s),对应缩减相邻镜头数量补齐总时长BPM < 80(慢节奏氛围/Lo-Fi)13s(建立段延长至 5s 时)0.8s约 16–18 个13s ÷ 0.8s ≈ 16;建立段固定延长至 5s,蒙太奇段压缩为 13s(与 multimodal_analyze_tool BPM<80 附加规则及 video_assembler 第 2 节保持一致)93BPM Dark Trap 专属13s(高潮爆发段从 5s 起算)0.5–2s 动态约 20–26 个前奏铺垫 0–5s:2–3 个慢镜(单镜 1.5–2s);蓄力段 5–11s:约 8–10 个(单镜 0.6–0.8s);高潮爆发段 11–18s:约 10–14 个(单镜 0.4–0.5s,最短 0.3s)
通用校验规则:规划完毕后,验证所有镜头时长总和 = 蒙太奇段可用时长(误差 ≤ 0.2s);若总时长超出,优先缩短弱拍镜头;若不足,在非高潮节点处随机补一个 0.3–0.5s 的补白镜(保持节奏感)。
运镜类型按以下方式随机组合:- 急推:从外侧极速推至锚点极近细节
- 急拉:从极近极速拉远至中景
- 快速横移:水平扫过锚点(带运动模糊)
- 上下突进:垂直俯冲/仰冲至锚点
- 多方向不完整环绕:以锚点为圆心 15°–45° 急停急转
- 手持微晃:轻微抖动但锚点保持中心
- 高潮强制节点(如存在音频卡点时):
- 11s:极速俯冲怼脸(LANDSCAPE 用高空俯冲)+ 球面膨胀畸变。
- 13.5s:360° 高速环绕 + 四角液化拉伸。
- 16s:全景拉出收尾,18s 精准闭环收镜。
主体类型专属分镜倾向(在 BPM 分档总镜头数基础上叠加执行):
以下规则针对各类主体的视觉特性,在同一 BPM 档位的总镜头数范围内,调整景别比例与运镜优先级,不改变总时长与卡点逻辑。
-
PRODUCT(产品静物)
- 景别比例:特写微距 55% / 中景主体 35% / 全景轮廓 10%;重点突出材质纹理、Logo 细节与立体轮廓。
- 运镜优先级:贴物近距离急推急拉 ≥ 小范围贴物环绕 > 快速横移;俯冲爆镜限制在高潮节点(11s/16s)使用,日常段落禁用大幅度俯冲。
- 每个主要角度(正面、侧面、45° 微俯)至少出现 3 次,背面视角至少 1 次;全程不出现大广角远景。
-
VEHICLE(车辆交通)
- 景别比例:特写细节 40% / 中景车身 40% / 全景整车 20%;重点捕捉车灯、车标、轮毂、车身曲线等硬核细节。
- 运镜优先级:低位贴地急推急拉 ≥ 贴地 360° 环绕 > 平行跟车横移;高潮段(11s–18s)优先使用向前冲刺式推拉模拟驾驶动势感。
- 每个主要角度(车头正面、左前 45°、车身侧颜、车尾)至少出现 2 次,俯视角度至少 1 次;禁用高空航拍视角。
-
ANIMAL(动物宠物)
- 景别比例:脸部五官特写 50% / 全身动态中景 35% / 环境适配全景 15%;重点锁定眼神、鼻尖、毛发纹理等萌态细节。
- 运镜优先级:贴地跟随式急推急拉 ≥ 跟踪式横移 > 小弧度环绕;蒙太奇段须包含至少 2 次模拟动物视角的极低位仰拍镜头(机位高度贴地)。
- 建立段环绕速度放缓至 4°/s(比通用规则慢),以配合动物慵懒/自然的气质;高潮俯冲改为"贴地加速冲向鼻尖",而非垂直俯冲。
-
ARCHITECTURE(建筑场景)
- 景别比例:局部线条/光影特写 30% / 中景全貌 45% / 大范围仰拍全景 25%;重点呈现建筑结构层次与纵深张力。
- 运镜优先级:低位仰拍急推纵深 ≥ 大范围慢速环绕 > 建筑线条平行横移;高潮俯冲改为"极限低位仰冲至建筑顶部",保留建筑挺拔感,禁止变形透视。
- 禁用贴物微距(建筑不适合超近距离怼脸),最近景别不超过局部线条/窗格特写。
-
LANDSCAPE(风景外景)
- 景别比例:高空大广角远景 50% / 中高空渐进推进 35% / 天际线平视延伸 15%;全程维持航拍视角,不落地。
- 运镜优先级:高空俯冲推进 ≥ 航拍 360° 全域环绕 > 天际线平移;高潮节点(11s)强制执行高空极限俯冲(区别于其他品类的怼脸俯冲)。
- 禁用近距离微距与低位镜头;建立段采用高空缓速横移(代替常规水平环绕),速度 3°/s。
-
HUMAN(人物人像)
- 景别比例:眼部/脸部特写 45% / 半身中景 35% / 全身全景 20%;重点聚焦五官神态、肢体线条与妆造细节。
- 运镜优先级:小半径体态环绕 ≥ 平视/微仰急推面部 > 全身横移甩镜;规避超广角近距离怼脸(防止面部透视畸形),急推最大推进比例不超过 130%(其他品类可至 140%)。
- 每个主要视角(正面、左右侧 45°、背面)至少出现 2 次;全身全景须在建立段或收尾段出现至少 1 次,确保人体比例完整呈现。
产品 TVC 模式专属分镜规则(仅 Final_Video_Spec.md 中执行模式 = 产品 TVC 模式时生效):
TVC 模式下,以下规则完全替代 TETO 默认分镜逻辑(两段式、高速蒙太奇、方向覆盖强制规则等);调色、锚点、音轨设计规则独立于 TETO 默认值重新定义,禁止混用。
关键元素设计(TVC 模式):
- 同样注册用户上传图为 key_element(Element_Subject_01),描述中须完整记录产品的材质、色彩、轮廓;额外标注核心卖点区域(如品牌 Logo 位置、标志性材质纹理区、功能部件)作为 TVC 模式锚点候选。
- TVC 模式的锚点从核心卖点区域中选取,而非从高对比边缘或高光点优先选取;若产品无明显卖点焦点,回退至几何中心。
镜头节奏设计(TVC 模式):
- 总时长:使用 Final_Video_Spec.md 中写入的时长(默认 18s,用户可声明 15–30s)。
- 单镜时长:0.8–2.5 秒,禁止低于 0.8 秒;卖点细节特写镜头允许停留最长 3 秒。
- 镜头结构(三段式):
- 全景铺垫段(0–30% 时长):2–4 个镜头,产品与环境全貌,缓慢推近或横移,速度 ≤ 6°/s;无特效,仅轻微柔焦氛围。
- 卖点展示段(30%–80% 时长):8–16 个镜头,交替呈现产品主体中景、材质纹理特写、Logo/功能部件微距,节奏从容;每个核心卖点停留不少于 1.5 秒。
- 收尾段(80%–100% 时长):2–4 个镜头,缓缓拉远至全景或定格产品正面特写,淡出收尾。
运镜规则(TVC 模式):
- 360° 完整缓慢环绕:全程以锚点(卖点区域)为圆心,顺时针缓慢完整环绕(速度 6–10°/s);可在关键角度(正面、45° 侧面)暂停 0.5–1 秒展示细节。
- 平滑推拉:缓慢推近至卖点细节停留(最近距离为纹理特写),再缓慢拉远;全程无加速爆发曲线,匀速平滑。
- 微距特写:材质纹理、品牌字样等需要高清晰度的内容使用静定微距机位,无任何运动;锐度极高,锚点偏差 ≤ 2px。
- 景别循环:全景(产品+环境)→ 中景(产品主体)→ 特写(卖点细节)交替出现,不得连续三镜停留同一景别。
- 禁用规则(TVC 模式):急推急拉、硬切跳剪、手持抖动、球面畸变、RGB 色散、白闪爆闪、高速横移甩镜;运动模糊强度极低(等效快门角度 ≤ 90°),静定镜头完全关闭。
调色与质感(TVC 模式):
- 主色调:低饱和莫兰迪调,根据产品主色自动匹配邻近色或补色背景色,整体高级灰基调。
- 高光柔化处理,阴影保留轻微层次(不压死纯黑),对比度控制在中低位。
- 可选轻度胶片颗粒(透明度 ≤ 3%),仅用于质感强化,不可明显可见。
- 禁用高对比冷青强调色、彩色闪烁、强逆光硬光效果。
- 转场使用叠化(0.3–0.5s)或淡入淡出,禁止硬切。
音频轨道设计(TVC 模式):
- 规划 1 条 music 类型轨道,时长与视频总时长一致,音量控制在 -20dB 以下,作为背景氛围不干扰视觉。
- 音乐风格标签:舒缓、治愈、轻商务、钢琴/环境音乐(ambient),无强节拍,节奏不主导视频。
- 若有旁白(VO)需求,单独规划 1 条 narration 类型轨道,BGM 自动让步于旁白音量。
- 音乐不需要卡点节拍同步,也不需要前奏/高潮结构设计;仅作为情绪背景铺垫。
特效强度档位选择(节点二用户确认):
在 Storyboard 完成后,通过节点二 cards 由用户选定特效强度档位(普通 / 高能 / 狂暴),写入 Final_Video_Spec.md;后续 media_generator 与 video_assembler 全程按对应档位执行。三档像素级参数(球面膨胀半径、RGB 色散偏移量、液化强度、白闪帧数、暗角不透明度、手持抖动幅度等)以 video_assembler 第 5 节参数表为唯一权威来源,本节不列出任何像素级数值。
运镜核心规则(全局禁用): 匀速运镜、柔和叠化转场、慢节奏长镜头、固定静止机位、过度磨皮。单次运动时长不超过 0.8s,运动过程必须带运动模糊;全程叠加微量真实手持抖动。
运镜夸张与张力强化规则(蒙太奇段强制执行):
- 方向覆盖强度:蒙太奇段必须覆盖以下所有六个运动方向,每个方向至少出现 3 次(原最低 2 次提升):俯冲/仰冲(垂直)、快速横移/甩镜(水平)、急推/急拉(Z 轴前后)、不完整弧度环绕(15°–90° 急停急转)、跳跃抖动(剧烈手持晃动,锚点仍居中);相邻镜头须交替方向,禁止连续三镜同方向。
- 运动加速度(非匀速):所有运镜必须有爆发感的加速度曲线——急推前 0.1s 慢启、后 0.2s 猛加速冲入;急停后允许轻微过冲再回摆(0.05s 回弹);禁止全程匀速平滑。
- 景别突变允许:允许从极远全景直接硬切至极近特写,无需过渡,主动制造视觉跳跃感。
- 运动模糊分层:高速运镜期间背景/前景允许强烈运动模糊;锚点周围核心区域(约占画幅短边 10% 半径内)必须保持清晰锐利,不可模糊。
- 超广角视角畸变:默认采用 24mm 等效超广角机位,边缘拉伸畸变强化速度感;人像类(HUMAN)除外,限制最广不低于 35mm 等效以防面部畸形。
设计独立音频轨道 (audio_layers):
- 规划 1 条 music 类型轨道,时长 18 秒,精确标注前奏落点(通用曲目约 3s;93BPM Dark Trap 专属曲目约 5s)、人声入场时间点(93BPM 专属:约 5s)与高潮三重爆发(11s / 13.5s / 16s)时间锚点;非 93BPM 曲目无需标注人声识别触发规则。
4. 素材生成
资产绑定:
- 用户上传的主图注册唯一 asset_id,绑定为 key_element(Element_Subject_01)核心视觉资产;后续所有视频生成均以此原图为视觉一致性根基,禁止重新随机生成主体外貌。
背景生成与主体合成(可选,仅节点零触发背景替换流程时执行):
背景图生成(TextToImage):
以下为 TETO 动感模式背景场景预设池,强调戏剧张力与电影冷青质感;TVC 模式有独立的极简高级感场景预设,详见本节末"产品 TVC 模式专属生成策略"。
- 根据主体类型从以下预设场景池中各提取 3 个候选方案,通过 Planner 以 cards 呈现给用户(含"AI 自动最优"选项);选定后立即生成:
- VEHICLE:黄昏露天停车场暖橙侧逆光 / 城市高架桥下冷蓝夜景氛围 / 赛博朋克风格车库霓虹灯光
- PRODUCT:极简摄影棚渐变灰背景柔光 / 赛博朋克未来主义金属展台冷光 / 户外自然散射光影背景
- HUMAN:城市天台日落逆光剪影 / 光影艺术墙体侧光氛围 / 极简室内柔光摄影棚
- ANIMAL:自然草地散射晨光 / 温馨室内暖黄背景光 / 阳光窗台逆光剪影
- ARCHITECTURE:薄雾清晨蓝灰天空留白 / 蓝调时刻夜景城市灯光 / 极简高云天空大光比
- LANDSCAPE:不适用,强制跳过背景替换流程
- 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K;背景图比例按 Final_Video_Spec.md 中的画幅(默认 9:16)生成;提示词须融入冷青电影调色基调、写实风格、与主体类型适配的光源方向描述(如侧逆光、顶光)。
主体与背景合成(ImageToImage):
- 以原参考图主体 + 选定背景图为输入,调用 ImageToImage 将主体无缝融合至新场景;推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 合成约束:主体居中偏下构图(贴合 TETO 锚点居中需求);主体边缘细节完整保留,轮廓锐利不晕染;光影方向与背景光源一致(若背景含明确侧逆光光源,须为主体补充对应高光与接地投影);主体色彩真实还原,不因背景色彩影响偏色。
- 合成完成后,执行以下四项质检;任一项不达标则更换随机种子自动重试(最多 2 次),2 次仍不达标时向用户说明具体失败项,并提供"重新选择背景"或"保留原图跳过合成"两个选项:
质检项判定标准不达标特征边缘融合度主体轮廓与背景过渡自然,无硬边/白边/锯齿/光晕可见明显抠图痕迹、边缘颜色溢出或主体轮廓呈"贴纸感"光影一致性主体高光方向与背景光源方向一致(误差 ≤ 30°);接地投影存在且透视合理主体受光面与背景逆向、缺少地面投影、或投影方向明显错误色调融合度主体色温与背景整体色温保持协调,冷青基调统一;主体不出现明显偏色或色块突变主体色彩与背景产生明显色温断裂(如背景冷青主体暖黄),或主体颜色被背景染色失真主体完整性主体关键结构(轮廓、细节部位)无被背景侵蚀、覆盖或变形;主体比例保持原图一致主体局部缺失、边角被背景融化、或主体产生非预期形变 - 全部质检通过后,展示预览供用户确认;确认后将合成图注册为新 resource_id,重新绑定至 key_element(Element_Subject_01)并替代原始参考图,后续所有视频生成步骤均使用此合成图。
视频生成策略:
- 生成路径:MultiModalToVideo。
- 推荐模型:首选 Seedance 2.5(480p);会员可升至 480p;备用 Seedance 2.5(480p)。
- reference_image:将 key_element 原图作为 image_1 传入 image_infos,锁定主体多角度一致性。
- 前后镜衔接:若当前分镜与上一 Shot 存在极强空间连续性(尤其是环绕段),可将上一 Shot 的 final_shot 绑定为 reference_video 辅助推演多视角物理合理性;其余情况默认仅引用原图。
- Shot 级视频质检(四项分标准):每个片段生成后,依次评估以下四项;任一不达标则更换随机种子自动重试(最多 2 次);2 次仍不达标时停止重试,向用户说明具体失败项,并通过 cards 提供"调整提示词重新生成"或"跳过本镜使用备用静帧"两个选项,不强行推进。
质检项判定标准不达标特征重试时的干预措施锚点清晰度锚点周围核心区域(画幅短边 10% 半径内)必须清晰锐利,全帧无整体虚焦锚点区域虚焦、全帧模糊、或核心主体细节丢失强化提示词"anchor zone razor sharp, ultra detailed center subject";狂暴档下优先重试而非降档运动张力每个蒙太奇镜头须有明确加速度曲线,起止有爆发感,非匀速平滑全段匀速缓移、无推拉加速冲入感、或运动幅度明显低于 Storyboard 设计意图提示词末尾追加"explosive acceleration, sudden burst movement, violent camera impact, no smooth easing"方向与景别符合度生成镜头的运动方向与景别须与 Storyboard 对应 Shot 描述一致(俯冲 / 横移 / 急推 / 环绕的执行方向不得偏离超过 45°,景别档位不得跨越两档)计划为正面急推但实际生成为侧面横移;计划为特写但实际为远景全貌精简提示词中其他描述,突出方向与景别关键词,去除可能产生歧义的修饰语主体完整性主体在运动过程中不得出现肢体缺失、结构变形、或被运动模糊完全覆盖遮蔽;锚点对应的物理特征点须在镜头全程可辨认高速运镜导致主体中心区域失去识别度、主体结构发生 AI 幻觉变形、或锚点特征点消失追加"preserve subject structure integrity, maintain anchor feature point visible throughout motion"
重试注意事项: 重试时仅更换随机种子并按上表干预措施补充关键词,不得擅自降低 Storyboard 规划的运镜强度档位或缩短单镜时长;若用户选择"跳过本镜使用备用静帧",由 video_assembler 以对应时间点的主体参考图作为静帧填充,叠加正常特效后拼入时间轴。
- 画面风格约束:所有提示词均须融入冷青调色、暗部压黑、7%–12% 胶片颗粒等视觉统一性约束,确保跨镜头风格一致。
超分辨率增强(super_resolution / MediaKit):
所有 Shot 生成并拼装完毕后,可对最终 18s 成片调用 super_resolution(video · MediaKit)进行整体增强。下表按主体类型与 BPM 档位给出推荐参数,优先满足主体类型规则,BPM 档位作为帧率补充建议。
按主体类型推荐分辨率:
主体类型推荐分辨率说明PRODUCT(产品静物)"4k"材质纹理、Logo 细节密集,高分辨率直接影响质感输出VEHICLE(车辆交通)"4k"车身曲线、车灯轮廓锐利度要求高,4K 强化金属质感ARCHITECTURE(建筑场景)"4k"建筑线条层次丰富,高分辨率保留结构纵深感LANDSCAPE(风景外景)"4k"全域大场景信息量大,4K 防止远景细节糊化ANIMAL(动物宠物)"1080p"毛发纹理已由生成模型处理,1080p 足够;4K 可选HUMAN(人物人像)"1080p"防止过度锐化导致皮肤质感失真;4K 仅限时装/商业人像场景
按 BPM 档位推荐帧率补充(fps):
BPM 档位推荐 fps说明BPM > 120(高速电子/EDM)"60"极速推拉、跳剪密集,60fps 消除运动模糊堆积,卡点更锐利BPM 80–120(标准节奏)"30"节奏均衡,30fps 保留轻微运动模糊,维持胶片质感BPM < 80(慢节奏氛围/Lo-Fi)"24"慢速环绕主导,24fps 原生帧率保留骤降变速的空间拉扯感,不宜插帧93BPM Dark Trap 专属"60"高潮段极速俯冲+全套特效密集,60fps 确保帧间特效不糊帧
触发时机与注意事项:
- 在 video_assembler 完成全片拼装、特效渲染、音画对齐后,对最终输出文件整体执行一次超分,而非对单个 Shot 逐一处理。
- 当用户明确要求"8K 输出"时,说明当前最高支持 4K(MediaKit 上限),不强行写入不支持的分辨率。
- 超分为可选步骤;若用户在意生成速度或无会员资格,可跳过或降级为 1080p 直接输出。
产品 TVC 模式专属生成策略(仅 Final_Video_Spec.md 中执行模式 = 产品 TVC 模式时生效):
TVC 模式下,以下规则完全覆盖 TETO 默认视频生成策略;超分辨率增强规则、背景生成与合成规则保持不变(仍按原流程执行)。
背景图生成(TextToImage · TVC 模式专属场景池):
TVC 模式背景强调极简、高级感与莫兰迪低饱和质感,与 TETO 模式的赛博朋克/强逆光场景池完全隔离,禁止混用。
- 根据产品主色自动推荐 3 个场景候选,通过 Planner 以 cards 呈现(含"AI 自动最优"选项),选定后立即生成:
- PRODUCT(通用电商产品):
- 极简摄影棚哑光渐变背景(灰白到浅米,顶部大面积柔光,无阴影边界)
- 莫兰迪灰蓝调石膏质感平台(产品置于圆弧转角台面,背景与台面同色系无接缝)
- 浅奶油色羊毛绒布背景(近距离绒面肌理,温润柔和,高档品发布感)
- PRODUCT(数码 / 科技类):
- 深空哑光黑磁吸展台(边缘极细冷白轮廓光,背景无渐变,近乎纯黑)
- 烟灰色金属拉丝平台(顶部漫反射冷白面光,边缘微蓝色调,科技感中性)
- 浅莫兰迪蓝灰渐变背景(产品正面视角,背景由深至浅,无明显光源方向)
- PRODUCT(美妆 / 护肤 / 香氛类):
- 柔粉米白大理石纹台面(背景浅米驼色散射柔光,无高对比光影)
- 莫兰迪玫粉丝绒布幕背景(顶部正面柔光,边缘自然衰减,无硬阴影)
- 透明玻璃台面+浅绿灰背景(折射光斑轻微,整体通透清爽,偏高端护肤格调)
- PRODUCT(鞋服 / 配饰 / 皮具类):
- 哑光灰白弧面展台(产品正面微俯视角,背景无接缝圆弧过渡,无强光)
- 浅燕麦色麻质布面背景(天然纤维纹理近景,背景与台面同材质统一)
- 深橄榄灰绒面背景(冷暖中性,轮廓光极细,适合深色皮具/鞋类)
- PRODUCT(食品 / 饮品 / 健康品类):
- 原木浅棕木纹台面+奶白背景(自然温暖,散射顶光,无强对比)
- 浅苔藓绿亚光背景(低饱和自然感,适合有机/健康品定位)
- 冰雾蓝灰玻璃质感台面(冷峻通透,背景为浅灰白,适合饮品/营养品科技感包装)
- PRODUCT(通用电商产品):
- 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K;背景图比例按 Final_Video_Spec.md 中的画幅(默认 9:16)生成;提示词须融入以下 TVC 专属约束:
- 低饱和莫兰迪色调,整体高级灰基底;
- 柔和漫反射光源(无硬阴影、无强逆光),光线方向以顶光或前侧顶光为主;
- 写实质感但非超写实(避免过度 HDR),整体通透清爽;
- 禁用赛博朋克霓虹、强逆光剪影、高对比冷青强调色等 TETO 风格元素。
主体与背景合成(ImageToImage · TVC 模式):
- 调用 ImageToImage 将主体无缝融合至 TVC 场景背景;推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 合成约束:主体居中偏下或居中构图(符合 TVC 卖点锚点需求);产品边缘细节完整保留,轮廓清晰无晕染;高光方向与背景柔光方向一致(顶光补充产品顶面轻微高光,侧光补充侧面轮廓光);主体色彩真实还原,不受背景莫兰迪调影响偏色。
- 合成质检沿用媒体生成模块四项标准(边缘融合度、光影一致性、色调融合度、主体完整性),判定标准保持不变;不达标时最多重试 2 次,仍失败提供"重新选择背景"或"保留原图"两个选项。
视频生成(TVC 模式):
- 生成路径:MultiModalToVideo(同 TETO 默认路径)。
- 推荐模型:首选 Seedance 2.5(480p);会员可升至 480p;备用 Seedance 2.5(480p)。
- reference_image:将 Element_Subject_01 原图(或合成图)作为 image_1 传入,全程锁定产品外观一致性。
- 前后镜衔接:TVC 模式镜头数量少(约 6–12 个),相邻镜头空间连续性高,每个镜头均可将上一 Shot 的 final_shot 绑定为 reference_video,辅助平滑运镜连贯性。
- 提示词风格约束:平滑推拉、缓慢环绕、莫兰迪低饱和调色、高光柔化、无爆发加速感、无硬切、叠化转场。每条提示词末尾追加否定词:"无字幕、无文字、无水印、no music、no hard cut、no motion blur"。
BGM 生成(TVC 模式):
- 用户已上传音频:直接注册 asset_id 并绑定至 Storyboard music 轨道,不做 BPM 分析(TVC 模式不依赖节拍卡点);时长不足时尾部循环补齐,超出则从最自然段落截取。
- 用户未上传音频(自动生成 BGM):调用 text_to_instrumental,推荐模型 Suno 5,备用 Mureka 8;提示词风格标签:ambient, piano, soft cinematic, healing, low tempo, no strong beat, luxury product feel;时长与视频总时长一致(15–30s 范围);生成后音量标注 -20dB,注册 asset_id 绑定至 Storyboard music 轨道;用户不满意可重新生成,最多 3 次。
Shot 级质检(TVC 模式调整版,四项标准):
TVC 模式下,运动张力与方向符合度判定标准不同于 TETO 默认值,其余两项(锚点清晰度、主体完整性)标准不变。
质检项TVC 模式判定标准不达标特征重试干预措施锚点清晰度产品核心卖点区域(画幅短边 15% 半径内)全程清晰锐利,无虚焦卖点区域虚焦或细节丢失强化"ultra sharp product detail, razor clear texture"关键词运动平滑度所有运镜须为匀速或缓出曲线,无爆发加速感,无抖动出现明显加速冲入、机器抖动或帧间跳跃追加"slow smooth dolly, no acceleration, steady camera, no shake"景别与方向符合度运动方向与景别须与 Storyboard 对应 Shot 描述一致(偏差 ≤ 30°,景别不跨越一档)计划推近但实际横移;计划中景但实际远景精简提示词,突出方向/景别关键词主体完整性产品外轮廓与关键细节(logo、纹理)在运动中无变形、无被背景侵蚀产品边缘被融化、logo 变形、局部缺失追加"preserve product structure integrity, no distortion"
音频来源处理(由 Planner 自动判定,无需用户选择):
- 用户已上传音频:通过 manage_item_assets 将上传的 MP3 注册为 asset_id,填入 Storyboard music 轨道;时长不足 18s 时由 video_assembler 在拼装阶段尾部循环补齐(保持音高不变),不在此处拉伸处理;时长 > 18s 时从最强能量起点截取前 18s。
- 用户未上传音频(自动生成 BGM):调用 text_to_instrumental,生成 18s 暗黑重低音电子 BGM;推荐模型 Suno 5,备用 Mureka 8;提示词须包含风格标签:dark trap, heavy 808 bass, cinematic, cold atmosphere, 93 BPM。生成后注册 asset_id 并绑定至 Storyboard music 轨道;用户后续不满意可申请重新生成,最多 3 次。
- 用户明确指定无音频输出:跳过音频生成步骤,Storyboard music 轨道留空;视频拼装阶段输出静音 MP4。
5. プロンプト作成
全局原则: 用户界面为中文时,提示词采用中文撰写;所有生视频提示词结尾统一加入否定词:"无字幕、无文字、无水印、no music",音频由独立音轨保障。
机位与景别词库(按主体类型):
- PRODUCT:平视微俯 45°、贴物微距特写、主体居中平视、微俯全景轮廓、小范围贴物环绕。
- ARCHITECTURE:低角度仰拍、纵深平视、建筑线条局部特写、大范围慢速环绕。
- LANDSCAPE:高空航拍广角、俯冲高空推进、天际线平视延伸、360° 全域航拍环绕。
- ANIMAL:贴地平视、脸部五官微距、全身动态中景、跟随式环绕。
- HUMAN:平视微仰人像、眼部/脸部微距特写、半身中景、全身全景、小半径体态环绕。
- VEHICLE:低位贴地仰拍、车头/车灯细节特写、车身侧颜中景、整车道路全景、贴地环绕推进。
运动控制词库(全局通用):
瞬爆推拉(0.2s 极速推入 140%;HUMAN 类型上限 130%,超出会导致面部透视畸形)、极速俯冲怼脸、360° 高速环绕、横向极速甩镜 (whip pan with motion blur)、断层硬切 (hard cut)、跳剪 (jump cut)、手持微晃 (handheld micro-shake)、中心锚点全程锁焦 (perfect center anchor tracking)、骤然降速空间拉扯。
调色与质感约束(所有提示词通用):
超高画面对比度;暗部纯黑压死无灰阶;中间调高级冷青基调;高光惨白通透;7%–12% 低透明度粗胶片颗粒;主体色彩真实还原不偏色;画面边缘极致锐利,无过度磨皮,无失真变形。
Seedance 2.5(分辨率 480p) 多镜头提示词模板:**
"以 <<<image_1>>> 作为 3D 锁定主体,anchor point fixed at absolute center of frame, never shift, tolerance ≤ 2px。[按 Story beats 列出各内部切镜动作与时序,所有运镜以锚点为圆心]。超高对比度,冷青电影级调色,暗部压死纯黑,高光惨白,7% 胶片颗粒,手持微晃,无字幕,无文字,无水印,no music。"
锚点约束必填项: 每个视频生成提示词中均须包含精确锚点描述,格式为:"锚点 [描述] 始终位于画面绝对中心,所有运镜围绕该点执行,不得偏移"。
运镜张力必填约束(蒙太奇段每条提示词末尾追加): "锚点核心区域极致清晰锐利,前景/背景强烈运动模糊,运动起止有爆发加速感,非匀速,禁止平滑缓行"。如提示词为英文输出场景,等效追加:"anchor zone razor sharp, foreground/background heavy motion blur, explosive acceleration on every move, no smooth easing, 24mm ultra-wide"。
93BPM Dark Trap 专属运镜标注(当音频识别为此风格时):
- 1/3 拍底鼓落点处注明:极速推入 140% → 球面膨胀畸变触发。
- 2/4 拍踩镲处注明:RGB 红蓝通道 1–2px 色散偏移。
- "I'm in cheetah" 人声段:俯冲爆镜 + 全屏单帧白闪 + 四角液化拉伸全套特效全开。
产品 TVC 模式提示词规则(仅 Final_Video_Spec.md 中执行模式 = 产品 TVC 模式时生效)
TVC 模式下,以下规则完全替代 TETO 默认提示词规则(BPM 分档规则、卡点锚点约束等);通用调色约束重新定义如下,不继承 TETO 冷青高对比设定。
TVC 模式调色与质感约束(所有提示词通用):
低饱和莫兰迪色系;柔和扩散光,无强逆光;高光轻柔不过曝;阴影保留轻微层次,不压纯黑;可选极轻胶片颗粒(透明度 ≤ 3%);产品主体色彩真实还原,不因背景染色偏色;全帧清晰无运动模糊。
TVC 模式 Seedance 2.5(分辨率 480p) 提示词模板:
以 <<<image_1>>> 为产品主体,锚点【卖点描述,如"品牌 logo 左上角"】始终位于画面中心,偏移容差 ≤ 2px。
【按 Shot 描述列出平滑运镜动作:缓慢环绕/平滑推近/微距停留/缓慢拉远,需含速度描述如"6°/s 顺时针缓慢环绕"】。
低饱和莫兰迪色调,柔和扩散光,高光轻柔,阴影轻浅,极轻胶片颗粒,产品细节极致清晰,平滑匀速运动无抖动。无字幕,无文字,无水印,no music,no hard cut,no motion blur。
TVC 模式锚点描述规则:
每条提示词中的锚点描述须指向核心卖点区域(如"正面中央品牌标志"、"右侧金属按键纹理区"),而非高对比边缘点;追加约束:「产品卖点区域全程极致清晰,所有运镜围绕该区域执行,不得偏移或模糊」。
TVC 模式运动控制词库(全局通用):
缓慢顺时针环绕(6–10°/s)、平滑推近至卖点细节(slow dolly in)、卖点区域静定锁焦(static close-up lock)、缓慢拉远至全景(slow pull back)、平行横移缓扫(slow lateral slide);所有运动词须附加「smooth, no acceleration, steady camera」约束。
TVC 模式否定词尾(每条提示词末尾统一追加):
「无字幕,无文字,无水印,no music,no hard cut,no sudden movement,no motion blur,no shake,no flash」。
分 BPM 区间提示词示例(Seedance 2.5(分辨率 480p) / MultiModalToVideo)
以下示例均遵循通用模板结构:<<<image_1>>> 锁定主体 → 锚点约束 → 内部切镜动作时序 → 调色质感约束 → 否定词尾。实际生成时,将 [主体描述]、[锚点描述] 替换为分镜中的具体内容。
BPM > 120(高速电子 / EDM)
节奏特征:单镜 ≤ 0.4s,急推急拉+跳剪为主(≥70%),变速 1.5x–2.0x,每 4 拍插入断层跳剪。
提示词示例:
以 <<<image_1>>> 为 3D 锁定主体,[锚点描述] 始终位于画面绝对中心,所有运镜围绕该点执行,偏移容差 ≤ 2px。
极速急推怼脸锚点(0.3s,推至 140%,运动模糊全开)→ 硬切右侧跳剪(轻微位移断层)→ 极速左侧甩镜扫过主体(0.3s,拖影)→ 跳剪复位(帧间位移 8px)→ 从高处极速俯冲锚点顶部(0.4s)→ 急拉拉远至中景(0.3s)→ 断层跳剪(帧切换)。变速全程 1.5x–2.0x 加速叠加,每 4 拍触发一次断层位移跳剪。
超高对比度,暗部纯黑压死,冷青电影级调色,高光惨白,7% 粗胶片颗粒,手持微晃。无字幕,无文字,无水印,no music。
BPM 80–120(标准节奏流行 / R&B)
节奏特征:单镜约 0.6s,急推拉 40% / 横移甩镜 30% / 短弧环绕 30% 均衡分配,变速 1.2x–1.5x。
提示词示例:
以 <<<image_1>>> 为 3D 锁定主体,[锚点描述] 始终位于画面绝对中心,所有运镜围绕该点执行,偏移容差 ≤ 2px。
正面平视微距特写锚点(0.6s,静定锁焦)→ 急推至极近细节(0.5s,1.3x 加速)→ 硬切左侧横移甩镜扫过主体(0.6s,水平拖影)→ 以锚点为圆心顺时针 30° 短弧急停环绕(0.6s)→ 急拉拉至中景(0.5s)→ 右侧反向甩镜(0.6s)→ 背面视角急推怼近(0.6s,1.2x 变速)。弱拍节点允许最长 0.9s 慢速环绕衔接过渡,变速区间 1.2x–1.5x。
超高对比度,暗部纯黑压死,冷青电影级调色,高光惨白,9% 粗胶片颗粒,手持微晃。无字幕,无文字,无水印,no music。
BPM < 80(慢节奏氛围 / Lo-Fi)
节奏特征:单镜 ≤ 0.8s,大弧度慢环绕+中景横移为主,急推比例 ≤30%,优先骤降速(1.0x→0.6x)制造空间拉扯感。
提示词示例:
以 <<<image_1>>> 为 3D 锁定主体,[锚点描述] 始终位于画面绝对中心,所有运镜围绕该点执行,偏移容差 ≤ 2px。
正面中景平视起幅,以锚点为圆心大弧度顺时针 60° 慢速环绕(0.8s,速度平缓均匀)→ 骤然降速(1.0x→0.6x,画面空间拉扯感)→ 侧面中景横移缓扫主体(0.7s)→ 慢速反向 45° 逆时针环绕(0.8s)→ 重拍节点触发一次急推至锚点极近(0.6s,仅此处提速至 1.3x)→ 慢速拉远至全景收尾(0.8s,1.0x 匀速)。弱拍段落以大弧度慢环绕为主,急推比例不超过 30%。
超高对比度,暗部纯黑压死,冷青电影级调色,高光惨白,12% 粗胶片颗粒,手持微晃。无字幕,无文字,无水印,no music。
93BPM Dark Trap 专属
节奏特征:单镜 0.5–2s 动态,1/3 拍底鼓 → 推拉+球面扭曲,2/4 拍踩镲 → RGB 色散,"I'm in cheetah" 人声 → 全套高潮特效全开。
提示词示例:
以 <<<image_1>>> 为 3D 锁定主体,[锚点描述] 始终位于画面绝对中心,所有运镜围绕该点执行,偏移容差 ≤ 2px。
前奏铺垫段(0–5s):侧面微距特写锁焦锚点,小幅 45° 慢速环绕,画面仅微量 RGB 色偏(±0.5px),无扭曲无白闪,单镜 1.5–2s。
主歌蓄力段(5–11s,I know my guy 人声入场):1/3 拍底鼓落点 → 极速推入 140%(0.2s)+ 0.1s 球面膨胀畸变触发 → 慢速后拉(0.5s);2/4 拍踩镲落点 → RGB 红蓝通道 1–2px 色散偏移;人声分句收尾空拍 → 特写硬切至中景;切镜密度降低 30%,单镜最长 2s 蓄势等待。
高潮爆发段(11–18s,I'm in cheetah 整句):强制触发全套特效——极速俯冲怼脸(0.3s)+ 全屏单帧白闪 + 球面中心膨胀畸变 + 四角液化拉伸 + RGB 色散全开(2px);360° 高速环绕(0.4s);极速推拉循环至 16s;16s 全景拉出 + 最重暗角压边收尾。
超高对比度,暗部纯黑压死,冷青电影级调色,高光惨白,10% 粗胶片颗粒,G 小调低频冷暗氛围,手持微晃。无字幕,无文字,无水印,no music。
6. 動画編集
时间线拼装、剪辑与卡点规则:
-
导入与轨道对齐:加载完整的 18s 背景音乐文件作为音频主轨;按 resource_prepare_and_analyze 输出的重拍时码轴对齐所有视频片段。
-
第一阶段建立段剪辑:裁切并导入建立段视频,1.0 倍速匀速播放,对齐前奏,首尾各 0.2s 淡入/淡出;仅叠加微量 RGB 色偏(±0.5px),无扭曲无白闪。建立段时长按 BPM 档位确定:BPM > 80 或未上传音频时为 0–3s;BPM < 80 时延长至 0–5s(与分镜设计模块及主体分析模块 BPM < 80 附加规则一致);93BPM Dark Trap 专属为 0–5s。蒙太奇快剪段的起始时间点相应调整。
-
第二阶段高能蒙太奇快剪 (3–18s):
- 按 Storyboard 规划的全部蒙太奇段镜头列表依次提取对应视频片段(镜头数量视 BPM 档位而定,约 16–38 个),按 BPM 分档剪辑模板执行:
- BPM > 120(高速电子/EDM):单镜 ≤ 0.4s;以急推/急拉/跳剪为主(≥70%),环绕类压缩至 ≤15° 短弧;变速 1.5x–2.0x;每 4 拍插入一次跳剪断层位移。
- BPM 80–120(标准节奏流行/R&B):单镜约 0.6s;急推急拉 40%、横移甩镜 30%、短弧环绕 30%;变速 1.2x–1.5x;弱拍允许最长 0.9s 慢速环绕衔接镜头。
- BPM < 80(慢节奏氛围/Lo-Fi):单镜 ≤ 0.8s;以中景横移 + 大弧度慢环绕为主,急推比例 ≤30%;优先骤然降速(1.0x → 0.6x)制造空间拉扯感。
- 93BPM Dark Trap 专属:启用专属时码轴——1/3 拍底鼓绑定瞬爆推拉至 140% + 0.1s 球面膨胀;2/4 拍踩镲绑定 RGB 色散 1–2px;"I know my guy" 人声段降低切镜密度(单镜最长 2s)蓄势;"I'm in cheetah" 人声段强制全套高潮特效全开。
- 音画卡点:节拍点处执行硬切 (Hard Cut)、跳剪 (Jump Cut) 或 3 帧以内极短叠化转场;强音爆发瞬间配合对应 BPM 档变速参数。
- 像素级锚点锁焦:相邻硬切时通过 X/Y 轴微调确保前后镜头锚点屏幕偏差 ≤ 2px;超出阈值自动重试生成(最多 2 次),仍失败则跳过并标记。
-
三大高潮节点强制执行:
⚠️ 以下括号内数值为高能档默认值,实际执行须以 Final_Video_Spec.md 中写入的特效强度档位为准,按第 5 节三档参数表代入对应数值,不得使用本节硬编码值覆盖非高能档执行。
- 11s:极速俯冲怼脸(LANDSCAPE 用高空俯冲)+ 球面膨胀畸变(高能档默认:中心膨胀半径 = 画幅短边 × 30%,边缘向内挤压最大位移 = 画幅短边 × 8%,持续 0.1s 峰值 + 0.05s 线性回弹,共 0.15s)+ 白闪爆闪(高能档默认:3 帧)。
- 13.5s:360° 高速环绕 + 四角液化拉伸(高能档默认:四角各向外拉伸 = 画幅对角线 × 6%,液化扭曲强度 = 40/100,中心主体保护半径 = 画幅短边 × 25%,0.3s 渐入峰值 + 持续至镜头结束 + 0.1s 渐出)+ RGB 全开色散(高能档默认:红蓝通道各偏移 2px,绿通道反向偏移 0.5px)。
- 16s:全景拉出 + 低频明暗频闪(高能档默认:每 2 帧交替亮度 ±15%,持续 0.5s)+ 全片最重暗角(高能档默认:四角范围扩展至画幅边缘向内 20%,不透明度 85%,0.5s 渐变至收尾强度);18s 精准收镜闭环。
-
特效强度三档参数表(全文唯一权威来源,执行时按档位直接代入):
以下三档参数由用户在节点二选定后写入 Final_Video_Spec.md,拼装阶段以本表为唯一数值依据,不得自行插值或降级。
参数项普通档高能档(默认)狂暴档变速倍率区间1.0x–1.3x1.2x–1.8x1.5x–2.5x急推最大推进比例120%140%160%球面膨胀半径画幅短边 × 18%画幅短边 × 30%画幅短边 × 45%边缘内压最大位移画幅短边 × 4%画幅短边 × 8%画幅短边 × 14%四角液化拉伸量对角线 × 3%对角线 × 6%对角线 × 10%液化扭曲强度20/10040/10065/100RGB 色散偏移(常规段)红蓝各 0.5px红蓝各 1–2px红蓝各 2–3pxRGB 色散偏移(高潮全开)红蓝各 1px红蓝 2px + 绿反向 0.5px红蓝 3px + 绿反向 1px白闪爆闪帧数普通重拍 1 帧;高潮节点 2 帧普通重拍 1 帧;高潮节点 3 帧普通重拍 2 帧;高潮节点 5 帧**白闪不透明度(高潮节点)**峰值帧 80%,过渡帧 40%峰值帧 100%,过渡帧 50%峰值帧 100%,过渡帧 70%**明暗频闪幅度(16s 收尾段)亮度 ±8%,每 3 帧交替亮度 ±15%,每 2 帧交替亮度 ±25%,每帧交替暗角不透明度(常规段)**45%60%80%暗角不透明度(收尾段)65%85%100%手持抖动幅度微量(±2px)中量(±4px)剧烈(±8px,蒙太奇全程)跳剪断层位移量3–5px5–8px10–15px蒙太奇段单镜最短时长0.5s0.3s0.2s档位继承原则:未列出的参数(如调色 LUT、锚点清晰度约束、音频卡点逻辑)三档完全相同,不因强度档位变化。狂暴档下,若生成质检时检测到主体中心区域出现模糊,优先重试而非降档执行。
**> BPM 优先原则(单镜最短时长冲突时):当 BPM 分档规则所要求的单镜时长短于当前强度档位的最短时长下限时(例如 BPM > 120 的默认 0.4s 短于普通档下限 0.5s),以 BPM 分档规则为准,强度档位的最短时长下限自动向下兼容至该 BPM 档位的重拍切镜最短时长(BPM > 120 时为 0.3s)。节奏卡点优先于强度限制,不得因档位下限卡死而破坏音画同步。
特效名称触发条件强度参数(高能档默认)持续时长备注球面膨胀畸变鼓点重拍(1/3 拍底鼓)中心膨胀半径 = 画幅短边 × 30%;边缘向内挤压最大位移 = 画幅短边 × 8%0.1s 峰值 + 0.05s 线性回弹,共 0.15s普通档:半径 × 18%,位移 × 4%;狂暴档:半径 × 45%,位移 × 14%四角液化拉伸高潮爆发点(13.5s)+ 360° 高速环绕段四角各向外拉伸 = 画幅对角线 × 6%;液化扭曲强度 = 40(0–100 归一化);中心主体保护半径 = 画幅短边 × 25%0.3s 渐入峰值 + 持续至当前镜头结束 + 0.1s 渐出中心保护区域内主体形态强制不变形RGB 色散错位2/4 拍踩镲(弱拍);高速运镜中(急推急拉、甩镜)弱拍:红蓝通道各偏移 0.5–1px;高速运镜中:1–2px;高潮全开(13.5s):红蓝 2px + 绿反向 0.5px与镜头同步;弱拍持续单镜全程;运镜中动态跟随;高潮固定直至镜头结束静止特写镜头强制关闭色散单帧白闪爆闪每个鼓点重音;高潮强节点(11s / 13.5s / 16s 额外叠加)普通重拍:1 帧纯白(不透明度 100%);高潮节点:共 3 帧(峰值帧 + 前后各 1 帧 50% 过渡帧)普通:1 帧(约 0.04s@24fps);高潮节点:3 帧(约 0.125s@24fps)帧数与不透明度按本节三档参数表执行暗角压黑全程持续叠加常规段:暗角范围 = 画幅边缘向内 15%,不透明度 60%;高潮 16s 收尾段:范围扩展至 20%,不透明度 85%全程持续;16s 起 0.5s 渐变至收尾强度不透明度按本节三档参数表执行(普通档 45%/65%;狂暴档 80%/100%)运动模糊所有蒙太奇段运动镜头快门角度等效 270°(曝光时间 = 帧时长 × 75%);极速镜头(0.3s 以内)提升至 360°与运动镜头同步;静止锁焦镜头关闭建立段运动模糊强度减半(快门角度等效 180°) -
特效强度档位引用:拼装阶段须读取 Final_Video_Spec.md 中写入的特效强度档位(普通 / 高能 / 狂暴),所有畸变半径、液化强度、RGB 色散偏移量、白闪帧数、明暗频闪幅度、暗角不透明度、手持抖动幅度、跳剪断层位移量、变速倍率区间,均按本节第 5 条三档参数表直接代入执行,不得自行插值或降级。未经用户在节点二确认修改前,默认使用高能档。
-
空间约束:所有运镜、畸变、光效、闪频 100% 同步鼓点联动,零节奏脱节;主体自然贴合场景表面,无悬浮/穿模/错位;画面边缘保持极致锐利,无失真变形。
产品 TVC 模式专属时间线拼装规则(仅 Final_Video_Spec.md 中执行模式 = 产品 TVC 模式时生效):
TVC 模式下,以下规则完全替代 TETO 默认拼装逻辑(第 1–7 节);超分辨率增强规则(按主体类型推荐 4K)保持不变。
-
导入与轨道对齐:加载 BGM 文件(音量 -20dB)作为音频底轨;TVC 模式不依赖节拍时码对齐,Shot 切换点由分镜设计模块规划的自然叙事节奏决定。
-
三段式时间线拼装:
- 全景铺垫段(0%–30% 总时长):导入 1–2 个全景 Shot,1.0 倍速,叠化入场(0.3–0.5s 淡入),展示产品与环境全貌。
- 卖点展示段(30%–80% 总时长):依次导入中景与特写 Shot,每 Shot 末尾执行 叠化转场(0.3–0.5s);绝对禁止硬切;特写镜头停留不低于 1.5s,期间不施加任何特效。
- 收尾段(80%–100% 总时长):导入 1–2 个收尾 Shot,0.3–0.5s 叠化或淡出收场;最后一帧保持清晰静止感,不做速度变化。
-
速度与节奏:全段 1.0 倍速,禁止变速;不插入跳剪、断层位移、手持抖动;相邻 Shot 速度过渡必须平滑。
-
特效应用(TVC 模式严格限制版):
特效项TVC 模式规则转场叠化(0.3–0.5s)或淡入淡出;禁止硬切、跳剪、白闪调色低饱和莫兰迪基调,高光柔化,阴影轻浅;禁止冷青强对比 LUT运动模糊关闭(快门角度等效 ≤ 90°);静止特写完全关闭球面畸变 / 四角液化 / RGB 色散全部禁用白闪 / 明暗频闪 / 暗角压黑全部禁用胶片颗粒可选叠加,透明度 ≤ 3%,仅用于质感强化 -
音画关系:BGM 作为情绪底层全程不间断播放,无需与画面切点同步;若有旁白(narration)轨道,BGM 自动回避至 -6dB(侧链)。
-
锚点锁焦校验(TVC 模式版):相邻 Shot 切换时验证卖点区域屏幕坐标偏差 ≤ 2px;叠化段自动插值过渡,无需额外调整;超出阈值时微调 Shot 起始帧偏移而非重新生成。