Methodology training and course video
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
专门用于将个人的专业方法论、业务 SOP 或知识框架,转化为极具专业感和视觉逻辑的课程、演讲、或产品发布培训视频。使用 GPT Image 2 生成图片
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
方法论培训视频全流程逻辑与控制链:
- 确立全局规范:利用 text_editor 初始化 Final_Video_Spec.md,锁定视频全局属性(画面比例 16:9 宽屏、视觉风格与色彩基调、推荐配音语速与性别、全局背景色)。视觉风格默认采用科技极简风与科技蓝;若用户指定,支持设定为商务墨绿、科技黑或温暖米色调,并在 Final_Video_Spec.md 中明确锁定。
- 多模态文献解析:使用 resource_prepare_and_analyze 对用户上传的方法论、培训大纲或 SOP 纯文本文档进行解析。提炼其核心逻辑链(如:拆流程、建专家、串团队、注方法等核心阶段)。
- 编写教学故事板(Storyboard):调用 storyboard_designer。将解析后的方法论步骤,设计成结构严谨的宣讲幻灯片(Slide)式故事板,定义关键视觉元素(如:各专家角色卡片、流程拓扑示意图)和有序的分镜头脚本。
- 历史/外部资产对齐:若用户有已经上传的品牌 Logo、特定片头或指定背景音乐(BGM),通过 media_generator 的资产注册功能,优先绑定至对应故事板槽位中,避免不必要的重新生成。
- 视觉资产分步生成:
- 课件展示/概念逻辑图:调用 media_generator 的 TextToImage。
- 动态转场/操作展示:调用 media_generator 的 MultiModalToVideo 或 FirstFrameToVideo。
- 音频旁白及背景音乐生成:
- 全局专业配音:根据故事板中的 verbatim 旁白台词,调用 media_generator 的语音生成工具。
- 商务背景音乐:基于设计的氛围基调生成。
- 音画精确对齐与剪辑:调用 video_assembler。根据生成的旁白语音实际时长,动态伸缩画面留存时长,确保幻灯片内容切换与主讲配音节拍精准重合。
关键控制点(里程碑停顿说明):
- 第1次停顿(Spec锁定):在 Final_Video_Spec.md 创建后,必须暂停并呈递给用户确认视觉基调(如配色、配音风格),不可直接批量生成。
- 第2次停顿(故事板确认):在故事板大纲及各页面配音词设计完成后暂停,请用户对宣讲台词和课件布局逻辑进行微调,保障内容准确。
2. マルチモーダル分析
复杂文档与脑图深度提炼规范:
- 输入解析适配 (Input Parsing & Adaptation):
- 多级 SOP/高密企业规范深度解构 (Densely Structured SOP Deconstruction):
- 多层级条款解构 (Tiered Clause Extraction):面对极其复杂的嵌套编号(如 “1.1.2.3.a 条款”),resource_prepare_and_analyze 须通过剥离冗长法条、保留核心操作的方式,抽取出 “主干动作 (Action) -> 准入条件 (Criteria) -> 例外分支 (Exception)” 的三层精简结构。
- 跨引用追溯合并 (Cross-Reference Slicing):对于文档内部“参见 X 章节”、“详见 Y 流程”的远端跳链,解析时须自动进行上下文追溯与合并切片,将远端异常规则或辅助定义融入当前主操作流的 bullet points 或口播旁白 (Story beats) 中,杜绝信息孤岛。
- 例外异常分支提取 (Exception Branch Extraction):提取出 “If-Then-Else” 异常拦截判定,凡遇到“禁止”、“触发红牌惩罚”、“立刻中止”等强合规判定,必须单独提炼并强标定为“合规红线与警示警告”专用镜头。
- 脑图/拓扑图分级解析与网状从属映射策略 (Mind Maps/Topology Diagrams Hierarchical & Mesh-Network Parsing Strategy):若用户上传复杂脑图、逻辑架构图、系统拓扑或包含交叉指向的网状图表,系统须执行以下高精度解析规范:
- 树状/网状层级解构 (Node Hierarchy Deconstruction):
- L0 核心节点(中心主题):识别为整套课程方法论的最高统领,锁定为全局 Spec 的总标题与视觉概念方向。
- L1 一级分支(主干分支):识别为课程的主体篇章结构(Chapters),若一级分支数量 > 5 个,须自动合并同类项,归并为 3-4 个核心阶段,以匹配故事板的结构。
- L2 二级分支(核心论点/流程节点):识别为具体的教学分镜(对应 Storyboard 中的单张 Slide 镜头/Shot 单元)。
- L3 三级分支(具体要点/执行子项):降维映射为分镜幻灯片内部的 bullet points 核心文字或特定专家角色 (element character) 的具体职责描述。
- L4 及更深嵌套(深层叶子/细节子项):严禁直接堆叠在同一张 Slide 上。当检测到层级 $\ge$ 4 级时,解析器须执行**“深度拆分与局部下钻机制 (Detail Drill-down)”**,将深层分支剥离,在后续镜头中独立设计一个局部的下钻放大版课件(如“左右经典分割 6:4 流程图表”,其中左侧专门展示该子树的拓扑细节,右侧进行详解),确保单张幻灯片绝不信息过载。
- 网状交叉关联与多父节点解构 (Mesh-Network Cross-Dependency Resolution):
- 公共交叉节点判定:若网状拓扑中某一节点拥有多个父节点指向(即多条流程汇聚的交叉枢纽),严禁复制生成多份。系统须将其定义为一个独立的共享 key_element(如共享系统、中台专家),并在多个 shots 描述中引用同一 element ID,确保视觉上角色的唯一性。
- 双向与反馈环路识别 (Feedback Loops):高精度识别带有双向箭头或闭环指向的网状流程(如 PDCA 循环、双向校验流)。解析系统必须将其提炼为“闭环流程图表版式”,在故事板中明确标定节点激活顺序,并在旁白中采用“循环迭代/持续反馈”的承接词语(如 “接着回到起点开始第二轮...”),通过音画联动完美重组闭环逻辑。
- 物理与逻辑关系识别 (Flow & Parallelism Recognition):
- 父子从属判定:根据逻辑分支发散方向、外包围框线或导向箭头,严格区分“包含与被包含”的上下级从属关系。父节点的内容通常作为幻灯片的“页面标题/概念 Banner”,子节点作为具体的支撑内容。
- 兄弟并列判定:同一层级的并列分支,需提取并归纳为同一张幻灯片中的并列卡片(如“上下经典分割 3:7 概念公式”下方的并列卡件),或设计成时序相邻的连续分镜,确保视觉上的并列平权。
- 树状/网状层级解构 (Node Hierarchy Deconstruction):
- 多级 SOP/高密企业规范深度解构 (Densely Structured SOP Deconstruction):
- 深度提炼的四大核心维度 (Four-Dimensional Extraction):
- 实体、角色与协作机制 (Roles & Collaboration):提取出哪些具体专家角色、系统节点或责任部门,梳理其输入/输出关系、信息交接规则以及专家协作流程。
- 时序、步骤与逻辑分支 (Steps & Decision Trees):提取严格的时序先后依赖关系。对分支判断(如:若审核通过,进入 Step A;若驳回,退回修改)或异常流处理,进行“If-Then-Else”条件式重构,使之呈现为直观、递进的流程步骤。
- 核心定理、黄金公式与行业模型 (Formulas, Axioms & Industry Models):
- 多维智能捕捉 (Intelligent Detection):自动扫描并精准识别学术/商业经典模型(如 SWOT 态势分析、MECE 分类法则、GROW 辅导模型、AARRR 漏斗)、硬核数学/业务公式(如 LTV、CAC、ROI、PDCA 循环)及特定行业定理(如帕累托法则、认知偏差定律、企业特有交付力公式)。
- 硬核金句萃取 (Golden Quote Extraction):敏锐提取文档中具有强烈断言性、定义性、或极具启发感的结论性陈述(如:“一人公司的核心本质是杠杆式交付”、“信息不对称是溢价的终极来源”),作为教学视频画龙点睛的“核心金句”。
- 规范化高亮标记 (Highlight Tagging for Storyboard):对捕捉到的公式、模型或金句,在输出的结构化大纲中强制使用特定高亮标识(如 【黄金公式:LTV = ARPU * 寿命】、【方法论金句:[内容]】),以便后续故事板和提示词工具能立即识别,并对应生成“上下经典分割(3:7 比例)- 概念提炼与公式课件”或“Banner 高亮”样式。
- 因果/推导逻辑结构化 (Derivation Structuring):将复杂的计算模型或多维度框架解构成“输入变量、交互逻辑、输出结果”的递进表述,将其转化为分步解析文字,防止直接丢出无背景解释的孤立公式,提升课件的可读性与说服力。
- 关键绩效指标与合规审查点 (KPIs & Compliance Checkpoints):针对企业内部规范,敏锐捕捉 SOP 中规定的数字量化指标(如:响应时长 < 15min)、合规红线及红牌警示点,确保这些高危要点在视频中得到强化呈现。
- 大纲输出与故事板无缝对接 (Structuring for Storyboard):
- 章节化切分:将提炼出的核心工作流或大纲,按照“导论(Intro)- 阶段核心逻辑(1-3个主要篇章)- 尾声总结(Outro)”拆分为清晰的结构模块。
- 排版模版匹配建议:自动建议每一章或核心步骤匹配哪个幻灯片版式(如:多专家协作建议采用“左右经典分割 3:7 专家卡片”,公式公式建议采用“上下经典分割 3:7 概念公式”,流程展示建议采用“左右经典分割 6:4 流程图表”),将解析结论直接转化为高可读性的幻灯片制作说明书,确保故事板设计阶段有据可依。
3. 絵コンテ設計
设计逻辑课件视觉元素 (key_element):
- 专家角色卡片 (element character):将方法论中的核心人设(如“卡尼曼决策顾问”)进行高精度视觉构图规范设计:
- 卡片画幅与内边距:采用经典的 3:4 纵向卡片或 1:1 正方形卡片比例。卡片内部肖像头像四周须保留 15% 的均匀安全 Padding(内边距),确保视觉饱满且决不贴边。
- 主体景别与构图:统一设定为正面胸像或 3/4 侧面视角(Chest-up portrait)。肖像双眼视线水平高度须精确对齐卡片框体的水平中轴线,人物头像主体占卡片总高度的 60%-70%,头顶须预留约 10% 的呼吸留白(Headroom)。
- 背景与层级:卡片背景采用纯净底色(契合全局色调),并辅以极微弱的柔和扁平投影(Minimalist flat shadow),与主幻灯片底色拉开干净的层叠级,严禁使用复杂的 3D 浮雕或杂乱渐变。
- 拓扑逻辑图示 (element scene):将方法论中的时序流水线及分支依赖关系(如 Step 1 → Step 2)定义为规范场景元素:
- 网格化构图与对齐:图示整体须居中偏中下构图,采用网格(Grid-based)水平或垂直流向对称布局。核心逻辑节点(Nodes)在活跃画布中横向跨度须占画布宽度的 70%-80%,四周必须严格预留 10% 的画面外安全边距(Margins)。
- 几何节点与正交连线:节点统一采用规整的扁平化几何体(如圆角矩形或正圆形卡片)。节点间距必须完全等宽等距。节点之间的逻辑连接线必须采用水平/垂直正交折线(Orthogonal connectors)或直线,严格避免无规则的斜交交叉线。
- 色调锁定与高亮继承:拓扑节点背景及连线颜色须精准继承 Final_Video_Spec.md 中锁定的全局主色调(极简科技蓝/商务墨绿/科技黑/温暖米色调)。正在进行的步骤节点可采用对应方案的高亮色聚焦,其余非活动节点置灰或弱化,呈现出清晰的运行层级。
- 严禁过度修饰:杜绝与主题无关的喧宾夺主元素,所有视觉设计必须符合“课程课件 / 商务汇报”的克制与专业属性。
设计课程镜头 (shot):
- 长分镜设计:每个镜头(Slide 页面)通常匹配一个核心论点或操作,长度建议控制在 8s-30s 之间。通过丰富的文字及图形动态来维持视觉吸引力。
- 镜头核心信息必须包含:
- 画风与排版描述 (Scene):必须指定经典的版面排版比例(严格采用以下五大布局模版之一,以维持学术与汇报课件的严谨整洁感,实现合规要点的高亮唤醒,并规范操作演示的交互动效):
- 左右经典分割(4:6 或 3:7 比例):
- 专家肖像卡片课件:左侧 30%-40% 区域绘制专家角色卡片 (element character) 或头像;右侧 60%-70% 区域撰写其具体的职责、任务、或执行 SOP 的核心 bullet points。
- 数据/流程拓扑课件:左侧 60%-70% 区域绘制拓扑逻辑图示 (element scene) 或流程逻辑框架;右侧 30%-40% 区域提供步骤的核心论点和解析文字。
- 上下经典分割(3:7 比例):
- 概念提炼与公式课件:上方 30% 放置黄金定律或计算公式金句作为核心 Banner;下方 70% 区域并列展示 2-3 列概念拆解图卡。
- 合规红线与警告警示课件(高反差警示板式):
- 红线警告课件:当承载 SOP 中涉及“合规红线”、“红牌警示点”或“异常拦截流”等关键警示或合规要素时,必须调用该专用警示模板。
- 警示结构:采用高对比度的分栏或通栏卡片设计。例如,“左侧/上方 25%-30% 区域”作为高亮警示带,渲染极简且极其醒目的警告标识(如 "WARNING / CRITICAL" 或 "合规红线" 警示图标);“右侧/下方 70%-75% 区域”使用高反差底色承载具体违规场景与处罚红牌。
- 警示配色高亮:背景底色应调整为与主色系呼应的高反差深色或警示色(例如在科技黑中采用高反差荧光黄/警告红线条,或在科技蓝/温暖米色中使用大面积深灰作为衬面,并点缀醒目的红/橙警示色块),用强烈的色差对比实现“视觉打断”和“高亮唤醒”,杜绝使用无区分的平淡普通底色。
- 系统操作与软件交互演示课件(Screencast / Interactive Mockup Layout):
- 交互板式:用于展示业务操作流程、后台系统运行、或模拟软件交互界面。采用 16:9 全屏展示精细且整洁的系统模拟界面 (mockup),或者采用左右 7:3 比例(左侧 70% 展示应用界面或系统逻辑框图,右侧 30% 呈现垂直的操作步骤卡片与交互指令说明)。
- 动态标定:该模板下必须在 Storyboard 中明确标定光标移动轨迹与动作触发源(如“光标自左下角平滑移至中心‘确认启动’按钮并点击,触发高亮与水波纹”),为后续视频动画生成提供精准的编排蓝本。
- 色调精准继承绑定:系统操作界面 (mockup UI) 的功能模块划分、背景色调、功能组件、主交互按纽及高亮聚焦框,必须精准继承 Final_Video_Spec.md 中锁定的全局色调(科技蓝/商务墨绿/科技黑/温暖米色调等),严禁使用未经全局色系锁定的原生高亮色或系统自带纯白底色,以维持专业严谨的视觉整体性。
- 安全边距与对齐:四周必须预留 10% 的空白安全边距(Margins),文字与图表元素严格采用左对齐或居中对齐,严禁任何内容贴边。其视觉风格与色调(科技蓝/商务墨绿/科技黑/温暖米色调,以及合规警示配色)必须与 Final_Video_Spec.md 保持高度一致。
- 左右经典分割(4:6 或 3:7 比例):
- 讲义旁白与字数控制 (Story beats):书写精准、饱含逻辑、富有说服力的口播台词。所有配音词必须是以 [旁白]、[讲师语音] 等角色标定的 verbatim 台词。为保障观众认知带宽并防范信息过载,必须严格控制旁白字数与镜头时长的配比,并对语气情感进行深度定制:
- 语速基准与字数上限:中文推荐播报语速为 每秒 3 至 4.2 个字(不含标点)。每个常规教学分镜(8s-30s)的旁白字数必须控制在 25 字至 60 字 之间。
- 匹配公式与视觉留白:遵循 旁白字数 ≤ 镜头预设时长 (s) × 4 的安全上限。设计台词时,字数计算需为分镜头尾部预留至少 1.0 至 1.5 秒的纯视觉停留时间,确保观众在配音结束后有足够的时间去阅读和理解幻灯片上的图表与文字内容,严禁台词过密导致声画堆叠挤压。
- 合规警示旁白调性(字数极简):对于合规红线与警告页面,讲义旁白语气必须切换为严肃、权威、警醒(例如 “【请注意】以下行为将直接触发红牌拦截...”),字数进一步精简至 20-40 字以内。遵循 旁白字数 ≤ 时长 × 3 的更严苛上限,为结尾预留 1.5秒 至 2.0秒 的充足视觉静止阅读时间,配合高亮画面,达到警示效果。
- 情感与语调差异化标注 (Voice Tone & Emotional Coding):针对不同页面内容属性,在 Storyboard 旁白标定中明确标注语调情感指令,建立起落有致的授课听觉张力:
- 常规页面:标注 [讲师语音 - 理性客观]。要求语调平稳自然,娓娓道来,建立严谨专业的教学基调。
- 黄金金句与定理公式:标注 [讲师语音 - 睿智深沉] 或 [讲师语音 - 激情感召]。在宣讲金句或公式定理时,音调微升以凸显分量,字词发音咬实并伴随适当顿挫,营造“画龙点睛、启发心智”的宣讲力。
- 合规红线与警示警告:标注 [讲师语音 - 严肃权威]。音调低沉沉稳,突出警告感,重音落在“严禁”、“禁止”、“红线动作”上,以冰冷严厉的权威语气建立不可侵犯的合规感。
- 镜头动向 (Cinematography):推荐使用静止锁定镜头(Lock-off)以保护图表可读性。若采用极其缓慢的推焦(Slow Push-in)以凝聚注意力,必须对起始焦距与聚焦重点进行精准规范(起始画面比例设定为 1.0x 宽屏无初始形变,最大画面放大比严格限制在 1.05x-1.1x 之间以凝聚视觉,且聚焦重点必须锁定在核心逻辑图示、关键课件卡片或专家肖像面部/眼部中心,防止向空白边缘偏移导致画面严重发虚或边缘畸变),严禁剧烈的镜头抖动或无逻辑的转弯。
- 画风与排版描述 (Scene):必须指定经典的版面排版比例(严格采用以下五大布局模版之一,以维持学术与汇报课件的严谨整洁感,实现合规要点的高亮唤醒,并规范操作演示的交互动效):
设计课程片头与片尾镜头 (Intro & Outro Shots):
- 课程片头 (Intro Slide):设计一个 3-5 秒的独立片头镜头,展示课程主标题、副标题或品牌 Logo,画风与主色系高度一致。背景音乐或独立音效需单独标注。
- 版权页/片尾 (Outro Slide):设计一个 3-5 秒的闭幕镜头,展示版权声明、致谢(如 “感谢观看”)或品牌 Logo。该镜头需明确标注“过渡至黑场(Fade to Black)”的视觉动向。
设计全局音频轨 (audio_layer):
- 背景音乐轨 (BGM):设计一条全局舒缓的、有沉浸感、专注于思考的商务科技风 BGM,避免有人声哼唱或节奏过于激烈的鼓点。
- 配音旁白轨 (Narration):独立管理,音轨描述中明确设定 narration_speaker_profile(例如:[严谨深沉的资深商业顾问,语速适中,带有理性与说服力])。
4. 素材生成
视觉画面生成策略:
-
底图/逻辑幻灯片生成:
- 核心推荐工具为 TextToImage。
- 首选模型:使用 GPT Image 2,并指定 2K 分辨率。该模型具有优秀的文字渲染能力、布局把控能力以及对复杂图表的生成质量。
- 对于同一方法论中需要反复出现的人物形象,调用 ImageToImage(配合 GPT Image 2)进行参考图特征提取,保证身份前后高度一致。
-
动态图表或操作演示生成:
- 若需要箭头流动、角色微动等动态视频,推荐使用 MultiModalToVideo 路径。
- 首选模型:使用 Seedance 2.5(默认分辨率设定为 480p,会员可选择 480p)。
- 备选工具:在非会员状态下,因无法使用会员专属的 Seedance 2.5模型,或者当 MultiModalToVideo 路径彻底不可用时,若通过其他手段启动(如首帧静图驱动),可使用 FirstFrameToVideo 路径(首选 Google Veo3.1 Fast 模型,分辨率设定为 720p)。
-
视频分辨率、时长限制与会员权益对齐:
- 会员专属模型:高级视频生成模型 Seedance 2.5(分辨率 480p) 与 Seedance 2.5(分辨率 480p)(包括 MultiModalToVideo 和 TextToVideo 路径下的应用)仅限会员使用,非会员不可调用。
- 分辨率限制:极清 480p 分辨率属于会员专属权益。非会员在进行视频生成时,最高只能选择 480p 分辨率。
- 时长控制约束:
- Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p)(MultiModalToVideo 路径):时长必须设定在 4s 至 30s 之间的整数秒。
- Google Veo3.1 Fast(FirstFrameToVideo 路径):时长必须严格限定为 4s、6s 或 8s 之一。
- 派发决策中置:在规划(Planner)与调度阶段,即使感知到用户非会员,也绝不能主动拒绝用户明确指明的模型或分辨率参数请求,应一律派发,将最终的权限拦截与降级降解选择交付给下游执行模块。
-
多路径容错与模型回退策略:
- 未指定路径时的多模态优先原则:当用户提供了参考图像/资产(如 keyframe 或 reference_image)且要求生成视频,但未指定具体生成工具路径时,若 MultiModalToVideo、ImagesToVideo、FirstFrameToVideo、VideoInterp 均可适配,必须优先调度 MultiModalToVideo,以获得最佳的运动连贯性和声画质感。
- 工具内模型优先回退:若正在执行的某个生成工具中的首选模型失败,必须优先切换至该工具内的其他备用模型进行容错。例如在 MultiModalToVideo 路径下,若 Seedance 2.5(分辨率 480p) 失败,应优先降级使用同一工具内的 Seedance 2.5(分辨率 480p)。
- 严格杜绝跨工具强行代换:若一个生成工具内的所有模型全部失败,严禁自动且无感知地调用另一个不同的工具路径来强行容错恢复(例如:不能在 MultiModalToVideo 下所有模型失败后,静默切换到 FirstFrameToVideo 甚至 TextToVideo)。一律视作任务生成失败,中止流程并向用户详细报错,提示用户并在页面交互中由用户自主选择是否尝试更换其他工具链。
配音与音乐生成策略:
- 配音:调用语音合成。推荐模型为 MiniMax Speech 2.8 HD,该模型在中文长句、多音字以及商务演讲情感语调的饱满度上表现最佳。
- 差异化语调与情感调校规范 (Differentiated Intonation & Emotion Modulation):生成旁白时,系统必须根据故事板划分的页面类型,动态向语音合成模型传递或合成对应的情感参数与音调约束:
- 常规页面/操作演示:采用 理性专业/标准宣讲 情感。参数设置:音高(Pitch)设为默认居中,语速(Speed)设为标准 1.0x。声线稳重、呼吸均匀。
- 黄金公式/方法论金句:采用 慷慨激昂/感召/深沉睿智 情感。情感强度(Emotion Intensity)提升 20%-30%,读到金句部分时,语速(Speed)微调慢至 0.85x - 0.9x,增强吐字的颗粒感与分量感,突出逻辑重音,拉开与前后常规旁白的听觉反差。
- 合规红线与警告页面:采用 严肃权威/冷峻警示 情感。情感强度调至庄重肃穆,音高(Pitch)降低 10%-15% 以增加压迫感与说服力,语速(Speed)限制在 0.8x - 0.85x,使咬字极其清晰、字字千钧。
- 差异化语调与情感调校规范 (Differentiated Intonation & Emotion Modulation):生成旁白时,系统必须根据故事板划分的页面类型,动态向语音合成模型传递或合成对应的情感参数与音调约束:
- 配音长难句断句与标点停顿控制规范 (Voice Phrasing and Pause Controls):
- 短停顿(逗号/顿号 , 、):语音合成中在标点处自动触发 250ms - 350ms 的微弱气息停顿,实现长难句的自然换气与逻辑切割。
- 中停顿(分号/冒号 ; :):自动触发 500ms - 600ms 的中度停顿,用于并列或并排逻辑分句间的承上启下。
- 长停顿(句号/感叹号/问号 。 ! ?):在完整句尾触发 800ms - 1000ms 的完整语句休止停顿,留给观众认知吸收上一句论点的时间。
- 段落与逻辑大转折(如故事板中标识的双斜杠 // 或省略号 ……):触发 1200ms - 1500ms 的深度逻辑休止,建立强烈的版块切换仪式感与呼吸感。
5. プロンプト作成
图像生成 Prompt 撰写规则 (TextToImage / ImageToImage - GPT Image 2):
- 画面描述结构:采用专业视觉总监和 PPT 排版师的口径。格式统一为:[排版布局比例说明] + [核心逻辑图示/专家肖像主体] + [背景环境及色彩调性] + [渲染材质与灯光约束] + [精确文字内容]。
- 排版比例 Prompt 转化细则:根据故事板设定的布局类型,将经典排版比例精准翻译为英文 Prompt 指令(GPT Image 2 适用):
- 左右 4:6/3:7 专家卡片:使用 "split-screen layout: left 30% or 40% area features a clean vertical expert avatar profile card, right 60% or 70% area consists of neat organized text paragraphs and bullet points, professional presentation slide template..."
- 左右 6:4 流程图表:使用 "asymmetric slide layout: left 60% or 70% displays a highly structured logical flowchart diagram, right 30% or 40% displays vertical text explanation column..."
- 上下 3:7 概念公式:使用 "top-down layout: the top 30% area holds a clean horizontal title banner with an elegant dividing line, the bottom 70% area exhibits 3 columns of structured text cards..."
- 高亮警示/红线模板:使用 "high-contrast alert layout: the top or left side features a prominent minimalist warning sign or 'WARNING/CRITICAL' badge with a striking color block, while the right or bottom side presents structured bullet points in high-contrast text layout on a dark background..."
- 四周安全边距:在 Prompt 首尾中显式强调 "generous 10% outer padding and margin around the frame, neat alignment, no elements touching the edges, ample breathing space and professional editorial layout..."
- 排版比例 Prompt 转化细则:根据故事板设定的布局类型,将经典排版比例精准翻译为英文 Prompt 指令(GPT Image 2 适用):
- 文字精确渲染:用英文双引号包裹具体要呈递在画面上的中/英文主题词(例如:a professional diagram showing "AI Workforce Pipeline" flowchart),要求使用加粗无衬线字体(bold sans-serif font),并置于版面黄金分割点。
- 专家肖像与表情神态一致性 (Expert Portrait & Expression Consistency):在设计专家角色卡片 (element character) 肖像时,制定高精度提示词锁定人设特征与职业神态,防止面部或风格在不同课件中走形:
- 景别与构图:统一采用正面胸像或 3/4 侧面(chest-up portrait or three-quarter profile view),视线平视看向镜头(direct gaze, looking into the camera),以维持极简商务插画或写实肖像的一致性。
- 表情神态(克制与自信):表情须设定为中性、睿智、略带职业微笑(calm expression, professional subtle smile, intelligent and confident look),严禁张口大笑、皱眉或任何具有戏剧性夸张的面部神态。
- 外观细节属性锁定:明确描述发型、服饰(如经典黑灰商务西服或极简高领毛衣 "classic grey business suit or minimalist dark turtleneck")和固定配饰,并在 Prompt 中锁定其英文关键词。
- 图生图特征继承 (ImageToImage):在对同一专家角色进行多画面适配或更新时,配合 ImageToImage 并强制以基础肖像图 <<<image_1>>> 为参考。英文 Prompt 中须显式包含锁定指令:"maintain consistent face identity, facial structure, hair style, and business attire as shown in <<<image_1>>>", "identical professional demeanor, zero facial expression drift".
- 色彩与材质约束:紧密贴合 Final_Video_Spec.md 定义的主色系与视觉风格撰写 Prompt,并规范系统操作界面 (mockup UI) 的配色自动继承映射:
- 科技蓝(默认):高纯度、低饱和度的科技蓝、冷灰色或纯白背景,呈现科技极简感。系统操作界面 (mockup UI) 须使用 "clean slate blue backgrounds, with vibrant cyan highlights on action buttons & key interactive panels"。
- 商务墨绿:使用深沉克制的暗绿色、石墨灰,或米白底色搭配墨绿装饰边框与线条。系统操作界面 (mockup UI) 须使用 "elegant graphite grey backgrounds, with sophisticated forest green border accents & active control buttons"。
- 科技黑:深邃的纯黑或暗灰色背景,辅以极简的白色、蓝色或青色高亮发光线条。系统操作界面 (mockup UI) 须使用 "deep obsidian black backgrounds, with glowing electric blue highlight borders & neon indicator panels"。
- 温暖米色调:温馨的浅米色、麦芽黄底色,辅以深褐、炭黑色的文字与逻辑框线。系统操作界面 (mockup UI) 须使用 "warm cream-colored canvases, with charcoal grey menu frames & soft walnut brown interactive elements"。
- 通用要求:杜绝廉价感 3D 光晕,不掺杂无意义的背景虚化或高饱和霓虹撞色。
- 底图背景、纹理与阴影约束 (Slide Background, Texture, and Shadow Constraints):对课件底图的背景细节进行微观规范,确保干净清透的学术与商务汇报感:
- 微弱网格线条 (Subtle Gridlines):支持在背景上设计极轻量、半透明的工程网格或导向虚线,以烘托逻辑严谨性,但绝不能干扰前景文本阅读。英文 Prompt 推荐词:"very faint semi-transparent background grid lines, ultra-thin light grey technical grid pattern, clean background guide lines".
- 极简扁平阴影 (Minimalist Flat Shadows):卡片及元素间采用极其微弱、柔和的扁平投影来建立视觉层级,杜绝任何厚重的 3D 浮雕、发光或强渐变。英文 Prompt 推荐词:"flat design aesthetic, extremely subtle soft drop shadows behind cards, minimalist flat shadows for clean layer separation, no heavy 3D bevels".
- 大面积纯净留白 (Ample Negative Space & Clean Canvas):背景主体必须维持极高比例的单色留白,彻底过滤掉高饱和度的发光气泡、渐变光斑、斜角色条等廉价纹理,保持画面绝对空灵透气,为主体内容提供充分的视觉呼吸空间。英文 Prompt 推荐词:"abundant negative space, ultra-clean solid color background, minimalist empty spaces for breathing room, zero visual noise or clutter".
视频生成 Prompt 撰写规则 (MultiModalToVideo / Seedance 2.5-class):
- 动作与镜头语言及超精细推焦控制 (Slow Push-in & Sharpness Protection):必须基于配图 <<<image_1>>> 描述运动趋势。基本镜头结合极缓慢微调的慢推镜头(Slow push-in)。
- 推焦起始焦距与聚焦控制:提示词中明确锁定起始焦距画面比为 1.0x(无初始画面形变),推焦结束时的最大画面放大比严格控制在 1.05x 至 1.1x 之间。聚焦重点必须精准指向主讲人像或核心数据卡片的中央,禁止偏离中心轴。
- 细节清晰度锁定(防模糊词):为了防止镜头推焦移动中由于模型自带的插值恢复抖动导致幻灯片文字、细线条图表边缘发虚,必须在提示词中显式强化图像边缘与文本的清晰材质属性。推荐加入控制词:"perfectly sharp and detailed textures, clean high-definition visual elements, zero motion blur, crystal clear chart labels and text lines during the subtle camera movement, maximum legibility"。
- 严禁任何剧烈镜头抖动(shake / camera wobble)或大幅度拉焦。
- 图表与操作演示动画演绎(高阶控制细则):
- 流动箭头与能量流特效控制:精准控制连接线和箭头的动态。必须明确描述流速、发光强度、拖尾长度及流动路径,保证能量流体贴合网格线,禁止发生溢出或扭曲。推荐英文描述词:
- 匀速脉冲流动:"luminous pulsing light traveling smoothly at a constant elegant speed along the connector arrows from left to right"
- 粒子环流/彗星拖尾:"a sleek glowing particle stream with a subtle comet-tail effect flowing in a continuous, seamless loop along the logical paths of <<<image_1>>>"
- 弱光穿梭导引:"soft, low-intensity light beams running steadily along the architectural lines, showing clear directionality without visual clutter"
- 节点激活、呼吸发光与边框脉冲控制:控制图表节点(矩形框/卡片)的状态切换与聚焦。必须约束动态幅度和色彩,严禁因发光引起节点内部文本抖动或变形。推荐英文描述词:
- 顺序亮起激活:"the logical blocks and step nodes illuminate sequentially in the workflow order, establishing a clear logical progression"
- 节奏呼吸发光:"the active node pulses with a gentle, rhythmic breathing glow at a slow frequency, the luminosity waxing and waning smoothly"
- 边框柔和晕染:"the border of the selected block highlights with a soft neon halo, scaling up extremely subtly by 1.02x to focus attention, while the internal text remains perfectly sharp, static, and legible"
- 状态强对比弱化:"inactive nodes remain slightly dimmed or desaturated, creating a strong visual hierarchy with the breathing active node"
- 系统操作与鼠标点击交互演绎:精细定义光标轨迹、鼠标点击与界面聚焦等交互特征,使操作展示逼真且丝滑。
- 光标移动与悬停:推荐英文描述词:"a minimalist white cursor arrow gliding smoothly across the UI to hover on the target button", "the cursor moves naturally to highlight the action panel"。
- 点击与水波纹动效:推荐英文描述词:"a gentle circular ripple animation expanding outward from the cursor tip to indicate a click action", "the cursor hovers and triggers a clean click feedback animation on <<<image_1>>>"。
- 区域与板块高亮:推荐英文描述词:"the selected interface panel scales slightly and is highlighted by a glowing border line in harmony with the theme color", "a soft lighting overlay gently illuminates the focus menu while other UI areas dim slightly", "the target workflow card highlights smoothly with an elegant border pulse"。
- 画风与 UI 稳定性锁定(文字及界面防崩坏):为防止视频生成时,模拟点击引发整个应用界面、图表结构、菜单选项或文字发生扭曲崩坏,必须在提示词末尾强制加入绝对静态锁定约束。必须包含:"all text labels, fonts, numbers, and core web/app UI structures of <<<image_1>>> remain completely static, crisp, and clean, only the cursor movement and highlight effect show animation, no visual distortion, no shape shifting, no layout flickering, maximum legibility"。
- 流动箭头与能量流特效控制:精准控制连接线和箭头的动态。必须明确描述流速、发光强度、拖尾长度及流动路径,保证能量流体贴合网格线,禁止发生溢出或扭曲。推荐英文描述词:
- 负向提示规避:对于单独配置了旁白轨道(VO)的镜头,在视频提示词中必须写明 no narration in video 和 no music 以避免伴音重叠,并在末尾附加 no subtitles 以便后期统一加字幕。
6. 動画編集
音画剪辑与总成标准:
-
精准踩点与音画对齐:
- 每个幻灯片镜头的持续时长必须由对应的旁白语音(Narration)实际音频长度动态决定。
- 对齐公式:镜头画面展示时长 = 旁白实际音频时长 + 500 毫秒(0.5秒)的尾部静音留白,确保画面切换在声音完全收尾后发生,避免截断感。
- 标点停顿无损保留约束:在音画剪辑总成时,剪辑系统必须原样、完整保留由标点符号(逗号、分号、句号、省略号等)触发的语音自动停顿和换气空白。严禁剪辑算法为盲目缩短时长而截断、压缩、或采用强行拼缝算法去除这些静音区间,确保视频成品的演讲节奏错落有致,保留自然的呼吸感与说服力。
- 图表动画与配音时间切分的微观踩点规则 (Micro-Timing Alignment Rules):
- 分步图表时序映射 (Timeline Segmentation for Diagrams):当幻灯片包含多步骤工作流或网状拓扑节点时,剪辑系统须将单个 shot 内部的图表动画子事件(如节点激活、箭头流动)分解。每个子动画的触发时刻必须与对应的口播旁白(Narration)中提及该步骤/词汇的起始音频电平段精准对齐。
- 视觉触发提前量 (Acoustic Lead-in & Offset):所有视觉变化(如逻辑节点变色高亮、能量流箭头启动)的触发指令,其在时间轴上的绝对位置应设定在旁白念出对应关键词前的 100毫秒 至 200毫秒 (100ms - 200ms),利用“画先动、声强化”的视听感知规律,防止因视觉反射滞后而产生的视听脱节感;落后旁白发音的时间差严禁超过 100毫秒。
- 状态维持与平滑退场 (State Retention & Blend Out):某个流程步骤处于高亮激活或动画演绎中时,其高亮和动画状态必须在配音读完本句或整个并列分句的完整周期内持续维持,并在切换至下一节点时执行 300毫秒 至 500毫秒 (300ms - 500ms) 的平滑溶解过渡,严禁在词句未完时视觉动画戛然而止。
- 操作演示鼠标点击微观精准对齐 (Mockup Click Synchronization):对于系统操作与交互演示课件,鼠标光标(Cursor)在画面上的平滑滑行运动,必须在配音提到具体操作指令(如 “点击保存”)的前 200毫秒 至 300毫秒 (200ms - 300ms) 结束并悬停于目标按钮上;鼠标点击触发的水波纹及按钮高亮动画必须在配音念出动词(“点击”、“确认”等)的绝对声能波形起始点处触发;点击后的界面状态切换或弹窗响应,须在点击后的 100毫秒 (100ms) 内平滑完成响应,达成高拟真的交互实时感。
-
多通道混音、响度均衡与自动化规整标准:
- 全局响度标准化目标 (Target Loudness Normalization):
- 视频最终总输出音频的整体集成响度必须严格控制在 -14 LUFS (或 -14 LKFS),这是流媒体与线上课程的最佳响度体验值。
- 最大真峰值 (Max True Peak) 必须严格限制在 -1.5 dBTP 以内,彻底预防在不同播放终端上发生数字削波失真 (Clipping)。
- 配音旁白轨 (Narration) 动态规整与美化:
- 音量基准锁定为 0 dB,作为主响度骨架。
- 动态压缩 (Compression):应用温和的动态压限。设定阈值 (Threshold) 约在 -18 dB 至 -22 dB,压缩比 (Ratio) 设定为 2.5:1 至 3:1,启动时间 (Attack) 设为 10ms-15ms,释放时间 (Release) 设为 100ms,使主讲配音的音量曲线更加平稳,消除由不同片段声能涨缩带来的忽大忽小感。
- 低频切除 (Low Cut / High Pass Filter):对旁白轨应用 100 Hz 以下的陡峭切除(18dB/Octave),彻底过滤喷麦声、唇齿风噪及低频环境共振,保障人声清晰度。
- 背景音乐轨 (BGM) 响度平衡与闪避避让 (Audio Ducking):
- 无旁白状态基准音量:片头、片尾或章节空隙时,BGM 正常响度平衡电平设定在 -12 dB 至 -15 dB 之间,维持思考氛围。
- 闪避压缩比例 (Ducking Depth):当旁白配音响起时,BGM 音量必须自动向下压低 12 dB 至 15 dB(即实际背景音乐瞬间降至 -24 dB 至 -30 dB 的弱听视状态),确保主讲人声清晰可辨。
- 时序响应控制:
- 快速压低 (Attack Time):在旁白句首触发前 200 毫秒 (200ms) 内快速降低 BGM 音量,防止背景音遮挡台词首字。
- 缓慢释放 (Release Time):在旁白句尾结束后的 1000 毫秒 (1000ms) 内缓慢平滑地恢复至 BGM 基准音量,防止音量突变带来令人不适的“抽吸感”。
- 频段协同避让与EQ空间雕刻 (Frequency Carving & EQ Sidechain):
- 低频避让:BGM 轨必须强制应用 80 Hz 以下的低频切除 (Low Cut),防止背景音乐的低音与旁白产生混浊重鸣。
- 中频人声避让 (Vocal Range Dip):当旁白配音与 BGM 同时播放时,BGM 在人声核心能量区间(1 kHz 至 3 kHz)必须应用一个 -3 dB 至 -4 dB、宽 Q 值的温和陷波衰减(EQ 侧链避让),从而腾出频段空间,让人声具备更强透射力和极高可懂度。
- 全局响度标准化目标 (Target Loudness Normalization):
-
极简专业转场与毫秒数精准规范:
- 转场类型限制:为了维持学术与商业课件的专业严谨质感,严禁使用任何花哨的 3D 旋转、缩放、擦除或几何形状转场。仅允许使用叠化溶解 (Dissolve) 或 淡入淡出 (Fade In/Out) 转场。
- 分级转场时长设定 (Transition Hierarchy in Milliseconds):
- 标准镜头与镜头切换 (Shot-to-Shot Transition):设定为精确的 400 毫秒 (400ms),采用轻量叠化溶解 (Dissolve),使两个课件画面/逻辑分镜之间过渡平滑无断裂感。
- 常规幻灯片页面大切换 (Slide-to-Slide Transition):设定为精确的 600 毫秒 (600ms),采用平滑的叠化溶解 (Dissolve),给观众眼睛充分的视觉适应期。
- 章节与章节大过渡 (Chapter-to-Chapter Transition):设定为精确的 1000 毫秒 (1000ms)。采用“淡出至黑场 (Fade to Black) 随后淡入 (Fade In)”的黑场断点式转场,其中纯黑场留存时长锁定为精确的 200 毫秒 (200ms),建立强烈的版块切换仪式感。
- 片头至第一页正文过渡 (Intro-to-Content Transition):设定为精确的 800 毫秒 (800ms),采用平滑淡入淡出或叠化溶解,实现视觉平稳过渡。
- 尾部正文至版权片尾过渡 (Content-to-Outro Transition):设定为精确的 1200 毫秒 (1200ms),配合画面向黑场淡出 (Fade Out to Black),将情绪优雅收尾。
-
片头与片尾音画总成规范:
- 片头独立 BGM/音效淡入:片头镜头开始时,其独立的片头背景音乐(或片头音效)必须执行 1000 毫秒 (1000ms) 的平滑淡入,音量设定在 -6 dB 至 -10 dB 以确保开场充满活力与专业感。随着片头结束并过渡至第一页课件,该背景音乐须在 1000 毫秒 (1000ms) 内平滑淡出,或自然转场至课程全局 BGM。
- 版权页黑场与音效/BGM淡出:视频最后一帧(版权页/片尾)结束时,画面必须执行向黑场淡出(Fade Out to Black),淡出动画时长设定为 1500 毫秒 (1500ms)。与此同时,所有音频通道(包括版权页背景音乐、收尾音效等)必须执行线性或指数级淡出,淡出时长设定为 2000 毫秒 (2000ms),实现音画同步归零、彻底静音。
-
字幕与文本排版标准:
- 背景安全框 (Subtitle Safety Box):视频下方字幕必须配置半透明的胶囊型或条状背景安全框(黑色或深灰,不透明度设定为 40% 至 50%,并设置适度 Padding 留白),以确保在多变的逻辑图表或亮色幻灯片底图上,文本依然具备极高可读性。安全框下边缘需与画面底边保持 5% 至 8% 的安全距离。
- 字体比例 (Font Proportion):在 16:9(如 1080p)常规视频规格下,字幕字体的高度应严谨控制在视频高度的 3.5% 至 4.2% 之间(约 38px 至 45px 像素高)。整体视觉需精致克制、严禁字号过大遮挡课件主干内容。
- 双语对齐规则 (Bilingual Alignment):
- 纵向叠放与样式分层:采用上下重叠的双语版式,中文(主字幕)居上,采用较粗的经典无衬线体(如思源黑体/微软雅黑);英文(副译文)居下,采用常规体(如 Arial/Helvetica),英文字号比例严格设定为中文字号的 70% 至 80%,两行文字之间保留字体大小 15% 的精细行距。
- 智能分行与对齐:中文单行上限锁定为 20 个字,英文单词数上限锁定为 12 至 15 词。超过上限时自动执行智能折行,折行后的多行文本必须严格保持水平均中对齐,杜绝单个字/字母孤立成行或英文单词断字切裂。锦上添花地,字幕渲染位置需水平均中。