商品宣传短片
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
基于上传的产品图片制作商业视频。Nano Banana + Seedance 2.5(分辨率 480p)。在关键阶段暂停以获取用户确认;通过“单镜头流水线”实现人机协作。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
阶段逻辑与依赖关系:
- 编写
Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、语言、模型偏好)→ text_editor。 - 生成故事板(关键元素、镜头列表、音频层)→ storyboard_designer。
- 为所有元素生成图像 → media_generator。
- 为每个镜头生成最终视频;参考该镜头的参考元素(第 3 步)→ media_generator。
- 基于故事板生成所有音频层 → media_generator。
- 资源就绪后进行最终剪辑;然后引导用户导出 → video_assembler。
依赖关系: 2→1;3→2;4→2,3;5→2;6→4,5。
注意 — 用户提供或明确指定了媒体资源(主要影响第 3–6 步): 在生成内容之前,请通过 media_generator 将用户上传的素材绑定并分配到适当的故事板位置;不要重复生成用户已提供的素材。
可选中间步骤(如果路由器需要): 当视频工具受益于锁定的第一帧时,在第 4 步之前为每个镜头生成 一个关键帧;否则,根据产品默认设置,直接执行 元素 → 镜头视频。
何时暂停: 不要一次性运行所有步骤。在上述每个关键阶段(例如:规格确定后、故事板确定后、元素图像生成后、关键帧生成后、镜头视频生成后、音频生成后)停下来,与用户确认,然后再进行下一步。在继续之前,使用卡片或 reply_to_user 邀请用户审阅。
2. 故事板设计
如何设计关键元素
- 始终包含关键主体:产品对象、关键场景(使用环境)和关键道具(如有)。
- 对象: 从用户上传的产品图片中提取,描述必须与该资产匹配;不要与展示内容相矛盾。若用户提供或明确指定了产品素材图,直接将用户上传的素材绑定对应位置;不要重复生成用户已提供的素材。
- 关键场景: 设计至少两个展示产品优势的应用场景(用于后期合成镜头)。将每个场景创建一个单独的元素。
如何设计镜头
- 优先考虑带有内部剪辑的长镜头,每个镜头 5 - 30 秒。在镜头内部进行设计,而不是拆分为许多短镜头;剪辑频率应遵循叙事节奏。任何镜头不得超过 30 秒(当前模型的最大时长限制)。
此工作流程针对 由产品或包装摄影构建的商业广告:例如,运动相机可能将 (A) 产品在场景中 的主角镜头与 (B) 仅展示环境或突出功能 的剪辑片段结合,从而售卖产品所属的 场景 和 方式 — 水下、越野、跳伞、滑板、现场音乐等。
将镜头分为两类:
- 产品在环境中(主角展示) — 产品(来自用户素材/元素)出现在场景 中:动态、清晰地解读 SKU 和使用场景(即您在“关键场景”下设计的相同环境元素)。用于证明实际部署和品牌活力。
- 辅助(功能与氛围) — 强调产品优势而不一定展示设备的镜头:例如,纯环境画面(跳伞降落、演出人群、滑板滑行)来暗示功能;宏观纹理/UI/支架细节;符合简报的生活方式节奏。这些与 (1) 交叉剪辑,使成片不仅是“桌上的包装”。
- 剪辑与节奏: 商业产品广告通常通过 更多的剪辑 和理念之间的 硬切(hard cuts)来获得能量(见规划器)。优先使用 短镜头,且每次剪辑都有 清晰的视觉变化 — 除非简报有要求,否则不要默认使用长镜头。当某个镜头确实需要较长时,您仍然可以在一次生成中使用 内部节奏(时间标记)。
- 配速: 每个镜头表达一个观点;改变 镜头景别(全景 → 中景 → 特写 → 高潮)。典型流程:建立(全景)→ 细节(中景)→ 情绪或纹理(特写)→ 高潮/Logo(受控的全景或包装展示)。
- 分镜头字段:
- 场景: 引用场景/布景元素 ID(例如
[Element_Underwater_Rig],[Element_Trail_Run])。 - 故事内容: 针对 (1):产品 + 主角或主观视角 + 动作。针对 (2):环境动作、抽象运动或细节 — 如果该镜头中 没有产品,请明确说明。
- 镜头语言: 景别、角度、运动;使节奏与广告节奏相匹配。为了营造 张力和高级感,计划在剪辑中 变换镜头语法 — 例如 荷兰角(倾斜角)/ 俯仰角、轻微旋转或转动、推入(推拉/向主体变焦)、拉出/揭示、摇摆或弧形运镜、甩镜头(少用)。在镜头之间 交替使用 这些运镜方式,使剪辑感觉 有驱动力,而不是平淡。每个镜头不要超过 30 秒(当前模型最大时长限制)。
- 场景: 引用场景/布景元素 ID(例如
- 品牌: 注意强制性的包装镜头、Logo 时长 — 组装时必须遵守这些要求。
如何设计独立音频
- 背景音乐: 设计至少一个全局背景音轨。如果视频较长(例如 3 分钟或更长)并且有清晰的段落或转折点,您可以计划多个音乐片段(每个都有自己的
audio_id和范围)。 - 旁白: 如果使用配音或旁白来解释或引导故事,请在此处设计(类型为
narration)。定义声音特征、基调和确切的脚本;使用layout_instruction将其限定在相关的镜头中。
3. 媒体生成
元素资产生成
- 图像: 使用 TextToImage 生成场景,设置视觉基调,锁定产品颜色/材质、特征、调色板等。使用 ImageToImage 获取变体的参考。推荐模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K。
最终镜头视频生成
- 使用 MultiModalToVideo。推荐模型:Seedance 2.5,分辨率 480p。
- 每个镜头的参考输入:元素资产 — 该镜头中出现的所有产品、场景和道具的元素图像。
4. 提示词撰写
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成提示词 (TextToImage, ImageToImage)
所有图像提示词的通用原则
- 提示词不仅是描述“画面里有什么”,更像是一位真正的电影导演和调色师在指导团队。
- 使用通顺的自然语言描述场景内容(主体 + 行为 + 环境等),并使用简短的词组描述视觉美学(风格、颜色、光影、构图)。拒绝文学化的修饰:不要向 AI 解释角色的动机或内心状态(例如“仿佛他不关心这张照片”)。不要描述屏幕外或不可见的元素。只描述物理上可见的内容。
- 对于所有图像提示词(任何角色):您必须在所有目标风格中全局应用“电影级提示词的 6 大核心规则”,以确保电影质感。将提示词写成流畅、自然的英语描述,将这 6 条规则编织在一起。不要将它们输出为带有标签的章节:
- 专业风格术语:结合使用专业艺术或电影术语与风格术语以提高准确性。(例如,引入“作者”和特定的电影视觉锚点,使用
Neo-Noir style, David Fincher Style, inspired by Se7en作为风格锚点,而不是泛泛地说明Neo-Noir风格)。 - 构图与镜头:明确指出电影化构图(例如
Over-the-shoulder shot(肩后镜头)、Dutch angle(荷兰角))和景别(例如Close-up(特写)、Medium shot(中景))。 - 光影:详细说明主光,并强调“负补光”以增加对比度和戏剧感(例如
Strong chiaroscuro contrast(强烈的明暗对比)、dramatic interplay of light and shadow(光影的戏剧性交织)或deep facial shadows emphasizing facial structure(强调面部结构的深面部阴影))。 - 调色:使用高端好莱坞调色手法设定克制的色调(例如
deep teal-cyan shadows dominating 90%, zero warm fill(90% 的深青色阴影,零暖光填充)或muted watercolor wash(柔和的水彩洗色))。除非用户明确要求,否则永远不要使用红蓝霓虹冲突(例如禁止crimson bleed(深红晕染)、霓虹洋红 vs 青色)。将图像限制在 90% 左右的区域内仅使用一种主色调(例如深青色)——极度克制。 - 视觉渲染:描述内容的整体视觉质量和纹理(例如
fine rendering quality(精细渲染质量)、rich and intricate details(丰富错综的细节)、soft-focus effect with subtle Gaussian blur(带轻微高斯模糊的柔焦效果))。 - 氛围与潜台词:描述角色的“潜台词”和微表情,将动作定格在戏剧性的时刻(例如
oppressive suffocation(压抑的窒息感)、no mercy(冷酷无情)、predatory stillness(捕食者的静止))。拒绝生硬、摆拍的样子。对于无生命物体,描述其状态(例如Destined aura(宿命光环)、piercing gaze(锐利的目光)、cold and detached atmosphere(冷漠疏离的氛围))。 - 条件元素(仅在相关时包含):
- 准确的画面内文字:当相关时,如果场景中出现文字(例如屏幕文字),请自然地整合它。您必须用引号包裹需要渲染的确切文本内容以示强调。例如:'A neon sign in the background reads "DANGER".'。
- 专业风格术语:结合使用专业艺术或电影术语与风格术语以提高准确性。(例如,引入“作者”和特定的电影视觉锚点,使用
当目标角色是 key_element(关键元素)时
提供清晰、详细的元素视觉定义,以便在镜头间保持一致。提示词结构应围绕:
- 主体与身份:清楚说明元素是什么 — 角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体型、种族(如果指定)、显著特征、声音)。
- 特征细节:具体描述该元素的关键视觉特征。优先考虑在镜头间必须保持一致的特征:
- 角色:面部特征(眼睛形状、下颌线、发型/颜色)、妆容与造型(如果相关)、服装与配饰(材质、剪裁、颜色、状况)。
- 道具/物体:形状、材质、颜色、尺寸、状况(新/风化/损坏)、独特的标记。
- 氛围/情感基调:描述定义场景的情感潜台词(例如张力、忧郁、希望、宁静、不安、温暖、压迫、恐惧、怀旧、孤立、亲密)。
当目标角色是关键帧(起始帧、结束帧或高亮帧)时
首先,在镜头的 Description 中定位相应时刻:确定确切的节拍 — 开始状态、结束状态或视觉/戏剧性最强的瞬间 — 并以此为基础。如果镜头描述没有清楚地描绘那一刻,请在脑海中模拟该镜头(主体运动 + 摄像机移动 + 环境变化),想象场景在那个瞬间的样子,然后自己填充细节。无论哪种方式,只描述那个瞬间的静态图像 — 可见的内容、构图方式以及所有事物的状态:
- 起始帧: 展示动作开始前的场景 — 主体在运动前的姿态和意图(重心偏移、注视方向、肢体预加载)、环境的基础状态,以及摄像机的初始构图和角度。
- 结束帧: 展示动作完成后的直接结果 — 主体的终结姿势或最终表情、环境变化后的状态,以及摄像机准备下一次剪辑的最终位置。
- 高亮帧: 确定镜头中视觉或情感冲击力最强的那一刻(例如,撞击的顶峰、揭示真相落入角色脸上的那一刻、结晶镜头主题的构图)。定格并以最大程度的细节描述那一帧 — 姿势、表情、光照状态、摄像机构图 — 这样它就可以作为该镜头中最具感染力的静止画面独立存在。
视频生成提示词
对于每个角色,流程存储 两张 图像(头部 + 全身)。在 视频 提示词中,为每张参考图标记每个角色,以便 Seedance 能正确读取面部和造型。使用产品图片标签(<<<image_1>>>, <<<image_2>>> 等)。
模板:Subject 1 — facial features reference <<<image_1>>> (head shot); hair, makeup, and costume reference <<<image_2>>> (full-body shot). 对于 Subject 2,继续编号(<<<image_3>>> 头部,<<<image_4>>> 全身等)。
然后按照以下 Seedance 顺序(摄像机 → 主体 → 空间 → 音频)追加运动/动态提示词:
- 在编写提示词时遵循此顺序:
- 摄像机 — 运动或镜头/剪辑变化(例如
static → push-in(从静止到推入)、cut to new angle(切到新角度)、orbit(环绕)、pan(摇镜头))。 - 主体 — 动作和表情(谁做了什么,面部动作节拍)。
- 空间 — 位置或环境变化(相对于空间的主体或摄像机位置;背景运动;深度/布局转换)。
- 音频 — 对话(如有)、音效,以及如果模型中没有音乐时的备注(见下文)。
动作细节
- 相关时,基于 特定的身体部位:手、腿、头、肩膀等。
- 添加 程度:幅度、速度、强度(例如 slowly raises one hand(缓慢举起一只手),snaps head left(头迅速向左转),pushes hard off the ground(用力蹬地))。
- 对于一个提示词中的多个节拍,列出 主要动作,然后是次要动作(按故事的时间顺序)。
多节拍与“镜头 1 / 镜头 2”(官方指南) - 当工具接受长提示词时,您可以在单次生成中标记 镜头 1, 镜头 2, 镜头 3 用于 摄像机或故事节拍 的序列。
- 精确的时钟计时(例如“0–3 秒”、“3–6 秒”)无法可靠执行 — 不要强制按确切秒数范围分割提示词,也不要编写明确的逐秒计划(例如“在 2 秒时...”,“从 5-8 秒...”)。描述 按顺序发生的事情,而不是按时间安排的镜头列表。
可选润色(当简报是电影级真人拍摄时): 您可以根据其他策略规则添加轻微的手持微抖动或微妙的胶片颗粒感 — 保持其从属于上述四层顺序。
特殊角色约定(针对 Seedance 2.5(分辨率 480p))
Seedance 接受自然语言提示词;这些包装符有助于模型区分 音乐、音效、对话 和 屏幕标题文字: - 音乐(描述正在播放的内容):
(...),例如 (fast-paced rock playing in the background)(背景中播放着快节奏摇滚乐)。 - 音效:
<...>,例如 <distant dog barking>(远处的狗叫声)。 - 口头对话:
{...},例如 {Hello, world} — 如果台词 不 是项目原始语言(例如英语短片中的日语独白),请在花括号前 标注语言,例如 Says in Japanese:{こんにちは}。 - 屏幕标题/章节/字幕文字:
【...】,例如 【Chapter One: Departure】(第一章:启程)。
- 摄像机 — 运动或镜头/剪辑变化(例如
注意: 您必须始终在提示词中包含以下负面约束,以确保后期制作的输出干净:
- 如果分镜脚本表明该镜头有单独的旁白音轨,请不要在视频提示词中写入旁白文本,以避免音频冲突。
- 为防止模型添加不需要的背景音乐,您几乎应该始终包含 'no music'。
- 字幕是在后期剪辑时添加的,因此您必须始终包含 'no subtitles'。