Digital presenter product promotion
Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.
为产品创建逼真的数字人宣传视频。使用 Nano Banana + Omni Human1.5。在关键阶段暂停以供用户确认;采用人机协作的一键式流程。
Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.
Complete workflow
1. Planning
完整视频的阶段逻辑与依赖关系:
- 编写
Final_Video_Spec.md(标题、类型、比例、时长、视觉风格、模型偏好)→ text_editor。
默认推荐参数:- 类型:数字人广告与产品视频
- 比例:9:16
- 视觉风格:写实摄影,干净的灯光,智能手机前置摄像头拍摄风格
- 模型偏好:Nano Banana + Omnihuman 1.5
- 语言:取决于(优先级从高到低)角色画像、用户需求、用户输入语言。
- 生成故事板(关键元素、镜头列表、音频层)→ storyboard_designer。
- 为所有元素生成图像 → media_generator。
- 生成一个关键帧 → media_generator
- 生成配音和背景音乐:脚本(基于用户上传的文本脚本或产品优势)、声音标识、语调和时间轴位置必须与计划的入点/出点相匹配 → media_generator
- 按镜头生成最终视频;该镜头引用关键帧(步骤 4)和音频(步骤 5) → media_generator。
- 所有资源准备就绪后进行最终合成;然后引导用户导出 → video_assembler
依赖关系: 2→1; 3→2; 4→2; 5→2; 6→4,5。
何时暂停: 不要一次性执行所有步骤。在上述每个关键阶段(例如:规格确定后、故事板完成后、元素生成后、镜头视频生成后、音频生成后)停下来,与用户确认,然后再继续。在继续之前,使用卡片或 reply_to_user 邀请用户进行审阅。
2. Storyboard design
如何设计关键元素
- 务必包含关键主体(人物、物体等)、关键位置/场景和关键道具(如有)。
- 人物:
数字人 (digital avatar)- 使用
TextToImage根据规格(年龄、性别、服装和与用户简报一致的语调)创建全新的数字人。 - 如果用户上传了肖像或全身参考图 → 使用 Nano Banana(或同等的各种多模态图像模型)进行细化/风格统一:保留可识别的面部特征和整体氛围,并输出一张干净、适合电商使用的参考静图。
- 使用
- 物体:
产品资产 (product assets)- 首先要求用户上传产品图片(包装、单品 SKU、抠图或场景内照片)。
- 如果未上传任何内容:从类别简报中随机生成一个合理的产品(保持外观、颜色、包装风格一致),并明确告知用户这仅供演示使用,稍后可替换为真实照片。
- 关键位置/场景: 从角色+产品中,选择一个固定的场景(视频中不更改位置),例如:
居家(日常、生活方式)、健身房(日常、充满活力)、安静的书店(正式、知识型)、办公室(正式、商务)。仅使用一个主场景;配音应侧重于使用场景/卖点,且不得因文案修改而更改背景。 - 用户提供的资产: 如果用户提供了参考媒体并将其指定为关键元素,则描述必须与该资产相符;不要与所展示或听到的内容相矛盾。
如何设计镜头
- 镜头数量: 完全由配音 (VO) 分段或 15 秒(根据 model_knowledge)限制决定。不要为了叙事节奏或镜头规模变化而增加镜头。但是,如果音频过长需要分镜头,务必优先考虑句子的完整性。不要直接按时间切分;而应在完整句子结束后切分。
- 视觉一致性: 全片保持一个场景、一种构图、一张关键帧图像(相同的 asset_id);不要编写诸如“切换到中景/切换到特写/改变角度”这样的故事板台词——禁止使用多机位设置。
- 取景: 中近景 (MCU) 或特写;主体占据画面主导地位;除非简报明确要求展示服装和全身产品关系,否则避免使用全身镜头。
- 外观: 写实摄影;智能手机/拍照手机外观(自然光或室内光,轻微的手持稳定感,自然的肤色,没有厚重的“美颜滤镜”网红脸)。
如何设计独立音频
- 背景音乐: 设计至少一个全局背景音轨。
- 旁白: 始终在故事板中定义旁白/配音层(类型为
narration):声音标识、语调、确切脚本,以及针对相关镜头的layout_instruction。
3. Media generation
元素图像生成
- 使用 TextToImage。对于原始角色/演示产品的生成,使用 ImageToImage 来细化用户上传的图像。
- 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
关键帧图像生成(每个镜头)
- 使用 ImageToImage。推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。单一合成:角色 + 产品 + 场景;灯光、构图以及产品的拿取方式在整个视频中保持不变;全片使用一个 asset_id,并在每个镜头中重复使用。
最终镜头视频生成
使用 ImageToVideoByAudio。推荐模型:OmniHuman1.5,分辨率 1080p。引用关键帧 + 对齐的音频片段。
4. Prompt writing
优先级最高、适用于所有prompt编写情况:当用户使用中文输入或是加载中文语言环境时,提示词prompt需要用中文书写。但是prompt中有关旁白/对话的内容要严格遵循Final_Video_Spec中的Output Language。
图像生成提示词 (TextToImage, ImageToImage)
所有图像提示词的一般原则
提示词不仅仅是描述“画面里有什么”,更像是一位真正的电影导演和调色师在给团队下达指令。
使用连贯的自然语言来描述场景内容(主体 + 行为 + 环境等),并使用短语来描述视觉美学(风格、颜色、灯光、构图)。拒绝文学修辞: 不要向 AI 解释角色的动机或内心状态(例如“好像他并不关心这张照片”)。不要描述画面外或不可见的元素。只描述物理上可见的内容。
当目标角色是 key_element 时
提供清晰、详细的元素视觉定义,以确保其在不同镜头中保持一致。围绕以下结构构建提示词:
- 主体与身份: 明确说明该元素是什么——角色、道具、场景或生物。对于角色,包括定义的身份特征(年龄、体格、种族(如果指定)、显著特征、声音)。
- 特征细节: 详细描述元素的关键视觉特征。优先考虑必须在不同镜头中保持一致的特征:
- 角色: 面部特征(眼睛形状、下颌线、发型/发色)、妆容和造型(如果相关)、服装和配饰(材质、合身度、颜色、状况)。
- 道具/物体: 形状、材质、颜色、尺寸、状况(全新/风化/损坏)、显著标记。
当目标角色是关键帧时
- 镜头取景: 取景说话主体,使其在静图中清晰可见——偏好使用中近景或胸像,画面中脸部占比大且清晰。避免使用广角建立镜头和脸部太小以至于模型无法与音频对齐的全身镜头。
- 产品可见性: 产品在关键帧中必须保持清晰可读——不能太小或在画面中丢失。偏好让主角拿着或佩戴产品(视情况而定),使其与脸部共同占据前景注意力;避免极小比例、严重遮挡或杂乱的背景,这会导致标签、形状或关键细节难以辨认。如果构图会导致产品过小,则收紧构图或让手/产品更靠近,以便脸部和 SKU 都清晰可见。
- 镜头语法: 交替使用双人镜头、越肩镜头 (OTS) 和单人镜头,在不破坏连续性的前提下增加变化。
视频生成提示词
对于基于关键帧参考的视频生成,提示词的主要目的是描述**“变化”和“动态”**。重点在于让场景生动起来,而不是重新描述参考图中已经存在的静态细节。高质量的视频提示词必须描述场景在以下维度上的动态演变:
- 基本提示词结构: 提示词 = 主体 + 动作,背景 + 动作,摄像机 + 动作等。使用简单、直接的措辞和短句结构;模型会根据你的描述及其对图像的理解进行扩展。
- 当在后期添加背景音乐时,在模型提示词中包含
no music(或同等指令),以免生成的片段与最终混音冲突;如果工具支持文本对齐,则包含确切的台词或对音频片段的意译。
对于 ImageToVideoByAudio
当使用音频驱动(口型同步/表演)模型时,提示词必须遵循上述维度,同时还必须遵守以下独特结构:
- 你必须明确描述由音频驱动的角色状态(例如:说话、唱歌、边说边哭、说唱)。
- 最佳实践模板: 摄像机运动 + 说话者的情绪 + 说话状态 + 特定的身体动作 +(可选)背景事件。
- 表现力: 偏好清晰发音的提示(“有节奏的语速”、“友好的解说者”)而非诗意的修辞。
示例: 镜头跟随一名男子转身面向镜头并向前走,同时以一种沉醉、深情的表情唱歌。他先是用双手触碰衣领,然后双臂张开,向后仰头,显得完全沉浸其中。背景中的光影随着节奏律动。
5. Video assembly
- 使用旁白 (VO) 时间轴作为定时的唯一事实来源;按顺序拼接每个镜头的视频。
- 将生成的片段上的任何额外音频轨道静音,以免旁白 (VO) 重复。
- 不要更改播放速度,也不需要对任何资产或视频轨道进行音频淡出处理。