Creative brand logo applications
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
用户上传品牌Logo后,自动生成6张超写实Logo场景应用图,并可将每张图制作为3-5秒动态视频。使用GPT Image 2生成图像,Kling 3.0 Omni生成视频,默认竖屏9:16。适用于品牌Logo创意展示、社交媒体营销素材等场景。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
整体流程与依赖:
- 分析Logo — 用户上传品牌Logo后,调用 resource_prepare_and_analyze 提取Logo的形状、颜色、文字、风格等关键视觉特征,输出结构化描述供后续步骤使用。
- 建立全局规格 — 通过 text_editor 建立 Final_Video_Spec.md,锁定比例(默认9:16)、分辨率、创意风格方向(超写实)、输出数量(6张)等全局参数。若用户指定自定义比例,需校验该比例在图像模型(GPT Image 2 支持 3:4 / 4:3 / 16:9 / 9:16)和视频模型(Kling 3.0 Omni 支持 16:9 / 9:16 / 1:1)中均受支持;两者交集仅为 9:16 和 16:9,不兼容时提示用户并回退到 9:16。
- 设计创意方案 — 调用 storyboard_designer,为6个场景分别设计:创意概念(以创意合成大师身份,基于Logo创作天马行空的超写实视觉效果,不局限于平面融合,可具有更强空间感和视觉冲击力的多维度呈现;创意方向也不局限于户外场景,可涵盖人文、动物、生物等多种领域,如纹身师在客户手臂上纹着Logo图形等人文场景)、超写实视觉描述、视频动态逻辑(基于图片内容的运动方案)、以及自然环境音效设计。不预设固定创意模板——每次生成的6个场景创意方向应根据Logo特征自由发散,确保不同用户获得各不相同的结果,避免重复套路。纹身、沙地凹印、墙面涂鸦/喷漆、蚂蚁排列等方向可作为创意参考灵感使用,但不得固化为每次必出或固定组合的模板。每个场景标注建议视频时长(3-5秒,由Agent根据画面复杂度判断)。
- 批量生成图片 — 调用 media_generator,使用 ImageToImage + GPT Image 2,以用户上传的Logo作为 reference_image,逐张生成6张超写实场景图。分辨率推荐 2K。将每张图片注册为 asset_id 并绑定到对应 Storyboard 场景。
- 批量生成视频 — 调用 media_generator,使用 MultiModalToVideo + Kling 3.0 Omni,以每张生成的场景图作为 image reference,配合动态逻辑提示词生成3-5秒视频。分辨率推荐 720p。
- 最终汇编(可选)— 调用 video_assembler,将6段视频按节奏拼接为完整作品。
依赖: 2→1; 3→1,2; 4→2,3; 5→4; 6→5。
暂停检查点: 在步骤3(创意方案完成)和步骤4(图片全部生成完成)后暂停,向用户展示结果并确认后再继续下一步。
2. 멀티모달 분석
Logo分析要点:
- 提取Logo的核心形状/图形轮廓、主色调与配色方案、文字内容(如有)、字体风格、整体视觉风格(简约/复古/科技感等)。
- 输出结构化描述,重点标注哪些视觉特征在场景融合中需要被精确还原(如特定曲线、标志性配色、文字字形)。
- 配色信息仅用于确保场景生成中Logo图形的识别性还原,不作为创意场景设计的关联依据——创意方向不应受限于Logo本身的色彩,而应以创意合成大师的视角自由发散。
- 分析结果将作为 ImageToImage 生成时 reference_image 的引用依据,确保6张场景图中Logo图形的形态与原Logo高度一致。
3. 스토리보드 설계
场景设计(6张):
- 每个场景包含以下结构化字段:
- 创意概念: 以创意合成大师的身份,基于Logo图形创作天马行空的超写实视觉效果。不固化创意模板——每次创作必须根据Logo的形状、行业属性等特征自由发散,6张场景的创意方向彼此不同且不重复。每个场景应是一个具体的、有叙事感的现实情境——不是抽象的视觉概念,而是有具体物件、具体环境、甚至具体人物动作的真实场景(如纹身师在客户手臂上纹着Logo图形、以Logo为原型的大型建筑矗立在城市中、复古汽车上立着Logo金属车标、抓娃娃机里Logo形状的毛绒抱枕被机械爪夹起、海上集装箱印着巨大Logo图案旁站着一只海鸥等)。Logo在场景中应转化为某种具体的物理形态(如纹身墨迹、建筑结构、金属车标、毛绒织物、集装箱印花等),而非作为独立图层叠加。创意方向不局限于户外场景,可涵盖人文、动物、生物、产品、建筑等多种领域。纹身、沙地凹印、墙面涂鸦/喷漆、蚂蚁排列等方向可作为参考灵感,但每次只选取其中部分或在此基础上延展新方向,不得固定为每次必出的6张组合,杜绝套路化、范式化。
- 视觉描述: 用简洁的自然语言描述画面中正在发生什么、有哪些具体物件——真实的场景叙事本身就能带来超写实感,不需要堆砌材质和光影术语。画面须符合现实逻辑且效果精美——场景整洁、审美在线,避免肮脏、破败、杂乱无序的视觉基调;即使涉及粗粝材质(如沙地、水泥墙等),也应以高级感和精致感呈现,而非下沉为脏乱差。
- Logo与场景的融合: Logo应作为场景中一个自然存在的物理实体出现——它是纹身上的墨迹、是建筑的结构形态、是车头的金属标、是毛绒玩具的形状、是集装箱上的印刷图案。当Logo转化为场景中的具体物理形态时,它与场景的材质、光影、空间关系会自然绑定,无需额外强调"融合"或堆砌材质互动描述。避免Logo"浮在"场景表面的生硬感——关键在于让Logo成为场景叙事的一部分,而非外加的图层。
- 画面丰富度: 通过具体的场景物件和环境细节自然营造画面层次感——如纹身师荧光绿的手套、集装箱旁的海鸥、建筑周围的树林和公路、娃娃机下方的各式毛绒玩具等。这些与场景叙事相关的具体物件比抽象的"前景/中景/背景层次"指令更有效。6张场景之间在题材、视觉氛围、色调上应有明显差异,避免画面效果雷同呆板。
- Logo占比与构图: Logo是画面的核心主体,必须醒目突出,不得过小。但不要让6张场景的Logo呈现千篇一律——Logo的视觉占比可灵活变化,部分场景略大(约1/3甚至更大),部分场景略小但仍清晰可辨。Logo图形尽量保持正面构图,不要有太大倾斜或翻转,确保品牌识别性;6张之间的差异主要通过题材、场景、色调、大小占比来体现,而非通过Logo角度倾斜变化。创意场景元素服务于Logo呈现,不能喧宾夺主。
- 视频动态逻辑: 基于该场景图片的内容信息,设计自然的动态呈现。动态应源自画面本身的物理逻辑,避免与画面内容矛盾的强行运动。
- 自然音效设计: 为每个场景设计与画面内容匹配的自然环境音效(如物体碰撞声、摩擦声、自然环境声等),音效应源自画面中实际发生的物理动作,让视频具有沉浸式真实感。
- 建议时长: 3-5秒,由Agent根据动态复杂度判断——简单微妙运动选3秒,需要展现过程感的运动选4-5秒。
Logo边缘处理: Logo边缘不需要保持完美平整——在不同场景中,Logo图形的边缘可以根据实际材质和物理环境出现不规则变化(如颜料晕染、沙粒塌陷、表面磨损、自然贴合曲面等),这些变化是超写实融合的一部分,是允许的。但整体形状和配色仍需可识别为原Logo。
比例一致性: 所有场景使用 Final_Video_Spec.md 中锁定的统一比例。
4. 미디어 생성
图片生成:
- 使用 ImageToImage + GPT Image 2。
- reference_image: 用户上传的Logo图片,通过 image_ids 传入。
- aspect_ratio: 默认 "9:16";GPT Image 2 仅支持 "3:4"、"4:3"、"16:9"、"9:16"。
- resolution: 推荐 "2K"。
- 每张图片以Logo的视觉特征为引用核心,prompt 指定从参考图中提取Logo图形/配色并融入超写实场景。
- 生成后注册 asset_id 并绑定到 Storyboard 对应场景。
视频生成: - 使用 MultiModalToVideo + Kling 3.0 Omni。
- image reference: 将对应场景的生成图片通过 image_infos 传入,让视频基于图片内容生成动态。
- aspect_ratio: 默认 "9:16"(Kling 3.0 Omni 仅支持 "16:9"、"9:16"、"1:1",需与图片比例保持一致)。
- duration: 3-5秒(整数;Kling 3.0 Omni 支持 3-15秒)。
- resolution: 推荐 "720p"。
- 注意: Kling 3.0 Omni 不支持 audio_infos 参数,视频音频由模型根据提示词自动生成;不支持外部音频引用输入。
5. 프롬프트 작성
图片提示词(ImageToImage / GPT Image 2):
- 像说话一样写提示词。 一条提示词就是一句话——像跟朋友描述一张照片那样写:"画面里有什么、正在发生什么、Logo以什么形态出现在哪里"。不要列参数、不要堆术语、不要分点。模型听得懂人话,自然句子比精心编排的美术指令效果好得多。
- 以下是验证过的好提示词,照着这个感觉写:
- "一个手穿荧光绿橡胶一次性手套的纹身师正用纹身工具在客户的手臂上纹这个图案,近景景别。"
- "俯瞰视角,以图案为原型的大型建筑在中央,周边有树林、公路和汽车。"
- "一辆立着图案金属车标的白色复古汽车,正俯视角,近景车头,倾斜构图。"
- "抓娃娃机玻璃柜,纯白背景,一只机械爪夹着图案形状的蓝色毛绒抱枕悬浮半空中,下方是各式各样的毛绒玩具,正面视角,近景。"
- "蔚蓝色的海上漂浮着一个巨大的白色集装箱,集装箱上印着一个很大的图案,在集装箱右边还站着一只海鸥,居中构图。"
- 好提示词的共同点: 一句话说清一个具体场景;Logo已经变成了场景里的某个东西(墨迹、建筑、车标、毛绒玩具、集装箱印花),不需要再解释"怎么融合";画面里有真实的物件和细节让场景可信;末尾顺手带上视角和构图(如"近景景别""俯瞰视角""居中构图")。
- 不要写成这样: "Hyper-realistic cinematic composition, dramatic volumetric lighting, shallow depth of field, the logo is seamlessly integrated into the textured surface with natural material interaction..."——这种堆砌抽象美术术语的写法效果很差,改成人话。
- 指定从 reference_image(<<<image_1>>>)中提取Logo的形状轮廓和配色,确保Logo可识别。但创意不受Logo色彩限制——以创意合成大师身份自由发散,人文、动物、生物、产品、建筑等方向都可以。
- 画面要好看: 符合现实逻辑,精致高级,不要脏乱破败;即使粗粝材质也保持整洁审美。避免卡通化、扁平化、插画风格。
- 6张要有变化: Logo大小可灵活变化——有的Logo大(约占画面1/3或更多),有的略小但仍清晰。但Logo图形尽量保持正面构图,不要有太大倾斜或翻转,确保品牌识别性。6张之间的差异靠题材、场景、色调来体现,不要靠Logo角度倾斜来凑变化。
- Logo边缘可以不完美: 颜料晕染、沙粒塌陷、表面磨损、贴合曲面变形——这些材质带来的不规则边缘是自然的,允许。但整体形状和配色仍须认得出是原Logo。
视频提示词(MultiModalToVideo / Kling 3.0 Omni): - 将生成的场景图绑定为 <<<image_1>>>。
- 动态描述基于图片内容的物理逻辑:描述主体应如何自然运动,而非凭空添加画面中不存在的大幅运动。
- 运动幅度适中,保持超写实基调——微妙的自然动态优于剧烈变化。
- 每条视频提示词必须包含自然环境音效描述: 根据画面中实际发生的物理动作编写匹配的音效提示(如物体碰撞、摩擦、自然环境声等),让Kling自动生成与画面内容同步的真实音效。音效必须源自画面可见的物理动作,不得添加画面中不存在的声音。
- 提示词总长不超过2000字符(含 <<<image_1>>> 标签)。
6. 동영상 조립
汇编规则:
- 将6段视频按创意节奏排列,可选择按场景视觉强度递进或对比交替排列。
- 转场以简洁硬切或极短叠化为主,保持超写实场景的质感不被过度特效干扰。
- 如用户需要完整展示视频,可添加简单的片头/片尾标识(可选)。