yeha.ai
返回模板库

爱马仕丝巾画风格

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

适用于生成具有奢侈品创意广告片(TVC)质感的爱马仕风格插画短视频:精细线稿、富有叙事感的场景构图、暖色调加宝石色点缀;每个场景固定全景建立镜头与跟随运镜的局部近景,仅使用与画面同步的音效。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

工作流阶段与顺序:

  1. 与用户确认视频的整体主题与故事场景(例如:中式庭院茶道、欧式宫廷宴会、巴黎公寓日常等),写入 Final_Video_Spec.md(含宽高比、成片时长预估、画面风格定义、语言)→ text_editor
  2. 设计分镜表:明确所有 key_element(主要人物、动物、场景),以及每个场景的双分镜结构(全景加近景跟随);默认每条 final_shot 成片约 3 秒,只有动作不能在 3 秒内自然完成时才延长至 4–5 秒 → storyboard_designer
  3. 生成所有 key_element 元素图(人物、动物、场景)→ media_generator
  4. 按分镜逐组生成视频(每组两条:全景 shot 加近景跟随 shot),引用对应元素图像;生成时为剪辑预留足够素材,成片时长由后续组接控制 → media_generator
  5. 仅当分镜明确标注音效时,生成与画面动作和环境精确同步的 final_audio;不生成 BGM、旁白或对白 → media_generator
  6. 剪辑合成,按全景到近景的节奏交替排列,将常规镜头修剪为约 3 秒,并精确对齐音效 → video_assembler
    依赖关系: 2→1;3→2;4→3;5→2;6→3、4、5。
    暂停节点: 完成 Final_Video_Spec.md 后、Storyboard 完成后、元素图生成后,各暂停一次请用户确认,再继续下一阶段。
2. 多模态分析

参考图分析重点(用于风格提取):

  • 提取插画的线条风格:线稿密度、勾线粗细、填色方式(平涂或渐变)、装饰性纹样密度。
  • 提取色彩体系:主色调(米色、象牙白、金棕)、点缀色(宝石蓝、翠绿、玫红、金黄)、色彩对比度与饱和度区间。
  • 提取场景叙事结构:主体(人或动物)的姿态与所处环境的空间层次关系(前景细节、中景主体、远景建筑或自然)。
  • 提取动物与人物的造型特征:服饰风格(历史时期、文化背景)、动物品种与姿态语言。
  • 输出结构化风格描述,供 storyboard_designer 和 write_media_prompt 使用。
3. 故事板设计

视觉风格定义(全局):

  • 线条风格(Ligne Claire):采用细而均匀、粗细一致的黑色勾边,类似比利时漫画"清爽线条"(Ligne Claire)而非可粗可细的中国工笔描线;建筑用硬直线,人物与花木用有机曲线,所有轮廓清晰封闭,无毛边或水墨晕染。
  • 色彩体系(冷暖宝石双色系):以象牙白、石灰白或沙色为底色;重点色采用冷暖并重的宝石色系——暖调(赭金、朱红、酒红、橙红)与冷调(皇室蓝、普鲁士蓝、翡翠绿、深紫)共存,整体色调沉稳高级,饱和度适中,避免单纯暖金色为主的偏差。
  • 填色方式(高密度装饰填充):主体采用平涂色块,在织物、地毯、挂毯、建筑彩绘等复杂表面必须填充高密度图案纹样(几何纹、卷草纹、花鸟纹等),每寸画面均有可读的装饰信息;仅在需要轻微体积感时辅以极细密的点描或颗粒感,不使用渐变或强烈明暗。
  • 叙事密度:每张画面应如一幅完整丝巾——充满文化符号、历史器物与自然意象的引用,画面信息量极高,经得起局部放大和反复观察;构图层次为前景装饰植物/器物 → 中景主体人物或动物 → 远景建筑或风景。
  • 光感质感:光线柔和均匀,无强烈投影与高光反光;整体呈现如高档丝绸或哑光印刷品般光滑洁净的视觉质感。
  • 整体气质:奢侈品 TVC 的精致与克制,每帧画面都应具有"可被丝网印刷在真丝之上"的平面装饰艺术感,避免写实渲染、日常随拍感或杂乱信息。
    key_element 设计规范:
  • element character / element animal:明确人物服饰(朝代或文化风格)、发型、配色;动物品种、毛色、姿态特征;需与参考图风格一致。
  • element scene:标注场景的空间层次——前景标志性装饰物、中景核心活动区域、远景背景建筑或自然景观;描述光线方向与时间氛围。
    双分镜结构(每个场景固定两条 shot):
    每个叙事场景必须包含以下两条 shot,顺序固定。两条 final_shot 默认各约 3 秒;仅当动作需完整呈现、在 3 秒内会显得仓促或被截断时,才将该条延长为 4–5 秒。
  1. Shot A — 全景建立镜头
  • 构图:宽景展示完整场景空间层次(前景、中景、远景均可见);主体人物或动物处于中景,比例适中。
  • 运镜:缓慢横移或轻微推进,配合场景纵深;3 秒内只完成一个清晰、克制的镜头运动。
  • 成片时长:默认约 3 秒;只有建立空间或关键动作确有必要时延长至 4–5 秒。
  1. Shot B — 局部近景跟随镜头
  • 构图:聚焦人物上半身或动物,突出正在进行的动作细节(如倒茶、举杯、翻书、栖停等)。
  • 运镜:跟随运镜贴近主体,轻微手持感或弧形环绕;镜头跟随动作方向移动。
  • 成片时长:默认约 3 秒;只有动作的起势、核心过程与收势必须连续保留时延长至 4–5 秒。
  • 必须明确写出主体正在做的具体动作(动词精确)及微表情或肢体细节;动作需适配短时长,不堆叠多个连续行为。
    跨镜头音频:
  • 全片仅使用与动作和空间匹配的音效,不设计 BGM、旁白或任何对白。
  • 为有音效的 shot 设计独立 audio_layer,注明触发动作、声音材质、远近层次与持续范围;优先使用细腻、近距离且具材质感的声音,例如丝绸摩擦、皮革轻响、器物轻触、茶水倾倒、鸟羽振动或环境微风。
4. 媒体生成

元素图生成:

  • 使用 TextToImage,指定 GPT Image 2,分辨率 4K
  • 人物或动物角色图:生成横向并排 reference_image——左侧为面部加上身特写(五官、发型、服饰领口);右侧为全身(服装全貌、配色、姿态)。
  • 场景图:生成完整场景全景图,需体现前景、中景、远景三层空间,并包含代表性装饰细节。
    视频生成(Shot A 与 Shot B):
  • 优先使用 MultiModalToVideo,指定模型 Seedance 2.5,分辨率 480p
  • Seedance 2.5 的单条视频最短生成时长为 4 秒:对于目标成片约 3 秒的 shot,生成 4 秒源片供后续剪辑;对于需延长的 shot,按成片所需生成并保留 4–5 秒,不额外拉长无叙事价值的停顿。
  • 每条 shot 的 reference 输入:
  1. 对应场景的 element scene 图像(必选)。
  2. 出现的 element character / element animal 图像(必选)。
  3. 同场景 Shot A 的 final_shot(仅在生成 Shot B 时作为连续性 reference_video;当需要强调空间一致性时可选)。
  • Shot B 近景跟随镜头:在 prompt 中明确指定跟随运镜方向、动作节奏与单一动作重点,不依赖模型自由发挥。
  • 视频内不生成音乐、旁白或对白;音效只保留与镜头动作直接相关的自然声,且须与独立 audio_layer 避免重复叠加。
    音效生成:
  • 仅针对 Storyboard 明确标注的动作或环境音生成 final_audio,使用 MultiModalToAudio;不生成音乐、旁白或对白。
  • 音效须贴合奢侈品创意广告片的细腻质感,保留必要的空间感与动态范围,并按对应 shot 的动作节拍精确对齐。
5. 提示词撰写

全局规则:

  • 以中文撰写 prompt 正文;全片只保留画面同步音效,不写入对白、旁白或 BGM。
  • 风格锚定短语(每条 prompt 必含):爱马仕丝巾插画风格,Ligne Claire 均匀细线勾边(建筑硬直线 + 有机曲线),平涂色块 + 高密度图案纹样填充(织物/地毯/建筑彩绘面面俱到),冷暖宝石双色系并重(皇室蓝/翡翠绿/深紫 与 赭金/朱红/酒红),象牙白或石灰白底色,无强烈阴影与高光,柔和均匀光感,哑光丝绸质感,叙事性高密度装饰构图(前景器物/植物 + 中景主体 + 远景建筑),奢侈品 TVC 精致克制气质,具有"可丝网印刷于真丝"的平面装饰艺术感。
  • 默认让一个镜头只承载一个可在约 3 秒内读清的视觉动作与运镜变化;需要延长时,明确保留动作的完整起势、过程与收势。
    图像 prompt(TextToImage — 元素图):
  • 结构:主体描述(人物或动物特征)加环境或场景(空间层次)加风格锚定加构图指令(如“横向并排参考图,左侧特写,右侧全身”)。
  • 明确服饰文化背景(如“唐代汉服,金黄色广袖,青玉腰带”);动物需指定品种与毛色。
  • 禁止出现画面外的叙述性语言;只描述镜头可见内容。
    视频 prompt(MultiModalToVideo — Shot A 全景):
  • reference_image 绑定:<<<image_1>>> 为场景图,<<<image_2>>> 为主体人物或动物图。
  • 运镜描述:镜头缓慢向右横移,或镜头轻微向前推进;明确方向与速度,并将动作控制为一个简洁的 3 秒视觉节拍。
  • 主体动作:静态或轻微动态(如衣袂微动、鸟羽轻扇),不宜大幅运动。
  • 固定负向词:no subtitles,no text overlay,no dialogue,no voice-over,no music(音效以独立 audio_layer 处理)。
    视频 prompt(MultiModalToVideo — Shot B 近景跟随):
  • reference_image 绑定:<<<image_1>>> 为主体人物或动物特写图,<<<image_2>>> 为场景图。
  • 运镜描述:跟随运镜,镜头随主体动作方向缓慢移动,带轻微弧形环绕感;明确跟随方向(向左、向右或向前)。
  • 动作描述:精确动词加肢体细节加节奏(如“右手缓缓提起茶壶,手腕轻转,茶水细流注入青瓷茶碗,动作舒缓优雅”);默认只保留一个 3 秒内可完成的动作片段,动作过程需要完整呈现时才说明延长至 4–5 秒。
  • 音效提示(可选):使用 <茶水倾倒声,轻微> 格式注明环境音。
  • 固定负向词:no subtitles,no text overlay,no dialogue,no voice-over,no music。
6. 视频合成

剪辑节奏:

  • 严格按“全景(Shot A)→ 近景(Shot B)”顺序交替排列,构成每个场景的基本单元。
  • 从每条 4 秒源片中选择动作和运镜最完整的连续段,常规 Shot A 与 Shot B 均修剪为约 3 秒;仅当动作会因剪短而失去完整性时保留 4–5 秒。
  • 转场:所有镜头之间一律使用直接硬切,不使用叠化、渐黑渐出或其他过渡效果;以镜头内动作和构图变化维持节奏。
    音频混合:
  • 全片不铺设 BGM,不加入旁白或对白;没有明确音效需求的段落保留画面留白,不以音乐填充。
  • 将每条 final_audio 精确对齐对应 shot 的动作触发点;保持细腻的近距离材质声与适度空间感,避免音效过密或压过画面节奏。
  • 全片无旁白轨、无对白轨、无字幕。
    导出:
  • 宽高比与分辨率遵循 Final_Video_Spec.md 设定。