yeha.ai
Back to templates

Hermes scarf-inspired illustration

Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.

适用于生成具有奢侈品创意广告片(TVC)质感的爱马仕风格插画短视频:精细线稿、富有叙事感的场景构图、暖色调加宝石色点缀;每个场景固定全景建立镜头与跟随运镜的局部近景,仅使用与画面同步的音效。

Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.

Complete workflow

1. Planning

工作流阶段与顺序:

  1. 与用户确认视频的整体主题与故事场景(例如:中式庭院茶道、欧式宫廷宴会、巴黎公寓日常等),写入 Final_Video_Spec.md(含宽高比、成片时长预估、画面风格定义、语言)→ text_editor
  2. 设计分镜表:明确所有 key_element(主要人物、动物、场景),以及每个场景的双分镜结构(全景加近景跟随);默认每条 final_shot 成片约 3 秒,只有动作不能在 3 秒内自然完成时才延长至 4–5 秒 → storyboard_designer
  3. 生成所有 key_element 元素图(人物、动物、场景)→ media_generator
  4. 按分镜逐组生成视频(每组两条:全景 shot 加近景跟随 shot),引用对应元素图像;生成时为剪辑预留足够素材,成片时长由后续组接控制 → media_generator
  5. 仅当分镜明确标注音效时,生成与画面动作和环境精确同步的 final_audio;不生成 BGM、旁白或对白 → media_generator
  6. 剪辑合成,按全景到近景的节奏交替排列,将常规镜头修剪为约 3 秒,并精确对齐音效 → video_assembler
    依赖关系: 2→1;3→2;4→3;5→2;6→3、4、5。
    暂停节点: 完成 Final_Video_Spec.md 后、Storyboard 完成后、元素图生成后,各暂停一次请用户确认,再继续下一阶段。
2. Multimodal analysis

参考图分析重点(用于风格提取):

  • 提取插画的线条风格:线稿密度、勾线粗细、填色方式(平涂或渐变)、装饰性纹样密度。
  • 提取色彩体系:主色调(米色、象牙白、金棕)、点缀色(宝石蓝、翠绿、玫红、金黄)、色彩对比度与饱和度区间。
  • 提取场景叙事结构:主体(人或动物)的姿态与所处环境的空间层次关系(前景细节、中景主体、远景建筑或自然)。
  • 提取动物与人物的造型特征:服饰风格(历史时期、文化背景)、动物品种与姿态语言。
  • 输出结构化风格描述,供 storyboard_designer 和 write_media_prompt 使用。
3. Storyboard design

视觉风格定义(全局):

  • 线条风格(Ligne Claire):采用细而均匀、粗细一致的黑色勾边,类似比利时漫画"清爽线条"(Ligne Claire)而非可粗可细的中国工笔描线;建筑用硬直线,人物与花木用有机曲线,所有轮廓清晰封闭,无毛边或水墨晕染。
  • 色彩体系(冷暖宝石双色系):以象牙白、石灰白或沙色为底色;重点色采用冷暖并重的宝石色系——暖调(赭金、朱红、酒红、橙红)与冷调(皇室蓝、普鲁士蓝、翡翠绿、深紫)共存,整体色调沉稳高级,饱和度适中,避免单纯暖金色为主的偏差。
  • 填色方式(高密度装饰填充):主体采用平涂色块,在织物、地毯、挂毯、建筑彩绘等复杂表面必须填充高密度图案纹样(几何纹、卷草纹、花鸟纹等),每寸画面均有可读的装饰信息;仅在需要轻微体积感时辅以极细密的点描或颗粒感,不使用渐变或强烈明暗。
  • 叙事密度:每张画面应如一幅完整丝巾——充满文化符号、历史器物与自然意象的引用,画面信息量极高,经得起局部放大和反复观察;构图层次为前景装饰植物/器物 → 中景主体人物或动物 → 远景建筑或风景。
  • 光感质感:光线柔和均匀,无强烈投影与高光反光;整体呈现如高档丝绸或哑光印刷品般光滑洁净的视觉质感。
  • 整体气质:奢侈品 TVC 的精致与克制,每帧画面都应具有"可被丝网印刷在真丝之上"的平面装饰艺术感,避免写实渲染、日常随拍感或杂乱信息。
    key_element 设计规范:
  • element character / element animal:明确人物服饰(朝代或文化风格)、发型、配色;动物品种、毛色、姿态特征;需与参考图风格一致。
  • element scene:标注场景的空间层次——前景标志性装饰物、中景核心活动区域、远景背景建筑或自然景观;描述光线方向与时间氛围。
    双分镜结构(每个场景固定两条 shot):
    每个叙事场景必须包含以下两条 shot,顺序固定。两条 final_shot 默认各约 3 秒;仅当动作需完整呈现、在 3 秒内会显得仓促或被截断时,才将该条延长为 4–5 秒。
  1. Shot A — 全景建立镜头
  • 构图:宽景展示完整场景空间层次(前景、中景、远景均可见);主体人物或动物处于中景,比例适中。
  • 运镜:缓慢横移或轻微推进,配合场景纵深;3 秒内只完成一个清晰、克制的镜头运动。
  • 成片时长:默认约 3 秒;只有建立空间或关键动作确有必要时延长至 4–5 秒。
  1. Shot B — 局部近景跟随镜头
  • 构图:聚焦人物上半身或动物,突出正在进行的动作细节(如倒茶、举杯、翻书、栖停等)。
  • 运镜:跟随运镜贴近主体,轻微手持感或弧形环绕;镜头跟随动作方向移动。
  • 成片时长:默认约 3 秒;只有动作的起势、核心过程与收势必须连续保留时延长至 4–5 秒。
  • 必须明确写出主体正在做的具体动作(动词精确)及微表情或肢体细节;动作需适配短时长,不堆叠多个连续行为。
    跨镜头音频:
  • 全片仅使用与动作和空间匹配的音效,不设计 BGM、旁白或任何对白。
  • 为有音效的 shot 设计独立 audio_layer,注明触发动作、声音材质、远近层次与持续范围;优先使用细腻、近距离且具材质感的声音,例如丝绸摩擦、皮革轻响、器物轻触、茶水倾倒、鸟羽振动或环境微风。
4. Media generation

元素图生成:

  • 使用 TextToImage,指定 GPT Image 2,分辨率 4K
  • 人物或动物角色图:生成横向并排 reference_image——左侧为面部加上身特写(五官、发型、服饰领口);右侧为全身(服装全貌、配色、姿态)。
  • 场景图:生成完整场景全景图,需体现前景、中景、远景三层空间,并包含代表性装饰细节。
    视频生成(Shot A 与 Shot B):
  • 优先使用 MultiModalToVideo,指定模型 Seedance 2.5,分辨率 480p
  • Seedance 2.5 的单条视频最短生成时长为 4 秒:对于目标成片约 3 秒的 shot,生成 4 秒源片供后续剪辑;对于需延长的 shot,按成片所需生成并保留 4–5 秒,不额外拉长无叙事价值的停顿。
  • 每条 shot 的 reference 输入:
  1. 对应场景的 element scene 图像(必选)。
  2. 出现的 element character / element animal 图像(必选)。
  3. 同场景 Shot A 的 final_shot(仅在生成 Shot B 时作为连续性 reference_video;当需要强调空间一致性时可选)。
  • Shot B 近景跟随镜头:在 prompt 中明确指定跟随运镜方向、动作节奏与单一动作重点,不依赖模型自由发挥。
  • 视频内不生成音乐、旁白或对白;音效只保留与镜头动作直接相关的自然声,且须与独立 audio_layer 避免重复叠加。
    音效生成:
  • 仅针对 Storyboard 明确标注的动作或环境音生成 final_audio,使用 MultiModalToAudio;不生成音乐、旁白或对白。
  • 音效须贴合奢侈品创意广告片的细腻质感,保留必要的空间感与动态范围,并按对应 shot 的动作节拍精确对齐。
5. Prompt writing

全局规则:

  • 以中文撰写 prompt 正文;全片只保留画面同步音效,不写入对白、旁白或 BGM。
  • 风格锚定短语(每条 prompt 必含):爱马仕丝巾插画风格,Ligne Claire 均匀细线勾边(建筑硬直线 + 有机曲线),平涂色块 + 高密度图案纹样填充(织物/地毯/建筑彩绘面面俱到),冷暖宝石双色系并重(皇室蓝/翡翠绿/深紫 与 赭金/朱红/酒红),象牙白或石灰白底色,无强烈阴影与高光,柔和均匀光感,哑光丝绸质感,叙事性高密度装饰构图(前景器物/植物 + 中景主体 + 远景建筑),奢侈品 TVC 精致克制气质,具有"可丝网印刷于真丝"的平面装饰艺术感。
  • 默认让一个镜头只承载一个可在约 3 秒内读清的视觉动作与运镜变化;需要延长时,明确保留动作的完整起势、过程与收势。
    图像 prompt(TextToImage — 元素图):
  • 结构:主体描述(人物或动物特征)加环境或场景(空间层次)加风格锚定加构图指令(如“横向并排参考图,左侧特写,右侧全身”)。
  • 明确服饰文化背景(如“唐代汉服,金黄色广袖,青玉腰带”);动物需指定品种与毛色。
  • 禁止出现画面外的叙述性语言;只描述镜头可见内容。
    视频 prompt(MultiModalToVideo — Shot A 全景):
  • reference_image 绑定:<<<image_1>>> 为场景图,<<<image_2>>> 为主体人物或动物图。
  • 运镜描述:镜头缓慢向右横移,或镜头轻微向前推进;明确方向与速度,并将动作控制为一个简洁的 3 秒视觉节拍。
  • 主体动作:静态或轻微动态(如衣袂微动、鸟羽轻扇),不宜大幅运动。
  • 固定负向词:no subtitles,no text overlay,no dialogue,no voice-over,no music(音效以独立 audio_layer 处理)。
    视频 prompt(MultiModalToVideo — Shot B 近景跟随):
  • reference_image 绑定:<<<image_1>>> 为主体人物或动物特写图,<<<image_2>>> 为场景图。
  • 运镜描述:跟随运镜,镜头随主体动作方向缓慢移动,带轻微弧形环绕感;明确跟随方向(向左、向右或向前)。
  • 动作描述:精确动词加肢体细节加节奏(如“右手缓缓提起茶壶,手腕轻转,茶水细流注入青瓷茶碗,动作舒缓优雅”);默认只保留一个 3 秒内可完成的动作片段,动作过程需要完整呈现时才说明延长至 4–5 秒。
  • 音效提示(可选):使用 <茶水倾倒声,轻微> 格式注明环境音。
  • 固定负向词:no subtitles,no text overlay,no dialogue,no voice-over,no music。
6. Video assembly

剪辑节奏:

  • 严格按“全景(Shot A)→ 近景(Shot B)”顺序交替排列,构成每个场景的基本单元。
  • 从每条 4 秒源片中选择动作和运镜最完整的连续段,常规 Shot A 与 Shot B 均修剪为约 3 秒;仅当动作会因剪短而失去完整性时保留 4–5 秒。
  • 转场:所有镜头之间一律使用直接硬切,不使用叠化、渐黑渐出或其他过渡效果;以镜头内动作和构图变化维持节奏。
    音频混合:
  • 全片不铺设 BGM,不加入旁白或对白;没有明确音效需求的段落保留画面留白,不以音乐填充。
  • 将每条 final_audio 精确对齐对应 shot 的动作触发点;保持细腻的近距离材质声与适度空间感,避免音效过密或压过画面节奏。
  • 全片无旁白轨、无对白轨、无字幕。
    导出:
  • 宽高比与分辨率遵循 Final_Video_Spec.md 设定。