Hermes scarf-inspired illustration
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
适用于生成具有奢侈品创意广告片(TVC)质感的爱马仕风格插画短视频:精细线稿、富有叙事感的场景构图、暖色调加宝石色点缀;每个场景固定全景建立镜头与跟随运镜的局部近景,仅使用与画面同步的音效。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
工作流阶段与顺序:
- 与用户确认视频的整体主题与故事场景(例如:中式庭院茶道、欧式宫廷宴会、巴黎公寓日常等),写入 Final_Video_Spec.md(含宽高比、成片时长预估、画面风格定义、语言)→ text_editor。
- 设计分镜表:明确所有 key_element(主要人物、动物、场景),以及每个场景的双分镜结构(全景加近景跟随);默认每条 final_shot 成片约 3 秒,只有动作不能在 3 秒内自然完成时才延长至 4–5 秒 → storyboard_designer。
- 生成所有 key_element 元素图(人物、动物、场景)→ media_generator。
- 按分镜逐组生成视频(每组两条:全景 shot 加近景跟随 shot),引用对应元素图像;生成时为剪辑预留足够素材,成片时长由后续组接控制 → media_generator。
- 仅当分镜明确标注音效时,生成与画面动作和环境精确同步的 final_audio;不生成 BGM、旁白或对白 → media_generator。
- 剪辑合成,按全景到近景的节奏交替排列,将常规镜头修剪为约 3 秒,并精确对齐音效 → video_assembler。
依赖关系: 2→1;3→2;4→3;5→2;6→3、4、5。
暂停节点: 完成 Final_Video_Spec.md 后、Storyboard 完成后、元素图生成后,各暂停一次请用户确认,再继续下一阶段。
2. 멀티모달 분석
参考图分析重点(用于风格提取):
- 提取插画的线条风格:线稿密度、勾线粗细、填色方式(平涂或渐变)、装饰性纹样密度。
- 提取色彩体系:主色调(米色、象牙白、金棕)、点缀色(宝石蓝、翠绿、玫红、金黄)、色彩对比度与饱和度区间。
- 提取场景叙事结构:主体(人或动物)的姿态与所处环境的空间层次关系(前景细节、中景主体、远景建筑或自然)。
- 提取动物与人物的造型特征:服饰风格(历史时期、文化背景)、动物品种与姿态语言。
- 输出结构化风格描述,供 storyboard_designer 和 write_media_prompt 使用。
3. 스토리보드 설계
视觉风格定义(全局):
- 线条风格(Ligne Claire):采用细而均匀、粗细一致的黑色勾边,类似比利时漫画"清爽线条"(Ligne Claire)而非可粗可细的中国工笔描线;建筑用硬直线,人物与花木用有机曲线,所有轮廓清晰封闭,无毛边或水墨晕染。
- 色彩体系(冷暖宝石双色系):以象牙白、石灰白或沙色为底色;重点色采用冷暖并重的宝石色系——暖调(赭金、朱红、酒红、橙红)与冷调(皇室蓝、普鲁士蓝、翡翠绿、深紫)共存,整体色调沉稳高级,饱和度适中,避免单纯暖金色为主的偏差。
- 填色方式(高密度装饰填充):主体采用平涂色块,在织物、地毯、挂毯、建筑彩绘等复杂表面必须填充高密度图案纹样(几何纹、卷草纹、花鸟纹等),每寸画面均有可读的装饰信息;仅在需要轻微体积感时辅以极细密的点描或颗粒感,不使用渐变或强烈明暗。
- 叙事密度:每张画面应如一幅完整丝巾——充满文化符号、历史器物与自然意象的引用,画面信息量极高,经得起局部放大和反复观察;构图层次为前景装饰植物/器物 → 中景主体人物或动物 → 远景建筑或风景。
- 光感质感:光线柔和均匀,无强烈投影与高光反光;整体呈现如高档丝绸或哑光印刷品般光滑洁净的视觉质感。
- 整体气质:奢侈品 TVC 的精致与克制,每帧画面都应具有"可被丝网印刷在真丝之上"的平面装饰艺术感,避免写实渲染、日常随拍感或杂乱信息。
key_element 设计规范: - element character / element animal:明确人物服饰(朝代或文化风格)、发型、配色;动物品种、毛色、姿态特征;需与参考图风格一致。
- element scene:标注场景的空间层次——前景标志性装饰物、中景核心活动区域、远景背景建筑或自然景观;描述光线方向与时间氛围。
双分镜结构(每个场景固定两条 shot):
每个叙事场景必须包含以下两条 shot,顺序固定。两条 final_shot 默认各约 3 秒;仅当动作需完整呈现、在 3 秒内会显得仓促或被截断时,才将该条延长为 4–5 秒。
- Shot A — 全景建立镜头
- 构图:宽景展示完整场景空间层次(前景、中景、远景均可见);主体人物或动物处于中景,比例适中。
- 运镜:缓慢横移或轻微推进,配合场景纵深;3 秒内只完成一个清晰、克制的镜头运动。
- 成片时长:默认约 3 秒;只有建立空间或关键动作确有必要时延长至 4–5 秒。
- Shot B — 局部近景跟随镜头
- 构图:聚焦人物上半身或动物,突出正在进行的动作细节(如倒茶、举杯、翻书、栖停等)。
- 运镜:跟随运镜贴近主体,轻微手持感或弧形环绕;镜头跟随动作方向移动。
- 成片时长:默认约 3 秒;只有动作的起势、核心过程与收势必须连续保留时延长至 4–5 秒。
- 必须明确写出主体正在做的具体动作(动词精确)及微表情或肢体细节;动作需适配短时长,不堆叠多个连续行为。
跨镜头音频: - 全片仅使用与动作和空间匹配的音效,不设计 BGM、旁白或任何对白。
- 为有音效的 shot 设计独立 audio_layer,注明触发动作、声音材质、远近层次与持续范围;优先使用细腻、近距离且具材质感的声音,例如丝绸摩擦、皮革轻响、器物轻触、茶水倾倒、鸟羽振动或环境微风。
4. 미디어 생성
元素图生成:
- 使用 TextToImage,指定 GPT Image 2,分辨率 4K。
- 人物或动物角色图:生成横向并排 reference_image——左侧为面部加上身特写(五官、发型、服饰领口);右侧为全身(服装全貌、配色、姿态)。
- 场景图:生成完整场景全景图,需体现前景、中景、远景三层空间,并包含代表性装饰细节。
视频生成(Shot A 与 Shot B): - 优先使用 MultiModalToVideo,指定模型 Seedance 2.5,分辨率 480p。
- Seedance 2.5 的单条视频最短生成时长为 4 秒:对于目标成片约 3 秒的 shot,生成 4 秒源片供后续剪辑;对于需延长的 shot,按成片所需生成并保留 4–5 秒,不额外拉长无叙事价值的停顿。
- 每条 shot 的 reference 输入:
- 对应场景的 element scene 图像(必选)。
- 出现的 element character / element animal 图像(必选)。
- 同场景 Shot A 的 final_shot(仅在生成 Shot B 时作为连续性 reference_video;当需要强调空间一致性时可选)。
- Shot B 近景跟随镜头:在 prompt 中明确指定跟随运镜方向、动作节奏与单一动作重点,不依赖模型自由发挥。
- 视频内不生成音乐、旁白或对白;音效只保留与镜头动作直接相关的自然声,且须与独立 audio_layer 避免重复叠加。
音效生成: - 仅针对 Storyboard 明确标注的动作或环境音生成 final_audio,使用 MultiModalToAudio;不生成音乐、旁白或对白。
- 音效须贴合奢侈品创意广告片的细腻质感,保留必要的空间感与动态范围,并按对应 shot 的动作节拍精确对齐。
5. 프롬프트 작성
全局规则:
- 以中文撰写 prompt 正文;全片只保留画面同步音效,不写入对白、旁白或 BGM。
- 风格锚定短语(每条 prompt 必含):爱马仕丝巾插画风格,Ligne Claire 均匀细线勾边(建筑硬直线 + 有机曲线),平涂色块 + 高密度图案纹样填充(织物/地毯/建筑彩绘面面俱到),冷暖宝石双色系并重(皇室蓝/翡翠绿/深紫 与 赭金/朱红/酒红),象牙白或石灰白底色,无强烈阴影与高光,柔和均匀光感,哑光丝绸质感,叙事性高密度装饰构图(前景器物/植物 + 中景主体 + 远景建筑),奢侈品 TVC 精致克制气质,具有"可丝网印刷于真丝"的平面装饰艺术感。
- 默认让一个镜头只承载一个可在约 3 秒内读清的视觉动作与运镜变化;需要延长时,明确保留动作的完整起势、过程与收势。
图像 prompt(TextToImage — 元素图): - 结构:主体描述(人物或动物特征)加环境或场景(空间层次)加风格锚定加构图指令(如“横向并排参考图,左侧特写,右侧全身”)。
- 明确服饰文化背景(如“唐代汉服,金黄色广袖,青玉腰带”);动物需指定品种与毛色。
- 禁止出现画面外的叙述性语言;只描述镜头可见内容。
视频 prompt(MultiModalToVideo — Shot A 全景): - reference_image 绑定:<<<image_1>>> 为场景图,<<<image_2>>> 为主体人物或动物图。
- 运镜描述:镜头缓慢向右横移,或镜头轻微向前推进;明确方向与速度,并将动作控制为一个简洁的 3 秒视觉节拍。
- 主体动作:静态或轻微动态(如衣袂微动、鸟羽轻扇),不宜大幅运动。
- 固定负向词:no subtitles,no text overlay,no dialogue,no voice-over,no music(音效以独立 audio_layer 处理)。
视频 prompt(MultiModalToVideo — Shot B 近景跟随): - reference_image 绑定:<<<image_1>>> 为主体人物或动物特写图,<<<image_2>>> 为场景图。
- 运镜描述:跟随运镜,镜头随主体动作方向缓慢移动,带轻微弧形环绕感;明确跟随方向(向左、向右或向前)。
- 动作描述:精确动词加肢体细节加节奏(如“右手缓缓提起茶壶,手腕轻转,茶水细流注入青瓷茶碗,动作舒缓优雅”);默认只保留一个 3 秒内可完成的动作片段,动作过程需要完整呈现时才说明延长至 4–5 秒。
- 音效提示(可选):使用 <茶水倾倒声,轻微> 格式注明环境音。
- 固定负向词:no subtitles,no text overlay,no dialogue,no voice-over,no music。
6. 동영상 조립
剪辑节奏:
- 严格按“全景(Shot A)→ 近景(Shot B)”顺序交替排列,构成每个场景的基本单元。
- 从每条 4 秒源片中选择动作和运镜最完整的连续段,常规 Shot A 与 Shot B 均修剪为约 3 秒;仅当动作会因剪短而失去完整性时保留 4–5 秒。
- 转场:所有镜头之间一律使用直接硬切,不使用叠化、渐黑渐出或其他过渡效果;以镜头内动作和构图变化维持节奏。
音频混合: - 全片不铺设 BGM,不加入旁白或对白;没有明确音效需求的段落保留画面留白,不以音乐填充。
- 将每条 final_audio 精确对齐对应 shot 的动作触发点;保持细腻的近距离材质声与适度空间感,避免音效过密或压过画面节奏。
- 全片无旁白轨、无对白轨、无字幕。
导出: - 宽高比与分辨率遵循 Final_Video_Spec.md 设定。