Japanese school action drama
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
适用于早期日本热血校园风格短视频创作,使用GPT Image 2生成图像、Seedance 2.5生成视频。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
整体流程与依赖关系:
- 建立全局视频规格(标题、类型、视觉风格、日语配音、多分镜合并策略)→ text_editor 写入 Final_Video_Spec.md。长宽比由用户选择——在规格建立阶段向用户提供可选项(9:16、16:9、4:3、3:4),确认后锁定写入 Final_Video_Spec.md,后续生图和视频生成均沿用此长宽比。生图和视频生成阶段一律不生成任何 DV 日期/时间戳信息——DV 录像带时间戳叠加超出 Flova 组装能力范围,如需要请在导出后使用外部工具(如剪映)统一添加。
- 设计 Storyboard:关键元素(角色校服造型、场景、道具)、多分镜规划(POV 视角、手持运镜、中近景/特写,多个分镜尽量合并到同一段视频生成中,每段不超过 15s;总内容超 15s 时按故事顺序拆分为多段视频,标注跨段衔接点)、对白设计(日语台词写入镜头描述,供视频生成时同步产出语音,对白前后须标注自然气口)→ storyboard_designer。不需要规划 BGM 音轨。资产隔离原则:角色元素参考图必须纯白背景,场景元素参考图必须无人,两类资产各自独立生成。
- 生成关键元素图片:根据 Storyboard 中的角色/场景/道具元素,使用 GPT Image 2 生成参考图 → media_generator。角色图纯白背景、场景图无人,各自独立生成。若用户上传了参考素材,优先通过 ImageToImage 基于上传素材生成,保持一致性。
- 逐段生成视频(含同步语音):以元素图片为多主体视觉参考,使用 Seedance 2.5 通过 MultiModalToVideo 生成视频(长宽比沿用 Final_Video_Spec.md 中用户选定的值);利用多镜头描述功能将多个分镜合并到单次生成中(最长 15s),将对白和环境音效写入视频提示词,由模型同步生成日语说话音频,不需要背景音乐 → media_generator。逐段顺序生成,不要批量同时提交——每次只发起一段视频生成请求,等待该段完成后再发起下一段。每条视频提示词须包含固定 VHS 色调锚点串和禁止时间戳排除指令,确保跨段色调统一、无时间戳。
- 最终组装:若内容在 15s 以内为单段视频,仅需裁剪/微调;若拆分为多段,按故事顺序拼接连接,段间硬切或极短叠化过渡,注意跨段衔接的自然感和色调统一;不要在组装阶段单独生成新音频 → video_assembler。
依赖关系: 步骤2依赖步骤1。步骤3依赖步骤2。步骤4依赖步骤3。步骤5依赖步骤4。
暂停点: 在关键里程碑(规格锁定、Storyboard 完成、元素图片完成、每段视频生成完成)后暂停,向用户确认再继续。不要一次性跑完全部步骤。
视频逐段生成: 步骤4中若内容超过 15s 需要拆分为多段视频,必须逐段顺序生成——每次只发起一段视频生成请求,等待该段完成后再发起下一段,不要将多段视频同时批量提交。这样可以在每段完成后及时检查色调一致性、对白气口和跨段衔接效果,发现问题立即修正,避免批量生成后才发现整批需要返工。
用户上传素材: 若用户提供了参考图片/视频,先通过 resource_prepare_and_analyze 提取角色造型、服装风格、色调倾向、场景布局等关键视觉特征;在步骤2–4中优先绑定并复用已有素材,保持 Storyboard 和元素描述与上传素材一致,不要矛盾。避免重复生成与用户素材矛盾的视觉内容。
2. マルチモーダル分析
用户上传素材分析:
- 若用户上传参考图片或视频,提取其中的角色造型、服装风格、色调倾向、场景布局等关键视觉特征,作为 Storyboard 元素描述和生成提示词的依据。
- 保持上传素材的视觉特征一致:不要在生成中 contradict 用户提供的角色外观、服装或场景设定。
3. 絵コンテ設計
关键元素设计
- 角色(element character): 不良少年(Yankii / ヤンキー)风格人物,穿着日式校服但穿法体现反叛感。支持以下造型:
- 传统诘襟(Gakuran): 黑色立领校服。穿法上刻意不规矩——绝对不扣扣子或只扣最下面一颗,敞开穿;可定制加长版(长流氓风衣)或超短版。内搭不穿规矩白衬衫,搭配亮色/花色衬衫(红色、豹纹、蛇皮纹、夏威夷花衬衫),领口大开露出锁骨和项链;或内搭松垮的纯色旧T恤(白色、黑色V领)。
- 西式制服(Blazer): 白衬衫+领带、V领针织背心或藏青色西装外套,背双肩包或手持厚重课本。
- 外套与便服: 横须贺刺绣夹克(Sukajan)、带毛领的飞行员夹克(MA-1 Bomber)、黑色皮衣。
- 发型与面部特征:
- 发型: 从以下选项中选择,可交叉组合染色(亮金色、黄毛、红发)以丰富角色个性:
- 传统硬派与极道风: 大背头/飞机头(Regent/Pompadour,大量发蜡向后梳,头顶前端高高隆起)、鸭尾头(Ducktail,后脑勺头发交汇成鸭尾形)、日式小卷烫/潘兴烫(Punch Perm,紧密小卷贴头皮,暗示校外黑帮关联)。
- 千禧年潮流与偶像风: 中分长碎发(Center-Parted Messy Long Hair,及耳或及肩,自然微卷毛躁感,慵懒大佬气场)、刺猬头/爆炸碎发(Spiky Hair,大量发蜡抓竖,常染亮金色或鲜红色)、湿发大背头(Wet-Look Slicked Back,用手和发胶向后抹,额前留几缕碎发,颓废性感)。
- 凶狠战斗型: 剃线寸头(Buzz Cut with Razor Lines,极短寸头,鬓角或眉毛处剃出锐利线条)、莫西干/仿莫西干(Mohawk/Faux Hawk,两侧推平,中间一条头发向上竖起)。
- 街头嘻哈混搭风: 脏辫/地垄沟(Cornrows/Dreadlocks,贴头皮编织细辫,通常属于帮派头目或战力天花板角色)。
- 其他: 狼尾发型(Mullet,两侧剃短后脑留长)、寸头配胡茬(Buzz Cut with Stubble)。
- 面部: 细眉或断眉(Yankii标志),三白眼(sanpaku eyes)直视镜头,下巴微收,眼神挑衅压迫。
- 战损妆: 创可贴、淤青、嘴角带血、泥污等战斗痕迹。
- 发型: 从以下选项中选择,可交叉组合染色(亮金色、黄毛、红发)以丰富角色个性:
- 配饰: 复古细框或半框眼镜;粗犷金属项链(银十字架、狗牌)、腰部金属裤链(wallet chain)、打架用的手部绷带。
- 场景(element scene): 90年代日本不良少年活动场所——废弃工厂、涂鸦墙壁的破旧走廊、天台、下雨的街头、破旧学校教室/走廊/校门口/操场,复古陈旧感。场景参考图中不得出现任何人物,只呈现场景本身的空间布局、陈设和氛围。
- 道具: 双肩包、厚重课本、复古眼镜、金属裤链、绷带、香烟等。
- 资产隔离原则: 角色元素参考图必须为纯白背景(仅呈现角色本身,不含任何场景环境),场景元素参考图必须无人(仅呈现场景空间)。两类资产各自独立生成,避免角色图带场景污染后续视频生成、场景图带人物干扰角色一致性。
镜头设计 - 多分镜合并: 将多个分镜/故事节拍尽量合并到同一段视频生成中,利用 Seedance 2.5 的多镜头描述能力在单次生成内实现镜头切换和场景过渡。每段视频总时长不超过15s(Seedance 2.5 上限);若总内容超过15s,按故事顺序拆分为多段视频,段间自然衔接。
- 镜头逻辑与跨段衔接: 相邻分镜之间必须有叙事或视觉逻辑关联——同一场景的连续动作、视线引导、空间方向延续等,不能出现无关联的跳跃切换。特别是当内容超过15s需要拆分为多段视频时,新一段的第一个分镜必须与上一段最后一个分镜形成"悬接"关系:沿用相同的角色姿态/视线方向/动作惯性/场景空间,让观众感觉镜头只是被截断而非跳到了另一个故事。设计 Storyboard 时应在分镜列表中标注跨段衔接点,说明衔接依据。
- 跨段色调统一: 拆分为多段视频时,所有段落的色调必须完全一致——同一种低饱和、低对比、轻微偏暖/琥珀米黄的老式DV复古色感,段间不能出现色温、饱和度或偏色方向的差异。在 Storyboard 中标注跨段衔接点时,须同时注明"色调与上一段保持一致",确保悬接处不会产生色彩割裂感。
- 时间戳: 生图和视频生成阶段一律不生成任何 DV 日期/时间戳信息。如需 DV 时间戳效果,请在导出后使用外部工具统一添加。
- 视角: 强烈的POV(第一人称视角),摄像机模拟特定角色的眼睛,营造代入感。
- 运镜: 手持DV摄影机风格(Handheld Camera),模拟真人尽量保持平稳的手持拍摄——画面有轻微、平稳的呼吸感晃动,不是抖动;跟随镜头时尽量平稳跟随,仅有偶尔极细微的左右摆动和步频律动,强调临场感和纪实感。不要写出"稳定""平滑""丝滑运镜"等暗示稳定器/云台效果的描述,也不要写出"抖动""shake"等暗示画面剧烈晃动的词。
- 景别: 大量使用中近景(Medium Close-up)和特写(Close-up),视觉中心锁定在角色面部表情和肢体动作上。
- 镜头描述须包含: 场景(引用场景元素ID)、故事节拍(角色动作与对白)、摄影语言(景别、角度、运镜方式)。
音频设计 - 日语对白(dialogue): 纯正日语,使用典型的"日漫不良少年/热血男主"傲慢、挑衅语气。对白原文写在镜头描述中,由视频生成模型同步产出语音,不需要单独生成音频。
- 对白气口: 每句对白结束后必须留出自然的气口(呼吸停顿),不要出现急停或话首话尾被截断的情况。在镜头描述中对白前后标注自然停顿,例如"角色停顿后开口说……,说完后保持表情停顿片刻",让模型生成的语音有完整的起止过渡,避免突然开始或戛然而止。
- 环境音效: 雨声、校园钟声、下课嘈杂声、衣服摩擦声等,在镜头描述中注明,由视频生成模型同步产出,增强临场感。
- 不需要背景音乐: 不规划BGM音轨。
4. 素材生成
元素图片生成
- 使用 TextToImage,模型选择 GPT Image 2。
- 分辨率推荐 2K,宽高比沿用 Final_Video_Spec.md 中用户选定的值(可选 9:16、16:9、4:3、3:4,须与最终视频一致)。
- 资产隔离——角色元素图必须纯白背景: 角色参考图只呈现角色本身(发型、面部、服装、配饰、战损妆),背景为纯白,不得包含任何场景环境元素,避免背景污染后续视频生成。
- 资产隔离——场景元素图必须无人: 场景参考图只呈现场景空间(废弃工厂、走廊、天台、教室等),不得出现任何人物,避免场景图带人物干扰角色一致性。
- 图片须呈现真实90年代消费级DV纪实质感:稍微降饱和、低对比度、轻微偏暖/琥珀米黄色偏、极少量细腻颗粒、隐约暗角,整体自然复古而非暴力滤镜(详见 write_the_prompt 中的提示词规则)。
- 生图一律不生成任何 DV 日期/时间戳信息: 每张图片提示词必须在色调锁定块之后逐字追加禁止时间戳负向后缀(
no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode),因为色调锁定块中的 VHS 摄像机描述词会诱导模型叠加时间戳,必须通过显式负向后缀排除。 - 若用户上传了参考素材,优先通过 ImageToImage(同样使用 GPT Image 2)基于上传素材生成,保持一致性。
视频生成(含同步语音) - 使用 MultiModalToVideo,模型选择 Seedance 2.5。
- 宽高比沿用 Final_Video_Spec.md 中用户选定的值(可选 9:16、16:9、4:3、3:4),分辨率推荐 480p,时长 4s–15s。利用 Seedance 2.5 的多镜头描述能力,将多个分镜合并到单次生成中(最长15s),在一条提示词内按顺序描述各分镜的动作、运镜和对白,实现镜头切换与场景过渡,无需分段生成再拼接。
- 以元素图片作为多主体视觉参考(image_infos,最多9张),为每个出场的角色/场景/道具绑定对应的元素图片,保持跨分镜一致性。
- 将日语对白和环境音效写入视频提示词,由 Seedance 2.5 同步生成说话音频和环境声音;不需要背景音乐,不需要单独生成音频。
- 视频提示词保持简单,只描述动作、运镜和对白(详见 write_the_prompt),不追求完美口型同步。
- 色调一致性约束: 视频画面必须与元素图片色调统一——低饱和、低对比、轻微偏暖/琥珀米黄的老式DV复古色感、极少颗粒。每条视频提示词须包含固定的 VHS 色调质感锚点串(具体措辞见 write_the_prompt 视频提示词规则),确保图生视频后色调不偏移、不出现不同色调批次。
- 时间戳约束: 生图和视频生成阶段一律不生成任何 DV 日期/时间戳信息。每张图片提示词和每条视频提示词(包括多分镜合并时每个
Shot N:段)必须逐字包含排除指令no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode,因为 VHS 摄像机描述词会诱导模型叠加时间戳,必须显式排除。DV 录像带时间戳叠加超出组装能力范围,如需添加请在导出后使用外部工具统一处理。
Asset Binding Contract - 遵循当前
manage_item_assets合约,使用 Storyboard 中的实际目标 ID,不要在 Skill 中定义单独的 ID 模板。 - 在目标 Storyboard 锚点存在后、任何生成引用该素材之前,先调用
query_assets_info查询。若所需绑定缺失,调用manage_item_assets补全完整绑定数组,再重新查询验证。 - 从素材的实际用途和计划 Storyboard 位置解析绑定类型,不要仅凭素材标签推断角色。若一个素材服务多种用途,在完整
asset_bindings数组中保留所有适用绑定。
5. プロンプト作成
全局优先: 当用户使用中文交互时,提示词正文用中文撰写;日语对白原文须保持日语;固定色调锁定块始终保持英文原文不变。
图片提示词(TextToImage / ImageToImage,GPT Image 2)
A. 角色元素图提示词(纯白背景,不含场景)
- 结构顺序(一段流畅描述,不分小节): 主体身份 → 发型与面部特征 → 服装与配饰 → 动作与表情 → 纯白背景隔离 → 【固定色调锁定块(逐字复制,不得修改)】→ 【禁止时间戳负向后缀(逐字复制,不得修改)】。
- 主体身份: 先写人物名/身份 +
as a 1990s Japanese delinquent high school student,让模型明确角色定位。 - 发型与面部特征: 明确指定发型和面部细节——发型从以下关键词中选择一个:
slicked-back pompadour with heavy hair wax/ducktail haircut, back of head hair tapering to a point/punch perm, tight short curly hair/center-parted messy hair, medium length stringy hair/messy spiky hair, heavily waxed spikes/wet look slicked-back hair, loose strands falling over face/short buzz cut, shaved lines on the side of the head/faux hawk, shaved sides, spiked up middle hair/cornrows, tightly braided hair along the scalp/mullet with shaved sides/buzz cut with stubble;可在发型前叠加染发色,如bleached blonde/bright red/golden yellow;面部写thin eyebrows, sanpaku eyes, intense defiant gaze, chin slightly tucked;如有战损妆写bandaged hands, slight bruises on face, cut on lip。 - 服装与造型: 明确指定日式校服类型及穿法——传统诘襟写
open black Gakuran (stand-up collar uniform), unbuttoned, with a red patterned shirt underneath;西式制服写navy blue school blazer over a grey V-neck sweater vest and a red tie;外套写Sukajan (embroidered souvenir jacket)/MA-1 bomber jacket with fur collar/black leather jacket;配饰写round vintage glasses/retro semi-rimmed glasses/silver cross necklace/wallet chain/bandaged hands等。 - 动作与表情: 用一个具体动作锁定画面张力,例如
turning his head to look at the camera with an arrogant expression、looking directly into the camera with a rebellious vibe。保持自然放松,不要夸张。 - 纯白背景隔离(必须写入): 在动作与表情之后、色调锁定块之前,逐字写入
isolated on a plain pure white background, no background scene, no environment, no props in background, studio white backdrop,确保角色参考图不含任何场景元素,避免背景污染后续视频生成。 - 不要描述画面外或不可见的内容,只写镜头能看到的事物。
B. 场景元素图提示词(无人,纯场景) - 结构顺序: 场景类型 → 空间布局与陈设 → 氛围与天气 → 无人物声明 → 【固定色调锁定块(逐字复制,不得修改)】→ 【禁止时间戳负向后缀(逐字复制,不得修改)】。
- 场景类型: 明确写出场景,例如
an abandoned Japanese factory interior/a graffiti-covered school corridor/a rainy Japanese high school rooftop/a rundown classroom。 - 空间布局与陈设: 描述场景中的关键物体和空间结构,例如
broken desks scattered around, cracked windows, peeling paint on walls, dim fluorescent light。 - 无人物声明(必须写入): 在氛围描述之后、色调锁定块之前,逐字写入
completely empty, no people, no characters, no figures, unoccupied scene,确保场景参考图不包含任何人物。 - 场景色调与角色图统一,沿用同一个固定色调锁定块。
⚠️ 固定色调锁定块——每张图片提示词结尾必须逐字原文复制,不得增删任何词、不得替换同义词、不得调整顺序:
shot on 1990s VHS camcorder, handheld POV camera, desaturated vintage tones, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm palette, 1990s Japanese home video look, classic retro vintage look, no heavy saturation, no cold blue tones, no neon tones
⚠️ 禁止时间戳负向后缀——每张图片提示词在色调锁定块之后必须逐字原文追加,不得省略、不得修改:
no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode
色调说明(仅供理解,不写入提示词):整体呈轻微偏暖/琥珀米黄的老式消费级摄像机色感,饱和度稍降但轮廓自然清晰;暗部微带暖调;肤色真实略泛暖;颗粒极少;无扫描线噪点;严禁偏冷蓝、偏紫品红或偏青绿的色彩倾向。
时间戳说明(仅供理解):色调锁定块中的
shot on 1990s VHS camcorder和1990s Japanese home video look会诱导模型在画面上叠加 DV 录像带日期/时间戳,因此必须在每张图片提示词末尾追加上述负向后缀来显式排除。
- 禁止使用的关键词:
cinematic lighting、golden hour(过度暖)、natural skin tones(易引导过暖)、high quality、4K、HD、sharp focus、detailed、35mm photography、heavy VHS tracking lines、heavy film grain、tape distortion、greenish-grey cast、purple-violet cast、blue-violet shadows、magenta color shift(这些会拉向偏紫)。date stamp、timestamp、time display、REC indicator等不得作为正面描述词写入提示词——生图一律不生成任何 DV 日期/时间戳信息,统一通过上述负向后缀排除。 - 角色元素图参考示例(注意纯白背景隔离 + 结尾固定色调锁定块原文照搬):
[人物名] as a 1990s Japanese delinquent high school student, messy bleached blonde hair, thin eyebrows, wearing round vintage glasses, a navy blue school blazer over a grey V-neck sweater vest and a red tie, carrying a backpack and holding thick textbooks, turning his head to look at the camera with an arrogant expression, isolated on a plain pure white background, no background scene, no environment, no props in background, studio white backdrop. shot on 1990s VHS camcorder, handheld POV camera, desaturated vintage tones, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm palette, 1990s Japanese home video look, classic retro vintage look, no heavy saturation, no cold blue tones, no neon tones, no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode[人物A] and [人物B] as 1990s Japanese delinquent high school students, both with slicked-back pompadour hair, thin eyebrows, sanpaku eyes, wearing open black Gakuran (stand-up collar uniforms) unbuttoned with red patterned shirts underneath, silver cross necklaces and wallet chains, looking directly into the camera with a rebellious delinquent vibe, isolated on a plain pure white background, no background scene, no environment, no props in background, studio white backdrop. shot on 1990s VHS camcorder, handheld POV camera, desaturated vintage tones, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm palette, 1990s Japanese home video look, classic retro vintage look, no heavy saturation, no cold blue tones, no neon tones, no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode[人物名] as a 1990s Japanese delinquent high school student, mullet with shaved sides, bandaged hands, slight bruises on face, wearing an open black Gakuran over a loose white V-neck T-shirt and a MA-1 bomber jacket with fur collar, chin slightly tucked, intense defiant gaze directly into the camera, isolated on a plain pure white background, no background scene, no environment, no props in background, studio white backdrop. shot on 1990s VHS camcorder, handheld POV camera, desaturated vintage tones, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm palette, 1990s Japanese home video look, classic retro vintage look, no heavy saturation, no cold blue tones, no neon tones, no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode
- 场景元素图参考示例(注意无人物声明 + 结尾固定色调锁定块原文照搬):
a graffiti-covered school corridor with broken windows and peeling paint, dim fluorescent lighting, scattered debris on the floor, completely empty, no people, no characters, no figures, unoccupied scene. shot on 1990s VHS camcorder, handheld POV camera, desaturated vintage tones, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm palette, 1990s Japanese home video look, classic retro vintage look, no heavy saturation, no cold blue tones, no neon tones, no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecodea rainy Japanese high school rooftop with chain-link fencing, wet concrete floor, overcast sky, puddles reflecting dim light, completely empty, no people, no characters, no figures, unoccupied scene. shot on 1990s VHS camcorder, handheld POV camera, desaturated vintage tones, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm palette, 1990s Japanese home video look, classic retro vintage look, no heavy saturation, no cold blue tones, no neon tones, no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode
视频提示词(MultiModalToVideo,Seedance 2.5)
- 参考图片绑定: 使用
<<<image_1>>>、<<<image_2>>>等占位符绑定每条镜头的角色/场景元素图片;多个分镜共用同一角色时复用同一占位符。 - 运镜描述(固定): 每条视频提示词须包含:
steady handheld camera, no stabilizer, very subtle gentle sway, mostly stable with occasional very slight side-to-side drift when following the subject。禁止写"稳定""平滑""丝滑运镜"或"shake""抖动"等极端词。 - 多分镜合并描述: 在单条提示词内按顺序描述多个分镜的动作、运镜和对白,利用 Seedance 2.5 多镜头描述能力实现镜头切换,例如:
Shot 1: [动作/对白/运镜] Shot 2: [动作/对白/运镜]。 - 对白格式: 日语对白用
{Japanese: [原文台词]}格式写入,对白前后留自然停顿说明,例如"角色停顿后开口说 {Japanese: …},说完后保持表情停顿片刻"。 - 表演: 人物微表情和轻微肢体动作,不需要完美口型同步。
- 长度控制: 描述文本加上
<<<image_X>>>标签总计不超过 2300 字符;多分镜合并时需精炼每个分镜描述。
⚠️ 视频固定 VHS 色调锚点串——每条视频提示词必须逐字复制:
slightly desaturated, low contrast, faint warm color cast, subtle amber-beige color shift, slightly warm shadow tones, very minimal film grain, faint vignette, very slight chromatic aberration, muted warm vintage tones, no heavy saturation, no cold blue tones, no neon tones
- 静态负向提示: 始终包含
no subtitles、no background music;如有独立旁白音轨,不要在视频提示词中重复完整旁白文本。 - 录像带时间戳规则: 生图和视频生成阶段一律不生成任何 DV 日期/时间戳信息。每条视频提示词(包括多分镜合并时每个
Shot N:段)必须逐字包含排除指令no date stamp, no timestamp, no time display, no REC indicator, no camcorder overlay, no VHS date overlay, no on-screen text, no timecode。如需 DV 时间戳效果,请在导出后使用外部工具统一添加。 - 禁止使用的关键词(视频):
cinematic lighting、golden hour、warm lighting、4K、HD、heavy VHS tracking lines、heavy film grain、signal noise、tape distortion、greenish-grey cast、yellowish cast。
6. 動画編集
组装与导出
- 单段视频(≤15s): 仅需按需要裁剪首尾、微调时长,无需拼接。
- 多段视频(总内容>15s): 按故事顺序将各段视频首尾拼接连接,段间以硬切或极短叠化过渡,保持手持DV纪实感的节奏。拼接时注意段间衔接的自然感——下一段的开场画面应与上一段的结尾画面在角色姿态、视线方向、场景空间上保持延续,不能让观众感觉到明显的叙事断裂。同时必须确保段间色调统一:所有段落的色温、饱和度、偏色方向完全一致,悬接处不能出现色差跳跃或割裂感,保持从头到尾同一种老式DV复古暖调。
- 音频: 视频已内嵌同步语音和环境音效,组装时不要单独生成新音频,不需要BGM。
- 音量微调:如需调整语音清晰度可适当提升人声音量。
- 复古胶片质感(色调、颗粒、VHS扫描线、色散、暗角)已在生成阶段通过提示词实现,组装阶段不再叠加。
能力边界说明 - 双语字幕叠加(西班牙语主字幕+英语副字幕、衬线字体、排版样式)超出当前组装能力范围,需在导出后使用外部工具(如剪映)完成。
- DV 录像带时间戳叠加(固定位置、字体、大小、格式的半透明时间码)超出当前组装能力范围,需在导出后使用外部工具(如剪映)统一添加。