yeha.ai
목록으로

Japanese youth idol music video

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

适用于制作平成时代AKB48风格青春偶像MV,融合日系胶片质感、纪录片手持摄影、校园青春叙事与女子团体群像感。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

全流程阶段与依赖关系:

  1. 通过 text_editor 建立 Final_Video_Spec.md,锁定全局参数:画面比例(默认16:9)、目标时长、输出语言(日语/中文歌词)、视觉风格基调(平成胶片偶像MV)、色彩系统(夏日青春胶片)。
  2. 调用 storyboard_designer 设计完整分镜:
    • 先建立 key_element(成员角色、核心场景、关键道具);
    • 再按「日常→放学→友情→练习→欢笑→舞台→青春高潮→黄昏收尾」结构规划 shot 列表;
    • 同步设计 audio_layer(BGM + 可选旁白VO)。
  3. 完成分镜后,扫描已有用户上传素材,通过 media_generator 将匹配资源绑定至对应 Storyboard 槽位,避免重复生成。
  4. 生成所有 key_element 形象图(角色参考图、场景参考图)→ media_generator
  5. 逐 shot 生成视频片段,优先以 element 图像为视觉参考 → media_generator
  6. 生成 BGM 及音效/VO 音频层 → media_generator
  7. 所有媒体就绪后调用 video_assembler 完成时间线剪辑,导出成片。

依赖关系: 2→1;3→2;4→2;5→4;6→2;7→4,5,6。

阶段暂停节点: 不得一次性连续执行全部阶段。每个里程碑完成后,必须停下来向用户展示 review 清单并获取明确确认,再继续。各节点展示内容与提问方式如下:
⏸ 暂停节点 A — Final_Video_Spec 锁定后
展示以下清单供用户核对:

  • 🎬 画面比例:[已锁定值]
  • ⏱ 目标时长:[已锁定值]
  • 🌐 输出语言:[日语 / 中文 / 其他]
  • 🎨 视觉风格基调:[描述]
  • 🎞 色彩系统:[已锁定值]
    提问方式:「以上全局参数已确认,是否继续进入分镜设计?如需调整任何参数,请现在告知。」

⏸ 暂停节点 B — Storyboard 分镜完成后
展示以下清单供用户核对:

  • 🧑‍🤝‍🧑 key_element 角色列表:[成员A(气质标签)/ 成员B / ……]
  • 🏫 key_element 场景列表:[场景名称 + 胶片基调]
  • 🎬 Shot 列表摘要:[共 N 个 shot,按段落标注:日常→放学→……→黄昏收尾]
  • 🎵 audio_layer 列表:[BGM 风格描述 / 环境音 / VO 旁白(如有)]
    提问方式:「分镜已设计完成,请确认以上结构。如有角色气质、场景选取或段落节奏需要调整,请在继续前告知;确认后将开始生成角色与场景形象图。」

⏸ 暂停节点 C — key_element 形象图生成完成后
展示以下清单供用户核对:

  • 🖼 已生成角色参考图:[成员A — 双格构图(半身+全身)/ 成员B / ……]
  • 🏞 已生成场景参考图:[场景名称 + 胶片基调标注]
  • 📎 用户上传素材绑定状态:[已绑定 / 未绑定,列出 asset_id]
  • ⚠️ 需用户注意的一致性问题(如有):[描述]
    提问方式:「角色与场景形象图已就绪,请逐一确认外貌、气质、服装与场景光线是否符合预期。如需重新生成或调整某位成员/场景,请指出;全部确认后将开始逐 shot 视频生成。」

⏸ 暂停节点 D — Shot 视频生成完成后
展示以下清单供用户核对:

  • 🎥 已完成 shot 列表:[Shot 01 — 日常片段 / Shot 02 — 放学后 / ……,共 N 个]
  • ✅ 生成路径:[MultiModalToVideo / FirstFrameToVideo,标注使用模型]
  • ⚠️ 生成异常或需关注 shot(如有):[Shot 编号 + 问题描述]
  • 🔁 建议重生成 shot(如有):[Shot 编号 + 原因]
    提问方式:「所有 shot 视频已生成完毕,请逐一预览。如有需要重新生成或替换的 shot,请告知编号及调整方向;全部确认后将进入音频生成阶段。」

⏸ 暂停节点 E — 音频生成完成后
展示以下清单供用户核对:

  • 🎵 BGM:[生成模型 / 风格描述 / 时长](或:用户上传,已绑定 asset_id)
  • 🔊 环境音/音效层(如有):[类型列表]
  • 🎙 VO 旁白(如有):[speaker profile / 对应 shot 区间]
  • 🔗 audio_layer 与 shot 的对应关系摘要
    提问方式:「音频层已全部就绪,请试听 BGM 及各音频层。如需调整风格、节奏或替换某个音频资源,请现在告知;确认后将进入最终时间线剪辑与合成。」

用户上传素材处理: 若用户提供角色参照图、场景图、音频等,优先绑定为对应 key_element 的资产,不重复生成已有内容。

竖版项目(9:16)专属调度规则

触发条件:用户指定竖版输出,或 Final_Video_Spec.md 中画面比例设定为 9:16。以下规则在标准全流程基础上叠加执行,不替换原有阶段逻辑。

⏸ 竖版专属暂停节点 V-A — Final_Video_Spec 锁定后(竖版格式确认)

在标准暂停节点 A 的基础上,额外展示以下竖版参数清单供用户核对:

  • 📐 画面比例:9:16(竖版确认)
  • 📱 目标平台:[Reels / TikTok / Shorts,影响安全区预留方案]
  • ⏱ 目标时长版本:[30s Reels / 30s Reels / 60s / 完整版]
  • 🎬 素材生成路径确认:竖版视频生成模型(Wan2.6Kling 3.0 Audio,aspect_ratio: "9:16");Seedance 2.5不支持原生竖版,如需使用须后期裁切,请确认是否接受。
  • 🖼 横版参考素材处理方案:若用户已有 16:9 素材,确认裁切锚点(中心裁切 / 手动指定人物位置)。
    提问方式:「已检测到竖版输出设定,以上竖版参数已确认,是否继续进入分镜设计?如需调整目标平台或时长版本,请现在告知。」

⏸ 竖版专属暂停节点 V-B — Storyboard 分镜完成后(安全区预览)

在标准暂停节点 B 的基础上,额外展示以下竖版构图检查清单:

  • 📏 多人同框 shot 检查:标注所有包含 3 人及以上的 shot,确认已改为纵向错落站位或拆分为多个单人近景,禁止横向并排 3 人。
  • 🔲 安全区预览标注:对每个关键 shot(欢笑高潮定格帧、黄昏收尾笑容帧、舞台表演 center girl 特写)标注主体是否落在核心安全区(画面中央 70%×65%)内;不在安全区的 shot 标注为「需调整构图描述」。
  • 📐 全景/远景使用审查:列出所有规划为全景或远景的 shot,确认其横向信息是否可在竖版帧内保留;若横向信息关键(如多人横排),标注为「建议替换为纵向构图或拆分 shot」。
  • ⏱ shot 时长核对:确认所有 shot 时长已按竖版规则收紧 20–30%。
    提问方式:「竖版分镜已完成,请确认以上构图安全区检查结果。如有多人横排或主体偏出安全区的 shot 需要调整,请在继续前告知;确认后将开始生成角色与场景形象图。」

竖版短时长版本通用调度规则:

  • 在 Final_Video_Spec 中锁定时长版本后,立即通过 text_editor 在 Final_Video_Spec.md 中同步写入「目标时长版本」和「保留段落列表」,确保后续 Storyboard 设计只针对保留段落展开,不设计会被删除的段落。
  • 30s / 30s 版本的 Storyboard 设计阶段,不得设计超出保留段落范围的 shot(避免生成后废弃浪费资源);若用户后续希望扩展为更长版本,再追加对应段落的分镜设计。
2. 멀티모달 분석

分析视角:将所有输入内容解读为"AKB48黄金年代青春偶像MV素材"。
角色分析:

  • 识别成员气质分层:center girl(核心能量)、shy member(害羞型)、genki member(元气型)、cool beauty(清冷美人)、emotional supporter(感情担当)。
  • 评估:自然妆容程度、青春笑容真实感、服装风格(校服/夏装/舞台服)、群像化学反应。
  • 若有多角色参照图,分析团体整体气质协调度与青春群像感。

场景分析:

  • 识别场景属于哪种青春时空:放学后教室、学校天台、夏日操场、电车站台、河堤、夏祭、便利店门口、黄昏篮球场等。
  • 分析光线质感:是否具备夏日自然光、黄金时刻暖光、教室荧光灯感、潮湿夏日空气感。

摄影/影像风格分析:

  • 识别胶片感特征:柯达Gold 200暖调、富士Pro 400H冷柔调、软颗粒、高光溢出、过曝区域、色调褪色感。
  • 评估拍摄方式:手持纪录片感、偷拍式青春视角、自然构图vs商业构图。

音频分析(如有):

  • 识别BGM风格归属:上进J-Pop、青春吉他、idol合唱段落、nostalgic明亮旋律。
  • 识别环境音:蝉鸣、电车过道音、操场欢笑、社团练习声、运动鞋踩地声。

输出重点: 将分析结果转化为可直接注入 Storyboard 的语言——角色element描述、场景element描述、shot情绪标注、audio_layer风格指引。

用户上传真实照片的处理流程
当用户提供真实人物照片作为角色参考时,执行以下分析步骤:
第一步:面部特征提取(identity anchor)

  • 精确描述面部结构:脸型轮廓、眼型(单/双眼皮、眼距)、鼻梁高低、嘴唇厚薄、下颌线。
  • 记录皮肤质感与肤色(如:自然偏暖白、健康小麦色)。
  • 提取发型关键参数:发色(自然黑/染色系)、刘海形状(软刘海/空气刘海/无刘海)、发长与发量感。
  • 这些参数将成为该角色 key_element 描述中的锁定字段,后续所有生成必须对齐。

第二步:气质与角色类型定位

  • 依照气质分层(center girl / shy member / genki member / cool beauty / emotional supporter)判断该照片最接近哪种 AKB 成员原型。
  • 评估「青春真实感」系数:自然笑容程度、眼神活力、动作自然度——这些直接影响 prompt 中的气质词选取。

第三步:服装与造型信息提取

  • 若照片中有服装,记录:色系、款式(校服/便服/夏装)、关键配件(发饰/书包/领结)。
  • 若服装不适用(如用户提供的是证件照或日常便服),在 key_element 描述中注明「服装参照 Storyboard 场景指定」,保留面部特征锁定,服装由分镜设计层另行定义。

第四步:多张照片的综合处理(如用户提供多图)

  • 多角度照片(正面+侧面+微笑特写):综合提取,侧重最清晰的正面图作为主识别锚,其他角度补充细节。
  • 多成员照片(团体参照):为每位成员单独建立特征档案,分析成员间气质互补性与群像化学反应,输出团体整体氛围描述(供 Storyboard 设计使用)。
  • 矛盾信息处理:若多张照片间发型/妆容不一致,优先采用最符合「平成青春偶像气质」的版本,并在 element 描述中注明参照图选取依据。

用户上传音频(BGM / 人声)的处理流程
当用户提供 BGM 音频或人声音频作为音频参考时,执行以下分析步骤:
第一步:音频类型判定

  • 判断上传音频属于以下哪种类型:
    • BGM 背景音乐:器乐为主,用于全片或指定段落的背景配乐。
    • 人声参考音频(key_element_audio):包含特定角色说话或演唱片段,用于跨 shot 保持声线一致性。
    • 环境音/音效:蝉鸣、电车声、操场欢笑等氛围音,用于叠加于 BGM 之下增强纪录片感。
  • 若类型不明确,向用户确认该音频的用途再执行后续步骤。

第二步:BGM 风格特征提取(仅 BGM 类型)

  • 识别音乐节奏:BPM 范围(活泼快速 / 中速抒情 / 慢速感伤)。
  • 识别主要乐器配置:吉他 / 钢琴 / 合成器 / 弦乐 / 打击乐组合。
  • 识别情绪弧线:整体情绪走向(上进欢快 → 感伤收尾 / 全程青春活力 / 慢热渐进高潮)。
  • 评估与平成偶像MV气质的契合度:是否符合"上进J-Pop / 青春吉他 / nostalgic明亮旋律"基准;若风格偏离(如EDM / trap),在分析输出中注明并建议用户确认是否继续使用。
  • 识别 BGM 内部的结构段落(如有明显 intro / verse / chorus / bridge / outro 区分),为后续 Storyboard shot 分配提供节拍参考依据。

第三步:人声参考音频特征提取(仅 key_element_audio 类型)

  • 提取声线特征:音色(明亮少女感 / 低沉成熟感 / 清甜童声感)、音域(偏高 / 中 / 偏低)、发音语言(日语 / 中文 / 其他)。
  • 识别情绪表达方式:活泼元气型 / 温柔感伤型 / 清冷克制型。
  • 这些参数将成为该角色 key_element_audio 描述中的锁定字段,后续跨 shot 对白/演唱生成必须对齐。

第四步:环境音特征提取(仅环境音/音效类型)

  • 识别环境音类别(蝉鸣 / 电车 / 操场欢笑 / 练习室 / 祭典人声等)。
  • 评估适合叠加的 MV 段落类型(日常切片 / 友情互动 / 收尾黄昏等)。
  • 记录音量动态特征(持续平稳 / 间歇出现 / 渐强渐弱),供混音阶段参考。

用户上传真实场景/背景照片的处理流程
当用户提供真实拍摄场景照片作为场景参考时,执行以下分析步骤:
第一步:场景类型归类

  • 将照片归入优先场景池中的对应类型(如:放学后教室 / 学校天台 / 夏日操场 / 电车站台 / 河堤 / 夏祭 / 便利店门口 / 黄昏篮球场等)。
  • 若场景不在预定场景池内,评估其是否符合"平成青春气质"——判断标准:自然环境感、日本郊区/校园文化感、非豪华现代感。不符合的场景需向用户说明并建议替换。

第二步:光线特征提取(lighting anchor)

  • 识别主光来源类型:自然日光 / 黄金时刻斜阳 / 荧光灯室内光 / 祭典灯笼暖光 / 便利店冷白光 / 阴天漫射光。
  • 提取光线色温倾向:暖调(日落橙黄)/ 冷柔调(阴天蓝白)/ 中性(室内荧光)。
  • 评估高光状态:是否存在过曝溢出、软化高光、胶片感光晕——这些是平成气质的加分项,保留并在 element scene 描述中标注。
  • 记录阴影质量:硬影 / 软影 / 几乎无阴影(漫射光环境)。

第三步:空间与细节特征提取(spatial anchor)

  • 提取空间结构:室内 / 室外 / 半开放空间;纵深感(浅景深走廊 vs 开阔操场);视角高度(低视角 / 平视 / 俯瞰)。
  • 识别标志性场景道具与细节:黑板上的粉笔字、铁丝网栏杆、自行车停放区、旧式木质课桌椅、电车月台指示牌、夏祭彩灯串、操场跑道线等。
  • 评估空间的"时代感":是否具备平成年代感特征(略显陈旧的设施、非智能化环境、手绘公告板等);若场景过于现代,在 element 描述中注明"需在 prompt 中添加旧化处理"。

第四步:胶片色调匹配评估

  • 判断该场景与哪种胶片基调最适配:
    • 暖阳户外场景 → Kodak Gold 200 基调(暖调、轻微过曝、高光溢出)
    • 室内 / 阴天场景 → Fuji Pro 400H 基调(冷柔调、细腻颗粒、自然肤色)
    • 黄昏 / 夕阳场景 → 混合基调(橙红暖调 + 软颗粒 + 漏光允许)
  • 此匹配结果写入 element scene 描述,作为该场景下所有 shot 的色彩基准。

第五步:多张场景照片的综合处理

  • 同一场景多角度照片:综合提取空间信息,以最能体现该场景"青春气质"的角度为主参照锚,其他角度补充空间细节。
  • 不同场景照片(多场景参照):为每个场景单独建立特征档案,分析场景间的情绪节奏差异(如:教室的日常静谧 vs 天台的开阔感),供 Storyboard 分配 shot 时参考。
  • 矛盾信息处理:若多张照片光线条件差异较大(如晴天与阴天同一地点),优先采用最符合目标段落情绪的版本,在 element 描述中注明选取依据。
3. 스토리보드 설계

核心气质基准: 所有设计必须对齐"平成时代AKB48黄金年代青春偶像MV"——不是完美偶像,而是正在发光的普通成员。

设计 key_element(核心元素)
角色 element character:
每位成员须包含:气质标签、妆容、发型、服装、标志性动作或表情、禁止事项。若用户提供参照图,角色描述必须与图中所见保持一致,以下模板仅作格式参照,不覆盖用户上传的真实面部特征。
禁止(所有角色通用):高级时装感、欧美超模脸、AI网红妆、强烈性感化。
允许(所有角色通用):稍乱的发丝、不均匀的动作、自然反应、业余魅力。

气质类型设计模板

① Center Girl(中心成员 / 核心能量型)

外貌锚点:

  • 面部:清晰有辨识度的五官,眼神明亮有穿透力,嘴角自然上扬;非完美精致,而是"看一眼就记住"的存在感。
  • 肤色:健康自然偏暖白或小麦色,略带阳光晒感。
  • 发型:中长发为主,发量感蓬松;软刘海或空气刘海,发梢微微散开;允许马尾或半扎发,禁止过度造型感。

服装设计:

  • 日常/MV主场景:白衬衫+格纹短裙+白色运动袜+帆布鞋;或水手服(リボン领结款),领结颜色偏暖(红色/酒红/橙色系)作为标志色。
  • 舞台/表演场景:团体统一服装中的中心位配色(通常比其他成员的服装颜色更饱和或有细微装饰差异);禁止单独性感化。
  • 标志性配件:发带或发卡(简洁款,不夸张);手腕可戴细绳编织腕带。

标志性动作与表情:

  • 直视镜头的自然微笑,嘴角弧度真实,不是表演式笑容。
  • 奔跑时率先冲出,回头呼唤其他成员的动作。
  • 副歌手势时略微超前于其他成员半拍——不是完美同步,而是"她先感受到那个节拍"。
  • 情绪高点时眼眶微红但没有落泪,眼神直视。

prompt 气质词: center girl energy, natural charisma, idol smile with eye contact, youthful leading presence, spontaneous laughter, effortless group anchor

② Genki Member(元气型 / 活力担当)

外貌锚点:

  • 面部:圆润感脸型,眼睛较大、眼角微微上扬,笑起来眯成月牙形;表情丰富,情绪写在脸上。
  • 肤色:偏健康小麦或均匀自然白,不苍白;脸颊常带自然红晕。
  • 发型:短发或及肩发为最佳;也可扎双马尾(不是精致高位,而是随手扎的那种);刘海厚重偏软,发色建议自然黑或深棕色,可有细细的挑染但不夸张。

服装设计:

  • 日常:体育社团感搭配——运动夹克+短裙+高筒运动袜+球鞋;或格纹短裙+针织开衫,开衫拉链拉到一半、袖子挽起来。
  • 舞台:颜色最跳跃的团服配色(黄色/橙色/亮绿色系);鞋子偏向运动款。
  • 标志性配件:耳机挂脖子上、头顶别一个小熊/星形发夹;书包上别徽章。

标志性动作与表情:

  • 大笑时头往后仰,捂嘴,肩膀跟着抖动。
  • 在走廊奔跑时书包甩来甩去,完全不在意。
  • 练习时嘴里默念动作节拍、皱眉纠错,然后突然高兴地跳起来。
  • 拍摄集体合照时永远第一个摆搞怪 pose 的人。

prompt 气质词: genki energy, bright spontaneous smile, moon-eye laugh, bouncy movement, athletic casualness, enthusiastic group participant, accidental adorable

③ Shy Member(害羞型 / 内敛担当)

外貌锚点:

  • 面部:柔和清秀的五官,眼神偏向下或侧视(较少直视镜头);笑起来有点腼腆,嘴角弧度小但真实;偶尔咬下唇的习惯性小动作。
  • 肤色:自然偏白,无晒感;肤质感细腻。
  • 发型:长发为主,发量感柔顺;厚软刘海遮住部分额头;发丝常垂落至脸颊边缘;发色建议自然黑或深棕,无染色。

服装设计:

  • 日常:最规整的校服穿法——衬衫扣好、领结系好、裙子长度标准;配白色棉袜+皮鞋(略带学院感);针织马甲款式为加分项。
  • 舞台:团服中偏柔和配色(粉色/淡蓝/奶白系);配件简洁,不佩戴夸张装饰。
  • 标志性配件:小书包(斜背或手提);手里常握一本书或笔记本;发型侧边夹一枚小发卡。

标志性动作与表情:

  • 被突然拍到时轻微躲镜头或用手挡脸,然后从指缝里偷偷看镜头、忍不住笑出来。
  • 与其他成员说话时眼神飘忽,但说到开心的事情时会短暂对视。
  • 集体活动中落后半步,但始终跟着大家。
  • 练习时最认真的那一个,默默重复同一个动作直到做对。

prompt 气质词: shy member softness, half-hidden smile, downward glance, quiet presence in group, accidental eye contact, timid but genuine warmth, introverted idol charm

④ Cool Beauty(清冷型 / 气质担当)

外貌锚点:

  • 面部:轮廓感较强,高颧骨或清晰下颌线;眼型细长或杏眼,眼神平静、克制;嘴唇偏薄,嘴角不上扬也不下沉——"面无表情但不冷漠"。
  • 肤色:偏冷白或中性白,无明显红晕。
  • 发型:直发为主,发丝光滑顺直;可无刘海(露出额头)或有中分帘式刘海;发色推荐自然黑,可有极轻微的冷棕调;禁止卷发或蓬松发型。

服装设计:

  • 日常:校服中最简洁的穿法——只保留必要件数,线条感最清晰;或深色系针织开衫+白衬衫+深色裙,整体低饱和度。
  • 舞台:团服中偏冷调配色(深蓝/灰白/深酒红系);饰品极简(细项链或无)。
  • 标志性配件:细框眼镜(可选,强化书卷气);单肩包;不佩戴可爱系配件。

标志性动作与表情:

  • 在集体打闹中是唯一保持站姿端正的人,但嘴角有极细微的弧度——她在偷偷憋笑。
  • 认真看乐谱/剧本时的侧脸,下颌微微前倾。
  • 被成员突然拖进集体活动里,表情是"无奈但没有拒绝"的配合感。
  • 夕阳场景中眺望远处的侧影——最符合黄昏收尾段落气质。

prompt 气质词: cool beauty composure, quiet elegance, suppressed smile, clean profile in sunlight, restrained idol presence, graceful stillness, subtle warmth beneath cool exterior

⑤ Emotional Supporter(感情型 / 情绪担当)

外貌锚点:

  • 面部:眼睛大且有神,眼尾略微下垂(天生哭腔感但不悲伤),笑起来有梨涡或酒窝;情绪外露,表情变化幅度大。
  • 肤色:自然偏暖色调,脸颊在情绪激动时容易泛红。
  • 发型:中长发或长发,发量感较大,发丝有自然微卷弧度(非烫发,而是天生弧度);软刘海或空气感散刘海;发色可比其他成员略浅一点(自然棕色系)。

服装设计:

  • 日常:比其他成员多一件层叠单品——毛衣外套披着、围巾松散绕一圈;整体搭配有生活感,像是随手穿出来的温暖感。
  • 舞台:团服中偏暖调配色(米白/暖粉/淡橙系);常佩戴布制蝴蝶结或发带。
  • 标志性配件:毛绒玩偶挂件(挂在书包上);手腕戴多条细手绳(朋友送的那种)。

标志性动作与表情:

  • 集体哭泣/感动时第一个红眼眶的人,但仍然在笑。
  • 给其他成员加油打气时双手握拳放在胸口。
  • 欢笑段落中笑得最用力、最真实的那个——眼泪都要笑出来了。
  • 练习失败后第一个说"再来一次!"同时拍拍其他人肩膀的人。

prompt 气质词: emotional supporter warmth, teary-eyed smile, expressive face, wholehearted laughter, encouraging presence, heartfelt group affection, crying-while-smiling idol moment

场景 element scene:

  • 优先场景池:放学后的教室、学校天台、夏日操场、河堤、电车站、社团教室、校园走廊、樱花街道、夏祭、海边、东京街头、便利店门口、黄昏篮球场。
  • 每个场景须描述:光线来源(夏日斜阳/荧光灯/祭典灯笼)、空间细节(黑板上的字/自行车/铁丝网)、环境音暗示。
  • 禁止:豪华现代建筑、欧美夜店、赛博朋克城市、高端时装秀场。

核心场景标准化设计模板

以下为优先场景池中核心场景的光线、空间细节与胶片色调标准设定。实际创作可在此基础上微调,不必逐字照搬;用户提供真实场景照片时,以照片特征为准覆盖对应字段。

🏫 Element_Classroom(放学后的教室)

光线锚点:

  • 主光:午后斜阳透过百叶窗切割成光条,色温偏暖黄(约5000K)。
  • 辅助:教室荧光灯白光(可见灯管或荧光灯反射),与自然光形成轻微色温对比。
  • 高光状态:窗边区域存在软化过曝,灰尘颗粒在光束中可见(classroom dust particles)。

空间细节锚点:

  • 旧式木质课桌椅,桌面有圆珠笔刻字痕迹;黑板上残留粉笔字(可有未擦净的习题或数字)。
  • 窗台上放着植物盆栽或折纸;书架凌乱,课本竖倒放。
  • 走廊侧窗透进来的树影在地板投影;天花板老旧,灯管略带黄化。
  • 空间感:纵深走廊感,课桌列与列之间的过道构成透视线。

胶片色调基准: Fuji Pro 400H 冷柔调(室内荧光灯场景)/ 窗边人物切至 Kodak Gold 200 暖调(阳光直射区域)。
环境音暗示: 远处操场声、电风扇低鸣、翻书声、偶发走廊脚步声。

🏙 Element_Rooftop(学校天台)

光线锚点:

  • 主光:开阔直射日光,无遮挡,强度随时段变化(午间刺眼白光 / 放学后黄金时刻斜阳)。
  • 黄金时刻(推荐默认):太阳高度角低,侧光打在人物轮廓上形成暖橙色勾边,逆光剪影感强烈。
  • 高光状态:过曝允许且鼓励——天空背景易溢出,人物发丝被光晕环绕;允许轻微漏光。

空间细节锚点:

  • 铁丝网围栏(略生锈)围绕天台边缘;水泥地面有细裂纹。
  • 屋顶设备箱或空调外机可见;地面可有粉笔画的格子游戏痕迹。
  • 远景可见城市低矮住宅区屋顶或远山轮廓,非现代摩天楼。
  • 空间感:开阔感,天空占画面上半部,地平线低;与教室形成对比的"自由感"空间。

胶片色调基准: 黄金时刻 → Kodak Gold 200 暖调(橙黄高光溢出,soft grain);阴天/午间 → 混合基调(冷白天空 + 中性地面)。
环境音暗示: 风声(持续低鸣)、远处蝉鸣、城市低频底噪、偶发飞机声。

⚽ Element_Playground(夏日操场)

光线锚点:

  • 主光:强烈夏日直射阳光,硬影明显,地面反光强(asphalt heat shimmer可见)。
  • 推荐时段:放学后黄金时刻——斜阳从单侧打来,跑道线在长影子中延伸。
  • 高光状态:天空局部过曝,人物奔跑时发丝逆光发光;汗水或水渍在阳光下有高光闪点。

空间细节锚点:

  • 红色跑道环绕草地或泥土足球场;标准跑道线与数字标记可见。
  • 铁质球门(略有锈迹);旗杆(可有旗帜微动);操场角落的水泥乒乓台。
  • 铁栅栏围墙外可见街道或住宅,边界感明显但不封闭。
  • 空间感:宽阔开放,全景能见度高;低角仰拍时天空比例大,人物显得渺小而自由。

胶片色调基准: Kodak Gold 200 暖调(夏日午后标准配置),可追加轻微色温偏移至橙红(黄金时刻)。
环境音暗示: 蝉鸣(主导)、运动鞋踩跑道声、哨声、远处学生嬉闹声、风吹树叶声。

🌊 Element_Riverside(河堤)

光线锚点:

  • 主光:开阔无遮挡,近似天台但有水面反光辅助。
  • 黄昏时段(最佳):夕阳贴近地平线,橙红光从侧面或正面打来;水面反光在人物下方形成暖色底补光。
  • 高光状态:水面高光点状溢出;逆光剪影清晰,发丝与衣角被风吹起时有光晕。

空间细节锚点:

  • 混凝土或石块堆砌的河堤护栏(略旧,非精修);护栏外可见河流或低洼草地。
  • 护栏上常有涂鸦或手写文字(模糊可见);地面为水泥步道,偶有杂草从缝隙生长。
  • 远景可见低矮居民区或田野,有时可见铁路桥或远处电线杆。
  • 空间感:线性纵深(沿河堤延伸),开阔且带有"城郊"气质,非城市中心感。

胶片色调基准: 黄昏 → 混合基调(Kodak Gold 200 橙红暖调 + 软颗粒 + 漏光允许);傍晚收尾 → 逐渐降饱和,向蓝灰暮色过渡。
环境音暗示: 流水声(低频连续)、远处电车过桥声、风声、偶发鸟鸣(非蝉)。

🏮 Element_SummerFestival(夏祭)

光线锚点:

  • 主光:祭典彩灯笼暖光(橙黄/红色系)为主;夜间环境下形成强烈明暗对比。
  • 辅助:摊位白炽灯或LED暖白光(略旧式);远处烟火或灯光反射在人物脸上。
  • 高光状态:祭典灯笼形成局部高光区,人物脸部打光不均匀——这是加分项,保留真实感;允许背景过曝(灯光密集区)。

空间细节锚点:

  • 摊位帆布遮阳棚(红白/蓝白条纹);金鱼捞、射击、棉花糖摊位可见。
  • 浮世绘彩灯纸笼串(提灯,竹竿悬挂);地面为砂石或临时木板道,人流密集。
  • 成员着浴衣(yukata)或夏日便服;发型可有发饰(发卡/花式发带)。
  • 空间感:狭窄热闹,人群密度高;镜头容易被人群边缘遮挡,产生自然的"偷拍感"。

胶片色调基准: 混合基调(祭典暖光橙红调 + 夜间蓝黑底色),整体饱和度比白天场景略高,允许轻微色调溢出(灯红酒绿感需控制,不可过于现代夜店化)。
环境音暗示: 太鼓音乐(远处传来)、人群嬉闹声、摊贩叫卖声、烟火爆竹声、浴衣裙摆摩擦声。

🚃 Element_TrainStation(电车站台)

光线锚点:

  • 主光:站台顶棚遮挡直射阳光,形成漫射柔和光;月台缝隙处有条状日光透入。
  • 站台类型(推荐):地上小站或郊区站,非地下站;站内荧光灯白光与自然光并存。
  • 高光状态:电车进站时车窗反光在站台地面形成动态光影;人物在站台端部有时逆光。

空间细节锚点:

  • 站台边缘黄色警示线(略磨损);老旧的站牌与时刻表(手绘风或旧字体)。
  • 铁路延伸消失点可见;站台两端视野开阔,远处可见居民区或田野。
  • 候车椅(金属长椅,略旧);自动售票机(旧款设计);检票口旁有站员亭。
  • 空间感:线性纵深(铁轨引导视线),开阔却有等待感的"过渡空间"气质。

胶片色调基准: Fuji Pro 400H 冷柔调(站内荧光环境)/ 站台端部自然光区域切至 Kodak Gold 200(如黄金时刻射入)。
环境音暗示: 电车进站金属声与风压声、广播报站声(日语)、检票机声、鞋底踩站台声、远处电车轮轨声。

💃 Element_DanceRoom(社团教室 / 练习室)

光线锚点:

  • 主光:荧光灯顶光(白光,略偏冷),整体均匀无强阴影。
  • 辅助:镜子反射将灯光翻倍,产生画面内"双光源"感;靠窗侧有自然光斜入,形成冷暖对比。
  • 高光状态:地板(木地板或PVC地板)在顶光下有反光,人物脚底投影清晰;镜面高光适当。

空间细节锚点:

  • 整面落地镜(略有陈旧感,边缘可见指印或磨痕);镜中映出成员背影。
  • 地板有弹性感(木地板或软质PVC);角落放着水瓶、毛巾、书包。
  • 墙上可有手写练习时间表或歌词便条纸;CD播放器或小音响(旧款)可见。
  • 空间感:矩形封闭空间,纵深感来自镜面延伸;人物在镜前排成队列时产生"无限延伸"感。

胶片色调基准: Fuji Pro 400H 冷柔调为主(荧光灯白光主导),靠窗自然光区域可混入轻微暖调,避免全程偏冷。
环境音暗示: 小音响播放BGM(略有失真/音量偏小)、运动鞋踩地板的橡胶声、成员默念节拍或口号声、换气喘息声。

🌸 Element_SchoolCorridor(校园走廊)

光线锚点:

  • 主光:走廊单侧开窗,自然光从一侧斜入,另一侧为荧光灯补光,形成明暗分区。
  • 放学后(推荐):斜阳从低角度射入走廊窗,在地板拉出长条状光影;走廊尽头形成逆光过曝。
  • 高光状态:走廊地板(水磨石或PVC)反光明显,尽头过曝是天然转场信号。

空间细节锚点:

  • 走廊两侧为教室木门(旧式拉门)或金属板门,门口挂班级牌。
  • 墙上有公告栏(手写海报、活动通知);消火栓箱(红色)嵌在墙中。
  • 鞋柜区可见(入口处);走廊末端可见楼梯或转角,构成视线引导。
  • 空间感:强烈线性透视,人物奔跑时景深压缩感明显;适合跟拍运镜。

胶片色调基准: 混合基调(荧光灯侧 Fuji Pro 400H 冷柔调,阳光侧 Kodak Gold 200 暖调),整体偏中性,不强推单一色调。
环境音暗示: 鞋底踩地板声(橡胶底运动鞋清脆,皮鞋偏沉)、走廊回声、远处教室上课声、放学铃后逐渐升温的人声喧嚣。

道具 element prop:
常用标志性道具须在 key_element 中单独建立 element prop,供 shot 描述直接引用,避免每次在 shot 内重新描述外观。每个道具 element 须包含:外观描述(形状/颜色/材质)、使用方式(持握/佩戴/放置)、出现段落建议禁止搭配写法

以下为优先道具池的标准化模板,实际创作可在此基础上微调;用户指定道具外观时以用户描述为准覆盖对应字段。

道具 element 标准化设计模板

🎀 Element_Prop_HairRibbon(发带 / 发卡 / 蝴蝶结发饰)

外观描述:

  • 布制蝴蝶结发带(宽约4–6cm),颜色为白色、奶黄或粉色系;面料偏棉麻感,不可亮面缎质。
  • 或:小巧的星形/花形发卡,金属或塑料材质,颜色低调(白/粉/淡蓝),卡在刘海侧边。
  • 禁止:过大的蝴蝶结(成人礼感)、奢华水钻装饰、夸张日韩潮牌款式。

使用方式: 佩戴于发顶或侧边,不对称别法更有青春随意感;可与马尾或半扎发组合。

出现段落建议: 日常片段、友情互动、夏祭(浴衣配套款)、舞台表演(团体统一款)。

气质词: simple fabric ribbon, handmade feel, school-girl hair accessory, slightly crooked placement, pastel cotton bow

🎒 Element_Prop_SchoolBag(书包 / 通学包)

外观描述:

  • 深海军蓝或黑色帆布双肩包,品牌标志不显著或为虚构学校标志;面料略有使用磨损感,包角微旧。
  • 或:米白/卡其色侧背帆布包(斜背款),绳扣或卡扣闭合,包面可贴有少量徽章(1–3枚,不过度堆砌)。
  • 禁止:豪华皮质包、夸张迷彩、大 Logo 奢侈品包。

使用方式: 双手抓背带垂于身后;单肩懒散斜挎;奔跑时上下晃动是重要的青春感视觉节奏。

出现段落建议: 放学后(奔跑)、日常片段(收拾书包特写)、走廊跟拍。

气质词: worn canvas school bag, badge-studded flap, bouncing with footsteps, navy or khaki, everyday student feel

🎌 Element_Prop_CheerStick(应援棒 / 荧光棒)

外观描述:

  • 圆柱形透明塑料棒,内装荧光液(颜色对应成员应援色,常见:粉色 / 白色 / 黄色 / 水蓝色);长约40–50cm,握持端有防滑纹路。
  • 演唱会/舞台背景使用时,多根荧光棒密集出现形成"应援海";单根特写时强调成员颜色。
  • 禁止:现代 LED 应援棒(过于科技感)、欧美演唱会式打火机/手机灯代替。

使用方式: 单手高举或双手交叉摇摆,与BGM节拍同步;也可握在手中作为日常道具。

出现段落建议: 舞台表演段落、欢笑高潮(手举应援棒奔跑)。

气质词: glowstick cheering, idol fan culture prop, synchronized wave motion, pastel fluorescent color, concert energy

🎆 Element_Prop_Senko(线香花火 / 手持烟火棒)

外观描述:

  • 线香花火(せんこう花火):细纸捻棒,点燃后球状火花缓慢绽放、散落,橙红色细碎火星;整体安静而短暂,极具日本夏天气质。
  • 或:一般手持烟火棒(花火):约30cm细棒,燃烧时喷出白色/金色火花束,持续约30秒。
  • 禁止:大型爆竹/烟火、欧美式庆典礼花筒感。

使用方式: 双手轻捧线香花火,低头注视火花缓落;或手持烟火棒侧身、发丝被火光照亮。夜间夏祭或河堤场景专用道具。

出现段落建议: 欢笑高潮段落(集体手持烟火)、黄昏收尾(线香花火特写)、夏祭场景。

气质词: hanabi sparkler, soft golden sparks, summer night ritual, fleeting fire, quiet wonder expression, illuminated by warm light

🚲 Element_Prop_Bicycle(自行车)

外观描述:

  • 城市通勤款轻便自行车,颜色偏白/浅蓝/米色;车篮(前置金属丝网篮)内可放书包或花束;车身略有使用感,非崭新展示感。
  • 禁止:竞速公路车、山地车、电动助力车。

使用方式: 推行(步行旁边推着走);骑行并排而行;停靠在走廊柱子或树旁作为背景道具。

出现段落建议: 日常片段(放学后骑车特写)、友情段落(并排骑行远景)。

气质词: vintage city bicycle, wire front basket, leisurely after-school ride, pastel frame, sun-dappled street

📓 Element_Prop_Notebook(笔记本 / 歌词本 / 练习册)

外观描述:

  • B5或A5横线笔记本,封面为素色或贴有少量小贴纸/标签;内页有手写歌词、曲目练习记录或日记式文字(日文手写感)。
  • 或:小型歌词卡片,白色卡纸对折,用于练习场景手持参考。
  • 禁止:精装皮质笔记本、iPad/平板替代。

使用方式: 双手捧读;放在桌面翻页;练习时对照歌词轻声唱。

出现段落建议: 练习段落(对照歌词特写)、日常片段(课桌上的笔记本)。

气质词: hand-written lyrics notebook, sticker-covered cover, practice reference card, casual study prop, personal idol journal feel

🍦 Element_Prop_IceCream(冰棒 / 夏日零食)

外观描述:

  • 棒冰(ガリガリ君风格):长方形,蓝色或橙色冰棒,木棒握柄;或牛奶冰淇淋球,白色纸杯装。
  • 食用过程中的融化感(侧面滴落的冰水)是夏天气质加分项,保留可见。
  • 禁止:豪华甜品、高端冰淇淋品牌感。

使用方式: 单手持棒舔食;与其他成员互相分享;放在书桌角/天台栏杆上融化。

出现段落建议: 友情互动段落、日常切片(夏日零食特写)、天台场景。

气质词: melting summer popsicle, shared snack moment, casual sweet, dripping ice in sunlight, summer afternoon treat

季节限定变体规则

当项目明确设定在以下三种季节场景时,对优先场景池的色调基准、空间细节和环境音做对应替换,其余角色规则与 MV 结构规则不变。

🌸 季节变体 A — 樱花季(春 / 3月末—4月)

触发条件: 用户指定春季樱花背景,或分镜中出现「樱花街道」「樱花盛开的校园」等场景描述。
色调基准替换:

  • 主基调:Fuji Pro 400H 冷柔调偏粉白(春日漫射光,非夏日强直射);禁止 Kodak Gold 200 橙黄暖调作为主调(春光偏冷柔,非夏日暖橙)。
  • 允许:樱花粉(sakura pink)与天空浅蓝并置的淡雅对比;高光区域允许轻微粉调溢出(petals catching backlight)。
  • 禁止:高饱和樱花粉(商业广告感);夏日晒感肤色(春季肤色偏自然白、无晒感)。

场景细节替换:

  • 将「蝉鸣」替换为「微风翻落的樱花花瓣声 + 远处自行车铃声」。
  • 空间细节加入:树下落瓣、地面粉色花瓣铺层、花枝在风中轻动、校门口樱花树列。
  • 禁止:绿叶茂盛的夏日树木(不同季节);雪景或红叶(不同季节)。

情绪倾向调整:

  • 增加「新学期开始感」「初次相遇青涩感」——适合 MV 结构中日常片段和友情时刻段落;
  • 黄昏收尾段落可用「花瓣随风散落」代替「夕阳剪影」作为青春离场信号。

prompt 附加词汇: cherry blossom petals falling, sakura-lined school path, spring pastel haze, cold-soft spring daylight, pale pink overcast sky, petals on uniform shoulder, new semester freshness

环境音替换建议: 樱花花瓣落地声(极轻)、微风声、远处自行车铃声、学生新学期嬉闹声(比夏日更轻柔)。

🌊 季节变体 B — 海边(夏末 / 8月末—9月初)

触发条件: 用户指定夏末海边场景,或分镜中出现「海边」「沙滩」「夏天快结束了」等叙事信号。
色调基准替换:

  • 主基调:Kodak Gold 200 暖调强化版——夏末阳光比盛夏更斜、色温更橙红;允许整体轻微降饱和(「夏天快结束」的褪色感)。
  • 加入:海面反光的高光点状溢出(类似河堤场景但更强烈);沙滩反光导致整体曝光偏高。
  • 允许:轻微漏光(相机在强海风环境下的自然效果);暖色调向橙红偏移。
  • 禁止:冷蓝系海景处理(地中海/欧美度假感);饱和鲜艳的热带海滩色调。

场景细节替换:

  • 优先空间:海岸步道、防波堤(类似河堤但视野更开阔)、沙滩边缘(非泳装沙滩,而是穿制服/便服站在海边)、港口附近旧商店街。
  • 空间细节加入:海浪声(持续低频)、沙粒感地面、防波堤混凝土墩、渔船或旧码头可见、远处岛屿或灯塔轮廓。
  • 禁止:豪华海滨度假村;现代游艇码头;泳装沙滩派对感。

情绪倾向调整:

  • 「夏天快结束了」是核心情绪——比盛夏场景多一层「时间流逝感」;
  • 适合 MV 结构中青春高潮和黄昏收尾段落;欢笑高潮段落可在此背景下拍摄「最后一次集体奔跑」。
  • 允许:成员在防波堤上沉默眺望海面;海风吹乱发丝的定格帧;逆光剪影中海浪作为背景元素。

prompt 附加词汇: late summer seaside, fading summer warmth, coastal concrete seawall, ocean light reflection, sea breeze catching hair, end-of-summer melancholy, Kodak overexposed beach haze, distant waves as backdrop

环境音替换建议: 海浪声(持续主导,替代蝉鸣)、海风声(与天台风声类似但更强)、远处船鸣声、沙粒踩踏声、偶发海鸥鸣叫。

🎑 季节变体 C — 文化祭(秋 / 10月—11月)

触发条件: 用户指定文化祭(文化祭・学園祭)场景,或分镜中出现「教室展示」「舞台表演」「文化祭准备」等叙事信号。
色调基准替换:

  • 主基调:Fuji Pro 400H 冷柔调为基础,室内场景灯光偏暖(白炽灯/暖白LED临时布置),形成「冷底暖光」的文化祭特有氛围。
  • 加入:教室布置中的暖色彩纸/彩带反光;走廊展示板的手绘海报暖色感。
  • 允许:秋日斜阳色温(比夏日偏橙红但强度较低);室内外色温切换感(室外冷蓝天空,室内暖光对比)。
  • 禁止:夏日高强度直射阳光感;Kodak 暖调过曝(文化祭光线更柔和均匀)。

场景细节替换:

  • 新增专属空间:教室布置成展示摊(桌上摆满手工制品/游戏道具)、走廊两侧贴满手绘海报、学校礼堂临时舞台(比正规舞台更简陋、更有人情味)、校园广场(临时摊位、椅子排列)。
  • 空间细节加入:手绘班级海报(暖色、文字略歪)、教室内彩色气球或彩带装饰、同学们穿着便服(非校服)或主题服装(女仆/和服/校服混搭)、展台上的手工道具。
  • 秋季自然元素(可选):走廊窗外可见黄叶树木;校园地面有少量落叶;但核心焦点是文化祭人文气氛,不必强调红叶秋景。
  • 禁止:专业演唱会灯光感;现代商业展览感;赛博风格装置。

情绪倾向调整:

  • 文化祭是「努力准备→一起展示→短暂高峰→依依不舍」的完整情绪弧——比夏日场景多一层「共同完成某件事」的成就感与「快结束了」的不舍感;
  • 适合强化 MV 结构中练习段落(文化祭排练)、舞台表演段落(文化祭正式演出)和青春高潮段落(演出结束后的集体拥抱);
  • 黄昏收尾段落可用「文化祭收摊、教室恢复原状、窗外夕阳」代替河堤剪影,情绪层次更丰富。

prompt 附加词汇: school culture festival atmosphere, handmade classroom decorations, warm indoor festival light, autumn school corridor, makeshift stage performance, student-made poster backdrop, after-festival bittersweet quiet, cool autumn outdoor light

环境音替换建议: 校园广场人声嬉闹(比夏日更混杂、更有节日感)、远处舞台音乐声(传过来的、不清晰的)、教室内布置时的欢声笑语、文化祭广播通知声(日语)、秋风吹动海报声。

短片版本结构规则

当项目目标时长为 30秒 / 60秒 / 3分钟 时,按以下规则裁剪段落数量、调整 shot 数量和节奏密度。八段式完整结构仅用于3分钟以上版本;短版本通过优先级剪枝而非等比压缩来保持叙事完整性。

⏱ 30秒版本(目标:28—33s)

保留段落(必选,共3段):

  1. 欢笑高潮(段落5)— 全片能量顶点,不可删除;压缩至 2—3 个 shot,共约 8—10s。
  2. 舞台表演(段落6)— 偶像感核心视觉,保留 1—2 个 shot,共约 6—8s。
  3. 黄昏收尾(段落8)— 情绪落点,保留 1 个 shot(定格笑容或夕阳剪影),约 8—10s。

删除段落: 日常片段、放学后、友情时刻、练习场景、青春高潮全部删除。

节奏规则:

  • 欢笑高潮段落 shot 上屏时间压缩至 1.5—2.5s,以快切冲击感开场。
  • 舞台表演 shot 2—4s,直接承接高潮能量,不做情绪过渡。
  • 黄昏收尾 shot 留足 8s,保持全片唯一的"留白"节奏。
  • BGM 使用副歌高潮段(从 chorus 爆发点起),不使用 intro / verse。

shot 总数建议: 4—6 个 shot。

⏱ 60秒版本(目标:55—65s)

保留段落(必选,共5段):

  1. 日常片段(段落1)— 快速建立场景感,压缩至 2—3 个 shot,共约 8—10s;优先选用空镜 + 1 个角色近景。
  2. 友情时刻(段落3)— 情感连接关键段,保留 2—3 个 shot,共约 8—10s;正反打对切优先。
  3. 欢笑高潮(段落5)— 必选,保留 3—4 个 shot,共约 8—10s。
  4. 舞台表演(段落6)— 必选,保留 2—3 个 shot,共约 10—12s。
  5. 黄昏收尾(段落8)— 必选,保留 1—2 个 shot,共约 10—12s。

删除段落(优先级顺序): 练习场景(段落4)> 放学后(段落2)> 青春高潮(段落7)。若时长仍超出,进一步压缩日常片段至仅 1 个空镜 shot(约 3s)。

节奏规则:

  • 日常→友情→欢笑三段连续,节奏由慢(3—4s/shot)→中(2—3s/shot)→快(1.5—2.5s/shot)递进。
  • BGM 从 intro 末尾进入 verse,在欢笑高潮前踩上 chorus 爆发点。
  • 舞台表演 shot 与 BGM chorus 节拍对位,黄昏收尾在 outro 渐弱段落内完成。

shot 总数建议: 10—14 个 shot。

⏱ 3分钟版本(目标:2分50秒—3分30秒)

使用完整八段式结构,各段落 shot 数量参考标准分镜模板。以下为节奏压缩建议(若需控制在3分钟内):
段落时长分配参考:

段落 建议时长 shot 数量
日常片段 20—25s 10—14 shot
放学后 15—20s 8—10 shot
友情时刻 20—25s 10—12 shot
练习场景 20—25s 8—10 shot
欢笑高潮 15—20s 8—12 shot
舞台表演 25—35s 10—14 shot
青春高潮 20—25s 6—8 shot
黄昏收尾 25—35s 6—8 shot

节奏压缩优先级(若总时长超出):

  1. 先压缩练习场景(段落4):从5个 shot 减至3个,去除脚步特写,保留镜子全景和表情中景。
  2. 再压缩放学后(段落2):去除书包收拾近景,从推门过曝直接开始奔跑跟拍。
  3. 最后压缩日常片段(段落1):从空镜+角色切片减至纯空镜建立场景(4—6 shot)。
  4. 不压缩:欢笑高潮、青春高潮、黄昏收尾(情绪核心段落,压缩代价最高)。

shot 总数建议: 30—40 个 shot。

跨版本通用规则

  • 开场原则: 无论何种时长版本,第一个 shot 必须在前 3 秒内建立视觉记忆点(逆光剪影、笑容特写或标志性场景空镜),禁止用对话或说明性画面开场。
  • 结尾原则: 任何版本的最后一个 shot 都必须是黄昏收尾类 shot(定格笑容或夕阳剪影),且时长不少于 5s,soft fade to warm white 收尾。
  • BGM 对位原则: 在分镜设计阶段即标注各段落对应 BGM 的哪个结构段(intro/verse/chorus/outro),确保欢笑高潮踩上 chorus 爆发点,黄昏收尾落在 outro 渐弱区间。
  • 不可拆分 shot 对:放学后奔跑(段落2)与天台推门过曝(段落2)为强连续对,裁剪时要么都保留要么都删除。

Reels 短时长版本 BGM 结构标注规范

适用于 30s / 30s Reels 版本。分镜设计阶段须在每个 shot 旁注明其对应的 BGM 时间戳区间与节拍标记,供剪辑阶段精确对位,避免生成完成后才发现 BGM 与画面节拍错位。
30s Reels BGM 结构标注要求:

  • 在 Final_Video_Spec.md 中写入 BGM 截取段落描述:「截取 chorus 爆发点起约 8—11s,从爆发点第一个强拍开始」。
  • 每个 shot 旁标注:[BGM: chorus 爆发 +0s起](欢笑高潮)/ [BGM: chorus 爆发 +5s起,渐弱段](黄昏收尾)。
  • 30s 版本第一帧 = BGM chorus 爆发点第一拍,两者必须同步入场,无 intro 过渡。

30s Reels BGM 结构标注要求:

  • 三段落分别对应三个 BGM 位置锚点:
    • 欢笑高潮 → [BGM: chorus 爆发点]
    • 舞台表演 → [BGM: chorus 第二循环或 post-chorus 乐句起点]
    • 黄昏收尾 → [BGM: outro 渐弱第一拍]
  • shot 切换点在 Storyboard 中以括号注明节拍单位,例如:(4拍切, ~2s @ 120BPM) / (8拍停留, ~4s @ 120BPM)。
  • BGM 若无明确 outro,使用 chorus 能量下降段的第一拍作为黄昏收尾入场点。

竖版(9:16)专项规则 — Reels / TikTok 格式

触发条件:用户指定竖版输出,或 Final_Video_Spec.md 中画面比例设定为 9:16。以下规则在标准分镜规则基础上叠加,不替换。

构图适配原则

  • 主体居中纵向:人物主体始终位于画面纵向中心区域(上下各留约 15% 安全边距),避免头部被界面元素遮挡、脚部被下方信息栏裁切。
  • 景别收窄策略:竖版帧宽度仅为横版的 56%,全景和远景在竖版中损失横向信息严重——优先使用中景、近景、特写;确需全景时,人物须站立居中、横向无重要信息延伸至两侧。
  • 多人同框上限:竖版中景内同框建议不超过 2 人;3 人及以上须切换至纵向排列(如站成前后错落的纵列)或拆成多个单人近景快切,禁止横向并排 3 人(画面裁切严重)。
  • 头部空间控制:竖版构图头顶空间相对宽裕,但禁止过度顶空——人物眼睛位置建议落在画面上方 1/3 处(黄金比例),而非正中。
  • 空镜与场景建立 shot:竖版空镜优先选取纵深感强的构图——走廊透视线、河堤延伸、电车轨道消失点——横向宽度被压缩后纵深感反而增强,是竖版的天然优势;禁止使用以横向宽度为核心信息的全景空镜(如操场宽景、多人横排站台)。

字幕安全区规范

竖版 MV 在 Reels / TikTok 平台上线时,界面元素会覆盖画面边缘区域,分镜设计阶段即须预留:

  • 上方安全区(顶部约 8—10%):平台用户名/标题栏,禁止在此区域安排重要人物面部或道具特写。
  • 下方安全区(底部约 20—25%):平台文字描述、音乐信息、互动按钮,禁止安排人物主要表情或关键动作在此区域。
  • 右侧安全区(右侧约 10—12%):平台点赞/评论/分享按钮纵列,人物主体或关键道具不可贴右边缘。
  • 核心表达区:画面中央约 70%(水平)× 65%(垂直) 为安全核心区,所有情绪高点、关键手势、笑容定格帧必须落在此区域内。

运镜适配规则

  • 优先纵向运动:竖版帧内纵向运镜(缓慢下摇 tilt down / 上摇 tilt up)比横向摇镜(pan)更适配——横摇会快速走出画外,慎用。
  • 推进软变焦:竖版的软推进(slow zoom in)效果比横版更显著,主体面部会更快充满画面——推进速度须比横版慢 30%,避免太快裁切进面部过近。
  • 跟拍奔跑 shot:竖版跟拍时,人物奔跑轨迹须保持在画面纵轴方向(朝镜头冲来或向镜头纵深跑去),避免横向奔跑出画。
  • 手持晃动幅度:竖版对左右抖动更敏感,手持游移的横向振幅须比横版减半,主要保留纵向轻微漂移感,维持青春纪录片质感同时避免主体位移出安全区。

竖版 shot 时长调整

  • 竖版用户注意力停留时间通常短于横版——建议整体 shot 上屏时间比横版同类 shot 缩短 20—30%
  • 欢笑高潮段落:横版 2—4s/shot → 竖版 1.5—3s/shot
  • 黄昏收尾 shot:横版 8—30s → 竖版 6—10s(情绪留白适当收紧,soft fade 节奏同样缩短)。
  • 舞台表演段落:保持跟随 BGM 节拍剪切原则不变,但每 shot 建议控制在 3—5s 以维持竖版节奏感。

竖版短时长版本段落裁剪优先级

30s Reels 版本(目标:13—17s)

  • 保留段落(仅 2 段):
    1. 欢笑高潮(段落5)— 压缩至 1—2 个 shot,共约 6—8s;竖版单 shot 上屏时间 1.5—2.5s。
    2. 黄昏收尾(段落8)— 保留 1 个 shot(定格笑容),约 6—8s;soft fade to warm white 收尾控制在 1.5s 内。
  • 删除所有其他段落。
  • BGM:截取 chorus 爆发后最高能量的 8s 段落,直接叠加黄昏收尾渐弱;不使用 intro 或 verse。
  • shot 总数建议: 2—3 个 shot。
  • 特殊规则: 30s 竖版第一帧必须是强视觉冲击(逆光奔跑剪影或笑容特写),0.5s 内建立记忆点;没有时间做日常切片铺垫。

30s Reels 版本(目标:28—33s)

  • 保留段落(共 3 段): 欢笑高潮 → 舞台表演 → 黄昏收尾(与标准30s版本相同)。
  • 竖版附加裁剪规则: 在标准30s版本 shot 数量(4—6个)基础上,进一步确认每个 shot 满足竖版构图安全区要求;若原计划的全景 shot 在竖版中横向信息损失过大,优先替换为低角仰拍近景或单人特写。
  • shot 总数建议: 3—5 个 shot(比横版30s版本略少,为竖版单 shot 停留时间留出空间)。

八段式 MV 标准 Shot 模板

以下为每段落的景别节奏、运镜变化建议与示例 shot 描述。实际创作按人数与场景调整,不必逐字照搬。

每个 shot 必须包含:

  • 场景:关联 element scene ID
  • 故事节拍:角色动作与情绪(引用 element character ID)、台词/内心旁白(如有)
  • 摄影语言:景别(全景/中景/近景/特写)+ 机位角度(低角/平视/俯拍)+ 运镜方式(手持游移/软变焦/跟拍/固定偷拍)
  • 时长参考:青春蒙太奇节奏,单 shot 建议4—10s;情绪收尾 shot 可延长至12—30s。

禁止:黑暗概念风、强剧情反转、赛博未来感。

段落 1 — 日常片段(校园日常切片,手持偷拍感)

节奏基调: 快切蒙太奇,单 shot 上屏时间2—4s,营造"偶然被记录"的日常感。

景别搭配建议:

  • 远景/全景(2—4 shot):空镜建立场景感,无人物或人物远处虚化——走廊尽头光线、教室窗外蝉鸣树影、操场铁栅栏
  • 中景(4—6 shot):校园日常动作切片——翻课本、整理书包、趴桌午休、窗边发呆
  • 近景/特写(2—4 shot):细节捕捉——手上的圆珠笔、课桌刻字、发丝逆光

运镜节奏: 以固定偷拍镜头为主(不推进不拉远),偶尔插入一个轻微手持晃动的中景增加纪录片质感;禁止使用跟拍或推进。

示例 shot:

场景:[Element_Classroom] 教室窗边,午后斜阳透过百叶窗切割成光条。固定机位平视,[Element_CharA] 趴在课桌上侧脸朝向窗外,眼神放空,嘴角微微上扬像在想什么好笑的事。手持轻颤但不推进。镜头在她肩部停留,发丝在风扇微风中微动。时长:4s。

段落 2 — 放学后(教室收拾书包、走廊奔跑、天台集合)

节奏基调: 从静到动,能量逐渐上升;前半段慢节奏(4—6s/shot),奔跑后快切(2—3s/shot)。

景别搭配建议:

  • 近景(2 shot):收书包特写——书本、水壶塞进包里的动作,建立"放学了"信号
  • 中景跟拍(2—4 shot):走廊奔跑侧跟,低角度,书包上下晃动,鞋底踩地声
  • 全景/远景(2 shot):天台铁门推开瞬间,阳光猛地涌入过曝——建立新空间
  • 中景/近景对切(4 shot):天台成员集合,彼此对视笑、喘气、推搡

运镜节奏: 书包近景→固定;走廊跟拍→低角手持跟随;天台推门→固定(利用光线变化做天然转场);集合互动→轻微游移平视手持。

示例 shot:

场景:[Element_Corridor] 放学走廊,手持低角度侧跟拍,[Element_CharA] 和 [Element_CharB] 并肩快跑,书包随步频上下颠,鞋底踩地声清晰。镜头略微落后二人半步,能看见她们的侧脸和奔跑时的笑意。跑至走廊末端推开天台铁门,画面瞬间过曝。时长:6s。

段落 3 — 友情时刻(成员互动、打闹、笑声)

节奏基调: 最轻松的段落,景别频繁在近景与中景之间切换;单 shot 3—5s,依笑声节奏剪切。

景别搭配建议:

  • 近景对切(4—6 shot):成员A说话→成员B反应笑出声的正反打,眼神交流为主
  • 中景(2—4 shot):群体打闹全貌——追跑、挡脸、互相推搡,保留肢体全貌
  • 特写(2 shot):笑到眯眼的瞬间特写,可以是定格候选帧,软焦感

运镜节奏: 正反打使用固定或极轻微手持;群体打闹中景用跟拍或游移增加混乱活力;笑容特写做软变焦缓推,停在笑容高点。

示例 shot:

场景:[Element_Rooftop] 天台,平视中景,[Element_CharA] [Element_CharB] [Element_CharC] 三人坐在围栏边吃零食,[Element_CharB] 说了什么让另外两人同时喷笑——[Element_CharA] 捂嘴,[Element_CharC] 往后仰。手持游移略微前进,最后停在三人中景笑容定格。时长:5s。

段落 4 — 练习场景(社团教室排练、不整齐的编舞)

节奏基调: 活力但带有"努力感",不整齐是重点;中等节奏,4—7s/shot,跟随编舞节拍切换。

景别搭配建议:

  • 全景(2—4 shot):舞室镜子前全员编舞全貌,动作不整齐可见
  • 中景(4 shot):专注练习的表情特写——皱眉数拍子、嘴里默念动作
  • 近景(2 shot):手势或脚步动作特写,强调"练习中"的质感
  • 低角全景(2 shot):所有人同时跳起/落地瞬间,鞋底踩地

运镜节奏: 全景以固定机位或极慢软推为主;中景插入轻手持增加现场感;脚步特写固定低角;不要使用流畅的摇臂或稳定器运动。

示例 shot:

场景:[Element_DanceRoom] 社团教室,镜子前。固定全景,[Element_CharA] [Element_CharB] [Element_CharC] 三人对着镜子练习副歌手势——动作参差,[Element_CharC] 跟不上节拍停下来重来,另两人继续。荧光灯白光,地板反光。镜子里映出三人背影。时长:6s。

段落 5 — 欢笑高潮(集体奔跑、夏日烟火、旋转)

节奏基调: 全片能量顶点,快速切换;2—4s/shot,视觉冲击感最强的段落。

景别搭配建议:

  • 远景奔跑(2 shot):全员迎着相机冲来,逆光过曝——经典AKB青春奔跑图
  • 低角仰拍(2 shot):成员跳起瞬间,天空背景,头发被风扬起
  • 中景旋转(2 shot):某成员原地旋转,裙摆/发丝展开,软变焦追随
  • 特写(4 shot):笑到闭眼的瞬间、举起手中应援棒/烟火棒的手

运镜节奏: 奔跑用低角固定迎拍(让人物向镜头冲近);旋转中景用软变焦追随;特写可以做轻微rack focus;整段禁止稳定器,允许晃动。

示例 shot:

场景:[Element_Playground] 操场,黄金时刻斜阳。低角固定机位,[Element_CharA] [Element_CharB] [Element_CharC] 全员朝镜头奔跑,逆光剪影 + 高光溢出,发丝被风掀起,面孔在接近时才逐渐清晰。时长:3s。

段落 6 — 舞台表演(偶像队形、青春手势舞、idol微笑)

节奏基调: 正式感但不失青春温度,跟随BGM节拍剪切;动作高点对应切换点;4—8s/shot。

景别搭配建议:

  • 正面全景(2 shot):队形建立,确认成员位置与服装
  • 中景平摇(2—4 shot):扫过编舞队列,展示群像整体
  • 近景对切(4 shot):center girl 直视镜头微笑特写,与群像全景交替
  • 低角仰拍(2 shot):举手/旋转动作的低角,蓬勃向上感

运镜节奏: 全景固定正面;中景平摇速度跟随BGM节拍;近景特写固定或极慢软推进;低角固定;禁止使用炫技运镜(弧形移动、无人机感)。

示例 shot:

场景:[Element_Stage] 学校礼堂舞台,荧光灯暖光。正面中景固定机位,[Element_CharA] [Element_CharB] [Element_CharC] 三人完成副歌最后一组手势后同时转向正面,举起右手,动作略有参差但充满活力。镜头缓慢软推进至中近景停定。时长:6s。

段落 7 — 青春高潮(全员镜头、情绪推进)

节奏基调: 情绪最饱满的段落,不是快切而是「停留」;5—10s/shot,让情绪有时间沉淀。

景别搭配建议:

  • 全景(2 shot):全员站立或集合,镜头缓慢推进,建立情绪高点
  • 中景(2—4 shot):成员间眼神交流,无台词,靠表情与视线传递情绪
  • 近景/特写(2—4 shot):眼眶微红或眼神坚定的面部特写;允许泪光但不刻意煽情

运镜节奏: 全景缓慢推进(非快速变焦,而是物理上的慢慢靠近或软变焦);中景固定;近景固定,停留时间比平时长。

示例 shot:

场景:[Element_Rooftop] 天台,夕阳将至,光线由暖黄转橙红。手持极慢前进中景,全员面朝镜头站成一排,彼此肩膀贴肩膀,没有人说话。镜头缓缓推进,面孔逐渐清晰,最终定格在 [Element_CharA] 正面中近景,眼神直视,嘴角微微上扬。时长:10s。

段落 8 — 黄昏收尾(夕阳剪影、沉默对视、微笑定格)

节奏基调: 全片最慢,留白最多;8—30s/shot,让情绪自然流淌;允许沉默。

景别搭配建议:

  • 远景剪影(2 shot):逆光夕阳下全员剪影,soft fade 边缘
  • 中景(2 shot):某成员侧脸望向远处,无台词,风吹动发丝
  • 近景定格(2 shot):某成员回头微笑——全片最后的笑容,定格候选帧
  • 空镜收尾(可选,2 shot):夕阳、空教室、飘散的樱花或蝉鸣中的操场——"青春离场"信号

运镜节奏: 剪影远景固定;侧脸中景固定或极轻微手持漂移;定格笑容做软变焦缓推至停,最终帧可做 freeze frame;空镜固定,soft fade to warm white 或 film burn out。

示例 shot:

场景:[Element_Riverside] 河堤,夕阳最后一刻,天边橙红渐深。固定远景,全员并排站在河堤栏杆旁逆光剪影,轮廓被夕阳勾边。风将几人的头发吹向同一方向。镜头不动,只等光线变化。Kodak Gold 200暖调,soft grain,高光溢出。时长:12s,末尾 soft fade to warm white。

设计 audio_layer(音频层)

  • BGM(music类型):上进J-Pop/青春吉他/idol合唱/nostalgic明亮旋律;参考《Heavy Rotation》《Ponytail to Shushu》《恋するフォーチュンクッキー》的编曲气质;禁止EDM、trap、黑暗电影配乐。
  • 环境音/音效层(可选):蝉鸣、电车过道音、操场欢笑、社团练习声、运动鞋踩地声——叠加在BGM之下增强纪录片感。
  • 旁白VO(可选):若MV有青春旁白叙事,设计 narration_speaker_profile(如「青春旁白,温柔而略带感伤」)并写明旁白文本与对应 shot 区间。
4. 미디어 생성

用户上传真实参考照片的绑定流程
当用户提供真实人物照片作为角色参考时,执行以下步骤(在任何生成任务开始之前完成):

  1. 注册 asset_id: 为每张用户上传的参考照片注册稳定的 asset_id,与对应的 resource_id(物理文件)绑定,确保后续所有引用使用 asset_id 而非临时路径。
  2. 绑定至 key_element: 将注册好的 asset_id 绑定到 Storyboard 中对应角色的 key_element 槽位(element character)。若该 key_element 尚未建立,先在 Storyboard 中创建角色 element,再完成绑定。
  3. 标记为参照锚点: 在 key_element 描述中注明「面部特征以用户上传照片为准,后续生成必须与之对齐」,避免下游生成自行重新解读角色外貌。
  4. 跳过重复生成: 已绑定真实参照图的角色,不再单独生成 TextToImage 角色参考图。若需要生成不同服装/场景版本,使用 ImageToImage,以绑定的真实参照图为基准进行迁移,保留面部特征。
  5. 多成员场景处理: 若用户上传多位成员照片,依次完成各成员的注册与绑定,确认每位成员都有独立的 key_element 和 asset_id 后,再启动后续生成流程。

用户上传真实场景/背景照片的绑定流程
当用户提供真实拍摄的场景照片作为背景参考时,执行以下步骤(在任何生成任务开始之前完成):

  1. 注册 asset_id: 为每张上传的场景照片注册稳定的 asset_id,与对应 resource_id 绑定,后续所有引用使用 asset_id。
  2. 绑定至 element scene: 将 asset_id 绑定到 Storyboard 中对应场景的 key_element 槽位(element scene)。若该 element scene 尚未建立,先在 Storyboard 中创建场景 element,再完成绑定。
  3. 在 element scene 描述中写入光线与空间锚点: 依据分析结果注明:
    • 光线来源与色温(如"黄金时刻斜阳暖光 / Kodak Gold 200 基调")
    • 标志性空间细节(如"黑板粉笔字、旧式木质课桌椅")
    • 胶片色彩匹配基准(Kodak / Fuji / 混合基调)
    • 若场景现代感过强,注明"需在 prompt 中添加旧化处理指令"
  4. 跳过重复生成: 已有真实场景参照图的 element scene,不再单独生成 TextToImage 场景背景图。若需要在该场景下叠加角色,使用 ImageToImageMultiModalToVideo 以绑定的场景照片为背景参考进行合成,保留光线与空间特征。
  5. 多场景照片处理: 若用户上传多个不同场景的照片,依次完成各场景的注册与绑定,确认每个场景都有独立的 element scene 和 asset_id 后,再将对应 shot 的生成任务与正确的场景 element 关联。

用户上传音频(BGM / 人声)的绑定流程
当用户提供 BGM 音频或人声音频作为参考时,执行以下步骤(在任何生成任务开始之前完成):

  1. 注册 asset_id: 为每条上传的音频文件注册稳定的 asset_id,与对应 resource_id(物理文件)绑定,确保后续所有引用使用 asset_id 而非临时路径。
  2. 按音频类型分类绑定:
    • BGM 类型 → 绑定到 Storyboard 对应的 audio_layer(type: music)槽位。若该 audio_layer 尚未建立,先在 Storyboard 中创建,再完成绑定。在 audio_layer 描述中注明「BGM 以用户上传音频为准,跳过 text_to_instrumental 生成」,并记录分析所得的风格特征(BPM 范围、主乐器、情绪弧线、内部段落结构)供 video_assembler 剪辑时参考节拍对位。
    • 人声参考(key_element_audio)类型 → 绑定到对应角色 key_element 的 key_element_audio 槽位。在 key_element 描述中注明「声线以用户上传音频为准,后续对白/演唱生成必须与之对齐」,记录提取的声线特征(音色、音域、情绪类型)。
    • 环境音/音效类型 → 绑定到 Storyboard 对应的 audio_layer(type: sfx/ambient)槽位,注明适合叠加的 MV 段落类型。
  3. 跳过重复生成: 已绑定真实 BGM 的 audio_layer,不再调用 text_to_instrumental 重新生成;已绑定 key_element_audio 的角色,对白/演唱生成时直接以该音频为声线参考,不另行生成 TTS 音色。
  4. 多条音频处理: 若用户上传多条音频,依次完成各条的注册与绑定(BGM 按段落顺序对应不同 audio_layer;多角色人声分别绑定各自 key_element),确认全部绑定完成后,再启动后续视频生成流程。
  5. 风格冲突提示: 若上传 BGM 风格明显偏离平成偶像 J-Pop 基准(如 EDM / trap / 暗系电影配乐),在绑定完成后以 reply_to_user 向用户说明风格偏差,询问是否继续使用或替换,不自动拒绝。

角色/场景形象图生成(key_element 图像)

  • 使用 ImageToImageTextToImage,推荐模型:Nano Banana Pro(Gemini 3 Pro Image)(2K,优先——跨图面部一致性最强,适合角色参考图双格构图及多角色联合生成);风格探索阶段可额外用 Midjourney V7 生成气质参考,但 Midjourney 不可用于需要一致性锚点的角色主图。
  • 同一角色多造型/多场景版本,使用 ImageToImage 以首版参考图为基准,保持面容与气质连贯;禁止用 Midjourney V7 做连续性迁移(其一致性不足以锁定面部)。
  • 角色参考图默认生成横向双格构图:左——半身头肩特写(面部识别锚点);右——全身造型(服装/发型/配饰完整呈现)。

shot 视频生成

  • 默认路径:MultiModalToVideo,推荐模型 Seedance 2.5(480p);需要会员资格。
  • 每个 shot 的参考输入:
    1. element 图像(必须):该 shot 出现的所有角色 element 图 + 场景/道具 element 图。
    2. 前一 shot 视频(可选):仅当与前 shot 存在强连续性(同一场景连续动作、情绪直接承接)时才加入;通常跳过视频参考,保持青春蒙太奇切割感。
  • 若需要带同步音效/对白的 shot(如舞台表演片段),切换至 FirstFrameToVideo,推荐模型 Google Veo3.1 Fast(720p);注意避免与独立 narration VO 轨道叠加冲突。

跨 shot 角色面部一致性保障
一致性检查节点:
每完成一批 shot(建议每 3—5 个 shot 或每段落结束时),在继续生成前执行以下检查,不通过则先重生成再继续:
检查项通过标准不通过判定面部识别锚点脸型、眼型、发色与 key_element 参考图对应,肉眼可辨为同一人五官结构明显漂移、发型/肤色突变妆容与发型刘海形状、发量感与 element 描述一致刘海类型改变(如软刘海变中分)、发色阶跃服装连贯性同一段落内同一角色服装与 element 描述一致段落内服装款式或配色无剧情原因发生变化气质基调面部表情与气质标签(元气/害羞/清冷等)保持对齐角色气质与设定明显偏离(如元气型变冷漠型)

重生成判断标准:

  • 必须重生成:面部识别锚点不通过(脸型或眼型明显走样);同一段落内服装无剧情原因变更。
  • 建议重生成:气质基调偏离超过 1 档(如从害羞变为冷漠);发型突变影响角色辨识度。
  • 可接受保留:轻微手持运动导致的瞬间失焦;光线变化引起的自然肤色细微差异;表情在合理情绪范围内的自然波动。
  • 重生成时优先调整 prompt(强化面部特征词、换 seed 或减少 shot 时长),而非直接换模型;若同 prompt 连续两次仍不通过,再考虑切换至 FirstFrameToVideo 以 keyframe 强控首帧外貌。

多成员同框 shot 的参考图绑定策略:
多位成员出现在同一 shot 时,参考图绑定按以下优先级处理:

  1. 为每位出现的成员各绑定独立参考图:分别使用各自 key_element 的角色参考图(左格半身特写优先作为面部锚),用 <<<image_1>>>、<<<image_2>>> 等占位符依次绑定,并在 prompt 中明确标注每个占位符对应的成员及参照侧重点(面部/全身/服装)。
  2. 成员数量上限建议:单 shot 中建议同框成员不超过 3 人;超过 3 人时模型容易混淆面部——优先拆成多个近景/中景 shot 切换展示,群像全景 shot 可适当放宽至 5 人但需降低对个体面部精度的预期。
  3. 主角优先原则:若某 shot 有明确的 center girl 或情绪焦点成员,将该成员的参考图放在第一个占位符位置(模型对首个参考图权重更高),其余成员依次排列。
  4. 避免参考图冲突:多参考图的发型/服装色系相近时,在 prompt 中用方位词区分(「画面左侧成员参照 <<<image_1>>>」);若仍出现面部混淆,可先生成单人 shot 再通过 MultiModalToVideo 的 Video Modifies 模式合成多人画面。
  5. 团体群像全景 shot:若成员数量多且面部识别不是主要要求(如远景奔跑、舞台全景),可用多角色联合参考图(横向多格构图)替代多张独立参考图,减少模型解析负担——但此路径仅适用于全景/远景,中景及以内仍须独立绑定。

非会员备用方案:Kling 3.0 Omni
当用户无 Seedance 2.5(分辨率 480p) 会员权限时,shot 视频生成切换至 MultiModalToVideo + Kling 3.0 Omni,规则如下:

  • 分辨率:720p(非会员无法使用 1080p)。
  • 时长:每个 shot 时长设定为整数秒,范围 3—30s;青春蒙太奇段落建议 4—8s,情绪收尾 shot 可延至 10—12s。
  • refer_type 必须显式声明(Kling 3.0 Omni 必填参数,Seedance 2.5不需要):
    • refer_type: "feature" — 以 element 图像或前一 shot 视频作为参考(Reference-to-video / Video 参考场景,本技能最常用)。
    • refer_type: "base" — 直接对已有视频进行内容修改(如改变背景、天气、服装风格等 Video-to-Video 场景)。
    • 本技能绝大多数 shot 生成属于 element 图像参考场景,默认使用 refer_type: "feature";仅在明确需要对已有 shot 做风格/内容编辑时改用 refer_type: "base"。
  • 参考输入策略与 Seedance 2.5 保持一致
    1. element 图像(必须):角色 element 图 + 场景/道具 element 图。
    2. 前一 shot 视频(可选):仅强连续性场景才加入,refer_type 保持 "feature"。
  • 带同步音效/对白的 shot:Kling 3.0 Omni 不具备内置音效 wrapper 语法;此类 shot 仍切换至 FirstFrameToVideo + Google Veo3.1 Fast(720p),规则与会员路径相同。
  • 失败处理:若 Kling 3.0 Omni 某 shot 生成失败,优先在同工具内重试(调整 prompt 或时长参数);若连续失败,停止该 shot 生成并通过 reply_to_user 告知用户,由用户决定是否切换其他工具(如 ImagesToVideo + Vidu(Q3))。

BGM 生成

  • 使用 text_to_instrumental,推荐模型 Suno 5(备选 Mureka 8)。
  • 注意:Suno 5 若 prompt 中包含知名音乐人/乐队名称,失败率高——用风格描述替代(如"upbeat J-Pop idol chorus, bright acoustic guitar, nostalgic synth, cheerful melody")。
  • BGM prompt 详细写法规范见 write_media_prompt 模块「BGM 生成 prompt」专项章节。

竖版(9:16)shot 视频生成专项规范

触发条件:Final_Video_Spec.md 中画面比例为 9:16,或用户明确指定竖版输出。以下规则在标准 shot 生成规则基础上叠加执行,不替换原有路径逻辑。

原生竖版生成路径(优先)

竖版 shot 优先使用以下两条原生支持 aspect_ratio: "9:16" 的路径,避免后期裁切损失画面信息:

① FirstFrameToVideo + Wan2.6(无内置音效需求时)

参数规范值模型Wan2.6aspect_ratio"9:16"resolution"720p" 或 "1080p"(1080p 需会员)duration5s、10s 或 30s

  • 适用场景:日常切片、友情互动、放学后奔跑、青春高潮等无需同步对白音效的 shot。
  • 参考图绑定:与横版路径相同,使用各角色 key_element 参考图(<<<image_1>>>、<<<image_2>>> …)+ 场景 element 图;first frame 优先选用与 shot 开场视觉最接近的 keyframe 图像。
  • prompt 构图锚点:在 prompt 主体描述前插入竖版声明段(见 write_media_prompt 竖版专项规范),奔跑/旋转 shot 的运动方向须调整为纵深轴方向而非横向穿越。
  • 失败处理:若 Wan2.6 某 shot 生成失败,优先在同模型内重试(调整 prompt 或 duration);连续失败则切换至 Kling 3.0 Audio 重试,不回退至横版路径。

② FirstFrameToVideo + Kling 3.0 Audio(需要同步对白/音效时)

参数规范值模型Kling 3.0 Audioaspect_ratio"9:16"resolution"720p" 或 "1080p"(1080p 需会员)duration3s—30s 整数值

  • 适用场景:舞台表演片段(需同步掌声/踩踏声)、含角色对白的 shot、需要内置 BGM 氛围感的 shot。
  • 与 narration VO 冲突处理:若该 shot 对应区间已设计独立 narration VO 音轨,Kling 3.0 Audio 的内置音效描述仅写环境音(<cicadas, wind>),不写旁白文字,避免双重语音叠加。
  • 参考图绑定:同 Wan2.6 路径,使用 key_element 参考图 + first frame 图像。
  • 失败处理:Kling 3.0 Audio 生成失败时,优先在同模型内重试;若连续失败,切换至 Wan2.6(接受该 shot 无内置音效,后期补混);不切换至其他工具。

Seedance 2.5竖版后期裁切方案(备用路径)

当用户已有 Seedance 2.5(分辨率 480p) 会员权限、且坚持使用 Seedance 2.5 生成竖版 shot 时,Seedance 2.5 不支持原生 aspect_ratio: "9:16",须按以下流程在后期执行裁切,用户须在 Final_Video_Spec 锁定阶段明确知情并确认接受此方案后,方可启用此路径

生成阶段处理

  1. 以横版(16:9)生成:使用标准 MultiModalToVideo + Seedance 2.5(480p),所有参数与标准横版路径相同。
  2. 构图预置:prompt 中必须加入以下构图约束词,确保主体落在后续裁切后仍安全的区域:

    subject centered horizontally, all key action within central 56% of frame width, avoid placing important elements near left or right edges, vertical-friendly framing

  3. 多人同框 shot:须在 prompt 中描述纵向错落站位(staggered vertically, front-to-back depth),禁止横向并排 3 人——横版生成时横向并排可以容纳,但裁切后两侧成员将被切出画面。
  4. 奔跑/旋转等运动 shot:prompt 中运动方向须指定为纵深轴方向(由远及近冲向镜头,或向远处纵深跑去),避免横向运动在裁切后出画。

后期裁切阶段(video_assembler 执行)

在时间线装配阶段,对所有 Seedance 2.5 生成的横版素材执行 9:16 裁切:
操作规范裁切比例从 16:9 裁切至 9:16,保留画面中心宽度约 56%默认锚点水平居中裁切(center crop)——适用于主体居中的 shot手动锚点若生成的 shot 中主体明显偏侧(如角色站在画面左 1/3 处),在 video_assembler 指令中标注裁切锚点偏移量(如"向左偏移 10% 裁切"),确保主体留在竖版帧内安全区校验裁切后须确认主体面部/关键动作落在核心安全区(水平 70%×垂直 65%),否则重新调整裁切锚点或标记为需重新生成信箱填充禁止严禁使用黑边/模糊填充方式将 16:9 素材填入 9:16 帧——必须执行实际裁切

裁切损失评估与重生成判断

在裁切后逐 shot 执行以下评估,不通过的 shot 须返回重新生成(调整构图 prompt 后再次以 Seedance 2.5 横版路径生成):
评估项通过标准不通过→处理方式主体完整性角色面部、关键手势均在裁切后画面内调整裁切锚点;若无法覆盖则重生成多人同框完整性所有预期出现的成员均在裁切后画面内重生成,强化 prompt 中纵向站位约束关键视觉元素道具、场景标志性细节不被裁切出画重生成,prompt 中将元素位置限定在画面中央运动方向横向运动未导致主体出画重生成,修改运动描述为纵深轴方向

非会员竖版备用方案

当用户无会员权限时,竖版生成路径调整如下:

  • 无音效 shotFirstFrameToVideo + Wan2.6(aspect_ratio: "9:16",resolution: "720p")
  • 含音效/对白 shotFirstFrameToVideo + Kling 3.0 Audio(aspect_ratio: "9:16",resolution: "480p")
  • 不使用 Seedance 2.5 路径(非会员无法使用 Seedance 2.5(分辨率 480p),也无需启动裁切流程)
  • Kling 3.0 Omni 横版备用方案保持不变,但竖版项目下该备用方案不适用(Kling 3.0 Omni 在 MultiModalToVideo 工具中不支持 9:16)

超分辨率(可选后处理)

  • 关键 shot 或封面图可通过 super_resolution 提升画质:图像使用 Jimeng SR(4K);视频使用 MediaKit(1080p)。
  • 竖版项目:超分辨率处理须在裁切完成后执行(先裁切至 9:16,再送入 MediaKit),避免对横版素材超分后再裁切导致边缘细节损失。
5. 프롬프트 작성

最高优先级(全局): 用户使用中文交互时,prompt 正文以中文撰写;若有日语对白/歌词台词,按原语言保留在对应位置。

图像 prompt(TextToImage / ImageToImage)

以"导演+摄影师联合描述"方式撰写——自然语言描述主体+动作+环境,短语描述风格/色彩/光线/构图。禁止写不可见的心理活动,只写镜头能看到的内容。

胶片视觉基准(融入主体描述段落,不单独列标题):

  • 胶片参考:Kodak Gold 200暖调 / Fuji Pro 400H冷柔调
  • 颗粒感:soft grain,轻微过曝,高光柔化溢出
  • 色调:pastel blue / warm sunlight yellow / sakura pink / school navy / sunset orange / soft white
  • 允许:轻微漏光、镜头眩光、软焦感、胶片时间码质感
  • 禁止:HDR锐化感、超清CG感、商业级锐化

角色描述锚点:

  • 锁定:面部特征、妆容(自然系)、发型(软刘海/马尾)、服装(参照 element 描述)
  • 气质词:youthful awkwardness, idol smile, natural reaction, genuine laughter, amateur charm
  • 禁止写入:性感化描述、高冷时尚感、欧美超模气质

场景/光线描述锚点:

  • summer sunlight, golden hour glow, after school atmosphere, humid summer air, classroom dust particles, fluorescent school light, festival lantern warmth

Nano Banana Pro 专项写法

Nano Banana Pro (Gemini 3 Pro Image) 是本技能角色参考图和多角色联合图的首选模型,其 prompt 需额外遵循以下规范:

角色参考图:双格构图指令

双格构图是角色主图的标准格式,必须在 prompt 开头用结构化指令显式声明布局,再描述内容:
【双格横向对比图,白色分割线居中】
左格:[角色名] 半身头肩特写,正面平视,面部清晰可辨——[面部特征描述]。[发型描述]。[妆容描述]。[表情描述]。
右格:同一人物全身造型,站姿自然,上下完整入框——[服装完整描述,含配件]。[鞋履描述]。[姿态/手部]。
整体风格:[胶片基调],[色调词],[光线描述],soft grain,analog warmth。

面部特征锁定格式(identity anchor block):
从 multimodal_analyze_tool 的分析结果中提取,写成一个连贯的描述块嵌入左格描述段落——格式如下:

「脸型轮廓(如:小圆脸/瓜子脸)+ 眼型(如:温柔单眼皮,眼距适中)+ 鼻梁(如:低鼻梁,鼻尖圆润)+ 嘴唇(如:薄唇,嘴角微翘)+ 肤色(如:自然偏暖白肌)+ 发型关键词(如:黑色软刘海,中长发,发量感蓬松)」

锁定字段必须与用户上传参照图分析结果逐字对应;若无用户参照图,则参照 key_element 描述中的角色设定填写。

多角色联合参考图(团体群像图):
当需要在一张图内呈现多位成员时,在双格指令基础上扩展为多列:
【四格/六格横向排列,各格等宽,白色分割线,2K分辨率】
第1格:[成员A] 全身造型——[描述]。
第2格:[成员B] 全身造型——[描述]。
……
整体风格:统一平成青春胶片色调,成员间服装色系协调,避免各格色温差异过大。

场景/背景参考图写法

  • 以空间锚点优先描述:室内/室外结构 → 纵深感 → 标志性道具细节 → 光线来源与色温。
  • 明确写出目标胶片基调(Kodak Gold 200 / Fuji Pro 400H / 混合基调),并在结尾附加旧化感词汇(若需要):slightly aged facilities, non-digital signage, hand-drawn bulletin board, worn wooden desks。
  • 场景图不需要写人物,写"empty scene, no characters"避免模型自行添加人物。

视频 prompt(MultiModalToVideo / FirstFrameToVideo)

  • 参考图绑定: 每位角色使用占位符 <<<image_1>>>, <<<image_2>>> … 明确绑定,并注明参考该图的哪一方面(面部/全身/服装)。
  • 运动层叠顺序: 摄影机运动(手持游移/软推进/跟拍)→ 主体动作(动作幅度+情绪节拍)→ 空间调度(人物位置/场景变化)→ 音效提示(如有同步对白/音效,使用 Seedance 2.5 wrapper)。
  • 青春纪录片运镜词汇: handheld drift, soft zoom in, candid observational framing, slow follow pan, rack focus to subject, accidental tilt
  • AKB风格动作词汇: spontaneous laughter burst, group running in unison, hair catching sunlight, awkward synchronized idol gesture, freeze on smile, rooftop silhouette at sunset

Seedance 2.5(分辨率 480p) Wrapper 完整语法与示例

Seedance 2.5(分辨率 480p) 支持在 prompt 内嵌入结构化标记控制音效、对白、音乐和画面字幕,使用时须严格遵守格式:
标记用途格式(...)背景音乐描述(upbeat J-Pop, bright acoustic guitar)<...>音效/环境音<cicadas chirping, sneaker footsteps on corridor>{...}角色对白(逐字台词,非日语前加语言标注){日语:「行くよ!」} 或 {中文:「我们跑吧!」}【...】画面叠加字幕/标题【青春、ここにある】

完整示例——放学后天台奔跑片段(含对白+环境音):

<<<image_1>>>(成员A全身造型参考)<<<image_2>>>(成员B全身造型参考)

手持摄影机低角度跟拍,两位成员从教室走廊冲出推开天台铁门,阳光猛地涌入画面——软过曝高光,镜头轻微眩光。成员A(参照<<<image_1>>>面部与校服)率先奔出,回头大声呼喊;成员B(参照<<<image_2>>>面部与发型)紧随其后,书包随奔跑上下晃动,发丝被风掀起。二人在天台边缘停下,喘气,对视,同时笑出声。摄影机缓慢软推进至二人中近景,定格在笑容上。

<铁门推开声,走廊回声,风声,两人笑声>
{日语:「もう授業終わったよ!」}
{日语:「やっと自由だ!」}

Kodak Gold 200暖调,soft grain,golden hour glow,pastel tone,analog warmth。

no music, no subtitles, no K-pop precision choreography, no commercial stabilizer movement, no HDR sharpness

完整示例——舞台表演片段(含BGM描述+群像对白):

<<<image_1>>><<<image_2>>><<<image_3>>>(三位成员全身舞台服参考)

固定机位正面中景,三位少女在学校礼堂舞台上完成最后一段副歌队形,动作稍不整齐但充满活力——举手、旋转、互相对视。镜头缓慢zoom in至全景→中景,最后定格在center girl特写,眼神直视镜头,嘴角微微上扬。舞台荧光灯暖光打在三人脸上,背景是略显简陋的学校布景板。

(upbeat J-Pop idol chorus, bright acoustic guitar, nostalgic synth pad)
<观众掌声,礼堂回声,舞台地板踩踏声>
【夏の約束】

Fuji Pro 400H冷柔调,soft grain,fluorescent school light,pastel contrast,amateur charm。

no subtitles, no K-pop刀群舞, no luxury stage lighting, no HDR sharpness

Wrapper 使用注意事项:

  • {...} 内只放逐字台词,不放动作描述或情绪说明。
  • 若项目已设置独立 narration VO 音轨,视频 prompt 内不得重复写入旁白全文,避免音轨叠加冲突。
  • (...) 音乐描述用于引导 Seedance 2.5 内置音效风格,但 BGM 主轨走独立 audio_layer,两者不冲突——末尾仍须附加 no music 防止模型生成独立音乐轨。

季节限定变体 prompt 补充规范

当项目触发樱花季 / 海边 / 文化祭变体时,在标准胶片基准词之后追加对应的季节关键词组,同时替换或删除与当前季节不符的词汇。

变体追加词汇替换/删除🌸 樱花季cherry blossom petals, sakura pink haze, cold-soft spring daylight, Fuji Pro 400H dominant, new semester freshness删除 summer sunlight / cicadas / humid summer air🌊 海边late summer seaside, coastal seawall, ocean light reflection, fading summer warmth, Kodak overexposed beach haze将 cicadas 替换为 ocean waves;删除 classroom dust particles🎡 文化祭school culture festival, handmade classroom decoration, warm indoor festival light, autumn outdoor cool light, after-festival bittersweet删除 summer sunlight;将 cicadas 替换为 autumn wind / festival crowd ambience

季节变体的视频 prompt 附加规则:

  • 樱花季 shot:在运动描述后附加 <petals drifting in wind, soft rustling sound>。
  • 海边 shot:在运动描述后附加 <continuous ocean wave sound, sea breeze>;注意画面内禁止出现泳装/沙滩派对感。
  • 文化祭 shot:在运动描述后附加 <distant stage music, crowd chatter, autumn wind>;场景内出现手绘海报或彩带装饰时在 prompt 中用 handmade paper banner, colored streamers 明确标注,避免模型生成商业展览感。

竖版(9:16)prompt 专项补充

触发条件:Final_Video_Spec.md 中画面比例为 9:16,或用户明确指定竖版输出。以下规则叠加于标准视频/图像 prompt 规范之上。

模型与参数选择:

  • 视频生成优先选用支持 9:16 的模型:FirstFrameToVideo 路径下推荐 Wan2.6(aspect_ratio: "9:16")或 Kling 3.0 Audio(aspect_ratio: "9:16");需要同步音效时使用 Kling 3.0 Audio。MultiModalToVideo(Seedance 2.5)不支持 aspect_ratio 参数,竖版 shot 若必须使用 Seedance 2.5,需在 prompt 中明确指示竖向构图,并接受最终帧可能需要后期裁切。
  • 图像生成(角色参考图 / 场景图)仍走标准 TextToImage / ImageToImage,分辨率保持 2K;竖版构图差异在 prompt 中以描述引导,不改变模型或分辨率参数。

图像 prompt 构图引导词(竖版专用):
在标准角色/场景 prompt 的构图描述位置加入以下引导:

vertical 9:16 composition, subject centered vertically, face positioned at upper third, full headroom visible, no horizontal crop

  • 角色双格参考图维持横向双格不变(仍用于后续视频生成的参考输入),不需要专门生成竖版参考图。
  • 场景参考图若需竖版版本,在 prompt 开头加 vertical framing, portrait orientation,并强调纵深透视线(走廊消失点、河堤延伸方向)而非横向宽度。

视频 prompt 构图引导词(竖版专用):
在运动层叠描述之前,加入以下构图锚点段落:

Vertical 9:16 framing. Subject centered on vertical axis, eyes at upper-third position. Keep all key action within the central 70% horizontal safe zone—no important elements near left or right edges. Avoid horizontal panning; prefer slow tilt or static framing with vertical depth.

  • 奔跑 shot:将「朝镜头横向冲来」改为「沿纵深轴朝镜头冲来(由远及近)」,人物在竖版帧内始终居中。
  • 旋转 shot:裙摆/发丝展开幅度描述可保留,但注意旋转半径不超出画面横向安全区——用 moderate spin, stays within frame 约束。
  • 群像 shot:多人同框时描述为纵向错落站位(staggered vertically, front-to-back depth),而非横向并排。

负向提示附加(竖版专用,追加至标准固定负向提示之后):

no horizontal pan beyond safe zone, no wide landscape framing, no side-by-side group lineup cutting out of frame

固定负向提示(每条视频 prompt 末尾附加):

  • no music(BGM 走独立音频轨道)
  • no subtitles(字幕在后期处理)
  • 风格负向:no K-pop precision choreography, no high-fashion styling, no commercial stabilizer movement, no cyberpunk or dark concept, no EDM energy, no luxury architecture

BGM 生成 prompt(text_to_instrumental)

本节规范适用于 Suno 5Mureka 8,两者写法基本一致,差异见末尾注释。

写法结构(四段式)

[情绪定位] + [BPM / 节拍感] + [主要乐器层] + [情绪弧线 / 段落结构]

  • 情绪定位:先用1句话点明整首曲子的气质核心,作为模型的最高优先级信号。
  • BPM / 节拍感:不必给精确数字,用描述性词组传达节奏感(见下方速查表)。
  • 主要乐器层:按「旋律乐器 → 节奏乐器 → 氛围层」顺序列举,避免罗列超过6件乐器(信号稀释)。
  • 情绪弧线:描述全曲的情绪走向或内部段落变化(intro起势→verse叙事→chorus爆发→outro收尾),供模型安排动态起伏。

BPM 描述速查

目标感描述词组活泼快切蒙太奇upbeat, energetic, around 130–140 BPM, driving beat青春中速副歌moderately upbeat, around 110–120 BPM, bouncy rhythm感伤抒情段落mid-tempo, around 80–90 BPM, gentle flow黄昏收尾slow, around 65–75 BPM, unhurried, nostalgic pulse

乐器组合推荐(平成偶像 J-Pop)

段落类型推荐乐器组合日常/友情蒙太奇bright acoustic guitar, glockenspiel, light drum kit, cheerful piano, subtle synth pad副歌爆发electric guitar power chords, full drum kit with snare accent, layered idol chorus vocals (wordless), synth brass stab感伤/天台fingerpicked acoustic guitar, solo piano, soft strings, light shaker, ambient reverb tail黄昏收尾solo piano, warm cello, distant acoustic guitar, fading synth wash, no percussion or very soft brush drums

禁止出现的乐器/风格词:EDM drop, trap hi-hat, 808 bass, dubstep wobble, dark orchestral, heavy metal guitar

完整 prompt 示例

示例 A — 全片主 BGM(活泼副歌型,适合日常+练习+欢笑段落)
Upbeat, cheerful Japanese idol pop anthem full of youthful energy and nostalgic warmth.
Around 120–130 BPM, bouncy rhythmic drive.
Bright acoustic guitar as the lead melody, light electric piano fills, glockenspiel accents on beat,
full drum kit with punchy snare, layered wordless idol chorus in the background, subtle analog synth pad for warmth.
Structure: gentle intro with acoustic guitar → verse builds with drums entering → chorus bursts with full instrumentation and choir swell
→ brief emotional bridge with piano solo → final chorus with added energy → soft outro fading on acoustic guitar.
Nostalgic pastel tone, summer sunlight feeling, analog warmth, no EDM, no trap, no dark mood.

示例 B — 情绪段落 BGM(感伤抒情型,适合黄昏收尾+青春高潮回望)
Bittersweet, nostalgic Japanese idol ballad with a gentle sense of fleeting youth and warm melancholy.
Mid-tempo, around 80–85 BPM, unhurried and flowing.
Fingerpicked acoustic guitar carrying the main melody, soft solo piano responding in phrases,
warm string ensemble (cello + violin) as sustained background layer, very light brush drums entering only in the chorus,
faint analog synth wash as ambient texture.
Structure: solo acoustic guitar intro → verse with piano joining → emotional chorus with strings swelling softly
→ quiet bridge, only guitar and cello → final chorus with full strings → fade out on solo piano.
Summer evening atmosphere, Kodak film warmth, soft sorrow, no percussion in intro/outro, no electric guitar distortion.

示例 C — 短片段环境音乐(低调氛围型,适合教室/走廊/电车切片段落作底层铺垫)
Soft, ambient Japanese school-life background music with a nostalgic, understated feel.
Slow tempo, around 70 BPM, minimal and airy.
Solo piano playing simple, sparse melody, light acoustic guitar strumming in the background,
faint glockenspiel notes scattered occasionally, very soft synth pad, no drums.
Loop-friendly structure with gentle variations, no dramatic climax, maintains a quiet everyday atmosphere throughout.
Suitable as ambient underscore beneath dialogue or environmental sound.
Pastel tone, soft focus, analog warmth, no percussion, no chorus vocals.

Suno 5 与 Mureka 8 差异注意事项

项目Suno 5Mureka 8知名艺人/乐队名称禁止写入,高概率触发失败——用风格描述替代相对宽松,但仍建议用风格词而非专有名乐器描述精度接受自然语言描述,细节越具体效果越好同左,可适当加入流派标签(如 "J-Pop idol, Shibuya-kei influenced")情绪弧线段落明确写 intro/verse/chorus/outro 结构,响应良好同左,也可用 "dynamic progression from quiet to full" 等整体描述时长控制不直接指定时长,通过段落数量间接影响同左

6. 동영상 조립

剪辑气质基准: "青春碎片感"——像平成时代偶像MV的蒙太奇,而非商业广告精剪。

节奏与时长:

  • 日常/友情段落:快切蒙太奇,单 shot 上屏时间1.5—3s,营造活泼流动感。
  • 情绪/黄昏收尾段落:放慢,单 shot 停留4—8s,留白给情绪沉淀。
  • 舞台表演段落:跟随BGM节拍剪切,动作高点对应切换点。

转场偏好:

  • 优先:soft dissolve(青春怀旧感)、handheld smash cut(自然切换)、freeze frame on smile(定格笑容)。
  • 允许:胶片时间码闪切、VHS轻故障转场、DV录像感叠化。
  • 禁止:精准商业特效转场、K-pop风格RGB描边切换、赛博视觉故障特效。

音频层混合:

  • BGM主轨贯穿全片,黄昏收尾段落BGM渐弱淡出。
  • 环境音(蝉鸣/电车/欢笑)在日常/友情段落叠加于BGM之下,音量约BGM的20—30%。
  • 若有narration VO,VO期间BGM小幅压低(duck to约-6dB),VO结束后恢复。
  • 带内置音效的视频 shot(FirstFrameToVideo生成)注意与VO轨道不重叠。

画面处理偏好:

  • 整体色调统一到"夏日青春胶片"色系(pastel暖调,软对比),避免色调跳变。
  • 允许保留轻微手持晃动、偶发失焦——这是青春纪录片质感的一部分,不做稳定处理。
  • 片尾建议:黄昏定格帧,soft fade to warm white 或 nostalgic film burn out。

Reels 竖版 BGM 截取点与节拍对位规范

适用于 30s / 30s Reels 版本。以下规则在标准剪辑节奏基础上叠加执行

30s Reels BGM 截取与对位规则

  • 截取段落:从 chorus 爆发点(全乐器组加入或人声爆发的第一个强拍)起截取 8—11s;不使用 intro / verse;截取起点偏差 ≤ 0.2s(须对齐强拍 downbeat)。
  • 第一帧入场:画面第一帧与 BGM chorus 爆发点第一拍同步,误差 ≤ 1 帧(约 0.04s @ 24fps);0.5s 内完成视觉冲击建立,无任何前导黑场或渐入。
  • 欢笑高潮快切节拍:shot 切换点对准强拍(downbeat),以 2–4 拍为一个切换单位;120 BPM 下,2 拍 ≈ 1s,4 拍 ≈ 2s;禁止在弱拍或旋律中间切换。
  • 换挡呼吸帧:欢笑高潮最后一个 shot 与黄昏收尾 shot 之间,保留 1 拍的软溶解过渡(约 0.5s @ 120 BPM),完成快切→留白的节奏换挡,避免直接硬切。
  • BGM 渐弱:在 13—14s 处(最后约 1.5s)开始线性渐弱,与 soft fade to warm white 同步;BGM 音量降至 -18dB 时画面完成全白;禁止突然截断。

30s Reels BGM 截取与对位规则

  • 三段 BGM 位置锚点
    • 欢笑高潮入场 = chorus 爆发点第一拍;shot 切换以 4 拍(约 2s @ 120 BPM) 为标准单位,切换点对准强拍。
    • 舞台表演入场 = chorus 第二循环起点(或 post-chorus 乐句起点);shot 切换跟随 8 拍乐句边界(约 4s),旋律最高点/最强乐器冲击对应 center girl 特写或队形定格帧。
    • 黄昏收尾入场 = BGM outro 渐弱段第一拍;soft fade to warm white 与 BGM 渐弱曲线同步结束。
  • 若 BGM 无明确 outro:以 chorus 能量下降后的第一个安静乐句起点作为黄昏收尾入场锚点。
  • 三段无缝衔接:欢笑高潮→舞台表演的 shot 切换点须落在 BGM 乐句边界(不可在乐句中间切);两段之间允许最多 0.5s 软溶解过渡,不做硬切。

竖版快切 BPM 节拍速查表

BGM BPM1 拍时长2 拍(最短切换单位)4 拍(标准切换单位)8 拍(情绪停留单位)1100.55s1.1s2.2s4.4s1200.50s1.0s2.0s4.0s1280.47s0.9s1.9s3.7s1380.43s0.9s1.7s3.5s

  • 竖版快切目标上屏时间 1.5–2.5s ≈ 3–5 拍区间;建议以 4 拍为基准单位,BPM 不明时默认按 120 BPM 估算。
  • 情绪留白段落(黄昏收尾)以 8 拍为最小停留单位,不做快切;竖版对应约 4–5s,比横版收紧但仍须留出情绪沉淀空间。
  • 用户上传 BGM 时,resource_prepare_and_analyze 应在分析阶段输出 BPM 估算值,写入 Final_Video_Spec.md,供剪辑节拍速查表取值。

竖版(9:16)剪辑专项规则

触发条件:Final_Video_Spec.md 中画面比例为 9:16,或用户明确指定竖版输出。

时间线构建:

  • 竖版时间线分辨率设置为 1080×1920(480p 对应 720×1280);确保所有素材在导入前已按此比例生成或裁切,不做拉伸填充。
  • 横版素材(如用户上传的 16:9 参考片段)若必须使用,优先执行中心裁切至 9:16,保留画面中心人物;若人物偏侧,手动标记裁切锚点后再切。禁止信箱(letterbox)黑边填充。

安全区叠加与字幕处理:

  • 后期字幕(若有)统一放置于画面底部 18% 以上、25% 以内的安全带,字体大小适配竖屏可读性(建议字号不低于横版的 1.3 倍)。
  • 片尾定格帧的 soft fade to warm white 时长建议 1.5—2s(竖版用户注意力衰减快,不宜过长)。

节奏与转场(竖版适配):

  • 整体节奏比横版收紧 20—25%:快切蒙太奇段落上屏时间目标 1—2.5s,情绪段落 4—7s,黄昏收尾 5—8s。
  • 转场优先使用 hard cut(直切)soft dissolve(柔化叠化);竖版中 freeze frame on smile 的定格时间比横版缩短至 2—3s(过长在竖版中显得拖沓)。
  • 禁止在竖版中使用横向滑动转场(slide left/right)——与平台原生滑动手势冲突,易造成误操作感。

音频层混合(竖版无差异):

  • 音频混合规则与横版相同,无竖版特殊调整;BGM 渐弱、VO duck 策略保持一致。