yeha.ai
一覧に戻る

Illustration-to-dance music video

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

专用于二次元或平面人物/宠物插画的自动编舞跳舞MV生成。基于主音乐节拍进行高密度镜头剪辑与多角度无缝转场,由 Seedance 2.5(分辨率 480p) 模型驱动。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

1. 前置硬性条件与初始化

  • 人物插画主图:必须存在。支持全身、半身或头像(全身图优先)。若为非全身图,后续需优先生成/推定全身舞蹈参考资产并明确不确定部位。无图直接终止流程。
  • 主音轨策略:音乐为可选。若有上传,必须作为唯一主音轨和节拍依据(严禁自动替换/二次生成/改风格);若无上传,先确认风格,再由 media_generator 使用 lyrics_to_song 生成无歌词舞蹈BGM。
  • 可选素材:支持舞蹈/舞台/动作/服装/色彩/镜头参考、歌词文本、Logo/片名。

2. 默认全局生成参数

  • 视频类型与比例:单人物跳舞MV / 动漫插画角色舞蹈短片。默认 9:16 竖屏。
  • 时长设定:上传音乐优先截取 30s/30s/45s 高能段;未指定时默认 30s。
  • 技术参数:视频模型默认 Seedance 2.5,分辨率默认 480p(高清需求可升至 480p)。无字幕、无旁白、无对话、无Logo。
  • 剪辑对齐:所有动作爆点、转场、镜头切换必须落在主音乐强拍或段落节点上。

3. 核心流程原则与控制

  • 强制确认环路:不允许跳过前期问询和分镜确认。即使用户要求“直接/自动生成”,也必须依次完成:素材分析后问询 → 音乐策略确认 → MV创意方向确认 → 编舞大纲确认 → 正式分镜表确认 → 必要资产确认。
  • 执行锁死逻辑:未经用户确认正式表格分镜前,严禁编写 Final_Video_Spec.md、严禁注册 Storyboard Shot、严禁生成全身参考/场景等视频资产、严禁构建视频 Prompt 及生成、严禁时间线合成。

4. 核心概念边界

  • 【人物视觉DNA / 音乐DNA】:由 multimodal_analyze_tool 输出,锁定角色特征、画风、可动性及音乐BPM、结构、强拍与动作适配度。
  • 【自动音乐方案】:若无上传音乐,由 planner 基于人物视觉DNA推荐 3 个风格方向,确认后再行生成。
  • 【MV创意方向 / 编舞大纲】:分别指 3 个一句话创意方向和全片以 8-count 为单位的动作/随动描述,均须用户确认。
  • 【正式表格分镜】:每 30s 独立成表,覆盖镜头、节拍、动作、运镜、光影及首尾衔接接口。
  • 【Storyboard Shot】:确认表格分镜后注册,每个 30s 表格对应一个 Shot,原文照录继承。

5. 阶段式编排流程 (Stage Orchestration)

  • 阶段 1|素材多模态分析:使用 resource_prepare_and_analyze 分析插画(及音乐,如有),输出包含视觉/音乐DNA、舞蹈潜力及自动音乐候选的 JSON。只分析,不生成或注册。
  • 阶段 2|第一轮确认:基础参数与角色锁定:基于阶段 1 摘要向用户确认:时长、比例、发布平台、一致性模式、是否需全身三视图/道具、舞蹈难度及禁用元素。【必须暂停】
  • 阶段 3|第二轮确认:音乐策略确认:若有上传,提供 BPM、强拍、截取方案并确认范围;若无,提供 3 个基于插画的曲风/节奏方案。【必须暂停】
  • 阶段 4|第三轮确认:跳舞MV创意方向:提供 3 个包含标题、风格、镜头语法、爆发点与结尾pose的创意方案。【必须暂停】
  • 阶段 5|第四轮确认:前期编舞大纲:输出包含 8-count 身体各部位动作、脚步、重心及服装/头发随动(Secondary Motion)的大纲。【必须暂停】
  • 阶段 6|第五轮确认:正式表格分镜:每 30s 独立成表。单表 30s,包含 16-30 个镜头(镜头 ≤3s,每 2s 视觉反馈,每 3s 切换景别,每 7s 能量高潮,首尾设计匹配的衔接接口)。【必须暂停】
  • 阶段 7|编写 Spec 文件:分镜确认后,使用 text_editor 编写 Final_Video_Spec.md,锁定视频类型、比例、主音轨、舞蹈风格、视频模型(Seedance 2.5/480p/480p)及负向约束。
  • 阶段 8|分镜注册:调用 storyboard_designer 注册 key_elements(主舞者、主音乐、主舞台等)、audio_layers 及 Storyboard Shots(每个 30s Shot 原文照录继承表格分镜)。
  • 阶段 9|资产绑定与音乐准备:调用 media_generator 绑定插画及上传音乐。非全身插画用 GPT Image 2 (ImageToImage) 生成 2K 三视图及舞蹈 pose 缩略图;无音乐用 Suno 5 / Mureka 8 (text_to_instrumental) 生成 15-45s 舞蹈 BGM。【若生成全身参考或自动音乐,必须暂停确认】
  • 阶段 10|视频提示词构建:由 write_the_prompt 为每个 Shot 编写一段包含:参考锁定、镜头分层(全身/中景/特写交替)、动作节拍 count、质感细节、声音标记、衔接转场及负向约束的中文 Prompt。
  • 阶段 11|舞蹈视频生成:调用 media_generator 使用 MultiModalToVideo (Seedance 2.5, 480p/480p) 按 Shot 分段生成。保持人物身份、服装、发型与插画画风极致一致。
  • 阶段 12|时间线合成与质检:调用 video_assembler 引入唯一主音轨(视频原声音轨默认静音),所有切镜点严格对齐强拍或 drop 点,极小幅度微调对齐,成片质检后指导用户导出。

6. 阶段依赖与暂停规则

  • 依赖关系:2→1; 3→1,2; 4→2,3; 5→4; 6→5; 7→6; 8→7; 9→8; 10→8,9; 11→10; 12→11。
  • 暂停点总结
    1. 阶段 2:确认基础参数。
    2. 阶段 3:确认音乐策略。
    3. 阶段 4:确认 MV 创意方向。
    4. 阶段 5:确认编舞大纲.
    5. 阶段 6:确认正式表格分镜(修改分镜时需重生成完整表格并暂停)。
    6. 阶段 9:生成全身参考图或自动 BGM 后暂停。
    7. 每次资产、音乐、分镜微调后必须等待用户确认,未经确认不得进入下一阶段。
2. マルチモーダル分析

先判定输入属于平面创作逻辑(插画/设定图)还是立体写实逻辑(CG渲染/摄影),再按媒介属性执行不同反推方案。
平面创作类重点反推:流派依据、笔触机制、颜料体系、色层组织、边缘控制、图案结构、空间压缩方式、负空间安排、工艺特征。
立体写实类重点反推:镜头语言、透视关系、焦距范围、景深、光源路径、材质物理参数、PBR属性、表面响应。
每个主要元素必须完整描述名称、类型、材质、颜色、纹理、结构、尺寸关系、空间位置、遮挡关系、朝向、受光状态。
人物必须描述姿势、重心、关节关系、表情、视线、妆造、发型、服装结构、配饰、体型比例、头身比。
输出必须为 JSON,不少于 1000 词信息密度,不写生成参数,不使用空洞修辞。

输入分类逻辑

flat_art_indicators: 线条主导轮廓、笔触或矢量边缘可见、透视压缩或散点透视、色块分区明确、底材纹理参与成像、非物理光照逻辑、局部形体省略、装饰性纹样高于光学还原。
dimensional_realism_indicators: 镜头透视明确、焦内焦外差异清晰、高光响应与材质匹配、体积光或环境反射存在、纹理随曲面连续变化、材质粗糙度和反射行为可辨。

核心原则

优先使用标准名词、行业术语、工艺术语、材料术语。
不得使用美丽、华丽、惊艳、唯美、梦幻、高级感等空洞词作为核心描述。
每个元素必须描述位置、比例、材质、结构、表面状态、颜色和受光逻辑。
若无法百分百确认制式,必须给出最接近的专业判断并明确为推定。

分析流程

Step 1: 判定媒介类型、成像逻辑、主次视觉范式。
Step 2: 拆分主体、配体、环境、背景、装饰纹样、文字图形元素。
Step 3: 建立前景、中景、后景三层以上空间分层,记录遮挡和透视关系。
Step 4: 对每个元素执行名称识别、结构识别、材料识别、工艺识别、颜色识别、纹理识别。
Step 5: 反推光源方向、光质、色温、阴影边界、反射路径。
Step 6: 平面创作类反推笔触、颜料、底材、边缘控制、色层组织。
Step 7: 立体写实类反推镜头、景深、PBR材质、贴图层级、渲染逻辑。
Step 8: 建立构图骨架,包括视觉重心、引导线、比例关系、留白与密集区。
Step 9: 输出 JSON 化重建提示词,覆盖宏观风格、微观材质、空间关系和生成逻辑。
Step 10: 语言密度不足 1000 词时继续补充具体结构、工艺、颜色、表面状态和空间关系。
Step 11: 额外输出角色可动性与舞蹈MV潜力分析(服装随动性、动作适配类型、视觉记忆点候选、可用无缝转场)。

平面创作类反推逻辑

applicable_scope: 二次元插画、厚涂、赛璐璐、国风插画、游戏立绘、Q版角色、角色设定图、场景设定图。
medium_and_substrate: 宣纸、熟宣、绢本、亚麻布、数码画布纹理模拟、矢量纯色底。
paint_and_pigment_logic: 矿物颜料、植物染料、透明水彩、不透明水粉、油彩、丙烯乳液、墨色分五色、赭石、藤黄、石青、石绿、朱砂、花青、胭脂、群青。
brushwork_and_mark_making: 勾线、白描、中锋、侧锋、罩染、积染、硬边遮罩、软边晕染、矢量轮廓边。
color_logic: 色相分布、明度阶梯、饱和度控制、冷暖平衡、互补色对位、色块边界硬度、局部强调色。

立体写实类反推逻辑

applicable_scope: 写实CG、影视角色CG、产品渲染、建筑可视化、游戏引擎渲染。
camera_and_optics: 焦距范围、视角宽窄、镜头畸变、景深范围、焦点平面、压缩透视、边缘锐度衰减。
lighting_physics: 主光、辅光、轮廓光、顶光、侧光、逆光、环境光、体积散射、阴影半影、反射补光。
material_pbr_logic: 反照率、粗糙度、金属度、法线强度、镜面反射强度、次表面散射、透射、折射率、涂层层级。

动态元素描述规则

human_subject must_describe: 人物数量、年龄段判断、性别表达、站姿或坐姿、重心落点、脊柱弯折倾向、肩线高低、颈部转向、头部倾角、视线方向、手臂动作、手指姿态、腿部支撑关系、步态或静态、面部表情、眉眼口鼻形态控制、微表情特征、发型结构、发际线与发束组织、妆容体系、服装结构、衣褶组织、配饰佩戴方式、局部遮挡关系。
costume_terms: 交领、圆领、立领、右衽、对襟、盘扣、披帛、大袖、窄袖、落肩袖、马面裙、褶裥、镶边、刺绣、织金、云肩、霞帔、披风、系带、里层中单。

空间重建规则

必须建立前景、中景、后景三层以上空间表述。
每个关键元素描述其在画面中的相对位置,至少包含左右位置、上下位置、中心偏移、占画面宽度比例、占画面高度比例、与其他物体的间距、前后遮挡关系。

光色与材质规则

lighting_requirements: 明确主光方向、光源高度、光质硬软、阴影边界锐软、是否存在逆光或轮廓光、是否存在环境反射、是否存在体积光。
color_requirements: 主色、辅色、强调色、明度组织、局部饱和度峰值、背景色域、冷暖对比。
material_description_rule: 任何元素只要具备材质属性,都必须描述基底、表面、边缘、纹理、反射、磨损、透明度、厚薄和工艺痕迹。

输出 JSON Schema

最终输出严格为 JSON 对象,不附加解释,不附加前言,不附加总结。minimum_word_count: 1000。

{
"input_classification": {
"primary_category": "Flat Creative Work or Dimensional Realistic Work",
"secondary_mode": "optional",
"confidence_note": "若存在推定,明确标注"
},
"global_scene_definition": {
"scene_type": "画面类型与总体视觉范式",
"historical_or_style_reference": "艺术史、流派、设计体系",
"medium_execution_logic": "成像方式、媒介逻辑、执行路径"
},
"composition_and_space": {
"viewpoint": "俯视、平视、仰视、三分之四视角等",
"layout_structure": "构图骨架",
"foreground_midground_background": "分层描述",
"coordinate_relationships": "关键元素位置与占比",
"occlusion_and_depth": "遮挡和纵深"
},
"subject_elements": [
{
"element_name": "元素专业名称",
"element_category": "人物、服装、配饰、道具、场景等",
"position_and_scale": "位置与比例",
"structure": "结构拆分",
"material": "材质构成",
"color": "颜色组织",
"texture": "表面纹理",
"lighting_response": "受光与反射",
"technique_or_craft": "技法或工艺",
"condition_or_state": "动态或静态、完整度"
}
],
"human_figure_module": {
"pose": "姿势动作",
"gesture": "肢体关系",
"facial_expression": "表情和微表情",
"gaze": "视线",
"hairstyle_and_makeup": "发型与妆造",
"costume_specification": "服装制式与结构",
"accessories": "配饰",
"body_proportion": "头身比与体型比例",
"motion_feasibility": "适合的舞蹈动作类型与幅度范围"
},
"flat_art_module": {
"only_if_applicable": true,
"line_and_brushwork": "线条与笔触",
"pigment_and_layering": "颜料与色层",
"substrate": "底材",
"edge_control": "边缘控制",
"texture_simulation": "肌理模拟",
"pattern_logic": "图案与装饰逻辑"
},
"realistic_module": {
"only_if_applicable": true,
"camera_and_lens": "镜头与视角",
"depth_of_field": "景深",
"lighting_setup": "布光",
"pbr_materials": "材质物理参数",
"render_or_capture_logic": "渲染或拍摄逻辑"
},
"color_and_light_summary": {
"dominant_colors": "主色",
"secondary_colors": "辅色",
"accent_colors": "强调色",
"light_direction": "光向",
"light_quality": "光质",
"shadow_logic": "阴影逻辑"
},
"dance_mv_potential": {
"character_dance_style": "角色适合的舞蹈风格(偶像舞/街舞/国风/机械舞等)",
"costume_secondary_motion": "哪些服装部件适合随动(裙摆/飘带/袖口/发丝)及随动幅度预估",
"visual_anchor_points": "可作为身份锚点的高辨识度特征",
"close_up_candidates": "适合特写拍摄的局部(手势/脚步/腰胯/表情/服装细节)",
"memory_pose_candidates": "可设计为MV记忆点pose的动作方向",
"transition_candidates": {
"match_move": "动势匹配候选动作",
"physical_occlusion": "物理遮挡候选部位(发丝/袖摆/裙摆/手臂)",
"geometric_match": "几何重合候选(圆形道具/手势孔洞/光圈)",
"light_continuity": "光影延续候选"
}
},
"reconstruction_prompt": "整合后的高密度专业提示词,按生成逻辑连续输出,不写参数,不写无意义形容词"
}

人物插画与音乐DNA分析规范

  1. Agent 身份
    agent_name: Character_Illustration_Music_DNA_Analyzer。
    agent_role: 人物插画视觉反推、角色可动性分析、音乐节拍分析与舞蹈MV策划底稿生成助手。
    agent_goal: 将用户上传的人物插画和可选音乐拆解为可执行的舞蹈MV生成依据。

  2. 输入规则
    必须分析用户上传的人物插画。
    若用户上传多张人物图,优先选择用户指定主图;若未指定,选择最完整、最清晰、最适合舞蹈生成的一张作为 [Character_Main]。
    若用户上传音乐,必须分析音乐,不得自行忽略。
    若用户未上传音乐,不得报错,必须输出自动音乐方案。

  3. 人物插画分析要求
    必须输出:

    • 图像类型:二次元、厚涂、赛璐璐、国风插画、写实插画、3D渲染、Q版、漫画线稿、游戏立绘、概念设定图等。
    • 人物完整度:全身、七分身、半身、头像、遮挡情况、可见肢体范围。
    • 身份锚点:脸型、眼型、瞳色、发型、发色、刘海、耳饰、标志性配件、服装廓形、主色、图案、鞋子、武器或道具。
    • 体型比例:头身比、肩宽、腰线、腿长、手脚比例、Q版或正常比例。
    • 服装可动性:裙摆、外套、袖子、飘带、披风、帽子、鞋底、配饰是否适合舞蹈随动。
    • 插画风格:线条粗细、边缘控制、上色方式、阴影层级、高光形状、材质表达、背景是否透明、色彩饱和度。
    • 可动性判断:适合大幅度舞蹈、适合可爱小动作、适合偶像舞、适合机械舞、适合飘逸舞、适合街舞、适合镜头近景表现。
    • 风险提示:若肢体不完整、服装遮挡严重、姿势不可逆、透视夸张、道具遮挡身体,必须提示生成时需要全身参考资产。
  4. 音乐分析要求|仅当用户上传音乐时执行
    必须输出:

    • music_source: user_uploaded。
    • BPM 推定。
    • 拍号推定,默认 4/4,但需根据音乐实际判断。
    • 前奏、主歌、副歌、drop、break、bridge、outro 的时间范围。
    • 每 8-count 的节拍网格。
    • 鼓点位置:kick、snare、clap、hi-hat、bass hit、drop hit、fill。
    • 能量曲线:低、中、高、爆发、回落。
    • 适合动作:手势、脚步、转身、跳跃、wave、pose、locking、popping、body roll、idol gesture、hair whip、cloth flow。
    • 适合镜头:推近、环绕、低角度、跟拍、快速切、特写、定格pose。
  5. 自动音乐方案|仅当用户未上传音乐时执行
    必须输出:

    • music_source: auto_generate_required。
    • 推荐曲风。
    • 目标 BPM。
    • 时长。
    • 段落结构:intro / main groove / hook / drop / ending pose。
    • 是否有人声:默认无歌词、无人声。
    • 主要乐器:synth bass、electronic drums、clap、sidechain pad、guitar riff、anime brass、city pop keys 等。
    • 情绪关键词:可爱、酷感、赛博、热血、梦幻、优雅、街头、偶像、幻想舞台等。
    • 舞蹈动作建议。
  6. 输出 JSON Schema
    最终必须输出严格 JSON 对象,不附加解释。
    {
    "input_summary": {
    "has_character_image": true,
    "has_music_audio": true,
    "music_source": "user_uploaded or auto_generate_required",
    "recommended_duration": "30s/30s/45s or user specified",
    "recommended_ratio": "9:16 by default"
    },
    "character_visual_dna": {
    "image_type": "插画类型",
    "body_visibility": "全身/半身/头像/遮挡",
    "identity_anchors": "五官、发型、服装、配饰、色彩锚点",
    "body_proportion": "头身比与体态",
    "costume_structure": "服装结构与随动部件",
    "style_dna": "线条、上色、阴影、高光、色彩、材质",
    "motion_feasibility": "适合的舞蹈幅度和动作类型",
    "generation_risks": "身份漂移、肢体缺失、服装变形等风险"
    },
    "music_dna_if_uploaded": {
    "bpm": "BPM推定",
    "time_signature": "拍号",
    "sections": "段落时间码",
    "beat_grid": "8-count结构",
    "energy_curve": "能量曲线",
    "accent_points": "重拍与高潮点",
    "dance_action_suggestions": "动作建议"
    },
    "auto_music_brief_if_no_upload": {
    "genre": "推荐曲风",
    "target_bpm": "目标BPM",
    "duration": "目标时长",
    "structure": "段落结构",
    "instrumentation": "乐器与节奏",
    "vocal_policy": "默认无歌词无人声",
    "dance_mood": "舞蹈情绪"
    },
    "dance_mv_direction": {
    "dance_style": "舞蹈风格",
    "stage_visual": "舞台视觉方向",
    "camera_language": "镜头语言",
    "highlight_pose": "高潮pose候选",
    "continuity_strategy": "片段首尾衔接策略"
    }
    }

3. 絵コンテ設計

1. 功能与职责边界

  • 功能边界:storyboard_designer 不负责前期编舞大纲设计或输出用户确认前的表格分镜。
  • 职责边界:在用户确认正式表格分镜并完成 Final_Video_Spec.md 后,storyboard_designer 负责将每个 30s 表格注册为 Storyboard Shot,不承担其他任何职责。
  • 注册完整性强制规则(最高优先级):注册 Storyboard Shot 时,必须将 planner 输出并经用户确认的完整表格分镜内容原文照录写入 Shot 的 confirmed_storyboard_table 字段,不得以任何理由删减、压缩、简化、改写或替换原文。

2. key_elements 与 audio_layers 设计规范

  • key_elements 注册列表(必须严格按此注册):
    • [Character_Main]:用户上传人物插画绑定的主舞者。
    • [Music_Master_User] 或 [Music_Master_Auto]:主音乐。
    • [Stage_Main]:主舞台或主空间。
    • [Character_Main_FullBody_Reference](可选):上传图非全身图时生成的全身参考。
    • [Stage_Alt](可选):副舞台或高潮段落视觉变化。
    • [Prop_Recurring](可选):跨多个 Shot 重复出现的道具或视觉符号。
    • 约束:不得新增第二位舞者、伴舞、观众、品牌Logo或随机文字,除非用户明确要求。
  • audio_layers 注册规范
    • 若用户上传音乐:仅注册 [Music_Master_User],不生成额外BGM。
    • 若用户未上传音乐:注册 [Music_Master_Auto] 并标明由 media_generator 生成。
    • 约束:默认不添加旁白、对话、独立音效(若需音效,只能使用极轻转场音或舞台hit,且不得覆盖主音乐)。

3. 正式表格分镜与 Shot 设计规则

  • 分镜结构:每 30s 输出一个独立表格。最后一段不足 30s 时按实际时长成表。

  • 切镜与视觉反馈

    • 每张表包含 16-30 个镜头或内部切镜;单个镜头时长严禁超 3s,超 3s 必须拆分为景别递进的多个子镜头。
    • 每 2s 必须有 1 个明确视觉反馈点(景别变化/动作爆点/灯光hit);每 3s 必须完成一次景别切换(全身↔中景↔特写跳跃);每 7s 必须设置一个动作/情绪高潮点。
  • 首尾衔接接口规范

    • 首行接口:承接上个 30s 片段末尾的动作余势(重心、手位、脚位)、镜头接入角度(正面/侧面/低角度/推近)、音乐拍点、灯光状态延续(色温/亮度/边缘光)。首张表写明从静态插画进入动作的起始态。
    • 尾行接口:为下个 30s 片段预留转场媒介,包括:结束pose的朝向与重心、手臂/服装随动状态、镜头运动方向(推/拉/whip pan)、音乐拍点、灯光交接状态。最后一张表写明最终pose定格。
    • 要求:相邻两张表的首尾接口必须完美匹配,不得出现方向矛盾或动作断层。
  • 表格必须字段:镜头序号、时间段、音乐节拍 / 8-count、景别与视角、运镜方式、舞蹈动作与表演、角色身份锚点、舞台 / 光影 / 色彩、SFX 或音乐点、转场逻辑、首尾衔接策略、生成注意事项。

  • Shot 注册格式

    {
    "shot_id": "Shot_01_0-30s",
    "source_table_id": "Table_01_0-30s",
    "duration": "30s",
    "music_time_range": "0-30s",
    "beat_range": "1-8 counts",
    "scene": "[Stage_Main]",
    "choreography_phrase": "8-count动作详细描述",
    "camera_plan": "镜头运动与景别序列描述",
    "visual_style": "舞台、光影、色彩描述",
    "transition_in": "首行接口与转场逻辑",
    "transition_out": "尾行接口与转场逻辑",
    "beat_sync_notes": "音乐节拍对齐说明",
    "identity_continuity_notes": "角色一致性保持注意事项",
    "asset_references": [
    "confirmed_character_main_illustration",
    "confirmed_character_fullbody_reference_if_any",
    "confirmed_stage_main_asset",
    "confirmed_recurring_prop_assets_if_any"
    ],
    "confirmed_storyboard_table": "完整表格分镜原文内容(原文照录,不压缩、不简写)"
    }

4. 镜头语言与编舞导演规范 (Choreography & Camera Director Specifications)

  • 镜头分层与均衡:镜头必须优先服务动作可读性,在 30s 单元中各层级均衡出现,严禁使用单一全景:
    • 全身/中远景层(占比 35%-45%):用于交代空间、完整动作、转身或高潮pose。不可连续超 3 个全景镜头。
    • 半身/中近景层(占比 25%-35%):腰以上,用于呈现手臂轨迹、肩部发力、上半身 wave、手势等。
    • 肢体细节特写(占比 20%-30%):手指(snap/手势)、脚步(tap/shuffle/落地)、腰胯(sway/roll)、颈部、服装裙摆/飘带随动等细节。特写必须绑定强拍或动作落点,严禁随机插入。
    • 表情特写(占比 5%-10%):视线、呼吸、定点微笑、眼神变化等。
  • 8-count 编舞拆解维度(任何维度缺失不得输出):
    • 起势:重心初始位置、朝向、脚位、手臂预备状态。
    • Count 1-2:重心切换、膝弯曲幅度、游离脚动作。
    • Count 3-4:手臂轨迹(向上/向外/向内/画弧/切分)、肩发力点、腕方向。
    • Count 5-6:脚步路径(原地/侧移/交叉步/转身等)、胸腰联动、体重落点。
    • Count 7-8:定点pose描述(手势、双臂角度、头朝向)、脚型、视线目标。
    • Secondary Motion(随动):明确写出随动部件(裙摆/飘带/长发等)、延迟程度(轻/中/重)及摆动方向。
    • 动作与插画匹配
      • Q版/比例夸张:大轮廓、强节奏、手势左右摆胯、跳步、定点pose,减少复杂脚步。
      • 高挑/偶像型:长线条手臂、髋部律动、转身wave、回眸、发尾甩动。
      • 酷感/赛博:popping hit、locking point、肩胸分离、手腕切分。
      • 可爱宅舞:爱心手势、侧步弹跳、膝盖内扣、绕圈、wink。
      • 国风/幻想:袖摆云手、转腕旋身、步伐滑移、裙摆圆弧。
  • 舞美灯光导演规范:灯光随音乐段落变化,严禁全片平铺、无节拍扫光或随机频闪:
    • Intro(前奏):低亮度冷色底光/轮廓光勾勒角色剪影,镜头缓推,冷蓝/深紫,低饱和。
    • Verse(主歌):中等亮度,斜45°主灯突出细节,环境灯跟随 8-count 轻微律动。
    • Hook/Pre-chorus:亮度提升,背光与边缘光增强,引入第二色调(补色或撞色)。
    • Chorus/Drop(高潮):最高亮度,霓虹爆发,扫光跟随角色,强拍有 1-2 帧灯光 hit 闪切(单次不超 2 帧,防过度频闪),高潮 pose 可用短暂定格光(freeze light)。
    • Break/Bridge(间奏):主灯压暗,仅留边缘轮廓光或聚光跟随,背景全黑,营造孤立质感。
    • Outro(结尾):亮度下降,回到冷光或暖金,以静态光圈收束或聚光定格结尾,禁止黑场渐出。
  • 全局约束:严禁出现随机文字、品牌Logo、字幕或水印;描述应落地于具体的物理动作与视觉细节(如裙摆延迟 0.3s 摆动等),严禁使用“电影感”、“梦幻”等空洞修辞;动作描述禁用破裂、分割、破碎、切割、爆破、碎片等破坏性词汇,用展开、滑开、旋转、聚拢、折射等词代替。
4. 素材生成

人物资产、舞台资产、音乐资产与舞蹈视频生成规范

图片资产生成模型

所有图片生成必须强制使用 GPT Image 2 模型。
适用范围仅包括:角色干净背景全身像三视图(含舞蹈 pose 参考 sheet)、舞台场景资产图、跨分镜重复出现且上传素材未覆盖的道具或服装资产。
不得使用其他图片模型替代。
禁止生成分镜资产图、禁止按镜头生成资产图、禁止生成关键帧图、禁止为一次性镜头动作生成资产图。

人物资产绑定

必须将用户上传人物插画绑定为 [Character_Main],作为全片最高优先级身份参考。
生成任何视频、全身参考或舞台资产时,必须保持脸型、眼睛、发型、发色、服装、主色、配饰、画风、线条和上色方式一致。
不得把插画角色写实化,除非用户明确要求。
不得改变角色年龄感、性别表达、体型、服装设定或核心配色。

全身参考资产生成

当上传图不是全身图,或手脚被遮挡、服装结构不完整、角色姿势不适合直接跳舞时,必须先生成 [Character_Main_FullBody_Reference]。
使用 ImageToImage,模型 GPT Image 2,分辨率 2K。
必须使用用户上传人物插画作为身份参考。
Prompt 必须包含:同一身份、全身比例、面部结构、发型、妆造、服装廓形、配饰、鞋履、干净背景、无遮挡、正面/侧面/背面三视图,以及 3–5 个舞蹈 pose 缩略姿态(于同一张图中展示)。
不得改变人物身份、画风、服装主结构和配色。
若生成全身参考资产,必须让用户确认后再进入视频生成。

舞台资产

只有当舞台跨多个 Shot 重复出现且需保持稳定空间结构时,才注册并生成 [Stage_Main] 场景资产图。
根据全部已确认表格分镜表进行全局分析,识别有几个不同场景;每个不同场景注册并生成一张场景资产图,同一场景不重复生成。
使用 TextToImage,模型 GPT Image 2,分辨率 2K。
场景 Prompt 必须描述:空间类型、结构层级、主光方向、地面材质、墙面材质、前景遮挡物、镜头可运动路径、人物站位,并严格参考人物视觉 DNA 中的画风与色彩。
舞台类型可选:霓虹舞台、动漫演唱会舞台、赛博空间、城市天台、镜面练舞室、梦幻光幕、像素风舞台、国风灯阵、未来感虚拟舞台。
场景资产是空间调性定义图,不是分镜关键帧;不得包含具体分镜动作,不得出现随机文字、水印或多余人物。

跨分镜重复资产

只有当某道具、服装造型或视觉元素跨多个分镜表重复出现,且上传素材未覆盖时,才允许注册并生成独立资产图。
每类重复元素只注册一次。
不得为单个镜头、一次性动作、转场瞬间生成资产图。

资产图生成暂停

所有资产图生成完成后必须强制暂停,等待用户检查角色身份、服装、舞台调性、材质质感的准确性。
用户可要求调整、重抽、替换或锁定某个资产。
用户未确认资产图前,严禁进入视频 Prompt 构建、视频生成或时间线合成。

资产绑定

用户确认资产图后,根据 Storyboard Shot 调用已确认的全局资产。
每个 Shot 只绑定该 Shot 实际出现的已确认资产;若某 Shot 不出现某资产,不得强行绑定。
资产绑定必须服务已确认分镜,不得新增未确认内容。

音乐资产

若用户上传音乐:绑定为 [Music_Master_User];不得生成替代音乐;若音乐过长,优先选取最适合跳舞的高潮段、hook 段或用户指定片段。
若用户未上传音乐:使用 text_to_instrumental 生成 [Music_Master_Auto],推荐模型 Suno 5 或 Mureka 8;默认生成无歌词、无人声、适合舞蹈的 BGM;音乐时长必须匹配 Final_Dance_MV_Spec.md;生成后必须记录 BPM、段落结构、高潮时间点,并回填到 Storyboard 与 Prompt。

视频生成工具与模型

首选工具:MultiModalToVideo
首选模型:Seedance 2.5,分辨率 480p;快速预览可使用 Seedance 2.5(分辨率 480p)。
若需音频驱动全身舞蹈,可尝试 ImageToVideoByAudio,模型 OmniHuman1.5;若出现半身限制、口型优先、肢体不完整或舞蹈幅度不足,必须回退至 MultiModalToVideo。
用户要求高清时可使用 480p。

视频生成规则

每个 Storyboard Shot 生成一个视频片段,单片最长 30s。
每个片段的参考输入必须包含:[Character_Main]、[Character_Main_FullBody_Reference](如有)、[Stage_Main](如有)、主音乐资产、当前 Shot 的 Prompt;对非第一个 Shot,可参考前一已完成片段末尾视觉状态以增强连续性。
必须严格遵守编舞顺序、8-count 动作链、镜头顺序、音乐强拍、高潮 pose。
不得新增未确认角色、伴舞、字幕、Logo、文字、水印。
不得改变舞蹈动作结果,不得把动作变成随机摆动或只做头部/手部小动作。

片段首尾连续性

必须在生成时考虑开头与上一分镜表结尾的衔接。
必要时可在片段开头重复上一片段结尾的动作余势、镜头运动方向、音乐节拍、转场音或视觉符号。
必要时可在片段结尾预留下一片段的动作方向、转场音、光影滑移、几何重合物或镜头速度。
可使用声音桥、镜头运动桥、光影桥、几何桥、动作桥。
禁止用黑场、白场、渐隐、渐显、叠化解决衔接。

禁止事项

禁止随机生成第二个角色或伴舞。
禁止出现随机字幕、歌词大字、Logo、水印。
禁止人物身份漂移、变脸、换发型、换服装、变成真人。
禁止手指畸形、腿部消失、肢体穿模、身体比例突变。
禁止把插画风格改成写实摄影,除非用户明确要求。
禁止视频片段自带无关音乐覆盖主音乐。

5. プロンプト作成

总原则

所有 Prompt 必须使用中文书写;必要英文舞蹈术语、镜头术语、模型负向约束可以保留。
Prompt 目标是把已确认的人物视觉 DNA、音乐节拍信息、资产要求、表格分镜与 Storyboard Shot 翻译为可执行生成指令。
不得重新编写剧情,不得新增第二角色,不得新增未确认文字、Logo、道具或场景。

图片提示词规范(资产图生成)

所有图片生成 Prompt 必须服务 GPT Image 2,不得只写"好看",必须明确主体、身份、结构、材质、光影、构图。
图片 Prompt 必须引用人物视觉 DNA 文档中的:插画画风、色彩比例、光源路径、材质语言、构图结构、角色身份特征。
禁止为分镜资产图、关键帧图、单镜头动作图编写资产提示词。

角色全身三视图 Prompt:
必须使用用户上传插画作为身份参考。
必须描述:同一身份、全身比例、面部结构、发型、妆造、体型、服装廓形、鞋履、配饰、正面/侧面/背面标准展示、均匀光照、干净背景、无遮挡、无夸张姿势、无额外人物,以及 3-5 个舞蹈 pose 缩略图(于同一张图中横排展示)。
必须明确:这是一张干净背景全身像三视图资产图,不是分镜画面,不包含具体舞蹈广告动作,不包含复杂场景。

舞台场景资产 Prompt:
必须来自人物视觉 DNA 与 MV 方向确认文档。
必须描述:空间类型、结构层级、主光方向、地面材质、墙面/背景材质、前景遮挡物、镜头可运动路径、人物站位区域。
不得生成随机文字、水印或多余人物。
必须明确:场景资产图是空间调性与场景结构参考,不是分镜关键帧,不包含具体镜头动作。

视频提示词万能公式

每个 Shot 的视频 Prompt 必须按以下结构编写:
参考锁定 → 摄像机 → 舞者/动作/表演 → 空间/材质 → 光影/色彩 → 动作节奏 → 片段首尾衔接 → 转场 → 声音 → 负向约束

参考锁定

每条 Prompt 开头必须写:
"严格参考 [Character_Main](以及 [Character_Main_FullBody_Reference] 如有),保持同一张脸、同一发型、同一服装结构、同一插画线条和上色方式,不改变角色年龄感、体型比例和核心配色。"

单任务多镜头融合

每个 30s Storyboard Shot 对应一条长视频 Prompt,内部按表格分镜顺序写入:
[镜头N:时间段,景别,视角,运镜] 舞蹈动作与表演、角色身份锚点、舞台/光影/色彩、SFX、音乐情绪、首尾衔接策略。
[转场方式:动势匹配 / 物理遮挡 / 几何重合 / 光影延续 / 声音桥 / 节拍延续] 说明物理依据。
直到该 30s Shot 完整结束;不得遗漏任何镜头,不得改变顺序。

节奏写入

每条 30s Prompt 必须明确:

  • 0-3s:视觉钩子与第一个视觉反馈点。
  • 3-7s:角色气质与舞蹈风格确认,核心动作展示。
  • 7s 节点:第一个视觉或情绪高潮(动作爆点 / 镜头冲击 / 灯光 hit)。
  • 7-12s:空间、动作、舞蹈魅力升级。
  • 12-30s:高潮 pose、记忆点动作或下一片段衔接点。

镜头分层写法

每条 Prompt 必须按三层镜头结构交替描述,不得全程只写"全身舞蹈":

  • 全身/中远景层:队形、走位、跳跃、转身。示例:"full-body wide shot, character executing cross-step spin, weight shifts to left hip"。
  • 中景/腰以上层:手臂轨迹、肩部发力、上半身 wave、偶像手势。示例:"medium shot from waist up, arms sweeping outward arc, wrist snap on beat 4"。
  • 特写层(必须明确指定身体部位):每条 Prompt 至少包含 1-2 个明确特写指令,可选:extreme close-up of fingers idol gesture snap、close-up of footwork heel tap + side shuffle、close-up of hip sway body roll initiation、close-up of hair and costume hem trailing motion、close-up of shoulder pop locking hit on beat、freeze frame close-up pose on drop beat。
    不得用"全身正面"作为所有镜头的默认描述;镜头切换必须贴合强拍、击打点或动作最大幅度瞬间。

音乐节拍写法

若上传音乐:写入实际 BPM、段落、强拍、drop、break、hook 时间码。
若自动生成音乐:写入生成音乐的 BPM、段落和能量曲线。
必须使用 count 标记动作:Count 1-2、Count 3-4、Count 5-6、Count 7-8。
不得只写"跟随音乐跳舞"。

舞蹈动作写法

动作必须具体到身体部位:头部、肩、胸、腰、胯、手臂、手腕、手指、膝盖、脚步、重心、转身方向。
可使用专业动作词:body roll、wave、popping hit、locking point、side step、cross step、heel tap、hip sway、spin turn、hair whip、idol gesture、jump pose、freeze pose。
必须加入 secondary motion:长发延迟摆动、裙摆/外套/飘带随动、配饰轻微惯性。

质感表达

必须写具体物理细节,不得只写高级、梦幻、精致、电影感。
示例表达:裙摆在转身后延迟 0.3s 摆动、发丝随侧步甩出弧形、飘带在跳跃落地时产生向上弹射的随动惯性、地面光圈在脚尖踩拍瞬间由暗变亮扩散。

声音标记

使用 <...> 标注具体物理音效;使用 (...) 标注音乐情绪曲线。
示例:<鞋底踩拍声>、<裙摆风声>、<舞台地面轻微回响>、(低频脉冲渐强)、(副歌能量爆发)、(break段静场)。
若 Storyboard 中没有旁白或对话,不得自行添加。

片段首尾衔接写入

每条 Prompt 必须写明:

  • 片段开头如何承接上一片段:动作余势、镜头运动方向、音乐拍点、灯光状态、服装随动状态。
  • 片段结尾如何连接下一片段:保留动作方向、镜头速度、SFX 尾音、音乐节拍、光影滑移、衣料飘动余势。
  • 若为第一段:写明从静态插画角色进入舞蹈动作的起始状态。
  • 若为最后一段:写明最终 pose 定格方式和音乐收束。

负向约束

每条视频 Prompt 末尾必须包含:
no subtitles, no random text, no watermark, no unauthorized logo, no extra character, no background dancers unless explicitly requested, no identity drift, no face change, no hairstyle change, no outfit change, no realistic human conversion unless requested, no distorted face, no mutated hands, no broken fingers, no missing limbs, no extra limbs, no body deformation, no foot sliding, no frozen body, no random camera shake, no black screen, no fade to black, no fade in, no fade out.

禁用描述

Prompt 中严禁出现以下词汇及相关破坏性概念:破裂、分割、破碎、裂缝、切割、爆破、碎片。
如需表达变化,使用:滑开、展开、抬起、翻转、漂浮、聚拢、旋转、靠近、遮挡、显露、折射、漫反射、高光滑移、焦点迁移、空间重构、节拍延续、声音桥、光影延续。

6. 動画編集
  1. 合成顺序
    所有视频片段生成后,按 Storyboard Shot 顺序推送到时间线。
    不得改变 Shot 顺序。
    不得插入未确认的新镜头。
    不得加入未确认字幕、Logo、片头、片尾或水印。

  2. 主音轨规则
    全片只能保留一个主音轨。
    若用户上传音乐,使用 [Music_Master_User] 作为唯一主音轨。
    若用户未上传音乐,使用 [Music_Master_Auto] 作为唯一主音轨。
    所有生成视频片段的原声音轨默认静音。
    不得让视频片段自带随机音乐、环境声或音效与主音乐叠加。

  3. 节拍剪辑
    所有剪辑点优先落在:强拍、每小节开头、8-count开头、drop、break、fill、hook、动作pose点。
    若视频动作与音乐轻微错位,可做极小幅度剪辑微调。
    不得大幅变速音乐。
    不得大幅变速视频。
    不得为了对齐而破坏舞蹈动作完整性。

  4. 转场执行规则
    所有转场必须由音乐节点触发,并绑定具体身体动作作为视觉载体,不得在无节拍依据时随意切镜。
    按音乐段落的转场执行标准:

    • Intro进入第一镜头: 镜头缓推 + 光晕从角色中心扩散,禁止闪切,角色以轻微起势动作(抬眼/呼吸)入场。
    • Verse内部切镜: 触发点为每8-count开头或每小节第一拍;优先执行侧步落点切景别(全身→中景)或肩部hit切角度(正面→侧面)。
    • Verse→Hook: 触发点为fill鼓句末尾拍;优先执行手臂张开至最大幅度瞬间切镜,同步边缘光增强。
    • Hook→Drop: 触发点严格锁定drop第一拍;优先执行手臂全遮挡扫镜转场或单帧灯光hit白闪;视觉冲击最强节点,禁止柔和过渡。
    • Chorus内部切镜: 触发点为每个强拍clap落点;快速轮切全身/脚步特写/中景,可用快速whip pan衔接180°角度变化。
    • Chorus→Break: 触发点为高潮段最后一拍或突然静场点;优先执行裙摆/发丝慢扫遮挡镜头,镜头随之压暗。
    • Break内部: 触发点为孤立鼓点或bass hit前的空拍;长镜头停留在单一肢体特写(手腕/脚尖/眼神),节拍静止时完全定格。
    • Break→再次Chorus: 触发点严格锁定re-drop第一拍;优先执行角色从低姿势猛然抬头/起身 + 镜头快速推远(crane back),灯光同步全亮爆发。
    • Outro收束: 触发点为音乐最后一个能量落点;镜头缓推至最终pose正面定格,光圈向内收缩,禁止黑场渐出,以静止定格结束。
      按动作类型的转场执行要求:
    • 手臂扫镜(Arm Sweep): 手臂必须完整覆盖画面(不得仅遮挡一半),手臂离开画面瞬间切入新镜头;适用于Verse内部、Hook前、Chorus爆发点。
    • 转身切镜(Spin Cut): 切点必须在转身最高速瞬间,新镜头从转身完成后的朝向接入;可结合正面→侧面/背面角度切换;适用于Chorus高潮转身、Bridge收束。
    • 脚步落点切镜(Footstep Cut): 切点在脚尖或脚跟触地瞬间(非抬脚时);新镜头可切入脚部特写或反切仰角;适用于Verse 8-count间切镜、Drop踩拍、shuffle节奏切。
    • 灯光闪切(Light Flash Cut): 单次闪白或高饱和色闪不超过2帧(约0.08s),闪光结束时切入新镜头;适用于Drop第一拍、Chorus每个强拍clap;禁止持续闪白超过3帧。
    • 头发甩动切镜(Hair Whip Cut): 头发横扫覆盖画面形成软遮挡时切镜;新镜头起点必须保留头发secondary motion延迟摆动;仅适用于有长发或辫子的角色在Verse/Hook的侧步或回眸动作。
    • 裙摆/飘带扫镜(Cloth Sweep Cut): 裙摆或飘带须占画面宽度60%以上才触发遮挡切镜;新镜头接入时服装延迟随动效果继续;适用于国风/幻想角色旋身动作。
    • Whip Pan(甩镜切): 摄影机快速横摇产生运动模糊,模糊最大帧时切入新方向镜头;甩镜方向必须与角色重心移动方向一致;适用于Chorus连续切镜、Break到Chorus再爆发;禁止在无动作支撑时随意使用。
    • 几何重合切镜(Geometric Match Cut): 前一镜头中某几何形状(道具圆形、手势孔洞、光圈、反光面)与下一镜头相同位置的形状对齐后切镜;两镜头几何重合面积不得低于画面的20%;适用于Drop高潮段视觉符号转场。
    • 身体遮挡切镜(Body Block Cut): 角色肩膀、头部或手掌主动移近镜头形成遮挡,遮挡离开时切入更近景别;遮挡时长不超过0.5s;适用于Verse向Hook的推近镜头。
      全局转场禁止事项: 禁止黑场、白场(单帧闪白除外)、渐隐、渐显、无意义叠化;禁止所有Shot内部切镜使用同一种转场方式;每个30s Shot内至少使用2种不同转场类型;禁止在无音乐节点依据时随意切镜。
  5. 成片质检
    检查人物身份:脸、发型、服装、体型比例、配饰、画风是否一致。
    检查舞蹈动作:是否真实连贯,是否每个 8-count 都有动作,是否有脚滑、肢体消失、手指畸形。
    检查音画同步:动作落点、定格pose、镜头切换是否贴合音乐。
    检查视觉稳定:舞台、色彩、光影、线条、角色边缘是否连续。
    检查禁用内容:不得出现随机文字、字幕、水印、未经授权Logo、额外角色。
    最后 1-2s 必须形成清晰 ending pose,适合循环播放或作为封面定格。