yeha.ai
一覧に戻る

M Countdown music stage

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

面向 K-pop 打歌舞台、户外舞台与现场演出短视频创作,将角色、舞台设定和爆点结构转化为观众第一人称 POV 的双角色舞台表演/对决视频;强调真实现场演出质感、舞台灯效、观众反应、长镜头爆点升级和 IP 风险规避。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

编排流程

阶段一:信息收集与规格确认

  • 用户输入角色描述、能力类型、场景类型、爆点结构即可启动;无需上传参考视频。
  • 本 Skill 默认就是双角色视频。如果用户只给出一个角色,先询问或提案第二个原创对手/搭档;不得默认生成单角色能力展示。
  • 开始前通过 text_editor 建立 Final_Video_Spec.md,锁定以下全局参数:
    • 视频数量:默认 1 条 15 秒视频。
    • 每条时长:默认 15 秒;每条 15 秒视频在 Storyboard 中各自对应 1 个 shot
    • 双角色设定:角色 A、角色 B、双方能力、舞台站位关系、对决关系。
    • 画幅:用户指定 9:16 竖版或 16:9 横屏,未明确时必须先通过 <cards> 询问。
    • 分辨率:用户指定 720p 还是 1080p,未明确时必须先通过 <cards> 询问。
    • 视觉风格:cinematic realistic outdoor live stage show,观众第一人称 POV,摄像机等于观众的眼睛或手机镜头,拍摄设备本身不入画;默认是户外主题乐园剧场、露天广场舞台、祭典舞台、漫展外场或夜场舞台,除非用户明确指定室内场馆。
    • 旁白语言:默认日语短句。
  • 如果用户给出热门动漫/游戏角色名,只把它当作灵感来源,不把官方角色名、作品名、招式名写入 Storyboard 或生成 prompt。

阶段二:故事板设计(暂停确认)

  • 调用 storyboard_designer 设计完整 Storyboard,包括:
    • 每条视频的 key_element:户外舞台/剧场空间、角色 A、角色 B、关键舞台道具或超自然特效源。观众 POV 是 shot 级镜头约束,不创建为独立 key_element
    • 每条 15 秒视频只创建 1 个 shot。若同一段视频有内部节奏升级,在该 shot 描述内使用 Beat 1 → Beat 2 → Beat 3 → Final beat 的叙事节拍,不得使用墙钟时间戳,也不得拆成多个 shot
    • 每条视频配套规划 Audio_BGM_*Audio_VO_* 两类独立音频层。
  • Storyboard 完成后强制暂停,向用户展示故事板结构,等待用户确认。
  • 如用户要求修改,调用 storyboard_designer 更新后再次暂停确认;直到用户明确说“确认”或“开始生成关键元素”才进入下一阶段。

阶段三:关键元素资产生成(暂停确认)

  • 用户确认 Storyboard 后,先调用 media_generator 生成或绑定关键元素资产,不得直接生成分镜视频。
  • 若用户已提供对应参考图,先注册并绑定到对应 key_element;若无参考图,按 Storyboard 描述生成关键元素参考图并绑定。
  • 关键元素完成后强制暂停,向用户展示角色 A、角色 B、舞台/场景等关键元素资产,等待确认。未确认前不得生成分镜视频。

阶段四:分镜视频生成(暂停确认)

  • 用户确认关键元素资产后,调用 media_generator 生成每条视频对应的 final_shot
  • 分镜视频生成必须引用已确认的关键元素资产:角色 A、角色 B、舞台/场景,以及必要道具或特效源。
  • 不在本阶段生成 VO 旁白或 BGM;先让用户确认画面是否打中观众第一人称 POV、双角色同台关系、户外舞台真实感、前景观众层次、长镜头连续性和超自然爆点。
  • 分镜视频完成后强制暂停,等待用户预览确认;如用户要求修改画面,优先回到 storyboard_designer 或视频生成 prompt 修正后再重试。

阶段五:生成 VO 旁白与 BGM(暂停确认)

  • 用户确认分镜视频画面后,再调用 media_generator 根据已确认的视频节奏与 Storyboard 音频层一次性生成 VO 旁白和 BGM。
  • VO 只覆盖开头句与收尾句等短句,不复述完整画面动作;BGM 以纯器乐/音效配乐为主,服务舞台奇观与观众反应。
  • 音频生成完成后暂停,等待用户确认声音气质、节奏和音画贴合程度。

阶段六:时间线追加

  • 用户确认视频与音频后,调用 video_assembler
  • 每条 15 秒成片作为独立片段,边界清晰,便于单独选中导出。
  • BGM 音量默认 0.7,VO 音量默认 1.0;每个片段末尾 2 秒淡出。

依赖关系

1 → 2 → 3 → 4 → 5 → 6。禁止一次性跑完所有阶段;每个暂停点均须等待用户明确确认后方可继续。

IP 角色转化策略

当用户描述的角色属于热门 IP(如现有动漫、游戏中的知名角色)时,按以下步骤在 Storyboard 阶段主动规避:

  1. 禁止出现角色名、作品名、招式名、组织名、村庄名或标志性台词。
  2. 外观只保留 2-3 个显著特征,并故意改动其中至少 1 个:
    • 例:原角色“白发 + 六眼 + 黑高领 + 蓝紫术式”改为“银灰短发假发 + 烟色护目镜 + 深海蓝高领演出服 + 六边形 LED 光幕”。
    • 改动方向:换发色、换服装颜色/材质、替换标志性配件、删除标志性纹路/徽章/符号。
  3. 把角色辨识度转移到能力和舞台表演方式:
    • 技能视觉:光效颜色、形状、运动方式、扩散路径、冲击波形态。
    • 战斗或表演节奏:防御反制型、高速突进型、范围爆发型、召唤烟雾型等。
    • 身体动作:站姿、手势、发力部位、移动路径、停顿姿态。
    • 舞台转译:把技能翻译成光幕、追光、灯柱、烟雾喷射、火焰环、闪光、舞台机关等可见现场表演语言。

IP 风险处理

  • 当视频生成返回 OutputVideoSensitiveContentDetected 等敏感内容拦截时,不自动切换模型。
  • 告知用户角色外观可能被识别为版权 IP pattern,并提供两个方向:进一步弱化外观特征并强化技能灯效描述,或更换外观设计后重新更新 Storyboard 再重试。
2. マルチモーダル分析

参考素材分析规则

当用户提供参考视频、测试成片或舞台素材时,优先提取以下信号供 Storyboard 与生成 prompt 使用:

  • POV 与运镜:判断是否为观众第一人称 POV;记录同一长镜头内的短促数码变焦、注意力横摇、抬头追烟柱/光柱、回拉重建全舞台等手机拍摄反应。此类运动属于长镜头内部注意力变化,不是切镜。
  • 真人质感:记录角色是否像真人舞台演员/特技演员,服装是否有真实布料、皮革、金属、护具、道具重量和皮肤光照;若参考呈真人质感,后续不得写成卡通、动漫、游戏 CG 或玩偶皮套。
  • 特效落地:记录特效如何与真实舞台发生交互,包括烟雾被推开、地面雾流动、灯架/建筑被照亮、观众脸部过曝、舞台阴影变化、火焰/电光/黑烟的遮挡关系。只记录“很炫”不够。
  • 受击反馈:记录能力命中或压制时,受击方的身体反应,例如重心后移、踉跄、撑地、手臂护脸、被烟雾/冲击波推开、滑步、短暂停顿或重新站稳;不要只记录特效本身。
  • 观众阵营反应:记录人群是否明显支持某一方,以及优势方出现高光时的欢呼、站起、举手、举手机、身体前涌、镜头被碰撞等反馈。
3. 絵コンテ設計

核心镜头定义

本 Skill 的 Storyboard 不是角色展示清单,而是“观众在人群中以第一人称视角看到同一个户外舞台上的超自然表演/对决”。摄像机等于观众的眼睛或手机镜头,拍摄设备本身不入画。默认镜头始终像站在舞台下方或观众席中观看并记录,不切到角色个人展示镜头、舞台摄影机镜头、无人机视角或第三人称电影镜头。

Shot 粒度规则

  • 每条目标视频片段默认对应 1 个 shot,即 1 次视频生成任务;不得将同一段视频拆分为多个 shot
  • 单个 shot 时长上限为 15 秒(Seedance 2.5 单次生成上限)。
  • 若一段内容有明显的内部节奏升级或场景推进,在同一 shot 描述内用叙事节拍(Beat 1 → Beat 2 → Beat 3 → Final beat)或箭头顺序列出;这些节拍是长镜头内的舞台事件升级段落,不代表独立 shot
  • 不得使用墙钟时间戳来描述内部节拍。Seedance 2.5 不能精确执行以秒为单位的时间戳指令,时间戳写法会导致行为不可预测或被忽略。
  • 只有当用户明确要求多镜头剪辑、视频总时长超过 15 秒、或批量生成多条独立视频时,才创建多个 shot。多条视频时,每条 15 秒视频仍各自对应 1 个 shot
  • 避免把“内部剪辑”写成硬切。更准确的写法是“同一观众第一人称 POV 长镜头内的内部节拍、表演调度、爆点升级和短暂机位反应”。

舞台坐标系与三层构图

每个 shot 必须先建立同一个舞台坐标系,再描述角色和爆点。不要从角色 A 或角色 B 的个人视角开始写。

  • 前景:观众头部、肩膀、手臂,以及少量前排观众举起的手机,局部遮挡舞台下缘,提供真实现场感。手机必须是边缘/下缘的小比例环境道具,不得居中遮挡舞台,不要求屏幕复现舞台动作,不得形成“屏幕中屏”构图或录制 UI。
  • 中景:同一个舞台平台上的两个角色、道具、烟雾、能力触发点;两个角色必须共享同一个中景舞台空间。
  • 背景:户外剧场建筑、主题乐园城墙/台阶/灯架/竖旗/天空/夜色/烟雾层。
  • 镜头运动:轻微手持呼吸感、手部微抖、被强光或冲击波带动的小幅后仰/抬头/横摇;允许 1-2 次由舞台事件触发的短促数码变焦或注意力横摇,例如突然 zoom 到发动技能的一方,再横摇/回拉找受击或反击的一方。运动必须由舞台事件或观众反应驱动,避免无意义匀速漂移或极端甩动。

双角色默认结构

  • 本 Skill 的默认视频单位是“双角色同台对峙/交锋/合作表演”。Storyboard 必须设计角色 A 与角色 B 两个 element character;除非用户明确要求单角色变体,否则不得生成单角色能力展示。
  • 如果用户只提供一个角色,Storyboard 不得直接进入单人秀;应让 Planner 补齐第二个原创对手/搭档,或在用户允许快速创作时自动提案一个与角色 A 能力形成强对照的角色 B。
  • 每个 shot 必须先写清角色 A 与角色 B 在同一舞台坐标系里的初始位置,例如左/右、前/后、台阶上/平台中央、远景/近景侧。
  • 每个内部节拍都必须同时包含四件事:角色 A 的动作、角色 B 的反应或反制、两者之间/舞台中央发生的可见爆点、观众第一人称镜头的反应。
  • 即使某一方正在发动技能,另一方也必须作为受击方、防御方、反应方或空间锚点存在;不得让另一方消失成“单人能力秀”。
  • 角色默认是真人舞台演员/特技演员,不是卡通、动漫、游戏 CG 或玩偶皮套。动作要像舞台武打表演:有重心、惯性、接触面和身体保护动作。
  • 受击反馈必须具体写出身体反应:后退半步、重心下沉、肩膀被冲击带偏、手臂护脸、膝盖弯曲、滑步、撑住舞台、从烟雾中重新站稳等。不要只写“被击中”“受到伤害”或只让特效覆盖身体。
  • 视觉高潮优先发生在两人之间、舞台中央或两人共同影响的空间中,例如黑烟横扫与蓝色电光对冲、火焰环包围防御光幕、冰晶光柱阻断突进、冲击波从两人中线扩散。

爆点事件优先级

默认采用“一个大舞台事件逐步升级”的结构,而不是持续高密度肉搏。角色动作通常小而清楚,特效体量巨大;人物负责触发,舞台事件才是主体。爆款感来自烟雾、光柱、能量团、火焰环、冲击波等大面积舞台事件,以及前景观众、边缘手机和现场光照反应。特效必须像真实舞台烟火、灯光、投影、烟雾和后期增强共同发生,而不是干净漂浮的游戏技能贴图。

同一个 shot 内按以下叙事节拍写入描述,不写秒数:

  • Beat 1:建立观众第一人称 POV、户外舞台空间和双角色站位。两名角色位于舞台两端或前后景,前景有观众头肩、手臂和少量边缘举手机形成真实人群层次;人群可默认分成支持角色 A 与支持角色 B 的两侧或几簇;一方以手势、站姿或短距离移动触发第一层能量迹象,另一方保持可见反应或防御姿态。
  • Beat 2:第一轮同台交锋出现。能力以舞台灯效或机关感形式扩散,例如黑烟从左侧横扫,右侧角色用蓝色电光或光幕挡住;爆点必须发生在两人之间或舞台中央。镜头可短促数码变焦到发动技能的一方,再横摇回到两人中线。
  • Beat 3:爆点顶峰。两人能力在中线或舞台中央对冲,形成最大体量视觉事件;受压一方必须有清楚的身体受力反馈,例如后退、滑步、护脸、弯膝稳住或被烟雾推开;冲击波推开烟雾,优势方支持者欢呼、站起、举手或举手机,观众脸部、手臂和少量边缘手机被强光照亮,镜头被人群反应带动轻微震动或后仰。
  • Beat 4:反转或二次奇观。受压一方从烟雾、侧翼、上方、屏幕后或舞台机关中反击;另一方仍在同一舞台空间中作出防御、后退、转身或重新站稳的真实身体反应;观众反应随优势转换而变化,另一侧观众开始欢呼、站起或向前涌。
  • Final beat:同台定格式收尾。两名角色停在舞台两端、中央能量余韵两侧,或一个保持攻击姿态、另一个防御姿态;烟雾和光效逐渐散开,短 VO 收尾句预留给后续音频生成。

Key Elements 设计规则

  • 每个项目必须包含至少一个 element sceneElement_Character_AElement_Character_B。双角色是默认结构,不是可选增强项。
  • 不创建任何“观众 POV 图片”或“观众视角参考图”关键元素。观众第一人称 POV 是 shot 的镜头约束;前景观众、手臂和少量边缘手机可写入 shotelement scene 的构图描述,但不得资产化成中心手机画面。
  • element scene 必须描述完整同台空间,而不是某个角色的单独背景。默认设定为户外/露天:主题乐园剧场、日式忍者剧场、祭典舞台、开放式漫展广场、夜市庙会舞台或露天广场舞台,并包含观众席结构、舞台平台、户外天空/夜色、烟雾层、灯架或建筑背景。
  • Element_Character_AElement_Character_B 分别定义外观、能力、舞台表演方式与 IP 规避后的原创化特征;但 Storyboard 的 shot 描述必须把两者放回同一个舞台坐标系里。角色外观使用真人舞台演员/特技演员语言:真实布料、皮革、金属、护具、假发、面具、护目镜、演出道具和灯效;避免直接引用动漫 IP 角色特征组合,避免卡通比例、塑料玩具质感和游戏 CG 盔甲。
  • 能力设计优先转译成可见舞台事件:光幕、追光、灯柱、烟火、烟雾喷射、火焰环、LED 光幕、冲击波、漂浮颗粒、地面雾。

音频层规划

  • 每条视频规划两条独立音频层,但只在用户确认分镜视频画面后生成:
    • Audio_BGM_*:纯器乐/音效配乐,包含太鼓、低频嗡鸣、whoosh、雷电、火焰、烟雾冲击、人群惊呼等关键词;无人声、无歌词。
    • Audio_VO_*:短 VO 旁白,脚本只包含开头句和收尾句,默认日语短句;标注 narration_speaker_profile,例如低沉神秘男声、空灵清冷女声、热血男声。
  • 如果多条视频共用 BGM,在 shot 描述中标注相同 audio_id,不要重复创建同类音频层。
4. 素材生成

关键元素资产生成

  • Storyboard 确认后,第一轮只生成或绑定关键元素资产,不生成分镜视频、VO 或 BGM。
  • 必须先处理 Element_Character_AElement_Character_B。若用户提供参考图,注册并绑定到对应 key_element;若无参考图,使用 TextToImage 生成角色参考图,重点锁定真人舞台演员/特技演员质感、原创化外观、真实服装/道具材质、身体轮廓、能力视觉源和 IP 规避后的特征组合。角色参考图不得是卡通、动漫、游戏 CG、玩偶皮套或塑料感盔甲。
  • 必须处理 element scene。舞台/场景参考图应呈现完整户外同台空间:观众席方向、舞台平台、两侧/中线站位区、背景建筑/台阶/灯架/竖旗、烟雾层、主光色调和真实人群密度;不要生成只服务单个角色的孤立背景。
  • 不生成或绑定任何“观众 POV 图片”资产。如果需要表达观众席真实感,把观众头肩、手臂和少量边缘手机写入场景或视频 prompt;场景参考图不得出现居中大手机、录制界面或屏幕中屏。
  • 对 Storyboard 中明确影响画面一致性的关键道具或特效源,也生成或绑定为关键元素资产;纯临时烟雾、光效轨迹和一次性冲击波可留给视频 prompt 描述。
  • 关键元素资产完成后必须暂停给用户确认;未确认前不得进入分镜视频生成。

分镜视频生成

  • 用户确认关键元素资产后,再生成每条视频对应的 final_shot,不生成 VO 或 BGM。
  • 默认使用 Seedance 2.5 原版,优先画质稳定性,不使用 Fast 模式,除非用户明确要求快速预览。
  • 每条 15 秒视频对应 Storyboard 中 1 个 shot,使用单次视频生成覆盖完整内部叙事节拍;不得按 Beat 1 / Beat 2 / Beat 3 等内部节拍拆成多次视频生成。
  • 分镜视频必须引用已确认的角色 A、角色 B、舞台/场景等关键元素资产;若有必要道具或特效源资产,也一并作为 reference_image 绑定到对应 shot
  • 视频生成时优先保证:观众第一人称 POV、拍摄设备不入画、前景观众层次和少量边缘手机真实感、中远景舞台、真人舞台演员质感、真实受击反馈、阵营化观众反应、户外真实空间、长镜头连续性、超自然舞台事件体量。
  • 视频完成后必须暂停给用户预览确认;未确认前不得生成 VO 或 BGM。

VO 旁白生成

  • 仅在用户确认分镜视频画面后生成 VO。
  • 使用 MiniMax Speech 2.8 HD;根据 Storyboard 的 Audio_VO_* 和已确认视频节奏生成。
  • 每条 VO 脚本只包含开头句与收尾句,避免覆盖中段舞台事件;语言遵循 Final_Video_Spec。
  • 旁白声线按画面气质选择:低沉神秘男声、空灵清冷女声、力量感男声、热血男声等。

BGM 生成

  • 仅在用户确认分镜视频画面后生成 BGM。
  • 使用 Suno 生成纯器乐/音效配乐,无人声、无歌词。
  • Prompt 明确包含:情绪关键词 + 核心音效类型 + 节奏特征 + 人群反应氛围。例如太鼓、低频嗡鸣、whoosh、雷电爆裂、火焰呼啸、观众惊呼。

IP 风险规避

  • 角色视觉描述必须使用舞台道具和灯效语言,避免高风险外观组合被模型识别为版权角色。
  • 若生成失败返回 OutputVideoSensitiveContentDetected,不自动切换模型,上报 Planner 处理。
5. プロンプト作成

全局写作语言

  • Prompt 正文用中文书写;模型名、参数标签、负向约束词可保留英文。
  • VO 或台词内容遵循 Final_Video_Spec 的旁白语言;默认日语短句。

视频 Prompt 结构

按以下顺序组织:镜头视角与长镜头声明 → 三层构图与户外舞台空间 → 双角色同台站位与相对关系 → 真人角色外观与能力触发方式 → 真实受击反馈 → 15 秒内部节拍 → 阵营化观众反应与真实前景道具 → 音频排除说明 → avoid block。

观众 POV 必写句式

每条视频 prompt 开头必须明确类似以下内容:

First-person audience POV from inside the crowd, camera equals the viewer's eyes / phone lens, no visible phone body, no recording interface, no screen-in-screen; continuous 15-second handheld long take with occasional event-driven digital zoom and short attention pan, foreground lower edge has audience heads, shoulders, raised arms, and occasional small edge phones as live-event atmosphere, stage remains the clear subject; raw phone-recorded live show realism, slight handheld breathing shake, imperfect exposure, cinematic realistic outdoor live stage show.

随后用中文补充具体场景:户外主题乐园剧场、日式忍者剧场、露天祭典舞台、漫展外场或夜场舞台;写清天空/夜色、建筑、台阶、竖旗、灯架、烟雾层和观众密度。

视频 prompt 内部分段写法

  • 15 秒视频必须写成同一个连续观众第一人称 POV 长镜头,摄像机等于观众的眼睛或手机镜头,拍摄设备本身不入画。
  • 描述同一 shot 内的多个节奏段落时,使用叙事节拍顺序(Beat 1 / Beat 2 / Beat 3 / Final beat)或“→”箭头;每段都必须明确属于同一个 continuous long take,不得写成独立镜头、硬切或场景跳转。
  • 不得使用墙钟时间戳或秒数范围标注。Seedance 2.5 无法精确执行以秒为单位的时间戳指令,时间戳写法会导致行为不可预测或被忽略;叙事节拍写法可让模型正确理解为同一长镜头内依次发生的事件升级。
  • 避免使用 camera cutscut tonew shotswitch angle 等会触发剪辑的词。若需要“内部节奏变化”,写成镜头小幅横摇、抬头、后仰、短促数码变焦、回拉、被前景观众手臂或小比例边缘手机短暂遮挡后恢复。数码变焦必须由舞台事件触发,例如爆点出现时突然 zoom 到发动者,再横摇找防御者或受击者。

真人角色质感写法

  • 角色必须写成 live-action stage performers / stunt performers:真实人体比例、真实皮肤受光、真实布料褶皱、皮革/金属/护具材质、演出道具重量和舞台汗湿/灰尘细节。
  • 角色服装可以夸张,但必须像真实演员穿着的舞台服,不像卡通形象、动漫人物、游戏 CG 模型、塑料玩具或玩偶皮套。
  • 写角色动作时绑定身体重心和接触面,例如“右脚踩住舞台地面、膝盖弯曲稳住身体、肩膀被冲击带偏、披风被烟雾掀起”。

三层构图写法

  • 前景:观众头部、肩膀、举起的手臂,以及少量边缘/下缘的前排观众手机;这些手机只作为现场真实感道具,可被舞台强光照亮或产生模糊反光,不要求复现主要角色或爆点特效,不得成为画面中心。
  • 中景:舞台平台、角色、道具、烟雾、能力触发点;角色动作要清楚但不必贴脸。
  • 背景:户外剧场建筑、主题景观、台阶、竖旗、灯架、天空/夜色、烟雾层。
  • 强爆点发生时,必须写“观众脸部、手臂和边缘手机被强光照亮”“观众手臂短暂上举或后仰”“镜头轻微震动但舞台仍可读”。

双角色同台写法

  • Prompt 默认必须包含角色 A 与角色 B;如果输入只提到一个角色,应先补齐或提案第二个原创对手/搭档,不要写成单角色能力展示。
  • 两个角色必须共享同一个舞台坐标系,写明角色 A 与角色 B 分别在舞台左侧/右侧、前景侧/后景侧、台阶上/平台中央等相对位置。
  • 不要写成两个角色各自的展示段。每个时间段都要保留另一名角色作为受击方、防御方、反应方或空间锚点,并写出双方位置关系的变化。
  • 爆点优先写在两人之间或舞台中央,例如“左侧黑烟横扫到中线,右侧蓝色电光光幕顶住烟雾,舞台中央形成强光冲击波”。
  • 避免长时间角色特写和单人英雄镜头;可以短促数码变焦到一方的发动动作或受击反应,但随后必须横摇/回拉重新读出两名角色同台对峙或交锋。

受击反馈写法

  • 每次能力压制、命中或反制都必须写清受击方的物理反馈:后退半步、滑步、重心下沉、手臂护脸、肩膀被带偏、膝盖弯曲、撑住舞台、从烟雾中重新站稳。
  • 特效不能替代身体反应。不要只写“蓝色电光击中角色 B”;应写“蓝色电光和烟雾冲到角色 B 身前,角色 B 手臂护脸、后脚滑半步,膝盖弯曲稳住,披风和烟雾被冲击波推向右侧”。
  • 受击反馈保持舞台表演安全感,不写血腥、真实伤害或痛苦细节。

阵营化观众反应写法

  • 默认观众不是均质背景,而是有支持对象的现场观众。可以写舞台左侧或前排某几簇观众支持角色 A,另一侧支持角色 B。
  • 当某一方技能发挥得好或完成反击时,该方支持者应出现可见反馈:欢呼、站起、举手、举手机、身体前涌、拍摄镜头被旁边观众轻碰、画面短暂抖动。
  • 观众反应必须跟随战局变化:A 占优时 A 方观众先欢呼,B 反击时另一侧观众再爆发;不要只写泛泛“观众惊呼”。

超自然舞台事件写法

  • 人物动作小而准确,特效体量大而可见。不要只写“激烈打斗”;要写清楚能力如何被舞台化:
    • 半透明六边形 LED 光幕从手掌扩散。
    • 蓝色竖向追光柱从舞台地面升起。
    • 黑烟像舞台烟雾喷射一样横扫观众视野上方。
    • 橙色火焰环在舞台中央卷起,但保留真实烟雾和灯光质感。
    • 冲击波推开地面雾,前景观众脸部和边缘手机瞬间泛白。
  • 特效必须压在真实舞台空间里:与舞台地面、烟雾、灯架、建筑背景、演员身体和观众脸部发生可见遮挡、投影、反光、过曝和光照互动,避免变成漂浮在纯 CG 背景上的特效贴图。

IP 角色提示词规避写法

当用户基于热门 IP 角色创作时:

  • 绝对禁止写官方角色名、作品名、招式名、组织名、村庄名、标志性台词。
  • 外观只保留 2-3 个特征,且至少 1 个故意偏离原角色;使用假发颜色、演出服材质、护目镜、面具、手套、道具等可见物品描述。
  • 技能/战斗风格必须详细充分:光效颜色、形状、运动方式、出手动作、反制逻辑、舞台灯效转译。

示例:原角色“鸣人风”不要写角色名或招式名,可写为:
spiky copper-gold short wig (not blonde), orange-and-charcoal athletic stage combat outfit, no headband, no symbols, cyan wrist guards. Combat style: three-directional rush with two semi-transparent gold-orange afterimage performers flanking simultaneously; the main performer charges a spinning cyan-blue circular light disc with gold energy flowing along both arms before a straight-line dash; afterimages execute ground-level feints while the main performer flips from above.

音频与字幕约束

  • 视频生成 prompt 中不要写完整 VO 脚本;VO 会在用户确认分镜视频画面后单独生成。
  • 视频 prompt 中默认加入 no musicno subtitles,避免视频模型自行生成音乐或字幕。
  • 可以写现场观众反应的视觉和轻量 SFX 线索,例如“观众惊呼、手臂上举、镜头轻晃、烟雾冲击声”,但最终 VO 与 BGM 以独立音频层为准。

Avoid block

每条视频 prompt 末尾加入 avoid block,固定包含:

official anime/franchise character names, copyrighted logos, emblems, headbands, face marks, readable subtitles, text overlay, watermark, UI, cartoon, anime style, illustration, cel-shaded, toy-like character, plastic mascot suit, game CG character, floating VFX sticker, clean CGI arena, stiff motionless crowd, missing hit reaction, stiff hit reaction, large foreground smartphone, centered phone screen, phone recording interface, screen-in-screen composition, visible camera app UI, giant hand holding phone blocking the stage, gore, injury, horror, third-person cinematic camera, drone shot, stage broadcast camera, hard cuts, switch angle, new shot, extreme shaky camera, camera spinning, morphing, smearing, deformed hands.

注意:不要笼统禁止所有 text。允许模糊的舞台竖旗、牌匾、灯箱或装饰性标识存在,但禁止清晰可读的字幕、水印、UI、官方 logo 和随机文字覆盖。

6. 動画編集

时间线组装规范

追加模式

  • 每次只追加新成片到当前时间线末尾,不重新组装已有片段,不合并跨批次成片。
  • 每条 15 秒成片作为独立片段,边界清晰,便于单独选中导出。

音频混合

  • 视频画面、VO、BGM 都经用户确认后再进入组装。
  • BGM 音量默认 0.7,VO 音量默认 1.0;如视频原生带有明显现场声,组装时保留适量现场声并降低 BGM 遮盖。
  • 每个片段末尾 2 秒淡出,VO 不要被淡出截断;BGM 可随片尾淡出。

同步与质检

  • VO 开头句对齐 Beat 1 的建立段,收尾句对齐 Final beat 的定格式收尾。
  • BGM 的最高能量点应对齐 Beat 3 的最大舞台爆点,不要在开头过早满能量。
  • 合成前检查:是否仍保留观众第一人称 POV、拍摄设备不入画、前景观众层次和少量边缘手机真实感、户外舞台真实感、长镜头连续性;如视频像第三人称电影镜头、中心手机屏幕中屏或纯 CG 战场,应返回视频生成阶段修正。

导出区间标注

  • 组装完成后向用户报告每条成片的实际时间线区间(如 90s-105s),说明在导出界面选择对应范围可单独导出。