yeha.ai
一覧に戻る

Historical romance drama

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

适用于古装甜宠短剧视频的创作。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

整体流程与里程碑节点
按以下阶段顺序推进,每个里程碑结束后必须暂停并获得用户确认,不得自动跳入下一阶段。

阶段 0:剧本来源确认
首先询问用户:是要自己提供剧本,还是由 AI 自动生成?

  • 如果用户自提剧本:请用户直接粘贴或描述剧本内容,进入阶段 1 审核。
  • 如果用户选择自动生成:按古装甜宠短剧爆款风格自动生成一份剧本(要求见下),生成后暂停让用户审核。
    自动生成剧本的要求:
  • 时长目标:1 分 30 秒~2 分钟(对应约 20~28 个镜头)
  • 风格:古装甜宠,聚焦男女主之间的情感交流与互动(如初遇心动、误会化解、暧昧升温等经典甜宠情节)
  • 结构:有起伏,节奏紧凑,每场戏有明确的情绪落点
  • 剧本以场景+台词+动作描述的形式呈现,便于后续转化为故事板
    爆款剧情三核心(每条均为必选项,不得缺失):
  1. 极致人设反差: 男女主的表面形象与私下性格必须形成强烈对比(如:表面高冷内里撒娇、表面莽撞内里细腻)。这种"反差萌"是击中观众爽点的核心机制,设定时需为男女主各设计至少一处令人意外的反差细节,并在剧本中安排对应的"人设暴露"场景。
  2. 身份悬念钩子: 男女主均需身怀秘密,"Ta 到底是谁?"作为贯穿全剧的悬念线索。每一次靠近与试探都应隐含身份信息的若隐若现,在短短 1~2 分钟内至少植入一处明确的悬念伏笔或反转暗示,牵动观众好奇心。
  3. 高密度糖点铺排: 肢体接触(如手触、对视、近距离)、语言撩拨、氛围心动必须高密度连续出现,不留冗余过渡,平均每 10~30 秒至少一处甜点,每一个甜点都需有明确的情绪爆发落点。

阶段 1:剧本审核确认
将剧本(AI 生成或用户提供)呈现给用户,邀请审核。用户确认后进入阶段 2。若用户提出修改意见,修改后再次确认。

阶段 2:形象与背景设定
剧本确认后,收集以下信息:

  1. 男主形象描述:外貌特征、服装风格、气质(若用户无明确要求,可根据剧本角色提供推荐描述)
  2. 女主形象描述:同上
  3. 故事背景描述:朝代氛围、主要场景风格(如宫廷、江湖、山野、书院等)
    收集完毕后,调用 media_generator 为男主、女主分别生成角色形象参考图,生成完毕后暂停,让用户审核形象,并明确询问:是否对当前人物形象满意、可以继续生成场景?还是需要先调整人物形象? 若用户选择继续调整人物,则按用户意见重新生成并再次确认;若用户确认满意,再进入阶段 3。

依赖: 阶段 2 → 阶段 1 完成

阶段 3:视频比例与制作偏好确认
形象确认后,一次性询问用户以下三项偏好,用户全部确认后进入阶段 4:

  1. 视频画面比例:如 16:9 横屏、9:16 竖屏等。
  2. 是否添加背景音乐:若用户选择添加,默认风格为古风暧昧轻音乐(参见下方参考曲风说明);用户也可描述其他偏好风格,或选择不添加。
  3. 是否添加字幕:若用户选择添加,将在后期合成阶段为台词添加字幕;若不需要,视频提示词中将使用 无字幕 反向约束。

阶段 4:故事板生成
调用 storyboard_designer 依据已确认的剧本、角色形象描述、背景描述及视频比例,生成完整故事板(包含 key elements、分镜列表、独立音频轨道)。生成后暂停,让用户确认故事板内容。

依赖: 阶段 4 → 阶段 2、3 完成

阶段 5:场景图生成与审核
故事板确认后,调用 media_generator 为故事板中所有 element scene 逐一生成场景参考图(写实电影感风格,规格与角色形象图一致)。全部生成完毕后暂停,将场景图展示给用户,邀请审核:"当前场景图是否满意,可以进入视频制作?还是需要调整某个场景?"。若用户提出修改意见,按意见重新生成对应场景图并再次确认;若用户确认满意,进入阶段 6。

依赖: 阶段 5 → 阶段 4 完成

阶段 6:视频制作
场景图确认后,调用 media_generator 按故事板顺序制作;先将已确认的男主、女主角色形象图绑定到对应 key_element,并将场景图绑定到对应 element scene。

镜头连续性与调度规则:

  • 先逐对判断相邻镜头是否存在强连续性需求,例如人物站位、朝向、手部动作、构图或同一空间关系必须无缝承接。仅有强连续性依赖的下一镜才使用上一镜末帧作为 reference_image;普通转场、换场景或构图重置的镜头不强制参考上一镜素材。不得使用上一镜完整视频作为 reference_video:连续性视频参考容易累积压缩与细节损失,导致后续镜头画质崩坏;末帧图片能保留必要的空间与动作锚点,同时避免这一画质传递问题。
  • 对存在连续性依赖的镜头,必须严格串行且禁止批量或并行提交:生成当前 shot → 等待 final_shot 成功完成 → 调用 resource_prepare_and_analyze 从该视频提取最后一帧 → 将该帧注册为 image 资产并绑定为下一 shot 的 reference_image,经验证后才可生成下一镜。不得在末帧可用前提交下一镜,也不得将存在强关联关系的镜头同时生成。
  • 不存在前后连续性依赖的镜头可按故事板制作,但不得将上一镜完整视频作为替代参考;不得因批量提交而破坏任何已判定的连续性依赖。
  • 若末帧提取、图片资产注册或绑定验证失败,暂停该连续性链路并重试;仍失败时向用户说明,不得自动降级为引用完整视频或继续生成依赖它的下一镜。
  • 在所有 shot 视频完成后,再生成所需的背景音乐及 narration 音频轨道。

依赖: 阶段 6 → 阶段 5 完成

阶段 7:最终剪辑导出
所有媒体资产就绪后,调用 video_assembler 完成时间线合成,引导用户导出成片。

依赖: 阶段 7 → 阶段 6 完成

2. マルチモーダル分析
  • 若用户上传参考图片(如演员照片、服装参考、场景图),提取以下信息用于后续形象生成:人物面部特征、服装色系与款式、场景氛围关键词。
  • 输出结果以结构化文本呈现,供 storyboard_designermedia_generator 直接引用。
  • 保持描述与上传素材一致,不得主观添加素材中未体现的元素。
3. 絵コンテ設計

设计 key elements

  • 必须包含:男主女主 两个 element character,以及至少一个核心 element scene(主要故事发生场景)。
  • 每个角色的 key_element 描述需涵盖:面部特征、发型发饰、服装款式与配色、整体气质;默认严格沿用下方固定形象描述,不得自行扩展、替换或省略任何细节。仅当用户在阶段 2 明确提出修改意见时,才按用户要求局部调整,其余部分保持不变。
  • 网红脸审美锁定(最高优先级): 角色五官须具备当下短视频平台主流审美——五官精致立体、轮廓感强、颜值出挑,具备"网红脸"特质(高鼻梁、双眼皮大眼、精致唇形、小脸尖下巴);整体气质兼具镜头感与话题感,令人过目难忘。此要求与参考图固定提示词并行执行,不得以任何理由降低颜值上限。
  • 角色基准形象(基于用户在项目启动时上传的参考图,固定使用,除非用户主动要求更改,否则不得偏离):
    • 女主(使用用户上传的女主参考图,动态绑定): 黑色发丝,高髻云鬓造型,发顶梳起饱满圆润发髻,两侧鬓发柔顺贴面,余发垂落于耳后;发髻以点翠珠钗与流苏步摇为饰,轻盈垂坠,古典韵味浓郁;五官娇俏可爱,眼神清澈灵动,腮红粉嫩饱满,嘴唇微微上扬;身着浅橘粉色汉服套装:内搭白色广袖上衣,外配橘色刺绣胸衣与飘逸薄纱长裙,腰间系白色兔子香囊挂件;整体风格清甜雅致,古风仕女感十足;皮肤白皙细腻,写实风格,超逼真人像质感,发丝清晰。
    • 男主(使用用户上传的男主参考图,动态绑定): 乌黑长发柔顺飘逸,发顶佩戴精致玄幻银色冠饰(附尖刺造型);眉眼深邃,目光冷冽有神,高鼻梁,唇形精致;身着深墨蓝暗青色广袖长袍,袍身饰有银色龙纹暗纹刺绣,配金属镂空肩甲装饰;身姿挺拔,气质清冷高傲,仙气与凛冽并存;皮肤清透瓷白,超写实、逼真,精致细腻,写实风格。
  • element scene 描述需涵盖:场景类型(如宫廷庭院、竹林小径)、时段光线、主要陈设,为后续分镜提供视觉锚点。
  • 场景画风固定规范(最高优先级,不得更改): 所有场景均采用写实真实电影感风格——真实建筑与自然材质纹理、电影级自然光源(如阳光透射、烛光、晨雾)、影调克制厚重,禁止出现任何动画感、游戏 CG 感、概念插画感或过度后期感;无论剧本氛围如何,场景画风必须始终保持写实电影质感,不得因用户剧本或角色描述的变化而偏移。

设计分镜

  • 总镜头数目标:10~14 个,覆盖完整剧本情节,整体时长约 1 分 30 秒~2 分钟。
  • 每个镜头偏向较长时长(建议 8~30 秒),优先在单镜头内设计内部剪切与情绪起伏,而非切割成多个短镜头。
  • 每个分镜描述必须包含:
    • 场景:引用对应 element scene ID
    • 故事节拍:角色动作、情感状态、台词(原台词逐字记录,含男女主对话);引用角色 element ID
    • 摄影语言:景别(特写/中景/全景)、机位角度(平视/仰拍/俯拍)、镜头运动(固定/推进/跟随/摇移)
  • 甜宠情感节点镜头(如对视、牵手、表白等)重点设计特写+慢推镜头,强化情感张力。
  • 节奏饱满原则(必须执行): 每个镜头的时长必须被动作或台词填满,不允许出现无实质内容的空镜或节奏拖沓段落。每个镜头须至少包含一个明确的动作节拍或一句台词;若某镜头纯为氛围建立,也需配合人物的微表情、肢体细节(如衣袖轻动、手指收紧)或环境动态(如风吹花落)填满画面叙事,不得出现"停滞等待"式的静默空场。
  • 全镜头站位与动作规范(每一镜均必须执行,无例外): 每个分镜的「故事节拍」开头必须用一句话明确标注本镜头开始时各角色的站位、朝向与肢体动作起始状态,结尾必须用一句话明确标注本镜头结束时各角色的站位、朝向与肢体动作终止状态。
    • 第 2 镜:直接描述初始站位与动作状态(无前序镜头,以场景进入方式或静止姿态作为起始锚点)。示例开头:「第 2 镜开始:女主独自立于庭院石阶中央,面朝远处,双手交叠于腹前;男主尚未出现」。
    • 第 4 镜起:开头须引用上一镜头末尾的站位状态作为起点。示例:「承接第 N-2 镜末尾:女主立于石桌左侧,背对男主,双手握拢衣袖;男主站于三步外,右手刚收回——本镜开始时两人保持上述站位……」。
    • 每镜结尾锚点示例:「本镜结束时:女主已转身,双手被男主轻握,两人相距不足一步,面对面对视」。
    • 此规范确保故事板本身完整记录全程站位流转,任意相邻两镜均可无缝拼接,后续提示词撰写可直接引用,无需回溯视频。

设计独立音频轨道

  • 背景音乐(bgm):至少一条贯穿全片的古风甜宠风格 BGM;若剧情有明显情绪转折点可拆分为两段(各自独立 audio_id)。
  • 旁白/配音(narration):若剧本包含旁白或独白,设计对应 narration 音频轨道,注明声线风格与覆盖镜头范围。
4. 素材生成

角色形象图生成(阶段 2)

  • 使用 ImageToImage,模型:GPT Image 2,分辨率:2K
  • 用户在项目启动时上传的男女主形象参考图,须在阶段 2 开始前由 media_generator 完成 asset_id 注册并绑定到对应 key_element,以下统称「男主参考图」「女主参考图」,动态引用,不硬编码 resource_id。
  • 参考图优先级为最高级别,高于剧本描述、场景氛围及任何其他上下文。剧本中的人物描述、身份设定、情节氛围均不得影响或修改角色的面部特征、脸型、发型发饰、服装款式与配色。在用户主动提出更换参考图之前,任何生成(三视图、逐帧参考图、视频帧)都必须严格还原参考图的人物外观,不得产生任何风格漂移或脸型偏移。
  • 为男主、女主各生成一张角色参考图,采用白色背景横向三视图布局:左侧正面全身、中间侧面全身、右侧背面全身;三视图均不携带任何道具,以纯净白底突出服装与人物轮廓。
  • 生成完毕后绑定(bind)到故事板对应 key_element 上,作为后续视频生成的 reference_image。

场景参考图生成(阶段 5)

  • 使用 TextToImage,模型:GPT Image 2,分辨率:2K
  • 为故事板中每一个 element scene 各生成一张场景参考图,采用写实电影感风格,参照 storyboard_designer 中对应 element scene 的描述(场景类型、时段光线、主要陈设)撰写提示词。
  • 场景图画风强制规范:真实建筑与自然材质纹理、电影级自然光源(如阳光透射、烛光、晨雾)、影调克制厚重;禁止出现动画感、游戏 CG 感、概念插画感或过度后期感。
  • 全部场景图生成完毕后暂停,等待用户审核确认,再进入阶段 6。
  • 审核通过后,将各场景图绑定(bind)到故事板对应 element scene 上,作为后续视频生成的 reference_image。

逐镜头视频生成(阶段 6)

  • 使用 MultiModalToVideo,模型:Seedance 2.5,分辨率:依用户在阶段 3 确认的视频比例,默认 480p
  • 每个 shot 均使用当前镜头涉及角色的 element 形象图,以及对应 element scene 图像(如有)作为 reference_image。
  • 第一个 shot 不添加前序镜头连续性参考。第二个及后续 shot 仅当与上一镜存在强连续性依赖时,额外使用从上一 final_shot 提取的最后一帧图片作为 reference_image;该图片用于保持人物站位、朝向、肢体动作、构图和空间关系。无强连续性依赖时,不添加上一镜素材作为参考。
  • 禁止把上一 final_shot 的完整视频作为 reference_video,禁止以视频资源或视频 asset_id 替代最后一帧图片;末帧不可用时不得自动回退为参考完整视频。
  • 生成前验证: 每次调用前逐项确认角色、场景及所需连续性素材均为 image;连续性图片确实来自已成功完成的上一 final_shot 的最后一帧;请求不含上一镜的 reference_video;并且本次仅提交一个存在前后连续性依赖的 shot。任一条件不满足时,不得发起该 shot 的生成。
  • 资产绑定约定: 连续性图片在目标 shot 已存在后、调用生成前处理。先通过 query_assets_info 查询绑定;如缺失,使用 manage_item_assets 在保留完整 asset_bindings 数组的前提下,将已注册的图片 asset_id 绑定为该 shot 的 reference_image;随后再次查询并验证。一个资产有多项实际用途时,保留全部适用绑定。
  • 时长:每镜头 8~30 秒,不超过 30 秒。

音频生成(阶段 6)

  • 背景音乐:仅当用户在阶段 3 确认需要添加时才生成。使用 text_to_instrumental,模型:Suno 5Mureka 8,依据故事板 bgm 描述生成古风甜宠风格纯音乐。
    • 参考曲风说明(默认方向): 微微古风、轻度暧昧感、轻柔流动的弦乐/琵琶/笛音为主,情绪克制不外放,适合作为甜宠场景的情绪底色。若用户在项目启动时上传了参考音频,可提取其整体风格氛围用于提示词描述,但须通过文字提示词驱动生成,不直接使用该音频作为输出。
    • 若用户在阶段 3 描述了其他风格偏好,以用户描述为准覆盖上述默认方向。
  • 旁白/配音(如有):使用 text to narration,模型:ElevenLabs v3,依据故事板 narration 轨道描述生成。
5. プロンプト作成

全局最高优先级: 所有提示词均使用中文撰写。视频中人物台词与旁白文本语言依剧本设定(默认中文)。
角色形象图提示词(TextToImage / ImageToImage)

  • 写法:导演+造型师联合简报风格,自然语言描述「人物+神态+环境」,短语描述「风格/色调/光线/构图」。
  • 必须锁定的身份信息:五官特征、发型发饰、服装款式与主色调、整体气质;需与用户确认的形象描述完全一致。
  • 形象提示词严格锁定原则(最高优先级): 下方男女主提示词为固定内容,生成角色图时必须完整采用,不得自行删减、替换或重新演绎任何描述细节。剧本内容、人物性格描述、情节氛围绝对不得影响角色的五官、脸型、发型发饰、服装款式与配色——这些外观要素由参考图与下方固定提示词唯一决定,与剧本无关。仅当用户明确表示对生成结果不满意并提出修改要求时,才按用户指示进行局部调整,其余部分仍保持不变。
  • 女主形象提示词参考(基于用户上传参考图,固定使用,不得自行改动): 黑色发丝,高髻云鬓造型,发顶梳起饱满圆润发髻,两侧鬓发柔顺贴面,余发垂落于耳后;发髻以点翠珠钗与流苏步摇为饰,轻盈垂落,古典韵味浓郁;五官娇俏可爱,眼神清澈灵动,腮红粉嫩饱满,嘴唇微微上扬;身着华丽汉服套装:内搭白色广袖上衣,外配橘色刺绣胸衣与飘逸薄纱长裙;整体风格清甜雅致,古风仕女感十足;皮肤白皙细腻,写实风格,超逼真人像质感,发丝清晰,细节拉满。
  • 男主形象提示词参考(基于用户上传参考图,固定使用,不得自行改动): 乌黑长发柔顺飘逸,发顶佩戴精致玄幻风格银色冠饰(附尖刺造型装饰);眉眼深邃,目光冷冽有神,高鼻梁,唇形精致;身着深墨蓝暗青色广袖长袍,袍身饰有银色龙纹暗纹刺绣,配金属镂空肩甲装饰;身姿挺拔,气质清冷高傲,仙气与凛冽并存;皮肤清透瓷白,明暗对比强烈,超写实、逼真,精致细腻,细腻肌理,写实风格。
  • 网红脸与网感强制要求(每张角色图必须体现): 人物面部必须符合当下短视频平台审美——五官精致立体、轮廓感强、颜值出挑,具备"网红脸"特质(高鼻梁、双眼皮大眼、精致唇形、小脸尖下巴);整体气质兼具镜头感与话题感,令人过目难忘;不得生成普通路人感或模糊五官。此要求与参考图固定提示词并行执行,不得以任何理由降低颜值上限。
  • 真实质感强制要求(每张角色图必须体现,不得出现动画感或游戏感): 真实写实人像摄影风格;超逼真还原皮肤纹理,原生毛孔可见,面部细碎绒毛清晰;皮肤质感真实自然;五官立体精致,具备电影级人像光感;整体呈现真实人物质感。
  • 古风视觉规范:服装以汉服/古代宫廷/江湖风为基准,避免现代元素混入;色彩以一种主色调为主(约占画面 90%),避免高饱和撞色。
  • 场景写实锁定原则(最高优先级,不得更改): 所有场景/背景提示词必须使用写实真实电影感风格描述——真实建筑与自然材质纹理、电影级自然光源(如阳光透射、烛光、晨雾)、影调克制厚重;绝对禁止出现动画感、游戏 CG 感、概念插画感或过度后期感的描述语;无论剧本氛围如何变化,场景画风须始终保持写实电影质感,不得偏移。
  • 布局说明:纯白色背景,横向三视图排列——左:正面全身、中:侧面全身、右:背面全身;三视图人物均不持有或佩戴任何道具,以突出服装与形体轮廓。
  • 不要在画面中出现与角色无关的文字或印刷体。

视频镜头提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))

  • 参考图绑定:每位出现的角色用占位符 <<<image_1>>>、<<<image_2>>> 等分别标注,对应各自 element 形象图。
  • 动作堆栈顺序:镜头运动 → 人物动作与情绪细节 → 空间/环境变化 → 音效/台词标注
  • 台词使用 Seedance 2.5 专用标记:对话 {台词原文},音效 <音效描述>,背景音乐 (音乐描述),片内字幕 【字幕文本】
  • 情感戏镜头(对视、牵手、表白等):重点描写面部微表情、肢体接触细节、情绪节拍(如"由紧张缓慢松弛")
  • 节奏饱满原则(每条提示词必须执行): 每个镜头的提示词必须将全部时长用动作或台词填满,禁止出现空泛的"停顿等待"或无内容的静止描述;即便是氛围建立镜头,也须在提示词中注明人物的微表情、肢体细节(如衣袖轻动、手指收紧)或环境动态(如风吹花落),确保画面叙事不中断、节奏不拖沓。
  • 镜头间动作连续性(仅强关联镜头执行): 撰写当前 shot 提示词前,若已判定其必须承接上一镜,则读取并分析上一 final_shot 的最后一帧图片中的人物站位、朝向、视线、手部动作、身体姿态、景别、构图和场景空间关系;在当前提示词开头明确写出承接状态,并实际绑定该图片为 reference_image。不得只根据上一镜提示词推测状态,也不得读取或绑定上一镜完整视频。无强连续性依赖时,按当前 shot 自身的故事板状态撰写,不强制引用前序镜头素材。
  • 旁白若在独立 narration 轨道,不要在视频提示词中重复完整旁白文本
  • 固定反向提示词:背景音乐独立生成时加 无背景音乐;若用户在阶段 3 选择不添加字幕,则加 无字幕;若用户选择添加字幕,则省略该项(字幕由后期合成处理,不通过模型生成)。

视频镜头固定视觉风格(每个镜头提示词均需融入以下描述,写成流畅段落,不单独列项):

  • 光线与色调: 电影光线,柔和侧逆光打亮人物轮廓;暖金冷蓝交织的柔化色调;远处光源将人物轮廓照亮,明暗对比强烈,人物轮廓光强烈。
  • 画面质感: 超写实,真实感,哑光真实质感;柔光镜效果;35mm 镜头,小景深;背景朦胧虚化。
  • 遮挡构图: 部分镜头(尤其情感戏与环境建立镜头)可在前景加入遮挡物(如花枝、帘幔、建筑边缘),增加层次感与电影感。
  • 表演节奏: 人物动作须以正常真实人类表演速度呈现,避免过度慢动作;仅在情感高潮瞬间(如对视定格、轻触面颊)可短暂强调慢速,其余时段保持自然流畅节奏。
6. 動画編集
  • 严格按故事板镜头顺序组装时间线,不得自行调换镜头次序。
  • 情感高潮镜头(对视、表白等)前后可设置 0.5~1 秒黑场或淡入淡出过渡,强化情绪停顿感;其余镜头间默认使用直切。
  • BGM 音量低于人声/旁白约 15~20 dB,保证台词清晰度;情感高潮段落可适当提升 BGM 音量。
  • 片头前 3 秒和片尾最后 3 秒做淡入/淡出处理。
  • 字幕处理:若用户在阶段 3 选择添加字幕,在时间线合成时为每个镜头的台词/旁白文本叠加对应字幕条目,字幕时间点与人物说话节奏对齐;若用户选择不添加字幕,则跳过此步骤。
  • 最终导出前引导用户确认总时长是否在 1 分 30 秒~2 分钟目标范围内,如有偏差提示可通过调整镜头时长修正。