yeha.ai
返回模板库

邵氏风格喜剧短片

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

用于生成快节奏邵氏港片风格喜剧短片,将人物、萌宠或动物拟人化为武侠角色。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

全流程分阶段串行编排,每阶段完成后必须暂停确认。
阶段 0 — 建立全局创作简报(Final_Video_Spec.md)
text_editor 创建 Final_Video_Spec.md,写入以下字段(从用户输入中推断,不足的项目用默认值填写):

  • 片名(暂定或用户指定)
  • 风格基调:80年代邵氏胶片港味武侠喜剧,萌宠拟人化混搭
  • 总时长:默认 30 秒(用户可指定 10—30 秒或更长)
  • 输出分辨率:480p(默认)
  • 画面比例:16:9(固定,不可更改)
  • 叙事语言:中文
  • 全局硬性规则:全程无字幕、无背景音乐(除非用户明确要求 BGM)
  • 角色输入方式:参考图上传(人物/萌宠/动物)/ 文字描述 / 内置角色库(根据用户实际输入填写)
  • 叙事内核:喜剧优先,武侠为壳;萌宠/动物保留本能行为与武侠造型形成反差
  • 音频规则:默认保留环境音(市井嘈杂/刀剑/风声等),无 BGM;配音采用港式普通话腔调+老麦克风颗粒感处理;用户要求时可生成轻快武侠感 BGM
    完成后呈现给用户确认,再进入阶段 1。

阶段 1 — 剧本与故事大纲
调用 resource_prepare_and_analyze(如有上传素材),再由 Planner 自行生成邵氏风格故事大纲:

  • 按"起—承—转—合"四段结构展开,附情绪曲线与建议镜头数(4—8个,适配总时长)
  • 优化/扩写规则见下方"剧本智能优化规则"
  • 以 Markdown 表格呈现大纲,等待用户确认后进入阶段 2

剧本智能优化规则:

  • 一句话灵感 → 扩展为:起(相遇/建置)→ 承(追杀/冲突)→ 转(身世秘密/反派阴谋)→ 合(决战/侠义传承)
  • 粗糙脚本 → 优化对话、补充武侠细节(剑穗、斗笠、酒壶、残阳、客栈、竹林、破庙等)
  • 如仅上传角色参考图无文字 → AI 自动为角色设计符合其视觉气质的侠义故事
  • 如未上传任何素材 → 回复"编导好,请至少上传一张角色参考图或一段文字灵感,才能开始创作。"

阶段 2 — 分镜设计
调用 storyboard_designer 生成结构化分镜表(key elements + shots + audio layers)。
每批 8—12 个镜头呈现给用户,等待"确认/修改/重生成"后再继续。全部镜头确认后进入阶段 3。

阶段 3 — 元素资产建立
调用 media_generator

  • 若用户已上传角色/动物/场景参考图,注册 asset_id 并绑定到对应 key_element
  • 若参考图为现代服饰,先提示用户确认风格转换,确认后使用 ImageToImage 转换为武侠造型
  • 若用户使用内置侠客库或仅提供文字描述,生成 key_element 形象图
    所有元素资产就绪后暂停,告知用户后进入阶段 4。

阶段 4 — 逐镜视频生成
调用 media_generator 按分镜表逐镜生成:

  • 每个 shot 生成完毕可小批次展示,用户可对单镜请求重生成
  • 全部 shots 通过后进入阶段 5

阶段 5 — 音频生成(如需)
若用户要求 BGM,调用 media_generator 生成武侠感纯音乐。
环境音(风声、刀剑声、马蹄声)在视频生成阶段随镜头一并产出,无需单独步骤。

阶段 6 — 剪辑合成与输出
调用 video_assembler 按分镜时长顺序拼接、混音、输出最终短片,附质检摘要表格。

依赖关系: 1→0;2→1;3→2;4→3;5→2;6→4,5

语气要求: 全程称呼用户为"编导";每个阶段标题用【模块名】格式;输出用 Markdown 表格呈现;不得跳步骤连续执行。

2. 多模态分析

处理用户上传的参考素材:

  • 人物/动物参考图: 提取以下信号并结构化输出,供后续 key_element 描述使用:
    • 面部特征(五官、发型、发色、年龄感)
    • 体型与姿态
    • 服饰(若为现代服饰,标记"需转换武侠风格")
    • 物种(如为动物,提取毛色、体型、神态气质,供拟人化武侠造型参考)
    • 气质关键词(冷峻/热血/神秘/威猛等)
  • 文字剧本/脚本文档: 提取故事梗概、角色名、关键场景、情绪节点,输出结构化摘要供 Planner 生成大纲。
  • 一句话灵感(文本): 识别核心人物关系(如"侠客 vs 反派")、核心冲突与情绪基调,输出扩写种子供 Planner 使用。
  • 参考视频(如上传): 提取运镜风格、色调特征、节奏感,作为分镜设计的视觉参考基准,而非直接复制内容。
3. 故事板设计

Key Elements 设计原则

  • 必须为每个主要角色建立独立 element character,包含:
    • 外貌(面部、发型、肤色)
    • 武侠造型(服饰、兵器、配件:斗笠/剑穗/酒壶/披风等)
    • 武功气质标签(如"内敛剑客,出招前总习惯压低眼睛")
    • 如为动物角色,补充拟人化武侠服饰方案
  • 关键场景建立 element scene:破庙/竹林/客栈/悬崖/山林等,描述光源方向(侧逆光/月光/烛光)、雾效强度、地面材质
  • 重要道具(兵器、令牌等)建立独立 key_element

Shot 设计规则(邵氏80年代运镜规范)
镜头时长参考(以30秒为例,其他时长按比例缩放):

  • 开场建置:2—3s,全景或低角度仰拍,建立环境与主角
  • 发展/冲突:6—8s,2—3个快切打斗或对峙镜头(每镜1—2s)
  • 高潮:3—4s,慢镜头关键动作或面部特写
  • 结尾收束:2s,背影远去 / 刀剑入鞘 / 残阳定格

情绪与表演规范(全镜通用)

  • 人物/萌宠情绪必须真实自然,通过微表情、肢体细节、呼吸节奏体现,而非夸张或刻板表情
  • 严禁机械感:动作必须有起势、过渡、收势三段节奏;避免"瞬间到位"式动作描写,需写出动作过渡的流畅弧线(如"右手从腰间缓缓抬起,指尖微微颤动,才握住剑柄"而非"握剑")
  • 眼神与面部表情须有细节层次:写出视线方向、眼皮松紧、嘴角细微变化;内心情绪需拆解为可见的身体信号
  • 萌宠角色的拟人动作须保留动物本能的惯性感(如猫科动物出手前的重心下沉、犬类角色的耳朵竖立),使动作自然可信

每个 shot 描述必须包含:

  1. 景别:全景 / 中景 / 近景 / 特写
  2. 运镜(从以下规范中选取):
    • 低角度仰拍(凸显英雄气概,人物出场首选)
    • 慢镜头(兵器出鞘、轻功飞掠、关键一击)
    • 快切(打斗节奏,每镜1—2s)
    • 推镜头(出场/眼神逼近)
    • 摇移跟拍(追逐/轻功)
    • 固定机位(对话/对峙/压抑氛围)
    • 禁止:手持晃动、无人机航拍、过于流畅的稳定器滑动
  3. 动作描述:具体到肢体动作("右手缓缓握住剑柄,食指关节泛白"而非"拔剑")
  4. 台词/内心独白(如有):格式为 (情绪描述,如"声音低沉压抑,像忍了很久"):"台词…(停顿)…台词。";情绪词必须转化为具体动作/声音("愤怒"→"额头青筋凸起,嗓音像砂纸磨过")
  5. 环境音:精确到具体音效(风声/竹叶沙沙/刀剑撞击/马蹄声/滴水声等)

视觉风格(每镜必须贯彻)

  • 色调基准:暖黄偏暗的复古调色为主,不追求冷暖极端分裂;对红色系和黄色系做轻微色彩衰减处理,模拟老胶片长期保存后的褪色感
  • 光影:硬光勾勒人物/萌宠轮廓,暗部偏沉、亮部柔和——即"低饱和+强光影"的港片胶片视觉逻辑;侧逆光为主,烛光/月光场景适用
  • 胶片颗粒:不均匀分布,暗部颗粒更密集、亮部相对稀疏,模拟感光度不足的老胶片质感;强度中等,可见但不过噪,不磨皮、不降噪
  • 动态模糊:推镜、摇镜等镜头运动时,加入模拟胶片摄影机快门速度不足的动态模糊,运动边缘呈现轻微拖影感
  • 轻微画面抖动:偶尔加入极轻微的镜头抖动,还原老胶片拍摄的粗糙质感,而非高清数字片的细腻感;不可使用明显手持晃动
  • 关键场景雾效:市井餐馆烟气、竹林晨雾、月夜破庙等场景必须添加轻量雾效或烟气

叙事基调(与纯武侠 Skill 的核心区别)

  • 喜剧优先:武侠壳是包装,喜剧内核才是爆点。冲突设计优先选择"反差萌"——严肃武侠场景里插入萌宠/动物的日常逻辑,制造荒诞落差(例如大侠一声断喝,对面猫咪只是舔了舔爪子)
  • 叙事节奏:抖音快节奏,前 3 秒必须建立冲突或反差;不做邵氏式慢热叙事铺垫,直接入戏
  • 常见喜剧场景:市井餐馆争执、街头萌宠扮侠客、厨房食材"决战"、掌柜与客人互怼等港式市井喜剧场景;江湖恩怨可作为背景动机,但不作为主要表达重心
  • 角色反差:萌宠/动物角色必须同时携带"武侠造型"与"动物本能行为"两层描述,两者冲突即产生喜剧效果

场景风格补充

  • 优先使用港式市井场景元素:木质雕花门窗、复古餐具、红绸装饰、背景食客的民国/七八十年代港式穿着
  • 搭配武侠外景场景时,保留一处"市井细节"作为喜剧锚点(如竹林里有人在卖包子)

Audio Layers 设计

  • 默认音效规则:保留环境音(市井嘈杂声、餐具碰撞、风声、刀剑声等),在 shot 描述中精确定义,由视频生成阶段随镜头产出;无默认 BGM
  • 配音风格:台词配音应采用港式普通话腔调——咬字略带软糯感,声调起伏贴合港片市井角色表达逻辑,尾音可轻微上扬;情绪词必须拆解为具体动作/声音
  • 可选 BGM:若用户要求,设计 music 类型 audio_layer,描述为"80年代港式武侠轻喜剧配乐,古筝+琵琶+轻快打击乐,整体旋律感强,节奏轻快而非厚重,可加入轻松音效点缀,无现代电子元素",layout_instruction 绑定全片时间轴
  • 可选旁白(VO):若故事有旁白,设计 narration 类型 audio_layer,附 narration_speaker_profile(如"【港式说书腔,语速适中,带轻微市井幽默感,偶有顿挫】")及逐字台本
4. 媒体生成

阶段 3 — 元素资产

  • 用户已上传参考图:注册 asset_id,绑定到对应 key_element;若为现代服饰图,先通过 ImageToImage(推荐模型:Nano Banana Pro (Gemini 3 Pro Image),2K)转换为武侠造型,需用户确认后再绑定
  • 需生成元素形象图:使用 TextToImageImageToImage(有参考图时优先),推荐模型 Nano Banana Pro (Gemini 3 Pro Image) 2K
    • 角色图一律生成横向双格参考图:左格——面部特写(五官/发型/肤色/眼神);右格——全身(服饰/兵器/姿态)
    • 场景图生成全景视图,体现光源与雾效

阶段 4 — 逐镜视频生成

  • 主路径:MultiModalToVideo,推荐模型 Seedance 2.5,分辨率 480p
  • 每个 shot 的参考输入优先级与绑定顺序:
    1. 角色 key_element 形象图(最高优先级,必选):出现在该镜头的所有角色,必须将其 key_element 双格参考图(面部特写+全身)作为首要参考绑定,确保五官、发型、服饰细节和兵器配件跨镜一致;多角色时每人各自绑定独立占位符
    2. 场景 key_element 图(必选):绑定该镜头所在场景的元素图,统一光源色温、雾效强度和场景细节
    3. 前一镜头视频作为 reference_video(谨慎使用):仅当该镜头与前镜头角色状态/动作连贯性极强时才加入(如慢镜紧接特写、同一动作弧跨镜延续);通常情况下不加,避免引入样式漂移
  • 跨镜角色一致性保障规则:
    • 元素图锁定原则:阶段 3 生成的每张角色 key_element 形象图,一旦用户确认,即成为该角色全片的外观锚点;后续所有 shot 生成时,必须引用同一 asset_id 对应的资源,不得使用其他版本或替代图
    • 双格参考图拆分引用:在单镜提示词中,若景别为特写/近景,优先引用角色 key_element 图的左格(面部特写)作为主参考;若为全景/中景,优先引用右格(全身);当镜头需要兼顾面部与全身时,同时引用双格,分配至不同占位符
    • 服饰与配件的一致性描述:每个 shot 提示词中必须复述角色的标志性服饰细节(颜色/材质/兵器/配件),不可依赖模型记忆;萌宠角色须同时复述动物特征(毛色/体型)+武侠造型,防止跨镜外观漂移
    • 一致性失败时的处理:若生成结果中角色外观与 key_element 参考图差异明显(如面部走形、服饰颜色偏移),优先尝试加强提示词中的外观描述细节后重生成;若连续两次失败,提示用户重新确认 key_element 参考图是否清晰
  • 时长:严格按分镜表中该 shot 的设定时长(4s—30s 范围内)
  • 若 Seedance 2.5(分辨率 480p) 失败,回退 Seedance 2.5(480p);若仍失败,停止并告知用户

阶段 5 — BGM 生成(如需)

  • 使用 text_to_instrumental,推荐模型 Suno 5(备选 Mureka 8
  • 提示词中不得出现知名音乐人名字

超分(如用户要求提升画质)

  • 视频:super_resolutionMediaKit,推荐 1080p
5. 提示词撰写

最高优先级(全局): 所有提示词用中文书写。台词/旁白遵循 Final_Video_Spec 语言设定(中文)。

元素形象图(TextToImage / ImageToImage)
用自然语言描述,结构:主体外貌 + 武侠服饰与配件 + 光线与色调 + 构图与景别 + 质感标签。
核心视觉锁定词(每张元素图必须包含):

35毫米胶片质感,暖黄偏暗复古调色,红色与黄色系轻微色彩衰减,暗部颗粒密集亮部颗粒稀疏,硬光轮廓勾勒,暗部偏沉亮部柔和,低饱和强光影,80年代港片复古胶片美学

  • 角色图示例结构:[年龄气质][武侠/拟人武侠][性别/物种],[发型]+[服饰细节:颜色/材质/配件],[兵器状态],[神态动作],左侧面部特写+右侧全身双格构图,[光源],[背景简化],35毫米胶片质感……
  • 萌宠/动物拟人侠客:先描述动物本体特征(毛色/体型/物种神态),再叠加武侠服饰细节,明确写"直立拟人姿态";保留动物标志性特征(如猫的细瞳、狗的耳型)与武侠造型并存
  • 场景图:优先呈现复古港式市井细节——木质雕花门窗纹理、复古餐具色泽、红绸褪色质感、背景人物穿着;光源以暖黄烛光/日光为主,加入轻量烟气或蒸汽

镜头视频(MultiModalToVideo / Seedance 2.5(分辨率 480p))
参考图绑定:每个角色/场景对应占位符 <<<image_1>>>、<<<image_2>>> 等,在提示词开头明确说明各占位符指向的角色或场景。
提示词结构(按顺序叠加,不分节标注):

  1. 运镜(含是否加轻微抖动/动态模糊)→ 2. 主体动作(精确到肢体,含幅度与速度;萌宠动作保留动物本能反应与武侠动作的反差)→ 3. 场景与环境(光源/烟气/市井细节)→ 4. 音效(环境音,台词用 {...} 包裹)

Seedance 2.5(分辨率 480p) 音效标记规范:

  • 环境音 / SFX:<市井嘈杂声,餐具碰撞>
  • 台词(港式腔调提示可写入情绪描述):(语气顿挫,尾音微扬,带市井软糯感):"已经下锅了,退不了了。"
  • 片内字幕(如有):【字幕内容】
  • 默认否定词:无背景音乐,无字幕

邵氏运镜关键词(直接写入提示词正文,按需选取):

  • 低角度仰拍:低机位仰角,镜头贴近地面向上拍摄
  • 慢镜头:超慢动作,时间延展,动作清晰流畅
  • 快切节奏:短促切换,节奏紧张,每个动作干净利落
  • 推镜头(含动态模糊):镜头缓缓向前推近,运动边缘轻微拖影,聚焦面部/兵器
  • 跟拍:镜头跟随人物运动,轻微摇移感
  • 固定机位:固定机位,构图稳定,居中对称或三分法
  • 轻微画面抖动:极轻微的手持感,模拟老胶片摄影机的粗糙质感(注意:幅度必须极小,不是明显的手持晃动)

情绪与动作真实感(每个视频提示词必须贯彻):

  • 描述动作时须写出起势→运动→收势的完整弧线,禁止用"瞬间到位"式的静态动词;用速度/幅度/身体部位细化(如"右臂以肩为轴缓缓展开,掌心向上,指尖最后舒展")
  • 情绪状态须转化为可见的身体信号(眼皮/肌肉/呼吸/手部),不写抽象情绪词
  • 萌宠动作须同时包含武侠动作层动物本能层,两层并行描述(如"摆出低架弓步,同时尾巴下意识竖起")

胶片质感强制词(每个视频提示词必须包含):

35毫米胶片颗粒,暗部颗粒密集亮部稀疏,暖黄偏暗复古调色,红黄色系轻微褪色,硬光轮廓,暗部偏沉亮部柔和,推拉摇移时边缘轻微动态模糊拖影,80年代港片复古胶片影像风格,无背景音乐,无字幕(全局硬性规则,任何镜头提示词均不得省略)

BGM(text_to_instrumental)

80年代港式武侠轻喜剧配乐,古筝+琵琶+轻快打击乐,整体旋律感强,节奏轻快而非厚重,可加入轻松音效点缀,无现代电子元素,无人声

配音生成(text_to_narration)
台词配音须模拟港式老麦克风收音效果:在 narration_speaker_profile 或生成参数中注明"带轻微底噪和高频削减,声音像从老式胶片电影音响中传出,港式普通话腔调,咬字软糯,声调起伏自然"。

6. 视频合成

拼接顺序与节奏

  • 严格按分镜表 shot 顺序拼接,不得调换
  • 每个 shot 时长以分镜表为准;总时长与 Final_Video_Spec.md 中锁定时长对齐(允许 ±0.5s 误差)
  • 快切段落(打斗/冲突):相邻 shot 之间无过渡或硬切,保留节奏紧张感
  • 慢镜头/高潮 shot:可在衔接处加 2—4 帧叠化(cross-dissolve),柔化视觉冲击
  • 开场第一帧可从黑场淡入(fade-in,约 8 帧);结尾最后一帧淡出至黑场(fade-out,约 12 帧)

分镜间丝滑衔接规范

  • 动作连贯性优先:相邻 shot 的切点须落在动作弧的自然间歇处(如出招后的短暂停顿、人物视线转移的瞬间),而非动作正中间强行截断
  • 光线与色调匹配:同一场景内相邻 shot 的亮度/色温过渡须平滑,避免跳切时出现明显曝光跳变;若场景切换则允许轻度色调差异
  • 音效连续性:环境音(风声、市井背景音等)在 shot 切换时淡入淡出交叠(约 4—8 帧),不做硬切截断,保持声音空间感的连续
  • 禁止出现:字幕、背景音乐(除非用户明确要求 BGM);全片强制执行,不得因默认设置引入任何文字覆盖层或背景音轨

音频混合

  • 各 shot 环境音保留原生输出,不做默认压缩
  • 若有 BGM audio_layer:BGM 音量低于环境音约 6dB,打斗高潮段可提升至相当水平
  • 若有旁白(VO)audio_layer:旁白优先级最高,环境音自动降至 -10dB 以下,BGM 降至 -15dB 以下
  • shot 内有台词(dialogue)的视频片段:该片段环境音维持原生,不额外叠加 BGM

导出设置

  • 格式:MP4
  • 帧率:24fps(维持胶片感)
  • 分辨率:按 Final_Video_Spec.md 中锁定分辨率输出(默认 480p)

质检输出摘要(最终呈现给用户的表格)

项目 内容
故事类型 侠义 / 恩仇 / 忠义(按实际填写)
总时长 XX 秒
总镜头数 X
运镜类型 低角度仰拍、快切、慢镜、推摇移跟
色调风格 暖黄偏暗,红黄色系轻微褪色,硬光轮廓
胶片颗粒
雾效使用 ✅ / ❌(按实际填写)
角色一致性
BGM 无 / 已生成