yeha.ai
Back to templates

Anthropomorphic cat film

Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.

适用于宠物拟人化情感短视频系列创作。核心公式:猫的身体 × 人的处境 × 集体情绪,将萌宠 Vlog 升级为可系列化、可商业化的情感内容资产。

Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.

Complete workflow

1. Planning

单集生产七步流程(依序执行,每阶段完成后暂停确认):

  1. 选情绪 + 选处境: 与用户确认本集「集体情绪」(怀旧/思念/委屈/治愈/团圆之一)和对应的「人类处境」(童年/职场/返乡…),共同写出一句 logline:「猫猫们替我们重过了一遍____」。用 text_editor 建立 Final_Video_Spec.md,锁定情绪标签、处境、logline、目标时长、画幅(默认 9:16)、输出语言。
  2. 拆场景 + 猫化翻译 → 分镜设计: 将处境拆解为 3–6 个记忆锚点,完成猫化翻译,设计完整 Storyboard(关键元素、镜次列表、跨镜音轨)→ storyboard_designer。完成后暂停,请用户确认分镜再继续。
  3. 生成或绑定元素图: 对所有 key_element 生成参考图;若用户已上传角色/场景素材,优先注册 asset_id 并绑定到对应元素槽,不重复生成 → media_generator。完成后暂停确认。
  4. 逐镜生成视频: 按分镜顺序生成每个 shot 的 final_shot → media_generator。完成后暂停确认。
  5. 生成音频: 生成背景音乐(及台词配音,如需)→ media_generator。完成后暂停确认。
  6. 合成输出: 按三层结构(萌层→戏层→心层)节奏装配时间线,片尾预留悬念钩子 → video_assembler

依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。

暂停节点: 步骤 1、2、3、4 完成后均须暂停,等待用户确认后方可进入下一阶段;不得一次性跑完全部步骤。

2. Storyboard design

核心创作公式

每集必须同时满足三要素:猫的身体(萌感载体)× 人的处境(情节来源)× 集体情绪(传播引擎)。选题永远从「人」出发——猫只是演员。判断标准:这条视频能不能让观众 @ 一个具体的人。

三层结构(必须齐备,缺一不可)

层级职责时长占比失败表现萌层(视觉钩子)前 3 秒用萌态/反差留住人;全片点缀萌感开头 0–5 秒 + 全片点缀开头平淡,完播率塌陷戏层(拟人情节)把「人的处境」翻译成猫能演的具体动作场景,3–6 个场景蒙太奇推进全片 60–70%流水账,有画面没故事心层(情感共鸣)结尾 10–20 秒收束升华:一句字幕/一个空镜,把情绪还给观众结尾 10–15%点破过头,煽情变尬,弹幕从泪目变尬

分镜设计规范

  • 每一镜必须标明「场景地点」字段(教室/宿舍/村口小卖部/屋顶…),直接服务后续 AI 提示词生成。
  • 场景锚点要求「一眼认出」:玻璃瓶可乐、跳房子、老冰棍、屋顶星空等标志性记忆符号优先。
  • 拆景数量:3–6 个,过多则节奏松散。

动物行为基线(V1.3)

  • 默认保持自然行为方式(四脚行走、打哈欠、踩奶、甩尾等),不做无差别拟人化直立。
  • 拟人动作(穿衣服、开冰箱、使用道具)仅在剧情明确需要时逐镜写出,非默认行为。
  • 道具按猫的身体比例缩放,保留猫的本能动作——拟人但不去猫化。

默认角色矩阵

每个角色须具备「角色卡三件套」:外形签名(视觉商标)+ 性格签名(一个稳定缺点比十个优点有用)+ 关系签名(与其他角色的固定关系线)。

角色外形签名备注元宝黄渔夫帽主角豆皮——毛台橘白狸花纹幼猫V1.3 外形修订卷卷——

角色形象须第一时间做版权登记。

人类角色规范(V1.2)

  • 「爸爸妈妈」= 人类主人,出镜不露脸:主观镜头 / 画外伸手 / 背影三选一。
  • 背景群演:公共场所群演为人类;主角可与功能性人类角色(服务员/老师/校长)互动。

语言系统(V1.1 核心规则)

  • 禁用旁白式抒情字幕;禁止文绉绉煽情。
  • 角色之间用自然的喵叫/旺旺叫「交流」,字幕以台词对白形式呈现,不写成旁白。
  • 台词必须童真化:短句、口语、带点傻气。示例——毛台:「喵呜?毕业是什么呀?」
  • 情绪不许直接念出,从对白互动和画面里「漏」出来;最重的台词留给角色最后小声说,或干脆留白让弹幕替观众说完。

跨镜音轨设计

  • 每集至少一条 BGM audio_layer,情绪须与「集体情绪」标签吻合(怀旧/治愈/温暖/思念…)。
  • 心层结尾段落 BGM 渐弱或留白,给情绪空间。
  • 台词音效(喵叫/旺叫)可作为独立音效层叠加在对应镜次时间点。
  • 不设旁白 VO 轨道。
3. Media generation

画面风格

全片现实写实风格(非 3D 动画、非卡通),所有视觉元素须与真实宠物/实景匹配。

角色/场景元素图生成

  • 使用 TextToImageImageToImage,推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
  • 每个 element character 生成一张横向并排参考图:左侧头肩特写(面部特征/毛色/眼神),右侧全身(道具/体型/姿态)。
  • 若用户已上传角色或场景素材,优先注册 asset_id 并绑定到对应 key_element,不重复生成。

Shot 视频生成

  • 使用 MultiModalToVideo,推荐模型:Seedance 2.5,分辨率 480p。
  • 每个 shot 的参考输入:
    1. 角色 element 图:该镜出现的所有角色的 key_element 参考图(必选)。
    2. 场景 element 图(如有)。
    3. 前一镜 reference_video:仅当与上一镜连续性极强时添加;通常不加。
  • 人类角色出镜时:提示词中只描述可见部分(画外手部/背影),不生成人脸。

背景音乐生成

  • 使用 text_to_instrumental,推荐模型:Suno 5Mureka 8
  • 提示词须对应本集「集体情绪」标签(怀旧/治愈/温暖/思念…)。
4. Prompt writing

全局优先级: 用户使用中文交互时,提示词正文用中文撰写。

图像提示词(TextToImage / ImageToImage)

  • 写法:「主体 + 动作 + 场景地点 + 光线/色调 + 构图」连贯自然语言,不拆成标签列表。
  • 风格固定锚词:真实感、自然光、写实摄影、非卡通。
  • 角色须通过 @资产引用 绑定 key_element 图,在提示词正文中用文字描述外形(防止角色漂移)。
  • 道具按猫的体型比例描述(「与猫爪等宽的玻璃瓶」而非「玻璃瓶」)。
  • 人类出镜时只写可见部分(「画外伸来的手」「背对镜头的人影」),不写人脸。

视频提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))

  • 参考图绑定占位符:<<<image_1>>> 对应第一个角色元素图,<<<image_2>>> 对应场景图,以此类推;每个角色独立占位。
  • 动作描述顺序:镜头运动 → 主体动作(保留猫的本能行为)→ 空间/环境变化 → 音效/台词标注
  • 台词与音效使用 Seedance 2.5 标注格式:对白 {喵呜?毕业是什么呀?},音效 <猫咪轻柔叫声>;BGM 由独立音轨承载时提示词末尾加 no music;始终加 no subtitles(字幕后期处理)。
  • 拟人动作仅在分镜明确写出时才写入提示词;默认描述自然猫行为。
  • 场景地点必须写入提示词,直接从分镜「场景地点」字段取值。
5. Video assembly

三层节奏装配

  • 萌层(0–5 秒): 第一个 shot 必须是视觉最强的萌态/反差画面,直接入画,无须黑场或片头 logo。
  • 戏层(全片 60–70%): 3–6 个场景镜次蒙太奇剪辑,节奏紧凑;场景间可用短暂黑切或叠化,避免硬切过多造成碎片感。
  • 心层(结尾 10–15%): BGM 渐弱;最后一个情绪镜头适当延长停留(+0.5–1 秒);字幕淡入后停留足够阅读时间,再淡出黑场。

片尾悬念钩子

最后 2–3 秒预留下集钩子:定格画面 + 疑问字幕,或角色动作戛然而止。

音频装配

  • BGM 全程铺底;心层段落音量降至 60–70%,保留留白感。
  • 台词音效(喵叫/旺叫)叠加在对应 shot 时间点,音量高于 BGM 但不压混。
  • 无旁白 VO 轨道。

导出

默认画幅 9:16(竖屏短视频);帧率跟随生成素材默认值。