Anthropomorphic cat film
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
适用于宠物拟人化情感短视频系列创作。核心公式:猫的身体 × 人的处境 × 集体情绪,将萌宠 Vlog 升级为可系列化、可商业化的情感内容资产。
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
单集生产七步流程(依序执行,每阶段完成后暂停确认):
- 选情绪 + 选处境: 与用户确认本集「集体情绪」(怀旧/思念/委屈/治愈/团圆之一)和对应的「人类处境」(童年/职场/返乡…),共同写出一句 logline:「猫猫们替我们重过了一遍____」。用 text_editor 建立 Final_Video_Spec.md,锁定情绪标签、处境、logline、目标时长、画幅(默认 9:16)、输出语言。
- 拆场景 + 猫化翻译 → 分镜设计: 将处境拆解为 3–6 个记忆锚点,完成猫化翻译,设计完整 Storyboard(关键元素、镜次列表、跨镜音轨)→ storyboard_designer。完成后暂停,请用户确认分镜再继续。
- 生成或绑定元素图: 对所有 key_element 生成参考图;若用户已上传角色/场景素材,优先注册 asset_id 并绑定到对应元素槽,不重复生成 → media_generator。完成后暂停确认。
- 逐镜生成视频: 按分镜顺序生成每个 shot 的 final_shot → media_generator。完成后暂停确认。
- 生成音频: 生成背景音乐(及台词配音,如需)→ media_generator。完成后暂停确认。
- 合成输出: 按三层结构(萌层→戏层→心层)节奏装配时间线,片尾预留悬念钩子 → video_assembler。
依赖关系: 2→1;3→2;4→3;5→2;6→3,4,5。
暂停节点: 步骤 1、2、3、4 完成后均须暂停,等待用户确认后方可进入下一阶段;不得一次性跑完全部步骤。
2. 스토리보드 설계
核心创作公式
每集必须同时满足三要素:猫的身体(萌感载体)× 人的处境(情节来源)× 集体情绪(传播引擎)。选题永远从「人」出发——猫只是演员。判断标准:这条视频能不能让观众 @ 一个具体的人。
三层结构(必须齐备,缺一不可)
层级职责时长占比失败表现萌层(视觉钩子)前 3 秒用萌态/反差留住人;全片点缀萌感开头 0–5 秒 + 全片点缀开头平淡,完播率塌陷戏层(拟人情节)把「人的处境」翻译成猫能演的具体动作场景,3–6 个场景蒙太奇推进全片 60–70%流水账,有画面没故事心层(情感共鸣)结尾 10–20 秒收束升华:一句字幕/一个空镜,把情绪还给观众结尾 10–15%点破过头,煽情变尬,弹幕从泪目变尬
分镜设计规范
- 每一镜必须标明「场景地点」字段(教室/宿舍/村口小卖部/屋顶…),直接服务后续 AI 提示词生成。
- 场景锚点要求「一眼认出」:玻璃瓶可乐、跳房子、老冰棍、屋顶星空等标志性记忆符号优先。
- 拆景数量:3–6 个,过多则节奏松散。
动物行为基线(V1.3)
- 默认保持自然行为方式(四脚行走、打哈欠、踩奶、甩尾等),不做无差别拟人化直立。
- 拟人动作(穿衣服、开冰箱、使用道具)仅在剧情明确需要时逐镜写出,非默认行为。
- 道具按猫的身体比例缩放,保留猫的本能动作——拟人但不去猫化。
默认角色矩阵
每个角色须具备「角色卡三件套」:外形签名(视觉商标)+ 性格签名(一个稳定缺点比十个优点有用)+ 关系签名(与其他角色的固定关系线)。
角色外形签名备注元宝黄渔夫帽主角豆皮——毛台橘白狸花纹幼猫V1.3 外形修订卷卷——
角色形象须第一时间做版权登记。
人类角色规范(V1.2)
- 「爸爸妈妈」= 人类主人,出镜不露脸:主观镜头 / 画外伸手 / 背影三选一。
- 背景群演:公共场所群演为人类;主角可与功能性人类角色(服务员/老师/校长)互动。
语言系统(V1.1 核心规则)
- 禁用旁白式抒情字幕;禁止文绉绉煽情。
- 角色之间用自然的喵叫/旺旺叫「交流」,字幕以台词对白形式呈现,不写成旁白。
- 台词必须童真化:短句、口语、带点傻气。示例——毛台:「喵呜?毕业是什么呀?」
- 情绪不许直接念出,从对白互动和画面里「漏」出来;最重的台词留给角色最后小声说,或干脆留白让弹幕替观众说完。
跨镜音轨设计
- 每集至少一条 BGM audio_layer,情绪须与「集体情绪」标签吻合(怀旧/治愈/温暖/思念…)。
- 心层结尾段落 BGM 渐弱或留白,给情绪空间。
- 台词音效(喵叫/旺叫)可作为独立音效层叠加在对应镜次时间点。
- 不设旁白 VO 轨道。
3. 미디어 생성
画面风格
全片现实写实风格(非 3D 动画、非卡通),所有视觉元素须与真实宠物/实景匹配。
角色/场景元素图生成
- 使用 TextToImage 或 ImageToImage,推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 每个 element character 生成一张横向并排参考图:左侧头肩特写(面部特征/毛色/眼神),右侧全身(道具/体型/姿态)。
- 若用户已上传角色或场景素材,优先注册 asset_id 并绑定到对应 key_element,不重复生成。
Shot 视频生成
- 使用 MultiModalToVideo,推荐模型:Seedance 2.5,分辨率 480p。
- 每个 shot 的参考输入:
- 角色 element 图:该镜出现的所有角色的 key_element 参考图(必选)。
- 场景 element 图(如有)。
- 前一镜 reference_video:仅当与上一镜连续性极强时添加;通常不加。
- 人类角色出镜时:提示词中只描述可见部分(画外手部/背影),不生成人脸。
背景音乐生成
- 使用 text_to_instrumental,推荐模型:Suno 5 或 Mureka 8。
- 提示词须对应本集「集体情绪」标签(怀旧/治愈/温暖/思念…)。
4. 프롬프트 작성
全局优先级: 用户使用中文交互时,提示词正文用中文撰写。
图像提示词(TextToImage / ImageToImage)
- 写法:「主体 + 动作 + 场景地点 + 光线/色调 + 构图」连贯自然语言,不拆成标签列表。
- 风格固定锚词:真实感、自然光、写实摄影、非卡通。
- 角色须通过 @资产引用 绑定 key_element 图,不在提示词正文中用文字描述外形(防止角色漂移)。
- 道具按猫的体型比例描述(「与猫爪等宽的玻璃瓶」而非「玻璃瓶」)。
- 人类出镜时只写可见部分(「画外伸来的手」「背对镜头的人影」),不写人脸。
视频提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))
- 参考图绑定占位符:<<<image_1>>> 对应第一个角色元素图,<<<image_2>>> 对应场景图,以此类推;每个角色独立占位。
- 动作描述顺序:镜头运动 → 主体动作(保留猫的本能行为)→ 空间/环境变化 → 音效/台词标注。
- 台词与音效使用 Seedance 2.5 标注格式:对白 {喵呜?毕业是什么呀?},音效 <猫咪轻柔叫声>;BGM 由独立音轨承载时提示词末尾加 no music;始终加 no subtitles(字幕后期处理)。
- 拟人动作仅在分镜明确写出时才写入提示词;默认描述自然猫行为。
- 场景地点必须写入提示词,直接从分镜「场景地点」字段取值。
5. 동영상 조립
三层节奏装配
- 萌层(0–5 秒): 第一个 shot 必须是视觉最强的萌态/反差画面,直接入画,无须黑场或片头 logo。
- 戏层(全片 60–70%): 3–6 个场景镜次蒙太奇剪辑,节奏紧凑;场景间可用短暂黑切或叠化,避免硬切过多造成碎片感。
- 心层(结尾 10–15%): BGM 渐弱;最后一个情绪镜头适当延长停留(+0.5–1 秒);字幕淡入后停留足够阅读时间,再淡出黑场。
片尾悬念钩子
最后 2–3 秒预留下集钩子:定格画面 + 疑问字幕,或角色动作戛然而止。
音频装配
- BGM 全程铺底;心层段落音量降至 60–70%,保留留白感。
- 台词音效(喵叫/旺叫)叠加在对应 shot 时间点,音量高于 BGM 但不压混。
- 无旁白 VO 轨道。
导出
默认画幅 9:16(竖屏短视频);帧率跟随生成素材默认值。