Two-character first-person interaction
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
适用于宠物 + 萌娃双主角同框短视频;以「闯祸–被抓包」喜剧弧线为核心,第一人称低角度手持 POV,内嵌大人画外台词,覆盖角色设定、视频生成(Seedance 2.5(分辨率 480p))、封面矩阵与合成全流程。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
前置检查
用户须至少提供以下之一,否则立即索取,不得继续执行:
- 已有角色参考图(面部或主体清晰),或对宠物/萌娃的文字描述(如"灰色宠物龙/麒麟,体型约如成年猫"、"黑白哈士奇幼犬")
- 一段简短场景文字(如"厨房烤肉失控"、"帮忙叠衣服")。
完整制作阶段逻辑(严格顺序,禁止跨越)
Phase 1:规格锁定 → text_editor
向用户确认:
- 宠物角色:物种/类型、主要外形特征关键词、体型大小参照
- 萌娃角色:主要外形特征关键词、与宠物的体型比例关系(谁更大、大约几比几)
- 视频总时长:30s(单段)/ 30s(2段)/ 45s(3段)
- 视频语言:用户指定
- 画面方向:竖屏 9:16(默认)或横屏 16:9
- 互动主题:用户描述剧情方向,或由 AI 提案后用户确认
- 视频模型:Seedance 2.5(分辨率 480p)(默认,画质优先)或 Seedance 2.5(分辨率 480p)(速度优先)
确认后用 text_editor 建立 / 更新 Final_Video_Spec.md,写入:项目名称、宠物角色(类型+外形关键词+体型参照)、萌娃角色(外形关键词+体型参照)、双主体体型比例关系、总时长、段数、画面比例、视觉基调、模型选择、POV约束(画面内始终呈现宠物+萌娃双主体)、音频策略(所有台词/SFX通过视频模型内嵌生成,不单独配音)、跨段衔接策略(每段视频结尾截帧作为下一段首帧静帧输入)。
【强制暂停点一】 将规格摘要发给用户确认,未收到确认前不得继续。
Phase 2:角色形象锁定 → resource_prepare_and_analyze + media_generator
- 若用户上传了参考图:调用 resource_prepare_and_analyze 判断是否已是「主体特写 + 三视图」合排格式:
- 已是合排格式:直接注册 asset_id,同时将①特写分区单独注册 asset_id,绑定到 key_element,无需重新生成。
- 非合排格式:提取视觉特征后,调用 media_generator(ImageToImage,Nano Banana Pro,2K)一次生成「1张特写 + 3视图」四图水平合排设定图(纯白背景,超写实摄影风格);整张图注册 asset_id,①特写分区单独注册 asset_id,全部绑定到 key_element。
- 若仅有文字描述:调用 media_generator(TextToImage,Nano Banana Pro,2K)直接生成四图合排设定图,注册方式同上。
【强制暂停点二】 将角色设定图(含特写 + 三视图)分别发给用户确认,此图为后续所有生成的视觉基准,未确认不得继续。
Phase 3:POV 分镜规划 → storyboard_designer
基于已确认的规格与角色形象,设计完整故事板:
- 单段(30s):设计2个镜头,时长30s。
- 双段(30s):设计4个镜头,每段30s,明确跨段剧情衔接节点(第1段结尾的画面状态即是第2段开头的起始状态)。
- 三段(45s):设计6个镜头,每段30s,同样明确相邻段的衔接节点。
每个镜头描述中须包含:POV形式说明(第一人称 POV:大人视角拍摄,大人不入画但画外台词保留);2–3个互动节拍及对应情绪信号;双主体同框说明;跨段衔接备注(多段时标注本段结尾定格画面描述);逐秒时间线与音频设计;大人画外台词内容及触发时机(必写)。
同时在故事板中登记本片涉及的场景 / 道具关键元素(element scene、关键道具),写明其外观描述(材质、颜色、形态、所处环境光),供 Phase 4 生成参考图、并供视频生成时绑定,确保跨段场景一致。
【强制暂停点三】 输出完整分镜后邀请用户审查,等待确认后再继续。
Phase 4:关键元素生成(场景 / 道具)→ media_generator
针对故事板中登记的每个场景 / 道具元素:
- 若用户已上传对应参考图:调用 resource_prepare_and_analyze 提取特征后,直接注册 asset_id,绑定到对应 element scene / 道具元素,无需重新生成。
- 若无参考图:调用 media_generator(TextToImage,Nano Banana Pro,2K)按故事板描述生成参考图,注册 asset_id 并绑定到对应元素;超写实摄影风格,与角色设定图的写实基调统一。
- 纯空旷场景(如普通桌面、地面)若无显著道具特征,可不单独生成,由视频提示词直接描述;仅对有明确形态/材质、需跨段保持一致的场景或道具(如指定的小床垫、特定餐具、玩具)才生成参考图。
【强制暂停点四】 将场景 / 道具参考图发给用户确认,作为后续视频的视觉基准,未确认不得继续。
Phase 5:视频生成 → media_generator
按照「跨段截帧首帧衔接」规则逐段生成:
- 第1段:以双角色设定图(各自特写分区为主参考)+ 该镜头绑定的场景/道具元素图一并作为参考输入直接生成。
- 第2段及后续段:调用 resource_prepare_and_analyze,从上一段已生成视频中提取最后1帧或最后0.5s内最佳构图帧作为截帧资源;将该截帧注册为过渡帧 asset_id;以该截帧作为下一段视频的 start_frame 输入,确保视觉连续性丝滑无割裂。
所有段:MultiModalToVideo(Seedance 2.5(分辨率 480p) 或 Seedance 2.5),480p,9:16 或 16:9,30s/段。
【可选:超分辨率提升】 用户对视频内容满意后,可对单段或全片调用 super_resolution 工具将分辨率从 480p 升至 1080p。
【强制暂停点五】 将所有段视频(含可选超分结果)发给用户预览确认后,再进入封面图阶段。
Phase 6:封面图生成 → media_generator
第一轮 · 主封面(比例由视频方向决定):
- 调用 resource_prepare_and_analyze,从已确认视频中提取最具冲击力的高光帧(优先级:「被抓包齐僵」定格瞬间 / 情绪顶点表情 / 喜剧落点构图),将候选高光帧发给用户确认,等待用户明确选定后再继续。
- 以宠物角色特写分区 + 萌娃角色特写分区 + 用户选定的高光截帧为多参考,调用 ImageToImage(GPT Image 2,2K)生成主封面,叠入用户确认的片名与金句;要求双主角清晰、体表形态与设定图一致,留出大面积干净负空间用于文字。比例依视频方向:
- 竖屏视频(9:16) → 主封面为 3:4 竖图(小红书 / 抖音);
- 横屏视频(16:9) → 主封面为 4:3 横图(B站 / 朋友圈)。
第二轮 · 尺寸裂变(另外两个比例): 主封面经用户确认后,以主封面为唯一垫图裁切裂变另外两个比例,文字排版与内容保持统一:
- 竖屏路径:3:4 主封面 → 裂变 16:9 横版 + 4:3 横图;
- 横屏路径:4:3 主封面 → 裂变 16:9 横版 + 3:4 竖图。
【强制暂停点六】 高光截帧选定、主封面确认两处均须等待用户明确确认;主封面确认后方可裂变,全部封面确认后再进入合成阶段。
Phase 7:时间轴合成 → video_assembler
按故事板顺序将多段 POV 视频拼接合成,硬切转场,输出最终成片,提示用户点击导出。
依赖关系: 2→1;3→1,2;4→3;5→2,3,4;6→5;7→5,6。
绝对禁止一次性跑完所有步骤,每个强制暂停点均须等待用户明确确认后方可继续。
2. マルチモーダル分析
角色参考图分析规则
判断上传图片是否已是「主体特写 + 三视图」合排格式(同时包含特写与正/侧/背面全身三视图)。
若非合排格式,提取以下视觉特征用于生成设定图:
宠物角色:
- 物种与整体体型类别
- 主色调与体表纹理(毛发/鳞片/皮肤的颜色分布区域和质感)
- 体型大小参照(与常见动物或物品的对比,如"体型约如成年猫")
- 面部特征(眼睛大小与颜色、鼻型、嘴部特征、须/毛/角等特殊器官)
- 标志性外形(尾巴形态、耳朵形状、特殊肢体或器官)
- 整体气质(温顺/调皮/傲娇/急切等)
萌娃角色:
- 主要外形特征(肤色与脸型、发色与发量、眼睛颜色与神态、体型胖瘦比例)
- 与宠物角色的体型比例关系(谁更大?比例约几比几?)
- 常见状态或动作倾向
场景 / 道具参考图分析规则
当用户为故事板中的场景或道具元素上传参考图时,提取以下特征用于注册绑定或生成参考图:物体类型与形态尺寸、主要材质与质感、颜色分布、所处环境与环境光基调(自然光/人造光、色温、明暗)。
跨段截帧提取规则
从上一段已生成的30秒视频中提取最后1帧或最后0.5秒内构图最稳定的帧作为截帧。优先选择:双主体均在画面中且构图居中饱满、光线清晰、无运动模糊的帧。输出截帧资源,供下一段视频 start_frame 使用。
3. 絵コンテ設計
内容基调底线(最高优先级):
所有场景基调为轻松喜剧 / 萌系日常。宠物之间的争抢、推搡须在喜剧范围内(夸张的肢体反应、傻气的表情),不得描述造成真实伤害的动作。禁止任何暴力、血腥或有害内容。
POV 约束(设计最高优先级):
采用第一人称 POV——以大人的视角拍摄:大人即镜头/手持设备本身,大人不入画(手部、躯干、面部均不出现),机位低角度贴近主体所在平面(如桌面高度、地面高度),模拟大人俯身凑近观察双主角的视角。画面内宠物 + 萌娃双主角全程同框互动。
镜头是"活"的手持第一人称,不是固定监控机位。 全程带轻微呼吸/手持晃动感,并由动作驱动主动运镜:跟随双主角移动、横摇/俯仰追随抢夺与追逐、在喜剧落点快速推近或轻甩到反应主体(如僵住的双主角、被出卖方的委屈脸)。动作越激烈,手持晃动越明显;运动须有动机,避免无意义的匀速空镜。
禁止大人形体入画(手/躯干/面部)。
运镜护栏:运动中双主角与接触面的接触阴影须始终可读、主体形态稳定;避免会导致 CGI 主体扭曲的极端甩动或天旋地转式运镜。
关键:「大人不入画」只约束画面,绝不等于静音。 大人的画外吐槽台词是灵魂,必须贯穿全片(见下方音频设计规范);禁止因"大人不出镜"就省略台词或在提示词里写 no dialogue。
【闯祸弧线(必填核心结构,最高优先级)】
本风格的喜剧引擎不是「互动」,而是「闯祸」。每段视频必须有一个明确的「祸」——两主角的行动造成的、可以被镜头拍到的物理状态变化(床单被掀歪/咬破、食物散落、东西被推翻、禁区被侵入、物品被拆散……)。没有可见的祸,大人台词就悬空,被抓包就没有张力。
规划分镜前必须先回答以下三个问题,否则不得进入逐秒设计:
- 他们犯了什么祸? 写明具体的受损/被占/被破坏的对象和其物理状态(如"床垫绗缝布被边牧幼犬咬出一个小豁口,棉絮微微外露",而不是"争床位")。
- 案发现场在哪里? 大人镜头推近时,画面里必须能看到「祸」留下的物理痕迹——这是被抓包的视觉证据。
- 大人的台词在反应什么具体的祸? 台词必须指向可见证据("你把床垫咬了!"),而不是抽象行为("不许欺负弟弟")。
镜头节奏结构(起中收,适用于单支30s片段,包含2–3 个互动节拍):
- 起(0–3s):建立场景,呈现双主角的初始状态与「作案动机」——在哪、想要什么、蓄势感。
- 中(3–12s):核心闯祸区,展开 2–3 个互动节拍,每个节拍有明确的触发动作 → 反应链,情绪逐步升级;「祸」的物理证据在此阶段逐渐积累并变得可见。
- 收(12–30s):情绪顶点——大人发现可见的案发现场,角色被抓包齐僵;画面构图须同时呈现「双主角的呆萌反应」+「背景中清晰可见的祸的证据」。
长视频多片段规划:
若用户选择视频总时长超过30s,在拆分分镜前必须先完成完整剧情策划,确保多片段之间逻辑贯通、情绪递进合理:
剧情策划规范(多片段必须执行):
- 时间线锚定:明确整条视频发生在哪个时间段,确保片段间时间流向自然,不得出现时间倒退或无法解释的场景跳跃。
- 情绪弧线设计:规划从第一片段到最后一片段的情绪变化曲线,每片段的情绪节奏在整体弧线中有明确位置,不得每片段情绪独立重置。
- 动作/状态连续性检查:相邻片段间的服装、发型、场景道具须保持逻辑连贯;若有合理的状态变化,须在分镜描述中给出动因。
- 剧情策划输出格式:在输出完整分镜前,先向用户呈现一份简明的「剧情大纲」——包含各片段的时间节点、场景、核心动作与情绪关键词,经用户确认后再展开逐秒分镜细节。
将完整叙事拆分为多个独立镜头(每镜头≤30s)。规划注意事项:
- 每个镜头为完整的起中收单元,默认一镜到底;仅当剧情有明确的时间跳跃或场景切换需求时允许段内切镜,且每段内切镜不超过 1 次;
- 在镜头描述中注明与前后片段的衔接动势,便于后续以 start_frame 保持主体连续性;
- 片段间衔接允许合理的场景/机位变换,只要主体形象一致即可。
互动类型参考库(灵感来源,非强制菜单):
设计分镜时优先从故事出发:先确定两个角色在这段时间里「想要什么、会怎么抢/骗/反应」,再用下表为节拍命名——而不是反过来先挑类型再填动作。允许超出库范围,允许自由混搭或发明新形态,只要符合轻松喜剧基调底线即可。
下表提供 6 种常见形态供参考:
类型描述争抢护食双方同时觊觎同一食物/物品;一方先抢到,另一方虎视眈眈或试图偷取;可引发护食姿态或第二轮抢夺嫁祸/装无辜一方搞破坏后溜走或藏到安全位置,另一方被留在原地;大人视角出现时,"无辜方"用眼神/动作示意另一方是肇事者被抓包齐僵两者正在做坏事被发现,同时停住动作,齐刷刷对视镜头呆萌僵立约 1–2s,喜剧停顿物理喜剧争抢/追逐中一方被碰撞、绊倒、压制或弹飞,落点夸张但无伤害感;重点在跌倒/弹起/打滚的喜剧弧度好奇探索+入侵一方先发现新物品独自研究,另一方悄悄凑近,趁机占据、抢占或搞破坏背刺/出卖一方与大人视角"联合",用眼神/动作示意另一方是肇事者;被出卖方的委屈反应是情绪顶点
情绪→肢体映射表(通用,适用任意物种;镜头描述必须调用对应具体信号,禁止只写"它很傲娇"等抽象词):
情绪身体信号傲娇头微仰 5–15°;半闭眼;尾巴/背部挺立或慢速摆动;故意转身背对,偶尔偷偷回望调皮身体低伏蓄力;尾巴/后躯快速摇摆;眼神快速扫向目标后假装没看;嘴角/嘴部微张委屈缩脖;前肢内扣或向内弯;双眼放大,下眼睑略带湿润感;身体重心后移,耳朵下压好奇头歪 15–30°;耳朵立起朝向声源/目标;鼻尖向前伸探;单步缓慢前探,身体拉长炸毛颈背/脊背体表毛发/羽毛/鳞片竖立;身体横向展开略压低;嘴微张,露出牙齿轮廓耍横挺胸直立;前肢踩住或指向对方;直视镜头或对方,眼神不让;尾巴高举
生活化场景库(双主角尺度下的日常空间):
- 室内桌面:餐桌、厨房操作台、书桌——适合「分配」「争抢」「被抓包」
- 室内地面:走廊、客厅地板——适合「追逐」「物理喜剧」「探索」
- 室内角落/家具旁:沙发边、墙角、门边——适合「嫁祸」「藏匿」「背刺」
- 户外地面:院子、草地——适合「追逐」「探索新物品」
镜头语言规范:
- 景别优先选用中近景(双主体完整入画且细节可见);情绪顶点可切近特写(单主体面部/表情)
- 镜头运动须与互动节拍配合,运动由动作驱动(第一人称手持,全程带呼吸感):
- 起:轻微手持呼吸感的固定 / 缓推,建立场景
- 中(互动节拍):跟随移动 + 横摇 / 俯仰追随抢夺、追逐、入侵;动作越激烈,手持晃动越明显
- 收(喜剧落点):快速推近到僵住的双主角,或轻甩到被出卖方 / 委屈方的脸,放大反应
- 避免无动机的匀速空镜与频繁硬切;运动中保持双主角尽量同框
- 默认一镜到底(镜头运动连续,不靠剪辑切换);仅当有明确场景/时间跳跃时允许切镜,每段不超过 1 次
- 每镜须注明逐秒时间线(格式:Xs–Xs:【节拍标题】动作描述 + 情绪信号 + 音频设计),时间精确到 0.5s
音频设计规范(内嵌,不单独配音):
台词为大人对双主角的对话口吻(宠溺式吐槽 / 质问 / 假装严肃),语言遵守用户指定,通过视频模型内嵌生成,不调用独立配音工具。每个镜头在逐秒时间线中注明台词内容及触发时机。
台词风格参考:「你们两个在搞什么 / What on earth are you two doing」「我就知道是你干的 / I knew it was you」「你偷偷摸摸干啥 / Why all the sneaking around」——口语化,有节奏感,配合画面动作触发点出现。
【音画因果锁定规则(必须遵守)】 当一句台词是角色状态变化的直接触发原因(如听到声音后僵住、转头、委屈),则该台词与对应的角色反应动作必须写在同一个时间窗口内:台词出现在该窗口前 0.5–1s,角色反应紧随其后,整个因果链控制在同一 2s 时间段内完成。禁止把触发台词写在前一节拍末尾、把角色反应放到下一节拍开头——跨节拍拆分会导致视频模型将两者处理为无关联事件,造成台词播完后角色延迟数秒才反应的叙事断层。
禁止在分镜阶段单独规划旁白生成步骤,音频策略在 media_generator 阶段由提示词内嵌处理。
4. 素材生成
主角形象资产生成(设定图):
宠物角色与萌娃角色分别生成独立设定图,生成格式均为「1张主体特写 + 3视图」四图水平合排,纯白背景,超写实摄影风格(Hyper-realistic photography)。四个分区:①左侧大幅主体特写(占整图约40%宽度)、②正面全身、③侧面全身、④背面全身。
- 无参考图时:使用 TextToImage,模型 Nano Banana Pro,2K,一次生成四图合排设定图。
- 有参考图时:判断是否已为合排格式——是则直接注册;否则使用 ImageToImage,模型 Nano Banana Pro,2K,一次生成四图合排设定图。
- 整图注册 asset_id,①特写分区单独注册 asset_id,宠物角色与萌娃角色分别绑定到各自的 key_element。
场景 / 道具元素图生成(对应 Phase 4):
针对故事板登记的、有明确形态/材质且需跨段一致的场景或道具元素(如指定小床垫、特定餐具、玩具):
- 用户已上传:注册 asset_id,绑定到对应 element scene / 道具元素。
- 无参考图:使用 TextToImage,模型 Nano Banana Pro,2K,按故事板描述生成单图(超写实摄影风格,与角色设定图基调统一),注册 asset_id 并绑定到对应元素。
- 纯空旷、无显著特征的场景(普通桌面/地面)可不单独生成,留待视频提示词直接描述。
所有类型通用:
- 角色设定图确认后,①特写分区 asset_id 作为后续视频生成的主要 reference_image 输入。
- 场景 / 道具元素图确认后,作为对应镜头视频生成的附加 reference_image 输入。
POV 视频生成:
- 生成路径:MultiModalToVideo,模型依 Final_Video_Spec 所选版本执行:
- Seedance 2.5(默认,480p,画质更优)
- Seedance 2.5(480p,生成更快,适合快速预览)
- 画面比例:依 Final_Video_Spec 所选方向执行:竖屏 9:16 或 横屏 16:9;分辨率固定 480p。
- 每个镜头默认时长 30s。
- 参考输入:同时传入宠物角色特写分区 asset_id 与萌娃角色特写分区 asset_id 作为双 reference_image,确保两个主角形象一致性;该镜头绑定的场景 / 道具元素图一并作为 reference_image 传入,确保场景跨段一致。
- 多段视频连续性(第二段起必须执行):
- 首帧锁定:调用 resource_prepare_and_analyze 提取上一段视频最后1帧(或最后0.5s内构图最稳定帧)作为 start_frame,输入到当前段生成,确保双主角体态与场景状态无缝衔接。
- 音频氛围延续:将上一段内嵌音频末尾片段作为 reference_audio 输入,保持声音氛围连续(Seedance 2.5(分辨率 480p) 与 Seedance 2.5(分辨率 480p) 均支持)。
- 单段(30s)独立视频无需此操作。
【可选:超分辨率提升】
用户对视频内容满意后,可对单段或全片调用 super_resolution 工具将分辨率从 480p 升至 1080p 或更高。效果接近直接出高分辨率,灵活性更高,适合正式输出前使用。建议在用户确认内容满意后再执行,对不满意的片段无需超分,避免浪费资源。
双主角一致性自检: 生成后确认双主角均完整出现在画面内,且与设定图形象一致;若任一主角缺失、形象漂移或体型比例明显失当,打回重新生成并追加对应 reference_image 约束。
封面图矩阵生成:
- 主封面(比例由视频方向决定):从已确认的 POV 视频片段中调用 resource_prepare_and_analyze 提取最具视觉冲击力的高光帧(优先级:「被抓包齐僵」定格瞬间 > 情绪顶点表情 > 喜剧落点构图),将候选高光帧发给用户确认,等待用户明确选定后再继续;以宠物角色特写分区(①分区)+ 萌娃角色特写分区(①分区)+ 该高光截帧为多参考,调用 ImageToImage(GPT Image 2,2K),叠入用户确认的片名与金句;要求双主角清晰、体表形态与设定图一致,留出大面积干净负空间用于文字排布,背景无字幕/水印。
- 竖屏视频(9:16) → 优先生成 3:4 竖图(小红书/抖音)作为主封面;
- 横屏视频(16:9) → 优先生成 4:3 横图(B站/朋友圈)作为主封面。
- 裂变尺寸:主封面发给用户确认后,以主封面为唯一垫图,裂变生成另外两个比例,风格与文字排版保持统一:
- 竖屏路径:3:4 主封面 → 裂变 16:9 横版 + 4:3 横图;
- 横屏路径:4:3 主封面 → 裂变 16:9 横版 + 3:4 竖图。
- 文字叠加规则:封面图只允许叠入用户确认的片名与金句;禁止出现任何其他文字、水印、随机字幕。
- 负向约束:no watermark, no subtitle, no random captions, no extra text overlay (allow only the confirmed title and tagline), no human in frame except 萌娃 character, no overhead shot, no floating subjects。
5. プロンプト作成
【最高优先级:所有 Prompt 正文(画面描述、运镜、物理细节等)必须用中文书写;模型名称、英文参数标签、负向约束词保留英文。台词内容例外——须遵循 Final_Video_Spec 指定的视频语言,非中文时台词用对应语言书写。】
一、图像生成提示词(TextToImage / ImageToImage)——角色设定图专用
生成格式为「1张主体特写 + 3视图」四图水平合排,一次生成。按以下顺序构建提示词:
- 布局声明:"纯白背景,四图水平排列,从左到右依次为:①左侧大幅主体特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身"。
- 主体锁定:物种、主色调与体表质感(毛发/鳞片/皮肤,逐区描述颜色分布)、体型比例、面部特征(眼睛形状大小颜色、鼻型、嘴型)、标志性特征(尾巴、耳朵、特殊器官)。禁用抽象形容词,转化为可见视觉细节。
- 各分区构图:①特写:主体面部与躯干前段清晰,眼睛直视镜头;②正面全身:完整入画;③侧面全身:轮廓与尾部/后肢可见;④背面全身:背部纹路细节完整。
- 光影:纯白背景,柔和均匀环境光,体表质感清晰,无强方向阴影。
- 风格锁定:Hyper-realistic photography, photorealistic, studio shot, 8K resolution。
- 负向约束:no text, no watermark, no logo, no extra character, no human, no colored background。
场景 / 道具元素图(同属 TextToImage / ImageToImage): 按故事板描述构建——主体物(如小床垫、餐具、玩具)+ 材质质感 + 颜色 + 形态尺寸 + 所处环境光(如"室内木地板,自然光,温暖柔和");风格锁定与角色设定图一致(Hyper-realistic photography, photorealistic, 8K);负向约束:no text, no watermark, no logo, no character, no human(场景/道具图只呈现物体本身,不含角色)。
二、视频生成提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))
严格按照【镜头运动 → 双主体表演 → 物理真实感细节 → 空间环境 → 音频】顺序组织:
1. 镜头运动
描述摄像机位置、高度与运动方式。本系列采用有生命力的第一人称手持 POV:镜头高度锚定在主体体型 1/2–2/3 处(低角度,避免俯视),大人不入画但画外台词贯穿。运镜由动作驱动,按节拍需要选用(而非全程死板固定):
- 手持呼吸感:贯穿全片的基础质感,轻微晃动而非纹丝不动;
- 跟随移动 / 横摇 / 俯仰:追随抢夺、追逐、凑近探索的主体,动作越激烈晃动越明显;
- 快速推近 / 轻甩:在喜剧落点或反应顶点甩向 / 推近单主体表情(如僵住的双主角、委屈脸)。
写法须把运镜动机和动作绑在一起,例如"镜头随幼犬扑向床垫快速横摇跟随,落点处轻微前冲"。保真护栏:运动中双主角与接触面的接触阴影须保持可读、主体形态稳定;避免会导致 CGI 主体扭曲的极端甩动或天旋地转式运镜。
2. 双主体表演(核心,密度最高)
按时间顺序逐个动作展开,每个动作须调用情绪→肢体映射表中的具体身体信号。写作格式要求:
- 写明"谁 + 具体部位 + 动作 + 程度副词"
- 写明完整因果链:A的动作X → 导致物体/环境状态Y → B的反应Z(禁止跳跃式描述,不能只写结果不写原因)
3. 闯祸证据可见性(必写)
在提示词「双主体表演」段落中,必须明确描述「祸」留下的物理状态:受损对象的具体形变(如"床垫左上角绗缝布被撕开约5cm的豁口,白色棉絮从缺口向外蓬出")、散落物的分布(如"三颗饼干碎屑散落在床垫右侧")。收段(12–30s)的画面描述须同时包含:①双主角呆萌僵立的姿态 + ②背景/前景中清晰可见的祸的痕迹,两者同框才能构成完整的被抓包喜剧构图。禁止只写角色表情而遗漏证据。
4. 物理真实感细节(每段必须包含以下4条中的至少3条)
① 接触锚定:描述每个主体与接触面(桌面/地面/物体)的具体关系。
正确示例:"前肢平贴桌面,掌心轻压,接触处桌面纹理清晰可见"。
禁止写法:"趴在桌上"(缺少接触细节,模型易生成漂浮效果)。
② 接触阴影(contact shadow):在提示词中显式追加:"所有主体与接触面之间有精准接触阴影(contact shadow),阴影浓度与主体体积和重量感匹配"。
③ 物质交互状态:描述物体被主体作用后的具体状态变化,禁止只写动词。
正确示例:"食物被咬下后截面呈参差断裂纹理,碎屑散落桌面";"液体溢出后沿桌面纹理扩散,边缘呈不规则轮廓"。
禁止写法:"在吃食物"(无状态结果,模型随机处理)。
④ 体型比例锚定:每段 prompt 必须写明双主体的体型比例关系。
示例:"宠物体型约为萌娃的1/3,两者并排时宠物肩高约至萌娃腰部"。
不锚定则模型在不同段之间随机缩放,破坏视觉一致性。
4. 空间与背景
描述空间类型、主光源方向、色温与景深基调(如"温馨居家桌面,暖黄灯光,背景略有浅焦虚化")。若用户有场景参考图,注明 <<<scene_image>>> 并继承其光影色调。
5. 音频(Seedance 2.5 包装符)
- 大人画外吐槽台词为必写项:每段至少 1 句大人对双主角的吐槽 / 质问 / 假装严肃口吻台词,用 {台词内容} 包裹(语言遵循 Final_Video_Spec 视频语言),花括号外紧跟「(无字幕)」:{你们两个在搞什么}(无字幕)。大人虽不入画,但画外有声——这是本风格的灵魂,不可省略。
- 环境音用 <音效描述> 包裹:<金属锅盖倒地声,婴儿清脆笑声>
- 背景音乐固定写:(no music)
- 禁止把 no dialogue / no speech 写入负向约束(那会关闭大人画外台词)。
- 禁止调用任何独立音频生成工具(text to narration / text_to_instrumental)
特别规则:角色静止(freeze pose)vs 画面定格
当分镜含「被抓包齐僵」节拍时,提示词须写:
「两主角动作同时停止约1.5秒,保持当前姿态不动,但摄像机维持固定机位的镜头呼吸感,背景环境继续正常运动(如飘落的颗粒物、流动的液体)」
禁止写"画面静止""画面暂停""screen freeze"——这些词会被模型解读为视频静帧,而非角色 pose 停止。
负向约束(视频,必须包含):
no subtitles, no text overlay, no watermark, no logo, no music, no floating subjects (all characters must maintain contact shadow on surface), no third-person overhead shot, no disembodied limbs without physical context。
POV 约束(视频提示词结尾必须追加):
「第一人称手持 POV(低角度,带呼吸感,运镜随动作跟随/横摇/推近),大人不入画但画外吐槽台词保留,画面内宠物与萌娃双主角全程同框,禁止主体与接触面之间无接触阴影的漂浮效果,禁止第三人称高角度俯拍,禁止极端甩动导致主体扭曲。」
附:感官词汇参考库(供"二、视频生成提示词"调用)——CGI 生物真实感专用
接触与物理:
- 接触点形变:掌心/爪底轻压接触面时的细微凹陷感 (subtle surface deformation at contact point)
- 接触阴影:体积感接触阴影 (volumetric contact shadow)、边缘软化阴影 (soft-edge ambient occlusion)
- 液体物理:沿表面纹理扩散的液体轮廓 (liquid spreading along surface grain)、不规则边缘水渍 (irregular watermark edge)
- 食物质感:啃咬后的断裂截面 (bitten cross-section with torn texture)、碎屑散落轨迹 (crumb scattering path)
- 粉末/颗粒:散落后的落点分布(较重颗粒近处多、轻颗粒漂远)(particle scatter distribution by weight)
体表材质:
- 毛发:逆光下毛发边缘透光感 (backlit fur translucency)、毛发层次感 (layered fur depth)、运动时毛发跟随惯性延迟 (fur inertia lag)
- 鳞片:鳞片边缘高光 (scale edge specular highlight)、鳞间阴影 (inter-scale shadow)
- 皮肤/幼年动物:皮下透光感(鼻端、耳廓)(subsurface scattering on snout and ear)
光影融合(CGI 主体与真实环境):
- 环境色反射:主体体表接收来自接触面/背景的反射色 (environment color bleeding onto subject)
- 投影一致性:主体在接触面的投影方向须与场景主光源一致 (shadow direction matches scene key light)
- 接触面反射:光滑桌面/地面对主体腹部产生的微弱漫反射 (surface reflection on subject underside)
情绪特效(须在 Final_Video_Spec 角色档案中预定义,不得凭空使用):
- 眼部发光(极度兴奋/愤怒时):眼部发出与角色属性对应的颜色光 (eye glow matching character elemental trait)
- 体表竖立:毛发/鳞片/羽毛逐根竖起,伴随轻微震颤 (fur/scale/feather bristling with subtle tremor)
- 呼吸加速:胸腔明显起伏,鼻孔微张 (rapid chest rise-fall, flared nostrils)
三、封面图提示词(ImageToImage / GPT Image 2)
封面图生成分两轮,提示词结构如下:
第一轮:主封面(比例由视频方向决定)
多参考输入:<<<image_1>>> 绑定宠物角色设定图特写分区(体表形态锁定精度最高);<<<image_2>>> 绑定萌娃角色设定图特写分区(萌娃形象锁定);<<<image_3>>> 绑定视频高光截帧(保留画面氛围与光影基调)。按以下顺序构建提示词:
- 双主角锁定:引用 <<<image_1>>> 锁定宠物体表形态(纹理、颜色分布、体型比例),引用 <<<image_2>>> 锁定萌娃面部特征与体型;写明双主角在画面中的位置、姿态与情绪焦点(如"宠物耳朵立起、身体微微后仰,萌娃嘴巴微张双眼放大,两者同时转头对视镜头呆萌僵立")。
- 氛围继承:引用 <<<image_3>>> 继承高光帧的光影基调、场景色温与背景质感(如"暖黄厨房光线,低饱和电影感色调,背景浅焦虚化")。
- 构图与负空间:明确留出大面积干净负空间用于文字叠加(上方或下方,依标题排版需求定)。
- 文字叠加指令:写入片名与金句的精确文字内容、字体风格(如"极简无衬线白色字体,字号大小对比强烈")、排版位置。
- 风格与比例锁定:Hyper-realistic photography, photorealistic CGI creature integrated in real environment, cinematic quality, editorial poster style;比例依视频方向:
- 竖屏视频(9:16) → 主封面为 vertical format (3:4);
- 横屏视频(16:9) → 主封面为 horizontal format (4:3)。
- 负向约束:no watermark, no subtitle, no random captions, no extra text overlay (allow only the confirmed title and tagline), no human in frame except the 萌娃 character, no overhead shot, no floating subjects。
第二轮:尺寸裂变(另外两个比例)
以已确认的主封面为唯一参考图(<<<image_1>>>),仅调整构图裁切与负空间位置以适配目标比例,文字排版风格与内容保持统一,无需重新绑定特写分区或高光截帧:
- 竖屏路径:3:4 主封面 → 裂变 16:9 横版 + 4:3 横图;
- 横屏路径:4:3 主封面 → 裂变 16:9 横版 + 3:4 竖图。
6. 動画編集
轨道结构:
- 视频轨(含内嵌音频):按故事板镜头顺序拼接 POV 视频片段。所有台词、音效均由 Seedance 2.5(分辨率 480p) 内嵌生成,保留视频原生音频轨,不得静音,不得替换为独立配音。
- 禁止调用任何独立音频生成工具(text to narration / text_to_instrumental / lyrics_to_song);整个项目无独立音频层。
剪辑节奏:
- 镜头间优先使用「动势匹配」或「物理遮挡」转场;禁止黑场叠化,除非场景有明确时间跳跃意图。
- 严禁对任何片段进行变速处理,防止音画失同步。
- 多片段拼接时,相邻片段衔接处做 0.1–0.2s 音频交叉淡化,避免声音硬切。
- 响度一致性(多片段必检):合成前检查所有片段整体响度,若相邻片段音量差异明显,须做响度标准化处理,保持整条视频音量感知均衡。
质检清单(合成前逐项确认):
- 双主角是否均完整出现在画面内?如任一缺失,打回对应镜头重新生成。
- 是否有主体漂浮(与接触面无接触阴影)?如有,打回重生成并追加 contact shadow 约束。
- 双主角体型比例是否跨段保持一致?如出现明显体型漂移,打回重生成并在提示词中补充体型比例锚定。
- 是否有形态突变或主体瞬间位移等物理不连贯?如有,打回重生成。
- 视频层是否残留字幕或水印?如有,裁切或重生成处理。
- 片段衔接处音频是否有硬切噪声?如有,补做交叉淡化处理。