yeha.ai
목록으로

Immersive romantic POV interaction

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

打造第一视角沉浸式互动影游体验,以“你的女友 / 男友视角”展开剧情。用户通过选择或自然语言输入设定场景,AI 实时生成对应分支剧情与画面

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

前置检查:
用户须至少提供以下之一,否则立即向用户索取,不得继续执行:

  • 一张参考图(女性人像 / 可爱小动物 / 可爱IP形象,面部或主体清晰),或
  • 一段简短场景文字(如"雨夜漫步"、"居家喂食")。

主体类型判断(有上传图时优先执行):

  • 判断上传图片的主体类型,分为三类:女性人像可爱小动物可爱IP形象(含卡通、毛绒玩具、虚拟角色等)。
  • 若判断主体为男性人像,立即中止,以友好语气告知用户本 Skill 不支持男性主体,请重新上传合适的参考图。
  • 将判断结果写入 Final_Video_Spec.md 的"主体类型"字段,后续所有阶段均依此字段调整生成策略。

完整视频阶段逻辑与依赖关系(严格顺序执行,禁止跨越):

  1. 意图捕获与规格锁定text_editor
    向用户确认以下所有选项:

    • 互动风格( 暧昧灵动/微醺夜色/日常温馨/强势张力)
    • 视频总时长:单段 30s / 30s / 45s / 60s 或自定义秒数(超过 30s 将自动拆分为多个 30s 片段)
    • 画面方向:竖屏(9:16,默认)横屏(16:9)
    • 视频模型:Seedance 2.5(分辨率 480p)(默认,画质更优)** 或 Seedance 2.5(分辨率 480p)(生成更快)**
    • 是否有指定台词或动作
    • 是否上传场景参考图(可选)
      确认后,使用 text_editor 创建 Final_Video_Spec.md,写入:项目名称、互动风格、画面比例、所选模型、语言、视觉基调、POV约束声明(画面内永远只呈现一个主体)、音频策略(所有声音通过视频模型内嵌生成,禁止单独配音)。
      【强制暂停点一】 将规格摘要发给用户确认,等待回复,未收到确认前不得继续。
  2. 女主形象锁定与设定图生成resource_prepare_and_analyze + media_generator

    • 若用户上传了参考图:首先调用 resource_prepare_and_analyze 判断上传图片是否已经是「半身特写 + 三视图」合排格式(即同时包含半身特写与正面/侧面/背面全身三个视图):
      • 是三视图合排格式:直接将该图注册 asset_id,同时将①半身特写分区单独注册 asset_id,全部绑定到 key_element(女主角色元素),无需重新生成
      • 不是三视图合排格式(如单张人像、半身照、生活照等):调用 resource_prepare_and_analyze 提取视觉特征,随后调用 media_generator(ImageToImage,Nano Banana Pro,2K)一次生成「1张半身特写 + 3视图」四图水平合排设定图(①半身特写大图 / ②正面全身 / ③侧面全身 / ④背面全身,纯白背景,实拍人像风格),仅生成此一张合排图,不额外单独生成半身图。将整张设定图注册 asset_id,同时将①半身特写分区单独注册 asset_id,全部绑定到 key_element(女主角色元素)。
    • 若用户仅提供文字描述:调用 media_generator(TextToImage,Nano Banana Pro,2K)直接生成「1张半身特写 + 3视图」四图水平合排设定图,注册方式同上,不额外单独生成半身图。
    • 场景参考图(若用户提供):调用 resource_prepare_and_analyze 提取场景光影与空间特征,注册 asset_id,绑定到 key_element(场景元素)。
      【强制暂停点二】 将角色设定图(含半身特写 + 三视图)发给用户确认,此图为后续所有生成的视觉基准,未确认不得继续。
  3. POV剧本与分镜规划storyboard_designer
    基于已确认的规格与女主形象,设计完整故事板(关键元素、镜头列表)。每个镜头时长默认 30s,多镜头组合为长视频。不设独立音频层,所有声音(台词、环境音、ASMR音效)均嵌入视频提示词由视频模型内嵌生成。
    【强制暂停点三】 输出完整分镜后,邀请用户审查台词与动作编排,等待确认后再继续。

  4. POV视频生成media_generator
    以确认的女主 key_element 设定图(半身特写分区为主、全身正面分区为辅)为主要参考,逐镜头生成视频(MultiModalToVideo,模型依 Final_Video_Spec 所选 Seedance 2.5 版本,480p)。严格执行 POV 单主体约束,生成后自检(见媒体生成部分)。
    【强制暂停点四】 将视频发给用户预览确认后,再进入合成阶段。

  5. 封面企划与信息收集planner【强制暂停点五】
    提供 3–5 个适合社媒平台的标题备选(参考爆款标题法则:引发好奇、代入感共鸣、数据强化等),并附一句金句 / 人设金言。询问用户封面是否需要叠加额外的署名文字(如频道名、账号名),叠加内容须明确告知仅限片名、金句与署名,不支持随机水印或其他额外文字;等待用户确认标题与附加信息后再继续。

  6. 封面图矩阵生成resource_prepare_and_analyze + media_generator【强制暂停点六】
    先调用 resource_prepare_and_analyze 从已生成的 POV 视频片段中提取最具视觉冲击力的高光截帧(构图饱满、女主情绪顶点、光影最优),将截帧发给用户确认;等待用户确认截帧后,根据 Final_Video_Spec 中的画面方向,优先制作与视频比例匹配的主封面:

    • 竖屏视频(9:16) → 优先生成 3:4 竖图(小红书/抖音)作为主封面;
    • 横屏视频(16:9) → 优先生成 4:3 横图(B站/朋友圈)作为主封面。
      女主设定图半身特写分区(①分区)+ 高光截帧为双参考,调用 media_generator(ImageToImage,GPT Image 2,2K)生成主封面,叠入用户确认的片名与金句;主封面发给用户确认后,以主封面为唯一参考裂变生成另外两个比例,共 3 个尺寸覆盖多平台发布需求:
    • 竖屏路径:主封面 3:4 → 裂变 16:9 横版 + 4:3 横图
    • 横屏路径:主封面 4:3 → 裂变 16:9 横版 + 3:4 竖图
  7. 全矩阵社媒宣发文案生成planner
    严格采用「5 段式爆款结构」(引言→故事→情感共鸣→启发→号召行动)撰写抖音、小红书、视频号三平台发布文案,字数 100–300 字,至少 60% 句子押韵,语气积极正向,第一人称叙述,风格与所选互动主题(纯欲娇嗔 / 夜店迷离 / 日常温馨 / 强势挑逗)保持一致。
    抖音/视频号:标题选取以下法则之一(引发好奇、代入感共鸣、利用数据、制造悬念、提供解决方案);文案节奏快,多短句,结尾加话题标签 3–5 个。
    小红书:标题带 emoji,文案更生活化、有温度,结尾引导互动;话题标签 5–8 个,含垂直品类词。
    禁止:禁止出现「AI生成」等破坏沉浸感的表述;禁止负面情绪直接表达;文案须有具体感官细节支撑,禁止套话。

  8. 时间轴合成与交付video_assembler
    按故事板顺序将多个 POV 视频片段拼接合成,处理片段间转场与音量衔接,输出最终成片。

依赖关系: 2→1;3→1,2;4→2,3;5→4;6→5;7→5;8→4。
绝对禁止一次性跑完所有步骤,每个强制暂停点均须等待用户明确确认后方可继续。

2. 멀티모달 분석

主体类型判断(有上传图时最优先执行,结果写入 Final_Video_Spec.md「主体类型」字段):

  • 女性人像:进入标准视觉特征提取流程(见下方第1–5条)。
  • 可爱小动物:提取物种、毛色/纹路、体型比例、面部神态(眼睛大小与形状、耳型、鼻型)、毛发质感,输出为可驱动设定图生成的结构化描述。
  • 可爱IP形象(含卡通、毛绒玩具、虚拟角色等):提取造型风格(写实/卡通/Q版)、主色调与配色方案、标志性外形特征(耳朵、表情、服装道具)、材质质感(布料/塑胶/毛绒),输出结构化描述。
  • 男性人像:立即终止,以友好语气告知不支持,请用户重新上传。

视觉特征提取规范(女性人像适用):

  1. 面部与妆容:识别五官比例、肤色、妆容风格(如"清透伪素颜"、"微醺纯欲妆"、"自然裸妆"),提取关键面部特征(眼型、唇形、眉形、眼角倾向)。
  2. 毛发与发型:识别发型状态(如"微卷湿发"、"空气刘海"、"中分长直发")、发色与发质光泽。
  3. 服装与材质:识别当前可见服装款式与织物纹理(如"粗针织毛衣"、"丝绸吊带"、"宽松白衬衫")。
  4. 光影与色温:推断主光源方向与色温(如"黄金时刻侧逆光"、"窗边柔和漫反射"、"室内低调冷白光"),提取为场景基调描述词。
  5. 情绪基调:判断当前情绪状态(害羞、主动、慵懒、调皮、专注)及与镜头的视线关系(直视/回望/低垂)。
  6. 场景图专项(若为场景参考图):提取空间类型、主光源、色温、景深质感、关键道具与背景元素,输出为可直接写入分镜场景描述的结构化词组。
  7. 空白自动补全:若用户输入极简(如仅有"早安"二字),自动补全感官细节(阳光、床铺、发丝凌乱、慵懒伸展、温热呼吸感),填满 Final_Video_Spec.md 中对应空白字段。

三视图合排格式判断规则(有上传图时优先执行): 判断上传图片是否已为「半身特写 + 三视图」合排格式——即同一张图内同时包含:①半身特写区域、②正面全身、③侧面全身、④背面全身四个分区。若是,输出判断结论「已是合排格式,无需重新生成」,并标注各分区位置;若否,输出「非合排格式,需重新生成设定图」,并进入视觉特征提取流程。

角色设定图生成输入规范: 提取结果须涵盖足以驱动「1张半身特写 + 3视图」四图合排的所有稳定特征——面部锁定描述(可重现的唇形、眼型、肤色词组)+ 发型状态 + 服装完整描述(含颜色、材质、版型、关键细节)+ 主光源基调。该结构化输出直接传递给 media_generator 用于生成①半身特写 / ②正面全身 / ③侧面全身 / ④背面全身四图合排设定图。

文字主题解析规则(输入为纯文本时启用):

  1. 情境类型识别:从关键词判断核心场景类型——"日常温馨"(厨房/沙发/卧室/早安)、"户外浪漫"(街头/海边/林荫道)、"微醺夜色"(KTV/酒吧/夜晚霓虹)、"暧昧灵动"(浴室/卧室夜晚)。
  2. 情绪基调锚定:判断女主预设情绪状态(害羞、主动、慵懒、调皮)及与镜头的视线关系初始状态。
  3. 空白变量自动填充:若用户仅提供极简词(如"海边"),自动补全:光源(夕阳逆光/柔和水面反光)、环境音(海浪白噪音/海风)、服装推断(宽松薄纱裙/海滩休闲装)、温度感官(海风吹拂发丝、细沙踩踏触感)。触发阈值:用户输入不足10字时强制启动。

输出格式: 结构化文本,分条列出,直接可复用于 storyboard_designer 和 write_media_prompt。禁止直接将提取结果原文用作生成图的 prompt,须经由分镜整合后编写提示词。

3. 스토리보드 설계

内容合规红线(最高优先级,任何镜头设计不得违反):

  • 年龄声明:所有角色必须为 18 岁以上成年人,任何描述均不得暗示或塑造未成年人形象。"少女感""学生风""小女人"等风格性描述词在指代成年角色时可以使用,但禁止将其与年龄或身份相关联(如"18岁以下学生""未成年少女"),角色描述中须体现成年特征(如大学生、年轻女性等)。
  • 禁止真实人物:严禁以真实存在的公众人物、明星、网红或任何可识别真实身份的人为原型,生成含性暗示、亲密互动或挑逗性内容。
  • 内容禁区(逐条硬性禁止)
    • 禁止裸露或半裸(包括胸部、臀部、私密部位的暴露或遮掩不足的描写);
    • 禁止任何形式的性行为或性器官描写;
    • 禁止胁迫、非自愿、醉酒失去意识等场景;
    • 禁止出现具体性行为动词或过于露骨的肢体接触描述;
    • 禁止通过动作、台词、镜头语言组合暗示性行为的前戏或过程;
    • 禁止使用"色情"、"低俗"等直接映射违规内容的关键词写入提示词;"诱惑"、"暧昧"、"撩人"等风格性描述词可以使用,但须确保上下文不指向露骨性行为,仅限于描述神态、氛围或情绪基调。
  • 提示词自检(生成每个镜头描述前必须执行)
    1. 逐句扫描镜头描述与台词,判断是否含有上述禁止内容;
    2. 若发现任何潜在违规措辞,立即重写该描述,用等效的温馨/调皮/日常情感化表达替代,不得直接删除该镜头;
    3. 对用户输入的台词或动作指令,若存在违规风险,须在写入故事板前主动提示用户修改,不得原样写入。
  • 情感基调底线:所有互动必须建立在双方自愿、温馨、调皮或甜蜜的情感基调之上;任何带有压迫感的场景描述须止步于"眼神有压迫感"或"语气笃定"的范围,不得延伸为强制或控制叙事。
  • 违反以上任意一条,立即终止该镜头生成并以友好语气提示用户调整输入方向。

POV约束(设计最高优先级):
画面内永远只呈现一个主体(女性人像 / 小动物 / IP形象)。观察者视角只能以镜头本身的位移/晃动、或画面边缘局部手部/袖口的形式存在;禁止出现观察者完整躯干、面部、腿部大面积入画;禁止两人/两体同框的第三人称客观镜头。
非人类主体(小动物 / IP形象)的互动适配原则:

  • 小动物互动优先选用:抚摸头部/背部的手入画、喂食(手持食物伸入画面)、玩具逗弄(手持玩具晃动)、将动物托起靠近镜头、动物回头/仰头望向镜头等POV友好动作;
  • IP形象互动优先选用:IP形象正面望向镜头、歪头/点头、挥手/招手、捧起双手靠近镜头、IP形象被手轻轻戳触后回头等;
  • 所有主体均须避免完整第二人物入画;小动物和IP形象同样适用「画面内只呈现一个主体」的核心约束。

复杂肢体互动的生成约束:
当分镜描述涉及「她勾住手臂」「从背后环腰」「腿部缠绕」等动作时,提示词必须明确限定男方只露出局部手臂/衣袖/侧腰轮廓,并在负向约束中追加:no full male body, no male face, no male legs, no third-person shot,防止模型生成完整第二人物或第三人称视角。

关键元素设计规范:

  • element character(主角):绑定已确认的角色设定图 asset_id(整图)及半身/主体特写分区 asset_id。
    • 女性人像:描述须涵盖面部特征、妆容、发型与服装(含颜色、材质、版型关键细节);若涉及服装切换,分列 Look 1 / Look 2。
    • 可爱小动物:描述须涵盖物种、毛色/纹路、体型比例、面部神态(眼睛形状与大小、耳型、鼻型)、毛发质感;如动物有穿戴饰品或服饰,一并记录。
    • 可爱IP形象:描述须涵盖造型风格(写实/卡通/Q版)、主色调与配色方案、标志性外形特征(耳朵、表情、服装道具)、材质质感(布料/塑胶/毛绒)。
  • element scene(场景):描述空间类型、主光源方向、色温与景深基调(如"林荫步道,午后斑驳阳光,背景虚化街道")。若用户提供了场景参考图,绑定对应 asset_id 并保持描述与图片一致。
  • 声音设计内嵌于镜头描述:所有台词、环境音、ASMR音效均在每个镜头的声音设计栏中逐秒标注,不设独立音频层,全部由视频模型内嵌生成。

四大风格分镜矩阵:

  1. 暧昧灵动:高调柔光,浅色系服装。欲拒还迎,小动作密集(咬唇、撩发、眼神躲闪后上扬直视)。声音轻柔气声,句尾上扬。
  2. 微醺夜色:低调暗光,高饱和反光材质。慵懒自信,持续直视镜头。动作幅度克制而精准。
  3. 日常温馨:暖色调,生活化场景(厨房操作台、沙发扶手、浴室镜前)。自然互动(喂食、靠肩),笑容有真实弧度与眼纹。
  4. 强势张力:高对比冷暖分割光,深色服装。主动向镜头逼近,眼神具压迫感。声音压低,语速放缓,语气笃定。

镜头节奏结构(起承转合,适用于单支30s片段):

  • 起(0–2s):建立环境与人物初始状态,女主察觉到镜头(POV视角观察者)。
  • 承(2–5s):产生互动契机,第一阶段互动(开口说话、轻微肢体动作、眼神拉丝)。
  • 转(5–10s):情绪升温,男友视角以画外音或局部肢体介入(如手伸入画面边缘轻触面颊/拨发)。
  • 合(10s–结尾):达到亲密顶点(极度靠近镜头、依偎、台词收尾),留有情绪余韵。

每个镜头描述必须包含:

  • 场景元素ID引用
  • 逐秒时间线(格式:Xs – Xs:【动作标题】画面描述 + 声音设计),时间精确到0.5s
  • 镜头语言(景别、角度、运动方式)
  • 微表情与肢体细节(见下方索引)
  • 确切台词(如有)及对应ASMR/环境音描述

微表情与肢体语言索引(供镜头描述调用):

  • 眼部:眼神拉丝、瞳孔微扩、视线先躲闪后缓慢回望、睫毛微颤、眼尾轻微上扬。
  • 唇部:轻咬下唇、嘴角单侧微勾、嘟嘴、唇部微张后闭合。
  • 肢体:身体重心前倾靠近镜头、用指尖虚挡镜头、单手撩拨刘海、慵懒侧卧将头靠向镜头方向。

关系预设(全局默认,适用所有场景):
女主角色默认与观察者(镜头视角)处于热恋同居关系——两人住在同一空间,日常共同生活。场景设计须符合此前提:无论是早晨起床、做饭、下班回家、夜晚入睡,双方都在同一屋檐下,禁止设计「各回各家」「道别下楼」「送出门外」等暗示非同居关系的结局或场景。若用户未说明特殊情境,所有生活化场景均以同居视角展开。

长视频多片段规划:
若用户选择视频总时长超过30s,在拆分分镜前必须先完成完整剧情策划,确保多片段之间逻辑贯通、情绪递进合理:

剧情策划规范(多片段必须执行):

  1. 时间线锚定:明确整条视频发生在哪个时间段(如「傍晚下班回家 → 做饭 → 饭后沙发」),确保片段间时间流向自然,不得出现时间倒退或无法解释的场景跳跃。
  2. 情绪弧线设计:规划从第一片段到最后一片段的情绪变化曲线(如「轻松日常 → 撒娇升温 → 亲密顶点」),每片段的情绪节奏在整体弧线中有明确位置,不得每片段情绪独立重置。
  3. 动作/状态连续性检查:相邻片段间的服装、发型、场景道具须保持逻辑连贯(如第一片段穿外套回家,第二片段应已换居家服,不得凭空出现服装跳变);若有合理的状态变化,须在分镜描述中给出动因(如「在片段衔接处女主已换上家居服」)。
  4. 剧情策划输出格式:在输出完整分镜前,先向用户呈现一份简明的「剧情大纲」——包含各片段的时间节点、场景、核心动作与情绪关键词,经用户确认后再展开逐秒分镜细节。

将完整叙事拆分为多个独立镜头(每镜头≤30s)。规划注意事项:

  • 每个镜头为完整的起承转合单元,默认一镜到底;仅当剧情有明确的时间跳跃或场景切换需求时允许段内切镜,且每段内切镜不超过 1 次;
  • 在镜头描述中注明与前后片段的衔接动势(如"延续前片段牵手动作,以回眸开场"),便于后续以 start_frame 保持主体连续性;
  • 片段间衔接允许合理的场景/机位变换,只要主体形象一致即可。

生活化场景库(供镜头场景设计调用):

  • 室内亲密:沙发打游戏、床上慵懒相拥、厨房做饭被捣乱、浴室镜前擦头发、书桌前被打扰学习。
  • 户外动态:阳光下奔跑追逐、草地打闹嬉戏、林荫步道牵手漫步、商场试衣等待、雨夜街头遇见。

情绪表现库(供微表情与台词设计调用):

  • 慵懒:眼神迷离、肢体柔软、声音带鼻音、动作迟缓拖沓。
  • 快乐/开心:笑容明媚、动作轻快、清脆笑声、眉眼弯弯。
  • 可爱/撒娇:嘟嘴、歪头约5–10°、小动作丰富(扯袖子、踮脚)。
  • 生气/假生气:脸颊轻鼓、假装不理人、视线别开后偷瞄、轻锤画面边缘男友手臂。

亲昵互动库(供动作链编排调用):

编排原则: 动作链中触碰脸部(捏脸/摸脸/轻抚下巴)和贴耳低语是最常见的 AI 生成失误高发区,大量重复使用会显得单调。每条分镜优先从以下多元互动方式中选取,同一段视频内同一动作类型不超过 1 次。

  • 基础触碰:牵手/十指相扣、摸摸头/揉乱发型、轻捏肩膀、拢住腰间、手指轻戳她手心、轻触手腕内侧、指腹轻划她小臂内侧皮肤。

  • 日常生活互动:递给她一杯饮料、帮她整理衣领或项链、递零食/对方咬一口、拉着她的手腕转身、帮她理顺被风吹乱的发丝(手拨而非贴脸)、帮她扣上或解开外套扣子、把她头上的帽子歪着戴好/故意戴歪、拉住她的包带让她停下来。

  • 肢体缠绕:她勾住镜头方向的手臂往前拉、双手捧住镜头(你的手)贴在脸侧(非遮脸)、头靠向镜头肩膀方向蹭一下、两人手指交扣并轻轻收紧、她单手攥紧镜头方向的衣袖不放、她将脸埋进镜头(胸口/颈侧)方向后慢慢抬起头。

  • 深度亲昵:拥入怀中(镜头微俯视她靠近的过程)、镜头极度贴近至轻微失焦(模拟亲吻,嘴唇将触未触)、她仰头向上凑近镜头后微微后缩浅笑、她从背后环住镜头方向的腰(视角向下可见她双臂)、她单腿搭在镜头方向的腿上慵懒交叠、她躺在镜头方向的腿上仰视对话(膝枕视角)。

  • 游戏与互动小动作:喂她一口食物(她凑上来咬)、她用手指在镜头方向的手背上写字/画圈、她突然抢走镜头方向手里的手机或物品然后举高藏起来、她转过身去假装不理人,背对镜头偷偷回望、她伸出手指比个"嘘"的手势靠近嘴唇(保密感/撩拨感)、她手持饮料吸管轻点镜头方向的鼻尖。

  • 衣物与材质互动:她拉扯自己毛衣下摆或帽子抽绳来掩饰害羞、她把过长的袖子(毛衣爪)捂住半个手掌然后伸向镜头方向、她整理裙摆时手指在腿侧轻轻拂过、她解下围巾的动作(丝绸/羊绒滑落的声音)。

  • 特别注意:贴耳低语场景(呢喃/气声台词)在整段视频中最多使用 1 次,且须配合明确的场景动机(如周围人多、秘密对话),禁止多次重复。

  • 镜头物理禁区:禁止出现「用手指/手掌虚挡镜头」「凑近镜头对着镜头呼气/哈气」等动作——前者容易让模型生成遮挡画面的手部特写,后者易触发模型生成模糊失焦画面或违规内容;如需表达"羞涩遮挡"或"亲近感",可改用「低头/侧头/用头发遮住半张脸」「靠近但视线斜下方」等替代动作。

  • 对白昵称参考库(台词中称呼镜头方向时优先从此选取,避免频繁使用"男朋友"等过于书面的表达):

  • 日常甜蜜系:宝宝、宝、亲爱的、老公、老公大人、哥

  • 撒娇卖萌系:人家的宝、坏蛋、臭宝、笨蛋

  • 昵称使用原则

  • 全片昵称一致性(最高优先级):整条视频(含所有片段)只能使用同一个昵称体系,禁止在不同片段中混用不同系列昵称(如同一条视频里既叫"老公"又叫"哥哥"会造成人设混乱,必须在规格锁定阶段确认后全程统一);

  • 同一段视频内同一昵称不超过 2 次,避免重复疲劳;

  • 昵称应与当下互动情绪匹配(如"爸爸"适合强势挑逗或娇嗔反差场景,"老公"适合日常温馨与撒娇场景);

  • 禁止在正式/平静对话中突然切换高反差昵称,需有情绪铺垫。

特殊空间关系(需在镜头描述中明确使用):

  • 平视互动:面对面坐立,视线齐平,眼神拉丝。
  • 俯视/压制视角:镜头俯视女主仰躺脸庞,或她被按在沙发靠背上微微抬头。
  • 仰视/依偎视角:女主蜷缩在镜头(怀里)下方,镜头向下俯看她毛茸茸的发顶与侧脸。
  • 骑坐/缠绕视角:女主骑坐时修长双腿跨于镜头两侧(仅腿部入画),或双腿夹住男友腰部(POV只见腿部轮廓)。
4. 미디어 생성

主角形象资产生成(设定图):
依据 Final_Video_Spec.md 中的「主体类型」字段,选择对应生成策略:
【女性人像】 生成格式为「1张半身特写 + 3视图」四图水平排列在同一张图内,纯白背景,实拍人像风格(Hyper-realistic portrait),禁止动漫/插画风。四个分区从左到右依次为:

分区内容构图要求①半身特写(左大图)面部+上半身特写,占整张图约40%宽度面部占画幅上2/3,锁定五官、肤色、妆容、发型,眼神直视镜头②正面全身完整全身站立正视图头顶至脚底完整入画,服装、鞋、配件完整可见③侧面全身完整全身侧视图(左侧面或右侧面)轮廓线清晰,发型侧面形态可见④背面全身完整全身背视图发型背面、服装背面细节完整

  • 无参考图时:使用 TextToImage,模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K,直接一次生成上述四图合排的设定图
  • 有参考图时
    • 若上传图片已是「半身特写 + 三视图」合排格式直接注册,无需重新生成
    • 若上传图片不是合排格式:使用 ImageToImage,模型 Nano Banana Pro,2K,一次生成上述四图合排设定图
  • 设定图整体注册一个 asset_id,同时将①半身特写分区单独注册 asset_id(用于后续视频生成时的 reference_image 输入),全部绑定到 key_element(女主角色元素)。

【可爱小动物】 生成格式为「1张主体特写 + 3视图」四图水平合排,纯白背景,超写实摄影风格(Hyper-realistic photography)。四个分区:①左侧大幅头部/躯干特写(占整图约40%宽度,锁定毛色、眼睛、面部细节)、②正面全身、③侧面全身、④背面全身。

  • 无参考图时:使用 TextToImage,模型 Nano Banana Pro,2K,一次生成四图合排设定图。
  • 有参考图时:判断是否已为合排格式——是则直接注册;否则使用 ImageToImage,模型 Nano Banana Pro,2K,一次生成四图合排设定图。
  • 整图注册 asset_id,①特写分区单独注册 asset_id,绑定到 key_element(动物角色元素)。

【可爱IP形象】 生成格式为「1张正面特写 + 3视图」四图水平合排,纯白背景,保持原始风格(写实/卡通/Q版均依原图风格还原)。四个分区:①左侧大幅正面特写(占整图约40%宽度,锁定造型配色与标志性外形特征)、②正面全身、③侧面全身、④背面全身。

  • 无参考图时:使用 TextToImage,模型 Nano Banana Pro,2K,一次生成四图合排设定图。
  • 有参考图时:判断是否已为合排格式——是则直接注册;否则使用 ImageToImage,模型 Nano Banana Pro,2K,一次生成四图合排设定图,保持原IP风格不得偏移。
  • 整图注册 asset_id,①特写分区单独注册 asset_id,绑定到 key_element(IP角色元素)。

所有类型通用:

  • 场景参考图(若用户上传):注册 asset_id,绑定到 element scene。
  • 设定图确认后,①特写分区 asset_id 作为后续视频生成的主要 reference_image 输入。

POV视频生成:

  • 生成路径MultiModalToVideo,模型依 Final_Video_Spec 所选版本执行:
    • Seedance 2.5(默认,480p,画质更优)
    • Seedance 2.5(480p,生成更快,适合快速预览)
  • 画面比例:依 Final_Video_Spec 所选方向执行:竖屏9:16 或 横屏16:9;分辨率固定 480p
  • 每个镜头默认时长 30s(MultiModalToVideo 支持最长30s);若分镜设计明确需要更短片段,可按分镜时长生成,但不超过30s。
  • 参考输入:以角色设定图中的半身特写分区作为主要 reference_image(面部一致性最优);若剧情需要全身服装参考,可同时附上正面全身分区图;有场景参考图时一并传入。
  • 多段视频连续性(长视频专用):当视频总时长超过 30s、由多个片段组成时,从第二段起须执行以下操作:
    1. 首帧锁定:调用 resource_prepare_and_analyze 提取上一段视频的最后一帧作为 start_frame(首帧参考图),输入到当前段的生成中,确保人物姿态、服装状态与画面环境无缝衔接;
    2. 音频氛围延续:将上一段内嵌音频末尾片段作为 reference_audio 输入,保持声音氛围连续(Seedance 2.5(分辨率 480p) 与 Seedance 2.5(分辨率 480p) 均支持音频参考输入);
    3. 镜头切换:每段内部默认一镜到底,优先保持连续镜头;仅当剧情有强烈转折需求时(如明确的时间跳跃或场景切换)才允许段内切镜,且每段切镜次数不超过 1 次。片段间衔接以 start_frame 保证主体连续性即可,不要求强制同一机位。
    • 单段独立视频(≤30s)不需要此操作。
  • 提示词跨片段延展(长视频必须执行):从第二段起,生成提示词前须先调阅上一段的完整视频提示词,在以下维度保持延续性并做剧情向前推进:
    1. 镜头运动延续:如上一段以推进镜头收尾,本段优先以同向镜头或自然接续的运镜方式开场,不得突然切换到完全矛盾的运镜逻辑;
    2. 女主状态延续:服装、妆容、发型、情绪弧线须与上一段末尾状态衔接,不得无故改变(除非分镜明确标注了时间跳跃);
    3. 声音氛围延续:台词语气、音量感知层级、环境音类型须与上一段保持一致风格,不得忽高忽低;
    4. 叙事向前推进:本段提示词须体现情节或情绪的递进,不得重复上一段的动作或台词节拍。
  • 所有音频由视频模型内嵌生成,禁止调用任何独立音频生成工具(text to narration / text_to_instrumental / lyrics_to_song)。 台词、环境音、ASMR音效均通过提示词中的 Seedance 2.5 音频包装符传入模型。
  • POV单主体自检规则:生成后确认画面内无第二个完整人物;如有,打回重新生成并在提示词中追加约束(见 Write the Prompt 负向约束)。

封面图矩阵生成:

  • 主封面(优先比例由视频方向决定):从已生成的 POV 视频片段中调用 resource_prepare_and_analyze 提取最具视觉冲击力的一帧(构图饱满、女主情绪顶点、光影最优)作为高光截帧,将截帧发给用户确认,等待用户明确确认后再继续;以角色设定图半身特写分区(①分区) + 该高光截帧为双参考,调用 ImageToImage(GPT Image 2,2K),叠入用户确认的片名与金句文字;要求人像清晰,留出大面积干净负空间用于文字排布,背景无字幕/水印。
    • 竖屏视频(9:16) → 优先生成 3:4 竖图(小红书/抖音)作为主封面;
    • 横屏视频(16:9) → 优先生成 4:3 横图(B站/朋友圈)作为主封面。
  • 裂变尺寸:主封面发给用户确认后,以主封面为唯一垫图,裂变生成另外两个比例,风格与文字排版保持统一:
    • 竖屏路径:3:4 主封面 → 裂变 16:9 横版 + 4:3 横图
    • 横屏路径:4:3 主封面 → 裂变 16:9 横版 + 3:4 竖图
  • 文字叠加规则:封面图只允许叠入用户确认的片名与金句;禁止出现任何其他文字、水印、随机字幕。
  • 负向约束:no watermark, no subtitle, no random captions, no extra text overlay (allow only the confirmed title and tagline), no anime, no illustration。
5. 프롬프트 작성

【最高优先级:所有 Prompt 正文必须用中文书写;模型名称、英文参数标签、负向约束词保留英文。】

一、图像生成提示词(TextToImage / ImageToImage)——角色设定图专用
角色设定图采用「1张主体特写 + 3视图」四图水平合排格式,一次生成。依据 Final_Video_Spec.md 中的主体类型,按以下对应规范构建提示词:

【女性人像】

  1. 布局声明:"纯白背景,四图水平排列,从左到右依次为:①左侧大幅半身特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身"。
  2. 主体锁定:面部特征、妆容、发型与服装(逐一具体描述,禁用抽象形容词,转化为可见视觉细节;服装须写明颜色、材质、版型与关键配件)。
  3. 各分区构图:①半身特写:面部占画幅上2/3,眼神直视镜头;②正面全身:头顶至脚底完整入画;③侧面全身:完整侧视轮廓;④背面全身:服装背面细节完整可见。
  4. 光影:纯白背景,柔和均匀环境光,无强方向阴影。
  5. 风格锁定:Hyper-realistic photography, photorealistic, cinematic quality, 8K resolution。
  6. 负向约束:no text, no watermark, no logo, no extra person, no anime, no illustration, no colored background。

【可爱小动物】

  1. 布局声明:"纯白背景,四图水平排列,从左到右依次为:①左侧大幅头部/躯干特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身"。
  2. 主体锁定:物种、毛色/纹路(精确到颜色分布区域)、体型比例、头部神态(眼睛大小与形状、耳型、鼻型)、毛发质感;若有穿戴饰品或服饰一并描述。
  3. 各分区构图:①特写:头部与躯干前段清晰可见,眼睛直视镜头;②正面全身:四肢完整入画;③侧面全身:体型轮廓与尾部可见;④背面全身:背部纹路与尾部细节完整。
  4. 光影:纯白背景,柔和均匀环境光,毛发质感清晰。
  5. 风格锁定:Hyper-realistic photography, photorealistic, studio shot, 8K resolution。
  6. 负向约束:no text, no watermark, no logo, no extra animal, no human, no colored background。

【可爱IP形象】

  1. 布局声明:"纯白背景,四图水平排列,从左到右依次为:①左侧大幅正面特写(占整图约40%宽度),②正面全身,③侧面全身,④背面全身"。
  2. 主体锁定:造型风格(写实/卡通/Q版,须与参考图一致)、主色调与配色方案、标志性外形特征(耳朵、表情、服装道具)、材质质感(布料/塑胶/毛绒)。
  3. 各分区构图:①正面特写:造型配色与标志性细节清晰可辨;②正面全身;③侧面全身;④背面全身。
  4. 光影:纯白背景,均匀漫反射光,轮廓清晰无硬阴影。
  5. 风格锁定:依原始风格填入(如 Hyper-realistic toy photography / Flat cartoon style / Chibi illustration),8K resolution;禁止在提示词中写入与原图风格矛盾的风格词
  6. 负向约束:no text, no watermark, no logo, no extra character, no colored background, no style mismatch。

二、视频生成提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))
严格按照【镜头运动 → 女主表演 → 空间变化 → 音频】顺序组织,中文正文,Seedance 2.5包装符保留英文标点:

  1. 镜头运动:描述摄像机起始状态与运动趋势(如"镜头从胸口高度缓慢向上推近至面部特写,保持轻微手持微抖")。
  2. 女主表演(核心密度最高):按时间顺序逐个动作展开,附程度副词,精确到身体部位(如"她缓缓抬起眼帘,视线从稍低处慢慢移至正对镜头,睫毛微颤一下,嘴角右侧微微上勾约3毫米,随后轻咬下唇")。
  3. 空间与背景:描述背景变化或环境光变化(如"身后窗外光线随风轻柔晃动,浅焦奶油色墙壁")。
  4. 音频(Seedance 2.5包装符)
    • 台词用 {中文台词内容} 包裹,每句台词花括号紧跟「(无字幕)」,格式示例:{宝,你今天怎么这么早回来}(无字幕);
    • 环境音效用 <音效描述> 包裹(如 <轻柔呼吸声,羽绒织物轻微摩擦声>);
    • 背景音乐用 (音乐风格描述) 包裹(视频层通常不内置音乐,写 no music);
    • 屏幕字幕用 【字幕内容】 包裹(通常留空,后期处理)。

负向约束(视频,必须包含):no subtitles, no music(视频层不内置,除非明确需要), no text, no logo, no second person in frame, no full male body, no male face, no male legs, no third-person shot。

POV约束强化(视频提示词结尾必须追加)
"第一人称主观视角,画面内只呈现一名女性主体,男性视角以镜头本身或画面边缘局部手部/袖口形式存在,禁止出现男方完整躯干、面部、腿部大面积入画,禁止第三人称客观视角。"

三、封面图提示词(ImageToImage / GPT Image 2)
封面图生成分两轮,提示词结构如下:

第一轮:主封面(比例由视频方向决定)
双参考输入:<<<image_1>>> 绑定女主设定图中的半身特写分区(面部特征与妆造锁定精度最高);<<<image_2>>> 绑定视频高光截帧(保留画面氛围与光影基调)。按以下顺序构建提示词:

  1. 人物锁定:引用 <<<image_1>>> 锁定女主面部特征、妆容、情绪状态,描述人物在画面中的位置与姿态。
  2. 氛围继承:引用 <<<image_2>>> 继承高光帧的光影基调、场景色温与背景质感(如"暖黄逆光,低饱和电影感色调")。
  3. 构图与负空间:明确留出大面积干净负空间用于文字叠加(上方或下方,依标题排版需求定)。
  4. 文字叠加指令:写入片名与金句的精确文字内容、字体风格(如"极简无衬线白色字体,字号大小对比强烈")、排版位置。
  5. 风格与比例锁定:Hyper-realistic photography, cinematic quality, editorial poster style;比例依视频方向:
    • 竖屏视频(9:16) → 主封面为 vertical format (3:4)
    • 横屏视频(16:9) → 主封面为 horizontal format (4:3)
  6. 负向约束:no watermark, no subtitle, no random captions, no extra text overlay (allow only the confirmed title and tagline), no anime, no illustration, no second person。
    第二轮:尺寸裂变(另外两个比例)
    以已确认的主封面为唯一参考图(<<<image_1>>>),仅调整构图裁切与负空间位置以适配目标比例,文字排版风格与内容保持统一。无需重新绑定高光截帧:
  • 竖屏路径:3:4 主封面 → 裂变 16:9 横版 + 4:3 横图
  • 横屏路径:4:3 主封面 → 裂变 16:9 横版 + 3:4 竖图

四、感官词汇参考库(高密度填充时调用)
摄影机与运镜语言:

  • 视角锚定:First-person boyfriend POV, Subjective camera, Direct eye contact
  • 运镜方式:手持摄像机轻微晃动 (Slight handheld camera shake)、缓慢推镜头 (Slow push-in)、焦点转移 (Rack focus)、镜头呼吸效应 (Lens breathing)、跟随步行的自然晃动 (Handheld walking tracking shot)
  • 画质质感:电影级质感 (Cinematic texture)、胶片颗粒感 (Film grain)、业余Vlog感 (Amateur Vlog aesthetic)、动态模糊 (Motion blur)、镜头光晕 (Lens flare)、高ISO噪点 (High ISO noise)

光影与色彩氛围:

  • 自然光:黄金时刻逆光 (Golden hour backlight)、窗外柔和漫反射 (Soft diffuse light from window)、树叶缝隙斑驳光斑 (Dappled light through leaves)、阴雨天冷色调 (Rainy day cold tone)
  • 人造光:卧室暖色床头灯 (Warm bedside lamp)、电视屏幕幽蓝反光 (Blue glow from TV screen)、赛博朋克霓虹灯 (Cyberpunk neon lights)、昏暗KTV镭射光 (Dim KTV laser lights)
  • 光效:轮廓光 (Rim light)、丁达尔效应 (Tyndall effect)、面部柔光 (Soft facial lighting)、湿润地面倒影 (Reflections on wet ground)

ASMR与声音设计:

  • 环境音:窗外淅沥雨声 (Pattering rain)、城市远处白噪音 (Distant city white noise)、冰块碰撞玻璃声 (Ice clinking in glass)、户外微风树叶沙沙声
  • 物理摩擦音:纯棉衣物摩擦沙沙声 (Rustling cotton fabric)、丝绸滑落声 (Silk slipping)、粗针织毛衣摩擦声、指腹划过发丝的微小摩擦声
  • 人声细节:贴耳呢喃 (Whispering close to ear)、清晰呼吸声 (Clear breathing sounds)、喉咙里的轻哼 (Soft hum)、清脆亲吻声 (Crisp kissing sound, 'muah')
6. 동영상 조립

轨道结构:

  • 视频轨(含内嵌音频):按故事板镜头顺序拼接 POV 视频片段。所有台词、ASMR音效与环境音均由 Seedance 2.5(分辨率 480p) / Seedance 2.5(分辨率 480p) 内嵌生成,保留视频原生音频轨,不得静音,不得替换为独立配音
  • 禁止调用任何独立音频生成工具(text to narration / text_to_instrumental / lyrics_to_song);整个项目无独立音频层,合成器只负责拼接与音量衔接,不叠加外部音轨。

剪辑节奏:

  • 镜头间优先使用"动势匹配"或"物理遮挡"转场;禁止使用黑场叠化,除非场景有明确时间跳跃意图。
  • 严禁对任何片段进行变速处理,以防音画失同步。
  • 多片段拼接时,相邻片段衔接处做 0.1–0.2s 音频交叉淡化,避免声音硬切。
  • 音量一致性(多片段必检):合成前检查所有片段的整体响度,若相邻片段音量差异明显(如一段声音很大、下一段极小),须在时间轴上做响度标准化,保持整条视频音量感知均衡;禁止忽略此项直接拼接输出。

质检清单(合成前逐项确认):

  1. 画面内是否出现第二个完整人物?如有,打回对应镜头重新生成。
  2. 是否有服装突变或人物瞬间位移等物理不连贯?如有,打回重生成。
  3. 视频层是否残留字幕或水印?如有,裁切或重生成处理。
  4. 片段衔接处音频是否有硬切噪声?如有,补做交叉淡化处理。