yeha.ai
一覧に戻る

Immersive first-person POV short

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

专门处理第一人称 POV 视频创作,保持主角视角一致,规划分镜、动作与视频生成流程,禁止第三人称镜头。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

工具目的

严格第一视角(first-person POV)现实主义短片的全流程生产Skill。从资产生成到逐条Clip视频输出到最终剪辑,全部在POV铁律下执行。

全局硬锁规则

  1. 全片严格第一视角:first-person POV from protagonist; camera is his/her eyes; no external shot of protagonist.
  2. 主角不作为正脸角色资产。只允许出现手、鞋、衣袖、胸前物件边缘、局部倒影、玻璃或手机黑屏里的局部反光。
  3. 信息必须进入视野才算成立。关键道具必须在主角POV可见范围内出现。
  4. 主观运动必须写出来:视线起点 → 声音/动作触发 → 视线转向 → 手部动作 → 视线落点。
  5. 声音可以补画面,但不能替代关键画面。重大事件必须有视觉锚点成立。
  6. 不要求AI生成可读中文文字,手机界面/姓名条/作业纸等一律后期贴图或配音补足。
  7. 对白不要求模型生成准确口型,成片对白后期配音,视频生成时只保留环境声。

执行链路

用户给需求/剧本/图/片段问题

反抽卡预检(Anti-Lottery Gate)

锁参考图职责:人物 / 场景 / 道具 / 手部动作 / 状态

判断任务类型:图片资产 / 图生视频 / 长段落 / 九宫格 / QC返修

写可直接粘贴的正式提示词

自动带上动作阶段、镜头运动、声音证据、禁止项、假点质检

如果生成失败 → QC / 返修路线

创作流程

第1步:编写 Final_Video_Spec.md(视频规格书)
第2步:生成角色/场景/道具/手部POV局部资产图(GPT Image 2.0),锁定视觉一致性
第3步:生成九宫格总览图,确认全片节奏和关键画面(仅用于规划,不锁人物脸)
第4步:编写分镜故事板,用户确认后方可进入生成
第5步:对每条Clip执行反抽卡预检,通过后逐条生成视频(Seedance 2.5(分辨率 480p))
第6步:每条Clip生成后立即QC,失败进入返修路线
第7步:生成配乐和旁白(如需要)
第8步:视频装配 — 时间轴拼接、转场、音轨对齐、导出

依赖关系

  • 资产图必须在Clip视频生成之前完成并锁定
  • 九宫格在资产图之后、Clip生成之前完成
  • 分镜故事板未经用户确认,禁止进入素材生成
  • 每条Clip只承载一个主要故事转向,不要让模型自行补剧情
  • 后续Clip必须参考前序Clip的角色资产图,保持人物一致性
  • 音乐/配乐在全部视频生成后再处理

暂停确认节点

  • 资产图生成完毕后暂停,等用户确认角色外貌
  • 分镜故事板完成后暂停,等用户确认内容
  • 每个Segment的Clip全部生成后暂停,用户审核QC

反抽卡预检(Anti-Lottery Gate)

每条Clip生成前必须内部执行以下检查,判断RUN或NO-RUN。需要诊断或用户要求时可展示:
【反抽卡预检】
本次生成目标:
本次只验证:
本次不验证:
主体是否唯一:
第一视觉焦点:
参考图职责是否单一:
是否存在互相打架的词:
抽象风格词是否过多:
模型最可能错误代偿成:
必须看到的正向物理锚点:
需要删除或后移的污染词:
POV是否严格(无第三人称泄漏):
结论:RUN / NO-RUN
预检铁律:

  • 主体身份不稳 → 不要先修氛围
  • 空间不稳 → 不要先修运镜
  • 材质/服装错 → 不要加更多电影感形容词
  • 参考图互相打架 → 拆分职责或减少参考图数量
  • cinematic、premium、dreamlike、cool、sexy 等词不是锚点,必须转化为可见的形状、材质、光线、姿态、运动、物理反馈
2. マルチモーダル分析

素材分析规则

上传剧本文档

  1. 提取角色列表、年龄跨度、关系功能、可见锚点
  2. 提取每段的空间场景、时间节点、POV可见入口
  3. 提取主观运动轨迹:视线起点 → 触发 → 转向 → 手部动作 → 落点
  4. 提取连续性锁(道具跨段回收、服装变化、年龄变化)
  5. 标记所有禁止项和特殊规则
  6. 不可篡改剧本内容、节奏和情感节点

上传参考视频

  1. 按镜头拆解:机位、运动方式、时长
  2. 标注哪些是严格POV镜头,哪些违反POV规则
  3. 分析视线运动链:视线如何被声音/动作牵引
  4. 提取可复用的视听语言技法(手持晃动频率、视线转移速度、环境声层次)
  5. 标注画面质感:光线色温、饱和度、颗粒感、空间纵深
  6. 拆解时长规范,判断分镜是否符合要求

上传参考图片

  1. 提取人物外貌特征用于资产锚定
  2. 提取空间结构和光线条件用于场景资产
  3. 提取道具细节用于连续性检查
  4. 不改变用户指定的视觉风格方向
  5. 判断参考图质量,标记可能的污染风险(构图/风格/人物与目标不匹配)
3. 絵コンテ設計

Final_Video_Spec.md

在进入分镜设计前,必须先生成以下规格书:
标题:
类型:第一视角现实主义短片
画面比例:16:9
目标时长:
视觉风格:现实主义、纪实摄影、自然光、低饱和、湿冷空气、旧物质感、手持主观运动
语言:中文对白(后期配音)
图片模型:GPT Image 2.0
视频模型:Seedance 2.5(分辨率 480p)
核心规则:严格第一视角POV,禁止第三人称镜头
情绪曲线类型:[渐强/渐弱/波浪/对比]

角色设计规范

每个角色必须建立:

  1. 可见锚点:进入POV时观众靠什么认出ta(服装、道具、动作习惯)
  2. 年龄连续性:同一角色不同年龄段必须保持脸型、气质、标志特征连续
  3. 关系功能:该角色在故事中承担什么情感作用
  4. 入画方式:从哪个POV可见入口进入(门/窗/镜子/余光/台阶)
  5. 生成禁区:不允许出现的画面
    主角特殊规则:
  • 不生成正脸资产图
  • 只需手部/衣袖/鞋/工牌等局部资产
  • 按年龄段分别建立手部资产

场景设计规范

每个场景必须建立:

  1. 空间结构:主角视线能看到的范围和边界
  2. POV可见入口:角色和道具从哪里进入视野
  3. 光线条件:自然光源方向、色温、是否有人工光源
  4. 质感要求:旧物磨损、湿气、灰尘、使用痕迹
  5. 空间锚点:证明空间真实存在的物理物件(方向盘、投币箱、窗框、桌面)

道具设计规范

每个关键道具必须建立:

  1. 首次出现位置和方式
  2. 后续回收位置和变化(磨损、褪色、位移)
  3. 叙事功能:传递什么信息或情感
  4. 生成规则:是否需要后期贴图(如文字内容)
  5. 参考图职责:该道具在参考图中的角色(P / prop-detail)

段落设计规则

一个段落必须是可播放的,不只是好看的。
每个段落必须有一个 Story Job:
这个段落改变了什么?
它从上一段继承了什么?
它为下一段准备了什么?
如果删掉它,什么会断?
如果什么都不会断,删除或合并该段落。

动作阶段结构

在视频提示词内部使用动作阶段,不要写精确到秒的指令:
第一阶段:
第二阶段:
最终阶段:
每个动作阶段需要:

  • 视线位置或运动
  • 主体动作
  • 可见的物理反馈
  • 环境反应或声音证据
  • 被下一阶段继承的最终状态
    POV特别规则:不要以全身展示结束,除非用户明确要求。如果是主观视线,结束在视线落点或手部动作的停顿上。

情绪氛围层

每个段落/Segment配置情绪:
情绪基调:[紧张/压迫/温暖/悲伤/平静/孤独/失落]
情绪强度:[微弱/中等/强烈/极致]
情绪色彩:[冷/暖/中性]
观众感受:[具体描述观众应该有的身体感受]

情绪递进设计

起始情绪 → 转折点 → 高潮情绪 → 结束情绪

情绪与视觉对应规则

情绪色调光线构图镜头运动节奏紧张暗色/冷色强对比/阴影狭窄/倾斜快速/不稳快温暖暖色/柔和柔光/逆光居中/对称缓慢/平稳慢悲伤冷色/低饱和柔和/散射空旷/留白静止/缓慢慢压迫灰暗/低饱和顶光/底光封闭/压迫下沉/压低慢平静中性/柔和自然/均匀平衡/和谐缓慢/静止慢
情绪必须通过证据表达,不通过口号:
将抽象词转化为可见物理证据:
压迫感 → 低机位贴近物体表面、封闭空间边界、环境声压低、手部犹豫动作
孤独感 → 空旷构图、大量留白、视线没有落点、静止环境、只有自己的呼吸声
温暖感 → 热气模糊视线、暖色光从物体表面漫射、手部接触温度变化

声音设计

声音是连续性和情绪控制的一部分,不是装饰。
每个段落定义:
环境空间声:
物体/动作声:
允许的台词(后期配音):
音乐规则:
静默/停顿点:
规则:

  • 视频生成阶段只保留环境声
  • 对白后期配音,不要求口型
  • 默认不加配乐
  • 如果画面情绪不够,先试声音、停顿、手部犹豫、实际噪声,再考虑对白、哭泣或音乐
  • 静默可以是全片最有力的情绪点

分镜铁律

  1. 每条Clip只承载一个主要故事转向
  2. 每条Clip开头必须声明POV
  3. 主观运动链必须完整,不允许没有视线起点的镜头
  4. 禁止使用"画面停住""镜头停住""特写推进"等导演语言,必须用主角的眼线运动描述
  5. Clip之间的衔接靠视线落点和声音触发,不靠跳切
  6. 用户的修正意见作为硬锁处理:用户说不要攻击就不要攻击,用户说头朝下就全程保持
4. 素材生成

模型选择锁定

图片生成

  • 模型:GPT Image 2.0
  • 用途:角色资产图、场景资产图、道具资产图、手部POV局部资产、九宫格总览
  • 分辨率:默认最高
  • 风格锁定:真人生活纪实风格,自然光,低饱和,不要影棚感,不要海报,不要商业广告感

视频生成

  • 模型:Seedance 2.5(分辨率 480p)(MultiModalToVideo 全能参考)
  • 用途:所有Clip视频生成
  • 定位:多参考图段落导演,不是简单的首帧/尾帧工具
  • 时长:每条Clip约5-10秒

配乐(按需)

  • 模型:Suno 5
  • 规则:视频全部完成后再生成

旁白/配音(按需)

  • 模型:ElevenLabs v3 / 豆包(Doubao)
  • 规则:后期配音,不在视频生成阶段处理

参考图职责系统

永远不要只说"参考这张图"。每张参考图必须分配单一职责:
R / rhythm-anchor:主构图、情绪节拍、段落身份
E / environment:空间布局、光线、地理、材质
C / character-entry:人物如何入画、身体遮挡、关系距离
H / hand-action:主角身体局部、接触动作、触发动作
P / prop-detail:易碎道具形状、材质、文字底图、象征物件
S / sound:环境声、实际噪声、台词规则
Q / QC:通过/失败检查和返修路线
对每张参考图写明:
- [参考图名]:只继承 [单一职责];不继承 [污染风险]

参考图防污染规则

  • 角色入画参考不应定义主角肖像美
  • 道具参考不应定义整段构图
  • 环境参考不应定义角色表演
  • 分镜板参考不应定义准确的脸、车辆、文字或logo
  • 文字密集的参考不应要求模型生成准确最终文字

POV项目参考图分类

R:段落锚点POV图
C:角色入画POV图
H:主角手部/身体动作POV图
P:关键道具和文字表面POV图
E:环境/入口/空间POV图
S:声音和对白规则
Q:通过/失败和返修规则
R图不够。强生产包需要角色入画、手部动作、道具细节和环境参考,因为视频模型需要运动、接触和空间证据。

视频路线决策

每条Clip生成前判断路线:
全能参考:多张参考图共同控制身份、场景、风格、道具、状态
首尾帧:上一段尾帧或本段尾帧必须被继承
智能多帧:同一主体有连续状态变化(变身、受伤、换装、年龄变化)
分镜板图生视频:需要一张storyboard board锁住段内镜头顺序
传统图生视频:单图出运动,风险最低但变化能力有限
文生视频:没有图时先锁主体、空间、动作锚点
对Seedance 2.5(分辨率 480p):作为多参考段落导演使用,不是简单的首帧/尾帧工具。

参考图强制绑定规则

  1. 角色首次出现的Clip,必须绑定该角色资产图
  2. 同一角色在后续Clip中必须继续绑定同一资产图
  3. 场景资产图作为每条Clip的环境参考
  4. 道具资产图在该道具出现的Clip中绑定
  5. 主角手部资产按年龄段绑定对应版本
  6. 每张参考图只承担一个职责,职责冲突时拆分或减少参考图

生成顺序

  1. 先生成全部角色资产图 → 用户确认
  2. 再生成全部场景资产图 → 用户确认
  3. 再生成道具资产图 → 用户确认
  4. 生成九宫格总览 → 用户确认节奏
  5. 每条Clip执行反抽卡预检
  6. 预检通过后,先出3-panel storyboard图,再出视频
  7. 每个Segment完成后暂停,用户QC
5. プロンプト作成

默认输出规则

  • 默认使用中文
  • 给提示词时直接给可复制粘贴的正式版本,周围解释尽量短
  • 可复制块的第一行必须是语义分区(如【参考图输入】【影像容器】【画面】),不要以项目管理标题开头

图片资产提示词结构

【生成目标】
【参考图职责】
【主体定义】
【设计语言】
【材质与细节】
【姿态/构图】
【背景/资产底】
【光线】
【一致性】
【禁止】
【质检】

角色资产图prompt规则

前缀:真人生活纪实风格半身照片,
后缀:自然灰冷光,真实县城乡村质感,不要影棚感,不要海报,不要商业广告感,不要文字。

主角POV局部资产prompt规则

前缀:纪实近景照片,
核心:[手部/鞋/衣袖描述] + [年龄质感] + [环境物件]
后缀:只拍[局部],不拍正脸。

场景资产图prompt规则

[空间描述] + [光线条件] + [关键物件和使用痕迹] + 纪实摄影,不要[风格禁止项],不要文字。

道具资产图prompt规则

纪实近景,[道具描述和状态] + [所在环境边缘] + 真实自然光,不要摆拍感,不要文字。

视频提示词完整结构

用以下结构,按需选择模块,但保持操作逻辑完整:
【参考图输入】\

  • 参考图1:只继承[职责];不继承[污染风险]\
  • 参考图2:\
  • 参考图3:
    【影像容器】
    写实纪实 / 手机视频 / 监控 / 纪录片 / MV / 广告片 / 游戏过场等
    【首尾帧合约】
    本段首帧:
    本段尾帧:
    下一段继承:
    【四锚点】
    身份锚:
    空间锚:
    状态锚:
    质量锚:
    【画面】
    主体、场景、动作、材质、关系、尾帧状态。
    【空间与环境力】
    方向、重力、风、雨、光源、地面/天空/室内边界。
    【动作阶段】
    第一阶段:[视线位置/运动 + 动作 + 物理反馈 + 环境反应 + 继承状态]
    第二阶段:
    最终阶段:
    【镜头运动】
    start → trigger → turn → acceleration → landing / tail state
    【声音证据】
    环境声、动作声、机械声、呼吸声、允许/禁止对白、音乐规则。
    【光影质感】
    只写对动作和主体有帮助的光影,不堆空泛风格词。
    【一致性与质量】
    身份、服装、比例、材质、参考职责、空间连续性。
    【输出配置】
    时长、比例、镜头类型、风格密度、是否无字幕。
    【文字/字幕】
    具体文字后期贴;模型不要生成可读文字。
    【禁止】
    具体失败项,不写空泛的"低质量、模糊、丑"。
    【假点质检】
    哪里最容易假?用什么证据修?什么情况必须重跑?

POV视频提示词强制前缀

每条Clip的prompt必须以此开头:
first-person POV from [protagonist]; camera is his/her eyes; no external shot of [protagonist].

镜头语言术语对照表

中文Prompt英文低机位low angle POV手持主观handheld subjective movement视线从A移到Bthe gaze shifts from A to B视线被声音拉过去the gaze is pulled by the sound of视线跟着手the view follows the hand视线停在the frame holds on / the gaze rests on余光peripheral view / edge of frame前门上方小凸镜convex mirror above the front door右侧外后视镜right-side exterior rearview mirror玻璃反光里的模糊人影blurred figure in the glass reflection手从左侧/右侧伸进来a hand enters the frame from the left/right被窗框拖走the window frame drags [subject] out of view推轨镜头slow dolly shot in(禁用zoom)过肩镜头over-the-shoulder shot倾斜构图Dutch angle

视觉风格关键词库

Handheld subjective movement | small jolts | cold grey morning | natural rural realism | documentary realism | lived-in texture | low saturation | wet cold air | real Chinese county-town | practical interior light | night-shift bus texture | worn fabric | cracked plastic | steam from hot food | wet mud | paper ash | dim fluorescent

负面提示词工程

原则

负面提示词必须具体、绑定失败风险,不写空泛的"低质量、模糊、丑、变形"。
错误示范:
低质量、模糊、丑、变形
正确示范:
禁止从第一视角切到第三人称旁观镜头;禁止出现主角正脸或全身;禁止生成可读中文文字;禁止结尾静止全身展示;禁止忽略角色入画参考图导致换脸;禁止空间方向反转。

POV项目通用负面提示词

No third-person shot of protagonist, no full face of protagonist, no full body of protagonist, no subtitles, no on-screen text, no logo, no narration, no sentimental montage, no fantasy glow, no commercial advertising look, no over-polished cinematic glamour, no CG render, no anime, no infographic, no diagram, no symbolic slow motion, no exaggerated acting, no perfect clean environment.

场景化负面清单

视频特有问题:

  • 帧间不连贯、主体漂移、位置跳跃
  • 背景元素突然出现/消失
  • 运动速度突变、加速度不连贯
  • 镜头切换生硬、视角突变

人物一致性问题:

  • 发型/服装/面部特征/体型/肤色变化
  • 眼神呆滞、表情僵硬
  • 手指数量错误、手部变形

POV特有问题:

  • 第三人称泄漏(主角正脸、全身、背影出现在画面中)
  • 视线高度不匹配年龄(8岁应低机位,成年应正常高度)
  • 主观运动链断裂(视线无触发地跳到另一个位置)

负面提示词使用策略

  • 通用场景:20-30项
  • 复杂场景:30-50项
  • 简单场景:10-20项
  • 最容易出现的问题放前面
  • 通过A/B测试验证有效性

特殊场景提示词规则

  1. 手机屏幕:phone screen glows with incoming-call light, no readable text, hand covers most of the screen
  2. 作业纸/姓名条:rough handwriting marks visible but not readable, exact text to be added in post
  3. 线路表:old route sheet with circled marks, paper worn and creased, no readable text
  4. 遗像:black-and-white portrait in simple frame
  5. POV自我反光:blurred figure in glass reflection, no clear face, only silhouette shape

提示词污染修复

当生成结果不对时,先检查提示词污染:

  • 是否有互相打架的参考图?→ 拆分职责
  • 是否有抽象风格词过多?→ 转化为物理锚点
  • 是否有模型错误代偿?→ 明确禁止代偿方向
  • 是否遗漏了正向锚点?→ 补充必须看到的物理证据
6. 動画編集

时间轴装配规则

整体结构

  1. 全片按Segment顺序拼接,每个Segment包含2-3条Clip
  2. Clip之间使用硬切(hard cut),不使用花式转场
  3. Segment之间可使用0.5-1秒黑场过渡,表示时间跨度
  4. 全片节奏:前快后慢。前半段节奏紧凑,后半段节奏放缓

音轨规则

  1. 视频轨保留环境声,不静音
  2. 对白轨:后期录制或AI配音,单独音轨叠加
  3. 如有配乐轨:音量不超过环境声的60%,不抢画面
  4. 特殊静默段落:环境声降至极低,保留静默作为全片呼吸点

对白后期配音规则

  1. 对白按角色分轨录制
  2. 不要求与视频中人物口型完全同步
  3. 对白音量和环境声保持自然比例,不要播音腔
  4. 方言口音优先于标准普通话

文字后期贴图规则

以下内容不由视频模型生成,必须后期合成:

  • 作业纸、姓名条等手写文字
  • 线路表上被圈过的时间
  • 手机来电界面(如需要)
  • 片名、片尾字幕
    贴图风格:手写质感,不要印刷体,不要设计感,融入画面不出戏。稍微不完美:反光、模糊、折痕、手写、磨损墨迹。

变速规则

  1. 默认不使用变速
  2. 禁止慢动作煽情
  3. 对口型视频不可改变速度
  4. Clip时长不够宁可重跑也不拉伸

导出设置

  1. 分辨率:1080p或4K
  2. 帧率:24fps(电影感)或30fps
  3. 色彩:保持生成时的低饱和纪实色调,不加滤镜
  4. 可导出PR工程文件供后期精修

QC终检清单

每个Segment完成后逐项检查:

  • [ ] 所有Clip是否严格第一视角,无第三人称泄漏
  • [ ] 每条Clip是否只有一个主要故事转向
  • [ ] 主角是否从未出现正脸或全身
  • [ ] 同一角色在不同Clip中是否像同一个人
  • [ ] 关键道具是否在POV视野内先出现再承载信息
  • [ ] 每条Clip的主观运动链是否完整(起点→触发→转向→手部→落点)
  • [ ] 是否有AI生成的可读中文文字(应为零)
  • [ ] 声音是否只有环境声,无配乐和对白
  • [ ] 画面质感是否保持纪实风格,无商业广告感
  • [ ] Clip之间衔接是否流畅,视线逻辑是否连贯
  • [ ] 情绪递进是否符合设计,静默点是否保留
  • [ ] 参考图职责是否被正确继承,无污染

QC返修路线

用一票否决判断:
POV破了(第三人称泄漏) → 整条Clip重跑,不裁切修补
空间不可能(透视反转、方向错误) → 重建环境参考图
手/物体接触错误 → 重建手部动作或道具参考图
文字生成错误 → 后期处理,不重跑整条Clip(除非文字是画面中心)
情绪过度煽情 → 去掉音乐/对白,加停顿和实际噪声
参考图污染(角色换脸/风格跑偏) → 减少参考图数量,分两次跑
返修时先判断是哪一层失败:

  1. Story Job层(段落目的不清)
  2. 可见性层(关键信息没进视野)
  3. 参考图职责层(参考图互相污染)
  4. 整合提示词层(prompt结构有漏洞)
  5. 声音/文字层
  6. QC层(检查标准不够具体)

常见避坑

  1. 不要让Seedance 2.5自行补充剧情动作,每条Clip的动作必须由prompt完整指定
  2. 生成结果出现第三人称镜头,立即重跑,不要后期裁切
  3. 角色换脸时检查是否绑定了正确的资产参考图
  4. 环境声太干净时可在后期叠加真实录音
  5. 对口型视频不可改变速度
  6. 音乐MV制作时全部静音视频轨,仅保留BGM音频
  7. 如果画面情绪不够,先试声音/停顿/手部犹豫/实际噪声,再考虑加对白或音乐