yeha.ai
一覧に戻る

Taiwanese-accent short drama

スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。

适用于剧情短片/微电影创作(10秒-10分钟)。用户上传灵感或剧本,AI自动扩展剧本、设计角色与场景、生成多机位手持风格分镜,全程使用Seedance 2.5原生音频+台湾腔配音,无BGM无字幕,每阶段用户确认后推进。

制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。

制作フロー全文

1. 制作計画

全流程阶段逻辑与依赖关系

每个阶段完成后必须暂停,等待用户明确确认后再进入下一阶段。禁止自动连续推进。

阶段 0 — 输入解析与故事方向锁定

  1. 接收用户输入,判断类型:
    • 完整剧本(含场景、对话、动作指示)→ 直接解析,不做大改动
    • 灵感/一句话想法 → 自动扩展为有头有尾、对话紧凑的剧本(每3-5秒至少一句台词,有起承转合),标注"已自动扩展,请核实"
    • 无任何内容 → 提示:"请上传一段故事想法、灵感或完整剧本"
  2. 若用户上传参考素材(图/视频/文档),调用 resource_prepare_and_analyze 解析,结果写入后续 element 设计使用
  3. 锁定基础参数(时长、类型、情感基调)
  4. 通过 text_editor 建立 Final_Video_Spec.md,写入:片名、类型、预估时长、画面比例(16:9)、分辨率(480p生成/1080p超分)、帧率(24fps)、风格基调、语言(台湾腔普通话)、配音规则(Seedance 2.5 原生音频、无BGM、无字幕)
  5. 暂停,展示故事梗概与基础参数,等待用户确认后继续

确认选项:A. 确认进入角色设计 | B. 调整时长 | C. 修改故事方向

阶段 1 — 角色设计与 element character 生成

  1. 根据剧本角色列表,为每个角色设计外貌、年龄、服装、音色层级(青年女声/青年男声/中年/老年)
  2. 若用户已提供角色参考图,直接使用 ImageToImage(Nano Banana Pro)以参考图为基础生成四视图;若无参考图,先以 TextToImage 生成初版角色图,再用 ImageToImage 基于初版补全其他视角
  3. 四视图规格:16:9横版纯白底,左侧胸像特写,右侧正/侧/背三视图全身立绘并排
  4. 将生成的角色图注册 asset_id,绑定至对应 element character
  5. 暂停,展示所有角色版,等待用户确认后继续

确认选项:A. 全部确认进入场景设计 | B. 修改某角色(请说明)| C. 重新生成某角色

阶段 2 — 场景设计与 element scene 生成

  1. 根据剧本场景列表,为每个主要场景设计空间结构、光影类型、道具、群众行为(≥3种不同行为)
  2. 调用 media_generatorImageToImage(Nano Banana Pro)生成多机位场景参考图;若无任何参考,以 TextToImage 生成初版
  3. 将生成的场景图注册 asset_id,绑定至对应 element scene
  4. 暂停,展示所有场景版,等待用户确认后继续

确认选项:A. 全部确认进入分镜设计 | B. 修改某场景(请说明)| C. 重新生成某场景

阶段 3 — 分镜设计

  1. 调用 storyboard_designer 将剧本逐 shot 转化为分镜,每 shot 7-15秒,包含全部强制字段(详见 Storyboard Designer 规范)
  2. 若剧情需要旁白VO,设计 narration 类型 audio_layer(使用 text to narration 工具生成,在此阶段标注 narration_speaker_profile 与完整旁白文本);不设计任何 music/BGM audio_layer
  3. 分镜表完成后执行分镜质检清单(见 Storyboard Designer 第八节),不合格项标注并修正
  4. 暂停,展示完整分镜表,等待用户确认后继续

确认选项:A. 全部确认进入样片生成 | B. 修改某镜头(请说明)| C. 调整整体节奏

阶段 4 — 样片生成(1-2个关键情绪镜头)

  1. 选取1-2个情绪最强的关键 shot,调用 media_generatorMultiModalToVideo(Seedance 2.5)先行生成样片
  2. 样片检查项:运镜是否符合规则、手持呼吸感是否明显、台湾腔配音是否自然、口型与音频同步误差≤0.05秒
  3. 不符合运镜规则 → 自动重试1次;仍失败则标记警告,提示用户可接受或跳过
  4. 暂停,展示样片,等待用户确认样片方向后继续

确认选项:A. 确认方向进入完整生成 | B. 修改(请说明)| C. 重新生成样片

阶段 5 — 完整短片生成与质检

  1. 按分镜顺序逐一调用 media_generatorMultiModalToVideo(Seedance 2.5)生成所有 shot 视频
  2. 若有 narration audio_layer,调用 text to narration 生成,按时间轴对齐
  3. 所有媒体就绪后,调用 video_assembler 拼接为完整短片(1920×1080超分后24fps,无BGM,无字幕)
  4. 执行最终质检清单(见下),标记不合格项,提示用户是否接受或重新生成对应 shot
  5. 暂停,展示成片与质检报告,等待用户最终确认后输出

确认选项:A. 确认下载成片 | B. 重新生成某 shot | C. 整体调整

最终质检清单(阶段5导出前必检)

  • 每个 shot 是否都有运动(无固定机位超过1.5秒)?
  • 每个 shot 是否有手持呼吸感(垂直±2-3像素,水平±1像素)?
  • 是否使用≥4种机位角度?
  • 是否避免正景偏转不足(需≥15°)/无角度无运动中景/简单匀速推拉/定止正面拍/稳定器平滑运动?
  • 推拉镜头是否都有S形加减速曲线?急推/急拉是否有惯性过冲(0.1秒)?
  • 特写是否全部有情绪动机?
  • 每个 shot 是否7-15秒?同场景 shot 时长差异是否≤±3秒?
  • 相邻 shot 是否不同角度、不同景别?光轴夹角是否≥30°?
  • 镜头衔接是否有动作/视线匹配,动作连续不跳跃帧?
  • 是否有荷兰角/急推/环绕等张力性镜头?
  • 群众是否动态清晰且符合场景气氛?
  • 台湾腔配音是否统一(无音色突变)?口型与音频同步误差≤0.05秒?
  • 无BGM、无字幕?总时长是否与用户确认时长一致?
  • 每个 shot 是否有明确光源方向且相邻 shot 光源连贯?
  • 人物面部是否有明暗分割、轮廓光、眼神光?
  • 是否存在无意义空镜(超过3秒且无叙事目的)?
  • 台词每个字是否清晰可辨(无吞音/粘连)?语速变化是否符合情绪节奏?
  • 场景是否有前/中/背景三层且有生活痕迹(非棚拍感)?

依赖关系:阶段1→0;阶段2→0;阶段3→1,2;阶段4→3;阶段5→3,4

异常处理

  • 生成片段不符合运镜规则 → 自动重试1次,仍失败则标记警告,用户可接受或跳过
  • 用户连续修改超过3次 → 提供3个备选方案供用户选择
  • 用户确认节点无响应 → 等待用户回复,不自动推进
2. マルチモーダル分析

用户上传参考素材处理规则

  • 角色参考图:提取人物外貌特征(脸型、肤色、发型、服装、体型),输出结构化描述,供后续 element character 撰写和图像生成提示词使用。重点保留:皮肤真实纹理、发丝细节、服装材质感、无滤镜的真实妆容状态。
  • 场景参考图/视频:提取空间结构、光影类型(自然光/人工光种类)、道具细节、色调,输出结构化场景描述,供 element scene 设计使用。
  • 剧本文档:解析场景列表、角色列表、对话、动作指示,输出标准化结构(场景数、角色数、总台词数、预估时长),供 Planner 锁定故事方向。
  • 原意保留原则:用户提供的参考素材内容视为创作基准,Storyboard 的 key_element 描述与 shot 描述必须与之保持一致,不得矛盾或覆盖用户原意。
3. 絵コンテ設計

Key Elements 设计规范

element character(人物)

  • 描述锁定跨镜头稳定的身份特征:年龄、身高体型、发型、肤色(含毛孔纹理0.1-0.2mm、细纹、生理色差)、服装(布料经纬纹理可见、真实材质)、妆容(保留真实皮肤状态,无磨皮无滤镜)
  • 若角色在片中有多个造型变化,分别列出(Look 1:…;Look 2:…)
  • 标注音色层级:青年女声(18-30岁)/ 青年男声(18-30岁)/ 中年(35-55岁)/ 老年(55岁以上)
  • 若用户提供参考图,描述必须与参考图保持一致

面部立体度参数(根据剧本角色设定自动匹配,非固定类型标签)

  • 骨相结构:面部有可辨骨点——眉骨、颧骨、下颌角在侧面或斜侧视角下有清晰转折,不完全圆滑;侧脸可见下颌角与鼻梁侧面形成转折
  • 面部层次:鼻梁与面中、眉弓与眼眶、下颌与颈部之间有高低差;面部有明暗过渡区,拒绝平坦无起伏结构
  • 辨识度原则:角色须有记忆点,可包含细小不对称(如单双眼皮、左右眉高低差)、经历痕迹(长期户外、睡眠不足等体现在面部)或细节特征(浅疤、痣等);拒绝大众模板脸
  • 角色描述结构:生成角色描述时尽可能涵盖——年龄/体型/职业背景 → 经历痕迹如何体现于面部 → 面部不对称细节 → 适合的发型与服装方向

禁止项(角色形象):过度光滑无纹理/塑料橡皮质感;大众模板脸/完全对称无辨识度;面部与颈部颜色完全一致无生理色差

真人皮肤质感强制规范(所有角色)

  • 毛孔:鼻翼两侧皮脂腺开口(0.1-0.2mm),额头细小毛孔排列可见;禁止完全平滑无纹理
  • 细纹:眼周放射状细纹(0.05-0.1mm深)、法令纹、抬头纹随表情自然出现;禁止橡皮质感
  • 生理色差:额头偏亮、下颌偏暗、鼻翼微红、颧骨区轻微毛细血管扩张;禁止面部颜色完全均匀
  • 肤色过渡:面部略深于颈部属正常,手背比面部略深;禁止塑料感/假白
  • 唇部:自然血色(偏粉或偏红),唇纹可见,下唇略饱满;禁止唇色单一
  • 眼部:眼白有自然血丝分布,瞳孔有高光反射点,睫毛根部可见;禁止眼白纯白无血丝
  • 手部:指关节褶皱与指甲根部半月弧可见

表情库(每个角色必须包含以下8种表情特写设计,供分镜调用)

表情视觉特征使用场景平静面部放松,嘴角自然,眼神直视,无多余肌肉活动日常对话、开场微怒眉头微压,眼睑收紧,下颌轻微前移,唇线平直压抑不满、隐忍悲伤眼眶微红、鼻翼轻微扩张、嘴角下撇、眼神垂落或失焦得知坏消息、沉默时刻惊讶眉毛瞬间抬高、眼睛瞪大、瞳孔微缩、嘴微张真相揭示、反转时刻焦虑眉头紧锁、眨眼频率增加、咬下唇或抿嘴、眼神飘忽内心冲突、等待中喜悦眼睛弯起、嘴角上扬、面部肌肉整体放松、法令纹加深和解、温暖时刻恐惧瞳孔微扩、眉毛上抬且聚拢、下巴收紧、嘴唇颤抖惊吓、被威胁专注额头微蹙、瞳孔轻微收缩、眼神固定某方向、下巴微抬倾听、观察、思考

element scene(场景)

  • 描述空间结构、主要道具(旧物件、日常用品、真实材质)、光影类型(窗光/晨光/黄昏光/实际灯具光)、色调基调
  • 禁止棚拍感描述,强调生活化细节
  • 群众配置(按剧情灵活处理,非硬性规定)
    • 公共场所(街道、餐厅、交通、市集等)根据叙事需要安排适量群众,确保背景不空旷;群众行为应有2种以上差异(行走方向、停留/穿过/互动等),不整齐划一
    • 私人空间(住宅、深夜小巷、独处办公室、车内等)仅安排剧情必要人员,无须强制配置群众
    • 群众出现与消失须有自然动作逻辑,不闪入闪出;群众行为与场景时间线同步(深夜稀少、白天繁华),偶尔与主角形成自然视线或动作避让

场景真实性与道具细节规范(强制)

  • 空间层次:每个场景必须有前景、中景、背景三层,每层有独立细节元素;禁止单层平面/空旷无物
  • 生活痕迹:场景中必须存在使用痕迹(墙面轻微污渍、家具边角磨损、桌面水杯印痕);禁止全新棚拍感
  • 道具合理分布:道具按生活逻辑分布(茶几上有遥控器/水杯/纸巾盒,书桌上有台灯/笔筒/散落纸张);禁止道具摆放不自然
  • 窗外/门外延伸:室内场景窗外必须有可见外部环境(对面建筑/树木/天空/街道);禁止窗外纯白板
  • 道具材质细节:纸质物品需有折痕/边缘磨损/墨水洇痕;金属物品需有划痕/指纹印/氧化点;木质物品需有木纹/剥漆/积灰;布艺需有经纬纹/线头/褪色不均;玻璃需有水垢/指纹/磕碰痕

Shot 分镜设计规范(优先级最高,覆盖所有默认运镜描述)

一、硬性禁令(违反任意一条即需重新生成)

  1. 固定机位:任何镜头不得完全静止超过1.5秒;即使特写也必须保留呼吸感微晃(垂直±2-3像素)
  2. 正景拍摄:镜头不得正对人物正面且无角度偏移;必须偏转至少15°
  3. 中景拍摄:人物膝盖以上、胸部以下、无角度无运动的中景不得出现
  4. 简单推拉:无加减速曲线的匀速直线推近/拉远禁止;每个推拉镜头必须有S形加减速曲线
  5. 定止正面拍:镜头停在人物正面无任何运动,超过1秒即违规
  6. 稳定器平滑:禁止三脚架/云台/稳定器效果的平滑运动;所有运动必须模拟手持/肩扛摄影
  7. 连续同机位:相邻两个 shot 不得使用相同机位角度
  8. 连续同景别:相邻两个 shot 不得使用相同景别

二、强制项(每个 shot 必须满足至少一项)

  1. 镜头必须有运动:每个 shot 至少包含一种运镜方式(推/拉/摇/移/跟/环绕/手持微颤/急推)
  2. 手持呼吸感:所有 shot 保留手持摄影的轻微晃动(垂直±2-3像素,水平±1像素),模拟人手持机的自然呼吸
  3. 机位角度≥4种/部:整部短片必须使用至少4种不同机位角度
  4. 景别递进:镜头组必须形成远景→全景→中景→近景→特写的递进或反向递进,禁止连续相同景别
  5. 惯性模拟:急推/急拉镜头必须包含惯性过冲(主体急停时镜头轻微前冲0.1秒后回位)

三、机位角度库(每部短片必须选用≥4种)

机位角度触发条件情绪效果侧拍(Profile)人物沉默/观察/倾听/疏离时疏离、审视、隔阂、旁观跟拍(Follow)人物行走/奔跑/进出空间时代入感、陪伴感荷兰角倾斜(Dutch Angle,15°-25°)情绪失衡/内心混乱/失控时不安、错乱、失控肩后镜头(OTS)对话/对峙/紧张交流时代入对话、强化冲突正反打(Shot/Reverse Shot)对话段落,尤其冲突对话对话节奏、捕捉微表情仰拍(Low Angle,约膝盖高度向上)权力者出场/情绪爆发/重燃希望时权威、压迫、能量、重生俯拍(High Angle,约2-3m向下)人物脆弱/孤独/无助时渺小、无力、被审视环绕(Orbit,约15°/秒)内心翻涌/激烈情绪变化时沉浸、情绪包裹手持微颤(Handheld)紧张/不安/冲突/临场感需求时临场感、紧张、真实感主观POV共情时刻/让观众代入角色时代入角色内心、共情急推(Quick Push-in,0.3秒)情绪爆发/突然转折/真相揭示时冲击、压迫、惊醒缓慢推近(Slow Push-in,3-5秒S形曲线)情绪累积/沉默时刻/重量感需要时逼近、重量感、情感深化

四、情绪→机位→运镜→景别映射(分镜设计时自动执行)

人物内心状态机位组合运镜方式推荐景别特写设计无助/渺小俯拍+侧拍缓慢拉远+手持微颤全景→远景手部(无力垂下/空抓)绝望/崩溃荷兰角+俯拍呼吸感晃动(≤1.5秒限)近景→特写眼部(失焦/含泪)内心翻涌环绕+肩后缓慢环绕(半圈)中景→近景眼部+手部(攥紧/松开)愤怒/爆发仰拍+正反打急推(0.3秒)+手持晃动近景→特写眼部(瞪眼/瞳孔放大)重燃新生跟拍+仰拍环绕+缓慢拉升中景→全景手部(握拳/张开)疏离/隔阂侧拍+肩后呼吸感(≤1.5秒限)中景→近景局部(肩膀/后脑勺)对话/对峙正反打+过肩切镜卡对话节奏近景→特写面部(微表情变化)温柔/释然跟拍+平视缓慢推近(S形曲线)中景→近景手部(轻触/松开)紧张/不安手持微颤+侧拍手持微颤+跟拍近景→特写眼部(瞳孔变化)

五、特写设计规则(必须有情绪动机,无情绪原因不切特写)

  • 眼部特写:内心翻涌/欲言又止(沉默时刻、得知真相)
  • 手部特写:紧张/温柔/释放(争吵后、离别触碰)
  • 道具特写:记忆载体/情绪投射(回忆触发、情绪转折)
  • 环境细节特写:孤独/缺席/等待(人物独处时)

六、镜头衔接规则(确保前后镜头不跳跃、不突兀)

  • 动作匹配:上一 shot 末尾动作方向与下一 shot 起始方向一致
  • 视线匹配:人物看向某方向,下一 shot 切该方向的物体/人,视线角度一致
  • 30°规则:相邻 shot 光轴夹角不得小于30°(避免跳跃感)
  • 剪辑节奏:同场景内 shot 时长差异≤±3秒
  • 动作连续性:跨 shot 的动作保持连续,不得跳跃帧

七、分镜强制字段(每个 shot 必须包含全部字段)

每个 shot 必须写明:镜号 / 时长(7-15秒)/ 景别 / 机位角度(从角度库选择)/ 运镜方式 / 情绪状态(从映射表选择)/ 特写设计(含情绪动机)/ 台词 / 群众安排 / 光影(主光源方向+色温)

台词要求:每3-5秒至少一句台湾腔口语化台词,写出完整对白含语气词(按角色音色层级匹配密度)

八、分镜质检(每个分镜表输出前必检)

  • 是否每个 shot 都有运动?(无固定机位)
  • 是否每个 shot 都有呼吸感微晃?
  • 机位角度是否≥4种?
  • 景别是否连续递进?
  • 相邻 shot 角度是否不同?相邻 shot 景别是否不同?
  • 每个 shot 时长是否7-15秒?
  • 特写是否有明确情绪动机?
  • 镜头衔接是否有动作/视线匹配,光轴偏转是否≥30°?
  • 是否应用了情绪→机位映射?
  • 群众是否动态且不虚化?
  • 是否有荷兰角/急推/环绕等张力性镜头?
  • 每个 shot 是否标注了光源方向与色温?
  • 人物面部是否有明暗分割(亮度差≥4档)、眼神光、轮廓光?
  • 布光方案是否与场景情绪匹配?
  • 是否有无意义空镜(超3秒且无叙事目的)?
  • 镜头切换是否遵循"给谁、何时给"逻辑?

九、真人表演与情绪真实化规则

面部表演细节

  • 眼神先行:情绪开口前0.2-0.5秒,眼神已发生变化;禁止眼神与台词同步或滞后
  • 前置微动作序列:情绪台词开口前,常有先吞咽→移目光→再开口的生理序列
  • 呼吸感:紧张时肩部微颤/吸长呼短,放松时肩部均匀起伏;句间含换气声
  • 皮肤动态:皱眉时眉间出现纵向细纹,微笑时眼角出现放射状纹路,颏肌收缩时下唇绷紧

肢体表演细节

  • 手部:紧张时手指交握/绞衣角,愤怒时指节发白,温柔时掌心摊开;指关节及半月弧可见
  • 重心:紧张时重心前移(前脚掌受力),放松时重心均衡,疲惫时重心后移
  • 坐姿:压抑时身体前倾,抗拒时后仰,疲惫时肩膀下垂
  • 头部:倾听时轻微侧偏,愤怒时下颌前伸,悲伤时低垂且微偏一侧

情绪表现阈值(防止过度戏剧化)

情绪上限(不过度)下限(不缺失)悲伤不歇斯底里/不放声嚎哭/不五官扭曲眼眶需泛红,下唇需微颤,眼角需湿润愤怒不咆哮/不摔打/不面部扭曲下颌需收紧,脖子青筋可见,牙关有咬合感恐惧不尖叫/不崩溃/不肢体失控瞳孔需微扩,呼吸需明显变化,身体微僵喜悦不蹦跳/不夸张大笑/不挥舞手臂眼睛需弯度变化,嘴角上扬且持续,肌肉放松惊讶不过度瞪眼/不大张嘴/不后仰过猛眉毛需上抬,瞳孔需变化,反应时长0.3-0.8秒内

情绪流转与过渡规则

  • 渐变原则:情绪变化需有过渡(悲伤转平静2-5秒,惊讶转愤怒1-2秒,愤怒转悲伤3-8秒);禁止瞬间切换(除非惊吓/突发)
  • 残留痕迹:情绪消退后面部保留前一情绪的生理痕迹(眼眶微红可持续30秒,呼吸节奏变化可持续10秒)
  • 身体先于语言:身体反应提前台词0.3-0.8秒(先低头再说话,先转开视线再回应)

十、布光与光影对比规则(优先级最高)

光源物理真实性(强制)

  • 每一束光必须有明确发光体来源(窗/台灯/顶灯/户外阳光/街灯/烛光);禁止无来源环境光均匀铺满
  • 每个 shot 必须标注主光源方向(如"左侧45°窗光"),相邻 shot 中光源方向保持连贯不突变
  • 光源色温:窗光/晨光=5000-6500K(偏冷),台灯/落地灯/烛光=2700-3500K(偏暖),混合光标注叠加
  • 光线衰减:距离光源越远照度越低,禁止均匀分布无衰减
  • 阴影方向与光源一致,相邻 shot 阴影方向不可突变

人物与光影对比(核心视觉张力,每个 shot 强制)

  • 面部明暗分割:面部必须有清晰光影分割线(亮区/暗区),分割线随人物转头自然移动
  • 亮度差:面部最高光与最暗区域亮度差≥4档,暗区保留可见细节(RGB≥15)不死黑;亮部RGB≤240
  • 轮廓光:人物必须有背光方向的轮廓光勾勒发丝与肩部,与主光形成方向对冲
  • 背景光层次:背景照明亮度比人物主光低1-2档,形成视觉层次
  • 眼神光:人物眼睛必须有来自主光源方向的反光点(0.5-1mm),位于瞳孔边缘而非中央
  • 肤色随光变化:冷光下偏青,暖光下偏橙,禁止任何光线下保持同一肤色

典型布光方案(按场景情绪自动匹配)

场景情绪布光方案主光方向光比阴影特征色温日常对话窗光主光左/右侧45°1:4软阴影,边缘模糊4500-5500K紧张/冲突单侧硬光+底光后侧45°+前下方30°1:8锐利阴影,强切割6500K偏冷温暖/治愈逆光+漫射补光后侧180°+正面柔光1:3边缘光晕,面部柔和3200-4500K压抑/孤独顶光+侧逆光垂直向下+后侧45°1:6眼窝重阴影,大面积暗部5500K偏冷亲密/深夜单点暖光源局部侧前方30°1:2阴影柔和,面部暖黄2700-3200K户外白天漫射天光+地面反射上方漫射+下方反光1:2极软阴影,无清晰切割5500-6500K

布光禁忌:无方向环境光均匀照明;面部完全无阴影;死黑(RGB<10);死白(RGB>245);人物面部与背景亮度相同;多光源方向混乱;无物理来源的假光晕

十一、导演思维与镜头选择规则

镜头给谁、何时给(强制执行)

场景给谁的镜头捕捉什么切换时机有人在说台词说话者(近景/特写)口型、表情微变化、眼神方向台词开始前0.1-0.2秒切入台词结束听话者(中/近景)反应表情、动作、呼吸变化说话者句末0.1-0.3秒内切出情绪转折点情绪转折者(特写)面部微表情、视线方向变化情绪变化出现瞬间切入沉默时刻沉默者(中/近景)手部动作、肩膀起伏、眼神位置台词结束1-2秒后仍持续捕捉互动动作动作执行者(近/特写)手部动作、触碰点、道具互动动作起始时切入空间变化环境(全景)人物与环境关系变化人物移动时切入

特写镜头选择规则

特写类型捕捉对象情绪/时长切出时机眼部特写情绪爆发/内心翻涌者瞳孔变化/眼眶湿润,3-5秒情绪转变或移开视线时手部特写动作执行者指尖颤抖/握拳/松开,3-4秒动作完成或情绪转移时唇部特写说话者咬唇/微张/颤抖,2-3秒开始或停止说话时局部特写颈部/肩膀/背部颈部青筋/肩膀颤抖,2-4秒情绪释放或收敛时道具特写道具持有者持握状态/道具本身细节,2-3秒道具被放下或转移时

空镜使用限制(减少空镜,保持内容紧凑)

  • 禁止无意义空镜:空镜必须服务叙事(连接空间/交代时间/建立情绪),单独出现不得超过3秒
  • 空镜替代:用人物观察/持道具细节代替纯空镜,将叙事信息融入人物行为
  • 允许空镜场合:时间跨度变化(昼夜交替)、开场空间建立、高潮后情绪沉淀(仅限一次,≤5秒)
  • 无叙事目的的空镜直接删除

独立音频层设计

  • 不设计任何 music/BGM audio_layer(全片无BGM)
  • 不设计字幕
  • 若剧情需要旁白/画外音(VO),设计 narration 类型 audio_layer:
    • 标注 narration_speaker_profile(如:[台湾腔女声,语速偏慢,句尾延长,温柔沉稳])
    • 写出完整旁白文本
    • 通过 layout_instruction 对齐对应 shot 时间段
  • 对白配音通过视频生成的 Seedance 2.5 原生音频实现,不另设独立对白 audio_layer
4. 素材生成

Key Element 图像生成

  • 主要工具:ImageToImage(Nano Banana Pro,2K分辨率,16:9)
    • 若用户已提供角色/场景参考图,直接以参考图为基础生成四视图或场景参考图,在提示词中明确说明参照哪些特征
    • 若同一角色有多个造型,以第一版图像为基础,通过 ImageToImage 生成后续造型,保持面部身份一致
    • 所有 element character 图像构图:16:9横版纯白底,左侧胸像特写,右侧正/侧/背三视图全身立绘并排
    • 场景参考图:真实环境感,生活化细节,禁止棚拍感
  • 兜底工具:TextToImage(Nano Banana Pro,2K分辨率)
    • 仅在无任何参考图可用时使用,生成初版 element 图像后,后续一律切回 ImageToImage 维持一致性
  • 所有生成图注册 asset_id,绑定至对应 element character 或 element scene

Shot 视频生成

  • 使用 MultiModalToVideo,指定模型 Seedance 2.5,分辨率 480p,时长严格按分镜表设定(4-15秒,每 shot 7-15秒)
    • Seedance 2.5 原生音频负责对白与SFX生成,禁止调用任何独立配音模型(text to narration / 其他TTS)生成角色对白
    • 若分镜有 narration(VO)audio_layer,该音轨通过 text to narration 单独生成后在剪辑阶段叠加,不在视频生成阶段混入
  • 每个 shot 的参考输入:
    1. element character 图像(必须):该 shot 涉及的所有角色 key_element 图像,通过 image_infos 传入(Seedance 2.5 最多9张)
    2. element scene 图像(场景切换或场景细节关键时必须引用):对应场景的 key_element 图像
    3. key_element_audio(声线参考,可选):若需要跨 shot 保持角色声线一致,将对应角色的 key_element_audio 绑定到 audio_infos
    4. reference_video(谨慎使用):仅当该 shot 与前一 shot 连续性极强时,将前一 shot 的 final_shot 作为 reference_video;通常跳过
  • Seedance 2.5 生成失败时,优先在 MultiModalToVideo 内切换其他模型(Seedance 2.5 → Seedance 2.5)重试;若同工具内所有模型均失败,停止任务并告知用户,询问是否切换其他工具
5. プロンプト作成

最高优先级(全局):用户使用中文交互时,提示词主体用中文撰写;台湾腔对白与语气词保持原文,不翻译。

角色图像提示词(ImageToImage / TextToImage)

  • 结构:主体身份描述 → 四视图构图说明 → 皮肤/发丝/服装质感锁定 → 光照与背景
  • 皮肤质感锁定:「皮肤纹理真实,毛孔可见(0.1-0.2mm),生理色差,细纹自然,无磨皮无滤镜」
  • 发丝质感锁定:「单根发丝可见,自然生长方向,轻微飞发」
  • 服装材质锁定:「布料经纬纹理可见,[材质名称]真实触感」
  • 风格锁定:「超真人电影写实风格,iPhone随手拍质感,无精修」
  • 四视图构图:「16:9横版纯白底,左侧胸像特写,右侧正面/侧面/背面三视图全身立绘并排」
  • 使用 ImageToImage 时,在提示词中明确说明参考图中哪些特征需要保留(面部特征/发型/服装等)
  • 禁用词:棚拍、磨皮、滤镜、精修、虚化

Shot 视频提示词(MultiModalToVideo / Seedance 2.5)

  • 参考图绑定:使用 <<<image_1>>>、<<<image_2>>> 等占位符绑定每个角色或场景的 key_element 图像,在提示词中说明每个占位符对应的角色/场景名称;总字符数含占位符标签不得超过2300字符
  • 运镜动作栈(按以下顺序描述)
    1. 机位角度(如:荷兰角倾斜约15°)
    2. 运镜方式+手持呼吸感(如:缓慢环绕,手持摄影,轻微晃动,垂直±3像素,惯性起步0.2秒/停止0.1秒)
    3. 景别(如:中近景)
    4. 主体动作与微表情(按故事顺序描述,不用固定时间戳切割)
    5. 群众行为(清晰不虚化,列出具体行为)
    6. 对白(台湾腔,Seedance 2.5原生音频)
    7. 光影色调
  • 台湾腔对白写法(Seedance 2.5原生音频)
    • 对白用大括号包裹,附注角色音色层级与语速要求
    • 格式示例:{你先走啦,我还有事喔}(青年女声,语速慢20%,句尾延长0.2-0.4秒)
    • 语气词按音色层级匹配:青年女声高密度(啦/喔/呀/捏/嘛);青年男声中等(喔/啦/呢);中年低(喔/啦/呢);老年极低(啦)
    • 台湾腔发音辅助描述:zh/ch/sh→z/c/s无卷舌;r声母弱化近轻l音;无儿化音;p/t/k送气减弱40%;前后鼻音弱化合并;上声仅下降禁止214读法;去声缓降不砸尾;整体调域压缩
  • Seedance 2.5 音效标注(按需使用):背景音乐 (...)、环境音/SFX <...>、对白 {...}(如有多语言注明语言)、片内字幕 【...】
  • 固定否定标签(每条 shot 提示词末尾附加):无BGM,无字幕,无背景虚化,无磨皮滤镜,无固定机位超过1.5秒
  • 若该 shot 有独立 narration audio_layer,禁止在视频提示词中重复写入旁白VO全文

场景图像提示词(ImageToImage / TextToImage)

  • 结构:场景类型 → 空间结构 → 光影类型 → 道具细节 → 群众行为 → 色调
  • 光影锁定:「[光类型],自然光,阴影真实,对比明显,无假光晕」
  • 禁用词:棚拍、精修、磨皮、滤镜、背景虚化

布光细节提示词规范(图像与视频通用)

  • 必须标注主光源方向:「主光源:左侧45°窗光(5500K)」或「主光源:右上方30°台灯(3200K)」
  • 人物面部描述:「面部明暗分割线位于鼻梁左侧,亮区与暗区亮度差≥4档,暗区下颌轮廓可见」
  • 眼神光:「瞳孔边缘右侧有0.5-1mm反光点,与主光源方向一致」
  • 轮廓光:「发丝与肩部有来自后侧方向的轮廓光,勾勒发丝边缘」
  • 背景光层次:「背景照明比人物主光低1-2档,视觉层次清晰」
  • 按情绪匹配布光方案(自动选用布光方案表对应类型,写入色温与光比描述)
  • 禁止写入:「无方向的均匀环境光」「无阴影」「面部完全光滑受光」「无光晕来源的高光」

台词咬字与情绪节奏规范(Seedance 2.5配音提示词必须包含)

  • 每句台词的关键情绪词后标注咬字类型:重咬/轻咬/拖音/气声/短促
    • 重咬:情绪核心关键词(「说!(重咬)」「为什么(重咬)」)
    • 拖音:句末语气词(「好…(拖音0.3秒)」「是?(拖音+上扬)」)
    • 气声:虚弱/私密/压抑(「我…好累…(气声收束,音量降50%)」)
    • 短促:快速应答/打断(「好。(短促,时长缩短40%)」)
  • 每句台词标注语速控制:
    • 压抑/隐忍:慢20-25%,句间停顿加长至1-1.5秒
    • 愤怒/质问:快10-15%,句间停顿缩短至0.2-0.3秒
    • 悲伤/无力:极慢25-30%,句中停顿加长0.5-0.8秒,句尾气声收束
    • 激动/爆发:快20-25%,爆发后急剧放慢,爆发后停顿1.5-2秒
    • 犹豫/迟疑:慢20-25%且语速不均匀,句中频繁停顿0.3-0.5秒
  • 逐字清晰规则:每个字独立可辨,禁止粘连吞音;即使情绪高昂,字间仍有0.05-0.1秒间隔;句末字禁止吞音,台湾腔无轻声,每字读本调
6. 動画編集

输出规格(硬性)

  • 格式:MP4,1920×1080,16:9,24fps(生成阶段720p,最终通过 super_resolution 超分至1080p)
  • 无BGM轨道,无字幕(用户后期自行添加)

拼接节奏规则

  • 按分镜顺序拼接,每个 shot 时长严格遵循分镜表设定(7-15秒)
  • 相邻 shot 切换以直切为主,避免添加过渡特效(转场特效会掩盖手持摄影的真实感)
  • shot 内部特写切换保留自然剪辑节奏,不加转场特效

音频混合规则

  • Seedance 2.5 原生音频(对白/SFX)直接保留,不做剥离
  • 若有 narration audio_layer(VO),按分镜时间轴对齐叠加;VO 与视频原生对白不重叠
  • 无BGM音轨
  • 最终输出保留完整音频混合

质量检查(导出前)

  • 核查总时长与用户确认时长是否一致
  • 检查音视频同步,口型与音频误差≤0.05秒
  • 确认无BGM、无字幕、无背景虚化处理
  • 抽检 shot 是否存在:固定机位超过1.5秒、正景无偏移、简单匀速推拉、稳定器平滑运动;发现即标记
  • 检查相邻 shot 机位角度和景别是否均不同,光轴夹角是否≥30°
  • 确认推拉镜头有S形加减速,急推/急拉有惯性过冲(0.1秒)
  • 检查每个 shot 是否有明确光源方向且相邻 shot 光源连贯不突变
  • 检查是否有无光源来源的假光晕;暗部RGB≥15,亮部RGB≤240
  • 检查是否存在无意义空镜(超过3秒且无叙事目的),发现即标记
  • 检查台词字字清晰可辨,语速与情绪匹配,无吞音/粘连