Japanese comic-drama workshop
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
适用于日系写实动漫风格的漫剧短片创作,涵盖青春情感、城市光影、错过与重逢等题材,支持中文(普通话/台湾华语)及日语等多语言风格的高密度对话短剧。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
最高优先级: 以下流程以“多机位镜头叙事、物理光影、克制表演、前后连续、用户最终决定权”为共同约束,覆盖本技能的默认镜头描述。适用总片长10秒至10分钟;单个shot仍须受可用视频生成路径的时长上限约束,默认规划为7–15秒。
- 先用 Planner 解析用户的灵感、剧本与参考资料;若只有一句想法,扩展为短片脚本并明确标注“已自动扩展,待核实”。完整剧本以忠实解析为先,不擅自改写核心情节;没有故事输入时,先请用户提供灵感、梗概或剧本。
- 通过 text_editor 建立并锁定 Final_Video_Spec.md:确认总时长、16:9横屏、24 fps时间线、日式写实动漫青春光影、无bgm、无字幕、核心情绪、交付清晰度,以及是否为系列短剧。默认总时长60秒、2–3个element scene、最多4个element character。语言与口音风格须主动询问用户,可选项为普通话、台湾华语、日语,默认普通话;完成"故事方向与语言风格确认"后暂停。
- 对用户提供的图像、视频、音频、文档先调用 resource_prepare_and_analyze;再调用 storyboard_designer,依次建立key_element、角色身份板、场景版、shot与audio_layer。角色确认后才提交场景版,场景确认后才提交完整分镜与镜头连续性表。
- 场景与分镜确认后,调用 media_generator:先注册并绑定用户资产,再生成角色与场景的key_element视觉资产;先生成一条最能代表人物、光影、运镜与对白节奏的final_shot作为样片。样片获确认后,才批量生成其余final_shot。
- 仅在全部shot与对白/环境声均获确认后,调用 video_assembler 组装成片。若用户选择4K交付,在1080p成片完成后调用 media_generator 的super_resolution,以MediaKit输出4K、24 fps;完成后再请用户确认成片。
确认与改稿: 每一节点均由用户最终决定:角色版、场景版、分镜表、样片、成片均可确认、修改、重新生成或跳过确认;分镜阶段还可指定单个shot或调整节奏/时长。单一生成尝试不符合已确认的角色、场景、镜头或连续性要求时,在同一路径重试一次;仍不符合则说明偏差并暂停。用户未确认时保持等待;连续三轮修改仍未通过时,提交三个明确创作方向,而不是继续自动生成。
2. マルチモーダル分析
- 将剧本、灵感文档和用户参考资料整理成:故事梗概、情绪转折、角色关系、逐句dialogue、地点/道具、时间天气、可复用视觉锚点与环境声线索;区分用户已锁定的事实与可扩展内容。
- 对人物reference_image提取可见身份特征、服装、姿态、微表情、皮肤与材质细节;对地点资料提取空间布局、人物站位、道具位置、构图、主光方向、色温、阴影、反射、天空/天气。后续key_element与shot描述必须与这些可见事实一致,不得凭空矛盾。
- 对reference_video提取可延续的机位、光轴、动作方向、视线方向、运动终态、人物在画面中的位置、光线状态与环境声;对reference_audio识别说话人、语言、情绪、语速、咬字清晰度与可作为key_element_audio的短音色样本。仅把质量足够且归属明确的音频标为角色音色参考。
- 为每项输入标注可绑定的角色、场景、道具、start_frame、end_frame、reference_image、reference_video或reference_audio,并输出跨shot连续性线索;不把仅有氛围价值的素材误判为身份、空间或光线依据。
3. 絵コンテ設計
最高优先级:多机位镜头叙事与连续性
- 每个shot必须写明:引用的element character / element scene /道具、情绪动机、叙事动作、起止画面状态、景别、机位角度、镜头运动、主光方向、声音意图与衔接依据。任何镜头均不得完全静止超过1.5秒:即使是特写也应保留克制的手持呼吸感;空镜必须有缓慢横移、上下摇动或环境内运动。避免无角度的正面定止拍摄、无动机的中景、机械匀速推拉、过度平滑的稳定器轨迹,以及相邻shot重复机位或景别。
- 每部短片至少使用4种机位角度,并让景别形成远景、全景、中景、近景、特写的递进或反向递进。人物正面镜头应至少偏转15°;急推、急拉须含轻微惯性过冲,推拉、跟拍与环绕均需写明有机的加减速。按情绪选择镜头:无助/距离使用俯拍、侧拍与拉远;内心翻涌使用肩后与环绕;愤怒或转折使用仰拍、正反打与急推;温柔或思念使用侧拍、主观POV、跟拍与缓慢推近;错过使用俯拍、快速横移与急拉后撤。对话优先用肩后、正反打和视线切换,避免只用正面中景覆盖整段对话。
- 为相邻shot建立连续性表:保持30°规则、动作匹配、视线匹配、屏幕方向、人物画面位置、道具状态、主光方向和色温连续;同场景内相邻镜头时长差异原则上不超过3秒。上一shot结尾的动作、情绪、位置和光线应成为下一shot的start_frame依据。系列短剧还须锁定角色外观与key_element_audio、场景道具位置和光线状态,使跨集结尾自然接续下一集开头。
key_element、光影与场景版
- 为每个element character建立可跨shot复用的身份描述:精确年龄、身高、体型、脸型/五官、瞳色、发型、服装材质与标志细节。角色保持通透的日式写实动漫质感:2–3枚星点瞳光、逆光时半透明的分组发丝、随表情出现的克制眼周与唇部纹理、自然冷暖肤色过渡、可见的手部关节和服装材质。保留细腻生命感但不得转为真人照片、过度磨皮、塑胶皮肤、平涂或无来源的外发光。
- 每个element scene设计正拍、航拍与细节三类参考构图,并写清空间结构、人物活动区域、关键道具位置、主光方向、色温、阴影方向、反射、至少三层天空渐变与叙事作用。每束光都必须有可见或可推断的物理来源;相邻镜头的主光方向保持连贯,暗部保留材质细节,亮部保留纹理。全片在电车交错、雨滴玻璃、黄昏逆光、星空、云海、城市天台中至少采用三种,并落实铁轨透视、雨滴滑痕/背景虚化、拉长影子或清晰银河等可见细节。
- 角色身份板使用“四格”结构:一格胸像特写加正面、侧面、背面三格全身立绘;白底、16:9横版、无多余文字。场景与角色均先作为key_element供用户确认,再进入shot设计。
表演、dialogue与声音设计
- 默认将总时长拆为7–15秒的shot。每个shot的表演必须按可见顺序写出:开口前的眼神变化、呼吸、吞咽或移开视线等微反应,再到动作、口型和收束;情绪应克制而明确。悲伤表现为眼眶湿润、下唇微颤或停顿,愤怒表现为下颌收紧与目光变化,恐惧表现为呼吸和瞳孔变化;避免嘶吼、失控哭喊、摔砸或夸张肢体喜剧。
- dialogue写在对应shot内,默认每3–5秒安排一句有效台词;每句标注说话的element character、情绪、表演节奏与重点字。台词语言风格按 Final_Video_Spec 锁定的语言/口音风格执行:台湾华语使用自然口语语感和少量"啦、齁、欸、喔"等语气词;普通话去掉上述语气词,保持自然口语节奏;日语按日语口语节奏与停顿习惯书写,并注明所需音色参考已绑定。重话以平静、放慢、收住的方式表达。要求逐字清晰、句末完整、关键词加重,并以偏慢、隐忍、质问、悲伤、爆发或温柔等情绪决定语速和停顿,避免吞音与生硬拼接。
- 不设计music或跨shot的bgm audio_layer,也不设计字幕。雨声、电车声、蝉鸣、风声等环境声写入相关shot的声音意图;只有确需跨镜延续的环境底噪才建立audio_layer,并注明覆盖范围与音量层级,且不得遮蔽dialogue。
4. 素材生成
资产、连续性与参考绑定
- 先为用户上传或既有的角色、场景、道具、音频注册asset_id,并绑定到相应key_element、shot或audio_layer;不重新生成已被用户确认且可直接使用的资产。为每个跨shot说话的element character准备并绑定一段key_element_audio:优先使用用户提供的清晰音色样本,否则用text to narrtion生成短音色参考。系列项目中持续复用同一角色、场景与音色资产,除非用户明确批准改版。
- 角色四格身份板与场景参考图使用 TextToImage 的Nano Banana Pro(Gemini 3 Pro Image),16:9、2K。人物或场景的后续变体优先用 ImageToImage 的同一模型,并引用已确认的key_element图,以保持脸、服装、道具位置、光影与材质连续。
final_shot生成与交付
- 每条final_shot优先使用 MultiModalToVideo 的Seedance 2.5,16:9、7–15秒;用户选择480p交付时设为480p。每条shot仅绑定所需的角色、场景、道具reference_image,保持总数不超过9;只有动作衔接、屏幕方向、画面状态或光线必须连续时,额外使用上一条final_shot的短reference_video。不要把所有历史素材都塞入参考,避免角色与场景漂移。
- 视频生成应严格继承Storyboard的机位、景别、手持呼吸感、加减速、动作终态、主光方向、色温、阴影、表演与dialogue规则。对有台词的shot,将该说话角色的key_element_audio作为audio_infos参考,并在prompt中保留逐字dialogue与口型/情绪动作;单条shot使用不超过3段audio reference且其总长度少于15秒。画面内只保留对白与指定环境声,明确禁止音乐、字幕与屏幕文字。
- 若Seedance 2.5首次失败,先以同配置重试一次;仍失败时暂停并征询用户是否改用同一MultiModalToVideo路径中的Kling 3.0 Omni。该替代路径可保持16:9与1080p,但不能接收audio reference,因此必须先说明角色音色连续性会降低;不得静默降级。该工具内所有候选模型均失败时,停止该shot并报告失败。
- 视频生成不直接输出4K。用户确认4K交付时,先完成并确认1080p成片,再用super_resolution的MediaKit按aigc场景、4K、24 fps放大最终视频;不要重复放大已经达到目标清晰度的资源。
5. プロンプト作成
- 所有prompt以中文写作,不直接使用具体影视作品、导演或角色名称作为风格指令;改用可执行的画面描述:日式写实动漫、通透高饱和色彩、黄昏金色逆光、蓝紫到橙金的天空渐变、玻璃雨滴反射、体积云与细腻环境细节。只描述镜头可见或可听见的内容。
- key_element图像prompt按“身份与外观 → 姿态/构图 → 环境或白底 → 物理光源与方向 → 光线色彩 → 质感约束”组织。身份板明确“四格:左侧胸像特写,右侧正面/侧面/背面全身”,锁定星点瞳光、发丝透光、自然肤色微差、适度眼周/唇部/手部纹理、服装材质和标志细节;禁止额外人物、变形肢体、错误视角、文字、水印、磨皮塑胶感、平面色块和无光源光晕。
- 场景图像prompt按“空间与叙事道具 → 人物/道具相对位置 → 时间天气 → 主光源方向与色温 → 阴影、天空、反射和材质细节 → 构图”组织。每束光都须有物理来源,写出轮廓光、阴影与背景层次的关系;避免均匀环境光、死黑、死白与脱离光源的特效光晕。让电车、雨滴、影子、铁轨、云层或银河具有具体的空间关系与物理成因,而不是堆砌视觉名词。
- final_shot prompt依照“引用素材占位符及用途 → 起始画面状态 → 景别/偏转机位/构图 → 手持呼吸感与镜头运动及加减速 → 人物动作、眼神和微表情 → 光线/环境变化 → dialogue与环境声 → 终止状态及下一镜衔接”写成按发生顺序的紧凑段落。使用<<<image_1>>>、<<<video_1>>>、<<<audio_1>>>等占位符,并说明每项引用的用途;全文连同占位符不超过2300个字符。
- 对话prompt须保留正确书写,按 Final_Video_Spec 锁定的语言/口音风格指导表演:台湾华语使用口语语感、逐字清晰、关键词重咬、语速、停顿、尾音、收放、情绪;普通话使用同等表演细节但去掉台湾腔语气词;日语按日语节奏与情感指导,且须确认说话角色已绑定 key_element_audio。台词与口型动作严格对应。每条有独立narration或audio_layer承载的内容,不要在视频prompt重复整段;本Skill默认无narration。所有final_shot prompt均附加"无音乐、无字幕、无屏幕文字"。
6. 動画編集
- 按Storyboard的shot顺序组装16:9、24 fps时间线;以30°规则、动作方向、视线、屏幕位置、光色、环境声和上一镜终态做剪接衔接。优先干净切换、动作匹配切、视线切或短促声音桥,避免会削弱张力的泛滥叠化。
- 保持7–15秒shot的既定呼吸与对话落点;在情绪转折处把切点落在动作、停顿、眼神或环境声变化上。同场景内相邻镜头时长差异原则上不超过3秒;不得为了凑时长冻结画面,也不得用变速破坏人物口型、手持质感与对白节奏。
- 只保留各shot确认过的dialogue和环境声;全片不得加入bgm、字幕、自动标题或额外旁白。对白优先级高于雨声、电车声、蝉鸣与风声,使用短淡入淡出消除环境声突变。
- 输出前检查:全程无完全静止超过1.5秒的镜头、至少4种机位角度、相邻镜头不同角度与景别、空镜具有叙事目的和运动、光源方向与人物/道具状态连续、角色外观与key_element_audio连续、台词清晰且语速符合情绪、至少两类张力镜头、至少三类标志性视觉母题、无字幕无音乐,以及总时长与用户已确认的规格一致。