治愈系 AI Vlog 创作
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
适用于制作治愈系/日常系独居生活风格 Vlog;流程覆盖角色设定、场景生成、故事板设计到视频生成全链路,支持单集与连续剧模式,强调角色与画风的跨镜头一致性。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
全视频流程阶段与依赖关系:
-
锁定全局参数 → 通过 text_editor 建立 Final_Video_Spec.md,写入:主题方向(vlog_theme)、美术风格(art_style)、色彩基调(color_palette)、光照偏好(lighting_style)、画面比例(默认 9:16)、是否连续剧(is_series)及集数、输出语言。所有后续阶段以此文件为参数锚点。
-
设计故事板 → 调用 storyboard_designer,产出:
- key_elements:主角(含换装变体)、全部场景、关键道具;
- shots:按集/场景排列的分镜列表;
- audio_layer:BGM 轨道。
-
绑定用户已上传素材(如有)→ 调用 media_generator,将用户提供的角色图、场景图等注册 asset_id 并绑定到对应 key_element 槽位,避免重复生成。
-
生成角色元素图 → 调用 media_generator,为主角及换装变体生成参考图。
-
生成场景元素图 → 调用 media_generator,为每个场景生成背景参考图。
-
逐镜头生成视频 → 调用 media_generator,引用对应 key_element 图(角色 + 场景)生成每个 shot 的视频片段。
-
生成 BGM → 调用 media_generator,按 storyboard audio_layer 描述生成背景音乐。
-
合成与剪辑 → 调用 video_assembler,按故事板顺序组装时间线,混入 BGM,导出成片。
依赖关系: 2→1;3→2;4→2;5→2;6→3,4,5;7→2;8→6,7。
连续剧模式: is_series=true 时,Step 2 一次性设计所有集数的 shots(每集对应各自场景),角色 key_element 全局复用;Step 4 只执行一次;Step 5、6 按集遍历;完成全部集数后统一进入 Step 8 或按集分别输出。
暂停节点: 不得一次性跑完全流程。以下节点完成后必须暂停并等待用户确认再继续:① Final_Video_Spec.md 锁定后;② 故事板设计完成后;③ 角色元素图生成完成后;④ 所有镜头视频生成完成后。
2. 多模态分析
用户上传参考素材的处理规则:
- 角色参考图:提取并描述五官特征(发色、发型、瞳色、脸型)、体型与身高感、服装款式与配色,输出结构化角色描述,供 key_element 描述字段使用。
- 场景参考图:提取空间布局(光源位置、家具摆放、道具分布)、色调与氛围关键词,输出结构化场景描述,供 element scene 描述字段使用。
- 风格参考图:识别美术风格标签(如"吉卜力上色""赛璐璐动画""水彩绘本"),提取色卡主色,作为 art_style 和 color_palette 的参数依据。
- 一致性校验:若用户同时提供角色图和场景图,检查两者画风是否统一;若存在明显差异,在分析结果中注明并建议统一使用哪套风格关键词。
3. 故事板设计
设计 key_elements
- 主角(element character):详细描述发型、发色、瞳色、肤色、标志性五官特征;若存在换装变体,将每套服装作为独立命名的外观变体写入描述(如"Look 1: 浅蓝碎花娃娃衫 + 米白短裙;Look 2: 粉色竖纹睡衣套装"),以便后续图像生成时单独引用。角色描述一经锁定,全流程禁止修改——所有 shots 只引用同一套描述,不得在单独 shot 中重新描述或局部覆盖角色外观。
- 场景(element scene):每个场景单独建立 key_element,描述空间布局、标志性道具摆放(如"床头柜左侧串灯,右侧香薰蜡烛")、主要光源位置与色温、整体色调;道具须与角色美术风格一致,避免写实感道具出现在手绘风场景中。场景描述同样锁定,同一场景在不同 shots 中复用时,空间布局、光源色温、道具陈列描述须完全一致,不得随 shot 局部修改。
- 道具组:若全局道具(如串灯、盆栽)跨多个场景复用,建立独立 key_element,shot 描述中通过 element ID 引用,避免每次重新描述导致外观漂移。
- 一致性锁定原则:key_element 的描述字段是唯一权威来源。shot 描述中如需提及角色或场景,仅引用 element ID,不重写任何已在 key_element 中定义过的属性(发色、服装、光源等),防止描述冲突导致生成结果偏离。
设计 shots
- 每个 shot 对应一个场景内的一段生活片段,建议时长规划 6–10s,不超过 15s。
- 每个 shot 描述必须包含:
- 场景引用:标注对应 element scene ID;
- 叙事动作:角色正在做什么(具体到肢体动作与表情,如"慢慢搅动咖啡杯,望向窗外晨光");
- 镜头语言:景别(全景/中景/近景/特写)、机位(正面/侧面/俯拍)、运镜方式(固定/缓推/微摇/平移),治愈系默认使用固定机位或极缓慢推拉,禁止快切与抖动;
- 光氛说明:光位方向与色温(如"右侧窗光,暖黄色温,柔和漫反射")。
- 连续剧模式:按集编号组织 shots,每集情绪线需有起伏(如"安静→期待→满足"),集与集之间角色引用同一 key_element,不重新描述角色外观。
设计 audio_layer
- 至少设置一条全局 BGM 轨(type: music),风格描述为治愈系轻音乐/氛围音乐,无人声,低频柔和,适合作为背景底层。
- 连续剧模式中,若不同集的情绪差异明显(如从清晨到夜晚),可按集拆分为多条 BGM 轨,分别描述各自氛围(如"清晨薄雾感钢琴曲"、"夜晚烛光爵士轻音乐")。
- 不使用旁白/narration 轨,Vlog 视频无需 VO 解说,叙事依靠画面与音乐传递。
4. 媒体生成
角色元素图生成
- 使用 TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 每个角色生成一张横版双联参考图:左侧为胸部以上头肩特写(五官、发色、瞳色、发型细节),右侧为全身正面(服装、鞋履、整体轮廓);两图同帧输出,确保后续视频生成时可同时引用。
- 换装变体:使用 ImageToImage,以主角原始参考图为基础,按 Look 描述替换服装;模型同上,保持五官与发型不变。
场景元素图生成
- 使用 TextToImage,模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 生成无人物的场景全景图,画面中需留出人物自然站立/坐立的位置区域(不得被道具完全填满)。
镜头视频生成
- 使用 MultiModalToVideo,模型:Kling 3.0 Omni,分辨率 720p,时长按 storyboard shot 规划(建议 6–10s,须为整数)。
- refer_type 设为 "feature"(元素图参考模式,用于角色 + 场景图驱动视频生成)。
- 每个 shot 的参考输入:
- 主角 key_element 图(必选):始终使用该角色已审核通过并绑定 asset_id 的元素图;若当前 shot 涉及换装,使用对应 Look 的元素图;严禁临时替换或使用未绑定的图像,以防角色外观跨镜漂移。
- 场景 key_element 图(必选):始终使用同一场景绑定的元素图;同一场景在不同 shots 中必须引用完全相同的 asset_id,不得使用"相似但不同"的场景图。
- 前一个 shot 的视频(可选):仅当该 shot 与上一 shot 为同一场景且动作连续时才加入(refer_type 保持 "feature");跨场景切换时不引用前一视频,避免引入错误的场景/光照信号。
- 一致性保障流程:在批量生成 shots 之前,确认所有 key_element 图均已通过用户审核并绑定稳定的 asset_id;如有 shot 生成结果出现明显角色/场景偏差,优先检查引用的 asset_id 是否正确,而非重新生成元素图。
- 连续剧模式中,跨集不引用前集视频,只复用 key_element 图;角色 asset_id 全剧共用,不得按集重新绑定。
BGM 生成
- 使用 text_to_instrumental,模型:Suno 5(首选)或 Mureka 8(备选)。
- 按 storyboard audio_layer 的氛围描述生成,禁止在 prompt 中出现知名音乐人姓名。
5. 提示词撰写
全局优先级: 用户使用中文交互时,所有 prompt 正文用中文书写。
图像 prompt(TextToImage / ImageToImage)
结构顺序:{art_style} → {主体/角色描述} → {场景/环境描述} → {道具与细节} → {色彩基调} → {光影描述} → {构图说明}
- 美术风格锚定(防漂移核心规则):每条 prompt 开头的风格关键词必须与 Final_Video_Spec.md 中的 art_style 字段逐字复制,不得同义替换、拆分或增删修饰词。角色图、场景图、道具图使用完全相同的风格串;若风格串在 Final_Video_Spec.md 中更新,所有待生成 prompt 必须同步替换。
- 角色图 prompt 要点(防外观漂移):发色、瞳色、肤色调、发型关键词必须与该角色 key_element 描述中已锁定的表述字面一致(如 key_element 写"深棕色大波浪长卷发",prompt 中不得改写为"棕色卷发"或"长波浪发");当前 Look 的服装款式与配色同样按 key_element Look 描述原文引用,不二次概括;双联图写明"左侧胸部以上特写,右侧全身正面,白色背景,角色设定参考图"。
- 场景图 prompt 要点:写明"无人物";道具名称、摆放位置、光源色温关键词须与对应 element scene 描述中的表述保持一致,避免同一场景在不同批次生成时因措辞差异导致空间感漂移;道具自然融入语境描述(如"床头柜上燃着香薰蜡烛,床框边缘缠绕着橙色串灯"而非"串灯,蜡烛")。
- 色彩控制:明确写出 Final_Video_Spec.md 中的 color_palette 关键词(如"低饱和暖米调,莫兰迪配色");治愈系禁止高饱和撞色,一个画面主色调不超过 2 个主色系;color_palette 关键词须在角色图与场景图中均出现,保证整体色调统一。
- 负面 prompt:高饱和度,强烈对比色,恐怖元素,写实摄影风,变形,多余手指,模糊,赛博朋克,机械科幻
视频 prompt(MultiModalToVideo / Kling 3.0 Omni)
- 参考图绑定:角色图用占位符 <<<image_1>>>,场景图用 <<<image_2>>> 标注;若引用前镜头视频则追加 <<<video_1>>>。
- 风格与色调延续(防跨镜漂移):在 prompt 开头以一句话点明当前画面的美术风格与色调基调,措辞与 Final_Video_Spec.md 中的 art_style 和 color_palette 保持一致;不得在单个 shot 的 prompt 中引入与全局风格不符的新风格词,防止模型局部发散。
- 角色行为描述(仅写动作,不重定义外观):prompt 中只描述角色在该 shot 内的动作与表情变化,严禁重新描述发色、服装、瞳色等已在参考图和 key_element 中锁定的视觉属性;外观一致性完全依赖 <<<image_1>>> 参考图传递,文字侧出现的外观描述越少越好,以免与参考图产生冲突指令。
- 动作描述堆叠顺序:镜头运动 → 角色动作(肢体 + 表情微动)→ 环境氛围细节 → 音效暗示(若无独立音轨)。
- 镜头运动:治愈系默认固定机位或极缓推拉("固定机位,微缓向前推进"),明确写出景别与机位角度。
- 角色动作:具体到肢体(如"右手缓慢搅动咖啡杯,左手托腮,嘴角微微上扬,眼神望向窗外"),不写抽象情绪词。
- 音频控制:视频 prompt 中始终写入 no music(BGM 在后期混入);始终写入 no subtitles。
- Kling 3.0 Omni 写法说明:不使用任何特殊括号语法;自然音效需求以自然语言融入动作或环境描述(如"咖啡杯轻轻碰触桌面,发出细微叩击声"),不以独立标签形式标注;保持 prompt 为流畅自然语言段落。
6. 视频合成
节奏与剪辑原则:
- 治愈系 Vlog 整体节奏舒缓,镜头间避免快切;默认使用柔和淡入淡出过渡(dissolve),时长 0.5–1s。
- 每个 shot 按故事板规划时长放置,不额外压缩;若单个片段过长,可在片尾做轻微淡出而非硬切。
- 连续剧集与集之间使用较长的淡出→淡入过渡(约 1.5s),给观众留出情绪缓冲。
音频混合:
- BGM 轨贯穿全片,音量设为主音轨的 40–60%,保证不压盖视频内的自然环境音。
- 视频素材自带的环境音效(如咖啡机声、雨声)保留,不完全静音;若与 BGM 冲突则略微压低(-6dB)。
- 首尾各做 1s 音量淡入/淡出,避免硬开硬结。
输出设置:
- 画面比例遵循 Final_Video_Spec.md 中的 output_ratio(默认 9:16)。
- 单集成片时长建议控制在 30s–90s;连续剧每集独立输出,不强制拼接为长视频(除非用户明确要求)。