手绘感旅行VLOG
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
用于制作"手绘贴纸角色+真实旅行场景"拼贴美学短视频VLOG。当用户要求制作手绘风旅行视频、贴纸风旅行短片等手绘+旅行结合的视频创作需求时触发。从角色设计到场景合成到动态成片,全流程AI生成。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
全流程阶段与依赖:
- 建立全局规格: 通过 text_editor 建立 Final_Video_Spec.md,锁定标题、画幅(竖屏 9:16)、总时长(15-60 秒)、视觉风格(拼贴手绘贴纸风)、色调关键词、输出语言。
- 素材分析与复用判定: 若用户上传了角色参考图、旅行实景照片或风格参考图,先调用 resource_prepare_and_analyze 提取特征,将结果写入 Storyboard 元素描述。已有可用素材优先绑定,不重复生成。
- 生成 Storyboard: 调用 storyboard_designer,产出 key elements(角色 1-2 个 + 场景集)、shot 列表(4-8 个,按六节点叙事结构排布)、audio layers(BGM + 可选字幕)。
- 角色 key_element 图像生成: 调用 media_generator,为每个角色生成白底全身设定图(含 3-5 个动作变体),绑定到对应 key_element。生成后锁定角色外貌。
- 场景合成图生成(每 shot 的 keyframe): 调用 media_generator,以角色 key_element 图为参考,生成"手绘贴纸角色叠在真实旅行实景前景"的拼贴合成图。先生成第一张作为风格锚点,确认后再批量生成。
- 视频片段生成: 调用 media_generator,以每张场景合成图为 start_frame,生成 3-5 秒动态片段。按多模型策略选模型(默认 Sora-2 → 备选 Wan2.6 → 质量优先 Veo3.1 Fast)。
- 音频生成: 调用 media_generator,生成 BGM(text_to_instrumental,轻快治愈旅行风)。
- 最终组装与导出: 调用 video_assembler,按叙事顺序拼接片段,对齐 BGM 节拍,处理片段自带音频与 BGM 的音量平衡,叠加可选字幕,导出成片。
依赖关系: 2→1;3→1,2;4→3;5→4;6→5;7→3;8→5,6,7。
暂停确认节点(不在一步内跑完全流程):
- 叙事线确认: 步骤 3 完成后,暂停展示 Storyboard 摘要(六节点结构、时长分配),请用户确认或调整后再进入生成。
- 角色设定确认: 步骤 4 完成后,暂停展示角色设定图,请用户确认外貌、配色、风格后再继续。
- 风格锚点确认: 步骤 5 生成第一张场景合成图后,暂停请用户确认拼贴效果、色调、透视是否满意,确认后再批量生成剩余场景图。
- 成片确认: 步骤 8 完成后,展示成片,请用户确认或提出微调需求。
异常处理:
- 角色与场景透视不匹配: 在提示词中加入 natural perspective, consistent scale,重新生成。
- 角色一致性偏差: 确认 key_element 图是否正确绑定;在提示词中完整复述角色外貌,重试。
- 视频生成全部失败: 停止当前 shot 生成,告知用户并建议调整 start_frame 或切换模型。
- 总时长超 60 秒: 提示用户将叙事线拆分为多段分别制作后拼接,单次不超过 1 分钟。
2. 多模态分析
用户上传素材分析:
- 角色参考图/草图: 若用户上传角色参考图,提取性别、年龄、发型发色、服装配色、配饰等特征,转化为角色提示词描述。Storyboard 中的角色 key_element 描述须与上传素材一致,不得矛盾。
- 旅行照片/场景参考: 若用户上传旅行实景照片,分析其场景类型、色调、光线条件、构图特点(纵深、引导线),作为场景生成的参考依据。将色调和光线描述提取为固定关键词,后续场景生成复用。
- 风格参考图: 若用户上传拼贴/手绘风格参考,提取描边粗细、贴纸化处理方式、拼贴层次等风格特征,纳入风格关键词。
3. 故事板设计
Key Elements 设计:
- 角色(element character): 建议设计 1-2 个核心角色;超过 2 个时一致性维护难度显著增加,需提示用户。定义主角的完整外貌——性别、年龄、发型发色、服装配色、标志性配饰。注明风格固定关键词:flat 2D cartoon, thick black outline, sticker style。若角色需多个动作版本(行走、回望、坐姿等),在描述中列出各动作变体。
- 场景(element scene): 按旅行叙事线定义关键场景,每个场景描述包含:地点类型、氛围色调、光线条件、纵深/引导线构图要素。首次确定色调关键词后(如 warm golden hour / cool fresh morning),后续场景复用。
Shots 设计:
- 默认叙事结构(可调整,可按旅行天数或情绪弧线增删节点)。括号内为建议时长占比,以 20 秒成片为基准换算;总时长变化时按比例缩放,但单片段不低于 3 秒、不超过 5 秒:
- 抵达(15% ≈ 3s): 角色站在车站/机场/入口,行李箱或背包在手,回望或抬头望向目的地标志——建立旅行起点与期待感
- 初探(15% ≈ 3s): 角色走在标志性街道/广场/景点入口,四处张望、拍照——展现目的地第一印象与风貌
- 美食体验(20% ≈ 4s): 角色坐在街边小吃摊/餐厅/咖啡窗前,手捧当地美食,满足表情——呈现味觉记忆与当地烟火气
- 沉浸游览(15% ≈ 3s): 角色走进景点深处(神社参道/海边栈道/古巷阶梯),与环境互动(摸墙、驻足仰望、蹲下看花)——深化目的地氛围
- 人文互动(20% ≈ 4s): 角色与当地人/市集摊主/街头艺人交流,或参与手作/体验活动——增加旅行的故事温度
- 告别(15% ≈ 3s): 角色回望远景/夕阳剪影/车窗外渐远的风景,挥手或安静注视——收束情绪,呼应抵达
- 总 shot 数 4-8 个,每个 shot 生成一张拼贴合成图作为 keyframe,再转为 3-5 秒视频片段。
- 每 shot 描述须包含:
- Scene: 引用场景 element ID
- 角色动作: 角色在场景中的具体动作与姿态
- Cinematography: 构图(角色置于前景偏下方或侧边,背景有纵深)、运镜方式(缓慢横移/推进)
- Atmosphere: 光线与色调描述,须与已锁定的场景色调一致
Audio Layers 设计:
- BGM: 至少一条全局背景音乐 track,风格为轻快治愈旅行风。注明音乐情绪和节奏。
- 字幕(可选): 若用户需要字幕,注明手写体风格、标注地点或心情短语;字幕在后期剪辑阶段叠加,不在音频层生成。
4. 媒体生成
角色 key_element 图像生成:
- 使用 TextToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 输出白底、全身、正面站立姿态的角色设定图。
- 建议用同一提示词调整姿态描述,生成 3-5 个不同动作版本(行走、回望、坐姿等)备用,均绑定到同一角色 key_element。
- 生成后锁定角色设定,后续步骤不得更改角色外貌。
场景合成图生成(每 shot 的 keyframe):
- 使用 ImageToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 参考输入:角色 key_element 图像(必选),确保角色一致性。若用户上传了旅行实景照片,可将其作为额外参考图传入。
- 生成"手绘贴纸角色叠在真实旅行实景前景"的拼贴合成图。
- 构图规则:角色置于前景(偏下方或侧边),实景背景有纵深感或引导线,角色与背景形成前后层次。
视频片段生成:
- 使用 FirstFrameToVideo,aspect_ratio "9:16",resolution "720p"(1080p 需会员)。
- 多模型策略(按优先级):
- 默认:Sora-2 — 擅长镜头内切换与画面叙事感,适合拼贴风格的场景表达;角色为 2D 卡通贴纸(非写实人物),不受 Sora-2 写实人物高失败率限制。仅支持 720p,生成 4秒 片段。
- 备选:Wan2.6 — 生成速度更快,适合批量产出时缩短等待;生成 5秒 片段。
- 质量优先(关键记忆点 shot):Google Veo3.1 Fast — 画质最佳,用于美食体验/人文互动等情绪高潮节点;生成 4秒 片段。
- 故障切换: 当前模型生成失败时,按 Sora-2 → Wan2.6 → Google Veo3.1 Fast 顺序在同工具内切换重试;若全部失败则停止并告知用户。
- 每张场景合成图作为 start_frame,生成动态片段。
- 动效须轻缓自然:缓慢横移/推进展现环境,角色轻微行走/发丝飘动/衣角微摆,氛围类光影变化/海浪/树叶摇晃。避免剧烈运动。
BGM 生成:
- 使用 text_to_instrumental,推荐模型 Suno 5(备选 Mureka 8)。风格:轻快治愈旅行风。
一致性保障:
- 角色一致性(最高优先级):场景合成图与视频生成均将角色 key_element 图作为参考输入;每次提示词完整复述角色外貌,不得省略。
- 场景一致性:首次生成时确定色调和光线关键词,后续场景复用。
- 风格一致性:固定使用 collage aesthetic, sticker-on-photo, thick black outline 等关键词。
5. 提示词撰写
语言规则: 提示词以英文为主(模型对英文理解更准确);输出字幕/文案可为中文,须遵循 Final_Video_Spec 的 Output Language。
角色提示词(TextToImage):
- 结构:[age] [gender] [ethnicity] + [hair_description] + [clothing_description] + [accessory_description] + 风格固定关键词。
- 风格固定关键词(每次必带):flat 2D cartoon illustration, thick black outline, sticker style, clean white background, full body, consistent character design。
- 动作变体通过调整姿态描述实现(如 walking pose slight side angle / looking back pose three-quarter view / sitting pose casual)。
场景合成提示词(ImageToImage):
- 结构:real photograph of [scene_description] + 2D flat cartoon sticker-style character superimposed on foreground + [character_full_description] + thick black outlines + collage aesthetic + [lighting/atmosphere] + natural perspective。
- 角色外貌描述须完整复述,不得省略或改写。
- 合成风格固定关键词:collage aesthetic, sticker-on-photo, superimposed on foreground, hand-drawn character overlaid on real scene, travel vlog aesthetic。
- 场景关键词须包含纵深感(leading lines, depth of field, natural perspective)。
- 色调关键词首次确定后复用(如 warm golden hour light / cool morning light / soft overcast)。
视频动效提示词(FirstFrameToVideo):
- 结构:gentle [camera_movement] + the cartoon character [subtle_action] + [atmosphere_detail] + natural gentle motion + cinematic travel atmosphere + [lighting_condition]。
- 动效约束:始终包含 subtle, gentle, slow 等约束词,降低运动幅度。
- 动效类型:场景类(缓慢横移/推进)、角色类(轻微行走/发丝飘动/衣角微摆)、氛围类(光影变化/海浪涌动/树叶摇晃)。
一致性关键词库(按需融入提示词):
- 角色风格:flat 2D cartoon illustration, thick black outline, sticker style, hand-drawn style, bold outlines
- 合成风格:collage aesthetic, sticker-on-photo, superimposed, mixed media, scrapbook style
- 一致性:same character, consistent style, same outfit, same hairstyle, consistent color palette, matching lighting
6. 视频合成
剪辑规格:
- 画幅:竖屏 9:16(适配短视频平台)。
- 总时长:15-60 秒;单次生成建议不超过 1 分钟,超长视频需分段制作后拼接。
- 单片段时长:3-5 秒,按叙事顺序拼接。
- 帧率:≥24fps,确保画面流畅。
转场:
- 使用简单淡入淡出,保持手绘清新感,避免复杂转场效果。
音频:
- BGM 贯穿全片,轻快治愈旅行风,节奏与画面切换对齐。
- FirstFrameToVideo 生成的视频片段自带同步音频,须注意与 BGM 音轨的音量平衡;BGM 为主音轨时降低片段自带音量或静音,避免冲突。
字幕(可选):
- 手写体风格,标注地点或心情短语,在后期阶段叠加。
节奏:
- 转场与 BGM 节拍对齐,避免跳帧。
- 叙事节奏与时长占比(以 20 秒为基准,按总时长比例缩放,单片段 3-5 秒):抵达 15%(≈3s,建立)→ 初探 15%(≈3s,展开)→ 美食体验 20%(≈4s,升温·记忆点)→ 沉浸游览 15%(≈3s,深入)→ 人文互动 20%(≈4s,高潮·记忆点)→ 告别 15%(≈3s,收束)。若总时长偏短(如 15 秒),优先压缩初探与沉浸游览,保留美食体验与人文互动的完整时长;若偏长(如 40-60 秒),可为美食体验或人文互动各加 1-2 个 shot 并适当延长,必要时将叙事线拆分为多段分别制作后拼接。