yeha.ai
목록으로

Hand-drawn travel vlog

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

用于制作"手绘贴纸角色+真实旅行场景"拼贴美学短视频VLOG。当用户要求制作手绘风旅行视频、贴纸风旅行短片等手绘+旅行结合的视频创作需求时触发。从角色设计到场景合成到动态成片,全流程AI生成。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

全流程阶段与依赖:

  1. 建立全局规格: 通过 text_editor 建立 Final_Video_Spec.md,锁定标题、画幅(竖屏 9:16)、总时长(15-60 秒)、视觉风格(拼贴手绘贴纸风)、色调关键词、输出语言。
  2. 素材分析与复用判定: 若用户上传了角色参考图、旅行实景照片或风格参考图,先调用 resource_prepare_and_analyze 提取特征,将结果写入 Storyboard 元素描述。已有可用素材优先绑定,不重复生成。
  3. 生成 Storyboard: 调用 storyboard_designer,产出 key elements(角色 1-2 个 + 场景集)、shot 列表(4-8 个,按六节点叙事结构排布)、audio layers(BGM + 可选字幕)。
  4. 角色 key_element 图像生成: 调用 media_generator,为每个角色生成白底全身设定图(含 3-5 个动作变体),绑定到对应 key_element。生成后锁定角色外貌。
  5. 场景合成图生成(每 shot 的 keyframe): 调用 media_generator,以角色 key_element 图为参考,生成"手绘贴纸角色叠在真实旅行实景前景"的拼贴合成图。先生成第一张作为风格锚点,确认后再批量生成。
  6. 视频片段生成: 调用 media_generator,以每张场景合成图为 start_frame,生成 3-5 秒动态片段。按多模型策略选模型(默认 Sora-2 → 备选 Wan2.6 → 质量优先 Veo3.1 Fast)。
  7. 音频生成: 调用 media_generator,生成 BGM(text_to_instrumental,轻快治愈旅行风)。
  8. 最终组装与导出: 调用 video_assembler,按叙事顺序拼接片段,对齐 BGM 节拍,处理片段自带音频与 BGM 的音量平衡,叠加可选字幕,导出成片。

依赖关系: 2→1;3→1,2;4→3;5→4;6→5;7→3;8→5,6,7。

暂停确认节点(不在一步内跑完全流程):

  • 叙事线确认: 步骤 3 完成后,暂停展示 Storyboard 摘要(六节点结构、时长分配),请用户确认或调整后再进入生成。
  • 角色设定确认: 步骤 4 完成后,暂停展示角色设定图,请用户确认外貌、配色、风格后再继续。
  • 风格锚点确认: 步骤 5 生成第一张场景合成图后,暂停请用户确认拼贴效果、色调、透视是否满意,确认后再批量生成剩余场景图。
  • 成片确认: 步骤 8 完成后,展示成片,请用户确认或提出微调需求。

异常处理:

  • 角色与场景透视不匹配: 在提示词中加入 natural perspective, consistent scale,重新生成。
  • 角色一致性偏差: 确认 key_element 图是否正确绑定;在提示词中完整复述角色外貌,重试。
  • 视频生成全部失败: 停止当前 shot 生成,告知用户并建议调整 start_frame 或切换模型。
  • 总时长超 60 秒: 提示用户将叙事线拆分为多段分别制作后拼接,单次不超过 1 分钟。
2. 멀티모달 분석

用户上传素材分析:

  • 角色参考图/草图: 若用户上传角色参考图,提取性别、年龄、发型发色、服装配色、配饰等特征,转化为角色提示词描述。Storyboard 中的角色 key_element 描述须与上传素材一致,不得矛盾。
  • 旅行照片/场景参考: 若用户上传旅行实景照片,分析其场景类型、色调、光线条件、构图特点(纵深、引导线),作为场景生成的参考依据。将色调和光线描述提取为固定关键词,后续场景生成复用。
  • 风格参考图: 若用户上传拼贴/手绘风格参考,提取描边粗细、贴纸化处理方式、拼贴层次等风格特征,纳入风格关键词。
3. 스토리보드 설계

Key Elements 设计:

  • 角色(element character): 建议设计 1-2 个核心角色;超过 2 个时一致性维护难度显著增加,需提示用户。定义主角的完整外貌——性别、年龄、发型发色、服装配色、标志性配饰。注明风格固定关键词:flat 2D cartoon, thick black outline, sticker style。若角色需多个动作版本(行走、回望、坐姿等),在描述中列出各动作变体。
  • 场景(element scene): 按旅行叙事线定义关键场景,每个场景描述包含:地点类型、氛围色调、光线条件、纵深/引导线构图要素。首次确定色调关键词后(如 warm golden hour / cool fresh morning),后续场景复用。

Shots 设计:

  • 默认叙事结构(可调整,可按旅行天数或情绪弧线增删节点)。括号内为建议时长占比,以 20 秒成片为基准换算;总时长变化时按比例缩放,但单片段不低于 3 秒、不超过 5 秒:
    • 抵达(15% ≈ 3s): 角色站在车站/机场/入口,行李箱或背包在手,回望或抬头望向目的地标志——建立旅行起点与期待感
    • 初探(15% ≈ 3s): 角色走在标志性街道/广场/景点入口,四处张望、拍照——展现目的地第一印象与风貌
    • 美食体验(20% ≈ 4s): 角色坐在街边小吃摊/餐厅/咖啡窗前,手捧当地美食,满足表情——呈现味觉记忆与当地烟火气
    • 沉浸游览(15% ≈ 3s): 角色走进景点深处(神社参道/海边栈道/古巷阶梯),与环境互动(摸墙、驻足仰望、蹲下看花)——深化目的地氛围
    • 人文互动(20% ≈ 4s): 角色与当地人/市集摊主/街头艺人交流,或参与手作/体验活动——增加旅行的故事温度
    • 告别(15% ≈ 3s): 角色回望远景/夕阳剪影/车窗外渐远的风景,挥手或安静注视——收束情绪,呼应抵达
  • 总 shot 数 4-8 个,每个 shot 生成一张拼贴合成图作为 keyframe,再转为 3-5 秒视频片段。
  • 每 shot 描述须包含:
    • Scene: 引用场景 element ID
    • 角色动作: 角色在场景中的具体动作与姿态
    • Cinematography: 构图(角色置于前景偏下方或侧边,背景有纵深)、运镜方式(缓慢横移/推进)
    • Atmosphere: 光线与色调描述,须与已锁定的场景色调一致

Audio Layers 设计:

  • BGM: 至少一条全局背景音乐 track,风格为轻快治愈旅行风。注明音乐情绪和节奏。
  • 字幕(可选): 若用户需要字幕,注明手写体风格、标注地点或心情短语;字幕在后期剪辑阶段叠加,不在音频层生成。
4. 미디어 생성

角色 key_element 图像生成:

  • 使用 TextToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
  • 输出白底、全身、正面站立姿态的角色设定图。
  • 建议用同一提示词调整姿态描述,生成 3-5 个不同动作版本(行走、回望、坐姿等)备用,均绑定到同一角色 key_element。
  • 生成后锁定角色设定,后续步骤不得更改角色外貌。

场景合成图生成(每 shot 的 keyframe):

  • 使用 ImageToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
  • 参考输入:角色 key_element 图像(必选),确保角色一致性。若用户上传了旅行实景照片,可将其作为额外参考图传入。
  • 生成"手绘贴纸角色叠在真实旅行实景前景"的拼贴合成图。
  • 构图规则:角色置于前景(偏下方或侧边),实景背景有纵深感或引导线,角色与背景形成前后层次。

视频片段生成:

  • 使用 FirstFrameToVideo,aspect_ratio "9:16",resolution "720p"(1080p 需会员)。
  • 多模型策略(按优先级):
    • 默认:Sora-2 — 擅长镜头内切换与画面叙事感,适合拼贴风格的场景表达;角色为 2D 卡通贴纸(非写实人物),不受 Sora-2 写实人物高失败率限制。仅支持 720p,生成 4秒 片段。
    • 备选:Wan2.6 — 生成速度更快,适合批量产出时缩短等待;生成 5秒 片段。
    • 质量优先(关键记忆点 shot):Google Veo3.1 Fast — 画质最佳,用于美食体验/人文互动等情绪高潮节点;生成 4秒 片段。
  • 故障切换: 当前模型生成失败时,按 Sora-2 → Wan2.6 → Google Veo3.1 Fast 顺序在同工具内切换重试;若全部失败则停止并告知用户。
  • 每张场景合成图作为 start_frame,生成动态片段。
  • 动效须轻缓自然:缓慢横移/推进展现环境,角色轻微行走/发丝飘动/衣角微摆,氛围类光影变化/海浪/树叶摇晃。避免剧烈运动。

BGM 生成:

  • 使用 text_to_instrumental,推荐模型 Suno 5(备选 Mureka 8)。风格:轻快治愈旅行风。

一致性保障:

  • 角色一致性(最高优先级):场景合成图与视频生成均将角色 key_element 图作为参考输入;每次提示词完整复述角色外貌,不得省略。
  • 场景一致性:首次生成时确定色调和光线关键词,后续场景复用。
  • 风格一致性:固定使用 collage aesthetic, sticker-on-photo, thick black outline 等关键词。
5. 프롬프트 작성

语言规则: 提示词以英文为主(模型对英文理解更准确);输出字幕/文案可为中文,须遵循 Final_Video_Spec 的 Output Language。

角色提示词(TextToImage):

  • 结构:[age] [gender] [ethnicity] + [hair_description] + [clothing_description] + [accessory_description] + 风格固定关键词。
  • 风格固定关键词(每次必带):flat 2D cartoon illustration, thick black outline, sticker style, clean white background, full body, consistent character design。
  • 动作变体通过调整姿态描述实现(如 walking pose slight side angle / looking back pose three-quarter view / sitting pose casual)。

场景合成提示词(ImageToImage):

  • 结构:real photograph of [scene_description] + 2D flat cartoon sticker-style character superimposed on foreground + [character_full_description] + thick black outlines + collage aesthetic + [lighting/atmosphere] + natural perspective。
  • 角色外貌描述须完整复述,不得省略或改写。
  • 合成风格固定关键词:collage aesthetic, sticker-on-photo, superimposed on foreground, hand-drawn character overlaid on real scene, travel vlog aesthetic。
  • 场景关键词须包含纵深感(leading lines, depth of field, natural perspective)。
  • 色调关键词首次确定后复用(如 warm golden hour light / cool morning light / soft overcast)。

视频动效提示词(FirstFrameToVideo):

  • 结构:gentle [camera_movement] + the cartoon character [subtle_action] + [atmosphere_detail] + natural gentle motion + cinematic travel atmosphere + [lighting_condition]。
  • 动效约束:始终包含 subtle, gentle, slow 等约束词,降低运动幅度。
  • 动效类型:场景类(缓慢横移/推进)、角色类(轻微行走/发丝飘动/衣角微摆)、氛围类(光影变化/海浪涌动/树叶摇晃)。

一致性关键词库(按需融入提示词):

  • 角色风格:flat 2D cartoon illustration, thick black outline, sticker style, hand-drawn style, bold outlines
  • 合成风格:collage aesthetic, sticker-on-photo, superimposed, mixed media, scrapbook style
  • 一致性:same character, consistent style, same outfit, same hairstyle, consistent color palette, matching lighting
6. 동영상 조립

剪辑规格:

  • 画幅:竖屏 9:16(适配短视频平台)。
  • 总时长:15-60 秒;单次生成建议不超过 1 分钟,超长视频需分段制作后拼接。
  • 单片段时长:3-5 秒,按叙事顺序拼接。
  • 帧率:≥24fps,确保画面流畅。

转场:

  • 使用简单淡入淡出,保持手绘清新感,避免复杂转场效果。

音频:

  • BGM 贯穿全片,轻快治愈旅行风,节奏与画面切换对齐。
  • FirstFrameToVideo 生成的视频片段自带同步音频,须注意与 BGM 音轨的音量平衡;BGM 为主音轨时降低片段自带音量或静音,避免冲突。

字幕(可选):

  • 手写体风格,标注地点或心情短语,在后期阶段叠加。

节奏:

  • 转场与 BGM 节拍对齐,避免跳帧。
  • 叙事节奏与时长占比(以 20 秒为基准,按总时长比例缩放,单片段 3-5 秒):抵达 15%(≈3s,建立)→ 初探 15%(≈3s,展开)→ 美食体验 20%(≈4s,升温·记忆点)→ 沉浸游览 15%(≈3s,深入)→ 人文互动 20%(≈4s,高潮·记忆点)→ 告别 15%(≈3s,收束)。若总时长偏短(如 15 秒),优先压缩初探与沉浸游览,保留美食体验与人文互动的完整时长;若偏长(如 40-60 秒),可为美食体验或人文互动各加 1-2 个 shot 并适当延长,必要时将叙事线拆分为多段分别制作后拼接。