yeha.ai
목록으로

Immersive interior design tour

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

适用于梦想家居或生活空间以竖屏一镜到底 POV 探索视频呈现的场景。以分镜图为视觉参考驱动 Seedance 2.5(分辨率 480p) 生成竖屏一镜到底探索视频。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

整体流程与阶段依赖:

  1. 与用户确认核心需求:目标空间类型(客厅/卧室/全屋等)、风格关键词(如侘寂、轻奢、北欧极简)、参考图或文字描述。将结论写入 Final_Video_Spec.md(含:空间类型、风格基调、输出规格 9:16 竖屏、语言、总时长固定 30 秒)→ text_editor
  2. 若用户上传了参考图片或文档,先进行多模态分析,提取空间布局、材质、光源与风格信息 → resource_prepare_and_analyze
  3. 规划多宫格分镜结构(4–6 格内容、情绪弧光、运镜标注规则)→ storyboard_designer
  4. 生成横版全景室内图:以宽画幅呈现完整空间格局,作为整个项目的空间底片,绑定为 key element → media_generator暂停,向用户展示并确认全景图后再继续。
  5. 基于全景图,生成竖版多宫格分镜图(4–6 格,含导演运镜标注文字),绑定为分镜参考资产 → media_generator暂停,向用户展示并确认分镜图后再继续。
  6. 以多宫格分镜图为 reference_image,通过 Seedance 2.5(分辨率 480p) 生成竖屏一镜到底探索视频media_generator
  7. 生成环境氛围音轨 → media_generator
  8. 组装时间轴,完成最终竖屏探索视频 → video_assembler

依赖关系: 2→1;3→1,2;4→3;5→3,4;6→5;7→3;8→6,7。

阶段确认节点: 步骤 4(全景图)和步骤 5(分镜图)完成后各暂停一次,获得用户明确确认后方可进入下一阶段,不可一次性跑完整流水线。

2. 멀티모달 분석

当用户提供参考图片、情绪板或设计文档时:

  • 空间结构提取: 识别房间轮廓、主要家具布局、视线通道与纵深层次。
  • 材质与光感解析: 提取墙面/地面/家具材质(如哑光微水泥、水洗原木、大理石),判断主光源方向、色温(暖/冷/自然光)、软硬程度。
  • 风格关键词归纳: 将参考素材归纳为可供 Storyboard 与提示词使用的简洁风格标签(如"侘寂·漫射光·低饱和暖调")。
  • 竖屏构图适配: 分析参考图时,优先关注适合 9:16 竖屏画幅的纵向构图要素:高挑的天花/窗景、纵深走廊、垂直材质纹理等。
  • 输出结构化分析文本,供 storyboard_designermedia_generator 直接引用。
3. 스토리보드 설계

Key Element 设计

  • 将整个空间登记为一个 element scene(全景空间底片),描述包含:
    • 完整空间布局与主要功能分区;
    • 主要材质、陈设与风格关键词;
    • 主光源方向、色温与光影特征。
  • 若有标志性道具(艺术摆件、绿植、织物),可单独列为 element prop
  • 该 element 的图片资产即为后续生成的横版全景图,其 asset_id 将被绑定于此。

多宫格分镜结构规划(4–6 格 · 总时长 30 秒)
分镜图是一张单一图片,以竖版 9:16 宫格排列呈现完整的 30 秒叙事路径,每格代表该 30 秒内的一个时间节拍,Seedance 2.5(分辨率 480p) 将一次性读取整张分镜图并生成单条 30 秒一镜到底视频。设计时需明确每格的内容规则:

  • 每格时长分配: 总计 30 秒,按情绪弧光分配各格占比:
    • 第 1 格(Threshold):约 2–3 秒,入口建立;
    • 第 2–4 格(Discovery):约 8–10 秒(每格约 2–3 秒),向主体空间推进;
    • 末 1–2 格(Belonging):约 3–4 秒,焦点落定、节奏收敛。
    • 在格内标注参考时间区间(如"0–2s / 3–7s / 12–30s"),供 Seedance 2.5 对齐运动节拍。
  • 格序与情绪弧光对应:
    • 第 1 格(Threshold):入口或玄关视角,空间轮廓初现,色调偏冷或低饱和;
    • 第 2–4 格(Discovery):向主体空间推进的连续运动节拍,光线逐渐充盈,材质细节显现;
    • 末 1–2 格(Belonging):视觉焦点落定(窗边、床头、核心角落),光影最丰富,节奏收敛。
  • 每格必须标注的运镜指令文字(叠加在格内,作为导演标注):
    • 运镜类型:Handheld Pan / Walk-in / Lens Breathing / Gaze Hold;
    • 推进方向与幅度(如"缓步向落地窗推入,带轻微垂直位移");
    • 竖屏构图分配(上段/中段/下段内容,如"上:天花漫射光,中:沙发主体,下:木地板纹理")。
  • 视角高度锁定(全局固定): 整张多宫格分镜图中,所有格的镜头高度须统一固定为成人步行视角——离地约 155–170 cm,水平或略俯 5° 以内,模拟人类正常行走时的目视高度。禁止出现无人机俯瞰、仰拍地面、上帝视角或夸张透视;镜头高度在全部格之间保持连贯,不得跳变。
  • 格间视线衔接: 相邻两格的视觉中心需保持方向动量或空间逻辑连续,避免视线跳切。

独立音频层设计

  • 规划一条全程 ambient 环境声层(type: music):静谧室内底噪、隐约自然声,覆盖全片时长。
  • 可选规划一条 foley 步态音效层:配合 Walk-in 节拍叠入,其余格淡出。
4. 미디어 생성

第一步:生成横版全景室内图(空间底片)

  • 使用 TextToImage(无参考图)或 ImageToImage(用户提供参考图时)。
  • 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K,横版宽幅构图(16:9 或更宽)。
  • 生成后将 asset_id 绑定到 Storyboard 中的 element scene(全景空间底片)。
  • 此图须完整呈现空间全貌:主要家具布局、材质、光线状态,作为后续分镜图的视觉母版。

第二步:生成竖版多宫格分镜图(含运镜标注)

  • 使用 ImageToImage,以全景室内图为参考,生成一张竖版 9:16 多宫格分镜图(4~6 格)。
  • 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
  • 每格对应 Storyboard 中规划的一个探索节拍,格内叠加导演运镜标注文字(如"Walk-in · 向落地窗缓步推入")。
  • 生成后将 asset_id 注册并绑定为独立资产,供后续视频生成直接引用。

第三步:生成竖屏一镜到底探索视频

  • 使用 MultiModalToVideo,推荐模型:Seedance 2.5,分辨率 480p,竖屏 9:16。
  • 参考输入:
    1. 主参考图(reference_image): 多宫格分镜图——Seedance 2.5 读取其中的空间信息与运镜标注,将其转化为连贯的一镜到底 POV 运动;
    2. 补充参考图(可选): 若需强化特定材质或光线,可追加全景室内图作为第二参考。
  • 时长:固定 30 秒(Seedance 2.5(分辨率 480p) 单次最大上限),一次生成完整视频,无需拆分。
  • 不添加前序视频作为 reference_video,以分镜图驱动运镜逻辑为主。

音频生成

  • 使用 text_to_instrumental,推荐模型 Suno 5Mureka 8,生成 ambient 或 lo-fi 空间声学轨道,时长覆盖全片。
5. 프롬프트 작성

全局优先级: 用户使用中文交互时,提示词正文使用中文;音频标签内的内容保持项目输出语言。

横版全景室内图提示词(TextToImage / ImageToImage)

  • 结构:[空间全貌视角] + [主要功能分区与家具布局] + [材质与陈设细节] + [光线描述] + [风格标签]
  • 明确宽幅横版构图(16:9 或更宽),呈现完整空间纵深与横向延展感;避免局部特写。
  • 写实室内摄影感,自然白平衡,胶片颗粒质感,禁止商业渲染过曝或 CGI 风格。

竖版多宫格分镜图提示词(ImageToImage)

  • 基于 <<<image_1>>>(全景室内图),生成竖版 9:16 多宫格分镜图,共 N 格(对应 Storyboard 规划格数)。
  • 每格内容描述需对应 Storyboard 中该格的空间视角与情绪阶段(Threshold / Discovery / Belonging)。
  • 视角高度全格锁定: 每格画面均须明确声明"成人步行视角,镜头高度约 160 cm,水平朝向",禁止出现无人机俯瞰、地面仰角或夸张透视;所有格保持同一视角高度,不得跳变。
  • 每格须渲染导演运镜标注文字,文字简洁清晰(如"Walk-in · 缓步推入落地窗"),叠加于格内画面角落,字体风格参考电影分镜手稿。
  • 整体图面保持一致的室内风格与光线氛围,来自同一空间底片。
  • 禁止额外人物出现,no subtitles,no commercial rendering look。

一镜到底视频提示词(MultiModalToVideo / Seedance 2.5(分辨率 480p))

  • 参考绑定: <<<image_1>>> 对应多宫格分镜图;如追加全景图则为 <<<image_2>>>。
  • 运镜指令层级(严格遵循此顺序):
    [一镜到底声明 + 时长 30s] → [整体 POV 运动路径,按分镜格顺序描述,含各格参考时间区间] → [各段空间视角与光影变化] → [竖屏三段构图分配] → [音频标签]
  • 明确声明"30 秒单次连续 POV 推进,无切剪",并在路径描述中按分镜格的时间区间标注节拍(如"0–2s 入口建立 → 3–10s 向落地窗推进 → 11–30s 窗边凝视收敛"),让 Seedance 2.5 将分镜图中的多格视角和时间节奏融合为流畅的一镜运动。
  • 视角高度锁定(全程固定): 明确声明"成人步行视角,镜头高度约 160 cm,水平朝向,全程保持一致",禁止任何俯拍、仰拍或无人机视角;在路径描述中每个节拍均不得出现视角高度漂移。
  • 竖屏专项: 声明 9:16,描述画面纵向三段内容分配(上/中/下)。
  • Seedance 2.5(分辨率 480p) 音频标签:** 环境声用 (...),步态音效用 <...>;若已有独立音轨,加 no music。
  • 固定负向屏蔽: no subtitles,no cuts,no jump cut,no character morphing,no commercial rendering look,no quotes。

示例(客厅一镜到底):
基于 <<<image_1>>>(多宫格分镜图)与 <<<image_2>>>(全景室内图)。竖屏 9:16,30 秒单次连续第一人称 POV,无切剪。运动路径:0–2s 玄关入口缓步进入(Handheld Pan,轻微物理震动)→ 3–10s 向落地窗方向步行推进(Walk-in,带垂直位移)→ 11–30s 在窗边凝视停留(Gaze Hold,极缓收敛)。上段:天花漫射光与窗帘纱影;中段:微水泥墙面与布艺沙发区;下段:哑光木地板渐近。(静谧室内底噪,隐约窗外风声) <轻柔步伐声>。no music, no subtitles, no cuts, no quotes.

6. 동영상 조립

竖屏时间轴组装

  • 以 9:16 竖屏规格组装,核心视频为一镜到底探索视频,若因时长原因拆分为多段则无缝拼接,对外呈现为单条连贯视频。
  • 音频混合: 环境氛围音轨全程铺底,音量低于视频原生音效;foley 步态层随 Walk-in 运动段落叠入,其余段落淡出。
  • 情绪落地处理: 参考 Storyboard 中的情绪阶段标注(Threshold → Discovery → Belonging),在 Belonging 阶段结尾收缩音量、轻微降速,形成情绪沉淀感;避免视频硬结尾,优先以淡出收场。
  • 节奏控制: 整体保持沉浸舒缓节奏;若多段拼接,拼接点选在运动方向一致的过渡帧,避免视线跳切。