yeha.ai
목록으로

Chinese millennium dreamcore

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

用于创作"千禧年梦核"风格的怀旧叙事短片——以2000年前后中国童年生活场景为核心,用GPT Image 2生成图像资产,用Seedance 2.5生成带音视频的镜头,营造熟悉的陌生感与阈限空间氛围。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

整体工作流(分阶段执行,每阶段结束后暂停并向用户确认):

  1. 画幅与叙事视角确认阶段

    • 用卡片询问用户:画幅选择 16:9(横屏) 还是 9:16(竖屏)
    • 用卡片询问用户:叙事视角选择 第一人称 还是 第三人称
    • 将用户选择记录到后续 Final_Video_Spec.md 中,作为全局锁定参数。
  2. 剧本确认阶段

    • 用卡片询问用户:剧本由用户提供还是AI生成。
    • 若AI生成 → 默认贴近2000年前后中国童年生活,从"梦核场景池"(见 Storyboard Designer)中选取1–3个场景,编织一段没有宏大叙事、但每处空间都像藏着一段童年录像的短故事;剧本中不使用旁白(narration / VO),所有人声均为现场对话(dialogue)与画外空间的嬉笑打闹声,由 Seedance 2.5 随视频同步生成。
    • 若AI生成剧本,先用卡片询问用户:剧本中是否需要出现人物
      • 有人 → 按有人剧本生成,设计具体角色与互动,人声为现场对话与画外嬉笑打闹。
      • 无人 → 以展现千禧年环境为主,镜头聚焦空间质感与时代物件,营造空旷的阈限空间氛围;不生成人物 key_element,人声仅保留画外空间的声音(远处嬉笑打闹、邻居电视声等)。
    • 生成剧本后暂停,等用户确认或修改再继续。
  3. 资产来源确认阶段

    • 用卡片询问用户:场景资产由用户提供还是AI生成;若阶段2选择了"有人"剧本,同时询问人物资产来源。
    • 若用户提供 → 调用 resource_prepare_and_analyze 理解上传素材,再在 Storyboard 中将描述与素材对齐。
    • 若AI生成 → 按下述规则生成 key_element 图像。
  4. 全局参数锁定

    • 通过 text_editor 建立 Final_Video_Spec.md,写入:标题、类型(千禧年梦核怀旧短片)、画幅(阶段1用户选择的 16:9 或 9:16)、叙事视角(阶段1用户选择的第一人称或第三人称)、是否有人物、时长意图、视觉风格(青绿焦黄、胶片颗粒、荧光灯冷调、轻微过曝)、输出语言。
    • 暂停,等用户确认全局参数。
  5. Storyboard 设计storyboard_designer

    • 设计 key elements(场景 + 道具;若"有人"剧本则含人物)和 shot 列表,以及独立音频层。
    • 若用户选择了第一人称视角,shot 的运镜设计须包含轻微的手持呼吸感——抖动幅度要小,仅模拟自然呼吸节奏,不可剧烈晃动(详见 Storyboard Designer)。
    • 暂停,等用户确认 Storyboard。
  6. Key Element 图像生成media_generator

    • 使用 GPT Image 2 生成场景(及道具)的 key_element 图像;若阶段2选择了"有人"剧本,同时生成人物 key_element 图像。
    • 若用户在阶段3提供了素材,绑定到对应 element 后补齐缺失部分。
    • 暂停,等用户确认元素资产。
  7. 镜头视频生成media_generator

    • 使用 Seedance 2.5(经 MultiModalToVideo)逐镜头生成带同步音频的视频,参考该 shot 对应的人物与场景 element 图像。
    • 暂停,等用户确认镜头素材。
  8. 音频层生成media_generator

    • 默认不生成 BGM。 所有声音以 Seedance 2.5 随视频同步生成的现场音轨为准(环境音、现场对话、画外嬉笑打闹等)。本 Skill 不使用旁白(narration / VO)。
    • 仅当用户在组装前明确要求添加 BGM 时,才使用 text_to_instrumental 生成一条梦核电子风格(dream-core electronic)BGM,风格偏低保真迷幻电子、空灵疏离,避免欢快旋律。
  9. 最终组装video_assembler

    • 组装时间线并引导用户导出。

依赖关系: 4→1,2,3;5→4;6→5;7→6;8→5;9→6,7,8

暂停规则: 每个带编号的阶段完成后必须暂停,用卡片或 reply_to_user 邀请用户确认后再进入下一阶段,不要一次性跑完全流程。

2. 멀티모달 분석
  • 当用户上传参考图片或视频时,重点提取以下信息并输出为结构化文本:
    1. 时代标识物:CRT显示器、软盘、MP3播放器、翻盖手机、旧广告灯箱、白色瓷砖墙、浅蓝色玻璃等千禧年物件。
    2. 色彩与影调:青绿色调、焦黄色调、荧光灯冷调、轻微过曝程度、胶片颗粒质感。
    3. 构图特征:对称/中心构图、低视角窥视感、极简点缀(画面中1–2个强记忆符号)。
    4. 空间类型:识别场景属于哪类千禧年公共空间(微机教室、公园、商场、书店、网吧门口等)。
  • 将分析结果与 Storyboard 中的 element 描述对齐:若上传素材与既定描述冲突,以用户素材为准修正 Storyboard。
3. 스토리보드 설계

梦核场景池(AI 生成剧本时从中选取 1–3 个):
微机教室、人民公园碰碰车、快餐店生日派对、高空旋转餐厅、县城老商场、童装层、电脑城、新华书店、网吧门口、报刊亭、筒子楼走廊/楼道(声控灯、绿墙裙)、街边大排档/粤菜小炒、学校操场/放学、老式理发店、公共澡堂、家中饭桌前看电视、报刊栏/宣传栏、客厅(午后午睡醒来)、街上(柏油路放学路上)、水族馆、路边街机、泳池、小卖部。

设计 key elements:

  • 人物(若剧本含人): 若角色有多套造型,在描述中分别说明(造型1:…;造型2:…)。
  • 场景: 描述场景中重要物件的位置与朝向——尤其是道具或主要动作发生的区域。融入时代物件(白色瓷砖墙、浅蓝色玻璃、旧广告灯箱、塑料绿植、玻璃柜台、CRT显示器、蓝色塑料椅等)。
  • 道具: 千禧年标志性道具(MP3播放器、电子宠物蛋、CCD相机、软盘、游戏光盘等)按需设为独立 element。
  • 用户素材: 若用户提供了参考素材,描述须与素材一致,不可矛盾。

设计 shots:

  • 时长: 优先 10–15s,最短不低于 5s,不超过 15s(Seedance 2.5 上限)。
  • 每个 shot 描述须包含:
    • Scene: 用场景 element ID 引用位置/场景。
    • Story beats: 角色与关键物件的动作和动态;对话与表演。写明确切台词(口语对话),用 element ID 引用角色。若剧本选择"无人",此处描述环境中的动态变化(光影移动、物件声响等)。
    • Cinematography: 镜头景别(远景、中景、特写)、机位角度、运镜方式。
  • 第一人称视角处理: 若 Final_Video_Spec 锁定为第一人称,运镜标注"第一人称主观视角",以轻微手持呼吸感为主——仅模拟自然呼吸节奏的极微幅起伏,不可剧烈晃动,幅度克制柔和;配合低角度(小孩身高)和视线引导(从门缝、窗棂、屏幕向内看),既避免稳定器式的完全平滑,也避免夸张晃动破坏梦核的静谧感。
  • 第三人称视角处理: 以"固定机位""缓慢推进""微摇"为主,强调旁观距离感与空间空旷感。
  • 构图密码: 对称/中心构图制造不自然秩序感;低视角/窥视感增加叙事压力;极简点缀——一组画面仅保留 1–2 个强记忆符号(如"暑假作业""福"字)。

设计跨镜头音频:

  • 默认不设 BGM: 所有声音以 Seedance 2.5 随视频同步生成的现场音轨为准。仅当用户明确要求时,才设计一条梦核电子风格(dream-core electronic)BGM 写入独立音频层。
  • 不使用旁白(narration / VO): 本 Skill 无独立旁白层。
  • 现场对话(dialogue): 写在 shot 的 Story beats 中,为画面内角色的口语对白。
  • 画外人声: 嬉笑打闹、远处呼唤、邻居电视声等画外空间声音写在 Cinematography 或音频描述中,营造"隔壁还有人在生活"的真实感。若剧本选择"无人",人声仅保留画外人声。
4. 미디어 생성

Key Element 图像生成:

  • 使用 TextToImage,模型 GPT Image 2,分辨率 2K
  • 人物 key_element 图: 生成一张包含三视图(正面、侧面、背面)+ 人物近景特写的横向合成图。画幅使用 16:94:3(GPT Image 2 支持的横向比例)。提示词必须以"生成一个中国2000年前后的[角色描述]人物"开头,根据剧本描述角色的衣着、发型、随身物品等时代特征。
  • 场景 key_element 图: 生成各场景的整体环境图,画幅 16:9。提示词需包含场景中的时代物件、色彩影调(青绿/焦黄/荧光灯冷调/胶片颗粒/轻微过曝)。
  • 同一人物多造型: 使用 ImageToImage(模型同为 GPT Image 2),以已生成的基础人物图为参考,保持身份一致性。
  • 若用户在阶段3提供了素材,先通过 resource_prepare_and_analyze 分析后绑定 asset_id 到对应 element,再补齐缺失 element。

镜头视频生成:

  • 使用 MultiModalToVideo,模型 Seedance 2.5
  • 参考绑定: 每个镜头通过 image_infos(≤9 张)传入该 shot 涉及的人物、场景及道具 element 图像作为视觉参考;用 <<<image_1>>>、<<<image_2>>> 等占位符在 prompt 中标注各参考图的引用顺序与引用内容(如人物外貌、场景环境)。若需更强画面控制,可先用 ImageToImage 合成一张该 shot 的 keyframe 构图参考图,一并作为 image_infos 传入。
  • 分辨率: 480p(默认),亦支持 480p;画幅: 16:9 / 9:16 / 4:3 / 3:4 / 1:1 / 21:9(与 Final_Video_Spec 锁定一致);时长: 优先 10–15s,最短不低于 5s(不超过 15s,Seedance 2.5 上限)。
  • prompt 字符上限 2300(含 <<<image_X>>> 占位符),需同时描述视觉运动和音频元素(环境音、对白、SFX)。
  • 音频参考(可选): 若需保持角色对话音色跨镜头一致,可将角色的 key_element_audio 通过 audio_infos(≤3 条)传入;未绑定时可不传。

音频层生成:

  • 背景音乐(bgm)默认不生成: 所有声音以 Seedance 2.5 随视频同步生成的现场音轨为准。仅当用户明确要求添加 BGM 时,才使用 text_to_instrumental 生成一条梦核电子风格(dream-core electronic)BGM(低保真迷幻电子、空灵疏离,避免欢快旋律)。
  • 不生成旁白(narration / VO): 本 Skill 不使用 text to narration 生成独立旁白层。所有人声(现场对话、画外嬉笑打闹等)均由 Seedance 2.5 随视频同步生成。

模型失败处理:

  • GPT Image 2 失败时,切换至同工具内其他模型(如 Nano Banana Pro)。
  • Seedance 2.5 失败时,优先切换至 Kling 3.0 Omni(可灵在 MultiModalToVideo 工具内的最佳模型);若 Kling 3.0 Omni 也失败,再尝试 Seedance 2.5。
  • 若整个工具内所有模型均失败,停止该步骤并告知用户。
5. 프롬프트 작성

语言规则: 用户使用中文交互时,prompt 正文用中文;画面中出现的文字(如海报、屏幕界面)按 Final_Video_Spec 输出语言渲染。

图像 prompt(TextToImage / ImageToImage · GPT Image 2):

  • 以导演+美术指导的口吻撰写:自然语言描述主体+动作+环境,短句描述风格/色彩/光影/构图
  • 人物 key_element 必须包含:"生成一个中国2000年前后的[角色身份]"开头词,随后描述衣着(如校服、低腰牛仔裤)、发型、随身物品(MP3耳机、电子宠物蛋)、表情气质。
  • 三视图+近景合成图:在 prompt 中明确要求"横向排列:左侧正面全身、中间侧面全身、右侧背面全身,最右侧头部近景特写",确保四部分在同一张图中。
  • 场景 key_element:必须融入时代物件关键词(白色瓷砖墙、浅蓝色玻璃、CRT显示器、旧广告灯箱、玻璃柜台等)和影调关键词(青绿色调、焦黄色调、荧光灯冷调、胶片颗粒加重、轻微过曝)。
  • 构图指令:在 prompt 中写入"对称中心构图、低视角窥视感、画面仅保留1–2个记忆符号"等构图密码。
  • 画面中如需出现文字(如"千年虫检测"、"OICQ"、"2000年倒计时"),引用精确可渲染字符串

视频 prompt(MultiModalToVideo · Seedance 2.5):

  • 结构: 运镜(如缓推、固定、微摇)→ 主体动作与表情 → 环境细节变化 → 音频描述(环境音/SFX/对白)。
  • 参考图占位符: 用 <<<image_1>>>、<<<image_2>>> 等在 prompt 中标注每张参考图引用的内容(如 <<<image_1>>> 为人物外貌参考),占位符计入字符上限。
  • 第一人称视角运镜写法: 若 Final_Video_Spec 锁定为第一人称,运镜部分必须写入"手持拍摄、极轻微的呼吸感晃动、幅度克制柔和、不可剧烈抖动"等指令;配合主观视角描述(如"视线从门缝望进去""低头看向手中的电子宠物蛋"),既避免稳定器式的完全平滑,也避免夸张晃动。
  • 第三人称视角运镜写法: 若为第三人称,运镜以"固定机位""缓慢推进""微摇"为主,强调旁观距离感与空间空旷感。
  • 音频描述必须具体:写明环境音(如"老吊扇吱呀转动声、远处蝉鸣")、SFX(如"QQ咳嗽提示音")、对白(如有,用引号括出并注明语言)。
  • 人声全部写进视频 prompt:本 Skill 不使用独立旁白层,现场对话(dialogue)和画外人声(嬉笑打闹、远处呼唤等)均需在视频 prompt 的音频描述部分写明,由 Seedance 2.5 随视频同步生成。
  • 字数控制: prompt + 占位符总计不超过 2300 字符,保持描述精炼。
  • 影调提醒: 在 prompt 末尾附加影调标签,如"胶片颗粒质感、青绿冷调、轻微过曝、怀旧梦核氛围",确保模型延续视觉风格。
6. 동영상 조립
  • 音频同步: 默认时间线上无 BGM 层,仅保留各镜头 Seedance 2.5 同步生成的现场音轨(环境音、现场对话、画外人声);本 Skill 无独立旁白层。
  • 若用户要求了 BGM: 将梦核电子 BGM 作为底层铺底叠加,音量不盖过现场人声。
  • 节奏与衔接: 镜头间以缓慢溶解或直接切为主,保留梦核氛围的疏离感与时间停滞感;避免快剪或炫技转场。
  • 导出引导: 组装完成后引导用户导出。