yeha.ai
Back to templates

City superhero blockbuster

Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.

上传一张你的照片,选择一座城市,就能生成一段以你为主角的真人城市英雄大片。使用Seedance 2.5模型,720p,16:9。

Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.

Complete workflow

1. Planning

工作流(逐步暂停等待用户输入):

  1. 等待用户上传照片 — 向用户说明需要上传一张个人照片作为人物身份和服装参考。暂停,等待用户上传完成后才能继续。上传后通过 resource_prepare_and_analyze 分析照片,提取人物外观特征(面部、体型、服装、发型),生成 semantic_output 供后续步骤使用,并将照片注册为 reference_image。
  2. 等待用户选择城市 — 照片确认后,向用户展示城市选择:预置中国30个省会/大城市(例如上海、广州、深圳、成都、杭州、武汉、西安等)+ 世界20大城市(如纽约、伦敦、东京、巴黎、迪拜、洛杉矶、悉尼等),同时允许用户自由输入城市名称。暂停,等待用户选择后才能继续。选定后,Planner 在 Final_Video_Spec.md 中记录该城市的标志性建筑、特色街道、天际线特征和代表性交通工具(如纽约→黄色出租车/褐石建筑/消防梯;伦敦→黑色出租车/泰晤士河/红砖建筑;东京→霓虹巷道/东京塔等)。
  3. 剧情判定(Planner 自动判断) — Planner 根据用户在对话中是否提供了剧情/脚本/动作描述,自动判断走以下哪条分支,无需询问用户:
    • 无剧情模式:用户只上传照片+选城市,未提供任何剧情文本 → 走固定28s单shot模板流程(当前默认行为)。
    • 有剧情模式:用户提供了剧情/脚本/动作描述 → Planner 评估剧情总时长:
      • ≤30s:按剧情实际时长设计单 shot,不拆分。
      • >30s:按叙事节拍拆分为多 shot,每个 shot 尽量接近30s但不强制,总 shot 数尽量少;禁止过度碎片化(如3s+5s+8s),每个 shot 不得低于8s。
  4. 生成人物三视图 — 通过 media_generator 使用 ImageToImage(推荐模型 Nano Banana Pro),以用户上传照片为参考,生成一张纯白背景的人物三视图(正面、侧面、背面并排),确保人物身份、服装、发型、体型与照片完全一致。纯白背景的目的是避免原始照片中的环境元素污染视频画风。生成的三视图注册为人物 key_element 的 reference_image,替代原始照片作为所有 shot 的身份参考。
  5. 建立 Final_Video_Spec.md 并设计 Storyboard — 通过 text_editor 先建立 Final_Video_Spec.md,锁定全局参数(16:9、720p、Seedance 2.5、视觉风格、选择的城市及其地标信息、时长模式与总时长)。然后通过 storyboard_designer 设计镜头:
    • 无剧情模式:固定28s单shot,使用当前10阶段固定时间轴模板。
    • 有剧情且≤30s:单shot,按用户剧情节拍设计场景阶段。
    • 有剧情且>30s:多shot,每个shot覆盖一个完整叙事段落,shot间注明连续性关系。
  6. 生成视频 — 通过 media_generator 生成视频:
    • 单shot模式:参考人物三视图(reference_image)一次性生成完整视频。
    • 多shot模式:按 storyboard 顺序逐 shot 生成;当后续 shot 与前一段连续性极强时,可将前一段 final_shot 作为 reference_video 传入。每个 shot 均以人物三视图为 reference_image。
  7. 组装与输出 — 通过 video_assembler 组装:单shot直接输出;多shot按 storyboard 顺序拼接,保持音画连续性。
    关键依赖与注意事项:
  • 每一步必须在用户确认/提供输入后才能进入下一步,不可跳过暂停点,每一步确认采用按钮式,即“确认”按钮加上“修改”按钮。
  • 第2步依赖第1步照片上传完成。第3步依赖第1步和第2步。第4步依赖第1步。第5步依赖第3步剧情判定和第4步三视图生成完毕。第6步依赖第5步 storyboard 设计完毕。第7步依赖第6步所有 shot 生成完毕。
  • 城市选定后,Planner 需根据所选城市补充该城市地标和街道特征信息,替换 prompt 模板中的 [选择城市] 占位符。
  • 时长处理:无剧情时固定28s不询问;有剧情时按剧情实际需要灵活设定,单shot≤30s,超30s时按叙事节拍拆分多shot,每段尽量长、尽量少,禁止碎片化。
  • 三视图替代原始照片:所有 shot 的 reference_image 统一使用三视图,不再直接使用原始上传照片,避免照片中的背景环境干扰视频生成。
  • 多shot连续性:仅当后续 shot 与前一段连续性极强时才添加 reference_video;通常情况下仅使用三视图作为参考即可。
2. Multimodal analysis

用户上传照片分析:

  • 分析上传的人物照片,提取关键身份特征:面部轮廓与五官比例、肤色、发型与发色、体型比例、服装款式与颜色、配饰。
  • 将提取的特征结构化为 semantic_output,供 prompt 写作时引用,确保视频生成保持与照片一致的人物外观。
  • semantic_output 中需包含三视图生成所需的指导信息:确认人物的正面/侧面/背面外观一致性要点(如发型是否对称、服装是否有背部细节、配饰在侧面是否可见等),以便后续 ImageToImage 生成三视图时保持准确。
  • 原始照片注册为 reference_image,作为三视图生成的输入参考;三视图生成后,三视图替代原始照片成为所有 shot 的 reference_image
  • 写实风格标注semantic_output 中需明确标注人物为真人,所有下游生成(三视图和视频)必须保持真人写实摄影风格,禁止输出2D动漫、3D渲染、插画或卡通风格。
  • 角色服装标注semantic_output 中需标注角色的服装和裤子完全沿用上传照片中的穿着——记录照片中服装的款式、颜色、材质、裤型等细节,供三视图和视频生成时严格匹配。角色具备发射蛛网的能力,但服装不做任何替换或转化,始终以照片中的真实穿着为准。
3. Storyboard design

时长模式分支:

  • 无剧情模式:固定28s单shot(一镜到底),使用以下10阶段固定时间轴模板。
  • 有剧情且≤30s:单shot,按用户剧情节拍设计场景阶段,总时长按剧情定(≤30s)。
  • 有剧情且>30s:按叙事节拍拆分为多shot,每个shot覆盖一个完整叙事段落,时长尽量接近30s但不强制,总shot数尽量少,每个shot不得低于8s,禁止过度碎片化(如3s+5s+8s)。shot间注明连续性关系(哪些shot需要前后衔接)。
    无剧情模式固定单镜头(28s,一镜到底):
    仅一个 shot(Shot 1,0–28s)。以下场景阶段及其时间分配为固定模板,不得修改、删减、合并或重新分配时间——场景描述须忠实写入 shot description,prompt 须忠实复现。
    Key Elements:
  • element character:用户上传照片中的人物。身份参考为纯白背景人物三视图(正面/侧面/背面)。服装和裤子完全沿用上传照片中的穿着,不做任何替换或转化。角色具备发射蛛网、城市摆荡穿越的能力。代词和称呼应与照片中人物性别一致(用户模板使用"她",实际以照片为准)。
  • element scene:用户选择的城市。包含该城市标志性建筑、特色街道、天际线。城市地标和代表交通工具根据用户选择动态确定。
    Shot 1 场景阶段(固定时间轴,逐段写入):
  • 0–4秒(卧室开场):卧室内部——一侧有床、架子、海报、散落的衣服,柔和阳光洒入,透过大大的敞开窗户可见[选择城市]天际线。人物坐在窗台上,姿态舒适却稳健,充满活力。望着前方说"Let's Go?",双手戴上耳机,自信微笑,以柔和而坚定的动作向后翻身跃出敞开窗户。镜头顺畅跟随离开房间。
  • 4–5秒(蛛丝特写):下落过程中极近距离特写角色的手。手指张开,手腕向前弹射,蛛丝从角色伸出的手连续延伸至上方建筑锚点,形成完整不间断弧线。镜头迅速后拉揭示下方城市景观,高楼大厦耸立在背景中。
  • 5–8秒(低空摆荡):温暖午后阳光,广角无人机追踪[选择城市]标志街道上空。人物在街道上方约3米高度极低空摆荡,经过砖墙公寓外观、消防逃生梯、商店、阳台、街边停泊车辆及繁华大道。背景中可见标志建筑大厦。双手紧握蛛丝,双腿并拢伸直,身体呈流线型。摆荡最低点高跟鞋轻擦街边停泊车辆车顶并物理反弹调整动量。镜头与人物一同倾斜40度。
  • 8–11秒(墙面奔跑):最高点松开蛛丝,空中舒展身体,侧身降落在经典建筑墙面。垂直墙面持续奔跑,身体向墙倾斜45度,高跟鞋踩踏墙面,双手保持平衡。沿外观水平快速迈出5–6步。墙面或屋顶无汽车。用力一蹬发射蛛丝——蛛丝从角色的手连续延伸至对面建筑锚点——穿越繁华标志性大道宽阔空间。下方街道可见出租车和车辆。蛛丝猛地将人物拉向一侧,镜头翻滚捕捉力量。
  • 11–14秒(街道穿越):低空掠过出租车、公交车、人行横道、湿润路面,以及带有温暖反射光的繁华大道。地面2米飞行后松开蛛丝降落在湿润街道上,转化为奔跑。快速3–4步穿过人行横道线和街头交通。出租车鸣笛,人物笑了笑。一脚踩上街边出租车车顶用力爆踩跨过,向上跃起发射蛛丝,大喊"哇哦哦哦!"高高升空。
  • 14–15秒(天际线收尾):短暂广角屋顶高度收尾镜头。人物到达摆荡最高点,悬挂在金色时刻城市天际线背景下,停顿在令人屏息的一瞬间。屋顶上无汽车或出租车。城市标志建筑大厦清晰可见,高耸而富有标志性,以天空为背景。下方:密集屋顶、露台、水箱、消防逃生梯、狭窄街道,以及夕阳雾气。巨大云朵在橙色和金色光芒中闪耀,镜头保持电影感画面。
  • 15–18秒(蛛丝荡行与城市杂技):动态镜头展示人物滑翔穿过高耸城市巷道,在蛛丝线上荡行,降落在屋顶上,并在俯瞰城市天际线的豪华屋顶泳池上方飘浮。
  • 18–23秒(日落三明治时刻):宁静广角镜头,人物在日落时随意坐在高空钢梁结构上,眺望城市天际线,一边快乐地吃着三明治。
  • 23–25秒(霓虹巷道与倒挂相遇):夜晚,在发光霓虹灯照亮的巷道中,人物倒挂在蛛丝线上,对着窗台上的一只黑猫温暖地微笑。
  • 25–28秒(返回家中):人物用蛛丝荡回阳台,翻身进入室内,然后带着大大的笑容瘫倒在沙发上,快乐地打电话。
    台词: "Let's Go?"(0–4秒),"哇哦哦哦!"(11–14秒)。
    环境规则(须体现在每个场景中):
  • 汽车和出租车仅存在于道路/街道上,绝不出现在屋顶、阳台、露台、墙面或天际线镜头中。
  • 屋顶镜头仅显示屋顶、露台、空调外机、水箱、天线、高楼和天际线元素。
  • 高跟鞋擦车顶仅发生在低空摆荡时与街边停放车辆接触。
  • 踩出租车场景仅发生在街道上行驶或停靠的出租车上。
    音频设计:
  • 不设计独立背景音乐音轨。视频内台词、环境音效和动作音效由 Seedance 2.5 模型同步生成。
4. Media generation

人物三视图生成(在 shot 生成之前执行):

  • 使用 ImageToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K,宽高比 16:9
  • 输入:用户上传照片作为 image_ids 参考。Prompt 要求生成纯白背景的人物三视图——正面、侧面、背面三个视角水平并排排列,保持与参考照片完全一致的脸部特征、肤色、发型、体型。人物描述不要写例如:面部为柔和的椭圆偏长轮廓,圆脸之类,一定要忠于原图参考;服装处理:角色的衣服和裤子完全沿用上传照片中的穿着,不做任何替换或转化,三视图中角色必须穿着与照片完全相同的服装和裤子。背景必须为纯白色,无任何环境、道具或阴影。三视图必须为真人写实风格(photorealistic real person),prompt 中需明确写明"真人写实摄影风格",并附加约束"非2D动漫、非3D渲染、非插画、非卡通"。
  • 生成后将三视图注册为人物 key_element 的 reference_image,替代原始照片作为所有 shot 的身份参考。原始照片仅保留为三视图生成的输入,不再直接用于 shot 生成。
  • Nano Banana Pro 在复杂多图布局和角色一致性方面表现最佳;若不可用可降级为 Nano Banana 2 (Gemini 3.1 Flash Image)。
    视频生成配置:
  • 使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 720p,宽高比 16:9,单次生成时长上限 30s(在 4–30s 范围内)。
  • 无剧情模式:固定28s单段生成,仅生成一个 final_shot,不拆分、不拼接。
  • 有剧情模式:按 storyboard 设计的 shot 数量逐个生成。每个 shot 时长由剧情决定,≤30s。多个 shot 时按 storyboard 顺序逐个生成。
  • 多 shot 连续性参考:仅当后续 shot 与前一段连续性极强时,将前一段 final_shot 作为 reference_video 传入;通常情况下仅使用三视图作为 reference_image 即可。
    参考绑定规则:
  • 人物参考绑定:人物三视图作为 reference_image,通过 image_infos 传入,绑定到人物 key_element。生成前调用 query_assets_info 确认绑定状态;若缺失则通过 manage_item_assets 绑定并重新查询验证。
  • 多 shot 模式:每个 shot 均需绑定人物三视图作为 reference_image;当某 shot 使用前一段 final_shot 作为 reference_video 时,同样需先绑定再生成。
  • 无需 audio_infos,不生成任何背景音乐(BGM)。视频内台词、环境音效和动作音效由 Seedance 2.5 模型同步生成,无需独立音频参考。
    Asset Binding Contract:
  • 遵循当前 manage_item_assets 契约,使用 Storyboard 中的实际目标 ID。
  • 绑定前先 query_assets_info,缺失时调用 manage_item_assets 并保留完整绑定数组,绑定后重新查询验证。
  • 从资产的实际用途和计划位置解析绑定类型,不凭媒体标签推断角色。
5. Prompt writing

模式分支:

  • 无剧情模式:使用下方的固定10阶段时间轴 Prompt 模板。
  • 有剧情模式:按 storyboard 中每个 shot 的设计编写 prompt,不再套用无剧情模式的固定10阶段模板。阶段数量和内容由 storyboard 根据剧情自由设计,不限制具体几个阶段、不限制每段时长。但须遵守以下结构规则:
    • 时间标记习惯:当一个 shot 内有多个场景节拍时,仍用时间标记(如"0–4秒:")分段描述,让模型理解每段持续时长,避免一个动作撑满全段;若该 shot 只有一个连续场景,则不需要拆时间标记。
    • 场景多样性原则:每个 shot 内部要有场景和动作的变化,避免"一个动作飞满全段";具体场景内容由 storyboard 决定,prompt 须忠实还原 storyboard 中的场景节拍。
    • 沿用全部 standing constraints:人物身份锁定(三视图)、真人写实风格、蛛丝发射方向与连续性、无 BGM、身体比例完整性——与无剧情模式一致,必须写入每个 shot 的 prompt。
    • 字符数控制:每个 shot 的 prompt ≤ 2,300 字符;浓缩优先级与无剧情模式相同(人物锁定 > 场景节拍 > 环境规则 > 风格标签)。
      Prompt 模板结构(填入 MultiModalToVideo 的 prompt 字段):
      每个 shot 生成一段独立 prompt,总字符数含标签须 ≤ 2,300。按以下优先级组织内容:
  1. 人物身份锁定:<<<image_1>>> 为纯白背景人物三视图(正面/侧面/背面),作为人物身份和服装的绝对参考标准。保持相同脸部特征和比例。角色的衣服和裤子完全沿用上传照片中的穿着,不做任何替换或转化,严格遵循三视图中角色的原始服装。角色具备发射蛛网的能力。无其他焦点人物。人物必须为真人写实风格,严格遵循照片中的真人皮肤质感和五官比例。
  2. 镜头类型声明:无剪辑原生一镜到底电影感无人机追踪动作视频——镜头连续跟随人物穿越多个场景,场景和动作随叙事推进持续变化,而非单一场景或动作贯穿全段。无转场特效、无时间跳跃。
  3. 城市环境:将 [选择城市] 替换为用户选定城市的地标建筑和特色街道。汽车/出租车仅出现在道路上,屋顶镜头仅显示屋顶建筑元素。
  4. 动作节拍(最高内容优先级,严格按固定时间轴执行)必须严格按照以下 10 个场景阶段及其时间标记分节描述,不得修改、删减、合并、重排或重新分配时间。每个阶段以时间标记开头(如"0–4秒:"),包含该阶段的完整场景+动作+镜头景别。各阶段内容须忠实还原 Storyboard 中 Shot 1 的对应段落——逐字复现场景描述,仅将 [选择城市] 替换为实际城市:
    • 0–4秒(卧室开场):卧室内部——床、架子、海报、散落衣服,柔和阳光洒入,敞开窗户可见城市天际线。人物坐在窗台上说"Let's Go?",双手戴上耳机,自信微笑,向后翻身跃出窗户。镜头跟随离开房间。
    • 4–5秒(蛛丝特写):下落中极近距离特写角色的手。手指张开,手腕向前弹射,蛛丝从角色伸出的手连续延伸至上方建筑锚点。镜头迅速后拉揭示城市全景。
    • 5–8秒(低空摆荡):温暖午后阳光,广角无人机追踪城市标志街道上空。街道上方约3米极低空摆荡,经过砖墙公寓、消防逃生梯、商店、阳台、街边车辆。双手紧握蛛丝,双腿并拢伸直,流线型。摆荡最低点高跟鞋轻擦车顶物理反弹。镜头倾斜40度。
    • 8–11秒(墙面奔跑):最高点松开蛛丝,空中舒展,侧身降落建筑墙面。垂直墙面奔跑5–6步,身体倾斜45度,高跟鞋踩墙面。墙面无汽车。蹬墙发射蛛丝穿越大道,蛛丝从角色手延伸至对面建筑锚点。镜头翻滚捕捉力量。
    • 11–14秒(街道穿越):低空掠过出租车、公交车、人行横道、湿润路面。地面2米飞行后降落转化为奔跑,3–4步穿过人行横道。出租车鸣笛,人物笑了笑。踩上街边出租车车顶跨过,跃起发射蛛丝大喊"哇哦哦哦!"高高升空。
    • 14–15秒(天际线收尾):广角屋顶高度。人物达摆荡最高点,悬挂在金色时刻天际线背景下。屋顶无汽车。标志建筑大厦以天空为背景。下方密集屋顶、水箱、消防梯、夕阳雾气。巨大云朵闪耀,电影感画面。
    • 15–18秒(蛛丝荡行与城市杂技):动态镜头,人物滑翔穿过高耸城市巷道,蛛丝线上荡行,降落屋顶,在豪华屋顶泳池上方飘浮。
    • 18–23秒(日落三明治时刻):宁静广角镜头,人物日落时坐在高空钢梁结构上,眺望天际线,快乐地吃三明治。
    • 23–25秒(霓虹巷道与倒挂相遇):夜晚霓虹灯巷道,人物倒挂蛛丝线上,对窗台上的黑猫温暖微笑,伸手抚摸猫咪。
    • 25–28秒(返回家中):人物蛛丝荡回阳台,翻身进入室内,带着大笑容瘫倒沙发,快乐地打电话。
      绝对禁止将所有动作压缩成一句连续描述或省略任何场景阶段——缺失场景阶段是导致"一个动作飞满全段"的直接原因。保留台词"Let's Go?"(0–4秒)和"哇哦哦哦!"(11–14秒)。
  5. 风格标签:真人写实风格、电影感照明、逼真AI视频、高对比度动态镜头角度、超级英雄电影美学。
    人物动作完整性(standing negatives):
  • 每个 shot 的 prompt 末尾必须附加约束:人物身体比例和四肢结构保持正常,动作自然连贯,无变形、无扭曲、无肢体融合或断裂。
  • 写实风格强制约束:每个 shot 的 prompt 必须包含"真人写实摄影风格,非2D动漫,非3D渲染,非插画,非卡通,非赛璐璐"。人物皮肤、光影、材质须呈现真实摄影质感。
  • 动作描述使用物理可信的幅度和轨迹(如摆荡弧线、蹬墙角度),避免描述会导致模型误解的极端姿态或非人类关节弯折。
  • 蛛丝发射方向必须写入 prompt:每次发射蛛丝的动作节拍中,明确写出蛛丝从"角色伸出的手"射出,飞向"上方/侧上方建筑"。不可省略手与方向——模型在缺少明确空间信息时会随机选择发射手和方向,导致蛛丝从下落方向的手射出,造成穿帮。
  • 蛛丝连续性约束(必须写入 prompt):每次发射蛛丝时,必须以"蛛丝从[角色的手]连续延伸至[具体锚点建筑物],形成完整不间断弧线"的句式描述。禁止出现断裂、分段、碎片化或悬浮在空中的蛛丝——模型容易生成断开的蛛丝片段漂浮在天空,必须在 prompt 中强制约束蛛丝为从手到锚点的完整连续单根线。
  • 无背景音乐约束:每个 shot 的 prompt 必须包含 no music(无背景音乐、无BGM)。仅保留模型同步生成的环境音效、动作音效和角色台词,不生成任何背景音乐。
  • 三视图已锁定人物身份和体型,prompt 中强调"严格遵循 <<<image_1>>> 的人物身体比例",减少模型自由发挥导致的形体漂移。
    字符限制处理(关键):
  • Seedance 2.5 prompt 上限 2,300 字符(含 <<<image_1>>> 等标签)。10 个场景阶段内容较多,需浓缩但绝对不可丢失任何场景阶段或改变时间分配
  • 浓缩优先级:人物身份锁定 > 10 个场景阶段(含时间标记) > 环境规则 > 风格标签。场景阶段优先级最高,因为场景多样性是视频质量的核心。
  • 保留每个阶段的时间标记("0–4秒:""4–5秒:"…)——这些标记让模型理解每段场景的持续时长,避免一个动作撑满全段。
  • 环境规则浓缩为一两句关键约束(如"汽车仅在街道上,屋顶无车辆")。
  • 浓缩时缩减修饰性形容词,但保留每个阶段的核心场景元素、动作和镜头景别。
    城市地标动态填充: [选择城市] 占位符需替换为用户选择城市的实际地标和街道特征。以 Planner 在 Final_Video_Spec.md 中记录的城市信息为填充来源。城市代表交通工具也应适配(如纽约→黄色出租车,其他城市替换为当地代表性车辆)。
6. Video assembly

组装规则:

  • 单 shot 模式(无剧情或剧情≤30s):无需拼接,直接输出单个 final_shot
  • 多 shot 模式(剧情>30s):按 storyboard 顺序拼接各 shot 的 final_shot,保持音画连续性,拼接处使用自然过渡(无硬切跳帧)。
  • 不叠加任何背景音乐(BGM),保持原始音轨(环境音效、动作音效、角色台词)。