City superhero blockbuster
スタジオの下書きを準備します。複数段階の手順は参考情報です。自動生成や課金は行いません。
上传一张你的照片,选择一座城市,就能生成一段以你为主角的真人城市英雄大片。使用Seedance 2.5模型,720p,16:9。
制作フロー本文は原文の中国語です。記載モデルと当サイトの対応モデルは異なる場合があります。実際のモデルと必要クレジットはスタジオで確認してください。
制作フロー全文
1. 制作計画
工作流(逐步暂停等待用户输入):
- 等待用户上传照片 — 向用户说明需要上传一张个人照片作为人物身份和服装参考。暂停,等待用户上传完成后才能继续。上传后通过 resource_prepare_and_analyze 分析照片,提取人物外观特征(面部、体型、服装、发型),生成 semantic_output 供后续步骤使用,并将照片注册为 reference_image。
- 等待用户选择城市 — 照片确认后,向用户展示城市选择:预置中国30个省会/大城市(例如上海、广州、深圳、成都、杭州、武汉、西安等)+ 世界20大城市(如纽约、伦敦、东京、巴黎、迪拜、洛杉矶、悉尼等),同时允许用户自由输入城市名称。暂停,等待用户选择后才能继续。选定后,Planner 在 Final_Video_Spec.md 中记录该城市的标志性建筑、特色街道、天际线特征和代表性交通工具(如纽约→黄色出租车/褐石建筑/消防梯;伦敦→黑色出租车/泰晤士河/红砖建筑;东京→霓虹巷道/东京塔等)。
- 剧情判定(Planner 自动判断) — Planner 根据用户在对话中是否提供了剧情/脚本/动作描述,自动判断走以下哪条分支,无需询问用户:
- 无剧情模式:用户只上传照片+选城市,未提供任何剧情文本 → 走固定28s单shot模板流程(当前默认行为)。
- 有剧情模式:用户提供了剧情/脚本/动作描述 → Planner 评估剧情总时长:
- ≤30s:按剧情实际时长设计单 shot,不拆分。
- >30s:按叙事节拍拆分为多 shot,每个 shot 尽量接近30s但不强制,总 shot 数尽量少;禁止过度碎片化(如3s+5s+8s),每个 shot 不得低于8s。
- 生成人物三视图 — 通过 media_generator 使用 ImageToImage(推荐模型 Nano Banana Pro),以用户上传照片为参考,生成一张纯白背景的人物三视图(正面、侧面、背面并排),确保人物身份、服装、发型、体型与照片完全一致。纯白背景的目的是避免原始照片中的环境元素污染视频画风。生成的三视图注册为人物 key_element 的 reference_image,替代原始照片作为所有 shot 的身份参考。
- 建立 Final_Video_Spec.md 并设计 Storyboard — 通过 text_editor 先建立 Final_Video_Spec.md,锁定全局参数(16:9、720p、Seedance 2.5、视觉风格、选择的城市及其地标信息、时长模式与总时长)。然后通过 storyboard_designer 设计镜头:
- 无剧情模式:固定28s单shot,使用当前10阶段固定时间轴模板。
- 有剧情且≤30s:单shot,按用户剧情节拍设计场景阶段。
- 有剧情且>30s:多shot,每个shot覆盖一个完整叙事段落,shot间注明连续性关系。
- 生成视频 — 通过 media_generator 生成视频:
- 单shot模式:参考人物三视图(reference_image)一次性生成完整视频。
- 多shot模式:按 storyboard 顺序逐 shot 生成;当后续 shot 与前一段连续性极强时,可将前一段 final_shot 作为 reference_video 传入。每个 shot 均以人物三视图为 reference_image。
- 组装与输出 — 通过 video_assembler 组装:单shot直接输出;多shot按 storyboard 顺序拼接,保持音画连续性。
关键依赖与注意事项:
- 每一步必须在用户确认/提供输入后才能进入下一步,不可跳过暂停点,每一步确认采用按钮式,即“确认”按钮加上“修改”按钮。
- 第2步依赖第1步照片上传完成。第3步依赖第1步和第2步。第4步依赖第1步。第5步依赖第3步剧情判定和第4步三视图生成完毕。第6步依赖第5步 storyboard 设计完毕。第7步依赖第6步所有 shot 生成完毕。
- 城市选定后,Planner 需根据所选城市补充该城市地标和街道特征信息,替换 prompt 模板中的 [选择城市] 占位符。
- 时长处理:无剧情时固定28s不询问;有剧情时按剧情实际需要灵活设定,单shot≤30s,超30s时按叙事节拍拆分多shot,每段尽量长、尽量少,禁止碎片化。
- 三视图替代原始照片:所有 shot 的 reference_image 统一使用三视图,不再直接使用原始上传照片,避免照片中的背景环境干扰视频生成。
- 多shot连续性:仅当后续 shot 与前一段连续性极强时才添加 reference_video;通常情况下仅使用三视图作为参考即可。
2. マルチモーダル分析
用户上传照片分析:
- 分析上传的人物照片,提取关键身份特征:面部轮廓与五官比例、肤色、发型与发色、体型比例、服装款式与颜色、配饰。
- 将提取的特征结构化为
semantic_output,供 prompt 写作时引用,确保视频生成保持与照片一致的人物外观。 semantic_output中需包含三视图生成所需的指导信息:确认人物的正面/侧面/背面外观一致性要点(如发型是否对称、服装是否有背部细节、配饰在侧面是否可见等),以便后续 ImageToImage 生成三视图时保持准确。- 原始照片注册为
reference_image,作为三视图生成的输入参考;三视图生成后,三视图替代原始照片成为所有 shot 的reference_image。 - 写实风格标注:
semantic_output中需明确标注人物为真人,所有下游生成(三视图和视频)必须保持真人写实摄影风格,禁止输出2D动漫、3D渲染、插画或卡通风格。 - 角色服装标注:
semantic_output中需标注角色的服装和裤子完全沿用上传照片中的穿着——记录照片中服装的款式、颜色、材质、裤型等细节,供三视图和视频生成时严格匹配。角色具备发射蛛网的能力,但服装不做任何替换或转化,始终以照片中的真实穿着为准。
3. 絵コンテ設計
时长模式分支:
- 无剧情模式:固定28s单shot(一镜到底),使用以下10阶段固定时间轴模板。
- 有剧情且≤30s:单shot,按用户剧情节拍设计场景阶段,总时长按剧情定(≤30s)。
- 有剧情且>30s:按叙事节拍拆分为多shot,每个shot覆盖一个完整叙事段落,时长尽量接近30s但不强制,总shot数尽量少,每个shot不得低于8s,禁止过度碎片化(如3s+5s+8s)。shot间注明连续性关系(哪些shot需要前后衔接)。
无剧情模式固定单镜头(28s,一镜到底):
仅一个shot(Shot 1,0–28s)。以下场景阶段及其时间分配为固定模板,不得修改、删减、合并或重新分配时间——场景描述须忠实写入 shot description,prompt 须忠实复现。
Key Elements: - element character:用户上传照片中的人物。身份参考为纯白背景人物三视图(正面/侧面/背面)。服装和裤子完全沿用上传照片中的穿着,不做任何替换或转化。角色具备发射蛛网、城市摆荡穿越的能力。代词和称呼应与照片中人物性别一致(用户模板使用"她",实际以照片为准)。
- element scene:用户选择的城市。包含该城市标志性建筑、特色街道、天际线。城市地标和代表交通工具根据用户选择动态确定。
Shot 1 场景阶段(固定时间轴,逐段写入): - 0–4秒(卧室开场):卧室内部——一侧有床、架子、海报、散落的衣服,柔和阳光洒入,透过大大的敞开窗户可见[选择城市]天际线。人物坐在窗台上,姿态舒适却稳健,充满活力。望着前方说"Let's Go?",双手戴上耳机,自信微笑,以柔和而坚定的动作向后翻身跃出敞开窗户。镜头顺畅跟随离开房间。
- 4–5秒(蛛丝特写):下落过程中极近距离特写角色的手。手指张开,手腕向前弹射,蛛丝从角色伸出的手连续延伸至上方建筑锚点,形成完整不间断弧线。镜头迅速后拉揭示下方城市景观,高楼大厦耸立在背景中。
- 5–8秒(低空摆荡):温暖午后阳光,广角无人机追踪[选择城市]标志街道上空。人物在街道上方约3米高度极低空摆荡,经过砖墙公寓外观、消防逃生梯、商店、阳台、街边停泊车辆及繁华大道。背景中可见标志建筑大厦。双手紧握蛛丝,双腿并拢伸直,身体呈流线型。摆荡最低点高跟鞋轻擦街边停泊车辆车顶并物理反弹调整动量。镜头与人物一同倾斜40度。
- 8–11秒(墙面奔跑):最高点松开蛛丝,空中舒展身体,侧身降落在经典建筑墙面。垂直墙面持续奔跑,身体向墙倾斜45度,高跟鞋踩踏墙面,双手保持平衡。沿外观水平快速迈出5–6步。墙面或屋顶无汽车。用力一蹬发射蛛丝——蛛丝从角色的手连续延伸至对面建筑锚点——穿越繁华标志性大道宽阔空间。下方街道可见出租车和车辆。蛛丝猛地将人物拉向一侧,镜头翻滚捕捉力量。
- 11–14秒(街道穿越):低空掠过出租车、公交车、人行横道、湿润路面,以及带有温暖反射光的繁华大道。地面2米飞行后松开蛛丝降落在湿润街道上,转化为奔跑。快速3–4步穿过人行横道线和街头交通。出租车鸣笛,人物笑了笑。一脚踩上街边出租车车顶用力爆踩跨过,向上跃起发射蛛丝,大喊"哇哦哦哦!"高高升空。
- 14–15秒(天际线收尾):短暂广角屋顶高度收尾镜头。人物到达摆荡最高点,悬挂在金色时刻城市天际线背景下,停顿在令人屏息的一瞬间。屋顶上无汽车或出租车。城市标志建筑大厦清晰可见,高耸而富有标志性,以天空为背景。下方:密集屋顶、露台、水箱、消防逃生梯、狭窄街道,以及夕阳雾气。巨大云朵在橙色和金色光芒中闪耀,镜头保持电影感画面。
- 15–18秒(蛛丝荡行与城市杂技):动态镜头展示人物滑翔穿过高耸城市巷道,在蛛丝线上荡行,降落在屋顶上,并在俯瞰城市天际线的豪华屋顶泳池上方飘浮。
- 18–23秒(日落三明治时刻):宁静广角镜头,人物在日落时随意坐在高空钢梁结构上,眺望城市天际线,一边快乐地吃着三明治。
- 23–25秒(霓虹巷道与倒挂相遇):夜晚,在发光霓虹灯照亮的巷道中,人物倒挂在蛛丝线上,对着窗台上的一只黑猫温暖地微笑。
- 25–28秒(返回家中):人物用蛛丝荡回阳台,翻身进入室内,然后带着大大的笑容瘫倒在沙发上,快乐地打电话。
台词: "Let's Go?"(0–4秒),"哇哦哦哦!"(11–14秒)。
环境规则(须体现在每个场景中): - 汽车和出租车仅存在于道路/街道上,绝不出现在屋顶、阳台、露台、墙面或天际线镜头中。
- 屋顶镜头仅显示屋顶、露台、空调外机、水箱、天线、高楼和天际线元素。
- 高跟鞋擦车顶仅发生在低空摆荡时与街边停放车辆接触。
- 踩出租车场景仅发生在街道上行驶或停靠的出租车上。
音频设计: - 不设计独立背景音乐音轨。视频内台词、环境音效和动作音效由 Seedance 2.5 模型同步生成。
4. 素材生成
人物三视图生成(在 shot 生成之前执行):
- 使用 ImageToImage,推荐模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K,宽高比 16:9。
- 输入:用户上传照片作为 image_ids 参考。Prompt 要求生成纯白背景的人物三视图——正面、侧面、背面三个视角水平并排排列,保持与参考照片完全一致的脸部特征、肤色、发型、体型。人物描述不要写例如:面部为柔和的椭圆偏长轮廓,圆脸之类,一定要忠于原图参考;服装处理:角色的衣服和裤子完全沿用上传照片中的穿着,不做任何替换或转化,三视图中角色必须穿着与照片完全相同的服装和裤子。背景必须为纯白色,无任何环境、道具或阴影。三视图必须为真人写实风格(photorealistic real person),prompt 中需明确写明"真人写实摄影风格",并附加约束"非2D动漫、非3D渲染、非插画、非卡通"。
- 生成后将三视图注册为人物 key_element 的 reference_image,替代原始照片作为所有 shot 的身份参考。原始照片仅保留为三视图生成的输入,不再直接用于 shot 生成。
- Nano Banana Pro 在复杂多图布局和角色一致性方面表现最佳;若不可用可降级为 Nano Banana 2 (Gemini 3.1 Flash Image)。
视频生成配置: - 使用 MultiModalToVideo,模型 Seedance 2.5,分辨率 720p,宽高比 16:9,单次生成时长上限 30s(在 4–30s 范围内)。
- 无剧情模式:固定28s单段生成,仅生成一个 final_shot,不拆分、不拼接。
- 有剧情模式:按 storyboard 设计的 shot 数量逐个生成。每个 shot 时长由剧情决定,≤30s。多个 shot 时按 storyboard 顺序逐个生成。
- 多 shot 连续性参考:仅当后续 shot 与前一段连续性极强时,将前一段 final_shot 作为 reference_video 传入;通常情况下仅使用三视图作为 reference_image 即可。
参考绑定规则: - 人物参考绑定:人物三视图作为 reference_image,通过 image_infos 传入,绑定到人物 key_element。生成前调用 query_assets_info 确认绑定状态;若缺失则通过 manage_item_assets 绑定并重新查询验证。
- 多 shot 模式:每个 shot 均需绑定人物三视图作为 reference_image;当某 shot 使用前一段 final_shot 作为 reference_video 时,同样需先绑定再生成。
- 无需 audio_infos,不生成任何背景音乐(BGM)。视频内台词、环境音效和动作音效由 Seedance 2.5 模型同步生成,无需独立音频参考。
Asset Binding Contract: - 遵循当前 manage_item_assets 契约,使用 Storyboard 中的实际目标 ID。
- 绑定前先 query_assets_info,缺失时调用 manage_item_assets 并保留完整绑定数组,绑定后重新查询验证。
- 从资产的实际用途和计划位置解析绑定类型,不凭媒体标签推断角色。
5. プロンプト作成
模式分支:
- 无剧情模式:使用下方的固定10阶段时间轴 Prompt 模板。
- 有剧情模式:按 storyboard 中每个 shot 的设计编写 prompt,不再套用无剧情模式的固定10阶段模板。阶段数量和内容由 storyboard 根据剧情自由设计,不限制具体几个阶段、不限制每段时长。但须遵守以下结构规则:
- 时间标记习惯:当一个 shot 内有多个场景节拍时,仍用时间标记(如"0–4秒:")分段描述,让模型理解每段持续时长,避免一个动作撑满全段;若该 shot 只有一个连续场景,则不需要拆时间标记。
- 场景多样性原则:每个 shot 内部要有场景和动作的变化,避免"一个动作飞满全段";具体场景内容由 storyboard 决定,prompt 须忠实还原 storyboard 中的场景节拍。
- 沿用全部 standing constraints:人物身份锁定(三视图)、真人写实风格、蛛丝发射方向与连续性、无 BGM、身体比例完整性——与无剧情模式一致,必须写入每个 shot 的 prompt。
- 字符数控制:每个 shot 的 prompt ≤ 2,300 字符;浓缩优先级与无剧情模式相同(人物锁定 > 场景节拍 > 环境规则 > 风格标签)。
Prompt 模板结构(填入 MultiModalToVideo 的 prompt 字段):
每个 shot 生成一段独立 prompt,总字符数含标签须 ≤ 2,300。按以下优先级组织内容:
- 人物身份锁定:<<<image_1>>> 为纯白背景人物三视图(正面/侧面/背面),作为人物身份和服装的绝对参考标准。保持相同脸部特征和比例。角色的衣服和裤子完全沿用上传照片中的穿着,不做任何替换或转化,严格遵循三视图中角色的原始服装。角色具备发射蛛网的能力。无其他焦点人物。人物必须为真人写实风格,严格遵循照片中的真人皮肤质感和五官比例。
- 镜头类型声明:无剪辑原生一镜到底电影感无人机追踪动作视频——镜头连续跟随人物穿越多个场景,场景和动作随叙事推进持续变化,而非单一场景或动作贯穿全段。无转场特效、无时间跳跃。
- 城市环境:将 [选择城市] 替换为用户选定城市的地标建筑和特色街道。汽车/出租车仅出现在道路上,屋顶镜头仅显示屋顶建筑元素。
- 动作节拍(最高内容优先级,严格按固定时间轴执行):必须严格按照以下 10 个场景阶段及其时间标记分节描述,不得修改、删减、合并、重排或重新分配时间。每个阶段以时间标记开头(如"0–4秒:"),包含该阶段的完整场景+动作+镜头景别。各阶段内容须忠实还原 Storyboard 中 Shot 1 的对应段落——逐字复现场景描述,仅将 [选择城市] 替换为实际城市:
- 0–4秒(卧室开场):卧室内部——床、架子、海报、散落衣服,柔和阳光洒入,敞开窗户可见城市天际线。人物坐在窗台上说"Let's Go?",双手戴上耳机,自信微笑,向后翻身跃出窗户。镜头跟随离开房间。
- 4–5秒(蛛丝特写):下落中极近距离特写角色的手。手指张开,手腕向前弹射,蛛丝从角色伸出的手连续延伸至上方建筑锚点。镜头迅速后拉揭示城市全景。
- 5–8秒(低空摆荡):温暖午后阳光,广角无人机追踪城市标志街道上空。街道上方约3米极低空摆荡,经过砖墙公寓、消防逃生梯、商店、阳台、街边车辆。双手紧握蛛丝,双腿并拢伸直,流线型。摆荡最低点高跟鞋轻擦车顶物理反弹。镜头倾斜40度。
- 8–11秒(墙面奔跑):最高点松开蛛丝,空中舒展,侧身降落建筑墙面。垂直墙面奔跑5–6步,身体倾斜45度,高跟鞋踩墙面。墙面无汽车。蹬墙发射蛛丝穿越大道,蛛丝从角色手延伸至对面建筑锚点。镜头翻滚捕捉力量。
- 11–14秒(街道穿越):低空掠过出租车、公交车、人行横道、湿润路面。地面2米飞行后降落转化为奔跑,3–4步穿过人行横道。出租车鸣笛,人物笑了笑。踩上街边出租车车顶跨过,跃起发射蛛丝大喊"哇哦哦哦!"高高升空。
- 14–15秒(天际线收尾):广角屋顶高度。人物达摆荡最高点,悬挂在金色时刻天际线背景下。屋顶无汽车。标志建筑大厦以天空为背景。下方密集屋顶、水箱、消防梯、夕阳雾气。巨大云朵闪耀,电影感画面。
- 15–18秒(蛛丝荡行与城市杂技):动态镜头,人物滑翔穿过高耸城市巷道,蛛丝线上荡行,降落屋顶,在豪华屋顶泳池上方飘浮。
- 18–23秒(日落三明治时刻):宁静广角镜头,人物日落时坐在高空钢梁结构上,眺望天际线,快乐地吃三明治。
- 23–25秒(霓虹巷道与倒挂相遇):夜晚霓虹灯巷道,人物倒挂蛛丝线上,对窗台上的黑猫温暖微笑,伸手抚摸猫咪。
- 25–28秒(返回家中):人物蛛丝荡回阳台,翻身进入室内,带着大笑容瘫倒沙发,快乐地打电话。
绝对禁止将所有动作压缩成一句连续描述或省略任何场景阶段——缺失场景阶段是导致"一个动作飞满全段"的直接原因。保留台词"Let's Go?"(0–4秒)和"哇哦哦哦!"(11–14秒)。
- 风格标签:真人写实风格、电影感照明、逼真AI视频、高对比度动态镜头角度、超级英雄电影美学。
人物动作完整性(standing negatives):
- 每个 shot 的 prompt 末尾必须附加约束:人物身体比例和四肢结构保持正常,动作自然连贯,无变形、无扭曲、无肢体融合或断裂。
- 写实风格强制约束:每个 shot 的 prompt 必须包含"真人写实摄影风格,非2D动漫,非3D渲染,非插画,非卡通,非赛璐璐"。人物皮肤、光影、材质须呈现真实摄影质感。
- 动作描述使用物理可信的幅度和轨迹(如摆荡弧线、蹬墙角度),避免描述会导致模型误解的极端姿态或非人类关节弯折。
- 蛛丝发射方向必须写入 prompt:每次发射蛛丝的动作节拍中,明确写出蛛丝从"角色伸出的手"射出,飞向"上方/侧上方建筑"。不可省略手与方向——模型在缺少明确空间信息时会随机选择发射手和方向,导致蛛丝从下落方向的手射出,造成穿帮。
- 蛛丝连续性约束(必须写入 prompt):每次发射蛛丝时,必须以"蛛丝从[角色的手]连续延伸至[具体锚点建筑物],形成完整不间断弧线"的句式描述。禁止出现断裂、分段、碎片化或悬浮在空中的蛛丝——模型容易生成断开的蛛丝片段漂浮在天空,必须在 prompt 中强制约束蛛丝为从手到锚点的完整连续单根线。
- 无背景音乐约束:每个 shot 的 prompt 必须包含 no music(无背景音乐、无BGM)。仅保留模型同步生成的环境音效、动作音效和角色台词,不生成任何背景音乐。
- 三视图已锁定人物身份和体型,prompt 中强调"严格遵循 <<<image_1>>> 的人物身体比例",减少模型自由发挥导致的形体漂移。
字符限制处理(关键): - Seedance 2.5 prompt 上限 2,300 字符(含 <<<image_1>>> 等标签)。10 个场景阶段内容较多,需浓缩但绝对不可丢失任何场景阶段或改变时间分配。
- 浓缩优先级:人物身份锁定 > 10 个场景阶段(含时间标记) > 环境规则 > 风格标签。场景阶段优先级最高,因为场景多样性是视频质量的核心。
- 保留每个阶段的时间标记("0–4秒:""4–5秒:"…)——这些标记让模型理解每段场景的持续时长,避免一个动作撑满全段。
- 环境规则浓缩为一两句关键约束(如"汽车仅在街道上,屋顶无车辆")。
- 浓缩时缩减修饰性形容词,但保留每个阶段的核心场景元素、动作和镜头景别。
城市地标动态填充: [选择城市] 占位符需替换为用户选择城市的实际地标和街道特征。以 Planner 在 Final_Video_Spec.md 中记录的城市信息为填充来源。城市代表交通工具也应适配(如纽约→黄色出租车,其他城市替换为当地代表性车辆)。
6. 動画編集
组装规则:
- 单 shot 模式(无剧情或剧情≤30s):无需拼接,直接输出单个
final_shot。 - 多 shot 模式(剧情>30s):按 storyboard 顺序拼接各 shot 的
final_shot,保持音画连续性,拼接处使用自然过渡(无硬切跳帧)。 - 不叠加任何背景音乐(BGM),保持原始音轨(环境音效、动作音效、角色台词)。