东方神话天宫
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
用于制作纯中国文化体系的云海天宫、仙域古风巨构与生活群像短片。以不可尽览的局部巨构、明亮云海气口、精确人物尺度和Midjourney(提示词末尾固定使用--v 8.2)硬提示词规范为核心,先试代表性主镜并执行提示词与成图双重验收;用户确认后用Jimeng SR超分,再以MiniMax H3生成16:9原生2K视频。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
强制流程与质量关卡
按以下顺序推进:参考素材蒸馏 → 建立统一视觉DNA与密度档位 → 先试一个代表性主镜 → 用户确认画面方向 → 扩展其余关键帧 → 用户逐张确认 → 仅超分已确认图片 → 用户再次确认 → MiniMax H3视频 → 用户复核 → 装配或交付。
“清雅”与“极繁”不是两套互斥世界观,只是同一空间母语的装饰密度档位。无论档位如何,核心都必须是:摄影机身处中国天宫巨构内部、下方或边缘;建筑无法看见全貌;一侧由被裁切的连续结构形成压力,另一侧由明亮云海形成气口;人物只负责尺度、视线与生活感。
首次采用一种新画面方向时,只选择最能代表该方向的一镜生成四个候选。用户确认该镜的空间、色彩和质感后,才能批量扩展其他镜头;除非用户明确要求跳过试镜并接受批量试错风险。每次生成前先完成“镜头事实卡”:观察位置、结构压住哪一侧、从哪些画框边缘出框、密实区与云海气口比例、一个结构异常、人物精确坐标与动作、主光方向。
提示词提交Midjourney前必须通过提示词验收;生成后必须通过画面验收。失败候选不得当作可用结果推荐给用户。每个失败镜头最多自动修正并重跑一轮;仍失败则说明失败点并等待用户,不得无限消耗额度。
图片生成后暂停,只有用户明确说“确认、选这张、用这张做视频”等,才超分该图。确认一张不等于确认全部。超分后再次等待用户确认,未经二次确认不生成视频。不得静默替换Midjourney(提示词末尾固定使用--v 8.2)、Jimeng SR或MiniMax H3,也不得擅自改变画幅、时长或分辨率。
2. 多模态分析
参考素材的空间语法蒸馏
分析图片或视频时,不要只罗列“仙气、宏大、唯美”。对每个镜头记录可执行事实:摄影机位于檐下、柱间、侧墙边缘、窄台、桥侧还是结构内部;哪一块建筑质量压住画面;结构从哪两条或三条边缘出框;重复节奏来自斗拱、柱列、层檐、台阶、梁架、羽片式顶棚还是水幕;明亮云海占比;人物人数、画幅位置、朝向与身高比例;光向、冷暖关系、材质和空气透视。
用“第一眼标签”检查参考与成图:应读成“人在无法看尽的东方天宫巨构内部或边缘”,不能读成“完整宫殿加云海背景”“空中城市明信片”“古装人物剧照”或“完整神兽驮城”。分析神兽时只蒸馏其形态语法,例如羽片式顶棚、鳞片式斗拱、蛇形屋脊、层叠结构肋,不复制具体活体神兽。
参考图只抽象构图、色谱、材质、人物或运动中的一种主要职责。若有多张参考,为每张标注唯一职责,避免冲突。区分真实的轻微单色胶片纹理、AI细节噪声、锐化边缘和压缩伪影;默认只保留极轻颗粒、柔和高光和微弱辉光,不制造脏点、重噪声或闪烁。
输出必须包含:命中的空间DNA、成图最容易发生的三种偏差、建议的装饰密度、单人或2—5人调度方案、可直接写入提示词的机位与出框事实。
3. 故事板设计
统一视觉DNA与镜头设计
所有镜头服从同一核心:人在无法看尽的中国天宫巨构内部、下方或边缘。建筑、服装、装饰与神话符号必须属于中国文化体系,使用唐宋气质木构、密集斗拱、歇山或庑殿层檐、藻井、朱漆柱、青绿琉璃、白玉云纹栏杆、矿物彩绘、铜金浮雕、古松、云海与建筑落瀑。禁止哥特、教堂、欧洲城堡、巴洛克、洛可可、维多利亚、希腊罗马柱式、蒸汽朋克、王冠、纹章、盔甲、天使、十字架和西式奇幻服装。
主镜画面约55%—70%由同一套被裁切的建筑质量占据,约25%—40%留给明亮云海、天空亮口或远处暖光;人物与小道具只占剩余区域。主镜必须从至少两条画框边缘越出,并具备一种可无限延展的重复节奏。机位优先:巨檐正下方、狭窄云台边缘、无尽侧墙旁、柱列之间、藻井内部、门阙缺口、跨云长阶底部。禁止用外部鸟瞰、完整天际线、对称宫殿正立面或完整城市总览介绍空间。
“清雅”降低装饰密度与饱和度,但仍保留巨构裁切、白玉或木构质量、宽阔云海气口和尺度压迫;“极繁”提高矿物彩绘、朱红、孔雀蓝、青绿、铜金和浮雕密度,但不能挤掉云海气口,也不能退化为完整宫殿、完整神门或普通华丽内景。换气镜仍从半掩门洞、桥侧、长廊转角、古松下平台或巨墙缺口观看;默认禁止完整居中的孤亭、浮亭和小宫殿。
每镜只允许一个点金事实:无尽曲廊、宫墙底部持续出水、羽片式巨型顶棚、鳞片式斗拱、被云吞没的门阙、跨云长阶、看不见尽头的侧壁或一条垂直水幕,七选一。默认把凤凰、龙、鲲鹏等转成建筑语法,不写完整活体头、嘴、翼、爪、尾或“神兽驮城”;只有用户明确要求活体神兽时才允许一只,并让其远置、局部遮挡且不与建筑争夺主语。
人物允许1—5名成年人。人物必须侧背、背身或偏侧,位于栏杆、柱脚、台缘、桥侧或窄廊,负责尺度与观看关系;不得成为正面古装写真。多人镜头写明精确人数、左右分组、服装大色块与一个生活动作,不使用“若干仙人”,不做仪仗队、群众阵列或复制人脸。除非用户明确要求,禁止帝王宝座、垂旒王冠、祭祀法会、仪式花瓶、侍从朝拜和宫廷权力叙事。
视频镜头每镜只设一个人物主动作、一条极慢摄影机路径和至多两层环境运动。横移、轻微推近、缓慢后拉、小幅升降与轻微仰俯交替使用;禁止固定镜头、快速推进、快速环绕、突然变焦和后拉成完整城市总览。近云与远云同向缓慢漂移但速度不同,瀑布持续下落,宽袖、披帛和裙摆随高空微风与身体惯性自然滞后。
4. 媒体生成
模型、参考与生成策略
关键帧统一使用TextToImage或ImageToImage的Midjourney,默认16:9;所有图像生成提示词末尾必须固定为--v 8.2,且该版本后不得再附加其他参数。无参考时用TextToImage探索首个代表性主镜;有用户参考、已确认人物或已选中的风格关键帧时使用ImageToImage。Midjourney最多使用五张reference_image,每张只承担构图、人物、色彩、材质或光感中的一个职责。首个代表性主镜被用户确认后,将该图作为后续镜头的主要reference_image,以继承空间母语和成像质感;不得只靠文字承诺跨镜人物身份一致。
每个镜头生成的四个结果先作为候选。先按画面验收规则筛选,失败结果不绑定为视频输入、不标记为final_shot。只重做失败镜头,不改变已确认镜头。用户确认某张后,使用SuperResolution的Jimeng SR仅处理该资源,目标4K,detail-synthesis scale为100;不重复超分已达到目标质量的图。超分结果成为该镜唯一主视频参考。
视频使用当前项目中可用的MiniMax H3,默认5秒、16:9、原生2K,以用户确认并超分的图片完整锁定0.00秒首帧。不得新增首帧不存在的重要人物、神兽、建筑或道具。每镜独立生成、独立复核,用户确认后才标为final_shot。若MiniMax H3不可用、失败或账户条件不满足,停止并报告,不静默切换模型或降低分辨率。
5. 提示词撰写
Midjourney图片提示词硬规范(固定--v 8.2)
输入解析与双模式执行
- 版本锁定: 所有由Midjourney执行的图像提示词,无论来自完整提示词模式还是一句话意图模式,均使用模型名
Midjourney,并以--v 8.2作为提示词最后一个参数。若输入含有任何其他Midjourney版本后缀,移除该后缀后再附加--v 8.2;其他显式参数按原顺序保留在该后缀之前。 - 完整提示词模式: 当用户提供的是完整的图像提示词、包含具体英文描述、参数或排除项时,除上述版本锁定外逐字原样提交,不翻译、不改写、不优化、不扩写,也不为满足本技能的默认句法而补词。用户的显式参数、画幅与排除项优先。
- 一句话意图模式: 当用户只用一句话描述主体、地点、事件或想要的画面时,主动将其扩写为可生成的英文提示词,并使用本技能的六段事实链、参数与排除项;在所有其他参数之后附加
--v 8.2。默认将用户意图置于“人在无法看尽的中国天宫巨构内部、檐下或边缘”的空间关系中,而不是完整宫殿全景或人物肖像。 - 一句话意图模式的构图先建立压迫式框景:巨柱、梁架、斗拱、藻井、竹帘、船檐或白玉构件从顶部和侧边裁出画外;再在中心或远处留出明亮、深远的云海气口。建筑以歇山、层叠斗拱、朱漆、青碧瓦、白玉、云梯、云桥、云瀑与可无限延展的层级构成,永不完整展示。
- 当一句话意图涉及登阶、抵达、上行或仰望时,优先采用“最低可见落脚平台”这一已在阶梯体系内部的低位机位:白玉天阶由近景斜向右上延伸并越出画框,云纹栏杆、朱漆仪仗柱与带斗拱屋顶的歇脚台以清晰重复节奏没入亮云;上方只露出一段被裁切的唐宋木构,避免生成完整对称的宫殿前广场。人物保持极小比例,以单人缓慢登阶或二至三名分散登阶者建立尺度,不形成仪仗或人群。
- 默认人物只承担尺度、视线和生活感:小比例、侧背或背身、宽袖古装,以眺望、围坐、行走或劳作等克制动作出现。色彩以云白、青瓷或冷青、孔雀蓝、青绿、旧木褐、浅金和铜件为主,朱红仅作受控点缀;保留木材、白玉、青瓦、丝麻、漆面与使用痕迹。
- 默认成像质感为真人古装奇幻电影现场的35mm胶片观感:自然景深、柔和高光、自然曝光滚降、极轻有机颗粒,以及由云面反射、侧光或珠光云光形成的冷暖层次。除非用户明确要求,排除动画、二次元、插画、游戏CG、塑料、霓虹科幻、巨大金属圆环、无人机航拍、完整居中对称宫殿、西方建筑、文字、水印、无意义满屏金光和活体神兽。
使用一条约75—120个英文词的可见事实链,严格按六段顺序书写:
[camera position + frame pressure + overflow edges]; [one continuous Chinese architecture system + repeated rhythm]; [one structural anomaly]; [exact people count + frame coordinates + direction + action]; [bright cloud/water depth]; [material palette + one light condition + rendering target]
前30个英文词必须同时回答:摄影机站在哪里、哪一侧被结构压住、建筑从哪些画框边缘出框。不要以cinematic、wide-angle、epic、majestic、beautiful开头,也不能只写“monumental”或“beyond the frame”而不给具体方向。可用句法包括: - camera directly beneath..., the cropped underside presses in from the top and both sides
- low oblique view from a narrow terrace, the continuous palace wall fills the left half and continues beyond the top, left and bottom edges
- inside a colossal dougong-bracketed structure, the ceiling and column rows vanish beyond three edges
正文必须写出至少三项明确中国结构锚点:Chinese timber-frame celestial architecture、dense interlocking dougong brackets、monumental xieshan eaves、polychrome zaojing coffers、vermilion lacquer columns、white-jade cloud-scroll balustrades、turquoise glazed tiles、Chinese mineral pigments and gilded relief。成像目标写成polished high-chroma Chinese mythic AI animation film keyframe,使用柔和高光、明亮云面反射、孔雀蓝/青绿/朱红/铜金/云白的大色块和极轻单色胶片纹理;避免灰褐风化石城、旅游摄影、低模游戏城市和塑料皮肤。
人物必须在正文前半段拥有精确坐标,例如one tiny female envoy at the lower-right balustrade, back turned, gazing upward。人物默认占画面高度约3%—10%,侧背或背身,脸不是视觉中心。多人写清楚如two adults at the left rail converse while three adults walk along the lower-right corridor,不写模糊人群。衣服用交领、宽袖、长袍、披帛、高髻、玉饰等中国语汇;不默认使用帝君、国王、王冠、宝座、朝拜或祭器。
神兽建筑化时,正文优先使用feather-ribbed reliefs、feather-shaped roof strata、scale-like brackets、serpentine ridge beams、sweeping structural ribs,不要直接写完整phoenix、dragon、bird head、beak、wings、talons或tail。每镜只能有一种图腾语法和一个结构异常。
默认禁用会诱导错误画面的表达:East Asian mythology、celestial emperor、royal palace、ceremonial crown、throne、ritual vase、sacred ceremony、divine light beam、solitary ornate pavilion、floating pavilion、complete gate、wide panorama、aerial overview、cityscape、skyline、three-layer depth composition。需要日光时写具体的peach-gold side sunlight、warm cloud bounce或soft volumetric daylight。
末尾按画面需要加入原子对象排除:
--no gothic cathedral castle baroque rococo victorian roman greek steampunk heraldry crown armor angel cross aerial skyline text watermark logo
默认建筑化神兽镜再加入bird beak talon;用户明确要求活体神兽时删除与目标冲突的排除词。
提示词提交前验收
全部通过才调用Midjourney:
- 第一分句含具体机位、压框方向和至少两条出框边缘。
- 画面不能被一句话概括为“完整宫殿/神门/亭子加云海背景”。
- 同一建筑系统占约55%—70%,明亮云海气口占约25%—40%。
- 只有一个结构异常和一个视觉主语。
- 人物有数量、坐标、朝向和动作,且不是正面写真。
- 正文至少有三项中国结构锚点,不出现上述诱导词。
- 神兽是建筑语法而不是默认活体。
成图验收与纠偏
出现下列任意两项即判失败:完整居中的宫殿、神门或亭子;对称正立面;建筑不足画面一半;没有明亮云海气口;人物成为可读面部写真;帝王宝座或祭祀叙事;活体神兽抢占主体;西方结构或服装;灰褐风化质感;同时出现两个以上异象。失败时先重写提示词前30词的机位、压框与出框关系,只改本轮最关键的三项,不用更长形容词掩盖问题。最多自动重跑一轮,只向用户推荐通过验收的候选。
MiniMax H3视频提示词
使用英文结构化格式,首行锁定首帧:
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
随后依次写:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: N/A
在integrated_multimodal_description中先声明保持首帧人物数量、服装大色块、建筑几何、光向、云海高度与色彩,再写一个清晰人物动作、一种小幅度极慢摄影机运动和至多两层环境运动。人物做缓步、停步、转身、仰望、交谈、抬手或劳作中的一个动作;衣袖、披帛和裙摆产生可见但克制的滞后运动。近云与远云同向缓慢漂移并有速度差,瀑布持续下落。
声音只保留高空风、瀑布、脚步、水声、衣料和必要自然环境声。默认无对白、旁白、歌声、乐器和背景音乐。禁止新增人物、飞鸟、活体神兽、建筑、科技、粒子、法阵、文字、符号和任何西方元素;禁止固定镜头、快速推进、旋转、穿模、结构融化、人物漂移、焦距突变和后拉展示完整巨构。
6. 视频合成
复核与装配
单镜保留MiniMax H3原生2K,不重复视频超分。多镜成片只使用用户确认的final_shot,按批准顺序装配;默认硬切,只有明确时间或空间过渡才使用不超过0.5秒的短淡化。
剪辑使用约2.5—3.5秒有效段落与少量5秒主镜交替,保留人物动作完成以及衣料、云雾和瀑布的环境反馈余量。相邻镜头检查人物数量与服装色块、运动方向、光向、云层方向、云海高度和建筑结构连续性。若视频把巨构后拉成完整城市、生成固定镜头、冻结云层、复制人物、静止衣料或让建筑结构融化,该镜不得进入成片。
禁止添加背景音乐、字幕、标题、logo和文字叠加。音乐轨道必须为空;只保留并平衡高空风、瀑布、脚步、水声和衣料声。最终交付保持16:9、2K。