Eastern mythology celestial palace
Prepare a studio draft. Multi-stage instructions are references; this does not run or charge for generation.
用于制作纯中国文化体系的云海天宫、仙域古风巨构与生活群像短片。以不可尽览的局部巨构、明亮云海气口、精确人物尺度和Midjourney(提示词末尾固定使用--v 8.2)硬提示词规范为核心,先试代表性主镜并执行提示词与成图双重验收;用户确认后用Jimeng SR超分,再以MiniMax H3生成16:9原生2K视频。
Workflow text is preserved in its original Chinese. Referenced models may differ from those available here. Check the studio for supported models and actual credit quotes.
Complete workflow
1. Planning
强制流程与质量关卡
按以下顺序推进:参考素材蒸馏 → 建立统一视觉DNA与密度档位 → 先试一个代表性主镜 → 用户确认画面方向 → 扩展其余关键帧 → 用户逐张确认 → 仅超分已确认图片 → 用户再次确认 → MiniMax H3视频 → 用户复核 → 装配或交付。
“清雅”与“极繁”不是两套互斥世界观,只是同一空间母语的装饰密度档位。无论档位如何,核心都必须是:摄影机身处中国天宫巨构内部、下方或边缘;建筑无法看见全貌;一侧由被裁切的连续结构形成压力,另一侧由明亮云海形成气口;人物只负责尺度、视线与生活感。
首次采用一种新画面方向时,只选择最能代表该方向的一镜生成四个候选。用户确认该镜的空间、色彩和质感后,才能批量扩展其他镜头;除非用户明确要求跳过试镜并接受批量试错风险。每次生成前先完成“镜头事实卡”:观察位置、结构压住哪一侧、从哪些画框边缘出框、密实区与云海气口比例、一个结构异常、人物精确坐标与动作、主光方向。
提示词提交Midjourney前必须通过提示词验收;生成后必须通过画面验收。失败候选不得当作可用结果推荐给用户。每个失败镜头最多自动修正并重跑一轮;仍失败则说明失败点并等待用户,不得无限消耗额度。
图片生成后暂停,只有用户明确说“确认、选这张、用这张做视频”等,才超分该图。确认一张不等于确认全部。超分后再次等待用户确认,未经二次确认不生成视频。不得静默替换Midjourney(提示词末尾固定使用--v 8.2)、Jimeng SR或MiniMax H3,也不得擅自改变画幅、时长或分辨率。
2. Multimodal analysis
参考素材的空间语法蒸馏
分析图片或视频时,不要只罗列“仙气、宏大、唯美”。对每个镜头记录可执行事实:摄影机位于檐下、柱间、侧墙边缘、窄台、桥侧还是结构内部;哪一块建筑质量压住画面;结构从哪两条或三条边缘出框;重复节奏来自斗拱、柱列、层檐、台阶、梁架、羽片式顶棚还是水幕;明亮云海占比;人物人数、画幅位置、朝向与身高比例;光向、冷暖关系、材质和空气透视。
用“第一眼标签”检查参考与成图:应读成“人在无法看尽的东方天宫巨构内部或边缘”,不能读成“完整宫殿加云海背景”“空中城市明信片”“古装人物剧照”或“完整神兽驮城”。分析神兽时只蒸馏其形态语法,例如羽片式顶棚、鳞片式斗拱、蛇形屋脊、层叠结构肋,不复制具体活体神兽。
参考图只抽象构图、色谱、材质、人物或运动中的一种主要职责。若有多张参考,为每张标注唯一职责,避免冲突。区分真实的轻微单色胶片纹理、AI细节噪声、锐化边缘和压缩伪影;默认只保留极轻颗粒、柔和高光和微弱辉光,不制造脏点、重噪声或闪烁。
输出必须包含:命中的空间DNA、成图最容易发生的三种偏差、建议的装饰密度、单人或2—5人调度方案、可直接写入提示词的机位与出框事实。
3. Storyboard design
统一视觉DNA与镜头设计
所有镜头服从同一核心:人在无法看尽的中国天宫巨构内部、下方或边缘。建筑、服装、装饰与神话符号必须属于中国文化体系,使用唐宋气质木构、密集斗拱、歇山或庑殿层檐、藻井、朱漆柱、青绿琉璃、白玉云纹栏杆、矿物彩绘、铜金浮雕、古松、云海与建筑落瀑。禁止哥特、教堂、欧洲城堡、巴洛克、洛可可、维多利亚、希腊罗马柱式、蒸汽朋克、王冠、纹章、盔甲、天使、十字架和西式奇幻服装。
主镜画面约55%—70%由同一套被裁切的建筑质量占据,约25%—40%留给明亮云海、天空亮口或远处暖光;人物与小道具只占剩余区域。主镜必须从至少两条画框边缘越出,并具备一种可无限延展的重复节奏。机位优先:巨檐正下方、狭窄云台边缘、无尽侧墙旁、柱列之间、藻井内部、门阙缺口、跨云长阶底部。禁止用外部鸟瞰、完整天际线、对称宫殿正立面或完整城市总览介绍空间。
“清雅”降低装饰密度与饱和度,但仍保留巨构裁切、白玉或木构质量、宽阔云海气口和尺度压迫;“极繁”提高矿物彩绘、朱红、孔雀蓝、青绿、铜金和浮雕密度,但不能挤掉云海气口,也不能退化为完整宫殿、完整神门或普通华丽内景。换气镜仍从半掩门洞、桥侧、长廊转角、古松下平台或巨墙缺口观看;默认禁止完整居中的孤亭、浮亭和小宫殿。
每镜只允许一个点金事实:无尽曲廊、宫墙底部持续出水、羽片式巨型顶棚、鳞片式斗拱、被云吞没的门阙、跨云长阶、看不见尽头的侧壁或一条垂直水幕,七选一。默认把凤凰、龙、鲲鹏等转成建筑语法,不写完整活体头、嘴、翼、爪、尾或“神兽驮城”;只有用户明确要求活体神兽时才允许一只,并让其远置、局部遮挡且不与建筑争夺主语。
人物允许1—5名成年人。人物必须侧背、背身或偏侧,位于栏杆、柱脚、台缘、桥侧或窄廊,负责尺度与观看关系;不得成为正面古装写真。多人镜头写明精确人数、左右分组、服装大色块与一个生活动作,不使用“若干仙人”,不做仪仗队、群众阵列或复制人脸。除非用户明确要求,禁止帝王宝座、垂旒王冠、祭祀法会、仪式花瓶、侍从朝拜和宫廷权力叙事。
视频镜头每镜只设一个人物主动作、一条极慢摄影机路径和至多两层环境运动。横移、轻微推近、缓慢后拉、小幅升降与轻微仰俯交替使用;禁止固定镜头、快速推进、快速环绕、突然变焦和后拉成完整城市总览。近云与远云同向缓慢漂移但速度不同,瀑布持续下落,宽袖、披帛和裙摆随高空微风与身体惯性自然滞后。
4. Media generation
模型、参考与生成策略
关键帧统一使用TextToImage或ImageToImage的Midjourney,默认16:9;所有图像生成提示词末尾必须固定为--v 8.2,且该版本后不得再附加其他参数。无参考时用TextToImage探索首个代表性主镜;有用户参考、已确认人物或已选中的风格关键帧时使用ImageToImage。Midjourney最多使用五张reference_image,每张只承担构图、人物、色彩、材质或光感中的一个职责。首个代表性主镜被用户确认后,将该图作为后续镜头的主要reference_image,以继承空间母语和成像质感;不得只靠文字承诺跨镜人物身份一致。
每个镜头生成的四个结果先作为候选。先按画面验收规则筛选,失败结果不绑定为视频输入、不标记为final_shot。只重做失败镜头,不改变已确认镜头。用户确认某张后,使用SuperResolution的Jimeng SR仅处理该资源,目标4K,detail-synthesis scale为100;不重复超分已达到目标质量的图。超分结果成为该镜唯一主视频参考。
视频使用当前项目中可用的MiniMax H3,默认5秒、16:9、原生2K,以用户确认并超分的图片完整锁定0.00秒首帧。不得新增首帧不存在的重要人物、神兽、建筑或道具。每镜独立生成、独立复核,用户确认后才标为final_shot。若MiniMax H3不可用、失败或账户条件不满足,停止并报告,不静默切换模型或降低分辨率。
5. Prompt writing
Midjourney图片提示词硬规范(固定--v 8.2)
输入解析与双模式执行
- 版本锁定: 所有由Midjourney执行的图像提示词,无论来自完整提示词模式还是一句话意图模式,均使用模型名
Midjourney,并以--v 8.2作为提示词最后一个参数。若输入含有任何其他Midjourney版本后缀,移除该后缀后再附加--v 8.2;其他显式参数按原顺序保留在该后缀之前。 - 完整提示词模式: 当用户提供的是完整的图像提示词、包含具体英文描述、参数或排除项时,除上述版本锁定外逐字原样提交,不翻译、不改写、不优化、不扩写,也不为满足本技能的默认句法而补词。用户的显式参数、画幅与排除项优先。
- 一句话意图模式: 当用户只用一句话描述主体、地点、事件或想要的画面时,主动将其扩写为可生成的英文提示词,并使用本技能的六段事实链、参数与排除项;在所有其他参数之后附加
--v 8.2。默认将用户意图置于“人在无法看尽的中国天宫巨构内部、檐下或边缘”的空间关系中,而不是完整宫殿全景或人物肖像。 - 一句话意图模式的构图先建立压迫式框景:巨柱、梁架、斗拱、藻井、竹帘、船檐或白玉构件从顶部和侧边裁出画外;再在中心或远处留出明亮、深远的云海气口。建筑以歇山、层叠斗拱、朱漆、青碧瓦、白玉、云梯、云桥、云瀑与可无限延展的层级构成,永不完整展示。
- 当一句话意图涉及登阶、抵达、上行或仰望时,优先采用“最低可见落脚平台”这一已在阶梯体系内部的低位机位:白玉天阶由近景斜向右上延伸并越出画框,云纹栏杆、朱漆仪仗柱与带斗拱屋顶的歇脚台以清晰重复节奏没入亮云;上方只露出一段被裁切的唐宋木构,避免生成完整对称的宫殿前广场。人物保持极小比例,以单人缓慢登阶或二至三名分散登阶者建立尺度,不形成仪仗或人群。
- 默认人物只承担尺度、视线和生活感:小比例、侧背或背身、宽袖古装,以眺望、围坐、行走或劳作等克制动作出现。色彩以云白、青瓷或冷青、孔雀蓝、青绿、旧木褐、浅金和铜件为主,朱红仅作受控点缀;保留木材、白玉、青瓦、丝麻、漆面与使用痕迹。
- 默认成像质感为真人古装奇幻电影现场的35mm胶片观感:自然景深、柔和高光、自然曝光滚降、极轻有机颗粒,以及由云面反射、侧光或珠光云光形成的冷暖层次。除非用户明确要求,排除动画、二次元、插画、游戏CG、塑料、霓虹科幻、巨大金属圆环、无人机航拍、完整居中对称宫殿、西方建筑、文字、水印、无意义满屏金光和活体神兽。
使用一条约75—120个英文词的可见事实链,严格按六段顺序书写:
[camera position + frame pressure + overflow edges]; [one continuous Chinese architecture system + repeated rhythm]; [one structural anomaly]; [exact people count + frame coordinates + direction + action]; [bright cloud/water depth]; [material palette + one light condition + rendering target]
前30个英文词必须同时回答:摄影机站在哪里、哪一侧被结构压住、建筑从哪些画框边缘出框。不要以cinematic、wide-angle、epic、majestic、beautiful开头,也不能只写“monumental”或“beyond the frame”而不给具体方向。可用句法包括: - camera directly beneath..., the cropped underside presses in from the top and both sides
- low oblique view from a narrow terrace, the continuous palace wall fills the left half and continues beyond the top, left and bottom edges
- inside a colossal dougong-bracketed structure, the ceiling and column rows vanish beyond three edges
正文必须写出至少三项明确中国结构锚点:Chinese timber-frame celestial architecture、dense interlocking dougong brackets、monumental xieshan eaves、polychrome zaojing coffers、vermilion lacquer columns、white-jade cloud-scroll balustrades、turquoise glazed tiles、Chinese mineral pigments and gilded relief。成像目标写成polished high-chroma Chinese mythic AI animation film keyframe,使用柔和高光、明亮云面反射、孔雀蓝/青绿/朱红/铜金/云白的大色块和极轻单色胶片纹理;避免灰褐风化石城、旅游摄影、低模游戏城市和塑料皮肤。
人物必须在正文前半段拥有精确坐标,例如one tiny female envoy at the lower-right balustrade, back turned, gazing upward。人物默认占画面高度约3%—10%,侧背或背身,脸不是视觉中心。多人写清楚如two adults at the left rail converse while three adults walk along the lower-right corridor,不写模糊人群。衣服用交领、宽袖、长袍、披帛、高髻、玉饰等中国语汇;不默认使用帝君、国王、王冠、宝座、朝拜或祭器。
神兽建筑化时,正文优先使用feather-ribbed reliefs、feather-shaped roof strata、scale-like brackets、serpentine ridge beams、sweeping structural ribs,不要直接写完整phoenix、dragon、bird head、beak、wings、talons或tail。每镜只能有一种图腾语法和一个结构异常。
默认禁用会诱导错误画面的表达:East Asian mythology、celestial emperor、royal palace、ceremonial crown、throne、ritual vase、sacred ceremony、divine light beam、solitary ornate pavilion、floating pavilion、complete gate、wide panorama、aerial overview、cityscape、skyline、three-layer depth composition。需要日光时写具体的peach-gold side sunlight、warm cloud bounce或soft volumetric daylight。
末尾按画面需要加入原子对象排除:
--no gothic cathedral castle baroque rococo victorian roman greek steampunk heraldry crown armor angel cross aerial skyline text watermark logo
默认建筑化神兽镜再加入bird beak talon;用户明确要求活体神兽时删除与目标冲突的排除词。
提示词提交前验收
全部通过才调用Midjourney:
- 第一分句含具体机位、压框方向和至少两条出框边缘。
- 画面不能被一句话概括为“完整宫殿/神门/亭子加云海背景”。
- 同一建筑系统占约55%—70%,明亮云海气口占约25%—40%。
- 只有一个结构异常和一个视觉主语。
- 人物有数量、坐标、朝向和动作,且不是正面写真。
- 正文至少有三项中国结构锚点,不出现上述诱导词。
- 神兽是建筑语法而不是默认活体。
成图验收与纠偏
出现下列任意两项即判失败:完整居中的宫殿、神门或亭子;对称正立面;建筑不足画面一半;没有明亮云海气口;人物成为可读面部写真;帝王宝座或祭祀叙事;活体神兽抢占主体;西方结构或服装;灰褐风化质感;同时出现两个以上异象。失败时先重写提示词前30词的机位、压框与出框关系,只改本轮最关键的三项,不用更长形容词掩盖问题。最多自动重跑一轮,只向用户推荐通过验收的候选。
MiniMax H3视频提示词
使用英文结构化格式,首行锁定首帧:
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
随后依次写:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: N/A
在integrated_multimodal_description中先声明保持首帧人物数量、服装大色块、建筑几何、光向、云海高度与色彩,再写一个清晰人物动作、一种小幅度极慢摄影机运动和至多两层环境运动。人物做缓步、停步、转身、仰望、交谈、抬手或劳作中的一个动作;衣袖、披帛和裙摆产生可见但克制的滞后运动。近云与远云同向缓慢漂移并有速度差,瀑布持续下落。
声音只保留高空风、瀑布、脚步、水声、衣料和必要自然环境声。默认无对白、旁白、歌声、乐器和背景音乐。禁止新增人物、飞鸟、活体神兽、建筑、科技、粒子、法阵、文字、符号和任何西方元素;禁止固定镜头、快速推进、旋转、穿模、结构融化、人物漂移、焦距突变和后拉展示完整巨构。
6. Video assembly
复核与装配
单镜保留MiniMax H3原生2K,不重复视频超分。多镜成片只使用用户确认的final_shot,按批准顺序装配;默认硬切,只有明确时间或空间过渡才使用不超过0.5秒的短淡化。
剪辑使用约2.5—3.5秒有效段落与少量5秒主镜交替,保留人物动作完成以及衣料、云雾和瀑布的环境反馈余量。相邻镜头检查人物数量与服装色块、运动方向、光向、云层方向、云海高度和建筑结构连续性。若视频把巨构后拉成完整城市、生成固定镜头、冻结云层、复制人物、静止衣料或让建筑结构融化,该镜不得进入成片。
禁止添加背景音乐、字幕、标题、logo和文字叠加。音乐轨道必须为空;只保留并平衡高空风、瀑布、脚步、水声和衣料声。最终交付保持16:9、2K。