Hitchcock-style suspense film
스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.
适用于悬疑短片、心理惊悚、电影感vlog、广告氛围片、艺术影像等创作。用户只需上传一张图片或一段想法,即可一键生成希区柯克风格短片:高对比伦勃朗光影、封闭式构图、希区柯克变焦、窥视视角等标志性元素自动
제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.
전체 제작 흐름
1. 제작 기획
全流程编排逻辑
阶段依赖关系
1 → 2 → 3 → 4 → 5,各阶段严格串行,有确认节点时须等待用户批准再继续。
阶段 1:建立全局规格(Final_Video_Spec.md)
- 在任何分镜或生成开始前,通过 text_editor 创建 Final_Video_Spec.md,锁定以下参数:
- 画幅:16:9
- 分辨率:1080p(默认),用户可要求其他规格
- 色彩模式:黑白经典(默认)或复古彩色(用户选择后写入)
- 风格标签:希区柯克悬疑、35mm胶片颗粒、伦勃朗高对比光、封闭式构图
- 音频策略:输出视频无音频轨道(用户后期自行配乐)
- 语言:中文(界面/交互),影像内容无对白要求
- 若用户未明确色彩模式,使用 reply_to_user 询问「黑白经典」或「复古彩色」,获得答复后写入规格文件。
阶段 2:素材解析(可选,仅当用户上传了图片或视频时触发)
- 调用 resource_prepare_and_analyze 分析用户上传的参考图或短视频。
- 将分析结果(主体描述、光影倾向、构图关键词、道具线索)注入后续分镜阶段上下文。
阶段 3:分镜设计
- 调用 storyboard_designer,基于用户输入(图片分析结果 + 文字创意)生成分镜表。
- 分镜完成后,暂停并向用户展示分镜草案(镜号、镜头类型、景别、画面描述、时长预估)。
- 使用卡片或 reply_to_user 邀请用户确认或修改(可调整镜头数量、替换镜头类型、修改任意镜头描述和时长)。
- 必须获得用户确认后方可进入下一阶段。
阶段 4:媒体生成
- 调用 media_generator 生成各镜头视频片段。
- 若脚本中有需要跨镜头保持一致的人物或场景,先完成图像生成并绑定至对应 key_element,再生成各镜头视频。
- 各镜头生成完毕后,暂停并向用户展示预览列表,允许用户对不满意的镜头申请重新生成。
阶段 5:剪辑与输出
- 调用 video_assembler 按分镜顺序拼接所有镜头,不添加任何音频轨道。
- 组装完成后,引导用户导出最终 MP4 文件。
2. 멀티모달 분석
参考素材解析规则
解析目标
将用户上传的图片或短视频转化为可注入分镜阶段的结构化信号,不做风格覆盖,只做内容提取。
图片解析
- 主体识别:人物(性别、年龄感、服装时代特征)、建筑/室内环境(旅馆、走廊、楼梯、地下室等)、关键道具(钥匙、信件、首饰、照片、箱子)。
- 光影特征:现有光源方向、对比度倾向(高对比 / 平光 / 柔光)、是否有条纹投影(百叶窗、格栅)。
- 构图倾向:人物在画面中的位置(居中 / 边缘 / 下角)、是否存在天然遮挡框(门框、窗框、栏杆)。
- 输出:以关键词列表形式输出,供分镜阶段作为视觉锚点。
视频解析
- 提取整体叙事节奏(静态 / 运动)、主要场景类型、关键动作时刻。
- 若视频中有明显的希区柯克风格元素(俯拍、特写、封闭构图),标注以便在分镜中延续。
- 提取有复用价值的关键帧(如建立空间感的第一帧、人物反应特写帧),供 media_generator 阶段作为 start_frame 或 reference_image 使用。
麦高芬道具识别
- 若素材中出现可疑的重复或孤立道具(信件、钥匙、首饰、照片、箱子),标记为潜在麦高芬,建议在分镜中安排道具反复出现。
3. 스토리보드 설계
真人写实强制锁定(所有分镜最高优先级)
- 所有画面风格锁定为真人写实、自然老化质感;禁止动漫、二次元、CG 渲染、扁平插画、抽象艺术、高饱和塑料感。
- 人物皮肤须保留毛孔、痣、皱纹、红血丝等真实细节;服装材质可见纹理(棉麻、皮革、金属磨损);光影自然或戏剧化,但绝不卡通化。
- 所有 shot 描述中只要涉及人物,须隐含「真实皮肤纹理、自然老化质感」要求,防止画面向 CG 或动漫风格漂移。
叙事结构规则
- 所有脚本遵循「铺垫 → 异常 → 惊悚 → 留白」四段结构,悬念密度大于惊吓密度;禁止直白血腥、尸体、伤口,惊悚时刻用间接暗示(刀刃上的水滴、浴帘上的手印、扭曲的阴影、突然的静音)。
- 默认镜头数:3~6 个,每个镜头时长 3~8 秒。
- 每个脚本至少包含 一个希区柯克变焦镜头;其余镜头从「静态长镜、俯拍牢笼、窥视视角、特写逼脸」中组合选用。
- 特写镜头(眼部、嘴角、手指)占比建议 ≥ 40%。
- 麦高芬道具强制贯穿:每个脚本须指定一件麦高芬道具(钥匙、信件、首饰、秘密文件等),在至少两个镜头中以特写出现,且角色与之互动(拿起、查看、藏匿);道具本身无需解释,但须驱动角色行为。
- 日常异化原则:场景应为日常生活环境(洗漱、做饭、开窗、走路),但须插入至少一处反常细节——窗外闪过人影、门缝下的眼睛、镜子中的异常反射、物件自行移动——以制造心理撕裂感。
- 主观镜头切换:每个悬疑段落至少包含一次三镜组合:「角色第一视角看向某处」→「切到该处物体/人影特写」→「切回角色惊恐反应特写」;可用望远镜框、门缝、钥匙孔形状遮挡边缘强化窥视感。
key_element 设计
element character(若涉及人物)
- 描述外貌特征(性别、年龄感、服装时代特征)、面部辨识要素(发型、眼神)、肤色阴影倾向、服装主色。
- 若人物在脚本中有关键表情或重要出镜,须为该角色预设**角色身份板(identity sheet)**描述,标注至少四个表情状态(平静、惊恐、狐疑、阴沉),供 media_generator 阶段生成参考图后绑定为 asset_id。
- 同一人物在多个镜头出现时,所有 shot 描述严格引用身份板中的外貌与表情库,确保跨镜头一致性。
element scene(核心场景)
- 描述空间结构(走廊深度、楼梯旋转方向、窗户/百叶窗位置)。
- 标注天然遮挡框元素(门框、窗框、栏杆)及其在画面中的位置关系。
- 标注光源位置及条纹投影来源(百叶窗、格栅)。
镜头(shot)设计规则
每个 shot 描述必须包含以下字段:
字段说明镜头类型希区柯克变焦 / 静态长镜 / 俯拍牢笼 / 窥视视角 / 特写逼脸景别特写 / 中景 / 远景运镜参数精确描述摄影机运动方式(见下方各类型规范)画面内容人物动作、表情、道具出现位置、空间关系光影细化光源方向、明暗分布、是否有条纹投影时长预估3~8 秒建议音效(仅供用户后期配乐参考,不生成)如:尖锐提琴刺音、低音长音、静音留白、环境白噪音(滴水、木门吱呀、钟表滴答)
人物情绪与面部表情细化规则(真人感核心)
- 禁止使用抽象情绪词(如"他惊恐地说");必须拆解为具体生理反应和可见行为:
- 惊恐:眼睛猛地睁大,瞳孔收缩,嘴唇微张却发不出声,呼吸停滞,额头渗出细汗。
- 狐疑:眉头缓慢皱起,眼神斜视,嘴角下撇,手指无意识敲击桌面。
- 内心压抑:喉结上下滚动,深呼吸后缓缓吐气,眼神躲闪,嘴角紧绷。
- 情绪转折时强制使用局部特写:在人物面临关键选择或情绪转折的 shot 中,必须以局部特写(眼睛、嘴角、手部颤抖)传递内心活动,而非直接拍全脸。
- 对白/独白节点:若 shot 中涉及台词,须以标点控制语气(?!——…),标注停顿、轻叹、结巴等口语化细节;内心独白标注为画外音低语处理,不在视频提示词中生成实际音效。
各镜头类型运镜规范
希区柯克变焦(核心,每脚本至少一个)
- 镜头物理向前推进的同时,焦距向后拉(变焦补偿推进),主体人物在画面中的大小保持不变。
- 背景空间被极度拉伸/压缩,产生空间扭曲和强烈眩晕感。
- 运动速度:中速(2~4 秒内完成),推进与变焦同步。
- 人物配合表情:迷茫、惊恐、眼神失焦或瞳孔放大。
静态长镜
- 固定机位,无任何摄影机运动。
- 主要用于铺垫段落,建立封闭空间压迫感。
- 构图要求:人物置于画面边缘或下角,门框/窗框/栏杆框住人物。
俯拍牢笼
- 上帝视角(极度俯拍),人物渺小置于空间中心。
- 周围建筑结构(楼梯栏杆、廊道墙壁)形成封闭囚笼感。
- 运动:固定机位或极缓慢垂直下降(模拟凝视)。
窥视视角
- 主观窥视镜头,模拟从门缝、窗缝或百叶窗间隙偷看。
- 画面边缘有遮挡物虚化(门框边缘、百叶窗叶片)。
- 带轻微手持晃动,增加不安感。
特写逼脸
- 极致特写,聚焦眼部、嘴角、手部(持道具)。
- 侧光,明暗各半,背景完全虚化。
- 无摄影机运动,靠演员微表情传递张力。
视觉硬性规则(所有镜头强制遵守)
维度规则画幅16:9,禁止强制黑边构图封闭式构图为主;人物常位于画面边缘或下角;多用俯拍、仰拍光影高对比伦勃朗光(侧光/侧逆光),面部一半亮一半阴;百叶窗条纹投影切割人体或墙面;大面积死黑,暗部无细节;禁止平光、柔光、灰调色彩(黑白模式)极致黑白,黑部死黑,亮部仅限面部/关键物体色彩(复古彩色模式)低饱和复古色(暗红、墨绿、灰蓝),高光暖黄,阴影沉黑;惊悚元素(血迹、红窗帘)允许局部高饱和红质感35mm胶片颗粒(中等强度)、边缘轻微色散、四角自然暗角、轻微胶片抖动字幕禁止任何字幕或水印
音频设计
- 本 Skill 输出视频不含音频轨道,无需设计任何 audio_layer(背景音乐、音效、旁白均不生成),留空供用户后期自行配乐。
4. 미디어 생성
关键元素图像生成
- 若脚本中有需要跨镜头保持一致的人物或场景,先通过 TextToImage 生成 key_element 参考图。
- 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 同一人物不同镜头的后续参考图使用 ImageToImage(同模型),以首张生成结果为参考,保持外貌一致性。
- 生成后将资源注册为 asset_id 并绑定至对应 key_element。
镜头视频生成
主路径
- 工具:MultiModalToVideo,模型:Seedance 2.5,分辨率:480p。
- 每个镜头生成时,image_infos 中传入该镜头对应的 key_element 参考图(人物图 + 场景图)。
- reference_video 策略:仅当前后两个镜头的场景/人物连续性极强时(如同一房间内人物的动作延续),才将上一镜头的 final_shot 视频作为 reference_video 附加;通常不使用视频参考,避免过度锁定而损失变焦/构图自由度。
- 时长参数:按分镜表中各镜头的时长预估值设置,范围 4~30s(Seedance 2.5(分辨率 480p) 支持范围)。
备用路径
- 若 Seedance 2.5(分辨率 480p) 失败,优先切换至 Seedance 2.5(480p)重试。
- 若 Seedance 2.5均失败,改用 FirstFrameToVideo + Google Veo3.1 Fast(720p,推荐时长 6s 或 8s);此时将分镜对应 key_element 图作为 start_frame 输入。
- 不同工具间不静默切换,须告知用户并确认。
超分处理
- 若生成分辨率为 720p,后期通过 super_resolution / MediaKit 将视频上升至 1080p,fps 保持 24。
音频处理
- 本 Skill 不生成任何音频资源(不调用 text_to_narration、text_to_instrumental、lyrics_to_song 等音频工具)。
- 若所用视频生成模型默认输出含音频轨道(如 FirstFrameToVideo 系列),在 video_assembler 阶段统一静音/移除所有音频通道。
5. 프롬프트 작성
全局规则
- 提示词以中文书写(与用户交互语言一致)。
- 所有视频提示词末尾固定附加反向提示关键词:无字幕,无水印,无现代物品(手机、汽车、LED灯),无音乐,无对白音频。
- 提示词中不描述任何音效或背景音乐(输出无音频)。
- 参考图占位符按顺序使用 <<<image_1>>>、<<<image_2>>> …(首张为人物参考,次张为场景参考)。
希区柯克变焦提示词模板(核心,每脚本至少一镜)
<<<image_1>>>(人物参考)<<<image_2>>>(场景参考)
希区柯克变焦,镜头物理向前推进同时焦距向后拉,主体人物大小在画面中保持不变,背后[走廊/楼梯/房间]空间极度拉伸扭曲,产生强烈眩晕感和空间崩塌感。人物表情[迷茫/惊恐],眼神失焦或瞳孔放大,微表情紧绷。高对比伦勃朗侧光,面部一半亮一半暗,一点眼神光。[极致黑白,黑部死黑无细节,亮部仅限面部与关键物体 / 低饱和复古色调(暗红、墨绿、灰蓝),高光暖黄色(接近#F5D6B3),阴影沉黑(接近#1A1A1A)]。16:9,35mm胶片颗粒中等强度,四角自然暗角,边缘轻微色散,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。
其他镜头类型提示词模板
静态长镜
<<<image_1>>>(人物参考)<<<image_2>>>(场景参考)
固定机位,无摄影机运动。[景别],[画面内容描述]。人物置于画面[边缘/下角],[门框/窗框/栏杆]形成封闭式构图。高对比侧逆光,人物剪影,百叶窗条纹投影切割墙面,大面积死黑。[极致黑白 / 低饱和复古彩色]。16:9,35mm胶片颗粒,四角暗角,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。
俯拍牢笼
<<<image_1>>>(人物参考)<<<image_2>>>(场景参考)
上帝视角极度俯拍,[固定机位 / 极缓慢垂直下降]。人物渺小站在[楼梯旋转中心/廊道中央],周围[楼梯栏杆/廊道墙壁/门框]形成封闭螺旋囚笼感。顶光,四周死黑,人物与结构线条形成强烈几何对比。[极致黑白 / 低饱和复古彩色]。16:9,35mm胶片颗粒,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。
窥视视角
主观窥视镜头,模拟从[门缝/窗缝/百叶窗间隙]偷看目标,画面边缘有[门框边缘/百叶窗叶片]虚化遮挡。轻微手持晃动,增加紧张不安感。[目标人物/物体的画面内容描述]。低照度,低饱和,高对比。[极致黑白 / 低饱和复古彩色]。16:9,胶片颗粒,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。
特写逼脸
<<<image_1>>>(人物参考)
极致特写,聚焦[眼部/嘴角/手部持道具],画面仅呈现局部细节,背景完全虚化。侧光,明暗各半,细微[表情变化/肌肉紧绷/手指颤抖]清晰可见。无摄影机运动。[极致黑白 / 低饱和复古彩色]。16:9,35mm胶片颗粒,轻微暗角,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。
色彩模式描述规范
色彩模式在提示词中的固定描述黑白经典极致黑白,黑部死黑无细节,亮部仅限面部与关键物体,禁止灰调复古彩色低饱和复古色调(暗红、墨绿、灰蓝),高光暖黄色(接近#F5D6B3),阴影沉黑(接近#1A1A1A),惊悚元素允许局部高饱和红
质感描述规范(所有镜头固定叠加)
35mm胶片颗粒中等强度,四角自然暗角(亮度降低约12%,过渡自然),边缘轻微红/青色散(偏移极小),24fps,禁止降噪、禁止过度锐化,禁止磨皮
6. 동영상 조립
剪辑与输出规则
时间线组装
- 严格按分镜表顺序拼接各镜头 final_shot,不调整镜头顺序(除非用户明确要求)。
- 各镜头时长以分镜表预估值为准;若实际生成时长与预估有偏差,优先保留完整画面,不强制裁剪关键动作。
转场
- 默认使用硬切(无过渡效果),保留希区柯克风格的剪辑节奏感。
- 特殊情况(如铺垫段落过渡至惊悚段落)可使用极短淡入淡出(≤ 0.3 秒),需在分镜表中明确标注。
- 禁止使用溶解、划像、缩放类花哨转场。
节奏控制
- 铺垫镜头(静态长镜)保持原速,不做快/慢处理。
- 惊悚高潮镜头(希区柯克变焦、突兀急推)保持原速,依靠运镜本身传递张力,不叠加变速效果。
音频处理(关键)
- 最终输出文件不包含任何音频轨道。
- 若生成的视频片段携带音频(包括模型自动生成的音效或环境音),在组装阶段统一移除/静音所有音频通道。
- 输出为纯视频流的 MP4 文件,无音频轨道,便于用户后期自行添加配乐。
导出参数
- 格式:MP4
- 帧率:24fps
- 画幅:16:9
- 分辨率:1080p(1920×1080)
- 无字幕、无水印、无音频轨道