yeha.ai
返回模板库

希区柯克·悬疑电影风格工坊

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

适用于悬疑短片、心理惊悚、电影感vlog、广告氛围片、艺术影像等创作。用户只需上传一张图片或一段想法,即可一键生成希区柯克风格短片:高对比伦勃朗光影、封闭式构图、希区柯克变焦、窥视视角等标志性元素自动

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

全流程编排逻辑

阶段依赖关系

1 → 2 → 3 → 4 → 5,各阶段严格串行,有确认节点时须等待用户批准再继续。

阶段 1:建立全局规格(Final_Video_Spec.md)

  • 在任何分镜或生成开始前,通过 text_editor 创建 Final_Video_Spec.md,锁定以下参数:
    • 画幅:16:9
    • 分辨率:1080p(默认),用户可要求其他规格
    • 色彩模式:黑白经典(默认)或复古彩色(用户选择后写入)
    • 风格标签:希区柯克悬疑、35mm胶片颗粒、伦勃朗高对比光、封闭式构图
    • 音频策略:输出视频无音频轨道(用户后期自行配乐)
    • 语言:中文(界面/交互),影像内容无对白要求
  • 若用户未明确色彩模式,使用 reply_to_user 询问「黑白经典」或「复古彩色」,获得答复后写入规格文件。

阶段 2:素材解析(可选,仅当用户上传了图片或视频时触发)

  • 调用 resource_prepare_and_analyze 分析用户上传的参考图或短视频。
  • 将分析结果(主体描述、光影倾向、构图关键词、道具线索)注入后续分镜阶段上下文。

阶段 3:分镜设计

  • 调用 storyboard_designer,基于用户输入(图片分析结果 + 文字创意)生成分镜表。
  • 分镜完成后,暂停并向用户展示分镜草案(镜号、镜头类型、景别、画面描述、时长预估)。
  • 使用卡片或 reply_to_user 邀请用户确认或修改(可调整镜头数量、替换镜头类型、修改任意镜头描述和时长)。
  • 必须获得用户确认后方可进入下一阶段。

阶段 4:媒体生成

  • 调用 media_generator 生成各镜头视频片段。
  • 若脚本中有需要跨镜头保持一致的人物或场景,先完成图像生成并绑定至对应 key_element,再生成各镜头视频。
  • 各镜头生成完毕后,暂停并向用户展示预览列表,允许用户对不满意的镜头申请重新生成。

阶段 5:剪辑与输出

  • 调用 video_assembler 按分镜顺序拼接所有镜头,不添加任何音频轨道
  • 组装完成后,引导用户导出最终 MP4 文件。
2. 多模态分析

参考素材解析规则

解析目标

将用户上传的图片或短视频转化为可注入分镜阶段的结构化信号,不做风格覆盖,只做内容提取。

图片解析

  • 主体识别:人物(性别、年龄感、服装时代特征)、建筑/室内环境(旅馆、走廊、楼梯、地下室等)、关键道具(钥匙、信件、首饰、照片、箱子)。
  • 光影特征:现有光源方向、对比度倾向(高对比 / 平光 / 柔光)、是否有条纹投影(百叶窗、格栅)。
  • 构图倾向:人物在画面中的位置(居中 / 边缘 / 下角)、是否存在天然遮挡框(门框、窗框、栏杆)。
  • 输出:以关键词列表形式输出,供分镜阶段作为视觉锚点。

视频解析

  • 提取整体叙事节奏(静态 / 运动)、主要场景类型、关键动作时刻。
  • 若视频中有明显的希区柯克风格元素(俯拍、特写、封闭构图),标注以便在分镜中延续。
  • 提取有复用价值的关键帧(如建立空间感的第一帧、人物反应特写帧),供 media_generator 阶段作为 start_frame 或 reference_image 使用。

麦高芬道具识别

  • 若素材中出现可疑的重复或孤立道具(信件、钥匙、首饰、照片、箱子),标记为潜在麦高芬,建议在分镜中安排道具反复出现。
3. 故事板设计

真人写实强制锁定(所有分镜最高优先级)

  • 所有画面风格锁定为真人写实、自然老化质感;禁止动漫、二次元、CG 渲染、扁平插画、抽象艺术、高饱和塑料感。
  • 人物皮肤须保留毛孔、痣、皱纹、红血丝等真实细节;服装材质可见纹理(棉麻、皮革、金属磨损);光影自然或戏剧化,但绝不卡通化。
  • 所有 shot 描述中只要涉及人物,须隐含「真实皮肤纹理、自然老化质感」要求,防止画面向 CG 或动漫风格漂移。

叙事结构规则

  • 所有脚本遵循「铺垫 → 异常 → 惊悚 → 留白」四段结构,悬念密度大于惊吓密度;禁止直白血腥、尸体、伤口,惊悚时刻用间接暗示(刀刃上的水滴、浴帘上的手印、扭曲的阴影、突然的静音)。
  • 默认镜头数:3~6 个,每个镜头时长 3~8 秒。
  • 每个脚本至少包含 一个希区柯克变焦镜头;其余镜头从「静态长镜、俯拍牢笼、窥视视角、特写逼脸」中组合选用。
  • 特写镜头(眼部、嘴角、手指)占比建议 ≥ 40%
  • 麦高芬道具强制贯穿:每个脚本须指定一件麦高芬道具(钥匙、信件、首饰、秘密文件等),在至少两个镜头中以特写出现,且角色与之互动(拿起、查看、藏匿);道具本身无需解释,但须驱动角色行为。
  • 日常异化原则:场景应为日常生活环境(洗漱、做饭、开窗、走路),但须插入至少一处反常细节——窗外闪过人影、门缝下的眼睛、镜子中的异常反射、物件自行移动——以制造心理撕裂感。
  • 主观镜头切换:每个悬疑段落至少包含一次三镜组合:「角色第一视角看向某处」→「切到该处物体/人影特写」→「切回角色惊恐反应特写」;可用望远镜框、门缝、钥匙孔形状遮挡边缘强化窥视感。

key_element 设计

element character(若涉及人物)

  • 描述外貌特征(性别、年龄感、服装时代特征)、面部辨识要素(发型、眼神)、肤色阴影倾向、服装主色。
  • 若人物在脚本中有关键表情或重要出镜,须为该角色预设**角色身份板(identity sheet)**描述,标注至少四个表情状态(平静、惊恐、狐疑、阴沉),供 media_generator 阶段生成参考图后绑定为 asset_id。
  • 同一人物在多个镜头出现时,所有 shot 描述严格引用身份板中的外貌与表情库,确保跨镜头一致性。

element scene(核心场景)

  • 描述空间结构(走廊深度、楼梯旋转方向、窗户/百叶窗位置)。
  • 标注天然遮挡框元素(门框、窗框、栏杆)及其在画面中的位置关系。
  • 标注光源位置及条纹投影来源(百叶窗、格栅)。

镜头(shot)设计规则

每个 shot 描述必须包含以下字段:

字段说明镜头类型希区柯克变焦 / 静态长镜 / 俯拍牢笼 / 窥视视角 / 特写逼脸景别特写 / 中景 / 远景运镜参数精确描述摄影机运动方式(见下方各类型规范)画面内容人物动作、表情、道具出现位置、空间关系光影细化光源方向、明暗分布、是否有条纹投影时长预估3~8 秒建议音效(仅供用户后期配乐参考,不生成)如:尖锐提琴刺音、低音长音、静音留白、环境白噪音(滴水、木门吱呀、钟表滴答)

人物情绪与面部表情细化规则(真人感核心)

  • 禁止使用抽象情绪词(如"他惊恐地说");必须拆解为具体生理反应和可见行为:
    • 惊恐:眼睛猛地睁大,瞳孔收缩,嘴唇微张却发不出声,呼吸停滞,额头渗出细汗。
    • 狐疑:眉头缓慢皱起,眼神斜视,嘴角下撇,手指无意识敲击桌面。
    • 内心压抑:喉结上下滚动,深呼吸后缓缓吐气,眼神躲闪,嘴角紧绷。
  • 情绪转折时强制使用局部特写:在人物面临关键选择或情绪转折的 shot 中,必须以局部特写(眼睛、嘴角、手部颤抖)传递内心活动,而非直接拍全脸。
  • 对白/独白节点:若 shot 中涉及台词,须以标点控制语气(?!——…),标注停顿、轻叹、结巴等口语化细节;内心独白标注为画外音低语处理,不在视频提示词中生成实际音效。

各镜头类型运镜规范

希区柯克变焦(核心,每脚本至少一个)

  • 镜头物理向前推进的同时,焦距向后拉(变焦补偿推进),主体人物在画面中的大小保持不变
  • 背景空间被极度拉伸/压缩,产生空间扭曲和强烈眩晕感。
  • 运动速度:中速(2~4 秒内完成),推进与变焦同步。
  • 人物配合表情:迷茫、惊恐、眼神失焦或瞳孔放大。

静态长镜

  • 固定机位,无任何摄影机运动。
  • 主要用于铺垫段落,建立封闭空间压迫感。
  • 构图要求:人物置于画面边缘或下角,门框/窗框/栏杆框住人物。

俯拍牢笼

  • 上帝视角(极度俯拍),人物渺小置于空间中心。
  • 周围建筑结构(楼梯栏杆、廊道墙壁)形成封闭囚笼感。
  • 运动:固定机位或极缓慢垂直下降(模拟凝视)。

窥视视角

  • 主观窥视镜头,模拟从门缝、窗缝或百叶窗间隙偷看。
  • 画面边缘有遮挡物虚化(门框边缘、百叶窗叶片)。
  • 带轻微手持晃动,增加不安感。

特写逼脸

  • 极致特写,聚焦眼部、嘴角、手部(持道具)。
  • 侧光,明暗各半,背景完全虚化。
  • 无摄影机运动,靠演员微表情传递张力。

视觉硬性规则(所有镜头强制遵守)

维度规则画幅16:9,禁止强制黑边构图封闭式构图为主;人物常位于画面边缘或下角;多用俯拍、仰拍光影高对比伦勃朗光(侧光/侧逆光),面部一半亮一半阴;百叶窗条纹投影切割人体或墙面;大面积死黑,暗部无细节;禁止平光、柔光、灰调色彩(黑白模式)极致黑白,黑部死黑,亮部仅限面部/关键物体色彩(复古彩色模式)低饱和复古色(暗红、墨绿、灰蓝),高光暖黄,阴影沉黑;惊悚元素(血迹、红窗帘)允许局部高饱和红质感35mm胶片颗粒(中等强度)、边缘轻微色散、四角自然暗角、轻微胶片抖动字幕禁止任何字幕或水印

音频设计

  • 本 Skill 输出视频不含音频轨道,无需设计任何 audio_layer(背景音乐、音效、旁白均不生成),留空供用户后期自行配乐。
4. 媒体生成

关键元素图像生成

  • 若脚本中有需要跨镜头保持一致的人物或场景,先通过 TextToImage 生成 key_element 参考图。
  • 推荐模型:Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K
  • 同一人物不同镜头的后续参考图使用 ImageToImage(同模型),以首张生成结果为参考,保持外貌一致性。
  • 生成后将资源注册为 asset_id 并绑定至对应 key_element。

镜头视频生成

主路径

  • 工具:MultiModalToVideo,模型:Seedance 2.5,分辨率:480p
  • 每个镜头生成时,image_infos 中传入该镜头对应的 key_element 参考图(人物图 + 场景图)。
  • reference_video 策略:仅当前后两个镜头的场景/人物连续性极强时(如同一房间内人物的动作延续),才将上一镜头的 final_shot 视频作为 reference_video 附加;通常不使用视频参考,避免过度锁定而损失变焦/构图自由度。
  • 时长参数:按分镜表中各镜头的时长预估值设置,范围 4~30s(Seedance 2.5(分辨率 480p) 支持范围)。

备用路径

  • Seedance 2.5(分辨率 480p) 失败,优先切换至 Seedance 2.5(480p)重试。
  • 若 Seedance 2.5均失败,改用 FirstFrameToVideo + Google Veo3.1 Fast(720p,推荐时长 6s 或 8s);此时将分镜对应 key_element 图作为 start_frame 输入。
  • 不同工具间不静默切换,须告知用户并确认。

超分处理

  • 若生成分辨率为 720p,后期通过 super_resolution / MediaKit 将视频上升至 1080p,fps 保持 24。

音频处理

  • 本 Skill 不生成任何音频资源(不调用 text_to_narration、text_to_instrumental、lyrics_to_song 等音频工具)。
  • 若所用视频生成模型默认输出含音频轨道(如 FirstFrameToVideo 系列),在 video_assembler 阶段统一静音/移除所有音频通道。
5. 提示词撰写

全局规则

  • 提示词以中文书写(与用户交互语言一致)。
  • 所有视频提示词末尾固定附加反向提示关键词:无字幕,无水印,无现代物品(手机、汽车、LED灯),无音乐,无对白音频。
  • 提示词中不描述任何音效或背景音乐(输出无音频)。
  • 参考图占位符按顺序使用 <<<image_1>>>、<<<image_2>>> …(首张为人物参考,次张为场景参考)。

希区柯克变焦提示词模板(核心,每脚本至少一镜)

<<<image_1>>>(人物参考)<<<image_2>>>(场景参考)

希区柯克变焦,镜头物理向前推进同时焦距向后拉,主体人物大小在画面中保持不变,背后[走廊/楼梯/房间]空间极度拉伸扭曲,产生强烈眩晕感和空间崩塌感。人物表情[迷茫/惊恐],眼神失焦或瞳孔放大,微表情紧绷。高对比伦勃朗侧光,面部一半亮一半暗,一点眼神光。[极致黑白,黑部死黑无细节,亮部仅限面部与关键物体 / 低饱和复古色调(暗红、墨绿、灰蓝),高光暖黄色(接近#F5D6B3),阴影沉黑(接近#1A1A1A)]。16:9,35mm胶片颗粒中等强度,四角自然暗角,边缘轻微色散,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。

其他镜头类型提示词模板

静态长镜

<<<image_1>>>(人物参考)<<<image_2>>>(场景参考)

固定机位,无摄影机运动。[景别],[画面内容描述]。人物置于画面[边缘/下角],[门框/窗框/栏杆]形成封闭式构图。高对比侧逆光,人物剪影,百叶窗条纹投影切割墙面,大面积死黑。[极致黑白 / 低饱和复古彩色]。16:9,35mm胶片颗粒,四角暗角,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。

俯拍牢笼

<<<image_1>>>(人物参考)<<<image_2>>>(场景参考)

上帝视角极度俯拍,[固定机位 / 极缓慢垂直下降]。人物渺小站在[楼梯旋转中心/廊道中央],周围[楼梯栏杆/廊道墙壁/门框]形成封闭螺旋囚笼感。顶光,四周死黑,人物与结构线条形成强烈几何对比。[极致黑白 / 低饱和复古彩色]。16:9,35mm胶片颗粒,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。

窥视视角

主观窥视镜头,模拟从[门缝/窗缝/百叶窗间隙]偷看目标,画面边缘有[门框边缘/百叶窗叶片]虚化遮挡。轻微手持晃动,增加紧张不安感。[目标人物/物体的画面内容描述]。低照度,低饱和,高对比。[极致黑白 / 低饱和复古彩色]。16:9,胶片颗粒,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。

特写逼脸

<<<image_1>>>(人物参考)

极致特写,聚焦[眼部/嘴角/手部持道具],画面仅呈现局部细节,背景完全虚化。侧光,明暗各半,细微[表情变化/肌肉紧绷/手指颤抖]清晰可见。无摄影机运动。[极致黑白 / 低饱和复古彩色]。16:9,35mm胶片颗粒,轻微暗角,24fps。无字幕,无水印,无现代物品,无音乐,无对白音频。

色彩模式描述规范

色彩模式在提示词中的固定描述黑白经典极致黑白,黑部死黑无细节,亮部仅限面部与关键物体,禁止灰调复古彩色低饱和复古色调(暗红、墨绿、灰蓝),高光暖黄色(接近#F5D6B3),阴影沉黑(接近#1A1A1A),惊悚元素允许局部高饱和红

质感描述规范(所有镜头固定叠加)

35mm胶片颗粒中等强度,四角自然暗角(亮度降低约12%,过渡自然),边缘轻微红/青色散(偏移极小),24fps,禁止降噪、禁止过度锐化,禁止磨皮

6. 视频合成

剪辑与输出规则

时间线组装

  • 严格按分镜表顺序拼接各镜头 final_shot,不调整镜头顺序(除非用户明确要求)。
  • 各镜头时长以分镜表预估值为准;若实际生成时长与预估有偏差,优先保留完整画面,不强制裁剪关键动作。

转场

  • 默认使用硬切(无过渡效果),保留希区柯克风格的剪辑节奏感。
  • 特殊情况(如铺垫段落过渡至惊悚段落)可使用极短淡入淡出(≤ 0.3 秒),需在分镜表中明确标注。
  • 禁止使用溶解、划像、缩放类花哨转场。

节奏控制

  • 铺垫镜头(静态长镜)保持原速,不做快/慢处理。
  • 惊悚高潮镜头(希区柯克变焦、突兀急推)保持原速,依靠运镜本身传递张力,不叠加变速效果。

音频处理(关键)

  • 最终输出文件不包含任何音频轨道
  • 若生成的视频片段携带音频(包括模型自动生成的音效或环境音),在组装阶段统一移除/静音所有音频通道。
  • 输出为纯视频流的 MP4 文件,无音频轨道,便于用户后期自行添加配乐。

导出参数

  • 格式:MP4
  • 帧率:24fps
  • 画幅:16:9
  • 分辨率:1080p(1920×1080)
  • 无字幕、无水印、无音频轨道