贾樟柯电影风格短片
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
适用于社会纪实、文艺独立短片创作,乡土纪实美学,生成贾樟柯式纪实美学短片。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
全局流程与确认节点
核心原则: 分阶段推进,每个关键节点暂停并等待用户确认后再继续,不得一次性跑完全流程。
输入类型判断
开始前判断用户输入类型,按以下规则处理:
- 完整剧本: 保留原角色、关系、事件顺序、对白、场景和结局;只调整摄影、表演、环境细节、声音和剪辑,不擅自改写剧情。若剧本缺少人物行动或时代信息,先向用户提出修改建议,得到确认后才能改变剧情。
- 故事梗概: 补全场景和人物动作,保留核心冲突及结局。
- 简短想法: 允许按本 Skill 规则扩展完整故事。
- 仅参考素材: 先调用 resource_prepare_and_analyze 分析素材,再请用户确定故事方向。
阶段 0:建立全局参数文档
用 text_editor 创建 Final_Video_Spec.md,锁定以下全局参数:
- 片名(用户提供或AI生成)
- 画幅:16:9
- 分辨率:1080p
- 帧率:24fps
- 时长意向(默认1–3分钟)
- 叙事基调(进城务工 / 下岗 / 小镇青年 / 故土没落)
- 视觉风格锚点:贾樟柯纪实美学(县城生活流,新旧并存,手持微晃/固定长镜头,环境音主导,不强制统一色调滤镜)
- 语言:中文方言碎片环境音为主,无旁白,无字幕
阶段 1:叙事基调解析(含用户输入分析)
- 若用户上传了音频文件,调用 resource_prepare_and_analyze 分析情感基调、语速节奏、有无人声碎片,输出推荐叙事基调。
- 若用户上传了人物参考图,调用 resource_prepare_and_analyze 提取外貌特征(脸型、肤色、发型、服装细节),输出结构化描述,供后续角色参考图生成使用。
- 按输入类型处理叙事内容:
- 完整剧本: 提取角色、场景、人物任务、事件顺序、对白、结局和时代背景,生成剧本分析摘要,不重新编故事。
- 故事梗概: 补全可见动作和场景关系,保留核心冲突及结局。
- 简短想法: 扩展为具有具体任务、现实阻碍和可见选择的生活流故事。
- 将叙事内容呈现给用户,等待确认或修改后方可进入下一阶段。
阶段 1.5:节奏、运镜与时长自定义(叙事线确认后、分镜生成前,不可跳过)
叙事线经用户确认后,一次性向用户展示以下三个维度,统一收集参数后进入阶段 2。
节奏类型(三选一)
- A. 慢节奏(沉浸式长镜):固定长镜头占比 ≥70%,单镜 6–12 秒,适合情绪沉淀、环境留白、时代氛围铺陈。
- B. 中节奏(生活流):手持跟拍与固定长镜各约 50%,单镜 4–8 秒,模拟日常观察节奏。
- C. 快节奏(短切蒙太奇):单镜 2–4 秒,仅适用于预告片或情绪强烈的回忆/幻觉段落。⚠️ 选C时须弹出警告:"快节奏可能削弱纪实感,是否确认?",用户二次确认后方可生效。
记录参数: - A → pace_type=slow,avg_shot_duration=8s,固定长镜头比例 ≥70%,禁止快切/急推。
- B → pace_type=medium,avg_shot_duration=5s,固定与手持各半。
- C → pace_type=fast,avg_shot_duration=3s,快切比例 60%,需二次确认。
运镜倾向(三选一)
- A. 手持跟拍为主:肩扛感,轻微晃动,贴近人物,适合运动场景和人物跟拍。
- B. 固定长镜为主:三脚架静止或极缓慢摇移,强调环境与人物关系,适合空镜和静态场景。
- C. 混合模式(推荐):人物运动时手持,静止时固定,由 AI 自动判断。
记录参数:camera_style=handheld / static / hybrid。
总时长(可选,默认 30 秒)
请用户输入短片总时长(10–180 秒),若不输入则默认 30 秒。
确认并传递参数
向用户输出确认清单(节奏 / 运镜倾向 / 总时长 / 预估镜头数),用户回复"确认"后,将以下变量传递给 storyboard_designer:pace_type、camera_style、total_duration、avg_shot_duration。
预估镜头数仅供时长参考,不作为强制数量约束;storyboard_designer 根据人物事件自然划分实际镜头数。
阶段 2:分镜设计
调用 storyboard_designer 生成完整分镜脚本(key_elements + shots + audio_layers);storyboard_designer 必须严格遵循阶段 1.5 传入的 pace_type、camera_style、total_duration、avg_shot_duration 参数,镜头时长须足以呈现完整行动,镜头数量根据叙事事件自然划分。分镜完成后呈现给用户,等待确认或修改后进入下一阶段。
阶段 2.5:角色参考图生成
分镜确认后,统计跨两个以上镜头出现的主要角色:
- 仅为这类角色生成参考图;一次性人物、远景路人和背景群众不生成。
- 若用户已上传对应参考图,直接注册为 asset_id 并绑定,不重复生成。
- 多名主要角色可批量生成后一次性展示,统一请用户确认,不逐人单独暂停。
- 确认后,将参考图注册为 asset_id 并绑定至对应角色 key_element;后续涉及该角色的镜头视频生成时,以此图作为 reference_image 输入。
阶段 3:素材生成
- 逐镜生成视频片段;若用户已上传参考图像/视频,优先绑定复用,不重复生成。
- 生成环境音/背景音轨(少用画外配乐,重视场景内声音元素)。
- 全部片段生成完毕后,呈现给用户预览,等待确认后进入剪辑阶段。
阶段 4:剪辑与交付
调用 video_assembler 按分镜顺序拼接,叠加环境音轨,输出最终视频。提示用户导出。
依赖关系: 阶段0 → 阶段1 → 阶段1.5 → 阶段2 → 阶段2.5 → 阶段3 → 阶段4;阶段3中素材生成依赖阶段4分镜。
异常处理: 若用户未提供任何输入,回复:"请上传一段音频,或用一句话描述一个场景(例如:'一个年轻人在手机店外等候消息'),AI将自动生成叙事框架。"
2. 多模态分析
用户上传音频/图像的解析规则
音频输入分析
当用户上传音频(MP3等格式)时,重点提取:
- 节奏与情绪: 整体速度是否缓慢沉郁;低中频能量是否为主(对应贾樟柯风格的沉重质感)。
- 人声线索: 是否含有方言碎片、街头环境声、老旧录音质感。
- 基调推断: 据以上特征推荐最匹配的叙事基调(进城务工 / 下岗 / 小镇青年 / 故土没落),并简要说明推断依据。
- 不分析口型同步需求:本Skill全程不生成对口型内容,音频仅作叙事基调参考或环境声素材。
人物参考图分析(用于角色身份板生成)
当用户上传人物参考图时,重点提取并输出以下结构化字段,供身份板生成 prompt 和 key_element 描述使用:
- 面部特征: 脸型(圆/方/长)、眼型、眉形、肤色(暗沉/蜡黄/粗粝)、皱纹/雀斑等皮肤纹理细节,明确是否有素颜/磨皮情况。
- 发型: 发色、长短、分线位置、发质(油腻/干枯/凌乱)。
- 服装: 具体款式(工装/夹克/棉服)、颜色(描述为褪色/陈旧+色相)、可见磨损细节(破洞/污迹/褶皱)。
- 体型与姿态: 身高体型大致感知、站姿/坐姿/动作状态。
- 情绪基调: 神情(疲惫/沉默/茫然/沧桑),与贾樟柯美学的契合度评估。
- 纪实风格符合性检查: 若参考图中人物存在明显磨皮、精致妆容、高设计感服装,在输出描述中注明「需在生成阶段向贾樟柯纪实风格纠偏」。
输出格式为结构化文本,逐字段列出,不进行主观评价。
图像/视频输入分析
若用户上传参考图或视频作为视觉锚点:
- 提取主要色调(是否符合低饱和土灰调体系)、场景类型(城中村/工厂/小镇街道等)、人物特征(衣着、年龄感)。
- 输出结构化描述,供 storyboard_designer 和 media_generator 作为视觉一致性参考。
- 若色调偏鲜亮或场景偏精致,在描述中注明需在生成阶段向贾樟柯风格纠偏。
3. 故事板设计
本 Skill 的核心原则
本 Skill 的核心不是制造灰暗县城画面,而是通过一个普通人的具体行动,观察中国县城在现代化、迁移和消费文化影响下的新旧并存。画面可以粗粝、平淡、热闹、艳俗或安静;人物可以失落,也可以好笑、尴尬或荒诞;时代变化不由摄影机解释,而让它自然进入同一构图。
贾樟柯纪实美学分镜设计规范
设计 key_elements(视觉元素)
人物(element character):
人物视觉
人物根据职业、年龄、收入和生活选择设计,不统一塑造成疲惫中年人。
允许小镇青年、学生、服务员、司机、商户、工人、表演者、返乡者和退休老人。服装可以陈旧,也可以鲜艳、廉价、追求时髦或带有职业特征。
保留自然皮肤、普通体态和真实衣物褶皱,不使用美颜、时尚大片妆容或过度精致造型。人物状态通过正在进行的行动表现,不靠"疲惫眼神"作为统一风格标签。
- 若同一人物跨多镜头出现,需在 key_element 描述中锁定服装、发型、肤色等细节以保持跨镜一致性。
- 若已生成角色身份板:key_element 描述必须与身份板视觉内容严格一致,不得引入身份板中未体现的外貌或服装特征;直接引用身份板的资产 asset_id 作为该 key_element 的锚定参考图。
场景(element scene):
场景设计
根据人物正在进行的事情选择真实空间,不为了表现风格而自动添加废墟和破墙。
可用空间包括:
- 日常居住:老住宅、新小区、出租屋、宿舍、家庭餐桌;
- 公共生活:车站、公交、街市、小饭馆、理发店、台球厅、手机店;
- 娱乐消费:KTV、舞厅、婚宴厅、商场、主题公园、直播间;
- 工作空间:工厂、工地、店铺、办公室、运输车辆;
- 城乡变化:拆迁区、新楼盘、旧街改造、城乡接合部。
每个场景必须出现至少一项现实生活活动,以及一项时代信息。时代信息可以是广告、手机、交通工具、商品包装、装修风格、广播或公共标识。
允许环境杂乱、拥挤或空旷,但杂物必须来自真实使用,不使用"剥落墙皮、锈门、晾晒衣物"作为每个场景的固定装饰。
设计 shots(分镜)
镜头时长与运镜(优先遵循用户自定义参数):
若规划阶段传入了 pace_type、camera_style、avg_shot_duration,严格按以下映射执行,覆盖下方默认值:
pace_type每镜时长范围固定/手持比例其他约束slow6–12s固定长镜头 ≥70%禁止快切,禁止急推medium4–8s固定与手持各约50%允许轻微晃动fast2–4s快切比例 60%仍须保留纪实质感与环境音
camera_style 映射:handheld→ 运动镜头强制手持;static→ 优先固定机位,手持仅限极少数追逐/慌乱场景;hybrid→ AI 根据镜头内容自动判断(人物行走用手持,空镜/对话用固定)。
镜头时长须足以呈现完整人物行动;镜头数量根据叙事事件自然划分,不强制固定数量。三段式开端/发展/结尾可作为叙事参考,比例无需严格固定。
默认值(无自定义参数时): 每镜 6–12 秒;固定长镜头不低于 6 秒;手持跟拍 5–10 秒;禁止快切(单镜不得低于 4 秒)。
每个 shot 描述必须包含以下维度:
-
景别与构图:
优先使用全景、中远景和中景,让人物与现实空间同时可见。人物不必始终居中,可以位于画面边缘、门框内、街道深处或多人活动之间。
允许路人、车辆、店铺活动和背景事件进入画面。背景中的偶然行动属于现实内容,不应全部清除。
特写只在动作或物件确实改变人物处境时使用。不得因为物件陈旧就安排象征性特写。 -
运镜方式(必须二选一或混用):
- 固定长镜头: 机位完全静止或极缓慢水平摇,画面内物体/人物自然运动。
- 手持微晃: 跟随人物移动,轻微非规律晃动,禁止滑轨/稳定器平滑感、无人机航拍。
- 机位以平视为主;仰角/俯角仅在特定叙事需要时使用。
-
现场光线与色彩:
生成每个场景前先确定时间、天气和画面内真实存在的光源。- 白天:允许阴天、晴天、硬日光、室内窗光,不固定为灰蒙漫射光;
- 夜晚:使用路灯、商店灯、车灯、电视、KTV彩灯或手机屏幕等现场光;
- 混合光源:允许冷白灯、暖灯和霓虹灯同时出现,但必须能在画面中找到来源;
- 人物与环境共享现场光线,不单独给人物添加轮廓光或电影补光;
- 允许局部过亮、偏色和曝光不均,但主体行动仍须可读。
环境综合色以低至中等纯度为主,现实中的招牌、塑料用品、演出服和商品可以形成局部高纯度色。不得把所有鲜艳颜色自动降成灰色。禁止精致广告摄影式的统一电影调色;禁止无人机航拍感。
-
环境音设计(每镜标注): 从以下元素中选取与画面匹配的组合:街边叫卖、摩托引擎轰鸣、长途大巴发动机声、老式收音机杂音/广播、方言碎片人声(不对口型)、风声、碎石子脚步声、车票摩擦声、工厂机械远声、小孩嬉闹声。配乐极少,默认不加音乐。
空间设计原则:新旧杂糅,不协调共存
这是贾樟柯空间区别于纯怀旧美术布景的核心特征。
**每个主要场景必须同时包含至少两种不同年代或生活系统的痕迹,**例如:
- 旧住宅楼道与新楼盘广告;
- 老式家具与桌上的智能手机;
- 墙上旧标语与门口新商业广告;
- 工装与廉价时髦服装同时出现在同一空间;
- 传统集市摊位与旁边的连锁店招牌;
- 方言广播与某处传出的短视频外放声。
禁止将场景设计成纯粹怀旧、纯粹破败或统一复古的美术布景。 杂糅感本身是贾樟柯空间的真实质地,不需要人工清理掉其中一种年代痕迹来"统一风格"。
在 shot 描述和 element scene 描述中,须明确标注场景内共存的两种(或以上)年代/生活系统元素,不得只描述单一时代感。
双线叙事原则:个人小事与时代巨变同框
这是贾樟柯风格最核心的叙事辨识点。AI 原创或根据简短想法/故事梗概扩展的故事必须贯彻此原则;用户上传完整剧本时,只提取并强化原剧本已有内容,不得擅自增加拆迁、下岗、离乡、卖旧物或改变结局。
两条叙事线要求:
- 人物线: 主角有一个具体、日常且可见的任务——找人、等车、取钱、卖旧物、送东西、决定离开。任务必须是行动,不是情绪状态。
- 时代线: 空间中存在一项正在发生的社会变化——拆迁、新楼、迁移、工厂停产、商业进入、交通改变。时代线通过建筑、交通、广告、广播、工作状态和人物去留进入画面,摄影机不直接解释或强调它。
同框镜头要求: 全片至少安排一个镜头,让人物的小行动与时代变化同时存在于同一构图中。例如:人物等车时,旧车站外的招牌正被拆除;人物在屋内修风扇时,远处新楼的广告广播持续传入。
在 shot 描述中,需同时标注人物线动作和时代线背景元素,不得只描述人物或只描述环境。
镜头等待现实发生:摄影机不替观众下结论
这份 Skill 的独特性不在"慢",而在摄影机不抢在现实前面解释意义。以下观察镜头要求适用于 AI 原创及扩展故事;用户提供完整剧本时,在不改动剧情的前提下尽量安排,无法安排则保留剧本原有节奏。
关键事件处理原则:
- 关键事件优先使用固定全景或中远景完整呈现;人物从空间一端进入,完成行动,再停留或离开。
- 不得在动作尚未形成意义前频繁切特写;不添加解释性旁白;摄影机不推近强调。
观察镜头(每部短片强制要求至少一个):
全片至少安排一个 8–30 秒的观察镜头,同时满足以下四项条件:
- 主角正在完成具体行动;
- 背景中有路人、车辆、广播或公共活动;
- 画面中出现一项时代信息;
- 摄影机静止,不推近,不添加解释性旁白。
在 shot 描述中须明确标注"观察镜头",并同时列出以上四项内容,不得缺项。
去留关系:人物面对一个可见的选择
这是贾樟柯叙事的内在张力核心。AI 原创或扩展的故事必须包含此项;用户提供完整剧本时,若剧本中已有此张力则在分镜中强化,若原剧本没有则不得擅自添加。 每个故事的主角应面对一种具体的去留关系,包括但不限于:
- 离开县城还是留下;
- 返乡后是否再次出发;
- 旧工作消失后去哪里;
- 一段关系是否继续;
- 某件旧物是保留、卖掉还是交还。
结尾处理: 结尾不必解决问题,但必须让人物完成一个可见的行动选择——上车、留下、交出钥匙、删除号码、带走物品或独自返回。选择通过动作呈现,不通过对白或旁白解释。
在 shot 描述中,结尾段落须包含主角完成该选择的具体动作,不得以情绪凝视或环境空镜代替可见行动。
流行文化突然刺入现实
这是容易被漏掉的重要辨识点。每个短片必须选择一种具有年代感的公共流行文化声音或视觉材料,从场景内部自然出现,不作为配乐添加:
- KTV 歌曲、商店音响、婚宴音乐、车载广播;
- 手机铃声或短视频外放;
- 广告口号、广场舞音乐、电视节目声。
该元素必须来自场景内部,并与人物处境形成反差。 人物失落时,远处仍可播放热闹歌曲;街区拆迁时,售楼广告仍可宣传新生活。摄影机不强调反差,也不解释它,让两者同时存在于画面中。
在 shot 描述的环境音设计和 audio_layers 设计中,须为全片至少一处明确标注来自场景内部的流行文化声音元素及其与人物处境的反差关系。
允许俗气、幽默和尴尬
如果只有沉郁,就不像完整的贾樟柯。现实气氛不得全程沉重。
允许人物说冷笑话、穿廉价时髦服装、唱跑调的歌、摆不合时宜的姿势,或在严肃环境中发生尴尬的小事。幽默不使用喜剧音效或夸张表演,而来自人物认真对待一件略显荒谬的事情。
在 shot 描述中,若有幽默或尴尬时刻,以行动和细节描述体现,不添加"幽默感""轻松氛围"等情绪标注。
一次克制的超现实闯入(可选)
当故事适合时,全片最多允许一次短暂超现实事件。此项为可选,不强制每片使用,强制使用会变成套路。
可用形式包括:
- 远处建筑缓慢移动或升起;
- 天空掠过无法解释的飞行物;
- 废墟中出现不合现实比例的表演;
- 普通物件短暂呈现异常运动。
处理规则: 摄影机和人物保持现实反应,不使用特效高潮、神秘音乐或解释性对白。超现实事件发生后,故事继续日常行动,不对事件进行任何说明。
若分镜中安排此类事件,在对应 shot 描述中明确标注"可选超现实事件",并注明触发依据(故事主题是否适合)。
叙事结构模板(三段式意象流)
段落时长占比典型意象开端(环境建立)25%灰蒙天空、老旧街道、长途大巴、废弃厂区远景发展(人物状态)50%工厂车间、城中村楼道、小旅馆、下岗人群、铁轨边独行结尾(时代留白)25%枯河、荒楼、空站台、拆迁废墟、人物背影消失于环境
影像媒介质感
根据故事年代选择影像质感,同一短片只使用一种主要媒介质感,不得无视故事年代统一添加老式噪点或复古滤镜:
- 1990年代: 轻微胶片颗粒、综合色偏差和有限动态范围;
- 2000年代初: 可使用轻微DV噪点、偏色和数字高光;
- 当代县城: 使用清晰数字影像,保留现场混合色温,不添加复古滤镜。
设计 audio_layers(独立音轨)
- 环境音混合轨(必选): 跨全片,内容为多层市井环境音叠加(无配乐);标注具体音效组合。
- 配乐(可选,默认不加): 仅当用户明确要求时添加;若加,需极简、低沉、不盖过环境音。
- 无旁白(narration): 本Skill默认不生成旁白音轨;若用户明确要求旁白,方可添加,但需保持克制、稀少。
- 不设置任何 dialogue 对口型轨道:环境声中方言碎片属于环境音层,不绑定人物口型。
4. 媒体生成
生成策略
角色身份板生成
- 路径: TextToImage,模型 Nano Banana Pro (Gemini 3 Pro Image),分辨率 2K。
- 每名主要角色生成两张参考图:
- 全身参考图: 人物在低信息量的真实场景中(如街边、走廊、空地),全身可见,背景简洁但为真实环境,非摄影棚。
- 正面近景: 面部+上半身,平视机位,背景为虚化或简单的真实场景色块。
- 禁止在身份板中出现: 文字标签、黑色剪影、设计板排版、表情宫格、多人物拼贴、纯白摄影棚背景。
- 若用户提供参考图,使用 ImageToImage 路径(同模型/分辨率),以参考图为视觉输入,强化面部特征一致性。
- 身份板生成后,注册为 asset_id,绑定至对应角色 key_element;后续该角色所有镜头视频生成时,将此 asset_id 作为 reference_image 输入。
视频片段生成
- 首选路径: MultiModalToVideo,模型 Seedance 2.5,分辨率 480p,时长 4–30s(按分镜设计)。
- 备选路径(无参考图时): TextToVideo,模型 Seedance 2.5,分辨率 480p。
- 若 Seedance 2.5(分辨率 480p) 不可用,降级至 Seedance 2.5(分辨率降为 480p)。
- 禁止使用 ImageToVideoByAudio(对口型工具),本Skill全程不生成对口型内容。
参考图绑定规则
- 若存在需要跨镜头复用的人物或场景 key_element,在生成对应镜头视频前,先通过 TextToImage 或 ImageToImage 生成 element 参考图(模型:Nano Banana 2 (Gemini 3.1 Flash Image),分辨率 2K),并绑定至对应 key_element。
- 生成每个 shot 视频时,以该镜头涉及的 key_element 参考图作为视觉参考输入;跨镜连续性极强时(人物动作/场景直接衔接),可额外加入上一镜头视频作为 reference_video,其余情况默认不加视频参考。
- 用户已上传的图像/视频素材优先注册为 asset_id 并绑定到对应 Storyboard 槽位,不重复生成。
环境音生成
- 环境音轨通过视频生成 prompt 内嵌方式驱动(在 prompt 中明确描述环境音元素)。
- 如需独立环境音素材(如远处方言广播碎片),可调用 text_to_narration(模型 MiniMax Speech 2.8 HD)生成非对口型人声音效。
- 如用户未提供背景音乐且未明确要求,不生成任何配乐。
- 若用户明确要求背景音乐,使用 text_to_instrumental,模型 Mureka 8,风格描述为:极简、低沉、空旷、中国民谣或工业环境底纹,时长匹配视频。
质量与风格把控
- 若生成视频出现明显磨皮/高饱和/精致布景等与贾樟柯风格相悖的特征,自动重试一次并在 prompt 中强化纠偏指令;二次失败后告知用户并询问是否接受或跳过。
5. 提示词撰写
提示词写作规范——贾樟柯纪实美学
本Skill所有提示词以中文书写。
图像提示词(TextToImage / ImageToImage)
必含前缀风格锚点(写入每条提示词开头):
贾樟柯电影风格,中国县城/小镇/城乡边缘写实场景,保留现场物体固有色,不使用统一电影调色滤镜,边缘柔和无锐化,手持或固定机位纪实质感,非广告摄影风格
角色身份板(全身参考图 / 正面近景):
- 背景:低信息量的真实场景(街边、走廊、空地、简单室内),背景虚化或色块简洁,禁止纯白摄影棚背景;
- 服装与造型:按角色设定如实描述(陈旧工装、廉价时髦、职业服装均可),禁止"疲惫神情"作为固定标签;
- 皮肤:保留自然皮肤纹理,明确写出"无磨皮,无美颜,无精致妆容,skin texture preserved";
- 禁止在画面内出现:文字标签、黑色剪影、表情宫格、设计板排版、多人物拼贴。
人物 key_element 图像(跨镜通用参考):
- 锁定服装、发型、肤色等跨镜一致性细节;
- 明确写出:无磨皮,无美颜,无精致妆容,skin texture preserved(皮肤纹理保留)。
场景 key_element 图像:
- 根据实际空间类型描述环境细节(如老旧住宅楼道、热闹街市摊位、厂区入口、KTV走廊、出租屋室内等),不默认添加"剥落墙皮、锈迹铁门、残旧标语、晾晒衣物"作为固定装饰;
- 允许场景陈旧、拥挤、整洁或普通,杂物和细节来自该空间真实使用状态;
- 光影:根据场景时间与实际存在的光源确定(白天阴/晴/硬日光/室内窗光;夜晚用路灯/商店灯/车灯/霓虹灯等现场光),不固定为阴天漫射光;
- 允许招牌、广告、商品、服装等局部高纯度色;禁止使用统一电影调色滤镜、精致广告摄影布光;禁止无来源的背景光晕或补光。
视频提示词(MultiModalToVideo / TextToVideo,Seedance 2.5(分辨率 480p))
必含强制前缀(每条视频 prompt 开头):
贾樟柯纪实风格,16:9写实宽屏,中国县城/小镇/城乡边缘实景,保留现场物体固有色,根据时间/天气/现场光源确定综合色调,不使用统一电影调色滤镜,允许招牌/服装/商品等局部高纯度色,边缘柔和,禁止磨皮美颜,禁止精致布景,禁止统一压灰,禁止滑轨稳定器平滑感
运镜描述(从以下选其一或组合):
- 固定长镜头,机位静止,画面内自然运动
- 手持跟拍,轻微非规律晃动,无稳定器感
镜头内容描述顺序(Motion Stack):
- 景别+构图(人物位置偏画面边角,大面积环境留白)
- 人物动作/状态(缓慢、沉默、日常性,无戏剧化表演)
- 环境细节(老旧/破败/杂乱,具体物件)
- 光影色调(根据场景时间/天气/现场光源单独描述,不固定为阴天漫射光)
- 环境音描述(用Seedance 2.5音效标记 <环境音内容>)
参考图绑定: 用 <<<image_1>>> 等占位符标注对应 key_element 参考图。
影像媒介质感(根据故事年代写入 prompt,同一短片保持统一,不得混用):
- 1990年代:轻微胶片颗粒、综合色偏差、有限动态范围;
- 2000年代初:轻微DV噪点、轻微偏色、数字高光;
- 当代县城:清晰数字影像,保留现场混合色温,不添加复古滤镜,不添加颗粒噪点。
固定 Negatives(每条视频 prompt 末尾):
no music,no subtitles,no lip sync,no smooth gimbal,no drone shot,no beauty filter,no unified desaturation filter,no cinematic lighting rigs
禁止在视频 prompt 中出现的描述: 磨皮、美颜、精致、高饱和、鲜亮、滑轨、稳定器、航拍、对口型、字幕、旁白台词(旁白若有,走独立音轨,不写入视频 prompt)。
典型镜头完整提示词示例(可直接复用)
以下三套模板对应最常见镜头类型,生成时按实际场景替换【】内占位内容,其余风格锚点保持不变。
类型一:环境远景(固定长镜头)
适用场景:开端段落的环境建立、时代留白结尾、空间交代。
贾樟柯纪实风格,16:9写实宽屏,中国县城/小镇/城乡边缘实景,保留现场物体固有色,根据时间/天气/现场光源确定综合色调,不使用统一电影调色滤镜,允许招牌/服装/商品等局部高纯度色,边缘柔和,禁止磨皮美颜,禁止精致布景,禁止统一压灰,禁止滑轨稳定器平滑感。
固定长镜头,机位完全静止,画面内物体自然运动。远景构图,【废弃工厂烟囱群 / 城中村低矮楼房 / 空旷长途大巴站台】占画面三分之二。根据实际时间与天气确定综合色调:若为阴天,漫射光柔和,对比度低;若为晴天,硬日光侧射,建筑投影明显;若为傍晚,暖橙光从地平线一侧打入,保留现场色温。招牌、广告牌或车辆允许保留现实中的局部高纯度色,不做统一压灰处理。画面边角可见路人缓慢移动 / 枯草摇曳 / 远处车辆驶过,无人物特写,环境主导。<风声低鸣,远处汽笛断续,偶有摩托引擎轰鸣渐远>
no music,no subtitles,no lip sync,no smooth gimbal,no drone shot,no beauty filter,no saturated colors,no cinematic lighting rigs
类型二:人物跟拍(手持微晃)
适用场景:发展段落中人物行走、劳动、等待等日常状态记录。
贾樟柯纪实风格,16:9写实宽屏,中国县城/小镇/城乡边缘实景,保留现场物体固有色,根据时间/天气/现场光源确定综合色调,不使用统一电影调色滤镜,允许招牌/服装/商品等局部高纯度色,边缘柔和,禁止磨皮美颜,禁止精致布景,禁止统一压灰,禁止滑轨稳定器平滑感。
手持跟拍,轻微非规律晃动,无稳定器感。全景/中景,<<<image_1>>>【中年男性,洗褪色藏青工装,寸头,面容粗粝保留皱纹雀斑】偏画面左侧,沿【铁轨边碎石路 / 城中村狭窄楼道 / 废旧厂区走廊】缓慢行走。右侧大面积留白为周边环境。根据实际时间与天气确定光线:白天晴天则硬日光侧射,白天阴天则柔和漫射;若为夜晚,使用路灯、商店招牌灯或手机屏幕等现场光,不统一添加冷青灰底调。周边招牌、衣物、商品允许保留现实中的固有色,不做整体压灰。人物无表演性动作,自然行走状态。<碎石子脚步声,远处方言碎片人声,老式收音机广播若隐若现>
no music,no subtitles,no lip sync,no smooth gimbal,no drone shot,no beauty filter,no saturated colors,no cinematic lighting rigs
类型三:手部特写(固定平视或手持微晃)
适用场景:关键旧物道具强调——车票、烟盒、打火机、旧收音机等,承载时代符号意义。
贾樟柯纪实风格,16:9写实宽屏,中国县城/小镇/城乡边缘实景,保留现场物体固有色,根据时间/天气/现场光源确定综合色调,不使用统一电影调色滤镜,允许招牌/服装/商品等局部高纯度色,边缘柔和,禁止磨皮美颜,禁止精致布景,禁止统一压灰,禁止滑轨稳定器平滑感。
固定平视机位,近景特写。画面主体为<<<image_1>>>【中年男性粗糙手部,手背青筋可见,皮肤暗沉干裂】,手持【一张泛黄折叠旧车票 / 半截燃着的劣质香烟 / 打火机反复拨动打不着火】,动作细微、缓慢,无戏剧化表演。背景虚化为模糊的现场环境色块,颜色根据实际场景保留,不强制压为灰土黄或脏蓝灰。根据拍摄时间与实际光源确定光线:室内或傍晚可使用昏黄灯光或窗光侧射;户外白天可使用漫射或硬日光;不固定为阴天漫射。手部皮肤纹理清晰保留,皮肤质感粗粝,禁止任何光滑感与美颜处理。<车票纸张摩擦声 / 打火机金属咔哒声,偶有远处环境音底噪>
no music,no subtitles,no lip sync,no smooth gimbal,no drone shot,no beauty filter,no saturated colors,no cinematic lighting rigs
6. 视频合成
剪辑与输出规范
节奏与剪辑风格
- 按分镜顺序线性拼接,遵循三段式意象流结构(开端→发展→结尾)。
- 切换方式: 以硬切为主,偶用极缓渐隐(黑场,0.5–1秒);禁止花式转场(划像、缩放、光晕等)。
- 整体节奏: 缓慢、沉郁;不压缩镜头时长;保留固定长镜头的完整时长,让画面"呼吸"。
- 若单镜视频片段超出分镜设计时长,优先从末尾修剪,保留人物动作的完整性。
音频叠加规则
- 环境音轨作为主音轨,音量高于一切其他轨道。
- 若有背景音乐轨,音量压低至环境音的30%以下,且不覆盖关键环境音时刻(如风声、引擎声高峰段)。
- 凡环境音中出现方言碎片人声、场景内歌声或广播人声的时段,BGM 音量须进一步压低至环境音的 15% 以下;音量变化必须使用 0.5–1 秒渐变过渡(淡出/淡入),不得硬切,避免忽大忽小的泵浦感。
- 片头/片尾可设0.5–1秒音频渐入/渐出,无需画面淡入淡出(保持硬切视觉)。
- 不添加任何字幕、标题、片头动画。
导出参数
- 格式:MP4
- 分辨率:1080p,16:9
- 帧率:24fps
- 无字幕,无水印
- 默认版本:带环境音(无配乐);如用户要求,可导出纯画面(静音)版本。