yeha.ai
返回模板库

剧本杀故事视频

将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。

适用于篇幅很长、包含跨章节伏笔与反转的剧本杀剧本;先确认生成范围并审核重构概览剧本,再制作忠于主线的完整长视频或分章节视频。

流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。

完整创作流程

1. 流程规划

先确认范围,再重构剧本(不可调换的强制前置流程)

  1. 收到剧本杀剧本文档后,先以文本让用户在以下范围中明确选择;在用户确认前,不得分析后续制作方案、创建故事板或生成任何媒体:
    • 完整长视频: 用一个长视频讲清整个故事的起因、发展、关键反转与结局;允许压缩次要情节,但不得损害主线因果。
    • 按章节制作: 一章一支视频;优先保证本章的剧情完整、人物动机和细节,并保留与后续章节有关的伏笔、信息差与反转铺垫。
  2. 用户确认范围后,调用 resource_prepare_and_analyze 通读全文,而非只依据章节摘要或开头内容。根据所选范围,提炼并重构一份用于视频的概览剧本:梳理主线、角色关系、章节推进、关键因果、跨章节伏笔及反转回收;完全忽略每章后的隐藏任务,不将其写入概览剧本、故事板或视频。
  3. 以文本向用户展示概览剧本及重构说明,清楚写明:保留了哪些关键剧情和角色金句、合并或省略了哪些重复/次要内容、伏笔和反转将在何处建立与回收、最终视频要呈现的故事。必须取得用户的明确确认;如有修改,更新概览剧本并再次确认。
  4. 只有范围选择和概览剧本均已按上述顺序获得确认,才能继续后续流程。任何一项存在不确定、冲突或未确认时,停止后续生成流程并向用户澄清,绝不擅自进入故事板、提示词或媒体生成。

完整视频的阶段逻辑和依赖关系

  1. 将已确认的范围、概览剧本、画幅、总时长或单章时长、视觉风格、输出语言和模型偏好写入 Final_Video_Spec.mdtext_editor
  2. 依据已确认概览剧本创建故事板(关键元素、镜头列表、独立 audio_layer)→ storyboard_designer。先将完整故事或当前章节划分为可理解的关键剧情段;每个关键剧情段都必须具备清晰的起、承、转、合,或在章节结尾以合理的未解转折替代“合”,以维持连续的故事讲述节奏。
  3. 审核故事板的叙事颗粒度:每个 shot 只承接一个明确的信息、动作、情绪变化或因果结果;一个完整关键剧情段至少由 3 个、通常 4 个递进 shot 构成,例如建立情境 → 发展冲突或行动 → 发生转折或揭示 → 展现反应、结果或留下悬念。不得用一个 shot 讲完一个关键剧情段;若不符合,返回 storyboard_designer 拆分并重排后再提交用户确认。
  4. 在生成任一元素图像或最终镜头前,通过 media_generator 使用其 write_media_prompt 子工具,依据故事板与 Final_Video_Spec.md 逐条编写提示词。先以文本展示元素图像的提示词草案(资产类型、对应 element_id、完整提示词、推荐模型和分辨率),经用户确认后才生成元素;元素完成后,以同样方式展示镜头视频的提示词草案,经用户确认后才生成镜头。用户要求修改时,更新对应草案并重新确认。
  5. 设置 key_element:用户已提供且适配的资产,先通过 media_generator 注册并绑定到相应故事板锚点;其余元素在元素提示词草案确认后生成 → media_generator
  6. 按已确认的镜头顺序生成每个 final_shotmedia_generator。每个镜头只执行其单一叙事职责,并参考该镜头所需的元素图像;若镜头依赖角色音色,先确保相应 key_element_audio 已生成或注册、绑定并验证,再生成该镜头。
  7. 生成不作为镜头前置条件的 narrationmusic/bgm 等其余 audio_layer,并绑定到其计划位置 → media_generator
  8. 所有资源完成后,按故事板组装时间线并引导用户导出 → video_assembler

依赖关系: 概览剧本重构依赖范围确认;全局规范、故事板及其叙事颗粒度审核均依赖概览剧本确认;元素和镜头提示词草案依赖经审核的故事板;元素生成依赖其草案确认;镜头生成依赖元素完成,且仅在引用音色时依赖对应音频的绑定验证;其余音频生成依赖故事板;时间线组装依赖全部最终视觉与音频资源完成。

暂停与复核: 不要一次执行完整流程。必须在范围确认、概览剧本确认、规范确认、故事板及其剧情段拆分确认、每一批提示词草案确认、元素完成、镜头完成、音频完成后暂停,等待用户确认再继续。

已有媒体: 用户提供或项目中已有的媒体若可直接匹配故事板,应优先注册和绑定,避免重复生成;可直接绑定的资产不需要提示词草案。若生成要引用音频,遵循该音频的生成或注册、绑定与验证依赖,但不得让不相关的视觉生成无谓等待。

2. 多模态分析
  • 对剧本杀 PDF、文本或图片执行全文阅读和跨章节关联分析;提取角色关系、事件时间线、信息差、伏笔、反转、结局回收和可用于视频的关键场景。
  • 识别加粗、加醋、下划线、标注等排版强调,但仅将其视为候选重点;结合全文因果判断哪些剧情与角色 dialogue 必须保留。
  • 将每章末尾的隐藏任务识别为排除内容:不纳入剧情梗概、伏笔链、角色动机或视频建议。
  • 输出与确认范围相适配的结构化分析:完整长视频强调全局故事弧及关键剧情段的起承转合;按章节制作则说明本章剧情闭环、章节结尾悬念及必须保留的后续伏笔。
3. 故事板设计

概览剧本忠实度(最高优先级)

  • 只能以用户确认后的概览剧本为叙事蓝本;不得加入隐藏任务、擅自补写剧情,或为了镜头效果改变人物动机、信息揭示顺序、关键反转和结局因果。
  • 保留驱动主线的关键剧情、关键证据或道具、人物关系变化和反转回收。面对篇幅过长或重复的文本,合并重复说明、压缩不影响因果的过场;压缩后仍应让观众理解故事核心与人物选择的原因。
  • 识别角色金句:优先保留反复呼应、揭示动机、埋设伏笔、触发反转或定义角色关系的确切 dialogue。原文的加粗、加醋、下划线等仅为线索,不得因排版强调而保留不服务叙事的重复台词。
  • 完整长视频: 以清晰的全局故事弧组织 shot,在必要处用精炼 narration 跨越次要段落;明确建立并回收关键伏笔。
  • 按章节制作: 每章视频完整呈现该章的冲突、推进与阶段性结果;将未来章节的伏笔以本章合理可见的信息保留,不得提前泄露后续反转答案。

设计故事节奏与 shot

  • 将完整故事或当前章节拆为连续的关键剧情段。每一段按起、承、转、合组织:先建立人物、目标、场景或信息;再推进冲突或行动;随后引入转折、发现、选择或信息揭示;最后呈现结果、人物反应、因果落点或面向后续的悬念。章节结尾可用未解的转折替代阶段性收束,但必须让观众理解它从何而来。
  • 一个完整关键剧情段至少使用 3 个、通常使用 4 个循序渐进的 shot 表达。应将建立、推进、转折、反应或收束拆到不同镜头,利用镜头之间的递进积累张力;不得以单个 shot 概述、讲完或跳过整个关键剧情段。
  • 每个 shot 只承接一个内容单元:单一信息揭示、行动推进、情绪变化、因果结果或视觉反应。若一个描述同时包含多个关键事件、多个转折或完整的起承转合,应拆为连续 shot,并明确前后镜头的承接关系。
  • 每个 shot 必须包含:引用 element scene 的场景、角色或道具行动、对剧情的单一作用,以及景别、角度、构图、镜头运动等镜头语言。
  • 优先采用 10–15 秒、带内部剪辑的长 shot,减少无叙事价值的碎片化切换;每个 shot 不得超过 15 秒。内部剪辑只能服务该镜头的单一内容单元,按叙事顺序描述镜头和动作,不使用精确到秒的硬性时间切分。

设计 key_element

  • 包含必要的 element characterelement scene 和关键道具;为每个独立角色、场景或道具使用独立元素标识。
  • 角色描述锁定跨章节稳定的外貌、服装状态与辨识特征;若角色在不同章节有明确状态变化,逐一说明。需要保持角色音色时,将音色样本规划为该 element characterkey_element_audio,而非普通旁白。
  • 场景描述关键道具的位置、朝向和发生表演的区域。用户提供的参考资产必须与对应元素描述一致。

设计旁白模式与独立音频

  • 对每个存在 narrationshot,明确标注以下两种之一,作为提示词和时间线的共同依据:
    • 旁白主导: narration 承担该段全部口头叙事。shot 中不得写入角色 dialogue 或要求角色开口说话;画面以无声表演、动作、表情和视觉信息服务旁白,避免两套语言信息冲突。
    • 旁白+演绎: narration 与画面表演共同推进剧情。必须说明 final_shot 原声是否承载可保留的同期声音(如环境声、动作音效或经确认的角色 dialogue),以及 narration 与角色 dialogue 的错开关系;不得让两段可理解的口头台词在同一时段竞争。
  • 当关键金句出现时,安排可读的表演与反应镜头,保留其完整原句;若以 narration 承担压缩信息,避免与角色 dialogue 重复同一内容。
  • 对跨章节伏笔,明确其在本章或当前段落的可见载体(对话、道具、动作或镜头信息)及后续回收位置;不得在伏笔建立时泄露回收结论。
  • 仅将跨 shot 的旁白规划为 narration 类型 audio_layer,并在描述中给出 narration_speaker_profile、精炼且必要的脚本、语气与覆盖范围。为全片或章节规划 music/bgm;在剧情转折、真相揭示或章节收束处按需分段。角色 dialogue 写入对应 shot,由角色的 key_element_audio 保持音色一致,不把它误建为旁白。
4. 媒体生成

元素资产生成

  • 若用户已为元素提供可用资产,优先注册并绑定,不重复生成。否则,使用 TextToImage 生成角色、场景和道具;同一角色的外观变化使用 ImageToImage 并参考确认后的基础形象以保持一致性。
  • 元素图像默认使用 Nano Banana 2(Gemini 3.1 Flash Image)、2K 分辨率。角色参考图采用横向 16:9 构图,包含半身身份特写与全身正、侧、背视图,确保服装和辨识特征可供后续 shot 参考。

最终镜头视频

  • 使用 MultiModalToVideo,默认模型为 Seedance 2.0、720p。每个 final_shot 参考该 shot 所需的角色、场景和道具元素图像,并严格执行其单一叙事职责;连续 shot 通过共享元素、服装状态、道具状态和动作结果保持递进连贯。
  • 仅在角色 dialogue 需要跨镜头音色一致且已有对应 key_element_audio 时,将该音频与元素图像一同作为 reference_audio,并明确其对应角色;不得将 narration 误作角色音色参考。
  • 对标为旁白主导shot,不传入角色 dialogue 或为口头角色表演生成音频。对标为旁白+演绎shot,按故事板生成需要保留的同期声音;原声的保留与音量由时间线规则决定。

旁白与音乐

  • narration 按故事板规定的脚本、narration_speaker_profile 和覆盖范围,使用 MultiModalToAudioSeed Audio 1.0 生成。单个 narration audio_layer 最长 120 秒;更长旁白应在章节、场景转换或叙事转折处拆分为连续片段,以保持叙事节奏与后期同步。
  • 未使用图像、音频 reference 或 Seed Audio voice_id 时,音频提示可同时给出旁白文本、声线、语气、情绪与必要停顿;一旦使用图像或音频 reference,或使用 Seed Audio voice_id,提示文本仅保留需朗读的旁白内容。
  • music/bgm 按故事板的情绪、节奏与跨度生成。隐藏任务不得成为旁白、音乐或任何音频提示的内容。

Asset Binding Contract

  • 使用当前 manage_item_assets 契约和故事板中的实际目标标识;不在本 Skill 另设标识模板。
  • 目标故事板锚点存在后、任何生成引用资产前,先调用 query_assets_info。若绑定缺失,使用 manage_item_assets 且保留完整 asset_bindings 数组,然后再次查询并验证。
  • 依据资产实际用途及其计划故事板位置确定绑定类型和角色;计划位置优先于媒体名称,不得仅根据标签推断。一个资产服务多个用途时,保留完整数组中的全部有效绑定。
5. 提示词撰写

音频生成提示词(Seed Audio 1.0)

根据本次生成是否使用音色或媒体参考,选择对应的提示词格式。

1. 无参考的文生音频 — 优先推荐

优先在不使用 voice_id 的情况下生成音频。不要要求用户选择或提供 voice ID;进行纯文生音频生成时,不要调用 search_voice_id

仅当未提供 voice_id、参考音频或参考图像时使用此模式。

使用自然语言编写提示词:

  • 对于旁白或对话,需包含:
    • 说话人身份,使用相关的角色 element 或旁白标签;
    • 性别、年龄、角色及其他相关身份特征;
    • 声线质感、语气、情绪、口音、语速和吐字方式;
    • 停顿、呼吸、重音、犹豫和情绪变化等表演细节;
    • 会影响表达方式的场景或对话语境;
    • 需要说出的准确文本。

所有朗读文本必须忠实于已确认的剧本或故事板。清楚区分表演指令与实际需要说出的文本。

  • 对于音效,使用自然语言描述需要生成的声音。根据需要说明声音来源、动作、环境、强度、持续时间、距离、质感、时机及随时间发生的变化。除非所需声音本身包含人声,否则不要加入口头对话。

2. 使用音色或媒体参考生成

当已有有效的 Seed Audio voice_id、参考音频或参考图像,或用户明确要求使用这些参考时,使用此模式。

不要仅为了启用此模式而要求用户提供 voice ID。除非用户或当前项目已经指定参考,否则优先使用无参考的文生音频模式。

在此模式下,生成提示词只能包含需要合成的准确旁白或对话文本。

不要加入说话人、性别、年龄、身份、情绪、语气、口音、语速、声线质感、表演、场景语境、音效、音乐、环境音或风格描述。所提供的参考将负责提供音色或角色语境。

不要混用两种提示词格式。只要存在任意 voice_id、参考音频或参考图像,就必须启用仅保留朗读文本的规则。

示例:无参考的文生音频

主播1是一名成年男性播客主播,嗓音低沉、略带沙哑,吐字清晰,语速略微偏快。他先以平缓、自然的叙事语调说道:“我是觉得亏欠这种事情,也不是说一次两次可以补偿得了的,对吧?就是说是一个……是一个终生的事情。所以就是说。”说完后稍作停顿,略微加重语气,以肯定的口吻继续说道:“这一次去迪士尼,我主要当时想的就是还是这两个原因,就去了。”随后,他稍微提高语调,带着轻微惊讶和讲故事的口吻说道:“我跟你讲,去了之后其实我是有点、有点惊讶的。大家可以看那个视频,当时那个 vlog 里面,我真的挺惊讶,因为我们去的那天是特地挑了上海今年入冬以来最冷的一天。那天最低气温是零下三度。”

全局规则

  • 用户使用中文或中文界面时,提示词正文使用中文;dialoguenarration 的语言严格遵循 Final_Video_Spec.md 的输出语言。
  • 提示词只描述镜头可见或可听的内容,不写角色不可见的心理动机或画外事实。严格以已确认概览剧本和故事板为准,不得写入隐藏任务或泄露尚未回收的反转。

图像生成提示词

  • 以电影导演和调色师的可执行简报来写:用自然语言描述主体、行为和环境;用简短词组描述风格、色彩、光影与构图。不得描述不可见的心理、屏幕外元素或无法呈现的事实。
  • 在一段流畅提示词中结合专业艺术或电影风格锚点、景别与构图、主光和对比、克制的调色、材质与细节、氛围及微表情;除非用户明确要求,避免红蓝霓虹冲突,以单一主色调主导画面。画面内文字须引用准确的可渲染文本。
  • key_element 图像须锁定角色身份、跨镜头稳定的面容、妆发、服装与道具材质或状态,避免出现无关文字或会破坏后续参考的一次性细节。

视频生成提示词

  • 每条视频提示词只能执行该 shot 的单一叙事内容,不得把连续剧情段中的建立、推进、转折和收束压缩进一条提示词。与前后 shot 衔接时,写明需延续的角色状态、道具状态、空间关系或动作结果。
  • 对有角色 dialogueshot,显式写入原文台词,并使用 Seedance 的 {…} 对话格式;若台词不是项目输出语言,在花括号前标明语言,花括号内只放台词文字。若有需保持一致的角色音色参考,明确哪个角色使用哪个 reference_audio
  • 旁白主导shot,不得写角色 dialogue、开口说话或口型表演,也不得复述旁白文本。对旁白+演绎shot,只写经故事板确认、且与旁白错开的角色 dialogue 或同期声音。
  • 按“摄像机 → 主体 → 空间 → 音频”的顺序编写动态:先写镜头运动或内部切换,再写主体动作和表情,接着写空间与环境变化,最后写对话或音效。动作需要时明确身体部位、幅度、速度与主次顺序;不得用逐秒时间表,而应描述依次发生的内容。
  • 可用 (...) 标记音乐、<...> 标记音效、{...} 标记口头对话、【...】 标记画面标题。若故事板存在独立旁白音轨,不在视频提示词中写旁白脚本;通常要求无背景音乐,并始终要求无字幕,避免与后期音频和字幕冲突。
6. 视频合成
  • 按确认后的完整故事弧或章节顺序组装 final_shotnarrationmusic/bgm;不得插入或暗示隐藏任务内容。
  • 保持关键剧情段由连续的 3–4 个 shot 递进完成:建立、推进、转折、反应或收束之间使用清晰的视觉与声音承接,不以单一片段跳过完整关键事件。完整长视频在章节或重大转折处使用清晰节奏过渡,确保伏笔建立、反转揭示和结局回收易于理解;按章节视频在章末保留自然悬念或伏笔,但不得泄露后续答案。
  • 对每个有 narrationshot,严格执行故事板标注的音频模式:
    • 旁白主导:narration 为唯一口头叙事,并静音该 final_shot 的原声,避免与旁白冲突。必要的环境声或动作音效应另行规划为独立 audio_layer,并以不妨碍旁白清晰度的音量混合。
    • 旁白+演绎: 不得静音 final_shot 原声。保留故事板指定的同期环境声、动作音效与角色 dialogue,并通过剪辑、音量自动化或错开安排,使 narration 与原声中的可理解语言互不遮挡。
  • 让关键金句保留足够的镜头停留、对白清晰度和音乐留白;始终以 narrationdialogue 的可懂度优先于背景音乐音量。完成后引导用户导出。