剧本杀故事视频
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
适用于篇幅很长、包含跨章节伏笔与反转的剧本杀剧本;先确认生成范围并审核重构概览剧本,再制作忠于主线的完整长视频或分章节视频。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
先确认范围,再重构剧本(不可调换的强制前置流程)
- 收到剧本杀剧本文档后,先以文本让用户在以下范围中明确选择;在用户确认前,不得分析后续制作方案、创建故事板或生成任何媒体:
- 完整长视频: 用一个长视频讲清整个故事的起因、发展、关键反转与结局;允许压缩次要情节,但不得损害主线因果。
- 按章节制作: 一章一支视频;优先保证本章的剧情完整、人物动机和细节,并保留与后续章节有关的伏笔、信息差与反转铺垫。
- 用户确认范围后,调用 resource_prepare_and_analyze 通读全文,而非只依据章节摘要或开头内容。根据所选范围,提炼并重构一份用于视频的概览剧本:梳理主线、角色关系、章节推进、关键因果、跨章节伏笔及反转回收;完全忽略每章后的隐藏任务,不将其写入概览剧本、故事板或视频。
- 以文本向用户展示概览剧本及重构说明,清楚写明:保留了哪些关键剧情和角色金句、合并或省略了哪些重复/次要内容、伏笔和反转将在何处建立与回收、最终视频要呈现的故事。必须取得用户的明确确认;如有修改,更新概览剧本并再次确认。
- 只有范围选择和概览剧本均已按上述顺序获得确认,才能继续后续流程。任何一项存在不确定、冲突或未确认时,停止后续生成流程并向用户澄清,绝不擅自进入故事板、提示词或媒体生成。
完整视频的阶段逻辑和依赖关系
- 将已确认的范围、概览剧本、画幅、总时长或单章时长、视觉风格、输出语言和模型偏好写入
Final_Video_Spec.md→ text_editor。 - 依据已确认概览剧本创建故事板(关键元素、镜头列表、独立
audio_layer)→ storyboard_designer。先将完整故事或当前章节划分为可理解的关键剧情段;每个关键剧情段都必须具备清晰的起、承、转、合,或在章节结尾以合理的未解转折替代“合”,以维持连续的故事讲述节奏。 - 审核故事板的叙事颗粒度:每个
shot只承接一个明确的信息、动作、情绪变化或因果结果;一个完整关键剧情段至少由 3 个、通常 4 个递进shot构成,例如建立情境 → 发展冲突或行动 → 发生转折或揭示 → 展现反应、结果或留下悬念。不得用一个shot讲完一个关键剧情段;若不符合,返回 storyboard_designer 拆分并重排后再提交用户确认。 - 在生成任一元素图像或最终镜头前,通过 media_generator 使用其 write_media_prompt 子工具,依据故事板与
Final_Video_Spec.md逐条编写提示词。先以文本展示元素图像的提示词草案(资产类型、对应element_id、完整提示词、推荐模型和分辨率),经用户确认后才生成元素;元素完成后,以同样方式展示镜头视频的提示词草案,经用户确认后才生成镜头。用户要求修改时,更新对应草案并重新确认。 - 设置
key_element:用户已提供且适配的资产,先通过 media_generator 注册并绑定到相应故事板锚点;其余元素在元素提示词草案确认后生成 → media_generator。 - 按已确认的镜头顺序生成每个
final_shot→ media_generator。每个镜头只执行其单一叙事职责,并参考该镜头所需的元素图像;若镜头依赖角色音色,先确保相应key_element_audio已生成或注册、绑定并验证,再生成该镜头。 - 生成不作为镜头前置条件的
narration、music/bgm等其余audio_layer,并绑定到其计划位置 → media_generator。 - 所有资源完成后,按故事板组装时间线并引导用户导出 → video_assembler。
依赖关系: 概览剧本重构依赖范围确认;全局规范、故事板及其叙事颗粒度审核均依赖概览剧本确认;元素和镜头提示词草案依赖经审核的故事板;元素生成依赖其草案确认;镜头生成依赖元素完成,且仅在引用音色时依赖对应音频的绑定验证;其余音频生成依赖故事板;时间线组装依赖全部最终视觉与音频资源完成。
暂停与复核: 不要一次执行完整流程。必须在范围确认、概览剧本确认、规范确认、故事板及其剧情段拆分确认、每一批提示词草案确认、元素完成、镜头完成、音频完成后暂停,等待用户确认再继续。
已有媒体: 用户提供或项目中已有的媒体若可直接匹配故事板,应优先注册和绑定,避免重复生成;可直接绑定的资产不需要提示词草案。若生成要引用音频,遵循该音频的生成或注册、绑定与验证依赖,但不得让不相关的视觉生成无谓等待。
2. 多模态分析
- 对剧本杀 PDF、文本或图片执行全文阅读和跨章节关联分析;提取角色关系、事件时间线、信息差、伏笔、反转、结局回收和可用于视频的关键场景。
- 识别加粗、加醋、下划线、标注等排版强调,但仅将其视为候选重点;结合全文因果判断哪些剧情与角色
dialogue必须保留。 - 将每章末尾的隐藏任务识别为排除内容:不纳入剧情梗概、伏笔链、角色动机或视频建议。
- 输出与确认范围相适配的结构化分析:完整长视频强调全局故事弧及关键剧情段的起承转合;按章节制作则说明本章剧情闭环、章节结尾悬念及必须保留的后续伏笔。
3. 故事板设计
概览剧本忠实度(最高优先级)
- 只能以用户确认后的概览剧本为叙事蓝本;不得加入隐藏任务、擅自补写剧情,或为了镜头效果改变人物动机、信息揭示顺序、关键反转和结局因果。
- 保留驱动主线的关键剧情、关键证据或道具、人物关系变化和反转回收。面对篇幅过长或重复的文本,合并重复说明、压缩不影响因果的过场;压缩后仍应让观众理解故事核心与人物选择的原因。
- 识别角色金句:优先保留反复呼应、揭示动机、埋设伏笔、触发反转或定义角色关系的确切
dialogue。原文的加粗、加醋、下划线等仅为线索,不得因排版强调而保留不服务叙事的重复台词。 - 完整长视频: 以清晰的全局故事弧组织
shot,在必要处用精炼narration跨越次要段落;明确建立并回收关键伏笔。 - 按章节制作: 每章视频完整呈现该章的冲突、推进与阶段性结果;将未来章节的伏笔以本章合理可见的信息保留,不得提前泄露后续反转答案。
设计故事节奏与 shot
- 将完整故事或当前章节拆为连续的关键剧情段。每一段按起、承、转、合组织:先建立人物、目标、场景或信息;再推进冲突或行动;随后引入转折、发现、选择或信息揭示;最后呈现结果、人物反应、因果落点或面向后续的悬念。章节结尾可用未解的转折替代阶段性收束,但必须让观众理解它从何而来。
- 一个完整关键剧情段至少使用 3 个、通常使用 4 个循序渐进的
shot表达。应将建立、推进、转折、反应或收束拆到不同镜头,利用镜头之间的递进积累张力;不得以单个shot概述、讲完或跳过整个关键剧情段。 - 每个
shot只承接一个内容单元:单一信息揭示、行动推进、情绪变化、因果结果或视觉反应。若一个描述同时包含多个关键事件、多个转折或完整的起承转合,应拆为连续shot,并明确前后镜头的承接关系。 - 每个
shot必须包含:引用element scene的场景、角色或道具行动、对剧情的单一作用,以及景别、角度、构图、镜头运动等镜头语言。 - 优先采用 10–15 秒、带内部剪辑的长
shot,减少无叙事价值的碎片化切换;每个shot不得超过 15 秒。内部剪辑只能服务该镜头的单一内容单元,按叙事顺序描述镜头和动作,不使用精确到秒的硬性时间切分。
设计 key_element
- 包含必要的
element character、element scene和关键道具;为每个独立角色、场景或道具使用独立元素标识。 - 角色描述锁定跨章节稳定的外貌、服装状态与辨识特征;若角色在不同章节有明确状态变化,逐一说明。需要保持角色音色时,将音色样本规划为该
element character的key_element_audio,而非普通旁白。 - 场景描述关键道具的位置、朝向和发生表演的区域。用户提供的参考资产必须与对应元素描述一致。
设计旁白模式与独立音频
- 对每个存在
narration的shot,明确标注以下两种之一,作为提示词和时间线的共同依据:- 旁白主导:
narration承担该段全部口头叙事。shot中不得写入角色dialogue或要求角色开口说话;画面以无声表演、动作、表情和视觉信息服务旁白,避免两套语言信息冲突。 - 旁白+演绎:
narration与画面表演共同推进剧情。必须说明final_shot原声是否承载可保留的同期声音(如环境声、动作音效或经确认的角色dialogue),以及narration与角色dialogue的错开关系;不得让两段可理解的口头台词在同一时段竞争。
- 旁白主导:
- 当关键金句出现时,安排可读的表演与反应镜头,保留其完整原句;若以
narration承担压缩信息,避免与角色dialogue重复同一内容。 - 对跨章节伏笔,明确其在本章或当前段落的可见载体(对话、道具、动作或镜头信息)及后续回收位置;不得在伏笔建立时泄露回收结论。
- 仅将跨
shot的旁白规划为narration类型audio_layer,并在描述中给出narration_speaker_profile、精炼且必要的脚本、语气与覆盖范围。为全片或章节规划music/bgm;在剧情转折、真相揭示或章节收束处按需分段。角色dialogue写入对应shot,由角色的key_element_audio保持音色一致,不把它误建为旁白。
4. 媒体生成
元素资产生成
- 若用户已为元素提供可用资产,优先注册并绑定,不重复生成。否则,使用 TextToImage 生成角色、场景和道具;同一角色的外观变化使用 ImageToImage 并参考确认后的基础形象以保持一致性。
- 元素图像默认使用 Nano Banana 2(Gemini 3.1 Flash Image)、2K 分辨率。角色参考图采用横向 16:9 构图,包含半身身份特写与全身正、侧、背视图,确保服装和辨识特征可供后续
shot参考。
最终镜头视频
- 使用 MultiModalToVideo,默认模型为 Seedance 2.0、720p。每个
final_shot参考该shot所需的角色、场景和道具元素图像,并严格执行其单一叙事职责;连续shot通过共享元素、服装状态、道具状态和动作结果保持递进连贯。 - 仅在角色
dialogue需要跨镜头音色一致且已有对应key_element_audio时,将该音频与元素图像一同作为reference_audio,并明确其对应角色;不得将narration误作角色音色参考。 - 对标为旁白主导的
shot,不传入角色dialogue或为口头角色表演生成音频。对标为旁白+演绎的shot,按故事板生成需要保留的同期声音;原声的保留与音量由时间线规则决定。
旁白与音乐
narration按故事板规定的脚本、narration_speaker_profile和覆盖范围,使用 MultiModalToAudio 的 Seed Audio 1.0 生成。单个narrationaudio_layer最长 120 秒;更长旁白应在章节、场景转换或叙事转折处拆分为连续片段,以保持叙事节奏与后期同步。- 未使用图像、音频
reference或 Seed Audiovoice_id时,音频提示可同时给出旁白文本、声线、语气、情绪与必要停顿;一旦使用图像或音频reference,或使用 Seed Audiovoice_id,提示文本仅保留需朗读的旁白内容。 music/bgm按故事板的情绪、节奏与跨度生成。隐藏任务不得成为旁白、音乐或任何音频提示的内容。
Asset Binding Contract
- 使用当前
manage_item_assets契约和故事板中的实际目标标识;不在本 Skill 另设标识模板。 - 目标故事板锚点存在后、任何生成引用资产前,先调用
query_assets_info。若绑定缺失,使用manage_item_assets且保留完整asset_bindings数组,然后再次查询并验证。 - 依据资产实际用途及其计划故事板位置确定绑定类型和角色;计划位置优先于媒体名称,不得仅根据标签推断。一个资产服务多个用途时,保留完整数组中的全部有效绑定。
5. 提示词撰写
音频生成提示词(Seed Audio 1.0)
根据本次生成是否使用音色或媒体参考,选择对应的提示词格式。
1. 无参考的文生音频 — 优先推荐
优先在不使用 voice_id 的情况下生成音频。不要要求用户选择或提供 voice ID;进行纯文生音频生成时,不要调用 search_voice_id。
仅当未提供 voice_id、参考音频或参考图像时使用此模式。
使用自然语言编写提示词:
- 对于旁白或对话,需包含:
- 说话人身份,使用相关的角色 element 或旁白标签;
- 性别、年龄、角色及其他相关身份特征;
- 声线质感、语气、情绪、口音、语速和吐字方式;
- 停顿、呼吸、重音、犹豫和情绪变化等表演细节;
- 会影响表达方式的场景或对话语境;
- 需要说出的准确文本。
所有朗读文本必须忠实于已确认的剧本或故事板。清楚区分表演指令与实际需要说出的文本。
- 对于音效,使用自然语言描述需要生成的声音。根据需要说明声音来源、动作、环境、强度、持续时间、距离、质感、时机及随时间发生的变化。除非所需声音本身包含人声,否则不要加入口头对话。
2. 使用音色或媒体参考生成
当已有有效的 Seed Audio voice_id、参考音频或参考图像,或用户明确要求使用这些参考时,使用此模式。
不要仅为了启用此模式而要求用户提供 voice ID。除非用户或当前项目已经指定参考,否则优先使用无参考的文生音频模式。
在此模式下,生成提示词只能包含需要合成的准确旁白或对话文本。
不要加入说话人、性别、年龄、身份、情绪、语气、口音、语速、声线质感、表演、场景语境、音效、音乐、环境音或风格描述。所提供的参考将负责提供音色或角色语境。
不要混用两种提示词格式。只要存在任意 voice_id、参考音频或参考图像,就必须启用仅保留朗读文本的规则。
示例:无参考的文生音频
主播1是一名成年男性播客主播,嗓音低沉、略带沙哑,吐字清晰,语速略微偏快。他先以平缓、自然的叙事语调说道:“我是觉得亏欠这种事情,也不是说一次两次可以补偿得了的,对吧?就是说是一个……是一个终生的事情。所以就是说。”说完后稍作停顿,略微加重语气,以肯定的口吻继续说道:“这一次去迪士尼,我主要当时想的就是还是这两个原因,就去了。”随后,他稍微提高语调,带着轻微惊讶和讲故事的口吻说道:“我跟你讲,去了之后其实我是有点、有点惊讶的。大家可以看那个视频,当时那个 vlog 里面,我真的挺惊讶,因为我们去的那天是特地挑了上海今年入冬以来最冷的一天。那天最低气温是零下三度。”
全局规则
- 用户使用中文或中文界面时,提示词正文使用中文;
dialogue与narration的语言严格遵循Final_Video_Spec.md的输出语言。 - 提示词只描述镜头可见或可听的内容,不写角色不可见的心理动机或画外事实。严格以已确认概览剧本和故事板为准,不得写入隐藏任务或泄露尚未回收的反转。
图像生成提示词
- 以电影导演和调色师的可执行简报来写:用自然语言描述主体、行为和环境;用简短词组描述风格、色彩、光影与构图。不得描述不可见的心理、屏幕外元素或无法呈现的事实。
- 在一段流畅提示词中结合专业艺术或电影风格锚点、景别与构图、主光和对比、克制的调色、材质与细节、氛围及微表情;除非用户明确要求,避免红蓝霓虹冲突,以单一主色调主导画面。画面内文字须引用准确的可渲染文本。
key_element图像须锁定角色身份、跨镜头稳定的面容、妆发、服装与道具材质或状态,避免出现无关文字或会破坏后续参考的一次性细节。
视频生成提示词
- 每条视频提示词只能执行该
shot的单一叙事内容,不得把连续剧情段中的建立、推进、转折和收束压缩进一条提示词。与前后shot衔接时,写明需延续的角色状态、道具状态、空间关系或动作结果。 - 对有角色
dialogue的shot,显式写入原文台词,并使用 Seedance 的{…}对话格式;若台词不是项目输出语言,在花括号前标明语言,花括号内只放台词文字。若有需保持一致的角色音色参考,明确哪个角色使用哪个reference_audio。 - 对旁白主导的
shot,不得写角色dialogue、开口说话或口型表演,也不得复述旁白文本。对旁白+演绎的shot,只写经故事板确认、且与旁白错开的角色dialogue或同期声音。 - 按“摄像机 → 主体 → 空间 → 音频”的顺序编写动态:先写镜头运动或内部切换,再写主体动作和表情,接着写空间与环境变化,最后写对话或音效。动作需要时明确身体部位、幅度、速度与主次顺序;不得用逐秒时间表,而应描述依次发生的内容。
- 可用
(...)标记音乐、<...>标记音效、{...}标记口头对话、【...】标记画面标题。若故事板存在独立旁白音轨,不在视频提示词中写旁白脚本;通常要求无背景音乐,并始终要求无字幕,避免与后期音频和字幕冲突。
6. 视频合成
- 按确认后的完整故事弧或章节顺序组装
final_shot、narration和music/bgm;不得插入或暗示隐藏任务内容。 - 保持关键剧情段由连续的 3–4 个
shot递进完成:建立、推进、转折、反应或收束之间使用清晰的视觉与声音承接,不以单一片段跳过完整关键事件。完整长视频在章节或重大转折处使用清晰节奏过渡,确保伏笔建立、反转揭示和结局回收易于理解;按章节视频在章末保留自然悬念或伏笔,但不得泄露后续答案。 - 对每个有
narration的shot,严格执行故事板标注的音频模式:- 旁白主导: 以
narration为唯一口头叙事,并静音该final_shot的原声,避免与旁白冲突。必要的环境声或动作音效应另行规划为独立audio_layer,并以不妨碍旁白清晰度的音量混合。 - 旁白+演绎: 不得静音
final_shot原声。保留故事板指定的同期环境声、动作音效与角色dialogue,并通过剪辑、音量自动化或错开安排,使narration与原声中的可理解语言互不遮挡。
- 旁白主导: 以
- 让关键金句保留足够的镜头停留、对白清晰度和音乐留白;始终以
narration与dialogue的可懂度优先于背景音乐音量。完成后引导用户导出。