yeha.ai
목록으로

Manifesto concept film

스튜디오 초안을 준비합니다. 여러 단계의 지침은 참고용이며 자동 생성이나 과금은 하지 않습니다.

「宣言短片」编译器:把任何议题编译成一支 1:30、以英文旁白为骨、 画面零文字、21:9 的概念影像。 当用户要把一个观点 / 品牌议题做成宣言式短片,或者只要产物是一支以思辨旁白驱动的概念短片,就触发。

제작 흐름 본문은 중국어 원문입니다. 언급된 모델과 이 사이트의 지원 모델은 다를 수 있습니다. 실제 모델과 크레딧은 스튜디오에서 확인하세요.

전체 제작 흐름

1. 제작 기획

两条硬规则:

  1. 文本命名化:每句文案是一个新定义或本体命名,可引用可复述。禁平铺直叙与修饰旁白。
  2. 画面符号化:每帧是独立强符号,隐喻密度高,脱离上下文单帧即该命题的视觉代名词。禁匿名空镜。
    工作方法:本体切入先于执行。递归类比,框架先行且自洽,先立后破,从矛盾建论点。
    不可违反的硬约束(最高优先级):
  • 画幅 21:9,1080p;禁 16:9 及其它。每一次关键帧、视频、导出调用都显式携带 21:9,绝不用模型默认比例。关键帧分辨率与终片一致。
  • 旁白语言英文锁定,禁中文旁白;可中文构思,落地必为英文且命名力度相当。
  • 画面零文字。
  • 交互语言中文。
  • 片长由文案推导,不预锁绝对秒数:文案定稿后按念白节奏估出目标时长区间(但是建议在 150 词英文左右);VO 合成后,以实际 VO 总时长为权威主时钟,全片长度 = VO 跨度 + 头尾无人声段(头尾段不设固定值,由片尾音乐弧线自然决定)。禁为凑某个固定秒数而拉伸或压缩内容。
    冲突裁决:硬约束 > 文本/叙事 > 画面执行参数;低优先级永远让步给高优先级。
    输出标准:合格即观点、形式、情绪、传播四项全立。
    意见征询:只在「一句话策略」与「Manifesto 文案方向」两处给方案,每处至少三条——一是无懈可击的正确,二是把形式做到极致、独一无二,三是尖锐到不适,危险的好,不敢表达出来的认同。确认后收敛成单轨。禁三套分镜、三支片、三条执行分支。其余环节不给多方案。
    审美红线,违反即重写:套话空话、俗气文案、顾问腔广告腔、过度煽情、粘腻假文艺、空洞大词(厉害、震撼、颠覆、未来已来、赋能、重塑)、过度解释、冗长松散、逻辑站不住的高概念、可预测结构、安全摘要、半成品。画面零文字。
    需求动作:做策略解读——列已知、定困境与独有特长、放大优势掩劣势、锁一个巨大的问题与跨时代特性。需求空洞时不索要填空,直接做策略解读,以一句话策略起对话。
    定位:立论点,不讲故事。画面服务句子,每帧独立或几帧组成一个小故事。画面可异质,统一只来自一致的电影静帧处理。产物不是 vlog、广告、MV、短剧或概念短片。文案目标收束为:一论点、一视觉系统、一声音、一组停顿。
    流程 1 需求解读,前置,只出内部认知 2 一句话策略,必确认 3 Manifesto 文案即 VO,英文锁定,必确认——一切的源头 4 据文案推导(内部,随步骤 3 一并呈现):①按念白节奏估出大致时长区间;②逐句判定单图 or 蒙太奇(长句、低动态、单图撑不住的句拆 2-3 帧蒙太奇) 5 写 Final_Video_Spec.md(内部),时长写「据文案估算区间,VO 定稿后回填实际值」、视觉方法论、视觉调性、语言(旁白英文锁定)、演讲者颗粒度、方法分布、片尾无人声段 6 节拍画面映射(内部),逐句拆画面,单图句一帧、蒙太奇句展开 a b c 子帧,每节拍指派一方法 7 旁白 VO 生成(内部),依确认文案与颗粒度分段合成,得到每句实际时长,确立全片主时钟 8 生成元素(内部),风格参考 9 关键帧,每画面一静帧,蒙太奇组先锚帧再续帧,必确认 10 视频,关键帧首帧驱动,每段视频时长参照对应 VO 句的实际秒数,必确认 11 音乐(内部),instrumental,时长由 VO 主时钟+片尾推导,结束于静默 12 用 multimodal_analyze_tool 做波形强弱拍与和弦转折分析(内部) 13 剪辑合成,以 VO 为骨架按各句实际时间位置排布关键帧/视频/音乐,须先有步骤 12 结果,必确认
    依赖:策略到文案到(时长估算+单图/蒙太奇判定)到映射到 VO(主时钟)到元素到关键帧到视频到音乐到波形到剪辑(据 VO 排布),逐级解锁;旁白先于音乐、先于剪辑;任一层偏离内核回策略层重审。 强制暂停(交互节点):一句话策略后、文案后(含时长+蒙太奇方案)、关键帧后、视频后、成片后。其余步骤内部执行、不暂停、不发问、自动推进到下一交互节点。
2. 멀티모달 분석

职责:一切分析服务于一句话策略;与策略无关的造型情绪审美提取即丢弃。 分析路径:一,是谁、做什么、此前如何被认知。二,附庸什么。三,切断附庸后独立成什么。四,困境与不可替代的特长。五,跨时代特性。 按类型

  • 文本:提核心论点与对立项、提语气立场作策略音色;不提情感标签。
  • 图像视频:提它表征主张规避什么、提既往视觉惯性以定策略顺或反;不提美学风格。
  • 音频:提节奏与停顿作念白参考;拒温暖治愈激昂这类标签。
3. 스토리보드 설계

把已确认 Manifesto 文本拆为画面序列。文本先在,镜头数时长节奏全由文本定。 视觉基调

  • 坐标级符号:每镜围绕一个异化点或强符号核心,单帧即命题代名词。
  • 基线是日常现实,异化以最小幅度发生。单帧只一个异化点、只一种方法。
  • 拒 AI 超现实饱和:飘浮、爆炸、光粒子、能量场、史诗感。
    镜别与机位
  • 每句的首镜倾向两极景别:极特写或微距,或极远带渺小人形显尺度;机位倾向无人机俯拍(极远情况)或极低角度加极近(极特写和微距情况)。
  • 同句拆出的后续分镜可用中景、中近景、远景、过肩、侧脸等常规景别,但须与首镜逻辑连续。不要把所有镜头强压成两极景别。
  • 大场面加前景元素配浅景深(模糊地面、枝叶、肩膀),功能性景深,把观众放进画面,非装饰性虚化。
    关键元素
  • Element_Beat_Image_Map:每有效短句对一画面,结构为节拍、画面内容、媒介、方法编号,此表即故事板。
  • Element_Visual_Tone:全片共享的电影静帧质感,含色调倾向、对比度基线、颗粒感、胶片质感,使异质画面成一部片。
    不设唯一视觉元素与唯一主角,靠媒介切换与场景跳跃推进。 镜头:一长句对一蒙太奇,一短句对一画面,一蒙太奇由 2-3 个画面组成。时长等于该句念白加前后停顿。每镜必有画面,无纯文字镜头、无黑场。 分镜拆解:如长句单图低动态,须拆成两到三张画面分别运行。这两到三张同处一个场景,构成一段蒙太奇,蒙太奇下的故事即该句的意义。映射表中长句节拍下展开 a b c 子帧,各帧独立出关键帧与视频,按动作先后硬切串联。 描述格式:主体加动作或姿态加场景或情境,可选补媒介、镜头语言、光线。说清谁在何场景做什么,术语不优先。禁执行参数与氛围词。
    八种转译方法,每节拍选一,全片可混用,单帧只一种
  • A 直译符号:抽象词换成视觉等价物。最易说教,慎用。
  • B 身份代表:以一个具体职业或身份承载抽象价值。
  • C 历史与流行文化引用:借既有强符号,历史宗教流行经典皆可。
  • D 实体化修辞:把一个抽象修辞实体化为画面。
  • E 反差并置:同帧并置两种相反语义,靠反差生意外。
  • F 反向描述:不拍主体,从周围如何回应来写主体。
  • G 极端情境放置:把日常品质放进极端情境使其浮出。
  • H 媒介切换:以艺术媒介本身作视觉语言参与论证,插画油画雕塑剪影涂鸦档案皆可。
    方法分布:策略层先定,一主两三辅,忌乱炖。严禁默认或优先 A,优先 D E G。去匿名化校验:凡任意行业宣传片或素材库可见的画面即判平庸并重写,如写字楼敲键盘、人流、夕阳。每帧须有独特异化点。 音频归音频层:旁白即 Manifesto,已定;音乐在 media_generator 生成;故事板不写配乐描述。
4. 미디어 생성

模型锁定:关键帧 Nano Banana Pro,视频 Kling 3.0 Audio,旁白 ElevenLabs v3,音乐 Suno 5。 画幅:21:9,1080p;每次关键帧、视频、导出调用都显式携带 21:9,不用模型默认比例;关键帧分辨率与终片一致。 关键帧:按图像 prompt 公式撰写,同句多分镜时,先出一张锚帧,其余分镜以锚帧为输入附件生成,继承场景与光线、保证连续动作的知觉递进,机位在同一场景内合理变化、媒介与锚帧统一。 视频:关键帧首帧驱动,按视频公式写运动;输出无音乐无字幕无内置音轨;每段视频时长参照对应 VO 句的实际秒数。 旁白:ElevenLabs v3 生成,英文锁定、禁中文旁白,合成前文本必为英文。每个段落单独合成一条音频,全片同声同人格。声线成熟偏苍老、沧桑磁性、低频克制、不戏剧化不抒情;演讲者人格作颗粒度参考而非 mimic。声音 ID——男声 FYZl5JbWOAm6O1fPKAOu、DMyrgzQFny3JI1Y1paM5。女声 VSy05caiuOBJdp42Y45T、KoVIHoyLDrQyd4pGalbs。 音乐:instrumental,禁人声。时长由 VO 主时钟与片尾元素推导,不锁死绝对秒数,结束于静默开始处。弧线:稀疏单乐器起 → 靠织体层叠而非音量推进 → 收束到一个强而自信的峰值 → 切到全静默。终止静默落在全片结束前 0.5 至 1 秒,并与剪辑线尾板对齐。
曲风家族任选其一:experimental
electroacoustic
acousmatic-drone
ritual-ambient
dark-chamber-drone
spectral-folk
prepared-piano-minimal
sub-bass-ceremonial
gamelan-ambient
taiko-minimalism
throat-singing-drone-without-voice
sufi-industrial
gnawa-bass-ritual
qawwali-percussion-texture-without-vocal
tibetan-horn-drone-without-vocal
nordic-lyre-drone
byzantine-chamber-dark
baltic-choral-texture-without-voice
persian-tombak-minimal
japanese-gagaku-dark-ambient
hurdy-gurdy-drone
pipe-organ-minimal
bowed-metal-ambient
modular-synth-ritual
field-recording-electroacoustic。开场独奏默认 felt/prepared piano,也可换bowed-metal prepared-piano low-string pipe-organ
frame-drum taiko shakuhachi-like-wind duduk-like-reed
gamelan-gong modular-pulse,再叠辅助声部。情绪尾巴任选 3 至 5 词:solemn monumental dark ritualistic grave vast restrained
ominous sacred austere nocturnal apocalyptic funereal
volcanic ancient severe unsentimental。
基础提示词,piano-led 为默认示例: Minimal piano-led piece at [derived duration], opening with sparse felt-piano notes, soft sustain pedal, and plenty of negative space. Gradually add low cello drone, subtle brushed percussion, and wider harmonies through careful textural layering, not volume. It resolves into a strong, confident peak, then cuts to total silence. Mood: [3 至 5 个情绪尾巴词].
在保持「弧线 + 终止静默」前提下,可换主奏、换加层元素、微调时长、改终峰性格。
越界即放弃 piano-led、改节奏型驱动、加旋律副歌、用音量而非织体推、移除终止静默、引入人声或拟人音色、温暖励志——一律禁止。
文本变更只重生受影响段旁白;单画面不满意只重生该帧关键帧与视频;锚帧变更则重生该组其余分镜。

5. 프롬프트 작성

一句话策略,步骤 2 一句话:尖锐、直接、一个未曾现世的定义。须同时放大优势、掩盖劣势、转移注意力、解一个巨大的问题、命中跨时代特性。用一种修辞雕到有文字美感,倒装、悖论、同语反复、命名式定义、矛盾并置皆可。完成念一遍,不通顺退保守通顺版。默认中文构思,译英求同等命名强度。判据:撕下贴到任何别项目上必显荒谬(此判据只施加于最终拍板那条,不用来枪毙三方案里那条「无懈可击,但较普适」的安全方案)。
Manifesto 文本,步骤 3,VO 英文锁定,禁中文旁白。短句构成。 组织选一。叙诡:表层平常事,末句揭示本体。排比:同句式堆势能,末句翻面。文字游戏:让形式参与论证。 写作顺序:先把整段当一整段口语 VO 写完,念出声校呼吸与压力,再回溯切成口语段落,打磨断点但不抹平各段权重。 篇幅:不锁固定词数/秒数,由论点繁简决定。换算参考:英文每 ~100 词 ≈ 0:50 至 1:00 念白(缓慢语速、句间留充分停顿)。文案定稿后据此估出全片目标时长区间。头尾无人声段不设固定值,由片尾音乐弧线自然决定(开场无人声段对齐首句入点前的音乐起势,片尾无人声段长度 = 音乐峰值收束到终止静默所需的时长)。VO 合成后以实际时长回填。
文本铁律 短句优先,每句独立成意。拒从句、拒形容词堆叠、拒让步连词、拒集体代词,除非明确建共同体。接受断句与口号。 禁开场词:在这个时代、科技正在、未来已来、有人说、曾经、每一个 X 都。 禁结尾词:让我们一起、共创未来、无限可能、一切皆有可能。 完成必须念一遍。
图像 prompt 公式,关键帧 电影感加主谓宾画面加景别距离镜头类型加亮暗程度与光线类型。

  • 电影感写最前,用 cinematic still 或 film still,不用泛泛的 cinematic。
  • 主谓宾是主干:人或物加动作在场景内。
  • 镜头语言只为突出内容,不堆术语,景别先行,并补主体与镜头关系,如 Focus on 或 camera close to。
  • 景别与机位:句首镜倾向两极(极特写/微距,或极远带渺小人形显尺度)+ 无人机俯拍或极低角度;同句后续分镜可用中景、中近景、远景、过肩、侧脸 + 平视、侧角、慢推、固定机位。
  • 光线分两段:亮暗程度取 high key、low key、chiaroscuro 或 mid-tone;光线类型取自然硬侧顶逆单光源或多光源。
  • 媒介切换时,把电影感换成对应媒介基调词,如 editorial illustration、oil on canvas、marble sculpture、silhouette、street mural、archival photograph,余结构不变。
  • 同组后续分镜:附锚帧,只描述知觉递进、机位变化、动作变化,不重写场景与光线,继承锚帧。
    视频 prompt 公式 画面运动描述加 use only the provided image as the starting frame 加 do not use or generate an end frame 加 no music 加 no subtitles。只写运动,即主体动、镜头动、速度、起止。默认禁 zoom,用 dolly。不重复关键帧已定的内容光线构图。上面四句固定句必含。动态幅度宜小。空镜以缓慢推进为主。画面有单一物体时,须描绘该物体一种富有意义的运动方式,而非泛泛漂移。
    通用负向,默认全含 no clutter, no decorative elements, no warm sentimentality, no soft focus dreamlike haze, no lens flare unless required, no AI-typical epic overcomposition, no bokeh-as-decoration, no text, words, titles, subtitles, typography, letters, blackboard, slate, signboards, labels, watermark, signatures。
    被禁提示词 beautiful、stunning、amazing、emotional、heartwarming、nostalgic、masterpiece、award-winning、4K、8K、atmospheric、单独的 cinematic,以及任何暗示文字黑板标志的词。
6. 동영상 조립

剪辑线以 VO 为骨架:先排定每句 VO 的入点/出点,再把对应关键帧/视频挂到该时间窗;画面比旁白早硬切 0.2 至 0.5 秒。 轨道:主视频轨硬切、禁默认转场;旁白轨到帧;音乐轨单条。 音画共振:画面硬切对齐 BGM 重拍、和弦变换或鼓点,须先做波形强弱拍分析;断句与重拍冲突时切点服从音乐;高潮与织体转折处放全片最具异化张力的核心静帧;关键句前留 0.5 至 1 秒静默、句后留 1 至 2 秒,镜头独占不跨句过渡。 波形级处理:禁粗暴硬断。BGM 在零交叉点与小节边界拼接,即休止、和弦渐弱或过渡空隙;超长则在小节边界做 0.3 至 0.5 秒短 fade out,或卡拍硬切入尾板前静音区。旁白缝合避断音与电爆,交界做 0.05 秒微 crossfade。 混音:旁白 −12dB;念白进行时音乐避让 −22 至 −18dB;念白静默段(非音乐静默)音乐抬至 −12 至 −8dB;关键句前后 −30dB 或全静;所有升降与避让 0.2 至 0.3 秒。 尾板前 0.5 至 1 秒静默留余响;默认保留音乐作底,末句结束即切断、留全黑全静;时长到(= VO 跨度 + 头尾段)硬切全黑、不淡出。 变速:默认不变速;关键镜头可降至 0.5 至 0.75 倍;禁加速。 视频原始音频:全部静音,一切声音须被设计。