INS人物锚点推拉转场
将创作草稿带入工作台;多阶段流程供参考,不会自动执行或扣费。
当用户上传人物图片,并提出INS街拍、人物推拉转场、城市穿搭、多场景切换、快速变焦、人物锚点转场或Fashion Reel短片需求时,调用本Skill。
流程正文保留原始中文。模板提及的模型不等同于本站已接入模型;实际可用模型与积分以工作台显示为准。
完整创作流程
1. 流程规划
收到用户上传的人物图片后,按照以下顺序完成任务:
第一步:确认输入素材
识别用户上传的主人物图片,将其作为唯一的人物身份和穿搭参考。除非图片严重模糊、人物完全被遮挡或无法辨认,否则不要要求用户补充更多人物图片。
第二步:分析并建立人物锚点
提取人物脸型、五官、发型、发色、服装结构、服装颜色、鞋子、包袋、眼镜、首饰、身体比例和整体气质。
将人物设定为整条视频中唯一的视觉锚点。
第三步:补全角色参考
如果用户图片不是完整全身照,先进行自然扩图,补全合理的身体、腿部和鞋子。
根据原图建立同一人物的正面全身、正面近景、轻微俯视、轻微仰视和侧前方视角参考。
补全内容必须延续原图服装和人物特征,不重新设计服装。
第四步:生成故事板
默认设计6个镜头,每个镜头约1—1.5秒。
镜头之间通过人物脸部、身体中心、眼镜、包袋或相似姿态完成视觉匹配。
故事板重点描述景别、机位、镜头运动、人物在画面中的位置和转场衔接点,不设计复杂剧情。
第五步:生成关键帧
先为每一个镜头生成稳定的竖屏关键帧。
所有关键帧必须使用同一个人物参考和同一套穿搭,人物在每个镜头中保持可识别。
第六步:生成动态镜头
根据故事板分别生成快速推近、快速拉远、俯拍下降、仰拍上升、轻微环绕和广角移动镜头。
每个镜头只安排一个主要镜头运动,避免一个镜头内同时出现过多复杂动作。
第七步:检查连续性
检查人物脸部、服装、包袋、眼镜、手部、身体比例和背景空间。
发现局部镜头人物变化时,只重新生成失败镜头,不推翻已经合格的其他镜头。
第八步:完成剪辑
按照音乐节奏完成速度变化、人物锚点匹配硬切、音效和调色,最后输出完整竖屏成片。
默认直接完成完整流程,不需要每一步等待用户确认。
如果用户明确要求“先给我看分镜”,则生成故事板后暂停,等待用户确认后再生成视频。
2. 多模态分析
分析用户上传图片时,需要重点提取以下信息:
一、人物身份特征
脸型、五官比例、眉眼、鼻子、嘴型、肤色、妆容、年龄感和整体气质。
二、发型特征
头发长度、发色、刘海、分缝、卷曲程度、帽子或发饰。
三、服装特征
上衣、外套、裤装或裙装的版型、材质、颜色、层次关系和穿着方式。
四、配饰特征
眼镜、耳饰、项链、手表、戒指、包袋、手机和鞋子。
原图中没有的配饰不要随机添加。
五、人物比例
头身比例、肩宽、腰线、腿部比例和整体体态。
不同机位可以产生合理透视变化,但不能改变人物基础比例。
六、原图构图
判断图片属于近景、半身还是全身。
如果缺少腿部、鞋子或部分服装,使用扩图补全,不直接裁掉人物。
七、可替换内容
原图背景不需要保持,可以替换为原创的城市街道、建筑入口、现代立面、街角、停车区域或咖啡店外景。
背景只负责提供INS街拍氛围,不得抢夺人物视觉中心。
八、人物一致性
所有镜头必须绑定同一人物参考。
保持脸部、发型、服装、包袋和主要配饰一致。
避免生成第二个人物、人物分身或背景路人遮挡主体。
九、素材使用原则
用户图片用于人物身份和穿搭参考,不将静态图片直接反复缩放伪装成视频。
需要重新生成具有真实空间透视和镜头运动的动态画面。
3. 故事板设计
默认设计一条约8秒、9:16竖屏、6镜头的INS城市街拍推拉转场短片。
整条视频没有完整剧情,重点展示同一个人物在多个原创城市空间中的穿搭状态和镜头变化。
镜头1:街边正面推近
时长约1.3秒。
人物全身站在城市店铺、咖啡店或建筑门口。
人物位于画面中央或略偏中央,手持手机或自然整理包袋。
镜头从全身远景开始,以超广角快速向人物推进,结束在人物胸部或脸部近景。
人物看向镜头,动作自然克制。
镜头结束时让人物脸部、眼镜或上半身占据画面中心,为下一个镜头提供匹配点。
镜头2:高机位俯拍贴近
时长约1.2秒。
切换到原创街道、路边车辆或人行道场景。
镜头从高机位俯拍人物开始,快速下降并靠近人物。
人物身体方向、脸部角度和上一镜头结束位置尽量一致。
使用轻微鱼眼和广角透视,产生强烈的空间感。
结束在人物调整眼镜、抬头或靠近镜头的状态。
镜头3:低机位建筑仰拍
时长约1.4秒。
人物位于现代建筑立面、廊柱或具有几何结构的建筑入口。
镜头从人物附近的低机位仰拍开始,先快速靠近,再轻微拉远或侧向移动。
建筑线条产生明显纵深,人物保持画面视觉中心。
允许轻微倾斜构图,但不能让人物歪斜或变形。
人物只做转头、轻微迈步或整理衣服等小动作。
镜头4:街角横向推拉
时长约1.3秒。
场景切换为原创街角、停车区域或建筑侧面。
镜头从侧前方快速横移并绕向人物正面,同时完成轻微拉远。
人物的脸部高度、身体中心或包袋位置与上一镜头保持匹配。
镜头需要有街拍摄影师跟拍的临场感,但不能剧烈抖动。
镜头5:顶部俯拍与空间拉开
时长约1.2秒。
镜头位于人物上方,从近距离俯拍开始,快速向上拉远或进行小幅环绕。
人物抬头看向镜头,保持稳定站姿或缓慢向前走一步。
利用道路标线、建筑边缘或地面结构制造图形感。
结束时人物仍然位于画面中心区域。
镜头6:建筑门口正面收尾
时长约1.5秒。
人物站在原创建筑入口、深色门面或城市街道正面。
镜头从全身远景快速推进至中景或近景。
人物自然转身、整理眼镜、放下手机或轻微摆动包袋。
最后0.3秒减速并稳定停留,清楚展示人物穿搭和脸部。
结尾不添加文字,可形成自然停顿。
转场规则:
所有镜头以人物作为锚点。
优先匹配人物脸部位置、头部大小、身体中心、眼镜、包袋或相似姿态。
转场发生在镜头运动速度最快的位置。
使用人物尺度匹配硬切、快速推进切换、拉远切换或方向一致的运动切换。
不使用普通淡入淡出、页面翻转、粒子消散、魔法光效或模板化特效转场。
4. 媒体生成
媒体生成以人物一致性优先,其次才是背景复杂度和镜头运动。
一、人物参考建立
将用户上传图片绑定为整条视频的主角色参考。
如果原图不是全身照,先生成一张自然的全身角色参考图。
补全后的脸部、发型、服装颜色和服装结构必须与原图一致。
二、关键帧生成
为6个镜头分别生成竖屏关键帧。
关键帧统一使用9:16构图,建议输出1080×1920或当前模型支持的最高竖屏清晰度。
人物在每个关键帧中保持相同身份、相同服装和相同配饰。
三、场景生成
使用原创的现代城市街道、咖啡店外部、建筑入口、几何立面、街角或停车区域。
场景之间可以变化,但整体保持同一城市、同一天和相近天气的感觉。
避免旅游景点、著名建筑、明显品牌门店和可识别的商业标志。
四、视频模型选择
优先选择当前可用模型中支持人物参考一致性、首尾帧控制、强镜头运动和竖屏输出的视频模型。
人物参考权重设置为高,镜头运动强度设置为中高。
不要为了增加动态而让人物产生夸张走路、跳跃或大幅挥手。
五、单镜头生成
每个镜头独立生成约1—1.5秒的视频素材。
单镜头只包含一种主要摄影机运动:
快速推进;
快速拉远;
俯拍下降;
仰拍上升;
轻微环绕;
横向移动。
六、连续性控制
所有镜头复用同一人物参考、同一服装描述和同一人物身份关键词。
每个镜头的结束人物位置,要与下一个镜头的开始位置相匹配。
优先保持脸部稳定,不使用过强运动模糊遮挡人物五官。
七、音乐与音效
默认选择无歌词、节拍清晰、具有时尚感的电子、轻Hip-hop或都市感器乐。
音乐不应过于浮夸或具有短剧感。
在每次快速推拉和硬切处添加轻微whoosh或空气移动音效。
音效音量低于背景音乐,不盖过整体节奏。
八、禁止内容
不生成字幕、标题、贴纸、边框、水印和随机品牌文字。
不增加无关人物。
不随机改变服装。
不生成夸张超现实变形、瞬移光效、爆炸、烟雾或粒子特效。
5. 提示词撰写
生成图片和视频时,提示词必须围绕以下顺序组织:
人物身份锁定
+
服装和配饰锁定
+
原创城市场景
+
景别与机位
+
摄影机运动
+
人物微动作
+
光线与色调
+
镜头结束匹配位置
+
一致性限制和负面限制
视频模型提示词优先使用英文,以提高摄影机运动指令的执行稳定性;故事板说明可以使用中文。
每个镜头提示词都必须重复强调:
same person as the reference image;
identical face;
identical hairstyle;
identical outfit;
identical accessories;
consistent body proportions;
subject remains recognizable throughout the shot。
镜头语言优先使用以下关键词:
Instagram fashion reel;
urban street style;
ultra-wide angle lens;
subtle fisheye perspective;
fast dolly in;
rapid pull back;
crash zoom;
speed ramp;
high-angle tracking shot;
low-angle tracking shot;
dynamic handheld camera;
subject-centered composition;
match cut on the subject;
snap transition;
editorial fashion cinematography。
单镜头提示词参考结构:
Same person as the uploaded reference image, identical face, hairstyle, outfit, bag and accessories. The subject stands in an original modern urban street environment. Vertical 9:16 Instagram fashion reel, ultra-wide angle lens with subtle fisheye perspective. The camera starts from a full-body wide shot and performs a fast smooth dolly-in toward the subject's face. The subject makes a small natural movement and looks toward the camera. Muted cool-gray and beige color palette, soft overcast daylight, editorial street-fashion photography. End with the subject's face centered and filling the frame, prepared for a subject-matched hard cut. Maintain identity and clothing consistency throughout the entire shot.
每个镜头根据故事板替换场景、景别和摄影机运动,不要改变人物固定描述。
负面提示词统一包含:
different person, face change, identity drift, different hairstyle, outfit change, additional accessories, duplicated person, extra limbs, distorted hands, warped face, unstable body proportions, changing bag, changing glasses, random text, logos, watermark, excessive motion blur, melting background, floating objects, sudden body movement, slow cinematic pan, fantasy effects, particle transition, dissolve transition.
禁止只写“镜头移动”“人物保持一致”等模糊指令。
必须明确写出摄影机从哪里开始、如何运动、最终停在哪里,以及下一镜头需要匹配的人物位置。
6. 视频合成
最终视频剪辑规格:
画幅比例:9:16。
建议时长:7.5—8.5秒。
镜头数量:默认6个。
输出帧率:优先30fps或当前生成素材的原生帧率。
无字幕、无旁白、无片头和片尾文字。
剪辑节奏:
每个镜头保留约1—1.5秒。
开头0.1—0.2秒快速建立人物和场景。
镜头中段进入快速推近、拉远、俯拍下降或环绕运动。
在运动速度峰值处进行下一镜头硬切。
最后一个镜头保留约0.3秒稳定画面作为收尾。
速度处理:
使用明显但流畅的speed ramp。
可以采用正常速度进入、快速加速、结尾轻微减速的结构。
避免全程匀速,也避免突然卡顿。
人物脸部靠近镜头时,运动速度可以快速提升;进入下一个镜头后短暂恢复正常速度。
转场处理:
主要使用人物锚点匹配硬切。
确保转场前后人物头部高度、脸部位置、身体中心或包袋位置相近。
必要时只使用2—4帧的轻微运动模糊帮助衔接。
不使用淡入淡出、黑场、白闪、旋转页面、故障特效、粒子消失或现成模板转场。
镜头方向:
相邻镜头的推进方向、人物视线和身体朝向应具有延续性。
不要连续出现多个方向完全相反的镜头,避免观看时产生混乱。
画面风格:
整体为克制、高级、都市、INS时尚街拍感。
色彩以灰色、米色、黑色、低饱和绿色和自然肤色为主。
可以有适度对比和暗角,但不能让人物脸部过暗。
保留轻微手持感和超广角透视,不制作成稳定器过度平滑的商业宣传片。
音乐同步:
每一次人物匹配切换尽量落在音乐鼓点、拍点或明显节奏变化处。
快速推进和拉远位置添加轻微whoosh音效。
最后一个镜头随音乐节奏自然结束,不进行长时间淡出。
质量检查:
输出前逐镜检查脸部、发型、服装、包袋、眼镜、手部和人物比例。
如只有某一个镜头发生换脸、换衣或手部严重错误,只重新生成该镜头。
不要因为单个镜头失败而重新改变整套分镜和人物设定。