看到网上有那种根据一个人的动作,换脸换装的视频,完整复刻原人物的动作,这是靠什么技术或什么工具实现的
网上看到的“换脸、换装且完整复刻原人物动作”的视频,在技术上被称为动作迁移(Motion Transfer / Pose-Driven Video Generation),通常需要融合姿态提取、AI 虚拟换装与人脸重构三项技术。
实现这种效果主要依赖生成式扩散模型(Diffusion Models)+ 骨骼控制网(ControlNet/OpenPose)。
核心技术原理
整个制作流程通常分为以下三个步骤:
姿态与动作提取(Pose Estimation)
系统首先使用 OpenPose 或 DensePose 算法对原视频进行逐帧解析,提取出原人物的骨骼节点、肢体动作以及面部表情轨迹,生成一张张“骨骼火柴人”或“3D人体表面图”。
角色与服装重构(Pose-Guided Video Generation & VTON)
AI 模型(基于 Stable Diffusion 或视频大模型)以提炼出的骨骼动作为约束条件,结合目标人物的图片(以及指定的服装),逐帧重新渲染画面。
如果涉及换装,还会结合 虚拟试衣算法(VTON),将服装网格平滑变形并贴合到目标的身体姿态上,同时模拟布料褶皱和光影。
人脸与表情高精融合(Face & Expression Alignment)
为防止生成的脸部模糊或变形,通常会叠加 LivePortrait 或 FaceFusion 等超清换脸工具,精准锁定原视频的眼神、嘴型和微表情,贴回生成的目标身上。
主流工具与实现方案
根据使用门槛,目前业内主流的工具和方案分为两大类:
- 开箱即用的云端 AI 工具(适合普通创作者)
如果你想快速制作,不需要配置高性能显卡,以下网页/App 工具封装好了完整流程:
Viggle AI:目前网上最爆火的“动作迁移”工具之一。只需上传一段原动作视频和一张目标人物/服装的照片,Viggle 就能自动将照片中的人物替换到视频中,并完全复刻原视频的舞蹈或动作。
DomoAI:主打 Video-to-Video(视频到视频)风格转换与角色替换,支持保持原视频动作的同时,更换人物形象和服装样式。
LivePortrait(快手开源):专门用于人脸与头部动作的精准驱动,能做到非常自然的人脸替换和表情复刻。
可灵(Kling)/ 智谱清言 / 创客贴等视频大模型:内置的“视频重绘”或“角色控制”功能,也支持输入骨骼或参考图进行动作复刻。
- 专业级开源框架与 ComfyUI 工作流(适合深度定制)
如果追求极高的画质、服装细节和帧率,专业团队通常会使用 ComfyUI 搭建本地工作流,结合以下开源模型:
动作驱动模型:
MimicMotion(腾讯开源):能实现极高一致性的动作迁移,对肢体交叉和交叠处理得非常好。
Animate Anyone(阿里开源)/ Champ:基于 3D 人体 Parametric Model 引导,专门解决动作迁移中的体型失真和抖动问题。
换装模型:
CatVTON / IDM-VTON:目前最强的开源虚拟试衣算法,能把指定的服装平滑平铺到人体动作上。
换脸与修复模型:
FaceFusion / ReActor:用于最后一步的超清换脸与人脸边缘融合。
AnimateDiff + ControlNet (OpenPose):在 ComfyUI 中通过骨骼控制网精准约束每一帧的渲染。
典型制作流程示例(以 ComfyUI 工作流为例)
Plaintext
[原动作视频] ──► OpenPose 提取骨骼帧
│[目标人物/服装照片] ──┼─► MimicMotion / Animate Anyone 渲染基础视频
│
├─► IDM-VTON 赋予服装质感与褶皱
│
└─► LivePortrait / FaceFusion 替换超清人脸 ──► [最终成果]如果刚开始尝试,建议直接使用 Viggle AI 或 DomoAI,上传一张照片和一段舞蹈视频即可秒级生成;如果需要影视级的画质和精细控制,再考虑部署基于 ComfyUI + MimicMotion + LivePortrait 的开源方案。