如何搭建基于 ComfyUI + MimicMotion 的本地动作迁移与换装工作流?需要什么显卡配置?
搭建基于 ComfyUI + MimicMotion 的动作迁移与换装工作流,核心逻辑是:先利用静态换装模型(如 CatVTON)把目标衣服无损替换到人物静态图上,再利用 MimicMotion 读取驱动视频的骨骼姿态,控制换装后的图片动起来。显卡与硬件配置要求MimicMotion 底层基于 Stable Video Diffusion (SVD),对显存(VRAM)和内存有较高要求:硬件维度最低配置 (门槛)推荐配置 (流畅/高清)说明GPU / 显存RTX 3060 12GB / 4070 12GBRTX 3090 / 4090 (24GB VRAM)12GB 显存需开启 --lowvram,分辨率通常限制在 512×512,且渲染较慢;24GB 显存可流畅运行 576×1024 高清输出。系统内存32 GB RAM64 GB RAM多个超大视频扩散模型(SVD、MimicMotion、DWPose)交替加载,32G 是稳定运行的底线。存储空间NVMe 固态硬盘(预留 50GB)NVMe 固态硬盘(预留 100GB+)SVD 与 MimicMotion 基础模型单体均在 5GB~10GB 以上,SSD 能极大缩短模型加载耗时。工作流整体逻辑与架构Plaintext[动作视频] ──► DWPose 提取姿态帧
│
├─► [MimicMotion 采样器] ──► [VHS 视频合成] ──► 最终动作视频
│[人物图 + 衣服图] ──► CatVTON 换装节点 ───┘ (作为 Ref Image)
为什么采用“先换装,后动作”?直接在动态视频里换装极易导致服装闪烁和纹理拉伸。先在静态图上完成高精度的 AI 虚拟试衣,再让 MimicMotion 驱动该静态图,能保证服装细节最稳定、无闪烁。搭建步骤指南 1.1. 安装 ComfyUI 自定义插件节点:准备节点与依赖。在 ComfyUI 的 custom_nodes 目录下,利用 Git 或通过 ComfyUI-Manager 搜索并安装以下必备节点:ComfyUI-MimicMotion(MimicMotion 核心驱动节点)ComfyUI-CatVTON 或 ComfyUI-Inpaint-CropAndStitch(用于前期静态图虚拟换装)ComfyUI-VideoHelperSuite(用于加载与导出视频,简称 VHS)comfyui_controlnet_aux(包含 DWPose 姿态提取器)2.2. 下载并放置模型文件:部署核心权重。将对应的权重下载并放置在指定路径下:MimicMotion 模型 (mimicmotion-1-1.pth 或 .safetensors) 存放至:ComfyUI/models/mimicmotion/SVD 基础模型 (svd_xt.safetensors) 存放至:ComfyUI/models/checkpoints/DWPose 关键点模型 (dw-ll_ucoco.pth) 存放至:ComfyUI/models/controlnet/ 或 custom_nodes/comfyui_controlnet_aux/ckpts/3.3. 组装 ComfyUI 工作流链路:构建完整节点网络。在 ComfyUI 画布中按照以下模块搭建连接:模块 A(静态换装阶段):使用 Load Image 分别加载 目标人物图 与 目标衣服图。连接至 CatVTON Pipeline 节点(搭配人物服装 Mask),输出一张已经换好衣服的人物静态参考图(Ref Image)。模块 B(姿态提取阶段):使用 VHS 的 Load Video 节点加载动作来源视频。将视频帧传入 DWPose Estimator 节点,提取出连续的姿态骨骼图(Pose Video)。模块 C(MimicMotion 动作合成阶段):添加 MimicMotion Model Loader 节点,加载 SVD 与 MimicMotion 权重。添加 MimicMotion Sampler 核心节点:ref_image 端口 ◄── 接入模块 A 输出的换装后图片。pose_images 端口 ◄── 接入模块 B 提取的骨骼序列帧。关键参数设定:steps: 20-25,cfg: 2.0-3.0,fps: 15-24,context_frames: 16(重叠帧 context_overlap: 4)。模块 D(视频导出阶段):将 MimicMotion Sampler 输出的 Latent 解码后,接入 VHS 的 Video Combine 节点,格式选择 video/h264-mp4 导出。降低显存消耗与提升画质的实用技巧启用 ComfyUI 显存优化参数启动 ComfyUI 时加上 --highvram(24G 显存)或 --lowvram(12G 显存)标记。最新版 ComfyUI 默认集成了 Dynamic VRAM 机制,能大幅避免显存溢出(OOM)问题。 分辨率与分块渲染(Tiling)如果显存小于 16GB,建议先将视频尺寸降采样(如 512×768)进行 MimicMotion 合成,导出后再通过 CCSR 或 SUPIR 节点做超分辨率放大。 消除人脸模糊与微表情修复MimicMotion 生成的视频如果脸部较远容易出现模糊,可在视频生成末端挂载 LivePortrait 或 FaceFusion (ReActor) 节点,将原图中清晰的人脸特征贴回并融合,保证换装换脸后的画质。