搭建基于 ComfyUI + MimicMotion 的动作迁移与换装工作流,核心逻辑是:先利用静态换装模型(如 CatVTON)把目标衣服无损替换到人物静态图上,再利用 MimicMotion 读取驱动视频的骨骼姿态,控制换装后的图片动起来。显卡与硬件配置要求MimicMotion 底层基于 Stable Video Diffusion (SVD),对显存(VRAM)和内存有较高要求:硬件维度最低配置 (门槛)推荐配置 (流畅/高清)说明GPU / 显存RTX 3060 12GB / 4070 12GBRTX 3090 / 4090 (24GB VRAM)12GB 显存需开启 --lowvram,分辨率通常限制在 512×512,且渲染较慢;24GB 显存可流畅运行 576×1024 高清输出。系统内存32 GB RAM64 GB RAM多个超大视频扩散模型(SVD、MimicMotion、DWPose)交替加载,32G 是稳定运行的底线。存储空间NVMe 固态硬盘(预留 50GB)NVMe 固态硬盘(预留 100GB+)SVD 与 MimicMotion 基础模型单体均在 5GB~10GB 以上,SSD 能极大缩短模型加载耗时。工作流整体逻辑与架构Plaintext[动作视频] ──► DWPose 提取姿态帧

                 │
                 ├─► [MimicMotion 采样器] ──► [VHS 视频合成] ──► 最终动作视频
                 │

[人物图 + 衣服图] ──► CatVTON 换装节点 ───┘ (作为 Ref Image)
为什么采用“先换装,后动作”?直接在动态视频里换装极易导致服装闪烁和纹理拉伸。先在静态图上完成高精度的 AI 虚拟试衣,再让 MimicMotion 驱动该静态图,能保证服装细节最稳定、无闪烁。搭建步骤指南 1.1. 安装 ComfyUI 自定义插件节点:准备节点与依赖。在 ComfyUI 的 custom_nodes 目录下,利用 Git 或通过 ComfyUI-Manager 搜索并安装以下必备节点:ComfyUI-MimicMotion(MimicMotion 核心驱动节点)ComfyUI-CatVTON 或 ComfyUI-Inpaint-CropAndStitch(用于前期静态图虚拟换装)ComfyUI-VideoHelperSuite(用于加载与导出视频,简称 VHS)comfyui_controlnet_aux(包含 DWPose 姿态提取器)2.2. 下载并放置模型文件:部署核心权重。将对应的权重下载并放置在指定路径下:MimicMotion 模型 (mimicmotion-1-1.pth 或 .safetensors) 存放至:ComfyUI/models/mimicmotion/SVD 基础模型 (svd_xt.safetensors) 存放至:ComfyUI/models/checkpoints/DWPose 关键点模型 (dw-ll_ucoco.pth) 存放至:ComfyUI/models/controlnet/ 或 custom_nodes/comfyui_controlnet_aux/ckpts/3.3. 组装 ComfyUI 工作流链路:构建完整节点网络。在 ComfyUI 画布中按照以下模块搭建连接:模块 A(静态换装阶段):使用 Load Image 分别加载 目标人物图 与 目标衣服图。连接至 CatVTON Pipeline 节点(搭配人物服装 Mask),输出一张已经换好衣服的人物静态参考图(Ref Image)。模块 B(姿态提取阶段):使用 VHS 的 Load Video 节点加载动作来源视频。将视频帧传入 DWPose Estimator 节点,提取出连续的姿态骨骼图(Pose Video)。模块 C(MimicMotion 动作合成阶段):添加 MimicMotion Model Loader 节点,加载 SVD 与 MimicMotion 权重。添加 MimicMotion Sampler 核心节点:ref_image 端口 ◄── 接入模块 A 输出的换装后图片。pose_images 端口 ◄── 接入模块 B 提取的骨骼序列帧。关键参数设定:steps: 20-25,cfg: 2.0-3.0,fps: 15-24,context_frames: 16(重叠帧 context_overlap: 4)。模块 D(视频导出阶段):将 MimicMotion Sampler 输出的 Latent 解码后,接入 VHS 的 Video Combine 节点,格式选择 video/h264-mp4 导出。降低显存消耗与提升画质的实用技巧启用 ComfyUI 显存优化参数启动 ComfyUI 时加上 --highvram(24G 显存)或 --lowvram(12G 显存)标记。最新版 ComfyUI 默认集成了 Dynamic VRAM 机制,能大幅避免显存溢出(OOM)问题。 分辨率与分块渲染(Tiling)如果显存小于 16GB,建议先将视频尺寸降采样(如 512×768)进行 MimicMotion 合成,导出后再通过 CCSR 或 SUPIR 节点做超分辨率放大。 消除人脸模糊与微表情修复MimicMotion 生成的视频如果脸部较远容易出现模糊,可在视频生成末端挂载 LivePortrait 或 FaceFusion (ReActor) 节点,将原图中清晰的人脸特征贴回并融合,保证换装换脸后的画质。

网上看到的“换脸、换装且完整复刻原人物动作”的视频,在技术上被称为动作迁移(Motion Transfer / Pose-Driven Video Generation),通常需要融合姿态提取、AI 虚拟换装与人脸重构三项技术。

实现这种效果主要依赖生成式扩散模型(Diffusion Models)+ 骨骼控制网(ControlNet/OpenPose)。

核心技术原理
整个制作流程通常分为以下三个步骤:

姿态与动作提取(Pose Estimation)

系统首先使用 OpenPose 或 DensePose 算法对原视频进行逐帧解析,提取出原人物的骨骼节点、肢体动作以及面部表情轨迹,生成一张张“骨骼火柴人”或“3D人体表面图”。

角色与服装重构(Pose-Guided Video Generation & VTON)

AI 模型(基于 Stable Diffusion 或视频大模型)以提炼出的骨骼动作为约束条件,结合目标人物的图片(以及指定的服装),逐帧重新渲染画面。

如果涉及换装,还会结合 虚拟试衣算法(VTON),将服装网格平滑变形并贴合到目标的身体姿态上,同时模拟布料褶皱和光影。

人脸与表情高精融合(Face & Expression Alignment)

为防止生成的脸部模糊或变形,通常会叠加 LivePortrait 或 FaceFusion 等超清换脸工具,精准锁定原视频的眼神、嘴型和微表情,贴回生成的目标身上。

主流工具与实现方案
根据使用门槛,目前业内主流的工具和方案分为两大类:

  1. 开箱即用的云端 AI 工具(适合普通创作者)
    如果你想快速制作,不需要配置高性能显卡,以下网页/App 工具封装好了完整流程:

Viggle AI:目前网上最爆火的“动作迁移”工具之一。只需上传一段原动作视频和一张目标人物/服装的照片,Viggle 就能自动将照片中的人物替换到视频中,并完全复刻原视频的舞蹈或动作。

DomoAI:主打 Video-to-Video(视频到视频)风格转换与角色替换,支持保持原视频动作的同时,更换人物形象和服装样式。

LivePortrait(快手开源):专门用于人脸与头部动作的精准驱动,能做到非常自然的人脸替换和表情复刻。

可灵(Kling)/ 智谱清言 / 创客贴等视频大模型:内置的“视频重绘”或“角色控制”功能,也支持输入骨骼或参考图进行动作复刻。

  1. 专业级开源框架与 ComfyUI 工作流(适合深度定制)
    如果追求极高的画质、服装细节和帧率,专业团队通常会使用 ComfyUI 搭建本地工作流,结合以下开源模型:

动作驱动模型:

MimicMotion(腾讯开源):能实现极高一致性的动作迁移,对肢体交叉和交叠处理得非常好。

Animate Anyone(阿里开源)/ Champ:基于 3D 人体 Parametric Model 引导,专门解决动作迁移中的体型失真和抖动问题。

换装模型:

CatVTON / IDM-VTON:目前最强的开源虚拟试衣算法,能把指定的服装平滑平铺到人体动作上。

换脸与修复模型:

FaceFusion / ReActor:用于最后一步的超清换脸与人脸边缘融合。

AnimateDiff + ControlNet (OpenPose):在 ComfyUI 中通过骨骼控制网精准约束每一帧的渲染。

典型制作流程示例(以 ComfyUI 工作流为例)
Plaintext
[原动作视频] ──► OpenPose 提取骨骼帧

[目标人物/服装照片] ──┼─► MimicMotion / Animate Anyone 渲染基础视频

                  │
                  ├─► IDM-VTON 赋予服装质感与褶皱
                  │
                  └─► LivePortrait / FaceFusion 替换超清人脸 ──► [最终成果]

如果刚开始尝试,建议直接使用 Viggle AI 或 DomoAI,上传一张照片和一段舞蹈视频即可秒级生成;如果需要影视级的画质和精细控制,再考虑部署基于 ComfyUI + MimicMotion + LivePortrait 的开源方案。

用 Claude Code + Remotion (React/TypeScript) 搭建自动化剪辑系统,核心是将视频剪辑转化为编写 React 组件,再由 Claude Code 在终端中负责“写组件 - 配置时间轴 - 执行 CLI 渲染 - 处理报错”的完整闭环。项目整体架构Plaintextmy-video-project/
├── public/ # 静态素材 (原始视频、音频、BGM)
│ ├── input.mp4
│ └── transcript.json # 带时间戳的字幕/文案数据
├── src/
│ ├── components/ # 可复用的 Remotion 动效组件
│ │ ├── Subtitle.tsx # 动态字幕组件
│ │ └── HighlightCard.tsx# 重点提示卡片
│ ├── Composition.tsx # 主视频组装逻辑
│ └── Root.tsx # Remotion 注册入口与参数定义
└── package.json
从零搭建步骤1.初始化 Remotion TypeScript 项目:耗时约 2 分钟。在终端中创建一个标准的 Remotion 项目,并安装基础的媒体处理扩展包:Bash# 1. 创建 Remotion 官方 React/TS 模板
npx create-video@latest my-video-project --template=blank

cd my-video-project

2. 安装 Remotion 辅助库(用于计算音视频时长、字幕对齐等)

npm install @remotion/media-utils @remotion/shapes
2.准备素材与转写数据管线:提取带时间戳的文案数据。将原始口播视频放入 public/input.mp4,并使用 Whisper 提取带毫秒级时间戳的 JSON 文件,保存至 public/transcript.json。JSON/ public/transcript.json 数据结构 /
[
{ "text": "欢迎来到这个自动化剪辑教程", "start": 0.5, "end": 2.1 },
{ "text": "今天我们用 React 剪视频", "start": 2.3, "end": 4.0 }
]
3.编写 Remotion React 组件框架:定义视频组件与参数接口。在 src/ 中编写基础的花字、字幕与画中画组件,并利用 Remotion 的 useCurrentFrame 和 interpolate 做动画效果:TypeScript// src/components/Subtitle.tsx
import { AbsoluteFill, useCurrentFrame, interpolate } from "remotion";

export const Subtitle = ({ text }: { text: string }) => {
const frame = useCurrentFrame();
// 实现简单的淡入弹跳效果
const opacity = interpolate(frame, [0, 5], [0, 1], { extrapolateRight: "clamp" });
const scale = interpolate(frame, [0, 5], [0.8, 1], { extrapolateRight: "clamp" });

return (


  
    {text}
  

);
};
并在 src/Root.tsx 中注册 Composition:TypeScript// src/Root.tsx
import { Composition } from "remotion";
import { MainVideo } from "./Composition";

export const RemotionRoot = () => {
return (

);
};
4.启动 Claude Code 进行剪辑编排与渲染:终端全自动指挥。在项目根目录下直接运行 claude 启动终端 Agent,直接用自然语言向它下达指令:Bashclaude
在对话框中给 Claude Code 输入 Prompt:"请读取 public/transcript.json。修改 src/Composition.tsx,将 public/input.mp4 作为背景主视频。利用 组件,根据 json 里的 start 和 end 时间,自动将 Subtitle 挂载到对应时间轴上。接着,检测 json 里包含‘React’关键词的片段,在右上方弹出 HighlightCard 动效。最后在终端运行 npx remotion render AutoVideo out.mp4 并处理出现的任何编译或类型错误。"Claude Code 在该项目中的最佳工作流自动计算时间帧数:Remotion 基于 fps 和 frame 渲染。Claude Code 会自动把 transcript.json 中的秒数(例如 start: 2.3s)转换成 Remotion 的帧数(2.3 * 30 = 69 帧),并为你自动生成对应的 节点。错误自愈 (Self-Healing):若在运行 npx remotion render 时出现 TypeScript 类型不匹配、视频路径未找对或 React 语法错误,Claude Code 会直接读取终端报错,自动调整代码并重新尝试渲染,直到生成 .mp4 文件。

完全可以,甚至在终端自动化操作的体验上,Claude Code 非常适合做这件事。

Claude Code 本身并不直接处理视频像素,而是作为 “Agent 级终端指挥官”。由于它具备自主运行 Bash 命令、读写本地代码文件以及实时修复报错的能力,它可以直接在你本地的环境中调度 FFmpeg、Whisper、Remotion、HyperFrames 等工具,完成从素材分析到最终成片导出的一切工作。

为什么 Claude Code 极其适合视频自动剪辑?

  1. 终端闭环执行与自纠错能力(Agent Loop)
    传统的 LLM 只能帮你写出 FFmpeg 或 Remotion 代码,你还需要手动复制到终端运行;如果报错,还要再贴回给 AI。

Claude Code 的方式:你给它一条指令,它会自动在本地生成剪辑代码、直接执行 npx remotion render 或 ffmpeg 命令。如果遇到字体缺失、时间戳重叠或语法错误,它会自己读取终端报错日志、修改代码并重新运行,直到导出 .mp4 文件。

  1. 超强长上下文与分镜规划(Long Context & Subtitles)
    口播视频转写出来的字幕文件(JSON)通常包含成千上万行带有毫秒级时间戳的数据。Claude 拥有极强的长文本理解与逻辑推理能力,能一次性吃下整段字幕 JSON,自动识别重点句、高潮句、无声停顿,并精准规划每一个分镜的出现时间点。
  2. 原生 MCP 插件拓展(Model Context Protocol)
    Claude Code 原生支持 MCP 协议。你可以直接向它挂载各类音视频扩展服务:

Whisper MCP:直接在 Claude 中调用本地或云端 Whisper 提取字幕。

AI 生成类 MCP:挂载 ElevenLabs(AI 配音)、Sora / Kling(空镜画面生成)或 Remove.bg(自动扣图)等接口,让 Claude 在剪辑过程中按需生成缺少的素材。

Claude Code 剪视频的真实交互场景
你在终端打开 Claude Code (claude),在一个包含 raw_video.mp4 的项目目录下,可以直接输入这样的自然语言指令:

你的指令:
"请读取 raw_video.mp4,用 faster-whisper 提取带毫秒时间戳的字幕。然后把其中的无声气口切掉;对于说到‘核心指标’的地方,帮我用 Remotion(或 HyperFrames)写一个浮现数据卡片的动效层,最后合成一段 1080p 的成品视频。"

Claude Code 在后台会自动替你完成以下步骤:

Plaintext
┌─ 1. [执行 Bash] 调用 python whisper_script.py 生成 transcript.json
├─ 2. [分析 JSON] 读取字幕文件,计算无声区间,自动编写并运行 FFmpeg 剪切命令
├─ 3. [编写代码] 生成 Remotion (React/TS) 或 HyperFrames (HTML/GSAP) 动效组件
├─ 4. [执行 Bash] 运行 npx 渲染命令,导出 overlay.mov 包装层
├─ 5. [自我检查] 检查渲染日志,确认无报错后调用 FFmpeg 终极压制
└─ 6. [完成交付] 提示你:最终视频已保存至 output/final.mp4

核心逻辑是“视频即代码”(Video as Code)。网上使用 OpenAI Codex 自动剪视频,并不是在传统剪辑软件里用鼠标拖拽,而是将 Codex 作为“智能导演”,配合代码化渲染引擎和工具链,实现从素材解析、分镜规划到最终导出成片的全流程自动化。网上主流的工具组合 (Technical Stack)目前技术圈最流行、可工程化落地的自动化剪辑方案,通常由以下几层工具组合而成:1. 编排与大脑:OpenAI Codex作用:解析文案意图、规划分镜脚本(Storyboard)、编写渲染代码,并通过终端命令或 MCP 协议指挥整个工具链。 2. 语音转写与粗剪(ASR & Jump Cut):faster-whisper + FFmpegfaster-whisper:提取带精准毫秒级时间戳的文案。 FFmpeg:Codex 根据时间戳生成命令行,自动切除素材中的废话、无声停顿(Jump Cut)和气口。 3. 动态包装与画面渲染引擎:HyperFrames 或 RemotionHyperFrames(目前极火的开源方案):允许将 HTML + CSS + GSAP 动效直接渲染成 MP4。Codex 只需要写网页代码,就能自动生成极具科技感的图表、信息卡片和动态字幕。 Remotion:基于 React/TypeScript 的程序化视频框架,Codex 编写 React 视频组件并运行 npx remotion render 导出成片。 4. 生成式多媒体扩展:MCP 插件 (Model Context Protocol)ImagineArt MCP / Picsart for Codex:通过 MCP 协议挂载到 Codex 中。Codex 可以直接在终端调用 Sora、Kling、Veo、ElevenLabs 等 AI 模型,自动生成空镜画面、背景音效或 AI 配音。 有哪些相关插件与拓展? MCP 媒体生成插件 ImagineArt MCP / Picsart for Codex:通过简单的 CLI/MCP 指令,在 Codex 上下文中实现图生视频、文字生语音、背景去除等功能。 传统剪辑软件桥接(PR / 达芬奇)ExtendScript (.jsx):如果需要导入 Premiere Pro,Codex 可以直接生成 .jsx 自动化脚本,自动将切好的片段放入序列时间轴。DaVinci Resolve Python API:Codex 编写 Python 脚本直接控制达芬奇完成轨道挂载和调色。Codex 自动剪辑的典型工作流程[原始视频/口播素材]

[1. faster-whisper 提取带时间戳字幕]

[2. Codex 解析内容,生成分镜表计划 (Storyboard)]

[3. Codex 编写 HyperFrames / Remotion 包装代码]

[4. 调用 FFmpeg / 渲染引擎导出最终 MP4]
设定规则约束:在工作区准备 visual-spec.md(画面比例、配色、排版)和 edit-rules.md(映射规则:痛点文案弹出警告卡片,方法论弹出清单)。生成分镜计划:Codex 解析 Whisper 导出的文本,先输出一份分镜逻辑表供你确认,避免直接渲染浪费算力。渲染合成:确认分镜无误后,Codex 自动生成样式代码,并通过 HyperFrames 与 FFmpeg 一键打磨、合成并导出成品视频。