LongCat Video Avatar 数字人:本地部署指南

本地跑 LongCat-Video-Avatar-1.5:Whisper 音频编码器、完整命令、输入清单,以及本站托管工具为什么做不了对口型。

LongCat Video Avatar 是「音频驱动的数字人」:你给一张静态人像和一段录音,模型生成这个人像按录音说话、口型对得上的视频。对不想露脸的创作者、虚拟主播,或者需要固定出镜形象的团队来说,这就是「品牌只有一张图」和「有人能念每一版脚本」的区别。

本页讲的是自建、自己管的 Avatar 本地工作流。本站托管生成器是「静态图 + 动作提示词 → 视频」,不接受音频、也不做语音驱动的对口型。如果你要的正是对口型,就按下面的步骤自己跑 Avatar-1.5。

LongCat 生态里「Avatar」指什么

Avatar 是独立的一条推理链路,不是基础视频模型上的一个提示词技巧:

  • 音频驱动生成 — 人像加 WAV 进去,说话的视频出来;口型由音频编码器驱动,而不是生成完再做一次重定时
  • 独立 checkpoint — LongCat-Video-Avatar-1.5,它的音频编码器和标准 LongCat Video 模型不是一套
  • 单人与双人音频 — v1.5 支持一路或两路音频输入
  • 续写 — 同一个模型可以接着往下生成,所以长视频本质上是多次生成再拼接

一条实用规则:把 Avatar 模型和基础视频模型当成两个同源但不同的工具。觉得「都是 LongCat」就互换 checkpoint,是最快把一次运行跑挂的方式。

Avatar 1.0 与 Avatar 1.5 的区别

版本发布时间音频编码器说明
LongCat-Video-Avatar2025-12wav2vec2--model_type avatar-v1.0(默认)
LongCat-Video-Avatar-1.52026-05Whisper-Large-v3口型更准、8 步蒸馏、支持 480P/720P、可选 INT8 量化

Avatar 1.5 必须开启蒸馏采样:不加 --use_distill 会直接报错,而不是悄悄退回旧模型。

官方本地部署四步走

上游把代码、权重和命令都公开了,下面这些步骤直接来自官方仓库,不是二手视频教程的转述。

第一步:装环境

git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
cd LongCat-Video

conda create -n longcat-video python=3.10
conda activate longcat-video

# PyTorch/CUDA 按自己的机器匹配,然后:
pip install ninja psutil packaging
pip install flash_attn==2.7.4.post1
pip install -r requirements.txt
conda install -c conda-forge librosa ffmpeg
pip install -r requirements_avatar.txt

第二步:下载 Avatar 1.5 权重

pip install "huggingface_hub[cli]"
huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 \
  --local-dir ./weights/LongCat-Video-Avatar-1.5

不要默默换成最初的 Avatar checkpoint:两版的音频编码器和推理链路都不同,文件混用会得到一个加载不起来的模型。

第三步:跑一次音频图生视频

torchrun --nproc_per_node=2 run_demo_avatar_single_audio_to_video.py \
  --context_parallel_size=2 \
  --checkpoint_dir=./weights/LongCat-Video-Avatar-1.5 \
  --stage_1=ai2v \
  --input_json=assets/avatar/single_example_1.json \
  --use_distill --model_type avatar-v1.5 --use_int8

两个人说话就换成 run_demo_avatar_multi_audio_to_video.py 加双人 JSON。要做更长的片段,再加上续写参数:

  --num_segments=5 --ref_img_index=10 --mask_frame_range=3

第四步:这些设置真的会改变结果

下面都是官方仓库里的建议,标注了对应参数:

设置官方建议值
Audio CFG3-5 效果最好;想口型更紧可以往上调
--resolution480P 或 720P
--ref_img_index默认 10;0-24 形象更稳,30 能减少重复动作
--mask_frame_range默认 3;调大能压重复动作,但过大会引入瑕疵
audio_type=para(合并)两段等长音频相加
audio_type=add(拼接)长度任意,依次拼接、空隙补静音,默认第一个人先说
提示词长度描述更长的提示词,稳定性和自然度都更好

ComfyUI 路线

想要可视化工作流,社区封装把 LongCat 节点放在主分支上:

cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-WanVideoWrapper.git
cd ComfyUI-WanVideoWrapper
pip install -r requirements.txt
git rev-parse HEAD

把最后那条命令打印出来的 commit 和每次保存的工作流记在一起,然后从仓库自带的 LongCatAvatar_audio_image_to_video_example_01.json 开始,不要用视频简介里来路不明的 JSON。这个封装是个人项目、长期在改:另开一份副本升级,先跑一个已知输入,并保留上一个能用的 commit,这样某个节点改名不会一次搞挂所有任务。注意 meituan-longcat 组织里没有官方 ComfyUI 节点——官方只发布模型,不发 ComfyUI 插件。

能少走弯路的输入检查

输入不当导致的 Avatar 失败,比硬件不够更常见。动手之前先满足这几条:

  1. 用清晰人像,整个头部都在画面里,脸上没有遮挡物
  2. 先从单人和一段短而干净的 WAV 开始,再试多人音频
  3. 每次测试保持音频的采样率和声道布局一致
  4. 提示词写清身份、景别、服装、背景和克制的动作
  5. 每次保存结果时,记下模型文件名、封装 commit、工作流 JSON、种子、尺寸、时长和音频文件名
  6. 第一遍确认音频里没有很响的背景音乐或重叠人声
  7. 避免把下巴或额头裁掉的极端特写,口型动作依赖这些区域
  8. 对比不同设置时复用同一张人像,才能把音频和提示词的影响单独看

显存和时长:测,不要猜

官方 Avatar 1.5 页面没有公布「8GB/12GB 就能跑」这类通用下限。社区的 FP8、GGUF、CPU offload、block swap,以及上面用的 INT8(--use_int8)都能压低峰值显存,但真实占用取决于 checkpoint 格式、分辨率、帧数、注意力后端、系统内存和封装版本。用一个有边界的测试阶梯:

  1. 先按官方文档的设置跑仓库自带的示例
  2. 再用自己的人像和音频跑 3-5 秒
  3. 记录峰值显存、系统内存、耗时和输出尺寸
  4. 每轮只改一个变量
  5. 口型和形象稳定之后,再增加时长

「支持长视频」不等于无限长的片段零漂移。续写是反复生成的操作——每一个接缝都要检查脸部变化、偏色、手部瑕疵、背景跳变和音画偏移。

排错对照表

症状大概率边界先做这一步
节点不见了封装没装好或节点定义过期重启 ComfyUI,核对固定的封装 commit
checkpoint 加载失败原始 Avatar 和 Avatar 1.5 文件混用了核对确切的模型文件名和上游来源
CUDA out of memory分辨率、帧数、模型格式,或 offload 不够先降一个维度、缩短片段,然后重新测
口型落后于音频音频预处理、帧时序,或编码器路径不对用官方 v1.5 示例跑一段干净的单人音频
接缝处形象变化续写重叠区或源图取景不理想缩短续写段,换一张更清晰干净的参考图
第一次能跑、更新后崩社区依赖在动回到记录过的 commit,另开副本再升级

发布前的检查清单

  • 带声音完整看一遍,检查口型对位、形象、手、牙齿和眼神
  • 检查每一处续写接缝的场景连贯性
  • 确认你对所用人像和音频拥有权利
  • 把模型许可证和「开源」分开看:权重是 MIT 许可,但你自己的素材另有权利归属
  • 按平台要求标注合成媒体,该取得同意的取得同意
  • 把封装 commit 和模型文件名放在成片旁边,方便以后复现

本站能做什么、不能做什么

longcat-video.org 的托管生成器是图生视频工具:一张静态图加一段动作提示词,按模型和分辨率每次消耗 150-300 积分,提交前会给出确切消耗,新账号有 150 一次性注册积分。它没有音频入口,因此做不出会说话的数字人。

  • 没有音频、不做对口型 — 托管流程在任何套餐下都做不了,这不是以后会解锁的功能
  • 静态图出动态 — 不需要对白的片段用站内图生视频
  • 语音驱动视频 — 按上面的步骤本地跑 Avatar 1.5,或参考 ComfyUI 数字人教程
  • 托管运行的价格 — 所有积分套餐都列在价格页

相关用法

Frequently Asked Questions

LongCat Video Avatar 是什么?

它是音频驱动的数字人:你给一张静态人像和一段录音,LongCat-Video-Avatar-1.5 生成这个人物按录音说话、口型对得上的视频。

本站托管工具能做数字人对口型吗?

不能。站内生成器接收静态图和动作提示词,没有音频入口也没有对口型链路。语音驱动的数字人需要按本页步骤本地部署 Avatar 1.5。

生成数字人需要哪个 checkpoint?

LongCat-Video-Avatar-1.5。它用 Whisper-Large-v3 音频编码器替代了初代 Avatar 的 wav2vec2,并且必须开启蒸馏采样:传 --use_distill --model_type avatar-v1.5,否则直接报错而不会退回旧模型。

什么样的输入最稳?

整个头部都在画面里的清晰人像、单个人说话、采样率和声道一致的短 WAV。先做单人再试多人音频,比较不同设置时复用同一张人像。

跑 LongCat Video Avatar 要多少显存?

官方没有公布通用下限。FP8、GGUF、CPU offload、block swap 和 INT8(--use_int8)都能降低峰值占用,但实际需求取决于分辨率、帧数、checkpoint 格式和注意力后端。用 3-5 秒的测试实测,不要照搬一个数字。

数字人能无限生成而不漂移吗?

不能。续写是反复生成的操作,每一个接缝都要检查形象变化、偏色和音画偏移。短片段上口型和形象都稳定之后,再考虑加长。

按人像选择合适的流程

语音驱动的对口型走本地 Avatar 1.5 环境;站内图生视频工具只把静态图动起来,不接受音频输入。