LongCat Video Avatar 是「音频驱动的数字人」:你给一张静态人像和一段录音,模型生成这个人像按录音说话、口型对得上的视频。对不想露脸的创作者、虚拟主播,或者需要固定出镜形象的团队来说,这就是「品牌只有一张图」和「有人能念每一版脚本」的区别。
本页讲的是自建、自己管的 Avatar 本地工作流。本站托管生成器是「静态图 + 动作提示词 → 视频」,不接受音频、也不做语音驱动的对口型。如果你要的正是对口型,就按下面的步骤自己跑 Avatar-1.5。
Avatar 是独立的一条推理链路,不是基础视频模型上的一个提示词技巧:
一条实用规则:把 Avatar 模型和基础视频模型当成两个同源但不同的工具。觉得「都是 LongCat」就互换 checkpoint,是最快把一次运行跑挂的方式。
| 版本 | 发布时间 | 音频编码器 | 说明 |
|---|---|---|---|
| LongCat-Video-Avatar | 2025-12 | wav2vec2 | --model_type avatar-v1.0(默认) |
| LongCat-Video-Avatar-1.5 | 2026-05 | Whisper-Large-v3 | 口型更准、8 步蒸馏、支持 480P/720P、可选 INT8 量化 |
Avatar 1.5 必须开启蒸馏采样:不加 --use_distill 会直接报错,而不是悄悄退回旧模型。
上游把代码、权重和命令都公开了,下面这些步骤直接来自官方仓库,不是二手视频教程的转述。
git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
cd LongCat-Video
conda create -n longcat-video python=3.10
conda activate longcat-video
# PyTorch/CUDA 按自己的机器匹配,然后:
pip install ninja psutil packaging
pip install flash_attn==2.7.4.post1
pip install -r requirements.txt
conda install -c conda-forge librosa ffmpeg
pip install -r requirements_avatar.txtpip install "huggingface_hub[cli]"
huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 \
--local-dir ./weights/LongCat-Video-Avatar-1.5不要默默换成最初的 Avatar checkpoint:两版的音频编码器和推理链路都不同,文件混用会得到一个加载不起来的模型。
torchrun --nproc_per_node=2 run_demo_avatar_single_audio_to_video.py \
--context_parallel_size=2 \
--checkpoint_dir=./weights/LongCat-Video-Avatar-1.5 \
--stage_1=ai2v \
--input_json=assets/avatar/single_example_1.json \
--use_distill --model_type avatar-v1.5 --use_int8两个人说话就换成 run_demo_avatar_multi_audio_to_video.py 加双人 JSON。要做更长的片段,再加上续写参数:
--num_segments=5 --ref_img_index=10 --mask_frame_range=3下面都是官方仓库里的建议,标注了对应参数:
| 设置 | 官方建议值 |
|---|---|
| Audio CFG | 3-5 效果最好;想口型更紧可以往上调 |
--resolution | 480P 或 720P |
--ref_img_index | 默认 10;0-24 形象更稳,30 能减少重复动作 |
--mask_frame_range | 默认 3;调大能压重复动作,但过大会引入瑕疵 |
audio_type=para(合并) | 两段等长音频相加 |
audio_type=add(拼接) | 长度任意,依次拼接、空隙补静音,默认第一个人先说 |
| 提示词长度 | 描述更长的提示词,稳定性和自然度都更好 |
想要可视化工作流,社区封装把 LongCat 节点放在主分支上:
cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-WanVideoWrapper.git
cd ComfyUI-WanVideoWrapper
pip install -r requirements.txt
git rev-parse HEAD把最后那条命令打印出来的 commit 和每次保存的工作流记在一起,然后从仓库自带的 LongCatAvatar_audio_image_to_video_example_01.json 开始,不要用视频简介里来路不明的 JSON。这个封装是个人项目、长期在改:另开一份副本升级,先跑一个已知输入,并保留上一个能用的 commit,这样某个节点改名不会一次搞挂所有任务。注意 meituan-longcat 组织里没有官方 ComfyUI 节点——官方只发布模型,不发 ComfyUI 插件。
输入不当导致的 Avatar 失败,比硬件不够更常见。动手之前先满足这几条:
官方 Avatar 1.5 页面没有公布「8GB/12GB 就能跑」这类通用下限。社区的 FP8、GGUF、CPU offload、block swap,以及上面用的 INT8(--use_int8)都能压低峰值显存,但真实占用取决于 checkpoint 格式、分辨率、帧数、注意力后端、系统内存和封装版本。用一个有边界的测试阶梯:
「支持长视频」不等于无限长的片段零漂移。续写是反复生成的操作——每一个接缝都要检查脸部变化、偏色、手部瑕疵、背景跳变和音画偏移。
| 症状 | 大概率边界 | 先做这一步 |
|---|---|---|
| 节点不见了 | 封装没装好或节点定义过期 | 重启 ComfyUI,核对固定的封装 commit |
| checkpoint 加载失败 | 原始 Avatar 和 Avatar 1.5 文件混用了 | 核对确切的模型文件名和上游来源 |
| CUDA out of memory | 分辨率、帧数、模型格式,或 offload 不够 | 先降一个维度、缩短片段,然后重新测 |
| 口型落后于音频 | 音频预处理、帧时序,或编码器路径不对 | 用官方 v1.5 示例跑一段干净的单人音频 |
| 接缝处形象变化 | 续写重叠区或源图取景不理想 | 缩短续写段,换一张更清晰干净的参考图 |
| 第一次能跑、更新后崩 | 社区依赖在动 | 回到记录过的 commit,另开副本再升级 |
longcat-video.org 的托管生成器是图生视频工具:一张静态图加一段动作提示词,按模型和分辨率每次消耗 150-300 积分,提交前会给出确切消耗,新账号有 150 一次性注册积分。它没有音频入口,因此做不出会说话的数字人。
它是音频驱动的数字人:你给一张静态人像和一段录音,LongCat-Video-Avatar-1.5 生成这个人物按录音说话、口型对得上的视频。
不能。站内生成器接收静态图和动作提示词,没有音频入口也没有对口型链路。语音驱动的数字人需要按本页步骤本地部署 Avatar 1.5。
LongCat-Video-Avatar-1.5。它用 Whisper-Large-v3 音频编码器替代了初代 Avatar 的 wav2vec2,并且必须开启蒸馏采样:传 --use_distill --model_type avatar-v1.5,否则直接报错而不会退回旧模型。
整个头部都在画面里的清晰人像、单个人说话、采样率和声道一致的短 WAV。先做单人再试多人音频,比较不同设置时复用同一张人像。
官方没有公布通用下限。FP8、GGUF、CPU offload、block swap 和 INT8(--use_int8)都能降低峰值占用,但实际需求取决于分辨率、帧数、checkpoint 格式和注意力后端。用 3-5 秒的测试实测,不要照搬一个数字。
不能。续写是反复生成的操作,每一个接缝都要检查形象变化、偏色和音画偏移。短片段上口型和形象都稳定之后,再考虑加长。