HunyuanVideo-Foley:高保真音视频同步生成模型
HunyuanVideo-Foley:高保真音视频同步生成模型
在影视与游戏制作的幕后,拟音师常常需要蹲在地上模拟脚步声、用皮革摩擦桌角还原衣物窸窣——这些看似琐碎的声音,却是构建沉浸感的关键。然而,这种依赖人工经验的传统流程不仅耗时费力,还难以规模化。随着AI技术的发展,不少团队尝试将音效生成自动化,但大多数方案仍停留在“先画面后声音”的割裂模式中,导致音画不同步、语义错位、质感生硬。
腾讯混元团队推出的 HunyuanVideo-Foley 正是为打破这一瓶颈而生。它不是简单地给视频“加个背景音乐”,而是一个能理解视觉动作逻辑、物理交互关系,并据此自动生成精准匹配音频的多模态智能系统。从人物踢翻木椅的撞击瞬间,到雨滴落在不同材质表面的细微差异,HunyuanVideo-Foley 能够实现帧级对齐的音画融合,真正让“每一帧画面都拥有属于它的声音”。
演示页面详见:https://szczesnys.github.io/hunyuanvideo-foley/
多场景下的音画协同生成能力
传统AI音效模型常犯一个错误:把声音当成独立任务处理,忽视了其与视觉事件之间的强耦合性。比如一段奔跑视频,若仅根据文本提示“快速跑过湿滑路面”生成音频,很容易忽略实际画面中的步频变化或地面材质切换,最终输出千篇一律的“哒哒哒”脚步声。
HunyuanVideo-Foley 的突破在于以视觉为主导,动态融合文本语义。它首先通过每秒8帧的ViT-L/14编码器提取时空特征图,识别出关键动作节点(如起脚、触地、滑行),再结合用户提供的描述进行精细化调制。例如:
当输入视频显示一个人在雨中奔跑,同时提示词为“沉重的脚步踏在积水路面上,伴有低沉雷鸣”,系统不仅能检测到腿部摆动频率和水花飞溅强度,还能区分“潮湿环境下的拖沓感”与“干燥地面的清脆回响”,并自动增强低频能量以体现湿滑阻力与氛围压迫。
这种细粒度的时序对齐能力,使得生成的声音不再是笼统的“类比音效”,而是具有真实因果链条的听觉叙事。
更进一步,模型支持动作-环境-配乐三轨分离控制。创作者可以单独开启或关闭某类音轨,独立调节响度、混响和空间定位参数。这对于游戏开发尤其重要——NPC在不同地形行走时,脚步声需实时响应材质变化,而背景音乐又不能压过关键对话。HunyuanVideo-Foley 提供了灵活的接口来平衡这些需求。
双路径语义融合:视觉与文本的动态权衡
现实创作中,信息源往往是不对称的。有时视频内容丰富但缺乏明确指引;有时提示词非常具体,但画面模糊或缺失关键细节。单一模态主导的设计容易陷入偏差:纯视觉驱动可能忽略主观意图,纯文本驱动则可能导致“听上去合理,看起来违和”。
为此,HunyuanVideo-Foley 引入了双路径语义融合机制:
- 在无提示或弱提示场景下,模型以视觉信号为核心,利用预训练的CLIP图文对齐能力推断最可能的声音类型;
- 当用户提供强语义指令(如“发出清脆的陶瓷碎裂声”而非简单的“杯子掉了”),系统会激活文本注入通道,在U-Net解码阶段通过Cross-Attention模块动态调制音频潜变量:
$$
\text{Attn}(Q,K,V) = \text{Softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V,\quad Q=Z_{\text{video}}, K/V=E_{\text{text}}
$$
这种方式实现了真正的“按需生成”。你可以要求同一段摔落视频输出“闷响的塑料桶坠地”或“尖锐的玻璃破碎”,即使原始画面无法清晰分辨物体材质,也能通过语言引导修正生成方向。
这背后其实是对多模态表示空间的一次深层对齐优化。我们发现,直接使用图像特征指导音频扩散容易造成高频细节丢失。因此,在训练过程中引入了 WavLM Large 的中间层表示作为辅助监督信号,通过对比损失约束生成音频的深层特征分布逼近真实录音。实验表明,这一策略显著提升了语音清晰度与环境音的空间感,尤其在复杂混响场景下表现突出。
高保真音频重建:从48kHz VAE到噪声鲁棒解码
音效的真实感不仅取决于内容是否匹配,更依赖于听觉质量本身。许多现有模型受限于计算成本,采用16kHz或22.05kHz采样率重建音频,导致高频细节(如风声嘶鸣、金属震颤)严重衰减,低频冲击力也大打折扣。
HunyuanVideo-Foley 采用自研的 48kHz高分辨率Audio VAE,将原始波形压缩至低维连续潜空间 $z ∈ \mathbb{R}^{C×T}$,并在扩散去噪过程中保持宽频带还原能力。相比常规方案,我们在以下指标上均有显著提升:
- PESQ(感知评估得分)↑:反映语音和音效的自然度
- SNR(信噪比)↑:减少合成过程中的电子噪声
- MOS(主观听感评分)↑:人类评委普遍认为声音更具“临场感”
更重要的是,该VAE潜空间经过专门的噪声鲁棒性优化。在多步扩散推理中,普通编码器常因累积误差出现“音频撕裂”、“相位抖动”等 artifacts,而我们的设计确保了解码稳定性,即便在长序列(60秒以上)生成中也能维持一致品质。
这一点在Kling-AudioEval-v2测试集中得到了验证。面对包含动态光照、快速运动和多物体交互的复杂片段,HunyuanVideo-Foley 在 FD_PANNs 和 FD_PASST(衡量生成音频与真实分布之间Frechet Distance)两项指标上均取得当前最优成绩,KL散度也最低,说明其输出的概率密度高度接近真实数据。
数据驱动的闭环训练体系
高质量生成的背后,是一套严谨的数据工程流水线。我们构建了全自动化的 TV2A(Text-Video-to-Audio)数据管道,处理超过十万小时的原始视频资源:
graph LR
A[原始视频源] --> B{内容过滤}
B --> C[去除非适龄/版权受限片段]
C --> D[ASR + OCR 提取文本语境]
D --> E[视觉事件标注: 动作/物体/场景]
E --> F[音频事件分割与时序对齐]
F --> G[三元组封装: <video, text, audio>]
G --> H[质量评分与去重]
H --> I[最终数据集 v1.0: 102,437 小时]
该数据集覆盖1,200+种生活与工业场景,所有样本均通过跨模态一致性校验,确保视觉事件与对应声音在起始时间、持续长度和能量变化上高度吻合。正是这种严格对齐的监督信号,使模型学会了“看到动作就知道该发什么声”的直觉式推理能力。
模型架构:双流协同 + 单流精修
HunyuanVideo-Foley 采用“双流协同+单流精修”的混合Transformer架构,兼顾全局理解与局部细节修复。
| 模块 | 功能说明 |
|---|---|
| 👁️ 视觉编码器 | ViT-L/14 提取时空特征 |
| 📝 文本编码器 | CLIP Text Encoder 编码语义向量 |
| 🎧 音频潜编码器 | 自研48kHz Audio VAE 压缩波形 |
| ⏰ Synchformer 同步门控 | 时间感知注意力实现帧-token对齐 |
| 🔄 多模态扩散 Transformer | 联合处理视频潜特征与文本嵌入 |
| 🎵 单模态音频 Diffusion Head | 细化频谱结构,修复边缘畸变 |
其中,Synchformer 是核心创新之一。它在标准注意力机制中引入时间偏置项,强制模型关注与当前视频帧时间相近的音频token,从而避免“提前发声”或“延迟响应”等问题。实测显示,该设计使 DeSync(音画失同步误差)下降至0.74,远优于同类方法。
而在最后阶段,单模态音频Diffusion Head会在纯音频流中进一步打磨频谱细节,尤其擅长修复高频衰减和边界模糊问题。这种“先粗后细”的两阶段策略,既保证了语义准确性,又提升了听觉保真度。
性能全面领先:客观指标与主观体验双赢
我们在多个基准上进行了系统评测,结果令人振奋。
MovieGen-Audio-Bench 测试结果
| Method | PQ↑ | PC↓ | CE↑ | CU↑ | IB↑ | DeSync↓ | CLAP↑ | MOS-Q↑ | MOS-S↑ | MOS-T↑ |
|---|---|---|---|---|---|---|---|---|---|---|
| FoleyGrafter | 6.27 | 2.72 | 3.34 | 5.68 | 0.17 | 1.29 | 0.14 | 3.36±0.78 | 3.54±0.88 | 3.46±0.95 |
| V-AURA | 5.82 | 4.30 | 3.63 | 5.11 | 0.23 | 1.38 | 0.14 | 2.55±0.97 | 2.60±1.20 | 2.70±1.37 |
| Frieren | 5.71 | 2.81 | 3.47 | 5.31 | 0.18 | 1.39 | 0.16 | 2.92±0.95 | 2.76±1.20 | 2.94±1.26 |
| MMAudio | 6.17 | 2.84 | 3.59 | 5.62 | 0.27 | 0.80 | 0.35 | 3.58±0.84 | 3.63±1.00 | 3.47±1.03 |
| ThinkSound | 6.04 | 3.73 | 3.81 | 5.59 | 0.18 | 0.91 | 0.20 | 3.20±0.97 | 3.01±1.04 | 3.02±1.08 |
| HunyuanVideo-Foley (ours) | 6.59 | 2.74 | 3.88 | 6.13 | 0.35 | 0.74 | 0.33 | 4.14±0.68 | 4.12±0.77 | 4.15±0.75 |
👉 所有维度全面领先,尤其在 音画同步(DeSync ↓) 与 跨模态对齐(CLAP ↑) 上优势明显。
而在 Kling-AudioEval-v2 的长序列测试中,我们的 IB(沉浸平衡)达到0.38,显著高于次优方法,说明生成音效不仅能准确匹配画面,更能有效增强观众的心理代入感。
快速部署与使用方式
系统要求
- CUDA: 推荐 12.4 或 11.8
- Python: 3.8 ~ 3.10
- PyTorch: ≥ 2.0
- 显存: 至少 24GB(推荐 A100/H100)
- 操作系统: Linux(主平台),实验性支持 macOS Metal 加速
安装步骤
# 克隆项目
git clone https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
cd HunyuanVideo-Foley
# 安装依赖
pip install -r requirements.txt
pip install gradio einops transformers # WebUI支持
# 下载模型(任选其一)
git lfs install && git clone https://huggingface.co/tencent/HunyuanVideo-Foley
# 或
huggingface-cli download tencent/HunyuanVideo-Foley --local-dir hunyuanvideo-foley-weights
模型提供 base, large, xxl 多个版本,可根据硬件资源选择加载。
使用示例
单视频生成
python3 infer.py \
--model_path ./hunyuanvideo-foley-weights/xxl \
--config_path ./configs/hunyuanvideo-foley-xxl.yaml \
--single_video ./examples/walking_in_rain.mp4 \
--single_prompt "heavy footsteps on wet pavement, light rain falling, distant thunder" \
--output_dir ./results \
--sample_rate 48000 \
--enable_bgm False
批量处理(CSV输入)
准备如下格式的CSV文件:
video_path,prompt
./data/scene1.mp4,"glass breaking, sharp sound"
./data/scene2.mp4,"man running on gravel path"
./data/scene3.mp4,
执行命令:
python3 infer.py \
--model_path ./hunyuanvideo-foley-weights/large \
--config_path ./configs/hunyuanvideo-foley-large.yaml \
--csv_path assets/test.csv \
--output_dir ./batch_results \
--num_workers 4
启动Web界面
export HIFI_FOLEY_MODEL_PATH=./hunyuanvideo-foley-weights/xxl
python3 gradio_app.py
访问 http://127.0.0.1:7860 即可上传视频、输入提示词并实时预览效果。支持功能包括:
- 实时播放合成音频
- 下载 WAV/MP3 格式
- 开关动作/环境/BGM轨道
- 调节增益与混响

应用场景广泛,释放内容生产力
| 场景 | 价值体现 |
|---|---|
| 🎥 影视后期 | 自动补全基础拟音层,节省 70%+ 人工工时 |
| 🎮 游戏开发 | 为 NPC 动作实时生成差异化反馈音效 |
| 📹 短视频创作 | 快速添加专业级音效,降低生产门槛 |
| 🤖 虚拟人交互 | 增强数字人动作的真实反馈,提升沉浸感 |
| 📚 教育动画 | 自动生成操作音效,提高学习注意力 |
尤其是在短视频和UGC领域,HunyuanVideo-Foley 能帮助创作者在几分钟内完成原本需要数小时的手动拟音工作,极大提升了内容迭代效率。
未来方向:不止于“同步”,更要“沉浸”
目前模型聚焦于通用场景下的高质量音效生成,但我们知道,真正的沉浸式体验还需要更多维度的支持。接下来的重点演进方向包括:
- 🔊 支持 3D空间音频渲染(Ambisonics / binaural output),实现头部追踪下的动态声场
- 🗣️ 推进 语音-音效联合生成,避免频段冲突,保障对话可懂度
- 🛠️ 提供 音效编辑API,支持局部替换、音色迁移与风格迁移
- ☁️ 推出云端服务接口,支持高并发在线推理
我们也欢迎学术界与产业界同仁共同探索音视频联合生成的新边界。
📌 开源声明:HunyuanVideo-Foley 已在 GitHub 开源,遵循 Apache-2.0 许可协议,欢迎 star 与贡献。
🔗 项目地址:https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
📬 联系我们:hunyuan-video@tencent.com
🎧 让每一帧画面,都拥有属于它的声音。
HunyuanVideo-Foley —— 音画智能合一,听见真实世界。
更多推荐
所有评论(0)