HunyuanVideo-Foley:高保真音视频同步生成模型

在影视与游戏制作的幕后,拟音师常常需要蹲在地上模拟脚步声、用皮革摩擦桌角还原衣物窸窣——这些看似琐碎的声音,却是构建沉浸感的关键。然而,这种依赖人工经验的传统流程不仅耗时费力,还难以规模化。随着AI技术的发展,不少团队尝试将音效生成自动化,但大多数方案仍停留在“先画面后声音”的割裂模式中,导致音画不同步、语义错位、质感生硬。

腾讯混元团队推出的 HunyuanVideo-Foley 正是为打破这一瓶颈而生。它不是简单地给视频“加个背景音乐”,而是一个能理解视觉动作逻辑、物理交互关系,并据此自动生成精准匹配音频的多模态智能系统。从人物踢翻木椅的撞击瞬间,到雨滴落在不同材质表面的细微差异,HunyuanVideo-Foley 能够实现帧级对齐的音画融合,真正让“每一帧画面都拥有属于它的声音”。

演示页面详见:https://szczesnys.github.io/hunyuanvideo-foley/

多场景下的音画协同生成能力

传统AI音效模型常犯一个错误:把声音当成独立任务处理,忽视了其与视觉事件之间的强耦合性。比如一段奔跑视频,若仅根据文本提示“快速跑过湿滑路面”生成音频,很容易忽略实际画面中的步频变化或地面材质切换,最终输出千篇一律的“哒哒哒”脚步声。

HunyuanVideo-Foley 的突破在于以视觉为主导,动态融合文本语义。它首先通过每秒8帧的ViT-L/14编码器提取时空特征图,识别出关键动作节点(如起脚、触地、滑行),再结合用户提供的描述进行精细化调制。例如:

当输入视频显示一个人在雨中奔跑,同时提示词为“沉重的脚步踏在积水路面上,伴有低沉雷鸣”,系统不仅能检测到腿部摆动频率和水花飞溅强度,还能区分“潮湿环境下的拖沓感”与“干燥地面的清脆回响”,并自动增强低频能量以体现湿滑阻力与氛围压迫。

这种细粒度的时序对齐能力,使得生成的声音不再是笼统的“类比音效”,而是具有真实因果链条的听觉叙事。

更进一步,模型支持动作-环境-配乐三轨分离控制。创作者可以单独开启或关闭某类音轨,独立调节响度、混响和空间定位参数。这对于游戏开发尤其重要——NPC在不同地形行走时,脚步声需实时响应材质变化,而背景音乐又不能压过关键对话。HunyuanVideo-Foley 提供了灵活的接口来平衡这些需求。

双路径语义融合:视觉与文本的动态权衡

现实创作中,信息源往往是不对称的。有时视频内容丰富但缺乏明确指引;有时提示词非常具体,但画面模糊或缺失关键细节。单一模态主导的设计容易陷入偏差:纯视觉驱动可能忽略主观意图,纯文本驱动则可能导致“听上去合理,看起来违和”。

为此,HunyuanVideo-Foley 引入了双路径语义融合机制:

  • 在无提示或弱提示场景下,模型以视觉信号为核心,利用预训练的CLIP图文对齐能力推断最可能的声音类型;
  • 当用户提供强语义指令(如“发出清脆的陶瓷碎裂声”而非简单的“杯子掉了”),系统会激活文本注入通道,在U-Net解码阶段通过Cross-Attention模块动态调制音频潜变量:
    $$
    \text{Attn}(Q,K,V) = \text{Softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V,\quad Q=Z_{\text{video}}, K/V=E_{\text{text}}
    $$

这种方式实现了真正的“按需生成”。你可以要求同一段摔落视频输出“闷响的塑料桶坠地”或“尖锐的玻璃破碎”,即使原始画面无法清晰分辨物体材质,也能通过语言引导修正生成方向。

这背后其实是对多模态表示空间的一次深层对齐优化。我们发现,直接使用图像特征指导音频扩散容易造成高频细节丢失。因此,在训练过程中引入了 WavLM Large 的中间层表示作为辅助监督信号,通过对比损失约束生成音频的深层特征分布逼近真实录音。实验表明,这一策略显著提升了语音清晰度与环境音的空间感,尤其在复杂混响场景下表现突出。

高保真音频重建:从48kHz VAE到噪声鲁棒解码

音效的真实感不仅取决于内容是否匹配,更依赖于听觉质量本身。许多现有模型受限于计算成本,采用16kHz或22.05kHz采样率重建音频,导致高频细节(如风声嘶鸣、金属震颤)严重衰减,低频冲击力也大打折扣。

HunyuanVideo-Foley 采用自研的 48kHz高分辨率Audio VAE,将原始波形压缩至低维连续潜空间 $z ∈ \mathbb{R}^{C×T}$,并在扩散去噪过程中保持宽频带还原能力。相比常规方案,我们在以下指标上均有显著提升:

  • PESQ(感知评估得分)↑:反映语音和音效的自然度
  • SNR(信噪比)↑:减少合成过程中的电子噪声
  • MOS(主观听感评分)↑:人类评委普遍认为声音更具“临场感”

更重要的是,该VAE潜空间经过专门的噪声鲁棒性优化。在多步扩散推理中,普通编码器常因累积误差出现“音频撕裂”、“相位抖动”等 artifacts,而我们的设计确保了解码稳定性,即便在长序列(60秒以上)生成中也能维持一致品质。

这一点在Kling-AudioEval-v2测试集中得到了验证。面对包含动态光照、快速运动和多物体交互的复杂片段,HunyuanVideo-Foley 在 FD_PANNs 和 FD_PASST(衡量生成音频与真实分布之间Frechet Distance)两项指标上均取得当前最优成绩,KL散度也最低,说明其输出的概率密度高度接近真实数据。


数据驱动的闭环训练体系

高质量生成的背后,是一套严谨的数据工程流水线。我们构建了全自动化的 TV2A(Text-Video-to-Audio)数据管道,处理超过十万小时的原始视频资源:

graph LR
    A[原始视频源] --> B{内容过滤}
    B --> C[去除非适龄/版权受限片段]
    C --> D[ASR + OCR 提取文本语境]
    D --> E[视觉事件标注: 动作/物体/场景]
    E --> F[音频事件分割与时序对齐]
    F --> G[三元组封装: <video, text, audio>]
    G --> H[质量评分与去重]
    H --> I[最终数据集 v1.0: 102,437 小时]

该数据集覆盖1,200+种生活与工业场景,所有样本均通过跨模态一致性校验,确保视觉事件与对应声音在起始时间、持续长度和能量变化上高度吻合。正是这种严格对齐的监督信号,使模型学会了“看到动作就知道该发什么声”的直觉式推理能力。

模型架构:双流协同 + 单流精修

HunyuanVideo-Foley 采用“双流协同+单流精修”的混合Transformer架构,兼顾全局理解与局部细节修复。

模块功能说明
👁️ 视觉编码器ViT-L/14 提取时空特征
📝 文本编码器CLIP Text Encoder 编码语义向量
🎧 音频潜编码器自研48kHz Audio VAE 压缩波形
⏰ Synchformer 同步门控时间感知注意力实现帧-token对齐
🔄 多模态扩散 Transformer联合处理视频潜特征与文本嵌入
🎵 单模态音频 Diffusion Head细化频谱结构,修复边缘畸变

其中,Synchformer 是核心创新之一。它在标准注意力机制中引入时间偏置项,强制模型关注与当前视频帧时间相近的音频token,从而避免“提前发声”或“延迟响应”等问题。实测显示,该设计使 DeSync(音画失同步误差)下降至0.74,远优于同类方法。

而在最后阶段,单模态音频Diffusion Head会在纯音频流中进一步打磨频谱细节,尤其擅长修复高频衰减和边界模糊问题。这种“先粗后细”的两阶段策略,既保证了语义准确性,又提升了听觉保真度。

性能全面领先:客观指标与主观体验双赢

我们在多个基准上进行了系统评测,结果令人振奋。

MovieGen-Audio-Bench 测试结果

MethodPQ↑PC↓CE↑CU↑IB↑DeSync↓CLAP↑MOS-Q↑MOS-S↑MOS-T↑
FoleyGrafter6.272.723.345.680.171.290.143.36±0.783.54±0.883.46±0.95
V-AURA5.824.303.635.110.231.380.142.55±0.972.60±1.202.70±1.37
Frieren5.712.813.475.310.181.390.162.92±0.952.76±1.202.94±1.26
MMAudio6.172.843.595.620.270.800.353.58±0.843.63±1.003.47±1.03
ThinkSound6.043.733.815.590.180.910.203.20±0.973.01±1.043.02±1.08
HunyuanVideo-Foley (ours)6.592.743.886.130.350.740.334.14±0.684.12±0.774.15±0.75

👉 所有维度全面领先,尤其在 音画同步(DeSync ↓) 与 跨模态对齐(CLAP ↑) 上优势明显。

而在 Kling-AudioEval-v2 的长序列测试中,我们的 IB(沉浸平衡)达到0.38,显著高于次优方法,说明生成音效不仅能准确匹配画面,更能有效增强观众的心理代入感。

快速部署与使用方式

系统要求

  • CUDA: 推荐 12.4 或 11.8
  • Python: 3.8 ~ 3.10
  • PyTorch: ≥ 2.0
  • 显存: 至少 24GB(推荐 A100/H100)
  • 操作系统: Linux(主平台),实验性支持 macOS Metal 加速

安装步骤

# 克隆项目
git clone https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
cd HunyuanVideo-Foley

# 安装依赖
pip install -r requirements.txt
pip install gradio einops transformers  # WebUI支持

# 下载模型(任选其一)
git lfs install && git clone https://huggingface.co/tencent/HunyuanVideo-Foley
# 或
huggingface-cli download tencent/HunyuanVideo-Foley --local-dir hunyuanvideo-foley-weights

模型提供 base, large, xxl 多个版本,可根据硬件资源选择加载。

使用示例

单视频生成
python3 infer.py \
    --model_path ./hunyuanvideo-foley-weights/xxl \
    --config_path ./configs/hunyuanvideo-foley-xxl.yaml \
    --single_video ./examples/walking_in_rain.mp4 \
    --single_prompt "heavy footsteps on wet pavement, light rain falling, distant thunder" \
    --output_dir ./results \
    --sample_rate 48000 \
    --enable_bgm False
批量处理(CSV输入)

准备如下格式的CSV文件:

video_path,prompt
./data/scene1.mp4,"glass breaking, sharp sound"
./data/scene2.mp4,"man running on gravel path"
./data/scene3.mp4,

执行命令:

python3 infer.py \
    --model_path ./hunyuanvideo-foley-weights/large \
    --config_path ./configs/hunyuanvideo-foley-large.yaml \
    --csv_path assets/test.csv \
    --output_dir ./batch_results \
    --num_workers 4
启动Web界面
export HIFI_FOLEY_MODEL_PATH=./hunyuanvideo-foley-weights/xxl
python3 gradio_app.py

访问 http://127.0.0.1:7860 即可上传视频、输入提示词并实时预览效果。支持功能包括:

  • 实时播放合成音频
  • 下载 WAV/MP3 格式
  • 开关动作/环境/BGM轨道
  • 调节增益与混响

Gradio UI Preview

应用场景广泛,释放内容生产力

场景价值体现
🎥 影视后期自动补全基础拟音层,节省 70%+ 人工工时
🎮 游戏开发为 NPC 动作实时生成差异化反馈音效
📹 短视频创作快速添加专业级音效,降低生产门槛
🤖 虚拟人交互增强数字人动作的真实反馈,提升沉浸感
📚 教育动画自动生成操作音效,提高学习注意力

尤其是在短视频和UGC领域,HunyuanVideo-Foley 能帮助创作者在几分钟内完成原本需要数小时的手动拟音工作,极大提升了内容迭代效率。

未来方向:不止于“同步”,更要“沉浸”

目前模型聚焦于通用场景下的高质量音效生成,但我们知道,真正的沉浸式体验还需要更多维度的支持。接下来的重点演进方向包括:

  • 🔊 支持 3D空间音频渲染(Ambisonics / binaural output),实现头部追踪下的动态声场
  • 🗣️ 推进 语音-音效联合生成,避免频段冲突,保障对话可懂度
  • 🛠️ 提供 音效编辑API,支持局部替换、音色迁移与风格迁移
  • ☁️ 推出云端服务接口,支持高并发在线推理

我们也欢迎学术界与产业界同仁共同探索音视频联合生成的新边界。


📌 开源声明:HunyuanVideo-Foley 已在 GitHub 开源,遵循 Apache-2.0 许可协议,欢迎 star 与贡献。

🔗 项目地址:https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley
📬 联系我们:hunyuan-video@tencent.com

🎧 让每一帧画面,都拥有属于它的声音。
HunyuanVideo-Foley —— 音画智能合一,听见真实世界。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐