在矩池云使用hallo2生成数字人视频,详细指南
Hallo2是一个由复旦大学、百度和南京大学合作开发的项目,专注于实现长时和高分辨率的音频驱动人像图像动画。该项目能够将音频信号转换为逼真的人脸动画,支持长时间的动画制作,并提供高分辨率的输出。它还提供了源代码和预训练模型,以促进研究和进一步的开发。
本文将详细介绍,如何在GPU算力租赁平台矩池云上快速复现、跑通 hallo2 项目,便捷的生成自己的数字人视频。
租用机器
本次复现先使用的是亚太1区 NVIDIA RTX 4090 配置环境,镜像使用的是 CUDA 11.8,选择好机器和镜像后,在高级选项–自定义一个http协议的 8000 端口,然后点击租用即可。
使用亚太1区的可以无感连 Github 和 HuggingFace,克隆 Github 代码或者下载Huggingface 模型很快。
租用成功后我们可以在租用页面看到机器的 SSH、Jupyterlab 等链接,矩池云官网有详细的教程介绍了如何使用这些链接连接服务器。

配置环境
clone 代码
经常修改的代码和数据集建议放矩池云网盘,Linux 系统实例中网盘对应机器中的 /mnt目录,永久存储,可以离线上传下载数据。
我们点击 Jupyterlab 链接即可直接访问服务器,新建一个 Terminal,输入以下指令 clone 项目。
# 进入网盘目录,我复现项目代码会归纳在一起 /mnt/example/,你改成自己目录即可
cd /mnt/example/
# clone 代码
git clone https://github.com/fudan-generative-vision/hallo2
cd hallo2
### 安装依赖
创建conda环境,按以下指令输入即可:
# 这句rm指令是清除镜像里默认配置的国内pip、conda镜像源,
# 如果你租用的不是亚太1区的机器,不用运行这句
rm ~/.condarc
rm /root/.config/pip/pip.conf /root/.pip/pip.conf
pip install torch==2.2.2 torchvision==0.17.2 torchaudio==2.2.2 --index-url https://download.pytorch.org/whl/cu118
pip install -r requirements.txt
pip install huggingface_hub==0.24 gradio==4.44.1

处理视频,还需要安装 ffmpeg。
# 这句sed指令是将默认的腾讯原换成官方的,
# 如果你租用的不是亚太1区的机器,不用运行这句
sed -i 's|http://mirrors.cloud.tencent.com/ubuntu/|http://archive.ubuntu.com/ubuntu|g' /etc/apt/sources.list
apt update
apt install ffmpeg -y
安装 git-lfs 下载预训练模型。
apt update
apt install git-lfs
git lfs install
git clone https://huggingface.co/fudan-generative-ai/hallo2 pretrained_models
进入 scripts 目录,打开 app.py 程序,设置下webui 的 server_name 和 server_port。
app.launch(server_name='0.0.0.0', server_port=8000)
在 config/inference 里将 default.yaml 复制改为 long.yaml。

然后输入以下指令运行程序即可,经过上面修改,程序部署在 8000 端口。
python scripts/app.py

我们直接租用页面点击8000端口对应链接。

然后就可以看到 hallo2 webui 界面,在页面可以上传图片和音频,然后点击生成按钮即可开始合成处理。
生成一个19s视频,大概耗时10分钟左右。

推理生成的时候GPU显存占用 13G左右,利用率100%。

整体生成效果很赞,目前 hallo2 只支持面部动作生成。
保存环境
在矩池云配置好环境后,暂时不用的话,可以租用页面点击更多–保存到个人环境,这样下次从保存环境启动不需要重新配置环境。

取一个环境名称,然后勾选保存成功后自动释放机器,再点击保存环境即可。

保存成功后下次即可快速从保存环境启动啦。
如果你复现有什么问题,或者有什么AI项目复现需求,欢迎评论交流,知无不言。
更多推荐
所有评论(0)