最近这几天研究了下AI和视频相关,还是颇有收获的。
我的想法是,如果用户提前录制好视频,根据这些视频进行AI训练,让最后用户的口型跟后期的音频保持一致,这样看起来就像用户真人在录制视频或直播,效果不是比那种卡通数字人好许多吗?
我刚开始的时候,在github上找到Wave2lip这个项目,看到文档和介绍也不错,
实际操作时,发现安装文档写的不是很清晰,刚好又发现了另外一个项目,也是基于wave2lip的:PaddleGAN
这个项目的介绍和安装文档非常清晰和详细,而且还提供中文版本,这真是雪中送炭。。。
看了下介绍,貌似也能达到我的预期需求,那既然如此,说干就干吧。
我原本是老老实实按照传统的方法安装,比如安装python等,结果发现,相关包的依赖,实在是太过于复杂,所谓牵一发动全身,忙碌了一整天,非但无济于事,还把自己搞得焦头烂额。。。囧
后来在友人的建议下,说安装conda不就可以解决这些乱七八糟问题了嘛。
哦,原来如此,这真是让人醍醐灌顶啊,于是赶快上conda官网,
选择适合自己python版本的conda,下载安装,安装后的conda如下图,
我的python版本如下图,
再看下是否具备相关安装要求,比如要求pip版本为20.2.2或更高版本,如下图
接下来,就是正式开启部署安装。
项目要求安装环境依赖如下:
PaddlePaddle >= 2.1.0
Python >= 3.6
CUDA >= 10.1
先安装PaddlePaddle吧,
查了下,显卡对应的是Cuda11.7版本,直接安装命令如下,
python-m pip install paddlepaddle-gpu==2.4.2.post117-f https://www.paddlepaddle.org.cn/whl/windows/mkl/avx/stable.html
安装好PaddlePaddle,测试下,
这里,如果没有GPU显卡,可以用如下命令:
python-m pip install paddlepaddle==2.4.2-i https://pypi.tuna.tsinghua.edu.cn/simple
但后边测试发现,没有显卡支持的这种纯cpu操作输出,卡的。。。连他阿玛都不认识了。。。囧
剩下的就是安装其它依赖支持,以及自然少不了ffmpeg支持,
conda install x264=='1!152.20180717'ffmpeg=4.0.2-c conda-forge
所有都完成后,测试下效果,
让老外讲中文。。。看起来还挺逼真的嘛 :)