取得阶段性进展~

Words
936
Reading
5 min
Listen
Play
3y

20230514_123739.jpg

其实在开始训练之前,我就知道我的数据集有很大问题。下载的歌曲去除音乐后还有很明显的混响,这和我在uvr5里只完成一道工序或许有关,混响不知道Au能否处理,不想去学了,因为歌曲质量本身就较低,怕花大力气还是得不到更好的效果,就先跑一下看是什么情况,也算是积累经验。

惊喜的是,跑到八千步的时候在Tensorboard里面听其中一个就已经接近于原数据了(另一个始终差很多),但推理效果不行,有很大噪音,咬字也不准,回头听了数据集里的几个原音,发现里面很多字因为处理音乐而受损,数据比我想的更糟糕,数据集如此,可想而知继续跑也不会有太大的进展,所以这一炉我跑到了一万三千步停了,准备下一炉。虽然一开始花了不少时间处理音乐,但第一次嘛,走点弯路也正常。

纠正昨天关于训练时间的推测,之前听说要二三十个小时,也不能说错,不过跑到一万多步其实也就三个多小时,那算起来跑到两三万步也就七八小时,和数据集数量有关,和电脑配置关系更大,不过也看到有人居然跑了七八万步,那确实要好久好久了。

这一炉我重新录音来搞,手边有本意林,随翻随读,读了一个小时……

之后的工作就简单了,听着效果还好,直接切片,进炉。

清晰的数据集果然效果好多了,跑到六千多步的时候在Tensorboard里面已经接近原声,但就是reference loss最好的值也有30,二十几一次都没有。推理试试,还是不太理想,不过感觉上可以继续跑,因为对这套数据整体比较满意,谨慎起见,我打算把数据优化一下,再重新跑一次!

当时读的时候有好几次读错字,有几个平卷舌没读准,我之前是觉得少数几次对比四百多的数据应该影响不大,不过在听Tensorboard声音对比就知道自己想错了,数据在精不在多,有问题的应该剔除,不然会影响整个训练效果。

所以我忍痛清零了,把明显有问题的十几条删掉,应该还有不完美的,没耐心听完了~

重新开始训练。这一次,志在必得。目前跑到一万步,中途曾有过reference loss值28的时候,效果还可以,但还想要更加理想,据说是要跑到十几才是优质,这个数据集可能做不到,有二十几也还行啦。

总结:有了几次经验后发现,曾经以为挺烦锁的操作其实很简单,一两次就熟悉流程了,唯一就是有点心疼显卡呀,滚烫滚烫的。

有兴趣也想炼个丹的同学可以找我做向导啦,全程免费手把手教,绝不会把你带沟里嘿嘿~


第二次录音是在这个平台上,上次提到的vocalremover,真的是宝藏啦,再推荐一次~

取得阶段性进展~ | Ecency