
( ̄ω ̄( ̄ω ̄〃 ( ̄ω ̄〃)ゝ先祝各位小伙伴们国庆节快乐~
本月(以及未来数月)仍然是研发之月🧐一起来看下9月份的研发进度吧。
伴奏人声提取12.0研发中
本月我们主线研发仍然在伴奏人声提取的架构设计中。
和之前不同的是,新的架构相对于上一代算法来说几乎大了3-4倍,这意味着将近有1b级(10亿级)的参数量,对工程上以及实验都是非常大的挑战🤒每次的实验失败付出的代价都会更高、实验的耗时也会更久。
我们将算法分为了三个抽象的目标,需要完成三个目标才算完成本次研发。
目前我们仍然在目标1的中后期阶段,本月的进度有点难以启齿🤒我们将近消耗了15-20天左右实验了一个完全错误的方向,耽误了非常久的时间,目前已经更换了方向。
(省流:憋了半天啥也没有.jpg)
不过相比上个月,本月的下旬我们基本固定了训练目标,目前的模型在大多数歌曲均比上一代模型更好,但在部分问题上仍然没有得到改进。我们正在定向的微调这方面问题,来获得更一致性、更准确的输出结果。
在纯粹的指标方面,上个月我们达到了18.83dB的SDR分数,本月则达到了18.89dB,我们内部除了自动计算的指标以外,还会有人工听测的平台,本月我们的输出质量均比上个月要高非常多。
全新“轻微杂音移除”(名称待定)模型确认发布
在12.0的研发中,我们也抽出部分算力用来实验这款全新的模型。
上个月的研发日志中我们介绍,该模型用来进一步、彻底的移除人声“录音”音频中那些细微的杂声、底噪、耳返漏音等非常小但又能足以让人听见、很“膈应”的声音。
最终的成果非常满意🧐我们分别比较了市面上开源的实现、以及某些软件或网站的实现,大部分的解决方案只能在歌曲中提取人声,而不是专门用来移除这些杂音,因此在这些模型上输出甚至无变化——小声音仍然存在。少部分的解决方案能部分、不完全的移除一些声音。
归因是这些模型的架构本身不够“敏感”,另外工程方面,由于“完全无杂音”的人声的训练素材非常难以获得,因此在普通的人声上进行训练,网络的上限会遭到制约,无论再怎么训练,网络永远都会忽视某些声音。
团子在模型和工程两个角度一起出发,彻底解决了这个问题,最终的输出符合我们产品发布标准,因此在12.0发布时,该模型也会作为伴奏人声提取系列的一个算法进行发布,这为人声提取提供了两个解决方案:需要在嘈杂的音乐或声音环境中提取人声、又或者需要在母带人声录音中进一步后处理移除不需要内容。
(从上到下分别是:原音频、团子处理后音频、团子提取出的“杂音”),由于本模型特性用于移除“超小声音”,外放可能无感,因此如需试听建议佩戴耳机并注意音量。音频为中期模型,不代表最终结果。
接下来?
“轻微杂音移除”模型将近满意,我们已经暂停最终微调环节,将一切训练的算力全部用来研发12.0系列“伴奏人声提取”算法,来尝试加速我们的实验和研发阶段。
而12.0系列目前我们估算仅处于25%左右的进度,当然小伙伴不需要从前几个月的时间线性的外推最终落地时间,就像游戏一样,如果某一天遇到了好事件(村民向您分享了核聚变技术.jpg),研发的进度产生“大跳”的可能性也是非常高的👻
下个月理论来说我们将在抽象的三个目标的目标1中,完成将近收尾的工作,有望对12.0系列 DangoNet6架构做出定性级别的结果。
















