APP下载

基于深度学习的音频分离

2021-03-01何一锋戴艺宁陈一凡

科学与财富 2021年27期
关键词:深度学习监督

何一锋 戴艺宁 陈一凡

摘 要:目前部署的沉浸式音频内容的范式是基于音频对象的,它是由一个声轨和位置元数据组成的。 基于电影对象的作品通常由几十个同时进行的音频对象组成,这给音频对象的提取带来了挑战。我们通过构建一种深度学习方法来提取对象,从基于对象的作品的多声道渲染中学习,而不是直接从音频对象本身学习。这种方法可以解决对象的可扩展性问题,也提供了以监督或无监督的方式来制定解决问题的可能性方案。

关键词:音频分离,深度学习,监督,无监督

中图法分类号TP389.1

1简介

音轨和位置元数据组成的音频对象在播放过程中被渲染成特定的听觉布局(如5.1或立体声),这比传统的多声道制作提供更高的灵活性、适应性和沉浸性。基于对象的音频制作是由几十个同时进行的音频对象组成。这种对象的可扩展性问题也从模型优化的角度带来了挑战。语音[7-9]和通用[3, 10]源分离文献中描述的包络模糊性问题也出现在这里。由于任务的来源(或说话人)独立性质,监督学习所需的输出到基础真理对不能被任意分配。 为了克服这些挑战,我们提出了一种基于多通道学习的方法:我们监督学习的参照物不是物体,而是由这些物体呈现的多通道混合。基于多通道的学习的灵感来自于人类评估电影作品的方式,根

据这种方式,即使两个混合中的物体数量可能不同,如果两个基于物体的作品在多通道布局中的渲染也是相似的,那么它们就被认为是相似的。……

登录APP查看全文

猜你喜欢

深度学习监督
突出“四个注重” 预算监督显实效
监督见成效 旧貌换新颜
夯实监督之基
有体验的学习才是有意义的学习
电子商务中基于深度学习的虚假交易识别研究
MOOC与翻转课堂融合的深度学习场域建构
大数据技术在反恐怖主义中的应用展望
深度学习算法应用于岩石图像处理的可行性研究
基于深度卷积网络的人脸年龄分析算法与实现
绩效监督:从“管住”到“管好”