基于联合分布的多标记迁移学习
2021-05-14桑江徽姜海燕
计算机工程与应用 2021年9期
桑江徽,姜海燕
南京农业大学 信息科技学院,南京210095
多标记数据普遍存在于现实世界中并得到了广泛的研究,如面部表情识别、情感分析等。多标记机器学习的巨大成功通常取决于大量有标记信息的训练样本。但是,具有多标记信息的样本不易获得,且人工标注工作费时费力且精度难以得到保障,因此多标记迁移学习应运而生。多标记迁移学习常用于解决多标记样本稀缺的问题[1-3],它放宽了经典机器学习关于训练样本和测试样本必须服从独立同分布这一重要的基本假设[4]。多标记迁移学习的核心思路是通过缩小领域之间数据的分布差异从而实现数据复用。数据分布由边际分布和条件分布组成,其中边际分布反映了领域之间数据整体相似性,缩小领域间的边际分布差异能够使得源领域的整体特征更加有效地训练目标领域模型(如图1(a)→(b));而条件分布则反映了领域间每种类别的差异性,缩小条件分布差异可进一步刻划领域间的特征信息(如图1(a)→(c))。

图1 不同领域样本数据的分布
现有的多标记学习方法在缩小领域间分布差异时更多地考虑数据的边际分布[5-8]。例如,Multi-Label Transfer Learning with Sparse Representation(S-MLTL)[5]为了解决多标记图像样本稀缺导致的模型训练困难,首次提出了多标记迁移学习,使用多标记稀疏编码将数据嵌入特征子空间中,使得共享标签的样本在子空间中彼此接近,子空间中的新特征表示更具有判别力。但是,S-MLTL仅仅考虑了多标记之间的关系,并没有缩小领域间的边际分布,因此在子空间中源领域特征和目标领域特征仍然存在较大的差异。……
登录APP查看全文
