基于胶囊网络进行可区别特征学习的零样本识别方法研究
2021-08-12徐树振
徐树振 朱 青
(北京工业大学信息学部 北京 100124)
0 引 言
教会机器认识世界是人工智能发展的必经之路,其中深度学习技术的突破得益于互联网发展过程中所积累下来的海量标注数据。ResNet[1]是卷积神经网络(CNN)分类模型的杰出代表,在ImageNet分类任务中,其误差率低至3.57%,但其分类能力仍局限于训练数据集中的图像类别。然而,很多情况下难以获得足够有标注的数据来训练识别或预测模型,越来越多的研究者将零样本学习(Zero-Shot learning,ZSL)引入图像分类。
零样本学习旨在借助辅助知识,如属性[2]、词向量[3]、文本描述[4]等,使图像分类模型能够识别训练集中从未出现过的图像类别。这种知识迁移的能力很符合现实生活中海量类别的存在形式,比如,能够通过阅读动物的描述来对不同种类的动物进行分类,而不是必须看到它们。
近年来,研究人员试图通过学习图像及其语义特征之间的相容函数,为两者构建一个共同的嵌入空间。DeViSE模型[3]和ALE模型[5]通过求解hinge ranking损失函数学习线性变换矩阵。Socher等[6]使用一个两层的神经网络将未见图像映射到语义特征空间。ESZSL模型[7]设计了一个弗罗贝尼乌斯范数(Frobenius norm)正则化矩阵。SJE模型[8]将多个兼容函数线性组合成一个联合嵌入,从辅助信息的不同方面捕获非冗余信息。SAE模型[9]从线性自动编码器中吸取了成功的经验,除了借助编码器将图像映射到语义空间外,它还利用解码器使模型能够从映射到的语义特征重构出原始的视觉特征。与DeViSE和ALE类似,Karessli等[10]优化了hinge ranking损失函数,创新性地将凝视信息作为辅助信息引入到ZSL任务中。……
