采用Transformer的行为及交互角色识别
2021-08-19邹婷
现代计算机 2021年21期
邹婷
(西南交通大学信息科学与技术学院,成都611756)
0 引言
图像分类作问题是计算机视觉领域的一个基础性课题,该问题伴随着深度学习技术的进步已取得巨大进展,包括目标分类、动作分类甚至场景分类等问题的研究都已经进行很长一段时间,其中部分任务已经接近人类的水准。而在真实应用场景下,如智能机器人,则需要对场景进行更为详细的理解,除了识别图片显然在发生的行为以外,我们还需要了解诸如“谁在进行活动”、“使用的工具”、“活动发生的场所”等信息用于更高层次的场景理解。
静态图像中的行为以及人物交互识别任务在过去的很长一段时间已经成为计算机视觉领域的研究热点之一[4],早期的数据集和方法主要集中在识别较少数量的动作[5],近年来的相关数据集则开始关注人与人、人与物之间的交互[6-7],而最新的研究已有更为详细的、结构化的数据集被提出,以便于解决更高层次的理解问题。Yatskar等人[8]利用自然语言资源提出的imSitu就是一个更大、信息更为全面的数据集,该数据集以一个三元组的形式描述静态图像的场景信息,与此同时,他们使用了一个CRF模型用于建模动作和交互角色-名词实体之间的依赖关系。在本文的工作中,实验使用Transformer模型来解决本任务,捕获动作-交互角色-名词实体之间的相关性关系。
Transformer[12]在自然语言处理中受到广泛的应用,已经证实其结构可捕获语法用于生成句子,近来也有部分工作将其用于图像领域并取得较为不错的效果[13-14],受启发于以上两点,本文将其运用于场景预测任务。……
登录APP查看全文
