时序行为提名的上下文信息融合方法
2021-03-11王新文谢林柏
王新文,谢林柏,彭 力
物联网技术应用教育部工程研究中心(江南大学 物联网工程学院),江苏 无锡214122
人体行为识别在智慧城市、智能交通和互联网视频推荐等环境下具有重要的应用前景。在基于视频的人体行为识别研究领域中,根据视频内容类型分为两种研究方向:行为识别和时序行为检测。时序行为检测要求预测未剪辑视频中人体行为发生的时间位置和所属的行为类别。早期方法采用时序滑动窗口进行检测[1-2],但是大量的滑动窗口导致计算量急剧增加。受益于图像目标检测技术的发展[3-4],目前行为检测主要采用两个关键步骤:时序提名和分类[5-8]。该方法第一步为时序行为提名,即精准地生成发生行为的候选时间区间(proposal)。第二步为分类,该步骤采用行为识别方法推断出proposal内的行为类别[9-12]。因此,第一步时序提名至关重要,直接影响时序边界的精确度[5-8]。
在早期工作中,Escorcia 等人[5]提出了深度行为提名(deep action proposals,DAPs)方法,采用单向长短期记忆网络(long short-term memory,LSTM)构建固定大小窗口内的视频单元之间的时序关系。Buch等人[6]提出了单流时序(single-stream temporal,SST)提名方法,该网络在整个视频上采用单向的门控循环单元(gated recurrent unit,GRU)输出多尺度的proposal,削弱了网络模型耗时问题。Guo 等人[7]在SST基础上进行改进,采用时序卷积构建上下文关系,并采用回归方法预测多尺度的时序区间。Gao等人[8]提出一种时序单元回归网络(temporal unit regression network,TURN)产生了较为精确的proposal。在以上时序行为提名方法中,DAP 和SST 均采用单向循环网络建立视频帧之间的时序联系。……