基于弱监督学习面向主题的图文识别方法*
2021-04-26朱命冬刘小杰王鲜芳张建霞
河南工学院学报 2021年6期
朱命冬,刘小杰,王鲜芳,张建霞
(1.河南工学院 计算机科学与技术学院,河南 新乡 453003;2.新乡市智能工业大数据应用工程技术研究中心,河南 新乡 453003; 3.河南工学院 智能工程学院,河南 新乡 453003)
0 引言
图文识别具有广泛的应用场景,如图像检索、图像标注、实体识别、语义理解、跨模态查询等。面向主题的图文识别可以自动识别图片中针对某一主题的关键信息,例如图书封面中的书名信息、商品图片上的品牌信息和旅游图片中的景点信息等。
面向主题的图文识别与传统的自然场景下文字识别有一定的相似性,都是从图片中识别文本,但它们存在本质上的区别:一方面自然场景下文字识别是识别图片中所有的文字,不考虑文字和主题之间的关系,容易识别出很多与当前主题不相关的文本信息;另一方面,自然场景下文字识别只识别场景中的文本片段,而不考虑这些文本片段之间的关系,很难给出一个具有完整语义的文本表述。由此可见,面向主题的图文识别具有更强的实用性。
实现准确地面向主题的图文识别主要面临两个挑战:首先,针对某一特定的主题,往往缺乏大规模的训练数据集,人工修正的成本较高,训练数据集中容易包含脏数据;其次,只识别出文字片段,不具备独立完整的语义,难以被理解和应用,因此需要识别出文字片段与主题之间的相关性,以及各个文字片段之间的语义语序关系,才能构建具有完整语义的文本。……
登录APP查看全文
