基于Python 的文本数据增强系统设计与实现
2021-07-30韩会珍刘立波
宁夏工程技术 2021年2期
韩会珍,刘立波
(宁夏大学 信息工程学院,宁夏 银川 750021)
近年来,人工智能正逐渐改变着世界,而自然语言处理已成为计算机科学与人工智能领域内一个重要方向,在各个行业应用越来越广泛[1—2]。随着深度学习的出现和计算能力的提升,自然语言处理中情感分析和主题分类等文本分类任务都取得了很高的准确性,但高性能往往取决于训练数据的大小和质量[3],文本数据的收集往往是十分困难的,文本增强技术的出现很好地解决了这类问题。
在实际的文本数据收集中,正常文本与敏感文本的数量很容易失衡,但又要求训练出的模型能够召回较为全面的敏感文本[4—6]。这就需要文本“数据增强”,来扩展敏感文本数量,让数据更丰富。传统文本数据增强方法中,同义词替换(SR)方法是对文本中的一些词语进行替换来完成数据增强,方式实现较为简单,但生成的文本与原文本相似度太高。采用VAEHD 文本生成模型可以学习文本中的潜在性解释,生成具有特定情感属性的文本[7]。但是该模型实现过程较为繁琐,且需要额外的数据。本文采用一种简单文本增强(EDA)方法,不需要额外的数据,而且同义词替换、随机交换、随机插入、随机删除4 种方式的结合能更好地扩充语义,实现起来也较为简单。因此,依据实际需求,首先对文本进行预处理,以处理乱码、换行符冗余等问题,然后再利用EDA 方法进行文本数据增强。采用Python 语言结合Flask 框架设计实现了Web 网页版单文本和批量文本数据增强系统[8—12],对于处理少样本场景下样本不均衡性、数据量不足易导致模型过拟合有较好的应用价值。……
登录APP查看全文
