APP下载

基于Python 的文本数据增强系统设计与实现

2021-07-30韩会珍刘立波

宁夏工程技术 2021年2期
关键词:界面分类文本

韩会珍,刘立波

(宁夏大学 信息工程学院,宁夏 银川 750021)

近年来,人工智能正逐渐改变着世界,而自然语言处理已成为计算机科学与人工智能领域内一个重要方向,在各个行业应用越来越广泛[1—2]。随着深度学习的出现和计算能力的提升,自然语言处理中情感分析和主题分类等文本分类任务都取得了很高的准确性,但高性能往往取决于训练数据的大小和质量[3],文本数据的收集往往是十分困难的,文本增强技术的出现很好地解决了这类问题。

在实际的文本数据收集中,正常文本与敏感文本的数量很容易失衡,但又要求训练出的模型能够召回较为全面的敏感文本[4—6]。这就需要文本“数据增强”,来扩展敏感文本数量,让数据更丰富。传统文本数据增强方法中,同义词替换(SR)方法是对文本中的一些词语进行替换来完成数据增强,方式实现较为简单,但生成的文本与原文本相似度太高。采用VAEHD 文本生成模型可以学习文本中的潜在性解释,生成具有特定情感属性的文本[7]。但是该模型实现过程较为繁琐,且需要额外的数据。本文采用一种简单文本增强(EDA)方法,不需要额外的数据,而且同义词替换、随机交换、随机插入、随机删除4 种方式的结合能更好地扩充语义,实现起来也较为简单。因此,依据实际需求,首先对文本进行预处理,以处理乱码、换行符冗余等问题,然后再利用EDA 方法进行文本数据增强。采用Python 语言结合Flask 框架设计实现了Web 网页版单文本和批量文本数据增强系统[8—12],对于处理少样本场景下样本不均衡性、数据量不足易导致模型过拟合有较好的应用价值。……

登录APP查看全文

猜你喜欢

界面分类文本
分类算一算
国企党委前置研究的“四个界面”
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
基于FANUC PICTURE的虚拟轴坐标显示界面开发方法研究
教你一招:数的分类
人机交互界面发展趋势研究
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
手机界面中图形符号的发展趋向
如何快速走进文本