多种AI算法在新冠疫情文本情绪识别中的实践
2021-11-17仇建民
江苏通信 2021年5期
仇建民
中国电信股份有限公司江苏分公司
0 引言
1 任务分析
1.1 任务背景
新型冠状病毒(COVID-19)感染的肺炎疫情牵动着全国人民的心。习近平总书记指出:要鼓励运用大数据、人工智能、云计算等数字技术,在疫情监测分析、病毒溯源、防控救治、资源调配等方面更好地发挥支撑作用。为助力疫情防控和疫情之后的经济社会恢复工作,北京市经信局主办了一场科技战疫公益挑战赛。为了帮助政府掌握真实的社会舆论情况,科学、高效地做好防控宣传和舆情引导工作,本赛题针对疫情相关话题开展网民情绪识别的任务。
1.2 任务说明
给定微博文本内容,设计算法对微博内容进行情绪识别,判断微博内容是积极的、消极的还是中性的,是文本三分类任务。
2 实验
2.1 数据准备
2.1.1 数据预处理
为保证后续各类算法实验对比的公平,数据统一进行预处理,后续各类算法均使用处理后的标准数据集。本文使用了以下4种数据预处理方法:(1)数据去噪。只保留微博内容、情感倾向两个字段,并删除空值、异常值等无效数据。(2)去除标点符号等特殊字符。因微博存在表情等数据会变成特殊字符,故统一删除字符,只保留中文、英文、数字,并将多余重复的空格合并为一个空格。(3)繁体字转简体字。将全部繁体字转换为简体字。(4)去除微博中无意义的词语。因为微博场景的特殊性,删除“展开全文”“网页链接”“转发微博”等微博特定词汇。
预处理完成后,最终的样本由原始的100 000条文本,缩减为99 373条文本。……
登录APP查看全文
