面向微博文本的自杀风险识别模型①
2020-11-24赵宝奇孙军梅葛青青
计算机系统应用 2020年11期
章 宣,赵宝奇,孙军梅,葛青青,肖 蕾,尉 飞
1(杭州师范大学 信息科学与工程学院,杭州 311121)
2(福建省软件测评工程技术研究中心,厦门 361024)
在过去的几年中,深度卷积网络在自然语言处理领域中表现优于现有技术.虽然卷积网络已经存在很长时间,但由于可用训练集的大小和所考虑网络的大小,其表现存在很多限制.短文本分类是自然语言处理领域的重要任务,包括情感分析、问答、对话管理等.
伴随Web 2.0 时代的到来,社交媒体平台得到快速发展.而在众多网络社交媒体平台中,微博以其独有的特点受到广大网民的关注和青睐,已然成为最受欢迎的社交媒体之一.据中国互联网络信息中心发布的第43 次《中国互联网络发展状况统计报告》[1]显示,截至2018年12月,我国的网络用户规模已达到8.29 亿,其中很大一部分的用户使用微博平台进行日常的沟通交流、信息分享.人们可以自由、便捷、实时地在微博平台上抒发自己的情感、观点或评论,但也由此产生了大量冗余无用的短文本内容.因此,通过微博文本的分类提取这些信息中的有价值信息是非常有必要的,将有价值信息整合分析,可应用于实际问题的探索.
微博短文本与其他形式的短文本不同,具有长度短小,信息含量较少,数据庞大,实时更新快,语言表述不规范等鲜明的特性.同时,作为线上文本,微博网站中的文本同线下文本一样,也能够显露出个体的身份、所处的社会关系、情感表达等重要信……
登录APP查看全文
