基于Word2Vec词嵌入和聚类模型的安全生产事故文本案例分类①
2021-01-22吴德平
计算机系统应用 2021年1期
吴德平,华 钢
1(中国矿业大学 信息与控制工程学院,徐州 221008)
2(江苏安全技术职业学院 网络与信息安全学院,徐州 221011)
安全生产事关生命财产安全.通过对安全生产事故划分,对安全生产事故发生的行业、时间、地域、原因、教训等多个维度展开大数据分析,采用语义分析技术,从客观的数据中挖掘安全生产事故的特点与规律,为安全生产的应急管理提供科学决策具有重要技术意义和参考价值.本文旨在通过NLP 技术实现安全生产事故大数据分析.图1是安全生产事故分类的实现流程,通过该流程实现安全生产事故的分类.准备大量的安全生产案例作为语料,jieba分词工具实现语料分词,将分词后的单元输入Word2Vec模型获得词向量,通过K-means 聚类对词向量实现聚类实现安全生产事故的分类[1].

图1 安全生产事故分类实现流程
1 文本表示
文本表示是把字词处理成向量或矩阵,以便计算机能进行处理.文本表示是自然语言处理的开始环节.目前常用的文本表示模型有:词袋模型、主题模型和词嵌入模型等.词袋模型主要有One-Hot (独热编码)、n-gram、TF-IDF.本例采用One-Hot 编码.
One-Hot 编码,又称一位有效编码,其方法是使用N位状态寄存器来对N个状态进行编码,每个状态都有它独立的寄存器位,并且在任意时候,其中只有一位有效.本质上是用一个只含一个1,其他都是0 的向量来唯一表示词语.表1中安全生产事故性质分类为例(仅考虑死亡人数),死亡人数1-9 的一种One-Hot 编码如表1.

表1 One-Hot 编码示意
