APP下载

支持汽车故障数据增值的词汇增强实体识别

2021-11-01杨雯迪任春华孙洁香

现代计算机 2021年26期
关键词:词汇特征文本

杨雯迪,任春华,孙洁香

(1.西南交通大学信息科学与技术学院,成都 611756;2.北京机械工业自动化研究所有限公司,北京 100120)

0 引言

在制造业产业协同与信息化技术支撑四川省重点实验室研发的汽车产业链协同平台上汇聚了多条汽车产业价值链的销售、配件、服务等业务协同数据,其中包括大量非结构化的文本数据,由于描述性的故障文本信息包含了大量汽车维修知识,具有增值服务价值。利用文本数据的前提是将文本数据转换为知识,针对故障文本的命名实体识别作为知识库建立、故障分类、故障关系发现、故障诊断等应用服务的上游任务,为后期应用提供基础支撑。

在中文命名实体识别中,由于文本不像英文具有自然分割的特征,常见的做法使用分词边界标记作为特征进行基于词的序列标注,该类方法忽略了汉字字符的表征能力且依赖于分词效果[1]。因此大多数模型为避免分词工具带来的分割错误,直接利用字符进行特征提取,模型主要包括长短时记忆(LSTM)网络、双向长短时记(Bi-LSTM)网络,以及条件随机场(CRF)等[2],但是基于字符的命名实体识别并没有充分利用汉语词汇信息,对于汽车维修这样的专业领域来说,故障件“后桥支架”在模型中经常会被认为是“后桥”和“支架”两个实体。如何更好地在命名实体识别中利用中文词汇信息一直受到研究的关注[2]。其中,文献[3]提出了Lattice-LSTM模型,将词汇信息整合到了基于字符的NER中。由于网络结构的增……

登录APP查看全文

猜你喜欢

词汇特征文本
本刊可直接用缩写的常用词汇
一些常用词汇可直接用缩写
如何表达“特征”
在808DA上文本显示的改善
本刊可直接用缩写的常用词汇
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征