一种循环迭代的智能语料标注系统
2021-11-08刘勇陆小慧
广东通信技术 2021年10期
[刘勇 陆小慧]
1 研究背景
在人工智能飞速发展的今天,特别是在认知智能的智能问答系统研发过程中,语料的标注和校对工作一直需要消耗大量的人力和时间。众所周知,人工智能领域的算法模型需要通过训练大量的语料得到,这些训练语料被事先进行标注,往往通常都是人工标注,标注过程需要耗费大量人力和时间。
因为标注的过程实际上是对语料中语言单位的特征进行解释的过程,不同的人可能会有不同的解释结果,所以语料标注带有很大的主观性。不同标注者的知识结构和语法理论也各不相同,如果只以少数人的标注结果作为训练语料,训练出的算法就可能有较大的误差。
本文研究旨在积累历史语料标注结果对算法模型训练的效果,降低语料标注工作的人力和时间成本投入,降低标注过程中的失误率,提高语料标注的准确率和效率。
2 系统定义与关键技术
语料标注,是对原始浯料进行加工,把各种表示语言特征的标签标注在相应的语言成分上,以便于计算机的识别和读取。包括:实体标注、词性标注、句法标注、分类标注、情感标注、篇章关系标注等。
本文研究并通过实施例详细说明了一种语料标注方法和系统,即根据预设的算法模型对待标注语料集中的语料进行标注,基于标注结果生成对应的训练集,通过训练集更新算法模型,用于下一次语料标注。通过本文实施例的实施,以每一次标注后的结果来更新算法模型,从而大大减少了人工标注的工作量,同时提升了标注的一致性和准确性。……
登录APP查看全文
