APP下载

机器学习需要更好的数据标注

2021-02-11崔滔

计算机与网络 2021年24期
关键词:高质量模型

崔滔

人们意识到AI非常强大,但为了实现它,必须获得大量的训练数据。有人在苹果花了数亿美元收集标签数据,但依然没有好的结果。

看到这一需求,许多专业标注公司诞生了。例如Datasaur,这是一个自动化数据标注的软件。当然,数据标注首先需要以人工的方式开始,特别是在人工智能项目的开始阶段,到了项目的中期或末期,机器学习本身可以用于自动标记数据,也可以生成合成数据。

Datasaur软件的主要目标是简化人工数据标注的操作,并引导他们以最低的成本创建更高质量的训练数据。由于它的目标是那些需要整天标记数据的高级用户,因此创建了功能键来加速标注过程,以及适合专用数据标注系统的其他功能。

不过在这个过程中,Datasaur也有了其他几个目标,包括消除偏见。还提供了项目管理能力,以清楚地阐明标签指南,确保随着时间的推移,标签标准继续得到保持。

数据标注的主观性是使这门学科充满陷阱的原因之一。

例如,想出一种方法,自动给文章贴上适合或不适合家庭的标签。通常可以参考电影分级制度,类似PG、PG13、R级。你可能认为这是一个非常简单的任务,而事实证明,科技公司认为合适的做法与电影行业认为合适的做法有很大不同。还有很多灰色地带的实例,对于什么是合适的,什么是不合适的,都会有非常不同的观点。

解决这类问题没有捷径可走。但是,有一些方法可以帮助公司将这些业务流程自动化,包括提供一个用于回答这些数据标注问题的决策谱系,这就是创建Datasaur软件的原因。……

登录APP查看全文

猜你喜欢

高质量模型
一半模型
坚持以高质量发展统揽全局
国有企业如何以高质量党建引领高质量发展
高质量项目 高质量发展
牢牢把握高质量发展这个根本要求
重尾非线性自回归模型自加权M-估计的渐近分布
以高质量党建引领企业高质量发展
“三部曲”促数学复习课高质量互动
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究