什么是数据增强
2021-02-11孟文出
计算机与网络 2021年24期
孟文出
如果有足够的训练数据,机器学习模型可以表现出色。不幸的是,对于许多应用程序来说,对高质量数据的访问仍然是一个障碍。解决这个问题的一个方法是“数据增强”,这是一种从现有的训练样本中生成新训练样本的技术。数据增强是一种在数据约束环境下提高机器学习模型性能和准确性的低成本和有效的方法。
机器学习模型的“过度拟合”
当机器学习模型在有限的例子上进行训练时,它们往往会“过度拟合”。当机器学习模型对其训练示例执行准确,但不能推广到未见数据时,就会发生“过度拟合”。
在机器学习中有几种方法可以避免“过度拟合”,比如选择不同的算法、修改模型的结构和调整参数。但最终,解决“过度拟合”的主要方法是向训练数据集添加更多高质量数据。
例如,考虑卷积神经网络(CNN),这是一种机器学习架构,特别适合于图像分类任务。但如果没有大量多样的训练例子,CNN最终会在现实世界中对图像进行错误分类。另一方面,如果CNN接受不同角度和不同光照条件下的物体图像训练,它在现实世界中识别物体的能力会变得更加强大。
然而,收集额外的培训示例可能是昂贵且耗时的,有时甚至是不可能的。这一挑战在监督学习应用程序中变得更加困难,因为训练示例必须由人类专家标记。
数据增加
增加训练数据集多样性的方法之一是创建现有数据的副本,并对其进行小的修改。这被称为“数据增强”。例如,假设在图像分类数据集中有20张鸭子的图像。……
登录APP查看全文
