机器学习中的特征工程方法
2020-10-21唐运军孙舒畅
唐运军 孙舒畅



摘 要:随着互联网的快速发展,机器学习技术得到了广泛的应用。面对海量的数据,特征工程就显得至关重要,可以说特征工程决定了机器学习模型的上线。文章介绍了对数值、文本、类别时间等不同类型数据的处理方法,总结了在面对高维数据时的特征选择方法并进行了比较,对机器学习的研究和工程应用具有指导意义。
关键词:机器学习;特征工程;特征选择
Abstract: With the rapid development of the Internet, machine learning technology has been widely used. In the face of massive data, feature engineering is very important. It can be said that feature engineering determines the on-line application of machine learning model. This paper introduces the processing methods for different types of data, such as numerical value, text, time of category, etc., and summarizes and compares the feature selection methods in the face of high-dimensional data, which has guiding significance for the research and engineering application of machine learning.
Keywords: Machine learning; Feature engineering; Feature selection
前言
在机器学习中使用数学模型来拟合数据并预测结果,而特征就是模型的输入。特征就是原始数据某个方面的数值表示。特征工程是指从原始数据中提取特征并将其转换为适合机器学习模型的格式。它是机器学习流程中一个极其关键的环节,因为正确的特征可以减轻构建模型的难度,从而使机器学习流程输出更高质量的结果。机器学习从业者有一个共识,那就是建立机器学习流程的绝大部分时间都耗费在特征工程和数据清洗上。
然而,尽管特征工程非常重要,专门讨论这个话题的著作却很少。张浩采用基于AdaBoost 算法的特征线性组合算法和基于提升树的非特征线性组合算法来实现结构化数据特征的自动生成,并采用基于高斯过程的贝叶斯优化方法来自动调整数据挖掘算法模型的参数[1]。白肇强以电商平台的用户行为数据作为切入点,介绍了特征工程的相关知识与概念,并在进行特征工程与实验验证的过程中提出了多项新的工程实现方案[2]。……
