综合数据特征与服务关联的机器学习流程生成*
2021-01-19赵汝涛
赵汝涛 王 菁
(北方工业大学大规模流数据集成与分析技术北京市重点实验室 北京 100144)
1 引言
生活中很多领域需要用到数据分析,但是根据不同的数据集选择合适的模型并训练、优化参数是一件专业、复杂且耗时的事情,且进行数据分析对业务人员的专业水平和经验都要求非常高,如何根据数据集自动生成机器学习流程(pipeline)是一个难点问题。针对此问题,研究学者开展了AutoML(Automated Machine Learning)研究。AutoML旨在以数据驱动,客观和自动化的方式做出这些决策:用户只需提供数据,而AutoML系统会自动确定最适合该特定应用程序的方法[1]。
因为在实践中探索原始元素和超参数值的整个空间是不可行的,所以这些系统使用复杂的搜索策略来修剪空间并减少需要评估的pipeline数量[2]。AutoML的主要实现方法有:网格搜索方法、随机搜索方法、贝叶斯方法、启发式方法、基于语法的方法等。在当前AutoML工具当中,AutoWeka[3]使用贝叶斯优化,Auto-sklearn[4]使用元学习,TPOT[5]使用遗传编程,而AlphaD3M[6]使用强化学习。据本文了解,到目前为止这些AutoML中大部分都存在耗时长或者性能低的情况,且并没有考虑将pipeline中primitive之间关联关系进行利用。
本文从primitive服务关联角度入手,定义了primitive服务关联模型及挖掘算法,从历史pipeline当中挖掘出primitive间的关联关系,设计了结合服务关联与数据特征的机器学习流程生成方法,可以在产生pipeline的性能和耗时维持在较好水平的同时,使产出pipeline的性能整体提升。
2 综合数据特征与服务关联的机器学习流程生成方法
2.1 整体流程
本文综合数据特征与服务关联的机器学习流程生成方法原理如图1所示,主要分为这几个模块:LSTM预训练模块、GAME生成器模块、LSTM生成器模块和Coach模块。……
