数据降维及聚类算法在烟叶相似性分析中的应用
2021-04-07翟擎辰周园春宋秋成王建伟孟珍张艳玲
数据与计算发展前沿 2021年2期
关键词:特征
翟擎辰,周园春,宋秋成,王建伟,孟珍*,张艳玲*
1.中国科学院计算机网络信息中心,北京 100190
2.中国烟草总公司郑州烟草研究院,河南 郑州 450001
3.中国科学院大学,北京 100049
引 言
数据与计算技术飞速发展,不仅在科学研究中起到辅助与支撑的作用,而且可以依靠其自身的逻辑方法,驱动甚至引领科学研究活动[1]。烟草行业内的工业需求的快速扩张,对传统的烟叶质量的认知模式也带来了很大的挑战。仅依靠经验主观判断的方法如人工抽吸法与化学分析法,来完成对烟叶质量的判别与评价已经无法满足产品质量稳定性的需求。机器学习时代的来临实现了很多技术上的应用[2]。通过对以往历史数据的挖掘模拟,建立智能替代模型和交互分析应用,采用客观数据作为辅助来配方评价和烟叶替代,对提高卷烟质量稳定性有重要意义。因此机器学习方法成为挖掘烟叶原料内在特征、发现烟叶产地外在关联、寻找烟叶分类特点的一种重要的科学手段。这也是目前辅助技术人员快速寻找缺失原料替代产地的一种重要方法[3]。
标准化的数据集是人工智能算法开展大规模训练和提升准确率的重要要素[4]。烟叶质量数据中包括物理属性、化学属性、感官质量、叶身外观等多种指标[5],有的数据源可以到达几十维甚至上百维。这种情况下,属性指标的选择和降维以及距离度量的构建就成了影响相似性度量和烟叶分类结果的关键[6]。仅仅依靠人工经验筛选输入指标,结果会丧失客观性且不能体现数据之间的关联性;……
登录APP查看全文
