基于深度学习的甲骨文分类算法研究
2021-11-01涂淳宁王贵田吉李汇嘉李婷
现代计算机 2021年26期
关键词:模型
涂淳宁,王贵,田吉,李汇嘉,李婷
(浙江大学城市学院计算机与计算科学学院,杭州 310015)
0 引言
甲骨文是现在已知的中国最古老文字,在中国文字不断演变的历史上有着极其重要的地位。但是经过长时间的研究,直到现在只有2000多个甲骨文字符被识别,仍有超过3000个字符未被识别。得益于深度学习在特征学习方面有着极强的能力,在图像分类、语言模型等人工智能应用上取得了很好的成果[1]。针对人工识别效率低下这一问题,本文结合基于深度学习的图像分类模型及语料分析模型,提出了甲骨文未识别字符词性及相关特征的预测模型。研究的成果可望推广到其他带有图像表征的类似古文字预测中。
本次的研究选择图像处理库PIL对收集到的甲骨文字符图像做滤波处理以增强图像可读性。甲骨文的文字特征有着一字多形、异字同形、有两个或多个字刻在一起的合写特点[2],因此选择TensorFlow上的迁移学习模型使用图像特征提取模块的InceptionV3架构将甲骨文字符按造字方式分类以及是否合写进行分类预测。此外,选择CBOW模型对语料分析,在得到特征词预测的基础上计算余弦距离得到与特征词相似度高的词。图像与语料两种预测方式相结合,为未来对各类型古文字未识别字符的预测奠定了良好的基础。
1 相关模型及方法
1.1 图像滤波
图像滤波即在保留图像特征的前提下为简化图像数据,提高图像可读性而对图像进行处理。图像信号在采集、传输和保存等阶段会受到不同因素的干扰而遭受不同类型的噪声污染,噪声污染会严重影响图像特征提取等系列后续处理过程[3]。……
登录APP查看全文
