APP下载

融合多源信息的平行语料库相似句段去重算法

2021-11-17左世亮刘稳良

计算机仿真 2021年8期
关键词:单词方法

左世亮,刘稳良

(上海应用技术大学,上海201418)

1 引言

我国和沿线国家之间的交流愈发紧密,各类深度合作项目日益增多,这对语言服务企业与人才能力都设定了更高的标准要求[1-2]。语言服务企业为支撑翻译生产,创建了一系列平行语料库,为多元化语言服务需求提供充足便利。但在多源信息发展的今天,随着语料数量持续增长,出现越来越多的相似语句,为翻译工作带来诸多困扰[3],由此要对相似句段进行去重,保障语言服务效率与水平。

关于文本去重问题,陈平华[4]等提出一种采用签名与哈希技术的云存储去重方案,在数据去重过程中运用双层校验机制审计数据完整性,校验文件完整性并精确定位损坏数据块;构造Merkle哈希树生成校验值,计算去重标签,确保检测到重复数据。但该方法局限性高,不易广泛推广。邓玉辉[5]等提出一种基于混合页面的磁盘缓存去重策略。在磁盘缓存中引入混合页机制,保留基页增加巨页,自适应调整巨页大小让命中率最大化;监测基页、巨页冷热程度,将重复率高的冷巨页拆分为基页,实现基页、巨页动态转换;利用重删技术对基页、巨页依次实施去重,在命中率最大化同时保持去重率,但方法去重速率缓慢。

综合以上内容,本文创建一种基于词频-逆向文件频率(term frequency-inverse document frequency,TF-IDF)的平行语料库相似句段去重算法。对齐平行语料库互为对应关联的句子,推导句段相似程度,加强后续去除速度,融合TF-IDF技术与单词主题相关性,计算关键词权重,删除高权重句段,达到平行语料库句段去重目的。……

登录APP查看全文

猜你喜欢

单词方法
Exercise 1
学习方法
看图填单词
看完这些单词的翻译,整个人都不好了
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
单词拾趣