APP下载

适用于PDF文本内容的高效模式匹配算法*

2018-03-21朱玲玉王旌舟陈庆春

通信技术 2018年3期
关键词:文本内容

朱玲玉,王旌舟,陈庆春

0 引 言

模式匹配在网络入侵检测、生物序列数据库比对(DNA)、信息检索、生物计量学等领域得到了广泛应用。模式匹配按同时匹配模式串的个数,分为单模式匹配和多模式匹配,其中KMP[1]、BM[2]为经典单模式匹配,AC[3]、WM[4]算法为经典多模式匹配。每种模式匹配算法都有其最优、最坏匹配复杂度,针对不同模式串的类型,其算法各有优点。

随着信息时代和大数据时代的快速发展,网络安全监管快速兴起,网络空间安全成为了热点。PDF是Portable Document Format(便携文件格式)的缩写,是全世界电子版文档分发的公开实用标准。作为一种通用文件格式,PDF能够保存任何源文档的所有字体、格式、颜色和图形,而不关心创建该文档使用的应用程序和平台。网络中越来越多的文件开始倾向于采用PDF这一主流的文本保存格式。随着PDF文档的广泛使用,PDF文件内容的保密性和安全性问题日益凸显。本文结合PDF文件格式及其编码规则,分析研究BM、QS[5]算法,并分析了一类适用于PDF文件的高效匹配算法,以支持涉密PDF文件内容的高效管控应用。

1 PDF文件格式及编码规则

PDF文档是8 bit字节序,以二进制流保存。深入理解PDF文件的格式,需从其对象、文件结构(逻辑结构)、文档结构(物理结构)、内容流和编码4方面理解[6]。

PDF文件实质由一系列对象构成,这些对象分别有8种基本数据类型,即逻辑对象、名字对象、字典对象、字符串对象、流对象、数组对象、数值对象和空对象。这些基本数据类型的对象是直接对象,可被标识,以便作为间接对象被其他对象引用。……

登录APP查看全文

猜你喜欢

文本内容
内容回顾温故知新
内容回顾 温故知新
内容回顾温故知新
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
主要内容
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
如何快速走进文本