视频图像中文本检测和提取技术研究
2016-10-21姜啸
科学与财富 2016年9期
姜啸
摘要:近年来,随着宽带网络技术、新型多媒体技术和信息通信技术的飞快发展,我们步入了一个崭新的互联网时代。面对日益增长的视频和图像资源数据,如何有效快速的在海量的数据中检索和访问到我们所需要的信息变得十分有意义。视频资源中包含丰富的语义信息和视频关键内容,为此,对视频图像中文本检测和提取成为本文研究主题。
关键词:数学形态学;文本定位;自适应阈值分割;字符识别;模板匹配
一. 引言
近些年来,科学技术的更新速度不断加快,科学方法日益创新。与此同时,多媒体数据库和多媒体信息检索的发展使得视频、音频和图像在我们的生活中扮演着越来越重要的角色。面对海量的视频和图像资源,有效快速的在海量的数据中检索和访问[1]到我们所需要的信息变得十分有意义。正在此背景下,解决上述问题产生的视频图像文本检测成为热点,因此本文开始对此展开研究。
二. 视频图像中文本分类
视频图像中的文本根据是否进行过后期制作所嵌入的文本或者根据图像的层次和维数可将其分为场景文本和人工文本(也称叠加文本或图形文本)两大类。
场景文本是被摄影机或摄像机随当时场景捕获到的文本,场景文本存在于场景中,是场景的一部分。如汽车车牌、交通路标、商店名称、街道指示牌等等。
人工文本是在后期制作嵌入的文本图形,在编辑阶段被整合到视频图像中。这类文本主要有新闻视频中标题纲要和时间,影视作品中的人物对白字幕、旁白字幕、片头和片尾;……
登录APP查看全文
