基于Image_Caption的车厢场景自适应描述
2021-09-10刘铮周述正赵祎婷卢铭娜
交通科技与管理 2021年16期
关键词:人工智能
刘铮 周述正 赵祎婷 卢铭娜







摘 要:图像自适应描述(Image_Captioning),是指以图像为输入,通过模型和计算来输出对应图像的自然语言描述。这一领域是结合了人工智能两大方向:计算机视觉和自然语言处理。将图像自适应描述算法应用于地铁车厢内部情况检测,有利于车站管理人员迅速全面掌控车厢内部情况,快速应对车厢内部突发情况。有利于提示车厢内部乘客互相照顾,提高车厢内部优质资源分配合理性(如残疾人以及孕妇让座)。
关键词:图像自适应描述;人工智能;车厢
1 图像自适应描述算法
Image Caption(图片描述)模型中,以图片数据作为输入,经过CNN进行卷积提取图片特征信息最终形成图片的特征图信息,而后attention模块对提取的特征图进行加强与抑制,作为后续进入LSTM模型的输入数据,不同时刻的attention数据会受到上一时刻LSTM模型输出数据而有所调整,LSTM模型最终输出文本信息。
2 模型细节
2.1 encoder模块
Image Caption(图片描述)模型的最终输出为一个长度为C的句子,其中yi指句子中的第i个词,这个词属于一个k维实数的词向量,其中K是字典长度。在encoder阶段,文中使用的是CNN(卷积神经网络),用于提取特征图向量集合,这些特征图向量后续会被作为注释向量。
通过CNN会提取L个特征图向量,命名为a,每一个都是D维向量用来代表图片的一部分。同时为了保留特征图与2维图片的关系,本文中的特征来自于较浅的卷积层,由此保证后续的decoder阶段,能够通过选取所有特征图的子集而选择性聚焦到图片的部分位置。……
登录APP查看全文
