基于场景图知识融入与元学习的视觉语言导航
2021-08-31胡成纬江爱文王明文
山西大学学报(自然科学版) 2021年3期
胡成纬,江爱文,王明文
(江西师范大学 计算机信息工程学院,江西 南昌 330027)
0 引言
视觉语言导航是近年来人工智能领域比较热门的研究课题。其主要任务是随机定义导航机器人所处位置,然后机器人根据用户指令,根据对所处环境的分析,自主寻找路径并完成目标搜索。例如,考虑室内场景(如厨房、客厅等)S={S1,S2,…,Sn}和 目 标 对 象 类O={o1,o2,…,ok}。目标类以简单语言的形式(如“肥皂”“电视”等)表示。在每一次探索任务中,为导航机器人在场景中随机生成某一起始位置p,同时将场景中随机采样得到的目标对象呈现给机器人。在探索过程中的每个时间点t,机器人都会获得当前状态,即机器人的第一视角RGB 图像xt,并且要从动作集A中根据策略π采样一个动作at,直到一次探索过程结束。由于任务涉及对视觉图像和自然语言的综合理解,并进行路径优化,因此,任务对算法的智能要求比较高,挑战性非常大,受到计算机视觉和自然语言处理领域的研究者的广泛关注。
目前主流使用监督学习或强化学习(RL)的方式来解决大多数的视觉导航问题。在探索环境时,以机器人第一视角观察到的信息作为输入,得到一系列的动作输出。然而,强化学习模型需要经历多次试错才能收敛。这使得在真实世界很难满足实验条件。AI2-THOR[1]框架提供了较为逼真的仿真环境。当机器人在此环境中执行导航任务时,每一步都可以观察到行动后所导致的变化,为智能机器人提供了与真实世界高度仿真的试验条件。……
登录APP查看全文