基于IFC标准的BIM自适应分词方法
2021-05-13周小平
张 鑫,周小平,2,王 佳,2
基于IFC标准的BIM自适应分词方法
张 鑫1,周小平1,2,王 佳1,2
(1. 北京建筑大学电气与信息工程学院,北京 100044; 2. 建筑大数据智能处理方法研究北京市重点实验室,北京 102616)
建筑信息模型(BIM)已经成为建筑行业信息技术应用的有效方案。随着BIM数据不断增长,为了高效使用BIM数据,很多研究将自然语言处理(NLP)引入BIM应用中。在中文环境中,由于缺乏建筑行业的术语特征,导致基础环节的中文分词在建筑领域BIM应用中的适应性较差。通过分析当前流行的BIM数据格式工业基础类(industry foundation class, IFC)文件,从中提取BIM模型特征,配合建筑领域术语特征加入分词模型中,以提高中文分词在建筑领域的性能。实验结果表明,与原始条件随机场(CRF)分词模型相比,在建筑领域测试集上,分词模型的F-measure提高了1.26%,其中,在仅加入BIM模型特征时,F-measure提升了0.10%,说明在分词模型中加入BIM模型特征对于提高中文分词在建筑领域的性能是有效的。同时,在BIM模型测试集上,相较于仅加入建筑领域术语特征,在加入BIM模型特征后,准确率从46.97%提升至87.74%,召回率从67.60%提升至94.77%,F-measure从55.43%提升至91.12%,提升了35.69%,有效提高了中文分词在建筑领域的BIM模型自适应性。
建筑信息模型;工业基础类;中文分词;模型自适应;建筑信息提取
建筑信息模型(building information model,BIM)是记录建筑设施物理特性与功能特性的数字信息模型[1]。BIM包含了建筑全生命周期中各阶段的详细信息,实现了其数据的互操作性,促进了建筑工程项目各参与方的有效协同[2]。目前,BIM已成为建筑工程行业(architecture,engineering and construction,AEC)工程信息化的有效解决方案和重要趋势[3],并在AEC内得到了广泛地研究和应用[4]。……
