科技期刊文本与数据挖掘人工智能应用的研究进展
2023-02-12王利鹏郑春雨
中国科技期刊研究 2023年8期
■庞 丽 王利鹏 郑春雨 陈 婕*
1)中国医科大学附属盛京医院妇产科,辽宁省沈阳市铁西区滑翔路39号 110022
2)中国医科大学期刊中心,辽宁省沈阳市沈北新区蒲河路77号 110122
根据Web of Science数据库统计,2018年全球发表学术论文总量大约为261.75万篇,中国已超过美国成为全球最大的科研论文生产国,2022年我国期刊总数为10185种,其中科技期刊有5071种[1],年发文量为100多万篇。伴随着国内“数据汇交”政策与国际“非商业目的的文本与数据挖掘著作权费用全免”政策的深入,大量“开放为常态,不开放为例外”的科学数据和科研成果成为公共资源,可供挖掘的数据规模巨大,研究基础雄厚,这将促进科学突飞猛进。然而,如何有效利用智能化手段进行文本与数据挖掘,摈弃冗余无效数据,从而指导学科发展,是摆在每位期刊人面前的一项课题。“文本与数据挖掘”(Text and Data Mining)是一项交叉技术,与图书情报学、信息学、术语学、机器学习、自然语言处理、模式识别、神经网络计算、数理统计等学科领域融合。近年来,随着人工智能技术的不断突破,文本与数据挖掘进展迅速。精准、全面、有效地利用文本与数据挖掘有效评估稿件、筛选主题、回避学术不端、预测学科发展、捕捉创新点、辅助高水平办刊及拓展应用是目前科技期刊关注的重点。国内该领域研究不多,既往研究对关键词抽提、挖掘逻辑、选题策划、创新性评估等进行探索,但尚未见对标准化智能体系的报道。边钊等[2]以遥感领域为例,分析关键词规范化对主题信息挖掘结果的影响,发现须进一步对关键词按照一定规则规范化以重塑聚类,方可得到优化结果,但其仅对遥感领域关键词数据进行抽提而非整篇科技文献的元数据。……
登录APP查看全文
