基于word2vec与LDA主题模型的技术相似性可视化研究
2021-10-11席笑文宋欣娜
情报学报 2021年9期
席笑文,郭 颖,宋欣娜,王 瑾
(1.中国科学院档案馆,北京 100190;2.中国政法大学商学院,北京 100088;3.北京理工大学管理与经济学院,北京 100081)
1 引 言
社会经济的快速发展和需求的快速更迭,迫使研发主体需要不断提高技术创新性与复杂性,以适应瞬息万变的现代经济。这就要求研发主体不断地进行创新活动,来保持自身的先进性,以在激烈的市场竞争中把握先机、抢占技术制高点。而技术相似性是研发主体进行识别潜在竞争与合作伙伴、技术转移、协同创新、并购等创新活动的重要依据[1],同时,也是企业、组织或国家进行技术情报分析的重要内容。由此可见,如何科学、准确地测度技术相似性成为值得考虑的问题。
传统的技术相似性测度方法主要依赖于专利分类体系,然而,分类体系存在着两个明显的问题:一是无法直观地反映专利的技术特征;二是不同类和子类可能出现重要的重叠,从而出现技术相似程度高的专利却属于不同分类的情况。随后,学者们开始尝试从专利引用关系角度进行分析,主要包括专利耦合、专利互引分析等,由于该方法存在专利引文施引动机的不明确性以及专利引用的滞后性等问题,使得技术相似性测度结果的准确性受到质疑。为了解决上述问题,基于文本挖掘的技术相似性测度方法开始受到研究者的广泛关注。该类方法通常采用one-hot向量或者词袋模型表示专利权人的技术主题,一方面,仅考虑词的共现关系,未考虑词间的语义关联性,无法细粒度地表示专利权人的技术主题;……
登录APP查看全文
