基于LDA的科技创新主题语义识别研究

Publisher: 国家哲学社会科学学术期刊数据库

E-ISSN: 0252-3116|volume|14|126-134

ISSN: 0252-3116

Source: 图书情报工作, Vol.volume, Iss.14, 2015-01, pp. : 126-134

Disclaimer: Any content in publications that violate the sovereignty, the constitution or regulations of the PRC is not accepted or approved by CNPIEC.

Previous Menu Next

Abstract

[目的/意义]由于传统科技创新主题概率识别方法忽略文本内容语义理解,为了更加准确地识别出主题,科技创新主题语义识别势在必行。[方法/过程]提出一种基于LDA的科技创新主题语义识别方法。利用语义角色标注技术对科技文献中的科技创新内容进行语义标引,构建LDA主题语义识别模型,根据表征科技创新内容的关键词语义角色对应的上位词的概率识别出科技创新主题。[结果/结论]通过以3D打印领域数据为对象进行实验,证明该方法能够更加准确地识别出科技创新主题,形成科技创新主题一主题词一科技文献的混合分布聚类集群,减少研究背景等无关数据干扰,避免语义含义相同的科技创新主题词重复统计问题。