一种基于多视图学习的科学主题提取方法

文档序号:6511385阅读:187来源:国知局
一种基于多视图学习的科学主题提取方法
【专利摘要】基于多视图学习的科学主题提取方法,从论文数据库中获取论文数据,作为即将进行科学主题提取的目标文档;针对每个目标文档,提取该文档中的多个视图的数据信息,作为科学主题提取的依据;对每个视图的数据信息进行简单的数据预处理并针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量;利用多视图学习的方法,对目标文档进行聚类,属于同一类的目标文档对应相同的科学主题;对于每一类目标文档,分别提取它们的科学主题,并以多个关键词的形式表示出来。本方法的优点在于,弥补了传统方法只考虑单一方面数据信息的不足,更好的利用多方面的数据信息,借助它们的互补关系和潜在主题的一致性辅助聚类,得到更好的科学主题提取效果。
【专利说明】—种基于多视图学习的科学主题提取方法
【技术领域】
[0001]本发明涉及文本聚类和科学主题提取等【技术领域】,特别是基于多视图学习的文本聚类方法和主题提取工作。
【背景技术】
[0002]每一篇文章都有自己特定的主题,学术论文更是如此,所有学者和研究人员在进行科学研究和撰写论文之前,都需要对现有的科学主题进行调研,而普通读者在查找资料的时候,也希望首先知道文章的主题。经验丰富的研究人员对自己所在领域的科学主题往往都有很清楚的认识,他们能够很好的发现与自己研究领域相关的论文,理清论文之间的关系,预测某些科学主题的流行程度和发展趋势,而且这些信息对于学者的研究工作以至整个研究领域的发展都起着至关重要的作用。随着互联网的高速发展,信息开始爆棚,凭借经验进行简单的人为处理和分析已经不能解决大数据时代带来的挑战。为了方便普通读者能够更加容易的了解新兴的研究领域,帮助经验不足的研究人员快速掌握各个研究领域的研究成果和代表人物,科学主题的提取工作显得尤为重要。
[0003]现有的科学主题提取工作基本上只考虑到论文数据中的单方面数据信息,而忽略了其他可以利用的潜在数据。学术论文主要包括正文,标题,摘要,关键字,共同作者以及参考文献等内容,传统的科学主题提取工作主要依据正文或者摘要等单一方面信息进行处理,很少考虑到多方面数据信息的相互影响和内在联系。因此我们提出了一种基于多视图学习的科学主题提取方法,弥补了传统方法的不足,更好的利用多方面的数据信息,借助它们的互补关系和潜在主题的一致性辅助聚类,得到更好的主题提取效果。

【发明内容】

[0004]为了克服现有的科学主题提取方法只考虑到论文数据中的单方面数据信息,而忽略了其他可以利用的潜在数据的缺点,本发明提出了一种基于多视图学习的科学主题提取方法,以方便普通读者能够更加容易的了解新兴的研究领域,帮助经验不足的研究人员快速掌握各个研究领域的研究成果和代表人物。
[0005]本发明所述的一种基于多视图学习的科学主题提取方法:
[0006]1、该方法包括以下步骤:
[0007]I)从论文数据库中获取论文数据,作为即将进行科学主题提取的目标文档;
[0008]2)针对每个目标文档,提取该文档中的多个视图的数据信息,作为科学主题提取的依据;
[0009]3)根据不同视图数据信息的内容特点不同,对每个视图的数据信息进行简单的数据预处理;
[0010]4)针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量;
[0011]5)利用多视图学习的方法,借助多个视图的数据信息,对目标文档进行聚类,属于同一类的目标文档对应相同的科学主题;
[0012]6)对于每一类目标文档,分别提取它们的科学主题,科学主题以多个关键词的形式表不。
[0013]2、步骤2)中所述的多个视图的数据信息,其特征在于:
[0014]I)根据应用的实际需求和目标文档所包含数据信息的实际情况,选取t个不同视图的数据信息,论文数据主要包括文章的正文,标题,摘要,关键字,共同作者以及参考文献等多方面的数据信息,当选取其中的四种:标题,摘要,关键字,共同作者这四个视图的数据Ih 息时,t = 4。
[0015]3、步骤3)中所述的根据不同视图数据信息的内容特点不同,对每个视图的数据信息进行简单的数据预处理,其特征在于:
[0016]I)对于论文数据的正文、标题、摘要,去掉所有停止词(a,the, or等使用频率很多但没有特定意义或明显区分价值的字或词,常为冠词、介词、副词或连词等),将单词词干化,即去掉ed,ing等分词形式或ment等词缀,只保留词干形式;
[0017]2)对于论文数据的关键字、共同作者和参考文献不需要进行上述操作。
[0018]4、步骤4)中所述的针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量,其特征在于:
[0019]I)共同作者视图、关键字视图和参考文献视图处理方式相同,以共同作者视图为例,遍历所有目标文档的作者部分,统计所有不同的作者姓名,将每一个目标文档的共同作
者视图用向量的形式表示,定义向量
【权利要求】
1.一种基于多视图学习的科学主题提取方法,该方法的特征在于: 1)从论文数据库中获取论文数据,作为即将进行科学主题提取的目标文档; 2)针对每个目标文档,提取该文档中的多个视图的数据信息,作为科学主题提取的依据; 3)根据不同视图数据信息的内容特点不同,对每个视图的数据信息进行简单的数据预处理; 4)针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量; 5)利用多视图学习的方法,借助多个视图的数据信息,对目标文档进行聚类,属于同一类的目标文档对应相同的科学主题; 6)对于每一类目标文档,分别提取它们的科学主题,科学主题以多个关键词的形式表/Jn ο
2.如权利要求1所述的基于多视图学习的科学主题提取方法,步骤2)中所述的多个视图的数据信息,其特征在于: I)根据应用的实际需求和目标文档所包含数据信息的实际情况,选取t个不同视图的数据信息,论文数据主要包括文章的正文,标题,摘要,关键字,共同作者以及参考文献等多方面的数据信息,当选取其中的四种:标题,摘要,关键字,共同作者这四个视图的数据信息时,t = 4。
3.如权利要求2所述的 基 于多视图学习的科学主题提取方法,步骤3)中所述的根据不同视图数据信息的内容特点不同,对每个视图的数据信息进行简单的数据预处理,其特征在于: 1)对于论文数据的正文、标题、摘要,去掉所有停止词(a,the,or等使用频率很多但没有特定意义或明显区分价值的字或词,常为冠词、介词、副词或连词等),将单词词干化,即去掉ed, ing等分词形式或ment等词缀,只保留词干形式; 2)对于论文数据的关键字、共同作者和参考文献不需要进行上述操作。
4.如权利要求3所述的基于多视图学习的科学主题提取方法,步骤4)中所述的针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量,其特征在于: 1)共同作者视图、关键字视图和参考文献视图处理方式相同,以共同作者视图为例,遍历所有目标文档的作者部分,统计所有不同的作者姓名,将每一个目标文档的共同作者视图用向量的形式表不,定义向
5.如权利要求4所述的基于多视图学习的科学主题提取方法,步骤5)中所述的利用多视图学习的方法,借助多个视图的数据信息,对目标文档进行聚类,属于同一类的目标文档对应相同的科学主题,其特征在于: 1)假定我们有t个不同的视图,用W(1),W(2),……Ww表示,定义下述公式
6.如权利要求5所述的基于多视图学习的科学主题提取方法,步骤6)中所述的对于每一类目标文档,分别提取它们的科学主题,科学主题以多个关键词的形式表示,其特征在于: 1)对于每一类目标文档,选取该类文档的某一个视图或多个视图,分别统计所有该类文档在该视图中不重复的单词,作为科学主题关键词的备选词库,如果选取的是参考文献视图,则以某一篇被引用的论文作为关键词,而不是一个简单的词,如果选取的是共同作者视图则以作者姓名作为关键词; 2)对备选词库中的关键词进行排序,如果选取的论文的正文、摘要、标题视图,则按照TF-1DF值进行降序排序,如果选取的是论文的共同作者、参考文献视图则按照出现次数进行降序排序,其中TF-1DF值的计算方法与权利要求4中步骤2)所说明的方法相同; 3)在备选词库中针对不同视图,分别选取前N个关键词(根据实际情况人为设定)来代表这一类论文所属的科学主题,因此描述一类科学主题的关键词可以是一些具有代表性的 领域名词、比较有影响力的论文作者,也可以一些经典的引用率较高的核心论文。
【文档编号】G06F17/30GK103530316SQ201310416384
【公开日】2014年1月22日 申请日期:2013年9月12日 优先权日:2013年9月12日
【发明者】王灿, 王哲, 卜佳俊, 陈纯, 于智 申请人:浙江大学
网友询问留言 已有0条留言
  • 还没有人留言评论。精彩留言会获得点赞!
1