基于词共现模型与DOM的石油主题采集策略  

A Petroleum Subject Collection Strategy Based on the Word co-occurrence Model and the DOM

在线阅读下载全文

作  者:李村合[1] 李晗[1] 

机构地区:[1]中国石油大学(华东)计算机与通信工程学院,东营257061

出  处:《微计算机应用》2008年第2期28-31,共4页Microcomputer Applications

摘  要:提出了一种基于DOM树的词共现模型,首先利用文档的结构信息生成DOM树,并依据DOM树的结构特点来统计文档中主题词的共现信息,最后采用向量空间模型实现对石油主题网页的采集和分类。它改进了原有的词共现模型,突出了利用位置信息来优化词共现模型的特点。实验证明该策略使采集和分类的性能都有了一定的提高。This paper proposes a word co - occurrence model which bases on the DOM tree. At first , the model uses the structure information of the document to build a DOM tree, and then counts the co - occurrence information in the documents bases on the structure of the DOM tree ,finally implements collection and categorization for the petroleum subject. It improves the original word co - occur- rence model and highlighted the character of positional information to optimize the word co - occurrence model. The experiment proves this strategy caused a certain enhancement for collection and categorization.

关 键 词:词共现模型 DOM树 文本分类 主题采集 向量空间模型 

分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象