基于Heritrix和HTMLParser的网页商品信息提取的研究  

在线阅读下载全文

作  者:刘文浩[1] 谢韬[1] 吴进[1] 

机构地区:[1]四川大学软件学院,成都610225

出  处:《计算机光盘软件与应用》2012年第8期190-191,共2页Computer CD Software and Application

摘  要:主要介绍Heritrix网络爬虫,分析了其系统结构。通过扩展Heritrix,使其能抓取太平洋电脑网站上的商品信息。在此基础上,利用ELFHash对效率抓取进行优化。最后,利用HTMLParser提取收集到的网页商品信息,为建立垂直搜索引擎提供信息源。

关 键 词:HERITRIX HTMLPARSER 网络爬虫 信息提取 垂直搜索 

分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象