基于遗传算法的聚焦爬虫搜索策略  被引量:5

Search Strategy of Focused Crawler Based on Genetic Algorithm

在线阅读下载全文

作  者:曾广朴[1] 范会联[1] 

机构地区:[1]长江师范学院数学与计算机学院

出  处:《计算机工程》2010年第11期167-169,共3页Computer Engineering

基  金:重庆市教委科学技术研究基金资助项目"网络聚焦爬虫研究与设计"(KJ091309)

摘  要:为了提高聚焦爬虫的搜索效率,提出一种结合内容评价和链接结构搜索策略的优点并利用小生境遗传算法进行全局寻优的搜索策略。改进遗传算子和小生境遗传算法,将待搜索的网页URL作为遗传个体,采用概率变迁规则和小生境淘汰运算引导搜索方向。实验结果证明,与聚焦爬虫的其他实现技术相比,该策略在抓取主题相关网页时具有更高的查准率和查全率。In order to improve the search efficiency of focused crawler, based on Niche Genetic Algorithm(NGA), this paper proposes a global optimization of search strategy which combines the advantages of content evaluation and link structure. URL search direction is guided by improving the genetic operators and NGA. Compared with other algorithms, experimental results indicate that this strategy has higher precision and recall in searching the topic pages.

关 键 词:聚焦爬虫 遗传算法 小生境 主题相关度 

分 类 号:TP311.13[自动化与计算机技术—计算机软件与理论]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象