检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]沈阳炮兵学院基础部计算机实验中心,沈阳110162
出 处:《计算机工程与应用》2008年第9期143-146,共4页Computer Engineering and Applications
摘 要:因特网的迅速发展对传统的爬行器和搜索引擎提出了巨大的挑战。各种针对特定领域、特定人群的搜索引擎应运而生。Web主题信息搜索系统(网络蜘蛛)是主题搜索引擎的最主要的部分,它的任务是将搜集到的符合要求的Web页面返回给用户或保存在索引库中。Web上的信息资源如此广泛,如何全面而高效地搜集到感兴趣的内容是网络蜘蛛的研究重点。提出了基于网页分块技术的主题爬行,实验结果表明,相对于其它的爬行算法,提出的算法具有较高的效率、爬准率、爬全率及穿越隧道的能力。With the explosive growth of the World-Wide Web,to general-purpose crawlers and search engines which pose great challenges.All sorts of special topic search engines are designed for special people and special domains.The web topic information search system (web spider) is the most important part of topic search engine,it collects web pages of special topic and provides users with the result or stores it in index database.Information resource of web is so extensive,how to collect interest content comprehensively and effectively,it is important to web spider research.In this paper,a new crawling strategy block-based topic crawling has been proposed,the experiments show that compared with some traditional algorithms,this algorithm has better performance.It is effective and has high precision.
关 键 词:定题搜索 主题爬行 搜索引擎 爬行算法 相关度分析
分 类 号:TP18[自动化与计算机技术—控制理论与控制工程]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.28