检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]北京航空航天大学计算机学院,北京100083
出 处:《微计算机信息》2007年第33期183-184,176,共3页Control & Automation
基 金:国家科技基础条件平台科技部(2003DKA5G015)
摘 要:高质量、结构化的数据对很多应用来说其价值是无穷的。然而这些数据往往都隐藏在查询表单背后的深度Web数据库中。深度Web数据库中的内容不能够直接被爬虫通过超链接直接获取,只有通过主动对查询表单提交查询才能有效地获取这些数据。最近的研究主要针对以下两个方面:一是如何有效的理解和获取网络上的查询表单,二是如何不断的对查询表单进行查询并下载表单背后的资源。一个必要的但还没很好的解决的一个问题是:如何将一次查询所获得的所有结果页全部有效的获得?这个问题从本质上看就是如何获取结果页面中"下一页"超链接的问题。本文针对这一问题提出了一种通过分析"下一页"超链接的结构特征来识别"下一页"超链接的策略,并在多种情况下进行了试验,取得了良好的效果。The high quality, structured data is invaluable for many applications. These data always hidden in the Deep Web databases. Deep Web databases are not directly crawled by Web crawlers through hyperlinks and are only accessible through Web query forms interfaces. Recent research efforts have been focusing on two aspects: one is to understand these Web query forms, the other is to efficiently acquire the structured information inside Web databases through iteratively issuing meaningful queries. A critical but still largely unresolved question is: how to acquire all the pages from one query? And this question esseni^e turns to how to find the "next page" hyperlinks. In this paper we focus on this issue and bring forward a strategy that find the "next page" hyperlinks from the structure of the "next page" hyperlinks. We do experiments in many cases, and the results seem good.
分 类 号:TP393[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:3.138.137.25