检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
出 处:《计算机学报》2002年第5期526-533,共8页Chinese Journal of Computers
摘 要:当前 ,Web已经成为人们获取信息的主要渠道之一 .然而 ,用于表达 Web页面信息的 HTML语言存在着与生俱来的缺点 .HTML 的“标记”只是告诉浏览器软件如何显示所定义的信息 ,却不包含任何语义 .因此由HTML语言所表述的 Web页面经过浏览器分析后只适合人们浏览 ,不适合作为一种数据交换的方式由机器处理 .该文以文档对象模型 DOM为基础 ,把所要提取的信息在 DOM层次结构中的路径作为信息抽取的“坐标”,并以这个基本原理为基础设计了一种归纳学习算法来半自动地生成提取规则 ,然后根据提取规则生成 Java类 .生成的 Ja-va类可以作为 Web数据源包装器组成的重要构件 .At present, the Web becomes a major channel for people to obtain information. However, there exist inherent drawbacks in the HTML language used to represent information of Web pages. The HTML tags only tell the browsers how to display the information on the screen, but no any semantics in them. So the HTML document is not suited to be a way of data exchange for computer to process. Based on DOM and inductive learning, the paper presents a novel approach to semi automatically generate Java classes which can be dominant part of a wrapper for Web sources. The paper is an important part of the research on integrated query processing over hetergeneous data sources.
关 键 词:DOM Web 信息提取 归纳学习 文档对象模型 路径表达式 XML INTERNET
分 类 号:TP393.4[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.117