检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]浙江金融职业学院,杭州310018 [2]浙江工商大学计算机与信息工程学院,杭州310018
出 处:《计算机与数字工程》2008年第4期78-80,93,共4页Computer & Digital Engineering
摘 要:对面向主题的信息采集技术进行了探索性研究。采用基于DOM的信息抽取技术,建立混合空间模型表示内容和结构特征信息,并通过定义网页间相似性来识别主题页面。较好的处理了Web信息抽取中主题页面识别的问题,实验结果证明了系统的可行性。An explorative study on subject oriented web information acquisition techniques is provided. Based on DOM Web information technology, a hybrid vector space model (HVSM) is brought up to represent text contents and structure characters of web pages. Defining the similarity between pages identifies the subject oriented web pages. The problem of identifying subject oriented web pages in web information extraction has been solved. The experiment proved the feasibility of the system.
分 类 号:TP393[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:13.59.0.231