检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
作 者:黄天强[1] 胡斌[1,2] 李峰[1] 卓月明[1] 蔡国民[1] 颜一鸣[1]
机构地区:[1]吉首大学信息管理与工程学院,张家界427000 [2]中南大学信息科学与工程学院,长沙410008
出 处:《情报学报》2009年第3期469-474,共6页Journal of the China Society for Scientific and Technical Information
基 金:湖南省教育厅科学研究项目(2007C525);湖南省教育科学规划课题(XJK06BJGl03);湖南省大学生研究性学习与创新性实验项目.
摘 要:本文针对互联网上信息的日益海量增长的情况,在评述前期算法的基础上,提出了一种关键资源页面判定树的增量式更新算法。新算法使用Web页面的链接分析方法,选择合适的Web页面属性,并基于反例的统计信息来构造判定树的测试属性值,采用ID5R算法来处理训练样本不断增长的关键资源页面判定的机器学习任务。同时设计了适合于该算法的剪枝策略,它通过引入并实时更新反例样本比率并在其值低于抑制因子时停止分裂的办法,避免了树的过度增长与抗嗓能力差、泛化情况糟糕的情况。实验表明增量式更新算法能更高效地生成关键资源页面判定树。最后讨论了该算法的应用领域。To cope increasingly growing Web information, this paper presents an incremental updating algorithm for inducing Web Key Resource Pages based on analysis of previous algorithm. The new algorithm applies Link Analysis Method and choose appropriate Web page attribute value, constructs test attribute value based on statistical analysis of "negative instance", applies the IDSR induction process to learning tasks in which training instances are presented continuously. Meanwhile we present a new truing method to optimize our new algorithm, which avoids the overmuch growth of decision tree by introducing and updating negative ratio continually, and pausing the growth if it down flows to the assumed threshold value. Experiments show that incremental training makes it possible to select training instances more carefully, which can result in smaller decision trees. We discuss application of this new algorism in the end.
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.229