检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
出 处:《计算机工程与应用》2004年第28期164-166,共3页Computer Engineering and Applications
基 金:国家电子政务支持(编号:2001BA110B01)
摘 要:异构数据的数据清理,侧重于重复记录,异常数值的探测,有效地发现数据源中的重复记录、异常等,笔者通过增加过滤条件的方法提高了字符串匹配算法的效率,加快了重复记录的识别,另外在刷新数据仓库的数据提出了增量式算法,有效地减少了比较的次数,节省了大量时间并确保数据仓库中数据的质量。文章实现了一个数据清理工具原型—DMCleaner,并用其进行了试验,结果表明采用了这些改进以后,数据清理的速度、效率和正确性都有了很大的提高,数据质量得到了保证。The data cleaning of the integration of heterogeneous data sources,emphasizes particularly on the efficient detection and discovery of duplicated records and abnormal data.In the premise of ensuring the data quality in database,it speeds up the identification of duplicated records with(the help of high efficiency of)String Matching Algo-rithm and decreases the times of comparison to save much time with incremental algorithm.The thesis particularly intro-duces String Matching Algorithm and incremental algorithm in detail and develops a prototype of data cleaning,which is called DMCleaner.The experiment results indicate that the DMCleaner increases the speed,efficiency and accuracy of data cleaning.
分 类 号:TP311.13[自动化与计算机技术—计算机软件与理论]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.49