相似文本的快速搜索  被引量:1

Faster Algorithm for Searching Similar Text

在线阅读下载全文

作  者:燕继坤[1] 郑辉[1] 席建民[1] 

机构地区:[1]西南电子电信技术研究所国家重点实验室,成都610041

出  处:《计算机工程》2004年第15期22-23,71,共3页Computer Engineering

基  金:国防预研基金资助项目

摘  要:相似文本的快速搜索是大规模文本处理需要解决的基本问题。从两方面改进了Udi的相似文本搜索方法,通过Hash把集合映射成ID,从而得到更快的集合比较算法,重新定义了相似关系,能够减少误判,同时对有固定格式的文本也有更好的效果。Searching similar texts is a fundamental problem for many large scale text processing tasks. Udi's algorithm for searching similar texts is improved in two ways. By mapping each set to an [D, a faster algorithm to compare sets is obtained. And the relation of similar to is redefined in order to both reduce false decision and improve the performance for those texts with fixed format.

关 键 词:大规模文本处理 相似文本搜索 复制检测 

分 类 号:TP391.43[自动化与计算机技术—计算机应用技术]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象