检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]华东理工大学计算机科学与工程系,上海200237
出 处:《计算机工程》2004年第20期148-150,共3页Computer Engineering
基 金:上海市青年科技启明星计划(99QD14038)
摘 要:提出了一种基于PAT树型结构的高频字串提取的改进算法,并以此用来获得特定领域网页中的未登录词集合,利用基于语义距离的概念相似度计算公式来获得任一概念的相关概念,从而给出了用于特定领域搜索引擎的语义词典完整的自动构建方法。将生成的语义词典用于搜索引擎FlyingSender中。实验结果证明新的词典比原有的手工构建的词典分词效果要理想得多,而且提供了概念联想的功能。An improved algorithm based on PAT tree structure to extract high frequency strings appearing in the doc is presented. Through it the paper gains a set of words of specific domain not listed in the general dictionary, computes the similarity for each two concepts to obtain associative concepts based on semantic distance. Finally, it concludes a complete automatic method to construct a thesaurus of specific domain used by search engine. Experimental results prove new thesaurus with concept association functions makes better performance than the general one.
分 类 号:TP391[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.222