检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
作 者:王宝勋[1] 王晓龙[1] 刘秉权[1] 李鹏[1]
机构地区:[1]哈尔滨工业大学计算机学院,黑龙江哈尔滨150001
出 处:《中文信息学报》2008年第3期32-36,114,共6页Journal of Chinese Information Processing
基 金:国家自然科学基金资助项目(60435020;60673037);863计划资助项目(2006AA01Z197;2007AA01Z172);黑龙江省自然科学基金资助项目(E200635)
摘 要:本文提出了一种生物医药领域词变体的识别策略。首先使用最小编辑距离算法和字符匹配算法从语料中分别获得特定目标词的形态学变体和缩略词,并将其作为候选词变体。本文采用系统相似模型获得每个词变体上下文语义的量化评价。本文的方法不需要任何语言学知识和精细加工的语料资源,实验表明,该方法可以在保证准确率的同时显著地提高词变体识别的召回率。This paper presents an unsupervised learning strategy to identify the variants of biomedical terms. The minimum edit distance algorithm and a character matching algorithm are first applied to identify the morphological variants and the abbreviations as the candidate variants for a given term. The system similarity model is innovatively introduced to measure the semantic context for each candidate variant. This method requires no linguistic knowledge or labor-intensive corpora, and the experiment indicates its significant improvement in recall with a reasonable precision.
关 键 词:计算机应用 中文信息处理 词变体 缩略词 最小编辑距离 系统相似模型
分 类 号:TP391[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.222