基于OEM模型的半结构化数据的模式抽取  被引量:8

OEM-based schema extraction of semi-structured data

在线阅读下载全文

作  者:鲁明羽[1] 陆玉昌[1] 

机构地区:[1]清华大学计算机科学与技术系,北京100084

出  处:《清华大学学报(自然科学版)》2004年第9期1264-1267,共4页Journal of Tsinghua University(Science and Technology)

基  金:国家"九七三"重点基础研究项目 ( G19980 3 0 414 ) ;中国博士后科学基金 ( 2 0 0 3 0 3 414 7)

摘  要:Web数据是典型的半结构化数据 ,缺乏明确的、预知的、与数据分离存储的外在模式 ,导致查询、浏览和集成Web数据的效率极低。该文提出一种基于 OEM (objectexchange model)模型的半结构化数据的模式抽取算法 ,采用自顶向下的剪枝策略 ,可快速发现频繁简单路径集 ,应用于半结构化数据的集成及查询回答与优化。其特点是可降低目标模式的规模 。Web data is typical semi-structured data without an explicit structure that characterises most data sets. The lack of data structure makes querying and integrating web data very inefficient. An approach was developed to identify structures in semi-structured and hierarchical data using the OEM (object exchange model) and a pruning strategy to quickly extract simple paths from the OEM graph for integrating and querying semi-structured data. The method can effectively reduce the scale of the target structure and enhance the efficiency of structure abstraction.

关 键 词:半结构化数据 模式抽取 对象交换模型 剪枝 

分 类 号:TP311[自动化与计算机技术—计算机软件与理论]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象