检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
作 者:姚立[1] 张曦煌[1] YAO Li;ZHANG Xihuang(School of Internet of Things Engineering,Jiangnan University,Wuxi,Jiangsu 214122,China)
机构地区:[1]江南大学物联网工程学院,江苏无锡214122
出 处:《计算机工程》2019年第4期205-210,216,共7页Computer Engineering
基 金:江苏省产学研合作项目(BY2015019-30)
摘 要:传统主题演化(ToT)模型通常忽略原始数据中的标签元信息。为此,建立一种基于标签的改进ToT模型。针对传统权重算法忽略词汇在文档集类别间和类别内的分布对权重产生影响的问题,结合文档标题特征,使用改进词频-反重力距算法进行权重分析,以扩展模型的生成过程。在ToT模型的基础上引入原始文档的标签属性,构建改进模型并使用吉布斯采样算法估计其参数。实验结果表明,与ToT模型相比,该模型具有较高的泛化能力。Traditional Topics over Time(ToT) models usually ignore label meta-information in the original data.To solve this problem,an improved ToT model based on label is established.Aiming at the problem that traditional weighting algorithms ignore the influence of vocabulary distribution among and within document sets on weights,combined with the characteristics of document titles,an improved TF-IGM algorithm is used to analyze the weights to extend the generation process of the model.Based on the ToT model,the label attributes of the original document are introduced to construct the improved model and estimate its parameters using Gibbs sampling algorithm.Experimental results show that the proposed model has higher generalization ability than the ToT model.
关 键 词:标签 主题演化模型 隐狄利克雷分配 词频-反重力距算法 吉布斯采样
分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.171