检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
作 者:谢佳斌[1] 金勇进[1] 谢邦昌[2,3,4,5,1]
机构地区:[1]中国人民大学统计学院 [2]中国台湾辅仁大学统计信息学系 [3]中国台湾辅仁大学应用统计所 [4]中华资料采矿协会(台湾) [5]厦门大学经济学院
出 处:《统计研究》2009年第4期101-104,共4页Statistical Research
摘 要:在将数据挖掘方法应用于抽样调查数据时,会遇到抽样权重的处理问题。本文提出采用放回的、与样本单元权数大小成比例的再抽样方法,简称PPWWR再抽样,来实现"事后"自加权设计。实现"事后"自加权设计后的子样本可忽略掉样本权数,直接采用常规的图示方法和数据挖掘算法进行分析。随后,基于2007中国公民科学素质调查贵州省数据,通过模拟分析讨论了PPWWR再抽样子样本的样本量问题,发现max(n,5%N)是一个比较合适的样本量。这一结论可能为其他大型复杂抽样调查数据的数据挖掘实施问题提供借鉴。The problem of how to deal with sampling weights appears when applying data mining methods to survey data. We suggest the method of re-sampling with probability proportional to the weights with replacement (PPWWR) to achieve post selfweighting design. Then, some ordinary statistical graphics and data mining algorithms can be used directly, ignoring the sample weights. Next, based on the survey data of GuiZhou Province from the survey of public understanding of science 2007, we discussed the sample size problem of the PPWWR re-sampling method by simulation and find max( n ,5% N) is an appropriate sample size. This conclusion might be useful for the implementation of data mining on other large and complex survey data.
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.222