检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]厦门理工学院计算机科学与技术系,福建厦门361012
出 处:《计算机技术与发展》2011年第9期39-42,共4页Computer Technology and Development
基 金:国家自然科学基金资助项目(60903203);福建省教育厅A类科技计划项目(JA08222)
摘 要:现实世界中存在着非平衡数据集,即数据集中的一类样本数量远大于另一类。而少数类样本的识别通常是人们首要关心的,将少数类样本误分为多数类要比将多数类样本误分为少数类付出更高的代价。传统的机器学习算法可能会产生偏向多数类的结果,因而对于少数类而言,预测的效果会很差。在对目前国内外非平衡数据集研究现状深入分析的基础上,针对非平衡数据集数据复杂度研究和失衡解决方法研究两个方向相对孤立及缺乏系统性的缺陷,提出了一种非平衡数据集整体解决框架,以满足日益迫切的应用需求。A dataset is imbalanced if the classification categories are not approximately equally represented.Often real-world datasets are predominately composed of "normal" examples with only a small percentage of "abnormal" or "interesting" examples.It is also the case that the cost of misclassifying an abnormal(interesting) example as a normal example is often much higher than the cost of the reverse error.Traditional machine learning algorithms may be biased towards the majority class,thus producing poor predictive accuracy over the minority class.Based on the deep analysis on current research about rare cases classification,proposes a learning framework to address the problem of relative isolation of research between data complexity and solution of imbalanced data,and lack of systematic defects to meet the increasingly urgent applications.
分 类 号:TP18[自动化与计算机技术—控制理论与控制工程]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.198