代价敏感分类算法的实验比较
代价敏感分类算法的实验比较
期
闻明松
等代价敏感分类算法的实验比较 ‘。〕
诊断为健康的代价也远远高于把一个健康人诊断为 绝症的代价代价敏感 一
一种以
为基算法的
分类就是为 , ,
方法
算法首先根据式 , ,
修改切
不同类型的错误分配不同的代价使得在分类时高代价错误产生的数量和错误分类的代价总和最小 改变现有的分类算法使其变得代价敏感是非常
练样本的初始权重并在此权重分布下顺序产生多 个独立的分类模型在每一轮结束后通过调整权重向量来反映每个训练样本在下一轮归纳过程中的 ,
费时费力的事情且效果有时并不明显通常的做法 ,
重要程度这种调整有效提高了被错误分类样本的
是不改变原有的算法通过增加一个过程使原来的 ,
权重使
得在每一轮归纳过程中学习器能够致力于 ,,
分类算法转换为代价敏感常用的方法有如下几种调整样本分布 ,
不同的样本从而生成多个不同的分类模型最后 ,
,
,一
〕
这是一种
这些模型通过投票产生一个集成在实现该算法时
,
,
传统的方法它根据错误分类的代价按照比例变换 ,
本文使用了 。。
等在文献 一 一 乏‘ ,
」中提出的
训练集中类别的频率其缺点是改变了样本的分布情况有时会影响算法的性能 ,
版本其权值调整公式如下 一 。
歼
》
元代价 “” ,
‘〔〕
提出的一种将 否则、 曰 ‘ 、‘
一般分类模型转换成代价敏感模型的方法它通过一个元学习过程根据最小期望代价修改训练样
如果训练集中第 , 一‘
个样本被错误分类则 ,
,
,
一。 一 ’
错误率 ‘
。 一 ’
一
一”
“
「
本的类标记并使用修改过的训练集重新学习新的 ,
票又一” 甲
。
,
规范 ‘
一
一
‘
一
” 。
“
模型
化因子
一 一 。。 £, ,
了二刃兀万权值调整因子瓦
代价敏感决策 一’“ ,
一
,
舟 ,
首先在划练集中多次取样生成多个 ,
一
、
、
模型再根据多个模型得到测试样本属于每个类别 的概率然后计算测试样本的所有错误分类代价并根据最小代价得到类标记
方法只在归纳第一个模型时通过样本 ,,
权重初始化步骤使用了错误分类的代价信息在其后每一轮归纳过程中都没有再使用分类的代价信
一种典型的做法是利用
集成学习技术本文以 的 ,
息 一
‘
〕 ,
阁算法为基算法对基于示例权重 、
的一种变体方法
,
在
变体算法算法 、
基于 ,
的
每一轮归纳过程结束后权值调整都使用了错误分类的代价信息从而使得顺序生成的每一个模型都 ,
种基于
的代价敏感集成算法
等
种代价敏感算法进行了实验研究并得到了一
是代价敏感的除了权值调整公式见式 于 歼
不同
些有意义的结论
算法外其余过程完全相同 ,
认
, ,
代价敏感学习算法 尹〕 ,,
习 假设 ,
叶八儿少‘。
为训练集中第 为第 己己 ,
个样本的真实 ,
算法的一种代价敏感变体方 ,,
类别介 否则 ,
‘
个样本的预测类别如果则 ‘
、, ,
法对训练集中的样本根据给定的代价矩阵通过下式修改每一类样本的
初始权重并在修改后的权重分布下训练分类模型
哟 ‘ ‘
、,,
二 〕
渺
系列算法 ,
样本权重初始化过程同版本
但是 的
系列算法使用的
又习 其中 ,
从 ,
是一种基于置信度预测方法 ‘
〕
该版本
为训练集中样本的总数 ,
为类别 ,
中的样
本总数
芝
、
‘
方法的权值调整因子 一
为规范化因子用来保证修改
通过下式计算 ‘了、了
后的样本权重总和仍然等于的代价向量可由式 ,
为误分类类别 一
合 ,
计算得出 ,
一
习 ,
,
‘
,
‘贵”琴 人 ,
决
,
, 八口匕 、声,、
,
“,’‘
’
其中 为把
任【
,
工表示该预测的置信度如果 ,
其中 价 ,
,
类样本误分为
类样本的代
该模型正确分类了样本
,
则舀二 ,
否则占 ,
一
为样本所含类别总数
是最简单的一种方法它在权值调整时不




