模型评价(AUC，ROC曲线，ACC, 敏感性，特异性，精确度，召回率，PPV, NPV, F1)

广旭qsian65x0b 2019-12-19

展开全文

混淆矩阵

精确率 / precision / PPV / 查准率

召回率 / Recall / True positive rate / TPR / 灵敏度 / 敏感性 / sensitive/ 查全率

ROC曲线

AUC(Area under the ROC curve)

cut-off点

计算步骤如下：

参考文献：

混淆矩阵

这里写图片描述

混淆矩阵包含四部分的信息：

True negative(TN)，称为真阴率，表明实际是负样本预测成负样本的样本数
False positive(FP)，称为假阳率，表明实际是负样本预测成正样本的样本数
False negative(FN)，称为假阴率，表明实际是正样本预测成负样本的样本数
True positive(TP)，称为真阳率，表明实际是正样本预测成正样本的样本数

对照着混淆矩阵，很容易就能把关系、概念理清楚，但是久而久之，也很容易忘记概念。不妨我们按照位置前后分为两部分记忆，前面的部分是True／False表示真假，即代表着预测的正确性，后面的部分是positive／negative表示正负样本，即代表着预测的结果，所以，混淆矩阵即可表示为正确性－预测结果的集合。现在我们再来看上述四个部分的概念（均代表样本数，下述省略）：

TN，预测是负样本，预测对了
FP，预测是正样本，预测错了
FN，预测是负样本，预测错了
TP，预测是正样本，预测对了

召回率 / Recall / True positive rate / TPR / 灵敏度 / 敏感性 / sensitive/ 查全率

而召回率是针对我们原来的样本而言的，它表示的是样本中的正例有多少被预测正确了。那也有两种可能，一种是把原来的正类预测成正类(TP)，另一种就是把原来的正类预测为负类(FN)。

R = TP/(TP+FN)

精确率 / precision / PPV / 查准率

精确率是针对我们预测结果而言的，它表示的是预测为正的样本中有多少是对的。那么预测为正就有两种可能了，一种就是把正类预测为正类(TP)，另一种就是把负类预测为正类(FP)。

P = TP/(TP+FP)

特异性 / specificity

样本中的负类被预测为负类的比例

ROC曲线

事实上，要一下子弄清楚什么是AUC并不是那么容易，首先我们要从ROC曲线说起。对于某个二分类分类器来说，输出结果标签（0还是1）往往取决于输出的概率以及预定的概率阈值，比如常见的阈值就是0.5，大于0.5的认为是正样本，小于0.5的认为是负样本。如果增大这个阈值，预测错误（针对正样本而言，即指预测是正样本但是预测错误，下同）的概率就会降低但是随之而来的就是预测正确的概率也降低；如果减小这个阈值，那么预测正确的概率会升高但是同时预测错误的概率也会升高。实际上，这种阈值的选取也一定程度上反映了分类器的分类能力。我们当然希望无论选取多大的阈值，分类都能尽可能地正确，也就是希望该分类器的分类能力越强越好，一定程度上可以理解成一种鲁棒能力吧。
为了形象地衡量这种分类能力，ROC曲线横空出世！如下图所示，即为一条ROC曲线（该曲线的原始数据第三部分会介绍）。现在关心的是：