☰
【AI】机器学习常见的指标及其解释
2026/10/11 7:26:33 网站建设 项目流程

机器学习常见的指标及其解释

机器学习中的评估指标种类繁多,没有“万能指标”,选择完全取决于你所解决的任务类型(分类、回归、聚类、排序等)以及业务关注的重点。


一、回归任务(预测连续数值)

这类任务评估的是“预测值”与“真实值”之间的偏差程度。

指标英文全称计算公式/含义核心特点与适用场景
MAE平均绝对误差1n∑∣yi−y^i∣\frac{1}{n}\sum|y_i - \hat{y}_i|n1​∑∣yi​−y^​i​∣直观,表示平均差多少。对异常值不敏感,适合业务解释(如房价预测)。
MSE均方误差1n∑(yi−y^i)2\frac{1}{n}\sum(y_i - \hat{y}_i)^2n1​∑(yi​−y^​i​)2放大较大误差,对异常值非常敏感。常用于优化目标(梯度更平滑)。
RMSE均方根误差MSE\sqrt{MSE}MSE​量纲与原始数据一致,比MSE更直观。对异常值敏感,不适合含大量离群点的数据。
MAPE平均绝对百分比误差100%n∑∣yi−y^iyi∣\frac{100\%}{n}\sum|\frac{y_i - \hat{y}_i}{y_i}|n100%​∑∣yi​yi​−y^​i​​∣相对百分比,直观易懂,适合不同尺度数据的对比(如销量预测)。
⚠️致命弱点:真实值为0时无意义,且实际值很小时会异常放大。
SMAPE对称平均绝对百分比误差改进版MAPE,分母取$(y_i| + |\hat{y}_i|)/2$
R² (决定系数)Coefficient of Determination1−SSresSStot1 - \frac{SS_{res}}{SS_{tot}}1−SStot​SSres​​模型解释力,取值(-∞, 1]。衡量模型比简单均值好多少。负值说明模型还不如直接取平均值。

二、分类任务(预测离散标签)

这是机器学习最庞大的评估体系,包含二分类、多分类和特殊的不平衡分类场景。

1. 基础指标(基于混淆矩阵)
指标核心公式通俗理解适用场景
准确率 (Accuracy)(TP+TN)/Total整体猜对的比例适合各类别样本数量大致均衡的场景(如手写数字识别)。
精确率 (Precision)TP/(TP+FP)“宁缺毋滥”,预测为正例的样本中有多少是真正的正例。垃圾邮件过滤(宁愿漏掉,不愿误把正常邮件放垃圾箱)。
召回率 (Recall)TP/(TP+FN)“宁可错杀一千”,所有真实正例中有多少被成功找出来。疾病筛查、金融风控(漏掉一个病人的后果比误判严重)。
F1-Score(2 * (P * R) / (P + R))精确率和召回率的调和平均。需要同时兼顾P和R,且数据存在不均衡时(如信用卡欺诈)。
2. 高级指标(不均衡数据专用)
  • AUC-ROC:衡量模型对正负样本排序能力的阈值无关指标。AUC=0.5相当于随机猜,越接近1越好。它对正负样本比例不敏感,是不均衡分类的首选标准。
  • AUC-PR (PR曲线下面积):当负例极多,正例极少时,PR曲线比ROC曲线更能反映模型表现(因为ROC可能因TN多而虚高)。

三、聚类任务(无监督,无标签)

评估聚类效果通常分为内部评估(无需真实标签)和外部评估(需要真实标签)。

指标适用类型核心逻辑
轮廓系数 (Silhouette Score)内部评估(最常用)综合衡量簇内紧密(内聚度)和簇间分离(分离度),取值[-1, 1],越大越好。
戴维斯-布尔丁指数 (DBI)内部评估衡量簇内距离与簇间距离之比,越小代表聚类效果越好。
调整兰德指数 (ARI)外部评估(需真实标签)衡量两个数据划分的相似程度,已校正随机性,取值[-1, 1]。
互信息 (NMI)外部评估衡量真实标签与聚类标签的共享信息量,取值[0, 1],越大越好。

四、排序与推荐系统(Top-K场景)

评估模型返回的前K个结果的优劣。

指标核心含义适用场景
NDCG@K归一化折损累计增益:考虑排序位置的顺序权重(排名越靠前,权重越大)。搜索引擎、电商推荐,用户更关心首页前几名的结果。
MRR平均倒数排名:关注第一个正确答案出现的位置。问答系统、导航查询(只关心最匹配的那一个)。
Hit Rate (Recall@K)前K个推荐结果中是否包含了用户真实喜欢的物品。粗略评估推荐系统的命中覆盖能力。

五、生成式AI / 大语言模型(文本生成)

这类任务有独特的评估方式,但也是争议最大的。

指标核心逻辑缺点
困惑度 (Perplexity)衡量模型对测试数据预测概率的倒数,越低代表模型越不“困惑”。只反映模型自信度,与生成文本的实际质量(通顺、逻辑)关联不大。
BLEU衡量生成文本与参考译文之间的N-gram精确匹配(侧重精确率)。惩罚短句,不擅长同义词识别,只适合机器翻译。
ROUGE衡量生成文本与参考文本的N-gram重叠率(侧重召回率)。主要用于文本摘要评估。
BERTScore / GPTScore利用BERT/GPT等预训练模型计算语义向量相似度。算力消耗大,但比BLEU更能捕捉语义(最新趋势)。

🎯 如何快速做出选择?(决策树)

  1. 业务是预测具体数值?→ 选MAE(易解释)或RMSE(放大错误);若需要百分比看MAPE(确保Y没有0)。
  2. 业务是分类,且类别均衡?→准确率足够,但建议附带混淆矩阵。
  3. 业务是分类,且正负样本极度不均?(如欺诈、癌症)→ 舍弃准确率,紧盯召回率(Recall)和AUC-ROC,或使用F1。
  4. 业务是推荐/搜索?→ 关注NDCG@K和Hit Rate@K。
  5. 业务是无监督聚类?→ 首选轮廓系数。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询