【滚雪球学数学建模】第8.1节·聚类与分类
2026/9/10 13:44:27 网站建设 项目流程

🎓本文收录于《滚雪球学数学建模》系列专栏

数学建模真正的难点,往往不在于掌握某一个公式或算法,而在于面对实际问题时,能否完成从问题分析 → 模型构建 → 算法求解 → 结果验证 → 论文表达的完整闭环。

本专栏正是围绕这一目标打造:从零基础出发,通过“滚雪球式”的知识积累方式,由浅入深地讲解数学建模中的核心方法、经典模型、算法工具与竞赛实战。

无论你是第一次参加数学建模竞赛的新生,还是希望进一步提升科研、论文与工程建模能力的学习者,都可以沿着本专栏逐步建立属于自己的数学建模知识体系与问题解决框架

🎯限时特惠:当前活动一折秒杀,一次订阅,终身有效,后续所有更新章节全部免费解锁👉 《滚雪球学数学建模》👈️

建议订阅 / 收藏专栏,后续将持续更新建模方法、算法实现、竞赛真题解析与实战案例,方便系统学习与随时查阅。

由于平台单篇字数限制,本期内容将拆分为3篇,具体文章链接如下:

  • 【滚雪球学数学建模】第8.1节·聚类与分类
  • 【滚雪球学数学建模】第8.2节·聚类与分类

全文目录

    • 一、引言:从数据中发现模式
    • 二、聚类分析:让数据自己分组
      • 2.1 聚类的基本思想
      • 2.2 距离与相似性度量
        • 2.2.1 常用距离度量
        • 2.2.2 数据标准化的必要性
      • 2.3 K-means聚类算法
        • 2.3.1 算法原理
        • 2.3.2 数学推导
        • 2.3.3 MATLAB实现
        • 2.3.4 K-means的优缺点
      • 2.4 层次聚类
        • 2.4.1 凝聚层次聚类
        • 2.4.2 MATLAB实现
      • 2.5 DBSCAN密度聚类
        • 2.5.1 核心概念
        • 2.5.2 算法流程
        • 2.5.3 MATLAB实现
        • 2.5.4 参数选择
      • 2.6 高斯混合模型(GMM)
        • 2.6.1 模型定义
        • 2.6.2 EM算法
        • 2.6.3 MATLAB实现
      • 2.7 聚类数目的选择
        • 2.7.1 肘部法则(Elbow Method)
        • 2.7.2 轮廓系数(Silhouette Coefficient)
        • 2.7.3 间隙统计(Gap Statistic)
    • 三、分类分析:从已知到未知
      • 3.1 分类问题的基本框架
      • 3.2 判别分析(Discriminant Analysis)
        • 3.2.1 线性判别分析(LDA)
        • 3.2.2 MATLAB实现
        • 3.2.3 二次判别分析(QDA)
      • 3.3 朴素贝叶斯分类器
        • 3.3.1 贝叶斯定理
        • 3.3.2 朴素假设
        • 3.3.3 高斯朴素贝叶斯
      • 3.4 决策树
        • 3.4.1 决策树的构建
        • 3.4.2 MATLAB实现(简化版)
      • 3.5 支持向量机(SVM)
        • 3.5.1 线性SVM
        • 3.5.2 软间隔SVM
        • 3.5.3 核技巧
        • 3.5.4 MATLAB实现
      • 3.6 K近邻(K-Nearest Neighbors, KNN)
        • 3.6.1 算法原理
        • 3.6.2 距离加权
        • 3.6.3 MATLAB实现
        • 3.6.4 KNN的优缺点
      • 3.7 集成学习方法
        • 3.7.1 随机森林(Random Forest)
        • 3.7.2 AdaBoost
    • 四、模型评估与选择
      • 4.1 性能度量
        • 4.1.1 混淆矩阵
        • 4.1.2 ROC曲线和AUC
        • 4.1.3 多类分类的评估
      • 4.2 交叉验证
        • 4.2.1 K折交叉验证
        • 4.2.2 分层交叉验证
        • 4.2.3 留一法(Leave-One-Out)
      • 4.3 偏差-方差权衡
    • 🎯 关于这个专栏
    • 💬 关于内容、引用与交流
    • 👨‍💻 About Me · 关于作者
    • 🚀 如果你正在学习数学建模
    • 🎁 文末福利 · 学习资源

一、引言:从数据中发现模式

在数学建模的实践中,我们常常面对这样的问题:手头有大量的观测数据,却不知道如何从中提取有价值的信息。聚类与分类,正是帮助我们从数据的混沌中理出秩序的两大利器。

设想你是一位生物学家,收集了数百种鸢尾花的花萼长度、花瓣宽度等测量数据。如何根据这些数据将鸢尾花分成不同的类别?这就是一个典型的分类问题。而如果你事先并不知道应该分成几类,只是希望让数据"自己说话",找出自然的分组,这便是聚类问题

这两个概念看似相近,实则有本质区别:

  • 聚类(Clustering)是无监督学习,我们不知道正确答案,让算法根据数据内在结构自行分组
  • 分类(Classification)是监督学习,我们已有标注好的训练样本,要学习一个规则去预测新样本的类别

本节将系统讲解聚类与分类的理论基础、常用算法、MATLAB实现以及实际建模中的应用技巧。我们的目标不是简单罗列算法,而是要让你真正理解每种方法背后的数学原理和适用场景。

二、聚类分析:让数据自己分组

2.1 聚类的基本思想

聚类的核心思想可以用一句话概括:物以类聚。我们希望将数据集划分成若干组,使得同一组内的样本尽可能相似,不同组之间的样本尽可能不同。

数学上,假设有数据集

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询