机器学习算法可以按照 学习方式 分为三大类,以下是结构化的分类清单,包含各类的核心算法、适用场景和典型特点:

一、 监督学习(Supervised Learning)

算法基于带标签的训练数据学习输入到输出的映射关系,目标是对新数据进行预测或分类。

  1. 分类算法
    • 逻辑回归(Logistic Regression):用于二分类任务,输出为样本属于某一类的概率,适用于信用评分、疾病诊断等场景。
    • 支持向量机(SVM):通过寻找最优超平面划分数据,可通过核函数处理非线性分类,适用于文本分类、图像识别。
    • k近邻算法(KNN):基于“近朱者赤”的思想,根据邻居的类别判断样本类别,适用于小样本分类、推荐系统。
    • 朴素贝叶斯(Naive Bayes):基于贝叶斯定理和特征独立性假设,计算效率高,适用于文本分类(如垃圾邮件识别)、情感分析。
    • 决策树(Decision Tree):通过递归划分特征空间生成树状模型,可解释性强,典型算法有ID3、C4.5、CART。
    • 集成学习分类算法
      • 随机森林(Random Forest):多个决策树的集成,降低过拟合风险,适用于高维数据分类、特征重要性评估。
      • 梯度提升树(GBDT/XGBoost/LightGBM):串行训练决策树,逐步修正预测误差,是工业界竞赛的常用算法。
  2. 回归算法
    • 线性回归(Linear Regression):拟合输入特征与连续输出值的线性关系,适用于房价预测、销量预测。
    • 岭回归/套索回归(Ridge/Lasso Regression):在普通线性回归基础上加入正则化项,解决过拟合和多重共线性问题。
    • 多项式回归(Polynomial Regression):通过引入多项式特征,拟合非线性的回归关系。

二、 无监督学习(Unsupervised Learning)

算法基于无标签数据学习数据的内在结构或规律,目标是发现数据的隐藏模式。

  1. 聚类算法
    • k-means:划分式聚类,通过迭代优化簇中心,将数据划分为k个簇,适用于文本聚类、用户分群。
    • 层次聚类(Hierarchical Clustering):分为凝聚式(自底向上)和分裂式(自顶向下),可生成聚类树状图,适用于小样本数据聚类。
    • DBSCAN:基于密度的聚类,能发现任意形状的簇,还可识别噪声点,适用于异常检测、空间数据聚类。
    • 谱聚类(Spectral Clustering):基于图论的聚类算法,将数据映射到低维空间后再聚类,适用于非线性可分数据。
  2. 降维算法
    • 主成分分析(PCA):通过线性变换将高维数据映射到低维空间,保留数据的主要方差,适用于数据可视化、特征降维。
    • t-分布随机邻域嵌入(t-SNE):非线性降维算法,擅长将高维数据映射到2-3维空间,可视化效果优于PCA。
    • 独立成分分析(ICA):用于分离混合的独立信号,适用于盲源分离(如语音信号处理)。
  3. 关联规则学习
    • Apriori算法:挖掘数据中的频繁项集和关联规则,适用于购物篮分析(如“买啤酒的人大概率买尿布”)。
    • FP-Growth算法:比Apriori效率更高,无需生成候选集,直接构建FP树挖掘频繁项集。

三、 强化学习(Reinforcement Learning)

算法通过与环境的交互学习最优策略,智能体根据环境反馈的奖励/惩罚调整行为,目标是最大化累计奖励。

  • Q-Learning:基于价值的强化学习算法,学习动作价值函数Q(s,a),适用于离散动作空间的任务(如迷宫寻路)。
  • SARSA:与Q-Learning类似,但属于在线策略算法,动作选择和评估使用同一策略。
  • 深度强化学习
    • DQN(深度Q网络):将深度学习与Q-Learning结合,适用于高维状态空间任务(如Atari游戏)。
    • PPO(近端策略优化):基于策略的强化学习算法,训练稳定,适用于机器人控制、自动驾驶等复杂任务。

作者:月影鹏鹏  创建时间:2026-10-04 17:46
最后编辑:月影鹏鹏  更新时间:2026-10-04 17:47