深度学习基础 Week5 分类算法基础知识

📅 2026/7/28 0:10:30 👁️ 阅读次数 📝 编程学习
深度学习基础 Week5 分类算法基础知识

目录

摘要

Abstract

1学习概述

2机器学习分类任务简介

2.1核心定义

2.2分类任务核心类型

2.3分类模型核心分支

3分类与回归的核心区别

3.1核心本质差异

3.2具体实例对比

3.3建模与评价差异

4分类任务核心底层知识点总结

5学习总结与感悟


摘要

本文系统梳理了机器学习分类任务的核心概念。分类作为监督学习的重要分支,通过建立特征与离散标签的映射关系实现定性判断,包括二分类和多分类两种类型。重点探讨了概率生成模型的原理,其通过联合概率分布和贝叶斯定理实现分类,训练采用极大似然估计。文章对比了分类与回归的本质差异:分类输出离散类别(如垃圾邮件识别),回归预测连续数值(如房价)。最后总结了分类任务的理论基础,包括高斯分布、后验概率等核心概念,强调概率生成模型从数据生成本质建模的特点。本次学习为后续深入掌握分类算法奠定了理论基础。

Abstract

This article gives a systematic overview of the core concepts in machine learning classification tasks. As an important branch of supervised learning, classification makes qualitative judgments by mapping features to discrete labels, including both binary and multi-class types. It focuses on the principles of probabilistic generative models, which use joint probability distributions and Bayes' theorem for classification, and are trained using maximum likelihood estimation. The article also compares the fundamental differences between classification and regression: classification outputs discrete categories (like spam detection), while regression predicts continuous values (like housing prices). Finally, it summarizes the theoretical foundations of classification tasks, covering key concepts like Gaussian distribution and posterior probability, and highlights how probabilistic generative models model the essence of data generation. This learning lays the theoretical foundation for mastering classification algorithms in depth.

1学习概述

本次学习聚焦机器学习监督学习核心分支——分类(Classification)任务,系统梳理了分类的核心定义、核心逻辑,对比了分类与回归的核心差异,同时结合概率统计核心知识点,掌握了分类任务底层的高斯分布、极大似然估计、后验概率、概率生成模型等基础理论,构建起了分类算法的基础知识体系,为后续深度学习、概率建模相关学习奠定了基础。

2机器学习分类任务简介

2.1核心定义

分类是机器学习中监督学习的核心任务之一,指模型通过学习带标签的训练数据,学习输入特征与离散标签之间的映射关系,最终对未知样本预测离散的类别标签。简单来说,分类任务的本质是“定性判断”,输出结果是有限、离散的类别,而非连续数值。

2.2分类任务核心类型

根据输出类别数量,可分为两类主流任务:

  • 二分类(Binary Classification):仅包含两个对立类别,是最基础的分类任务。例如判断邮件是否为垃圾邮件、判断肿瘤是良性还是恶性、判断用户是否点击广告。
  • 多分类(Multi-class Classification):包含三个及以上离散类别。例如手写数字识别(0-9共10个类别)、图像识别(猫、狗、鸟等多类别区分)、文本情感多分级(负面、中性、正面)。

2.3分类模型核心分支

本次重点学习了概率生成模型(Probabilistic Generative Model),这是分类任务的重要模型体系。该类模型核心逻辑是学习数据的联合概率分布 P(X,Y),先建模数据的生成规律,再通过贝叶斯公式推导后验概率完成分类,典型代表为高斯判别分析、朴素贝叶斯算法。模型训练依托极大似然估计(Maximum Likelihood, MLE),通过最大化观测数据的概率,拟合模型最优参数。

3分类与回归的核心区别

分类与回归同属监督学习,但二者任务本质、输出结果、应用场景完全不同,核心差异在于预测结果的形态,具体区别及实例对比如下:

3.1核心本质差异

  • 分类任务:定性任务,预测离散、有限的类别标签,结果无大小、连续关系。
  • 回归任务:定量任务,预测连续、无限的数值,结果存在大小、增减关系。

3.2具体实例对比

任务类型典型案例典型案例任务属性
二分类判断西瓜是否成熟成熟/未成熟(离散2类)定性判断
多分类识别花卉种类(鸢尾花)山鸢尾/变色鸢尾/维吉尼亚鸢尾(离散多类)定性判断
回归预测西瓜成熟度评分0-10的连续数值(如7.5、8.2)定量计算
回归预测房屋价格任意连续数值(如120.5万、156.8万)定量计算

3.3建模与评价差异

  • 建模方式:分类模型多基于概率分布(高斯分布、伯努利分布)建模,输出类别概率;回归模型直接拟合特征与数值的线性/非线性映射关系。
  • 评价指标:分类常用准确率、精确率、召回率;回归常用均方误差、绝对误差。

4分类任务核心底层知识点总结

本次同步掌握了支撑概率分类模型的核心基础理论,形成完整知识闭环:

  • 概率分布(Probability Distribution):描述数据的出现规律,分类生成模型最常用高斯分布(Gaussian Distribution),假设同类样本服从正态分布。
  • 极大似然估计:模型训练的核心方法,固定观测数据,求解最贴合数据的模型参数,是朴素贝叶斯、高斯判别分析的训练核心。
  • 后验概率(Posterior Probability):基于先验概率和样本似然,通过贝叶斯公式更新得到的类别概率,分类模型最终依据最大后验概率判定样本类别。
  • 模型优化(Modifying Model):可通过修改模型分布假设、损失函数、网络结构等方式,优化分类精度与模型鲁棒性。

5学习总结与感悟

本次学习明确了机器学习分类任务的核心定位,清晰区分了分类与回归两大核心监督学习任务的边界,同时打通了分类任务与概率统计知识的关联。不同于直观的判别模型,概率生成模型从数据生成本质出发建模,依托高斯分布、极大似然、贝叶斯概率完成分类,让我理解了分类算法的底层逻辑而非单纯记忆公式。后续将进一步学习典型分类算法的原理与实操,掌握模型修改、调优的具体方法,深化对概率机器学习体系的认知。