1. 逻辑回归与Softmax回归的本质解析
在机器学习分类任务中,逻辑回归和Softmax回归是最基础却最重要的两类模型。它们之所以能成为分类问题的首选工具,关键在于其概率建模思想与数学形式的完美统一。
1.1 概率建模的核心思想
逻辑回归最初是为解决二分类问题而设计的。假设我们要预测一个用户是否会点击广告(点击=1,不点击=0),逻辑回归不是直接预测0或1,而是预测"点击的概率"。这种概率视角带来了几个关键优势:
- 可以量化预测的不确定性(比如预测概率0.51 vs 0.99)
- 可以设置不同的决策阈值(通常取0.5,但可根据业务调整)
- 概率输出更易于后续系统集成和决策
概率建模的核心在于如何将线性模型的输出(可以是任意实数)转换为合法的概率值(必须在0到1之间且总和为1)。这正是sigmoid和softmax函数的作用所在。
1.2 从Logistic函数到概率转换
Logistic函数(即sigmoid函数)的数学形式为:
σ(z) = 1 / (1 + e^{-z})
这个S型曲线有三大特性:
- 将任意实数z映射到(0,1)区间
- 在z=0时取值为0.5
- 导数σ'(z) = σ(z)(1-σ(z)),这个特性在反向传播中非常有用
在实际应用中,z通常是特征的线性组合:z = w₁x₁ + w₂x₂ + ... + wₙxₙ + b。通过sigmoid转换,我们得到了P(y=1|x) = σ(z),即给定输入x时属于正类的概率。
注意:sigmoid函数在实现时需要考虑数值稳定性。当z为很大的负数时,e^{-z}会溢出,因此实际代码中通常对z的正负分别处理。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 从二分类到多分类的扩展
2.1 Softmax回归的数学形式
当类别扩展到K类(K>2)时,我们需要一个能输出多项分布的函数,这就是softmax:
softmax(z)k = e^{z_k} / Σ^K e^
与sigmoid相比,softmax有以下特点:
- 输入是一个K维向量z,输出是一个K维概率分布
- 所有输出值之和严格等于1
- 保持原始得分的相对大小(即z_k大的对应的概率也大)
2.2 二分类与多分类的统一视角
一个有趣的事实是:当K=2时,so
