1. 神经网络基础:从感知机到多层感知机(MLP)
在人工智能领域,神经网络已经成为解决复杂问题的核心工具。作为一名长期从事深度学习研究的工程师,我发现很多初学者在入门时都会遇到一个共同的问题:面对CNN、RNN、Transformer等复杂模型时感到无从下手。其实,这些复杂模型的核心思想都源于最基础的多层感知机(MLP)。今天,我就带大家从最基础的感知机开始,一步步拆解神经网络的核心逻辑。
1.1 为什么要从感知机开始?
1943年,麦卡洛克和皮茨提出了MP模型,这是第一个真正意义上模拟生物神经元工作的数学模型。14年后,心理学家弗兰克·罗森布拉特在这个基础上提出了感知机(Perceptron),开启了人工智能连接主义的第一个高潮。
感知机的重要性在于它奠定了神经网络最基础的工作机制:输入信号→加权处理→激活输出。这种机制至今仍然是所有神经网络模型的核心。理解感知机,就相当于掌握了神经网络的"基因密码"。
提示:在学习神经网络时,建议把每个概念都和生物神经元的工作机制进行类比,这样理解起来会更加直观。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 感知机:神经网络的雏形
2.1 感知机的结构与工作原理
感知机的结构极其简单,主要由三部分组成:
- 输入层:接收外部信号,每个输入对应一个特征值
- 权重与偏置:决定每个输入信号的重要性
- 输出层:通过激活函数产生最终输出
用数学公式表示就是:
$$z = \sum_{i=1}^n w_ix_i + b$$
$$output = step(z) = \begin{cases}
1 & \text{if } z \geq 0 \
0 & \text{otherwise}
\end{cases}$$
这个简单的模型却能完成很多基础任务。比如,我们可以训练一个感知机来判断一封邮件是否是垃圾邮件:
- 输入x1:邮件中包含"免费"这个词的次数
- 输入x2:邮件中包含"赢取"这个词的次数
- 输出:1表示垃圾邮件,0表示正常邮件
2.2 感知机的训练过程
感知机使用错误驱动的方式进行训练,其权重更新规则可以表示为:
$$w_i \leftarrow w_i + \eta(y_{true} - y_{pred})x_i$$
$$b \leftarrow b + \eta(y_{true} -
