
前面四篇把机器学习的基础框架、数据准备、任务分类和树模型都聊了一遍。今天终于轮到重头戏了——神经网络。这是一个被过度神话又被过度低估的技术。被神话是因为媒体整天吹人工智能像人脑一样思考——纯属扯淡人工神经网络跟生物神经网络差了十万八千里。被低估是因为很多人觉得深度学习不就是堆层嘛谁不会啊——真要是一个模型几亿参数、训一个星期不崩那你试试看咱们从历史沿革走一遍顺便把这些东西为什么这样设计的逻辑讲清楚。感知机——神经网络的始祖简单到让人误会1958年Frank Rosenblatt发明了感知机Perceptron这是一个单层的神经网络——输入层、输出层中间一层权重。你把特征加权求和再过一个阶跃函数大于0输出1、小于0输出-1就完成了二分类。这是历史上第一个能从数据里学习的算法模型。它用的训练方法就是现在的随机梯度下降的雏形——预测错了就调整权重朝着误差减小的方向走。但1969年Marvin Minsky写了一本叫《感知机》的书数学证明了一个单层感知机连异或XOR这种简单的逻辑都学不了因为XOR在二维空间里线性不可分。这个结论直接浇灭了第一波神经网络的热情整个领域进入了长达十几年的AI冬天。多层感知机与反向传播——神经网络的真正奠基解决XOR问题的方案其实很简单——加一层隐藏层。通过一个中间层先把二维空间的点映射到三维空间在三维空间里XOR就线性可分了。这是一个几何直觉——增加维度可以让不可分的数据变得可分。但问题来了单层感知机的权重更新有明确的数学推导误差真实值-预测值多层网络里隐藏层的权重怎么更新你不知道隐藏层的输出该是多少。1986年Rumelhart、Hinton和Williams发表了那篇开创性的论文正式提出了反向传播算法Backpropagation。核心思想就是链式法则——从输出层往前推把输出层的误差分配到每一层上然后用梯度下降逐层更新权重。反向传播的提出是神经网络历史的转折点。因为从此以后你可以训练多层的、非线性的网络了——隐藏层可以有多层、每层可以有多个神经元只要你愿意可以堆到很深很深。激活函数——没有它再深的网络也是线性变换你可能会问堆那么多层有什么意义如果每层都是线性变换加权求和那多层叠加还是线性变换等价于一个单层网络。所以每一层之后必须加一个非线性激活函数让网络具备拟合任意复杂函数的能力。早期用的Sigmoid函数把输入压缩到(0,1)之间性质很好但有个致命的梯度消失问题——输入很大或者很小的时候导数趋近于0反向传播的梯度传不过来深层网络训不动。Tanh类似只是范围变成了(-1,1)。2011年ReLU修正线性单元横空出世就是max(0,x)——正数部分不变、负数部分截断为0。这个函数简单到令人发指但它在正数部分导数为1梯度不衰减大大缓解了梯度消失问题而且计算极其高效。从此ReLU成了深度学习的默认激活函数直到现在依然如此。卷积神经网络——给图像设计的天才结构全连接网络处理图像有一个致命问题——参数量太大。一张224x224x3的图摊平之后是15万个像素如果第一层就有1000个神经元那就是1.5亿个参数不光算不动而且极度容易过拟合。卷积神经网络的核心思想是局部连接和权值共享。用一个小尺寸的卷积核比如3x3在整个图像上滑动同一个卷积核的所有位置共享同一组权重。这样参数量被压缩到了几百几千个而且天然具备平移不变性——猫在图像的左上角还是右下角卷积核都能捕捉到它的边缘特征。1989年LeCun提出LeNet用在手写数字识别上是现代CNN的始祖。但真正引爆这个领域的是2012年的AlexNet——用GPU训练了一个8层的CNN在ImageNet图像分类比赛上把错误率从26%砍到了15%震惊了学术界和工业界。从此深度学习进入了大模型大数据大算力的暴力美学时代。循环神经网络——处理序列数据的记忆机制图像是静态的但语言、语音、时间序列是有先后顺序的。循环神经网络RNN的核心思想是记忆——每个时间步的输出不仅依赖当前输入还依赖上一个时间步传下来的隐状态。这就像你在读一段文字每个词的阅读理解都结合了前面所有词的上下文。LSTM和GRU是RNN的改进版通过门控机制解决了长序列中的梯度消失/爆炸问题——它们能记住几百步之前的信息而普通RNN只能记住几步。但RNN的顺序处理性质决定了它很难并行化——必须一个token一个token地跑GPU的大规模并行优势发挥不出来。这在处理长序列时成了瓶颈。Transformer——注意力机制彻底改变了一切2017年Attention Is All You Need这篇论文的发表是神经网络历史上仅次于反向传播的里程碑事件。Transformer抛弃了RNN的顺序处理完全依赖自注意力Self-Attention机制。自注意力的核心是序列里的每个元素都可以直接看到序列里的所有其他元素然后对不同的元素赋予不同的注意力权重加权汇总得到自己的新表示。这个操作可以并行化所有元素同时算而且能捕捉长距离依赖——不管两个词隔了多远注意力机制都能直接建立联系不像RNN要一步一步地传过去。Transformer加上了位置编码因为没有了顺序输入必须人工告诉模型谁在前谁在后、多头注意力多组注意力并行、残差连接和LayerNorm防止深层网络退化再加上海量数据和超大规模算力成就了GPT、BERT、LLaMA等一系列横扫全领域的大模型。Transformer的出现让神经网络架构设计这件事不再有图像用CNN、语言用RNN的分野了。现在一个Transformer架构可以干CV、NLP、语音、多模态所有活儿——这也是为什么很多人说Transformer就是深度学习的第一性原理。神经网络的未来——更大更小还是更聪明过去十年的发展模型规模从几百万参数膨胀到了几千亿数据量从几十万样本膨胀到了几万亿token。这种暴力堆料的模式还能持续多久现在没人说得清楚。但有几个方向是明确的一是效率优化——如何用更少的算力和更少的数据达到同样的效果。模型蒸馏、量化、剪枝、稀疏计算这些会越来越重要。二是架构探索——Transformer的自注意力是O(n²)复杂度处理长序列时捉襟见肘。Mamba这类基于状态空间模型的新架构正在挑战Transformer的霸主地位未来三年可能会出现新的范式级突破。三是多模态融合——文本、图像、视频、语音、3D点云把所有这些模态在同一个模型里统一处理这是通往世界模型的必经之路。神经网络的故事远远没有结束我们还在半山腰上。