AI大模型与数学 第6课:导数定义、几何意义、导数四则运算、全套基本求导公式推导
本课核心定位(AI最重要一课)
从这一课开始:数学真正进入AI训练核心。
课前说点我的感受,刚看到这的小伙伴或许有些困惑或疲惫,相信我继续看下去,我是看到第七八课左右开始有些开朗,看到十几课的时候豁然开朗,等到三十课的时候打通经脉的那样开朗,数学真的会让你上瘾,特别是数学与ai的结合当你看懂时会觉得居然如此精妙,妙不可言的神奇感,而且你的思维会有质的飞跃。
前面课程:
函数、极限、连续、无穷小 —— 搭建了模型的静态结构
本课导数:开启模型的动态训练
前几课是准备小汽车材料,这节课小汽车开起来,未来课小汽车怎么开往哪开开心。
一句话:
极限是“状态”,导数是“变化速度”,大模型训练就是全程在算导数。
所有 AI 核心技术:
梯度下降
反向传播
参数更新
学习率
模型收敛、发散
全部 = 导数的工程落地
没有导数,神经网络无法学习、无法更新参数、没有智能。
一、导数定义(极限定义,根源推导)
增量定义式
设函数 y=f(x),在 x 处给一个微小增量 \Delta x
变化率:
\frac{\Delta y}{\Delta x}
=\frac{f(x+\Delta x)-f(x)}{\Delta x}
当 增量趋近无穷小:
f’(x)=\lim_{\Delta x \to 0}\frac{f(x+\Delta x)-f(x)}{\Delta x}
大白话解释
\Delta x:微小扰动、微小变化
\Delta y:结果的变化量
导数 = 瞬间变化速度
面包厂类比(终极易懂)
x:烘烤温度
f(x):面包口感分数
\Delta x:温度微调一点点
\Delta y:口感变化多少
导数 = 温度每变1度,口感变好还是变差、变多快
AI 对应(梯度本质)
导数 = 梯度
输入微小变化
损失值变化多少
模型知道:参数该往哪边调、调多少反向传播本质:逐层求导。
二、导数几何意义
f’(x_0) = \text{曲线在 }x_0\text{ 点切线斜率}
通俗理解
函数曲线越陡 → 导数越大 → 梯度大,更新幅度大
函数曲线越平 → 导数越小 → 梯度小,更新慢
水平谷底 → 导数=0 → 模型收敛、训练停止
AI落地绝杀对应
- 梯度大(陡坡):模型误差大,大步更新参数
- 梯度小(缓坡):模型接近最优,微调参数
- 梯度为0(谷底):损失最小,模型收敛
职场类比
导数 = 工作改进速度
刚开始:漏洞多、改进快(大梯度)
后期:趋近完美、改进极慢(小梯度)
三、可导与连续的关系(AI核心)
定理
可导一定连续,连续不一定可导
AI解释
- 可导:曲线平滑、有梯度、可以训练
- 不可导:尖角、折点,无梯度、无法更新参数
典型不可导:ReLU的0点、绝对值函数尖角
四、导数四则运算法则(神经网络层融合核心)
设 u(x),v(x) 均可导:
和差法则
(u\pm v)’ = u’\pm v’
AI意义:多特征梯度叠加、残差连接梯度
数乘法则
(k u)’ = k\cdot u’
AI意义:学习率缩放梯度!!(超级核心)
学习率 lr 本质就是导数前面乘的常数 k
乘法法则(极重要)
(uv)’ = u’v + uv’
AI意义:注意力机制、权重×特征双向梯度传播
除法法则
\left(\frac{u}{v}\right)‘=\frac{u’v-uv’}{v^2}
AI意义:归一化、向量标准化梯度更新
神经网络每层矩阵运算,全部由四则求导堆叠而成
五、全套基本求导公式【从零完整推导】
常数函数
©’ = 0
推导:常数无变化,变化速度为0
AI:固定偏置不参与梯度更新
幂函数(全网用的最多)
(x^\alpha)‘=\alpha x^{\alpha-1}
推导:极限二项式展开消去无穷小
特例:
(x^2)’=2x,\quad (x)‘=1
AI:损失函数MSE、多项式拟合全部靠它
指数函数(AI第一核心公式)
(e^x)’ = e^x
本课重点推导(依托第4课重要极限)
(e^x)‘=\lim_{\Delta x\to0}\frac{e^{x+\Delta x}-e^x}{\Delta x}
=e^x\lim_{\Delta x\to0}\frac{e^{\Delta x}-1}{\Delta x}=ex\cdot1=ex
AI史诗级意义
e的导数是自身
所以:
Softmax
交叉熵损失
概率模型
全部稳定可导、梯度不消失、不爆炸
这是人类选择自然常数e搭建AI概率体系的终极原因。
对数函数
(\ln x)’=\frac{1}{x}
AI:交叉熵损失核心求导项
三角函数全套
(\sin x)‘=\cos x
(\cos x)’=-\sin x
AI:
正弦位置编码
时序模型
傅里叶特征网络
六、导数 = AI梯度下降的完整底层逻辑(本课升华)
导数正 → 函数上升
损失变大 → 参数反向更新
导数负 → 函数下降
损失变小 → 顺着梯度方向优化
导数0 → 极值点
模型收敛、训练结束
一句话打通大模型训练
每一轮 Epoch,本质就是:求导 → 取负 → 乘学习率 → 更新参数
W_{new} = W_{old} - \eta \cdot \frac{dLoss}{dW}
你看:全程只用导数四则运算
七、本课终极统一类比
- 函数 = 面包店固定工艺规则
- 复合函数 = 多层加工流水线
- 极限 = 无限逼近完美状态
- 连续 = 工艺稳定无跳变
- 导数 = 微调工艺、判断变好还是变差、更新工艺参数
AI训练本质:
用导数不断微调面包店亿万参数,让成品无限逼近人类完美口感味道。
八、本课AI落地总结(可直接写论文)
- 所有神经网络参数更新 完全依赖导数
- 学习率就是导数的数乘系数
- 注意力权重更新依赖乘法求导
- 归一化层依赖除法求导
- e指数函数自导性质保障大模型梯度稳定
- 不可导点导致训练震荡、不收敛
九、课后习题(基础求导20道)
基础公式类
- y=x^5
- y=\sqrt{x}
- y=\dfrac{1}{x}
- y=3x^2+2x+1
- y=e^x+5
- y=\ln x+2x
- y=\sin x - \cos x
四则运算进阶 - y=x^2 \cdot e^x
- y=x\ln x
- y=\dfrac{x}{x+1}
- y=(x^2+1)\sin x
- y=3x^3 - 2e^x
简单复合铺垫(为下一课链式法则) - y=(x+1)^2
- y=\sin(x)\cdot \cos(x)
- y=e^x \ln x
拔高理解(AI梯度风格) - y=x^2-4x 求极值点
- y=e^{-x} 求导(模拟衰减梯度)
- y=\ln(1+x) 求导(损失函数原型)
- y=2x^2-8x+3 找导数为0点
- 解释:为什么 e^x 是AI最完美的激活基底函数?
下一课预告 第7课
链式法则、复合函数求导、多层神经网络反向传播数学本源
(真正看懂GPT反向传播的一课)