AI大模型与数学·第45课 级数刷题集训2:数列收敛VS级数收敛(AI数值稳定性核心) 一、本课定位上一节我们建立了级数认知:AI的智能来自「级数无限逼近」本课解决整个AI训练最容易混淆的数学问题:90%的人分不清两件事数列收敛(单项越来越小)级数收敛(无限累加不爆炸)AI梯度爆炸、Loss抖动、训练崩溃、模型不收敛,全部来自这两个概念。我们巩固一下,数列与级数在大模型中的应用与区别数列:按次序排出来一串数;级数:数列逐项相加的无穷求和。数列管迭代过程;级数管函数逼近、收敛判断、截断计算,是大模型训练、推理、理论证明的底层数学工具。一、数列在大模型的应用梯度下降迭代数列权重更新:w_{k+1}=w_k-\eta \nabla L(w_k)每一轮权重 w_0,w_1,w_2…w_k 构成数列。数列收敛:权重逐步稳定,损失下降,训练正常;数列发散:学习率过大,权重震荡爆炸,训练崩溃。大模型训练本质就是看参数数列是否收敛。文本token序列(离散数列)输入句子拆成token编号 [t_1,t_2,t_3…t_n],就是离散整数数列。Transformer全部工作就是建模这个数列内部依赖;自注意力计算数列各个位置之间关联。解码器生成文本,是一步一步产出token,生成的输出本身就是不断延长的数列。残差网络、多层堆叠数列每一层网络输出 x_1,x_2…x_L,构成状态数列;残差连接保证这个数列不会快速发散,缓解梯度消失。二、级数(泰勒级数、幂级数、傅里叶级数)核心应用激活函数的多项式逼近(泰勒级数)计算机硬件不会直接算 e^x、\tanh、\text{GELU},把函数展开成泰勒无穷级数,只取前有限项做近似计算。ex=1+x+\