1.概念理解
①原始残差:X输出=X+F(X)
原始残差:输出等于输入加上对输入做的改变,让模型只需要学习“差了哪一点”。
②HC:X输出=Mapping[X]+Mapping [F₁(X), F₂(X), ..., Fₙ(X)]ᵀ
注:Mapping矩阵[X]+Mapping矩阵[将X变为n 条并行的分支变换(每条都可以是不同的操作,比如线性投影、激活、甚至子网络)进行输出拼接]
HC:输出是把原始输入和原始输入经过多条不同路径改变后的结果全部拼在一起,再整体用Mapping矩阵转换一次。注:这里矩阵没限制。
③mHC:X输出=Mapping[X]+Mapping [F₁(X), F₂(X), ..., Fₙ(X)]ᵀ
注:只是这个Mapping矩阵限制为双随机矩阵,就是行列加起来都为1,来保持训练稳定。
mHC:和HC一样,但最后转换时的权重被Mapping矩阵限制成每一行、每一列加起来都是1,从而自动保持数值稳定。
④注意力残差:X输出=Z+F(X)
注:10层一块,其中Z是前面所有块输出的加权和
块内:沿用原始的残差连接(等权求和),作为基础信息的稳定积累管道。
块间:每个块被压缩为一个表征向量,后续块在计算Z时,通过注意力机制(加权求和) 来决定如何聚合这些块级信息
注意力残差:输出等于前面所有块(10层一块)输出的加权总和,加上当前层内部的改变量,其中权重由注意力机制自动分配。
2.总结比较
3.图示
图1(a)传统残差 与(b)HC 与c(mHC)
图2注意力残差
哲学视角
“残差不是绕路,而是捷径。”
—— 四种设计将信息传递拆解为直连(原始残差)、多路复用(HC)、正则约束(mHC)与全局累积(注意力残差),让神经网络既能保留原始特征,又能灵活融合多分支变换,同时避免训练不稳定。这恰是对“学而时习之,不亦说乎”的工程化复现:原始残差保证了梯度直达与恒等映射,HC通过并行分支的拼接拓宽了表示维度,mHC用双随机矩阵维持能量守恒与训练平稳,注意力残差则让历史层输出加权贡献——每一次前向传播,都站在过往激活的阶梯上,望向更深的地方。