ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

(2017|ICLR|Google Brain,主网络与超网络联合训练,静态/动态超网络,LSTM,RNN)超网络

(2017|ICLR|Google Brain,主网络与超网络联合训练,静态/动态超网络,LSTM,RNN)超网络 HyperNetworks论文地址https://arxiv.org/abs/1609.09106学术交流群922230617目录1. 引言2. 动机与相关工作3. 方法3.1 静态超网络为卷积网络生成权重3.2 动态超网络为循环网络自适应生成权重4. 实验4.1 静态超网络用于 MNIST 卷积网络4.2 静态超网络用于 CIFAR-10 残差网络ResNet4.3 HyperLSTM 用于字符级 Penn Treebank 语言建模4.4 HyperLSTM 用于 Hutter Prize Wikipediaenwik84.5 HyperLSTM 用于手写序列生成IAM4.6 HyperLSTM 用于神经机器翻译WMT14 En→Fr1. 引言在深度学习中通常直接训练网络的权重参数。论文提出一种新思路使用一个小型网络称为超网络来生成另一个更大网络称为主网络的权重。主网络的行为与普通神经网络无异——学习将输入映射到目标输出而超网络则接收包含层结构信息的输入如层 embedding 向量并生成该层的权重。这种设计受进化计算中的HyperNEAT启发但论文的超网络完全通过反向传播端到端训练因此更高效、可扩展。超网络可以看作一种 “基因型-表型” 关系超网络编码了主网络的结构。论文聚焦两个应用方向静态超网络为卷积网络生成滤波器。动态超网络为循环网络RNN/LSTM动态生成每时间步的权重。主要贡献超网络生成的非共享权重的 LSTM在字符级语言建模、手写生成、神经机器翻译上取得接近或超越 SOTA 的结果挑战了循环网络“权重共享”的固有范式。同时超网络在卷积网络上用更少参数取得了有竞争力的图像识别精度。【2026|CVPR Oral|NITR模型压缩权重调制参数映射映射网络映射网络的作者在论文中指出其研究是一种超网络。区别在于超网络联合训练超网络与主网络目标网络而映射网络冻结正交初始化的映射矩阵只训练一维的潜在向量。因此产生了第二个差异由于潜在向量通常是低维的远小于目标网络的参数量因此映射网络实现了大幅度参数压缩。】2. 动机与相关工作传统进化方法如 HyperNEAT通过演化 CPPN 来定义大网络权重但训练慢且依赖启发式。压缩权重搜索DCT使用固定变换过于简单。DPPN可微但规模有限。论文与上述方法的关键区别端到端梯度下降训练效率高。论文也受到快速权重fast weights概念的启发Schmidhuber, 1992其中网络可产生上下文依赖的权重变化。早期实验限于前馈网络而论文首次将此类方法成功应用于大规模循环网络LSTM。此外论文采用层 embedding 向量作为超网络输入而非 HyperNEAT 中的坐标输入这使得超网络能适用于卷积和循环架构且能实现层内和层间近似权重共享。3. 方法3.1 静态超网络为卷积网络生成权重每个卷积核包含 N_in × N_out 个 filters每个 filters 的尺寸为 f_size × f_size。假设这些参数存储在矩阵 K_j ∈ R^{N_in · f_size × N_out · f_size} 中其中 j 1, ..., D 是主卷积网络的深度。超网络接收一个可学习的层 embedding 向量z^j ∈ R^{N_z​}通过超网络 g 生成该层全部权重处理不同尺寸的核实际网络中如 ResNet各层通道数不同16、32、64 等。论文设定一个基础尺寸如 16若需要 32×64 的核则通过拼接 8 个基础核每个由独立的embedding生成组成大核需要更多 embedding 向量参数量成比例增加。实验显示超网络生成的卷积核在 MNIST 上与传统学习的核结构相似见图 2证明了其有效性。3.2 动态超网络为循环网络自适应生成权重标准 RNN其中权重 W 和偏置 b 在任意时刻 t 固定不变。动态超网络允许权重随时间步变化其中z_h,z_x,z_b 由一个小型循环超网络根据当前输入 x_t 和上一时刻隐状态 h_{t−1} 生成。内存优化直接生成完整矩阵需要 N_z 倍内存不实际。论文采用行缩放策略不重新生成整个矩阵而是生成一个缩放向量 d(z)用它来缩放一个固定的基础矩阵的每一行内存需求从 N_z × N_h × N_h 降为 N_z × N_h​且计算为逐元素乘法十分高效。该操作与 Layer Normalization、Multiplicative RNN 有相似性但论文的缩放向量是数据依赖且随时间变化的。将此思想扩展至 LSTM得到HyperLSTM。每个门输入、遗忘、输出、细胞更新的权重矩阵都由超网络生成的缩放向量调整。超网络本身也是一个 LSTM带 Layer Norm其隐状态通过线性投影生成各个门的embedding。4. 实验4.1 静态超网络用于 MNIST 卷积网络主网络两层卷积第二层核为 7×7×16×1612,544 参数超网络embedding大小 N_z 4超网络参数 4,240结果测试精度 99.24% vs 传统 99.28%参数量大幅减少。4.2 静态超网络用于 CIFAR-10 残差网络ResNet使用 Wide ResNetWRN-40-1 和 WRN-40-2超网络生成 conv2、conv3、conv4 共 36 层卷积核。精度损失约 1.25~1.5%但参数量减少为原来的 1/6~1/15说明超网络提供了良好的权衡。4.3 HyperLSTM 用于字符级 Penn Treebank 语言建模任务预测下一个字符评价指标 BPCbits-per-character主 LSTM1000 或 1800 单元超网络 128 单元embedding 大小 4对比普通 LSTM、Layer Norm LSTM、堆叠 LSTMHyperLSTM 优于普通 LSTM与 Layer Norm 结合达接近 SOTA且收敛更快。4.4 HyperLSTM 用于 Hutter Prize Wikipediaenwik8数据集100M 字符205 个唯一字符更复杂主 LSTM1800/2048 单元超网络 256/512 单元接近当时 SOTA。生成样本分析权重变化强度显示在确定性词语如 Europeans中变化小在单词间或括号处变化大说明超网络在动态切换模型。隐藏状态直方图HyperLSTM 的细胞状态常处于饱和区与 Layer Norm 的去饱和策略不同但两者性能相近说明超网络学到的策略并非简单归一化。4.5 HyperLSTM 用于手写序列生成IAM任务预测笔迹 (x,y) 坐标和提笔/落笔状态使用 MDN混合密度网络序列长度平均 700 步最长 1900 步HyperLSTM 显著优于基线收敛速度与 2 层 LSTM 相当。生成样本更连贯权重变化集中在单词或字符之间呈现“跳变”模式。4.6 HyperLSTM 用于神经机器翻译WMT14 En→Fr模型Google GNMT 架构将 LSTM 替换为 HyperLSTM结果HyperLSTM 达到当时单模型 SOTA且 log 困惑度降低证明了超网络在大规模生产级任务中的实用性。
返回列表