ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

机器学习与深度学习(李宏毅)day5

机器学习与深度学习(李宏毅)day5 鱼与熊掌可以兼得的机器学习当有同样大小的模型的时候与其把network变胖不如把network变高会更容易得到好的结果。deeplearning里layer的作用就相当于剪窗花的时候把纸对折。如果目标function让loss很低的那个function是复杂且有规律的语音、影像等问题那么deep的network会优于shadow的network结论深度学习是一个可以让与跟熊掌兼得的方法通过深度学习有机会在比较少的参数量的情况下得到比较低的loss。自注意力机制Selfattention上第一种情况也称为Sequence Labeling本节课讲的内容self-attention运作机制会吃一整个sequence的信息input几个vector就会输出几个vector每个vector都是考虑了整个sequence才得到的。再把这个考虑整个句子的向量丢进fully connected的network。这样fully connected的network就不是只考虑一个非常小的范围而是考虑一整个句子的信息再选择要输出什么结果。产生b1向量过程:根据a1找出sequence里和a1相关的其他向量这里用Dot-product的方法计算出q和v把v1到v4每个向量都乘上attention的分数α再加起来其中谁的attention分数最大谁抽出来的结果就最好。依次得到b1,b2,b3,b4即为下图自注意力机制Selfattention下若把k组成矩阵的形式择α可以表示为softmax作用让每个α的值相加等于一只有WqWkWv是需要通过training data找出来的其他的都是设定好的。Multi-head Self-attentionSelf-attention的一种变形如果想要加上位置的相关信息就可以用Positional Encoding当Self-attention应用于语音处理的时候会需要很大的memory来存储语音的attention metrix所以就能用Truncated Self-attention不看一整句话而只看一个小的范围Self-attention和CNN的比较CNN可以看作一种简化版的Self-attention因为在做CNN的时侯只考虑receptive field里面的信息而在做Self-attention的时候考虑的是整张照片的信息。Self-attention只要设置合适的参数就能做到跟CNN一样的事情Self-attention弹性比较大所以需要较多的训练资料训练资料少的时候就会Overfitting而CNN弹性比较小在训练资料比较少的时候结果比较好但训练资料多的时候就会没办法从更大的训练资料得到好处。Self-attention和RNN的比较比如最右边的vector要考虑最左边的input那么必须要把最左边的输入存在memory里并且不能忘掉一路带到最右边才行而Self-attention就没有这个问题只要最左边输出一个query最右边输出一个key就能连接起来。RNN在input或ouput一排sequence的时侯没办法平行化只能依次产生向量。而Self-attention可以平行处理所有的输出Self-attention也能用在图上面图里每个node之间是有edge来表示关联性的Self-attention就可以只考虑相连的nodes。类神经网络训练(五)批次标准化通过Feature Normalization使不同dimension的数值都在0上下就可以制造出一个比较好的error surface这样就会对training有帮助在做gradient descent的时侯loss收敛会更快一点。在激活函数之前或之后做Feature Normalization的差异不大。
返回列表