|
1
3
DR tf对nesterov的实现实际上是原始公式的一个近似,对动量的高值有效。 细节 这是个很好的问题。在本文中,nag更新定义为
哪里
与标准动量的主要区别在于
技巧的一部分实际上在您引用的文档中提到:算法是跟踪
为了使累加器符合tensorflow的定义,让我们稍微改变一下纸上的符号。让我们来定义
(tf的这种变化的动机是现在
如果我们注意到
最后一个近似值适用于动量的强值,其中
我们现在有了一个使用当前位置梯度的更新,规则非常简单——它们实际上是标准动量的规则。
但是,我们希望
|
|
2
1
我在网上看不到这方面的任何信息,而且链接的报纸肯定没有帮助,所以我看了一下
unit tests for
总结
哪里
换句话说,在我看来
下面将更详细地介绍如何在
经典动量模式
为了
实际上,以上只是
我要解释为意义;
如果我们假设为了单元测试的目的
nesterov加速梯度(nag)模式
为了
这个
它在单元测试中被调用,如下所示:
|