Mxnet 29: Adagrad优化方案
发布时间
阅读量:
阅读量
1. 稀疏特征和学习率
在模型训练过程中,常常会出现稀疏特征(即发生频率较低的特征),这一现象在自然语言处理领域尤为常见。例如,“预处理”这一词汇的出现频率通常远低于“学习”一词。此外,在诸如计算广告以及个性化协同过滤等其他领域中,此类特征同样广泛存在,因为许多事件或内容仅受到少数用户的关注,这正是长尾经济所体现的特点。
当学习率逐渐下降时,可能会出现以下情况:对于高频特征而言,其参数能够迅速收敛至最优值;然而对于低频特征,在尚未获得足够多的观测数据之前,其参数的调整过程可能仍显不足。换句话说,在面对高频特征时,学习率下降的速度过慢;而在面对低频特征时,则可能下降得过于迅速。
针对上述问题,一种有效的应对策略是统计特定特征被观察到的次数,并将该统计结果作为调整学习率调度策略的依据。
2.AdaGrad算法特性分析
AdaGrad算法通过小批量随机梯度 g_t,借助 s_t 来累计历史梯度的平方值:
$\begin{aligned} \mathbf{g}t & = \partial{\mathbf{w}} l(y_t, f(\mathbf{x}_t, \mathbf{w})), \ \mathbf{s}t & = \mathbf{s}{t-1} + \mathbf{g}_t^2, \ \mathbf{w}_t & = \mathb
全部评论 (0)
还没有任何评论哟~
