Advertisement

ADAM is a method for stochastic optimization

阅读量:

核心

Adam是一种基于低阶矩自适应估计的随机目标函数一阶梯度优化算法,该方法具有实现简便、计算效率高、内存占用少等特点,且对梯度的对角线部分具有重新缩放不变性。此外,该算法特别适用于数据量庞大、参数数量众多或二者兼具的问题场景,同时也能够处理非平稳目标函数以及存在噪声干扰或梯度稀疏的情况。

  • 数据规模大\参数数量多\数据规模与参数数量均较大
  • 非平稳目标函数
  • 噪声干扰\梯度稀疏\噪声干扰与梯度稀疏并存
    该算法所涉及的超参数具备明确的物理意义,在实际应用中通常无需进行过多调整。文中探讨了Adam算法与其相关启发算法之间的内在联系,并从理论上分析了其收敛性质,同时给出了在收敛速度及在线凸优化框架下的regret bound。实验结果验证了Adam在实际应用中的优异表现,其效果优于其他多种随机优化方法。最后还对基于无限范数的Adam改进形式进行了探讨。

介绍

随机梯度优化在众多科学与工程领域中具有重要的实际应用价值。在这些领域中,许多问题可以被重新表述为对某些标量参数化目标函数进行优化的问题。需要对这些参数实施最大化或最小化操作。若该目标函数对于其参数具有可微性,则梯度下降方法成为一种相对高效的求解手段。这是因为,计算所有参数的一阶偏导数与仅计算目标函数本身的复杂度保持一致。通常情况下,目标函数本身具有随机性,例如:许多目标函数由在不

全部评论 (0)

还没有任何评论哟~