Advertisement

该方法难以复现实验精度

阅读量:

实现论文实验的复现过程一直以来都是一个极具挑战性的任务,或者说,将实验结果精确地还原到与论文中一致的精度水平尤为困难。多数情况下,我们很难达到与原始文献相媲美的准确度,这主要归因于神经网络参数数量庞大、优化策略繁多以及参数初始化等一系列问题。通常情况下,论文中不会详细描述一些小细节的处理方式,或者作者可能掌握着某些未公开的“技巧”,因此我们常常难以再现其实验效果。

此前我曾尝试复现几篇研究论文中的实验内容,耗费了大量精力才最终完成,但最终得出的实验结果与原文中所报告的精度仍存在约2-3%的差距。由于原始文献并未开源代码,仅能依据其描述编写代码,在这种情况下很难判断问题究竟出在哪里,最终只能放弃继续尝试。

最近阅读到一篇关于网络优化的文章,感觉其中内容颇具启发性,并对复现实验代码具有实际帮助作用,因此将其整理记录下来。

一、提升模型训练效率
主要包括两个方面:一是选择更大的batch size进行训练;二是采用16位浮点型进行计算。
增大batch size能够在整体上加快模型训练的速度。然而一般而言仅通过增大batch size并不能显著提升效果,在这一领域已有不少相关研究工作发表。例如Facebook团队在《Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour》一文中总结了若干关键解决方案。

全部评论 (0)

还没有任何评论哟~