学习笔记-Large Scale Machine Learning Notes
发布时间
阅读量:
阅读量
随着项目进入倒数第二周,本章重点探讨了如何处理大规模样本的机器学习任务,例如训练集包含五百万个样本的情况。
此前我们曾指出,样本数量的多少在某种程度上会影响模型性能,当数据量达到特定规模后,不同算法所得到的结果趋于一致。有一句广为流传的话指出,“最终取得胜利的往往是掌握最多数据资源的人,而非拥有最优算法的人”。

尽管持续增加训练样本数量并不总能带来积极效果,但我们需要建立相应的评估标准,以判断在何种情形下扩大样本量能够产生正面影响。如左图所示的情形,增加样本数量仍具有一定的积极作用;然而右图所呈现的情况则表明,继续扩充样本量已无法带来改善,此时或许应当考虑引入更多的特征变量以提升模型性能。

1. Stochastic gradient descent
随机梯度下降属于梯度下降方法中的一种特定类型。以此前所学的在线性回归问题中应用梯度下降算法为例,
全部评论 (0)
还没有任何评论哟~
