Advertisement

C++ 学习 四八五 AlphaGo 硬件与算法

阅读量:

1、硬件

在维基百科平台上,可以查阅到多个版本的AlphaGo所采用的硬件配置信息:

在击败李世石的版本中,系统(AlphaGo Distributed)配置了1202个CPU处理器与176个GPU单元,并能够同时运行40条搜索线程。

2、算法

AlphaGo的整体技术框架可以概括为:深度卷积神经网络(CNN)结构与蒙特卡洛树搜索算法(Monte Carlo Tree Search)的融合。

通过深度学习神经网络,系统训练出了两个落子策略模型以及一个局面评估模型,这三个模型的神经网络架构大致相同,主要差异体现在参数设置上。

落子策略包括SL(监督学习策略网络)和RL(强化学习策略网络)两种类型。

SL策略是通过对人类对弈棋局的学习,模拟在特定棋局状态下人类如何选择落子位置。这一过程完全基于人类下棋经验的积累,其目标是:当面对某一具体棋局形式时,预测人类可能采取的落子方式。AlphaGo正是通过分析大量的人类对弈数据,从而掌握这类落子策略,使得SL策略能够模仿人类进行下一步棋的选择。

![](https://ad.itadn.com/c/weblog/blog-img/ima

全部评论 (0)

还没有任何评论哟~