Advertisement

不用数学公式或代码实现AI控制技术‘强化学习’算法框架。举生活实例说明

阅读量:

不用公式、不用代码,白话讲讲强化学习原理

The best way to learn is to teach others.

AlphaGo 击败世界围棋冠军李世石……AlphaStar 制服星际争霸2冠军……现代智能系统的技术架构大多依赖于这一强大的算法框架。有人认为强化学习是一种基于错误修正的学习机制,在状态-动作空间中构建高效的映射关系?经过半年的学习与实践,我认为强化学习使实时决策能够超越短视的局限。本文将结合一个日常生活的实例——“小赛能否按时完成假期作业”来探讨这一前沿技术的应用前景。

在说强化学习之前,我们先来聊聊他的两个兄弟:监督学习和无监督学习。

监督学习

监督学习就是,你喂给机器一堆有标签的数据,比如下表这样。

特征值 标签
小明, 爱穿裙子, 出门前化妆 女孩
小张, 不穿裙子, 出门前不妆 男孩
小何, 爱穿裙子, 出门前不妆 男孩

在经历对带标记数据的学习过程后(经过对有标签数据的训练/学习后),我们获得了这样一个分类器或回归器;通过分析无标记数据(根据无标签的数据),我们能够基于此推断其类别(推测出其标签)。

特征值 AI所推测出的标签
小钗, 爱穿裙子, 出门前化妆 女孩
小黛, 爱穿裙子, 出门前化妆 女孩

全部评论 (0)

还没有任何评论哟~