不用数学公式或代码实现AI控制技术‘强化学习’算法框架。举生活实例说明
发布时间
阅读量:
阅读量
不用公式、不用代码,白话讲讲强化学习原理
The best way to learn is to teach others.
AlphaGo 击败世界围棋冠军李世石……AlphaStar 制服星际争霸2冠军……现代智能系统的技术架构大多依赖于这一强大的算法框架。有人认为强化学习是一种基于错误修正的学习机制,在状态-动作空间中构建高效的映射关系?经过半年的学习与实践,我认为强化学习使实时决策能够超越短视的局限。本文将结合一个日常生活的实例——“小赛能否按时完成假期作业”来探讨这一前沿技术的应用前景。
在说强化学习之前,我们先来聊聊他的两个兄弟:监督学习和无监督学习。
监督学习
监督学习就是,你喂给机器一堆有标签的数据,比如下表这样。
| 特征值 | 标签 |
|---|---|
| 小明, 爱穿裙子, 出门前化妆 | 女孩 |
| 小张, 不穿裙子, 出门前不妆 | 男孩 |
| … | … |
| 小何, 爱穿裙子, 出门前不妆 | 男孩 |
在经历对带标记数据的学习过程后(经过对有标签数据的训练/学习后),我们获得了这样一个分类器或回归器;通过分析无标记数据(根据无标签的数据),我们能够基于此推断其类别(推测出其标签)。
| 特征值 | AI所推测出的标签 |
|---|---|
| 小钗, 爱穿裙子, 出门前化妆 | 女孩 |
| 小黛, 爱穿裙子, 出门前化妆 | 女孩 |
全部评论 (0)
还没有任何评论哟~
