不动点理论在《A Distributional Perspective on Reinforcement Learning》的研究中被应用
发布时间
阅读量:
阅读量
fixed point理论是 Banach Space 中的central理论工具。它常用于探讨该空间中解的存在性,并由此发展出通过迭代方法求解问题的算法。在文献[1]中,fixed point理论处于整个算法的核心地位,并以分布式Bellman方程替代期望值Bellman方程作为其理论基础。本文将系统地进行分析:第一部分介绍基于固定点的迭代算法;第二部分深入探讨分布式的不动点解析。
一、Fixed Point的迭代算法
2
2
如上定义中指出:当源空间X与目标空间Y完全一致时,并且测度保持不变;其中X是一个Banach空间(即非空、完备的赋范空间),则有如下不动点定理:
定理4.8(巴拿赫不动点定理)
若X是一个非空、完备的赋范空间且函数f: X→X满足收缩条件,则f在其定义域内存在唯一的一个固定点x₀∈X满足f(x₀)=x₀。
巴拿赫空间作为一种特殊的非空、完备的测度空间(metric space),其对应的不动点定理能够保证任意满足收缩条件的映射在该空间内必定存在且唯一对应于一个固定点(a unique fixed-point)。选取任意初始点x₁并将其代入映射得到x₂=f(x₁),再将新得到的结果继续代入映射得到x₃=f(x₂),如此反复迭代生成序列{xₙ}ₙ≥1={f(xₙ₋₁)}ₙ≥1};根据巴拿赫不动点定理可知该序列必定收敛于固定点
全部评论 (0)
还没有任何评论哟~
