强化学习是什么
应用
游戏,仿真,不需要指定已知数据,根据反馈进行学习,比如AlphaGO.落地实现不多。
环境
pip install gym
官网地址:
gym.oepenai.com
Box2D
MuJoCo
rlSchool
基本算法
马尔科夫决策过程MDP、策略迭代、价值迭代、广义策略迭代、
最优价值算法
Q-learning、DQN改进
反向强化学习
反向强化学习,最大熵反向强化学习,GAIL
其他强化学习方法
稀疏回报求解、Model-based
基于策略梯度的算法
Actor-Critic算法:与gan相似,有A3C,A2C,使策略单调提升优化:TRPO,GAE、PPO
off-policy策略梯度法:Retrace、ACER、DPG、DDPG。
应用

其中环境的参数可以是指定的,智能体的参数需要不断进行学习。
1、在一个离散时间序列,t=0,1,2,…中,智能体需要完成某项任务。
2、在每个时刻t,智能体执行动作at,并在环境中得到状态st和回报rt,环境会对智能体的动作at做出反应,然后发送新的st+1和回报rt+1
3、智能体不会在被告知在当前状态下,应该采取哪一个动作,只能通过不断尝试每一个动作,依靠环境对动作的反馈,改善自己的行为,以适应环境。
回报
回报是强化学习的核心,是强化学习区别于其他机器学习的标志特征,
特点;衡量智能体在时间t上做的有多好,智能体的目标就是最大累计化回报。有立即回报和长期回报
智能体的组成-策略
策略是智能体的核心,最终目的就是找到一个策略,策略是决定智能体行为的机制,是状态到行为的映射。
策略分为确定性策略和随机策略。
智能体的组成-值函数
智能体从t时刻开始与环境交互,会产生多条不同的轨迹,不同轨迹的回报值不同,无法用回报值去衡量状态好坏,
值函数是对回报值的期望,可以用来评价当前状态的价值,从而指导动作的选择。
状态值函数:从状态s开始,遵循当前策略π所获得的期望回报
行为值函数:针对当前状态s执行行为a,继续遵循策略π与环境交互,所获得期望回报,
MuJoCo:mujoco.org:对关节进行控制。
更多推荐
所有评论(0)