应用

游戏,仿真,不需要指定已知数据,根据反馈进行学习,比如AlphaGO.落地实现不多。

环境

pip install gym
官网地址:
gym.oepenai.com
Box2D
MuJoCo
rlSchool

基本算法

马尔科夫决策过程MDP、策略迭代、价值迭代、广义策略迭代、

最优价值算法

Q-learning、DQN改进

反向强化学习

反向强化学习,最大熵反向强化学习,GAIL

其他强化学习方法

稀疏回报求解、Model-based

基于策略梯度的算法

Actor-Critic算法:与gan相似,有A3C,A2C,使策略单调提升优化:TRPO,GAE、PPO
off-policy策略梯度法:Retrace、ACER、DPG、DDPG。

应用

在这里插入图片描述
其中环境的参数可以是指定的,智能体的参数需要不断进行学习。
1、在一个离散时间序列,t=0,1,2,…中,智能体需要完成某项任务。
2、在每个时刻t,智能体执行动作at,并在环境中得到状态st和回报rt,环境会对智能体的动作at做出反应,然后发送新的st+1和回报rt+1
3、智能体不会在被告知在当前状态下,应该采取哪一个动作,只能通过不断尝试每一个动作,依靠环境对动作的反馈,改善自己的行为,以适应环境。

回报

回报是强化学习的核心,是强化学习区别于其他机器学习的标志特征,
特点;衡量智能体在时间t上做的有多好,智能体的目标就是最大累计化回报。有立即回报和长期回报

智能体的组成-策略

策略是智能体的核心,最终目的就是找到一个策略,策略是决定智能体行为的机制,是状态到行为的映射。
策略分为确定性策略和随机策略。

智能体的组成-值函数

智能体从t时刻开始与环境交互,会产生多条不同的轨迹,不同轨迹的回报值不同,无法用回报值去衡量状态好坏,
值函数是对回报值的期望,可以用来评价当前状态的价值,从而指导动作的选择。
状态值函数:从状态s开始,遵循当前策略π所获得的期望回报
行为值函数:针对当前状态s执行行为a,继续遵循策略π与环境交互,所获得期望回报,
MuJoCo:mujoco.org:对关节进行控制。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐