isaaclab中强化学习的PPO Runner 配置类里的参数配置文件解析
·
| 参数 | 类别 | 作用 |
|---|---|---|
| num_steps_per_env | rollout | 每次采样多少步 |
| max_iterations | 训练长度 | 总迭代次数 |
| save_interval | 实用 | 保存策略频率 |
| actor_hidden_dims | policy | MLP 大小 |
| noise_std_type | policy | std 是否保证正 |
| init_noise_std | policy | 初始探索强度 |
| entropy_coef | PPO | 探索力度 |
| clip_param | PPO | 限制策略更新幅度 |
| desired_kl | PPO | 策略变化速度限制 |
| num_learning_epochs | PPO | 每次更新轮数 |
| conv_layers_params | 感知 | 卷积网络结构 |
| conv_linear_output_size | 感知→policy | flatten 后的维度 |
- 其中flatten的作用在于把卷积输出的多维张量(例如 C×H×W)变成一维向量
更多推荐
所有评论(0)