参数类别作用
num_steps_per_envrollout每次采样多少步
max_iterations训练长度总迭代次数
save_interval实用保存策略频率
actor_hidden_dimspolicyMLP 大小
noise_std_typepolicystd 是否保证正
init_noise_stdpolicy初始探索强度
entropy_coefPPO探索力度
clip_paramPPO限制策略更新幅度
desired_klPPO策略变化速度限制
num_learning_epochsPPO每次更新轮数
conv_layers_params感知卷积网络结构
conv_linear_output_size感知→policyflatten 后的维度
  • 其中flatten的作用在于把卷积输出的多维张量(例如 C×H×W)变成一维向量
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐