MindSpore分布式训练Atlas800-9000裸机单机多卡训练modelzoo模型报错
·
环境
1、服务器:Atlas800-9000(Arm+Ascend),裸机。
2、驱动和软件包:5.0.3.1商用版本
3、mindspore:1.5.0
【操作步骤&问题现象】
1、配置完环境后从MindSpore官方modelzoo拉取resnet代码。
2、单机单卡训练正常(run_standalone_train.sh)。
3、使用models/hccl_tools.py生成对应的rank_table.json文件。
4、使用0,1卡进行单机多卡训练(2卡训练和8卡训练报错一致,方便起见使用2卡),报错。
5、尝试多台atlas800设备,均存在相同错误。

解答:
可以检查下不同卡的执行时间是否一致,是否一个执行比较慢
更多推荐
所有评论(0)