【进程丢失】pytorch DDP分布式训练10个epoch就丢失1个GPU进程
发布时间
阅读量:
阅读量
文章结构概览
- 现象
-
- 首次出现
- 再次发生
-
原因探讨
-
-
首次出现-原因探讨
-
首次出现-尝试应对措施
-
- 注意要点
-
再次出现-原因探讨
-
再次出现-尝试应对措施
-
-
附录:
-
日志监测
-
- 首次 - GPU 日志
- 第二次记录
-
- 定位存在问题的显卡设备
- GPU 日志监测
- CPU 日志监测
-
日志解析
-
现象
第一次
在使用Resnet50结合Arcsoftmax以及deepglint *2进行训练时,当完成10个epoch后,会出现GPU进程丢失的情况,导致训练程序无法继续执行。该问题具有重复性,且每次均发生在训练至第10个epoch阶段,值得注意的是,每次出现异常的GPU卡bus id均不相同。所使用的Pytorch版本为1.7.0,硬件配置为titan rtx x 8张显卡。
第二次
在完成Resnet100结合Arcsoftmax模型,并利用megaface、vggface2以及deepglint数据集进行两次训练迭代(当前仅完成一个epoch,尚未达到两个epoch)后,服务器在锁屏状态下通过TTS界面提示出现内存不足的错误信息,系统随即终止了相关进程。
全部评论 (0)
还没有任何评论哟~
