Advertisement

【进程丢失】pytorch DDP分布式训练10个epoch就丢失1个GPU进程

阅读量:

文章结构概览

  • 现象
      • 首次出现
      • 再次发生
    • 原因探讨

      • 首次出现-原因探讨

      • 首次出现-尝试应对措施

        • 注意要点
      • 再次出现-原因探讨

      • 再次出现-尝试应对措施

    • 附录:

    • 日志监测

      • 首次 - GPU 日志
      • 第二次记录
        • 定位存在问题的显卡设备
        • GPU 日志监测
        • CPU 日志监测
    • 日志解析

现象

第一次

在使用Resnet50结合Arcsoftmax以及deepglint *2进行训练时,当完成10个epoch后,会出现GPU进程丢失的情况,导致训练程序无法继续执行。该问题具有重复性,且每次均发生在训练至第10个epoch阶段,值得注意的是,每次出现异常的GPU卡bus id均不相同。所使用的Pytorch版本为1.7.0,硬件配置为titan rtx x 8张显卡。

第二次

在完成Resnet100结合Arcsoftmax模型,并利用megaface、vggface2以及deepglint数据集进行两次训练迭代(当前仅完成一个epoch,尚未达到两个epoch)后,服务器在锁屏状态下通过TTS界面提示出现内存不足的错误信息,系统随即终止了相关进程。

全部评论 (0)

还没有任何评论哟~