pytorch 1.7.0 torchvision 0.8.1 torch.cuda.amp gradscaler DDP 训练卡死
发布时间
阅读量:
阅读量
出现错误提示:在使用 pytorch 进行 DDP 模型训练过程中,程序运行陷入停滞状态
相关代码
# 具体卡住的代码
yolov5训练代码 train.py 中有一句:
scaler.step(optimizer) # optimizer.step
程序运行到第二个epoch的时候,卡住了,
具体卡在调用语句:
/home/xxx/lib/python3.7/site-packages/torch/cuda/amp/grad_scaler.py
中的
if not sum(v.item() for v in optimizer_state["found_inf_per_device"].values()):
就卡死了。。。。并不只知道为什么
软件环境
Python 3.7.11
PyTorch 1.7.0
TorchVision 0.8.1
CUDA 10.
全部评论 (0)
还没有任何评论哟~
