基于CUDA/GPU技术和密码运算的成果总结
发布时间
阅读量:
阅读量
结论
本人自行编写的GPU模幂运算代码,以及从GitHub和Stack Overflow获取的GPU RSA算法和GPU模幂算法,均未能实现比CPU更快的运算速度,且测试时CPU代码未进行任何优化。本次测试共执行了8192次
x^y \mod z
运算,其中x与y为unsigned long long类型,即64位整数,z为65537。
本人编写的multiply.cu程序耗时约5秒(5.041000s),而对应的CPU版本multiply_cpu.c仅需0.287000s;当开启O3优化后,CPU版本耗时几乎接近于零。
采用TensorFlow编写的diancheng.py程序耗时约为2.4秒。
GPU_RSA.cu程序耗时0.473737秒,而对应的CPU_RSA.c程序耗时0.519994秒;开启O3优化后,CPU版本耗时降至0.198997秒。
paradd2.cu程序的平均GPU耗时为0.061485毫秒,而平均CPU耗时仅为0.002447毫秒。
所有GPU版本的运算速度均低于对应的CPU版本。
这是Nvidia提供的CUDA编程七步法,或许对后续的性能优化具有一定参考价值
https://developer.download.nvidia.com/assets/cuda/files/reduction.pdf
Git
全部评论 (0)
还没有任何评论哟~
