Advertisement

基于CUDA/GPU技术和密码运算的成果总结

阅读量:

结论

本人自行编写的GPU模幂运算代码,以及从GitHub和Stack Overflow获取的GPU RSA算法和GPU模幂算法,均未能实现比CPU更快的运算速度,且测试时CPU代码未进行任何优化。本次测试共执行了8192次
x^y \mod z
运算,其中x与y为unsigned long long类型,即64位整数,z为65537。

本人编写的multiply.cu程序耗时约5秒(5.041000s),而对应的CPU版本multiply_cpu.c仅需0.287000s;当开启O3优化后,CPU版本耗时几乎接近于零。

采用TensorFlow编写的diancheng.py程序耗时约为2.4秒。

GPU_RSA.cu程序耗时0.473737秒,而对应的CPU_RSA.c程序耗时0.519994秒;开启O3优化后,CPU版本耗时降至0.198997秒。

paradd2.cu程序的平均GPU耗时为0.061485毫秒,而平均CPU耗时仅为0.002447毫秒。

所有GPU版本的运算速度均低于对应的CPU版本。

这是Nvidia提供的CUDA编程七步法,或许对后续的性能优化具有一定参考价值
https://developer.download.nvidia.com/assets/cuda/files/reduction.pdf

Git

全部评论 (0)

还没有任何评论哟~