在CUDA Python课程中,“Numba辅助的自定义核函数与内存管理”是一个关键难点
发布时间
阅读量:
阅读量
始终认为自身设计的算法不存在问题,但最终测试所得结果却与预期存在偏差。
失误之处竟位于一个看似合理且易于接受的位置。

解决方案
在最终测试环节中,存在一个表面无误、无需进行任何调整的单元格,即这一行内容,初看之下似乎不存在任何问题。
d_histogram_out = cuda.device_array_like(histogram_out)
必须将设备数组全部置零后,方可通过测试,例如:
zero_array = np.zeros(histogram_out.shape[0])
d_histogram_out = cuda.to_device(zero_array)
注:对于CUDA初学者而言,尚不清楚如何直接生成设备端全零数组,只能采取此种方式,了解相关方法的朋友欢迎在评论区分享
最终效果图展示

还没有任何评论哟~
