| 35 | |
| 36 | template <typename T> |
| 37 | void copyD2H(T *dst, const T *src, size_t n, AccessOrder order = {}) { |
| 38 | if (order.is_device()) |
| 39 | CUDA_CALL(cudaMemcpyAsync(dst, src, n*sizeof(T), cudaMemcpyDeviceToHost, order.stream())); |
| 40 | else |
| 41 | CUDA_CALL(cudaMemcpy(dst, src, n*sizeof(T), cudaMemcpyDeviceToHost)); |
| 42 | } |
| 43 | |
| 44 | template <typename T> |
| 45 | void copyH2D(T *dst, const T *src, size_t n, AccessOrder order = {}) { |