| 23 | |
| 24 | template<typename T> |
| 25 | void lu_split(Param<T> lower, Param<T> upper, Param<T> in) { |
| 26 | constexpr unsigned TX = 32; |
| 27 | constexpr unsigned TY = 8; |
| 28 | constexpr unsigned TILEX = 128; |
| 29 | constexpr unsigned TILEY = 32; |
| 30 | |
| 31 | const bool sameDims = |
| 32 | lower.dims[0] == in.dims[0] && lower.dims[1] == in.dims[1]; |
| 33 | |
| 34 | auto luSplit = common::getKernel( |
| 35 | "arrayfire::cuda::luSplit", {{lu_split_cuh_src}}, |
| 36 | TemplateArgs(TemplateTypename<T>(), TemplateArg(sameDims))); |
| 37 | |
| 38 | dim3 threads(TX, TY, 1); |
| 39 | |
| 40 | int blocksPerMatX = divup(in.dims[0], TILEX); |
| 41 | int blocksPerMatY = divup(in.dims[1], TILEY); |
| 42 | dim3 blocks(blocksPerMatX * in.dims[2], blocksPerMatY * in.dims[3], 1); |
| 43 | |
| 44 | EnqueueArgs qArgs(blocks, threads, getActiveStream()); |
| 45 | |
| 46 | luSplit(qArgs, lower, upper, in, blocksPerMatX, blocksPerMatY); |
| 47 | POST_LAUNCH_CHECK(); |
| 48 | } |
| 49 | |
| 50 | } // namespace kernel |
| 51 | } // namespace cuda |
nothing calls this directly
no test coverage detected