| 204 | |
| 205 | #if CUDA_VERSION >= 10010 |
| 206 | std::vector<BenchArgs> get_f16_feat_model_args() { |
| 207 | std::vector<BenchArgs> args; |
| 208 | args.emplace_back(BenchArgs{128, 9216, 9216}); |
| 209 | args.emplace_back(BenchArgs{128, 6400, 6400}); |
| 210 | args.emplace_back(BenchArgs{128, 5184, 5184}); |
| 211 | return args; |
| 212 | } |
| 213 | #endif |
| 214 | |
| 215 | void benchmark_matrix_mul( |