↓ 3 callersFunctiondequant_8bit_blockwise_kernel_util(
a_ptr,
offsets,
code_ptr,
absmax_ptr,
mask,
BLOCK_SIZE: tl.constexpr,
)
bitsandbytes/backends/triton/kernels_8bit_quant.py:180
↓ 3 callersFunctionquantize_8bit_blockwise_kernel_util(
a,
code_ptr,
CODE_SIZE: tl.constexpr,
BLOCK_SIZE: tl.constexpr,
N_PER_TH: tl.constexpr,
bitsandbytes/backends/triton/kernels_8bit_quant.py:137
↓ 2 callersFunction_dequantize_blockwise_impl(
A: torch.Tensor, absmax: torch.Tensor, code: torch.Tensor, blocksize: int, dtype: torch.dtype, out: torc
bitsandbytes/backends/cuda/ops.py:358