↓ 2 callersMethod__init__(self, normalized_shape, eps=1e-05, weight=True, dtype=None, device=None)
llava/model/language_model/mpt/norm.py:35
↓ 2 callersFunction_bwd_kernel_one_col_block(start_n, Q, K, V, Bias, DO, DQ, DK, DV, LSE, D, softmax_scale, stride_qm, stride_kn, stride_vn, stride_bm, st
llava/model/language_model/mpt/flash_attn_triton.py:184
↓ 2 callersFunction_bwd_store_dk_dv(dk_ptrs, dv_ptrs, dk, dv, offs_n, offs_d, seqlen_k, headdim, EVEN_M: tl.constexpr, EVEN_N: tl.constexpr, EVEN
llava/model/language_model/mpt/flash_attn_triton.py:168
↓ 2 callersFunction_normal_param_init_fn_(module: nn.Module, std: float, n_layers: int, d_model: Optional[int]=None, init_div_is_residual: Union[int, f
llava/model/language_model/mpt/param_init_fns.py:124
↓ 1 callersMethod__init__(self, d_model: int, n_heads: int, attn_impl: str='triton', clip_qkv: Optional[float]=None, qk_ln: bool=False,
llava/model/language_model/mpt/attention.py:158