Functionflash_attn_fn(query, key, value, n_heads, softmax_scale=None, attn_bias=None, key_padding_mask=None, is_causal=False, dropo
llava/model/mpt/attention.py:61
Methodforward(self, x, past_key_value=None, attn_bias=None, attention_mask=None, is_causal=True, needs_weights=False)
llava/model/mpt/attention.py:154
Methodforward(self, x, past_key_value=None, attn_bias=None, attention_mask=None, is_causal=True, needs_weights=False)
llava/model/mpt/attention.py:214
Methodinitialize_vision_tokenizer(self, mm_use_im_start_end, tokenizer, device,
tune_mm_mlp_adapter=False,
llava/model/llava_mpt.py:236
Functionkaiming_normal_param_init_fn_(module: nn.Module, n_layers: int, d_model: Optional[int]=None, init_div_is_residual: Union[int, float, str, b
llava/model/mpt/param_init_fns.py:162
Functionkaiming_uniform_param_init_fn_(module: nn.Module, n_layers: int, d_model: Optional[int]=None, init_div_is_residual: Union[int, float, str, b
llava/model/mpt/param_init_fns.py:155
Functionscaled_multihead_dot_product_attention(query, key, value, n_heads, softmax_scale=None, attn_bias=None, key_padding_mask=None, is_causal=False, dropo
llava/model/mpt/attention.py:19
Functiontriton_flash_attn_fn(query, key, value, n_heads, softmax_scale=None, attn_bias=None, key_padding_mask=None, is_causal=False, dropo
llava/model/mpt/attention.py:88
Functionxavier_normal_param_init_fn_(module: nn.Module, n_layers: int, d_model: Optional[int]=None, init_div_is_residual: Union[int, float, str, b
llava/model/mpt/param_init_fns.py:176
Functionxavier_uniform_param_init_fn_(module: nn.Module, n_layers: int, d_model: Optional[int]=None, init_div_is_residual: Union[int, float, str, b
llava/model/mpt/param_init_fns.py:169