Functionflash_attn_fn(
query,
key,
value,
n_heads,
past_key_value=None,
softmax_scale=None,
attn_bias=N
model/llava/model/language_model/mpt/attention.py:115
Methodforward qkv: (batch, seqlen, 3, nheads, headdim) bias: optional, shape broadcastible to (batch, nheads, seqlen, seqlen). For exam
model/llava/model/language_model/mpt/flash_attn_triton.py:940
Methodforward q: (batch, seqlen_q, nheads, headdim) kv: (batch, seqlen_k, 2, nheads, headdim) bias: optional, shape broadcastible to (batch
model/llava/model/language_model/mpt/flash_attn_triton.py:991
Methodforward q: (batch_size, seqlen_q, nheads, headdim) k, v: (batch_size, seqlen_k, nheads, headdim) bias: optional, shape broadcastible
model/llava/model/language_model/mpt/flash_attn_triton.py:1044
Methodforward(
self,
x,
past_key_value=None,
attn_bias=None,
attention_mask=None,
model/llava/model/language_model/mpt/attention.py:322
Methodforward(
self,
x,
past_key_value=None,
attn_bias=None,
attention_mask=None,
model/llava/model/language_model/mpt/attention.py:419
Functionload_pretrained_model(
model_path,
model_base,
model_name,
load_8bit=False,
load_4bit=False,
device_map="au
model/llava/model/builder.py:27
Functionscaled_multihead_dot_product_attention(
query,
key,
value,
n_heads,
past_key_value=None,
softmax_scale=None,
attn_bias=N
model/llava/model/language_model/mpt/attention.py:28
Functiontriton_flash_attn_fn(
query,
key,
value,
n_heads,
past_key_value=None,
softmax_scale=None,
attn_bias=N
model/llava/model/language_model/mpt/attention.py:190