↓ 1 callersFunction_update_kv_cachekv: (batch_size, seqlen, 2, nheads, head_dim) or (batch_size, 1, 2, nheads, head_dim)
based/models/mixers/slide_attention.py:255
↓ 1 callersMethod_update_kv_cachekv: (batch_size, seqlen, 2, nheads, head_dim) or (batch_size, 1, 2, nheads, head_dim)
based/models/mixers/mha.py:506
↓ 1 callersMethod_update_kv_cachekv: (batch_size, seqlen, 2, nheads, head_dim) or (batch_size, 1, 2, nheads, head_dim)
based/models/mixers/mha.py:860
↓ 1 callersMethod_update_kv_cachekv: (batch_size, seqlen, 2, nheads, head_dim) or (batch_size, 1, 2, nheads, head_dim)
based/models/mixers/slide_attention.py:385
↓ 1 callersFunctionallocate_inference_cache(
max_batch_size,
max_seqlen,
nheads,
headdim,
layers: Union[int, Sequence],
device,
train/src/generation.py:665
↓ 1 callersFunctionbuild_datasets(
data_paths: Dict[str, List[str]],
num_samples: Dict[str, List[int]],
seq_length: int,
seed:
train/src/datamodules/language_modeling_neox.py:141
↓ 1 callersFunctioncapture_graph(
model, inference_params, batch_size, max_seqlen, decoding_seqlen=1, mempool=None, n_warmups=2
)
based/models/mixers/mamba/utils/generation.py:327
↓ 1 callersFunctioncapture_graph(
model, inference_params, batch_size, max_seqlen, decoding_seqlen=1, mempool=None, n_warmups=2
)
train/src/generation.py:773
↓ 1 callersFunctioncreate_block(config, layer_idx=None, process_group=None, device=None, dtype=None, multiple_of=256)
based/models/transformer/gpt.py:264