↓ 2 callersMethodgguf_completion(
self, context, continuation=None, stop=None, retries=3, delay=5, **kwargs
)
lm-eval-harness/lm_eval/models/gguf.py:46
↓ 2 callersMethodparallel_forward(self, x, q, k, v, k_enc=None, v_enc=None, mask=None)
based/models/mixers/prefix_linear_attention.py:193
↓ 2 callersMethodparallel_forward(self, x: torch.Tensor, q: torch.Tensor, k: torch.Tensor, v: torch.Tensor, decay: torch.Tensor=None, impl_choi
based/models/mixers/linear_attention.py:185
↓ 2 callersFunctionselective_scan_fnif return_last_state is True, returns (out, last_state) last_state has shape (batch, dim, dstate). Note that the gradient of the last state is
based/models/mixers/mamba/ops/selective_scan_interface.py:82
↓ 2 callersFunctionselective_scan_fnif return_last_state is True, returns (out, last_state) last_state has shape (batch, dim, dstate). Note that the gradient of the last state is
synthetic/zoology/mixers/mamba_ssm/selective_scan_interface.py:77
↓ 1 callersMethod__init__(
self,
d_model,
d_state=16,
d_conv=4,
expand=2,
dt_rank="auto
based/models/mixers/mamba/modules/mamba_simple.py:30
↓ 1 callersMethod__init__(
self,
d_model: int,
n_layer: int,
vocab_size: int,
ssm_cfg=None,
based/models/mixers/mamba/modules/models/mixer_seq_simple.py:87
↓ 1 callersMethod__init__(
self,
name,
data_prefix,
documents,
indexed_dataset,
num_sam
train/src/datamodules/language_modeling_neox.py:234