↓ 2 callersMethodupdate_think(self, key_states, query_states, value_states, attention_mask, num_key_value_groups)
pyramidkv/pyramidkv_utils.py:561
↓ 1 callersMethod__init__(self, start_budget_ratio = 0.1, window_size = 64, max_capacity_prompt = 256 + 64, kernel_size = 5, pooling =
pyramidkv/pyramidkv_utils.py:653
↓ 1 callersFunction_prepare_4d_causal_attention_mask_with_cache_position Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_length)`,
pyramidkv/llama_model.py:2602
↓ 1 callersFunction_prepare_4d_causal_attention_mask_with_cache_position Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_length)`,
pyramidkv/llama_model_think.py:235
↓ 1 callersFunction_protected_indices(
key_len: int,
*,
sink_size: int,
recent_size: int,
device: torch.device,
)
pyramidkv/scissorhands.py:51
Method__init__(self, num_hidden_layers = 32, window_size = 64, max_capacity_prompt = 256 + 64, kernel_size = 5, pooling = 'a
pyramidkv/pyramidkv_utils.py:324
Method__init__(self, window_size = 64, max_capacity_prompt = 256 + 64, kernel_size = 5, pooling = 'avgpool', merge = None, r
pyramidkv/pyramidkv_utils.py:473
Method__init__(self, window_size = 64, max_capacity_prompt = 256 + 64, kernel_size = 5, pooling = 'avgpool', merge = None, g
pyramidkv/pyramidkv_utils.py:798
Method__init__(self, window_size = 64, max_capacity_prompt = 256 + 64, kernel_size = 5, pooling = 'avgpool', merge = None, g
pyramidkv/pyramidkv_utils.py:894
Method__init__(self, window_size = 32, kernel_size = 7, pooling = 'maxpool',max_capacity_prompt=None,floor = None,normalize=
pyramidkv/pyramidkv_utils.py:949
Method__init__(self, window_size = 32, kernel_size = 7, pooling = 'maxpool',max_capacity_prompt=None, layer_idx = None, num_
pyramidkv/pyramidkv_utils.py:1098
Method__init__(self, config: PretrainedConfig, max_batch_size: int, max_cache_len: int, device, dtype=None)
pyramidkv/cache_utils_think.py:1046
Method__init__(self, config: PretrainedConfig, max_batch_size: int, max_cache_len: int, device, dtype=None)
pyramidkv/cache_utils_think.py:1197
Method__init__(self, config: PretrainedConfig, max_batch_size, max_cache_len, device="cpu", dtype=None)
pyramidkv/cache_utils_think.py:1474