↓ 1 callersFunction_prepare_4d_causal_attention_mask_with_cache_position Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_length)`,
neuron_deactivate/transformers/models/llama/modeling_llama.py:59
↓ 1 callersMethod_report_to_hp_search(self, trial: Union["optuna.Trial", Dict[str, Any]], step: int, metrics: Dict[str, float])
neuron_enhancement/transformers/trainer.py:1264
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length)
neuron_detection/transformers/models/llama/modeling_llama.py:619
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length)
neuron_detection/transformers/models/gemma2/modeling_gemma2.py:532
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length)
neuron_detection/transformers/models/gemma2/diff_gemma2.py:270
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length)
layers/transformers/models/modeling_qwen2.py:585
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length)
layers/transformers/models/modeling_llama.py:564