↓ 2 callersFunctionrepeat_kv This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:246
↓ 1 callersMethod_prepare_4d_causal_attention_mask_with_cache_position Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_l
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:735
↓ 1 callersMethod_upad_input(
self, query_layer, key_layer, value_layer, attention_mask, query_length
)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1145