Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/MuLabPKU/TransArch
/ functions
Functions
302 in github.com/MuLabPKU/TransArch
⨍
Functions
302
◇
Types & classes
76
↳
Endpoints
1
Method
__init__
( self, vllm_config: VllmConfig, config: "Glm4MoeLiteConfig", hidden_size: int
GQLA_preprint/src/vllm_model.py:67
Method
__init__
( self, vllm_config: VllmConfig, prefix: str, config: "Glm4MoeLiteConfig | Non
GQLA_preprint/src/vllm_model.py:202
Method
__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
GQLA_preprint/src/vllm_model.py:345
Method
__init__
( self, vllm_config: VllmConfig, config: "Glm4MoeLiteConfig", hidden_size: int
GQLA_preprint/src/vllm_model.py:420
Method
__init__
( self, vllm_config: VllmConfig, prefix: str, config: "Glm4MoeLiteConfig | Non
GQLA_preprint/src/vllm_model.py:535
Method
__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
GQLA_preprint/src/vllm_model.py:607
Method
__init__
(self, *, vllm_config: VllmConfig, prefix: str = "")
GQLA_preprint/src/vllm_model.py:690
Method
__len__
(self)
TransMLA_NeurIPS_2025/transmla/utils.py:95
Method
__len__
(self)
CLOVER_ICML_2025/src/data.py:98
Method
__len__
(self)
GQLA_preprint/src/compression.py:630
Method
_expanded
(it)
GQLA_preprint/src/vllm_model.py:678
Function
_final_hook
(_m, args, kwargs)
GQLA_preprint/src/compression.py:134
Function
_hook
(_m, args, kwargs)
GQLA_preprint/src/compression.py:127
Method
_init_weights
(self, module)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:528
Method
_init_weights
(self, module)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1329
Method
_reorder_cache
(past_key_values, beam_idx)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1794
Method
_set_cos_sin_cache
(self, seq_len, device, dtype)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:172
Method
_set_cos_sin_cache
(self, seq_len, device, dtype)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:201
Method
_set_cos_sin_cache
(self, seq_len, device, dtype)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:285
Method
_shape
(self, tensor: torch.Tensor, seq_len: int, bsz: int)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:799
Method
apply_multimodal_chat_transformation
Transform a prompt and optional multimodal content into a chat format. This method is used for chat models that expect a specific con
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:71
Function
apply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:219
Method
backward
(ctx, grad_output)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:514
Function
bbh_prompt
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:69
Method
compute_logits
( self, hidden_states: torch.Tensor, sampling_metadata: SamplingMetadata, )
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:569
Function
eager_attention_forward
( module: nn.Module, query: torch.Tensor, key: torch.Tensor, value: torch.Tensor, attentio
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:258
Method
extra_repr
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:55
Method
forward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/transmla/partial_rope.py:142
Method
forward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/transmla/lora_qkv.py:220
Method
forward
( self, hidden_states: torch.Tensor, position_embeddings: Tuple[torch.Tensor, torch.Te
TransMLA_NeurIPS_2025/transmla/transformers/mla.py:76
Method
forward
(self, hidden_states)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:48
Method
forward
(self, x, position_ids)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:79
Method
forward
(self, x)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:105
Method
forward
(self, hidden_states)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:144
Method
forward
(self, hidden_states)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:202
Method
forward
( self, hidden_states: torch.Tensor, position_embeddings: Tuple[torch.Tensor, torch.Te
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:380
Method
forward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:471
Method
forward
( self, input_ids: Optional[torch.LongTensor] = None, attention_mask: Optional[torch.T
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:572
Method
forward
r""" labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*): Labels for computing the masked language mo
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:828
Method
forward
(self, x)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:89
Method
forward
(self, hidden_states: torch.Tensor)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:151
Method
forward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, )
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:324
Method
forward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, residual: Option
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:411
Method
forward
( self, input_ids: torch.Tensor, positions: torch.Tensor, intermediate_tensors
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:503
Method
forward
( self, input_ids: torch.Tensor, positions: torch.Tensor, intermediate_tensors
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:558
Method
forward
(self, hidden_states)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:103
Method
forward
(self, x, seq_len=None)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:146
Method
forward
(self, x)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:388
Method
forward
(self, hidden_states)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:420
Method
forward
(ctx, x, loss)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:507
Method
forward
(self, hidden_states)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:568
Method
forward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.Tensor] = None,
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:806
Method
forward
( self, hidden_states: torch.Tensor, attention_mask: Optional[torch.LongTensor] = None
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:930
Method
forward
Args: hidden_states (`torch.FloatTensor`): input to the layer of shape `(batch, seq_len, embed_dim)` attention_mask (
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1228
Method
forward
( self, input_ids: torch.LongTensor = None, attention_mask: Optional[torch.Tensor] = N
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1451
Method
forward
r""" Args: labels (`torch.LongTensor` of shape `(batch_size, sequence_length)`, *optional*): Labels for computing
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1635
Method
forward
r""" labels (`torch.LongTensor` of shape `(batch_size,)`, *optional*): Labels for computing the sequence classification/regression
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1838
Method
forward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, llama_4_scaling:
GQLA_preprint/src/vllm_model.py:155
Method
forward
( self, input_ids: torch.Tensor | None, positions: torch.Tensor, intermediate_
GQLA_preprint/src/vllm_model.py:311
Method
forward
( self, positions: torch.Tensor, hidden_states: torch.Tensor, llama_4_scaling:
GQLA_preprint/src/vllm_model.py:523
Method
forward
( self, input_ids: torch.Tensor | None, positions: torch.Tensor, intermediate_
GQLA_preprint/src/vllm_model.py:644
Method
get_decoder
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:823
Method
get_decoder
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1628
Method
get_input_embeddings
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:564
Method
get_input_embeddings
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:808
Method
get_input_embeddings
(self, input_ids: torch.Tensor)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:555
Method
get_input_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1444
Method
get_input_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1613
Method
get_input_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1831
Method
get_output_embeddings
(self)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:814
Method
get_output_embeddings
(self)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1619
Method
get_random_lora_request
Optionally select a random LoRA request and return its associated tokenizer. This method is used when LoRA parameters are pr
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:99
Function
is_valid_sequence
Validate a sequence based on prompt and output lengths. Default pruning criteria are copied from the original `sample_hf_requests` and `
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:186
Method
load_data
Load data from the dataset path into self.data. This method must be overridden by subclasses since the method to load data w
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:85
Method
load_weights
(self, weights: Iterable[Tuple[str, torch.Tensor]])
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:600
Method
load_weights
(self, weights)
GQLA_preprint/src/vllm_model.py:671
Method
make_empty_intermediate_tensors
( self, batch_size: int, dtype: torch.dtype, device: torch.device)
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:586
Method
maybe_oversample_requests
Oversamples the list of requests if its size is less than the desired number. Args: requests (List[SampleRequest
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:162
Function
mmlu_cloze_prompt
MMLU prompt without choices
TransMLA_NeurIPS_2025/lighteval/tasks.py:55
Function
mmlu_pro_mc_prompt
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:38
Method
padding_ret
(ret)
TransMLA_NeurIPS_2025/training/train.py:48
Method
prepare_inputs_for_generation
( self, input_ids, past_key_values=None, attention_mask=None, inputs_e
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1729
Function
preprocess_function
(examples, tokenizer, seq_len)
TransMLA_NeurIPS_2025/training/train.py:8
Function
process_image
Process a single image input and return a multimedia content dictionary. Supports three input types: 1. Dictionary with raw image bytes
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:222
Function
prompt_commonsense_qa
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:29
Function
prompt_hellaswag
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:11
Function
prompt_math
(line, task_name: str = None)
TransMLA_NeurIPS_2025/lighteval/tasks.py:77
Function
repeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:668
Method
sample
Abstract method to generate sample requests from the dataset. Subclasses must override this method to implement dataset-specific log
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:143
Method
sample
( self, logits: Optional[torch.Tensor], sampling_metadata: SamplingMetadata, )
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:578
Method
set_decoder
(self, decoder)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:820
Method
set_decoder
(self, decoder)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1625
Method
set_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:567
Method
set_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:811
Method
set_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1447
Method
set_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1616
Method
set_input_embeddings
(self, value)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1834
Method
set_output_embeddings
(self, new_embeddings)
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:817
Method
set_output_embeddings
(self, new_embeddings)
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1622
Function
tokenize
(data_batch)
TransMLA_NeurIPS_2025/transmla/utils.py:163
← previous
next →
201–300 of 302, ranked by callers