Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/MuLabPKU/TransArch
/ types & classes
Types & classes
76 in github.com/MuLabPKU/TransArch
⨍
Functions
302
◇
Types & classes
76
↳
Endpoints
1
↓ 7 callers
Class
DeepseekV3RMSNorm
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:39
↓ 5 callers
Class
DeepseekV2RMSNorm
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:94
↓ 4 callers
Class
DeepseekV2MLP
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:374
↓ 3 callers
Class
DeepseekV3MLP
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:93
↓ 3 callers
Class
MLAAttention
Modified from `transformers.models.llama.modeling_deepseek_v3.DeepseekV3Attention` add support for attention bias and softcapping
TransMLA_NeurIPS_2025/transmla/transformers/mla.py:22
↓ 2 callers
Class
DeepseekV2MLP
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:61
↓ 2 callers
Class
DeepseekV2Model
Transformer decoder consisting of *config.num_hidden_layers* layers. Each layer is a [`DeepseekV2DecoderLayer`] Args: config: Deepse
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1415
↓ 1 callers
Class
DataCollatorWithFlattening
Data collator used for padding free approach. Does the following: - concatate the entire mini batch into single long sequence [1, total_toke
TransMLA_NeurIPS_2025/training/train.py:26
↓ 1 callers
Class
DeepseekV2DecoderLayer
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:348
↓ 1 callers
Class
DeepseekV2DecoderLayer
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1197
↓ 1 callers
Class
DeepseekV2DynamicNTKScalingRotaryEmbedding
DeepseekV2RotaryEmbedding extended with Dynamic NTK scaling. Credits to the Reddit users /u/bloc97 and /u/emozilla
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:187
↓ 1 callers
Class
DeepseekV2LinearScalingRotaryEmbedding
DeepseekV2RotaryEmbedding extended with linear scaling. Credits to the Reddit user /u/kaiokendev
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:158
↓ 1 callers
Class
DeepseekV2MoE
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:96
↓ 1 callers
Class
DeepseekV2MoE
A mixed expert module containing shared experts.
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:521
↓ 1 callers
Class
DeepseekV2Model
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:457
↓ 1 callers
Class
DeepseekV2RotaryEmbedding
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:114
↓ 1 callers
Class
DeepseekV2YarnRotaryEmbedding
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:262
↓ 1 callers
Class
DeepseekV3Attention
Multi-headed attention from 'Attention Is All You Need' paper
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:328
↓ 1 callers
Class
DeepseekV3DecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:456
↓ 1 callers
Class
DeepseekV3MoE
A mixed expert module containing shared experts.
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:157
↓ 1 callers
Class
DeepseekV3Model
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:545
↓ 1 callers
Class
DeepseekV3RotaryEmbedding
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:59
↓ 1 callers
Class
DeepseekV3TopkRouter
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:110
↓ 1 callers
Class
Gemma2MLADecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:22
↓ 1 callers
Class
Gemma2MLAModel
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:35
↓ 1 callers
Class
Glm4MoeLiteGQLAAbsorbAttention
GLM-4.7-Flash attention serving a GQLA checkpoint via MLA absorb. Same shapes as vanilla MLA — ``kv_b_proj`` is sized for ``num_heads`` and w
GQLA_preprint/src/vllm_model.py:409
↓ 1 callers
Class
Glm4MoeLiteGQLAAbsorbDecoderLayer
Swap in GQLA-absorb attention; reuse parent forward + MoE/MLP wiring.
GQLA_preprint/src/vllm_model.py:532
↓ 1 callers
Class
Glm4MoeLiteGQLAAbsorbModel
Standalone twin of Glm4MoeLiteModel for the GQLA-absorb path. Cannot subclass Glm4MoeLiteModel directly (it is @support_torch_compile- decora
GQLA_preprint/src/vllm_model.py:598
↓ 1 callers
Class
Glm4MoeLiteGQLAAttention
GQLA_preprint/src/modeling.py:22
↓ 1 callers
Class
Glm4MoeLiteGQLAAttention
GLM-4.7-Flash attention with GQA-shaped KV. Requires q LoRA (always true on GLM-4.7).
GQLA_preprint/src/vllm_model.py:64
↓ 1 callers
Class
Glm4MoeLiteGQLADecoderLayer
GQLA_preprint/src/modeling.py:32
↓ 1 callers
Class
Glm4MoeLiteGQLADecoderLayer
Swap in GQLA attention; reuse parent forward + MoE/MLP wiring.
GQLA_preprint/src/vllm_model.py:199
↓ 1 callers
Class
Glm4MoeLiteGQLAModel
GQLA_preprint/src/modeling.py:38
↓ 1 callers
Class
Glm4MoeLiteGQLAModel
Standalone twin of Glm4MoeLiteModel. Cannot subclass it because the parent is @support_torch_compile-decorated; subclassing would break the c
GQLA_preprint/src/vllm_model.py:266
↓ 1 callers
Class
LlamaMLADecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:22
↓ 1 callers
Class
LlamaMLAModel
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:35
↓ 1 callers
Class
LoraQKV
TransMLA_NeurIPS_2025/transmla/lora_qkv.py:20
↓ 1 callers
Class
MixtralMLADecoderLayer
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:22
↓ 1 callers
Class
MixtralMLAModel
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:35
↓ 1 callers
Class
MoEGate
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:393
↓ 1 callers
Class
PartialRope
TransMLA_NeurIPS_2025/transmla/partial_rope.py:47
↓ 1 callers
Class
SampleRequest
Represents a single inference request for benchmarking.
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:30
↓ 1 callers
Class
TestDataset
TransMLA_NeurIPS_2025/transmla/utils.py:77
↓ 1 callers
Class
TestDataset
CLOVER_ICML_2025/src/data.py:80
↓ 1 callers
Class
_DS
GQLA_preprint/src/compression.py:629
Class
AddAuxiliaryLoss
The trick function of adding auxiliary (aux) loss, which includes the gradient of the aux loss during backpropagation.
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:500
Class
BenchmarkDataset
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:47
Class
CustomMMLUEvaluationTask
TransMLA_NeurIPS_2025/lighteval/tasks.py:305
Class
DeepseekV2Attention
Multi-headed attention from 'Attention Is All You Need' paper
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:683
Class
DeepseekV2Config
r""" This is the configuration class to store the configuration of a [`DeepseekV2Model`]. It is used to instantiate an DeepSeek model accordin
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/configuration_deepseek.py:7
Class
DeepseekV2FlashAttention2
DeepseekV2 flash attention module. This module inherits from `DeepseekV2Attention` as the weights of the module stays untouched. The only req
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:915
Class
DeepseekV2ForCausalLM
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:534
Class
DeepseekV2ForCausalLM
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1601
Class
DeepseekV2ForSequenceClassification
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1821
Class
DeepseekV2MLAAttention
Main reference: DeepseekV2 paper, and FlashInfer Implementation (https://arxiv.org/abs/2405.04434 and https://github.com/flashinfer-ai/flashi
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:188
Class
DeepseekV2PreTrainedModel
TransMLA_NeurIPS_2025/models/deepseek_v2_lite/modeling_deepseek.py:1320
Class
DeepseekV3Config
r""" This is the configuration class to store the configuration of a [`DeepseekV3Model`]. It is used to instantiate an DeepSeek model accordin
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/configuration_deepseek_v3.py:26
Class
DeepseekV3ForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:794
Class
DeepseekV3ForCausalLM
TransMLA_NeurIPS_2025/transmla/vllm_registry/deepseek.py:689
Class
DeepseekV3PreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:514
Class
Gemma2MLAConfig
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/configuration_gemma2mla.py:3
Class
Gemma2MLAForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:45
Class
Gemma2MLAPreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/gemma2/modeling_gemma2mla.py:29
Class
Glm4MoeLiteGQLAAbsorbForCausalLM
Top-level causal LM serving a GQLA checkpoint via MLA absorb.
GQLA_preprint/src/vllm_model.py:687
Class
Glm4MoeLiteGQLAForCausalLM
GQLA_preprint/src/modeling.py:47
Class
Glm4MoeLiteGQLAForCausalLM
Top-level causal LM. Same as parent except ``self.model``.
GQLA_preprint/src/vllm_model.py:342
Class
GqlaLayout
GQLA_preprint/src/compression.py:36
Class
KwargsForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/deepseek_v3/modeling_deepseek_v3.py:790
Class
LlamaMLAConfig
TransMLA_NeurIPS_2025/transmla/transformers/llama/configuration_llamamla.py:3
Class
LlamaMLAForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:45
Class
LlamaMLAPreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/llama/modeling_llamamla.py:29
Class
MixtralMLAConfig
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/configuration_mixtralmla.py:3
Class
MixtralMLAForCausalLM
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:45
Class
MixtralMLAPreTrainedModel
TransMLA_NeurIPS_2025/transmla/transformers/mixtral/modeling_mixtralmla.py:29
Class
RandomDataset
TransMLA_NeurIPS_2025/throughput_test/benchmark_dataset.py:271
Class
TrainingArguments
TransMLA_NeurIPS_2025/training/train.py:79