Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/deepspeedai/DeepSpeed
/ types & classes
Types & classes
1,850 in github.com/deepspeedai/DeepSpeed
⨍
Functions
10,922
◇
Types & classes
1,850
↳
Endpoints
34
↓ 175 callers
Class
SimpleModel
tests/unit/simple_model.py:20
↓ 29 callers
Class
AutoEPConfig
User-facing configuration parsed from DS config JSON.
deepspeed/module_inject/auto_ep_presets/base.py:96
↓ 26 callers
Class
MockMoETransformer
tests/unit/v1/moe/autoep_test_utils.py:96
↓ 25 callers
Class
AsyncIOBuilder
op_builder/async_io.py:13
↓ 20 callers
Class
DtypeEnum
deepspeed/inference/v2/inference_utils.py:18
↓ 18 callers
Class
DeepSpeedCPUAdam
deepspeed/ops/adam/cpu_adam.py:13
↓ 18 callers
Class
DeepSpeedZeroConfig
Sets parameters for ZeRO optimizations.
deepspeed/runtime/zero/config.py:90
↓ 16 callers
Class
ConfigBundle
A config bundle is a collection of configs that are used to instantiate a model implementation.
deepspeed/inference/v2/modules/module_registry.py:13
↓ 15 callers
Class
DeepSpeedConfig
deepspeed/runtime/config.py:676
↓ 14 callers
Class
DSStateManagerConfig
deepspeed/inference/v2/ragged/manager_configs.py:137
↓ 14 callers
Class
DeepSpeedInferenceConfig
Initialize the DeepSpeed Transformer Config. Arguments: hidden_size: The hidden size of the transformer layer intermed
deepspeed/ops/transformer/inference/config.py:21
↓ 14 callers
Class
GDSBuilder
op_builder/gds.py:10
↓ 13 callers
Class
CUDAGatedActivation
CUDA implementation of gated activation kernel. This kernel assumes that the input tensor has gate and activation values in adjacent channels
deepspeed/inference/v2/kernels/core_ops/gated_activations/gated_activation.py:15
↓ 12 callers
Class
ContainerMap
deepspeed/inference/v2/model_implementations/inference_policy_base.py:28
↓ 12 callers
Class
RotateHalfConfig
deepspeed/inference/v2/modules/configs/attention_configs.py:29
↓ 12 callers
Class
TmpRepo
A throwaway git repo seeded with BASELINE, committed on ``master``.
ci/test_tests_fetcher.py:70
↓ 11 callers
Class
AutoTPConfig
Configuration for Automatic Tensor Parallelism. Example usage: config = AutoTPConfig( tp_size=4, layer_specs
deepspeed/module_inject/autotp_config.py:214
↓ 11 callers
Class
TPLayerSpec
Unified specification for tensor parallel layer partitioning. This is inspired by Universal Checkpointing's SubparamShape but extended f
deepspeed/module_inject/autotp_config.py:28
↓ 10 callers
Class
AutoEP
Automatic Expert Parallelism: detect and replace MoE layers.
deepspeed/module_inject/auto_ep.py:273
↓ 10 callers
Class
DeepSpeedFP16Config
For float16 configuration
deepspeed/runtime/precision_config.py:100
↓ 10 callers
Class
EvoformerAttnBuilder
op_builder/evoformer_attn.py:13
↓ 10 callers
Class
GatheredParameters
deepspeed/runtime/zero/partition_parameters.py:2237
↓ 10 callers
Class
MMapIndexedDataset
deepspeed/runtime/data_pipeline/data_sampling/indexed_dataset.py:369
↓ 10 callers
Class
RaggedOpsBuilder
op_builder/ragged_ops.py:11
↓ 9 callers
Class
BlockedAllocator
Allocator class for managing which blocks are free/used in the blocked KV-cache. This is a simple allocator that uses a linked list to ke
deepspeed/inference/v2/ragged/blocked_allocator.py:11
↓ 9 callers
Class
DSLinearConfig
Config class for DSLinearBase.
deepspeed/inference/v2/modules/configs/linear_config.py:10
↓ 9 callers
Class
PassContract
Lightweight metadata describing what an optimization pass expects and produces. Contracts let DeepCompile validate a pass schedule before it runs
deepspeed/compile/passes/contract.py:15
↓ 9 callers
Class
QuantizationConfig
Configuration settings for quantization for LoRAOptimizedLinear, QuantizedLinear, and QuantizedParameter Attributes: q_bits (int
deepspeed/linear/config.py:39
↓ 9 callers
Class
SimpleMoEModel
tests/unit/simple_model.py:80
↓ 9 callers
Class
SubParamLinearLayer
Column-parallel linear layer with sub-parameter support. Handles cases where weights contain multiple logical sub-parameters that need t
deepspeed/module_inject/layers.py:1216
↓ 8 callers
Class
DSNormConfig
Config class for both DSPreLN and DSPostLN.
deepspeed/inference/v2/modules/configs/norm_config.py:10
↓ 8 callers
Class
PipelineModule
Modules to be parallelized with pipeline parallelism. The key constraint that enables pipeline parallelism is the representation of the forwa
deepspeed/runtime/pipe/module.py:86
↓ 8 callers
Class
PredicatedTileIteratorResidualLast
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_iterator_residual_last.h:156
↓ 7 callers
Class
DeepSpeedGPTInference
Initialize the DeepSpeed GPT Transformer Layer.
deepspeed/model_implementations/transformers/ds_gpt.py:9
↓ 7 callers
Class
InferenceCoreBuilder
op_builder/inference_core_ops.py:11
↓ 7 callers
Class
PlaceholderSequenceDescriptor
The DummySequenceDescriptor is an empty object that allows us to perform schedulability checks before formally tracking a sequence.
deepspeed/inference/v2/ragged/sequence_descriptor.py:35
↓ 7 callers
Class
ProfilingResult
deepspeed/compile/profilers/__init__.py:13
↓ 7 callers
Class
QuantizedParameter
Quantized parameter class that implements weight quantization. Weights are stored in quantized form on GPUs, and can be dequantized on-the-fl
deepspeed/linear/quantization.py:18
↓ 7 callers
Class
RaggedBatchWrapper
Container for all the auxiliary Tensors used in the management of a ragged batch. For each Tensor, we maintain a shadow Tensor on the host.
deepspeed/inference/v2/ragged/ragged_wrapper.py:31
↓ 7 callers
Class
RaggedTopKGating
CUDA implementation of top-1 gating. This will perform a softmax on the logits, and return the scale as well as its idx within that expert's
deepspeed/inference/v2/kernels/ragged_ops/top_k_gating/top_k_gating.py:16
↓ 7 callers
Class
RepeatingLoader
deepspeed/runtime/dataloader.py:17
↓ 7 callers
Class
SynchronizedWallClockTimer
Group of timers. Borrowed from Nvidia Megatron code
deepspeed/utils/timer.py:44
↓ 7 callers
Class
WrapperLeafModule
tests/unit/runtime/zero/test_zero_leaf_module.py:139
↓ 7 callers
Class
model_3d_desc
deepspeed/checkpoint/reshape_3d_utils.py:17
↓ 6 callers
Class
CUDABiasActivation
CUDA implementation of bias activation kernel. This kernel should be deprecated once we are fusing the bias activation into the linear kernel
deepspeed/inference/v2/kernels/core_ops/bias_activations/bias_activation.py:15
↓ 6 callers
Class
DeepSpeedTransformerConfig
Initialize the DeepSpeed Transformer Config. Arguments: batch_size: The maximum batch size used for running the kernel on each GP
deepspeed/ops/transformer/transformer.py:34
↓ 6 callers
Class
InternVLFusionAdapter
InternVL-style splice: replace IMG_CONTEXT token runs with visual tokens. InternVL encodes each image as ``<IMG_START> <IMG_CONTEXT>×N <IMG_END>`
deepspeed/sequence/autosp_fusion.py:230
↓ 6 callers
Class
LinearAllreduce
deepspeed/module_inject/layers.py:581
↓ 6 callers
Class
LinearBlockedKVCopy
CUDA Kernel implementation that will perform rotary position embeddings on the queries and keys before copying into a blocked KV cache.
deepspeed/inference/v2/kernels/ragged_ops/linear_blocked_kv_rotary/linear_blocked_kv_copy.py:19
↓ 6 callers
Class
LinearLayer
deepspeed/module_inject/layers.py:678
↓ 6 callers
Class
MoE
Initialize an MoE layer. Arguments: hidden_size (int): the hidden dimension of the model, importantly this is also the input and output d
deepspeed/moe/layer.py:17
↓ 6 callers
Class
MoEModelPreset
Preset configuration for a known MoE model family.
deepspeed/module_inject/auto_ep_presets/base.py:27
↓ 6 callers
Class
MockHFModel
tests/unit/runtime/test_tp_plan_extraction.py:15
↓ 6 callers
Class
MyModel
tests/unit/v1/zero/test_zero.py:243
↓ 6 callers
Class
NcclBackend
deepspeed/runtime/comm/nccl.py:17
↓ 6 callers
Class
PredicatedTileAccessIteratorResidualLast
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:84
↓ 6 callers
Class
Qwen2VLFusionAdapter
Qwen2-VL-style splice: visual tokens enclosed by vision_start/end tokens. Qwen2-VL wraps each image's visual tokens with a pair of special bounda
deepspeed/sequence/autosp_fusion.py:265
↓ 6 callers
Class
RaggedUtilsBuilder
op_builder/ragged_utils.py:11
↓ 6 callers
Class
RandomLTDBuilder
op_builder/random_ltd.py:9
↓ 6 callers
Class
ReplaceWithTensorSlicing
deepspeed/module_inject/auto_tp.py:33
↓ 6 callers
Class
RoutedAssignmentPayload
deepspeed/moe/ep_tp_dispatch.py:20
↓ 6 callers
Class
UlyssesSPViTAttention
Sequence-parallel wrapper for an opaque ViT attention module. Parameters ---------- attn: The original ViT attention layer (any `
deepspeed/sequence/autosp_vit.py:48
↓ 6 callers
Class
VectorMatMulOp
deepspeed/ops/transformer/inference/op_binding/vector_matmul.py:12
↓ 6 callers
Class
meg_2d_parallel_map
deepspeed/checkpoint/reshape_meg_2d.py:9
↓ 6 callers
Class
noop_context
deepspeed/runtime/utils.py:114
↓ 5 callers
Class
AlexNetPipe
tests/unit/alexnet_model.py:49
↓ 5 callers
Class
BertLayerNorm
tests/unit/modeling.py:273
↓ 5 callers
Class
BertLayerNorm
tests/unit/modelingpreln.py:271
↓ 5 callers
Class
BlasLibLinear
Wrapper around the BLAS matmul kernel for FP16/BF16/FP32 for CUDA/RoCM. Performs z = x @ y
deepspeed/inference/v2/kernels/core_ops/blas_kernels/blas_linear.py:13
↓ 5 callers
Class
BlockedRotaryEmbeddings
CUDA Kernel implementation that will perform rotary position embeddings on the queries and keys before copying into a blocked KV cache.
deepspeed/inference/v2/kernels/ragged_ops/linear_blocked_kv_rotary/blocked_kv_rotary.py:14
↓ 5 callers
Class
BlockedTrainedRotaryEmbeddings
CUDA Kernel implementation that will perform rotary position embeddings on the queries and keys before copying into a blocked KV cache.
deepspeed/inference/v2/kernels/ragged_ops/linear_blocked_kv_rotary/blocked_trained_kv_rotary.py:19
↓ 5 callers
Class
CPUAdamBuilder
op_builder/cpu_adam.py:9
↓ 5 callers
Class
CUDARMSNorm
Floating point layer norm kernel for CUDA/RoCM. Performs: z = ln(x)
deepspeed/inference/v2/kernels/core_ops/cuda_rms_norm/rms_norm.py:11
↓ 5 callers
Class
CompressedBackend
deepspeed/runtime/comm/compressed.py:14
↓ 5 callers
Class
DeepSpeedInferenceConfig
Sets parameters for DeepSpeed Inference Engine.
deepspeed/inference/config.py:118
↓ 5 callers
Class
DeepSpeedMonitorConfig
Sets parameters for various monitoring methods.
deepspeed/monitor/config.py:125
↓ 5 callers
Class
DummyMPU
tests/unit/model_parallelism/test_autotp_training.py:94
↓ 5 callers
Class
FP_Quantize
deepspeed/ops/fp_quantizer/quantize.py:43
↓ 5 callers
Class
HybridEngineRollout
Rollout engine using DeepSpeed hybrid engine. Args: engine: DeepSpeed engine wrapping the model. tokenizer: HuggingFace tokenizer
deepspeed/runtime/rollout/hybrid_engine_rollout.py:29
↓ 5 callers
Class
LayerNormOp
deepspeed/ops/transformer/inference/op_binding/layer_norm.py:12
↓ 5 callers
Class
LoRAConfig
Configuration settings for LoRAOptimizedLinear. Attributes: lora_r (int): LoRA attention dimension, also known as the rank. Defaults
deepspeed/linear/config.py:13
↓ 5 callers
Class
MockMoEOnlyTransformer
tests/unit/v1/moe/autoep_test_utils.py:135
↓ 5 callers
Class
MpiBackend
deepspeed/runtime/comm/mpi.py:16
↓ 5 callers
Class
Noop
deepspeed/comm/torch.py:92
↓ 5 callers
Class
OptimizedLinear
Optimized version of nn.Linear that adds features such as: * LoRA w. base weight sharding * FP [6,8,12] quantization Arguments:
deepspeed/linear/optimized_linear.py:18
↓ 5 callers
Class
PartitionedTensor
deepspeed/runtime/utils.py:668
↓ 5 callers
Class
QuantizerBuilder
op_builder/quantizer.py:9
↓ 5 callers
Class
RaggedLogitsGather
CUDA Kernel implementation for gather the hidden states of the final token of each sequence. This is used to reduce the cost of the performin
deepspeed/inference/v2/kernels/ragged_ops/logits_gather/logits_gather.py:14
↓ 5 callers
Class
SequentialLinearModel
tests/unit/model_parallelism/test_autotp_custom_patterns.py:26
↓ 5 callers
Class
SimpleConf
tests/unit/runtime/test_ds_config_model.py:17
↓ 5 callers
Class
SimpleFrozenModel
tests/unit/simple_model.py:39
↓ 5 callers
Class
TorchCheckpointEngine
deepspeed/runtime/checkpoint_engine/torch_checkpoint_engine.py:15
↓ 5 callers
Class
UtilsBuilder
op_builder/utils.py:9
↓ 5 callers
Class
_ConcatFusionAdapter
Concrete subclass that appends visual tokens after text tokens.
deepspeed/sequence/test_autosp.py:279
↓ 4 callers
Class
AutoTP
deepspeed/module_inject/auto_tp.py:194
↓ 4 callers
Class
BertConfig
Configuration class to store the configuration of a `BertModel`.
tests/unit/modeling.py:173
↓ 4 callers
Class
DSMoEConfig
Config class for DSMoEBase
deepspeed/inference/v2/modules/configs/moe_config.py:10
↓ 4 callers
Class
DeQuantizer
deepspeed/inference/quantization/utils.py:96
↓ 4 callers
Class
DeepSpeedCPUAdagrad
deepspeed/ops/adagrad/cpu_adagrad.py:11
↓ 4 callers
Class
DtypeEnum
deepspeed/runtime/config.py:101
next →
1–100 of 1,850, ranked by callers