MCPcopy Create free account

hub / github.com/deepspeedai/DeepSpeed / functions

Functions11,258 in github.com/deepspeedai/DeepSpeed

↓ 21 callersMethodeval
(self)
tests/unit/hybrid_engine/test_he_lora.py:87
↓ 21 callersMethodget_cache
Get the tensor associated with the given cache ID. Parameters: cache_id (int): The ID of the cache tensor to get.
deepspeed/inference/v2/ragged/kv_cache.py:186
↓ 21 callersMethodload_state_dict
(self, sd)
deepspeed/runtime/lr_schedules.py:661
↓ 21 callersMethodresolves_data_dependency
(self)
accelerator/hpu_accelerator.py:50
↓ 21 callersMethodstore
csrc/deepspeed4science/evoformer_attn/kernel_backward.h:155
↓ 21 callersMethodtype
()
deepspeed/runtime/sparse_tensor.py:39
↓ 21 callersMethodwait_stream
(self, other)
tests/unit/v1/zero/test_overlap_comm_record_stream.py:123
↓ 20 callersMethodStream
(self)
accelerator/hpu_accelerator.py:102
↓ 20 callersFunction_make_mock_process_group
Return a mock object that satisfies dist.get_world_size / get_rank.
deepspeed/sequence/test_autosp.py:92
↓ 20 callersMethod_splice_visual_into_text
(self, text_embeds, visual_embeds, input_ids)
deepspeed/sequence/test_autosp.py:282
↓ 20 callersMethodautotp_size
(self)
deepspeed/runtime/engine.py:1291
↓ 20 callersFunctioncheckpoint_correctness_verification
(config_dict, models, hidden_d
tests/unit/checkpoint/common.py:166
↓ 20 callersMethodcompile
Compile the module using the specified backend and kwargs. If a compiler_fn is set, it will be used instead of torch.compile().
deepspeed/runtime/engine.py:5603
↓ 20 callersMethodds_summary
(slf: torch.Tensor, use_debug_name: bool = False)
deepspeed/runtime/zero/partition_parameters.py:1600
↓ 20 callersMethodlayer_norm
(inputs, gamma, beta, epsilon)
op_builder/npu/inference.py:54
↓ 20 callersMethodoutput
Returns the pre-allocated, padded output Tensor.
deepspeed/inference/v2/modules/interfaces/moe_base.py:79
↓ 20 callersMethodpartition_numel
()
deepspeed/runtime/zero/partition_parameters.py:1593
↓ 20 callersMethodsynchronize
(self)
tests/unit/v1/compile/test_graph_profile.py:47
↓ 19 callersFunctioncollect_gradients_safe
Collect gradients from model parameters using safe_get_full_grad API
tests/unit/v1/zero/test_zero_user_backward.py:87
↓ 19 callersMethodrecord_stream
(self, stream)
tests/unit/v1/zero/test_overlap_comm_record_stream.py:23
↓ 19 callersMethodrun_test
(self, test_config, r_tol)
tests/model/Megatron_GPT2/run_func_test.py:483
↓ 18 callersMethod_incr_stats
(self, key, incr=1)
deepspeed/io/base_file_writer.py:35
↓ 18 callersMethod_swappable_optimizer_subgroup
(self, sub_group_id)
deepspeed/runtime/zero/stage3.py:1180
↓ 18 callersMethodcleanup
(self)
ci/test_tests_fetcher.py:105
↓ 18 callersMethoddata
(self)
deepspeed/runtime/utils.py:751
↓ 18 callersMethodget_model_parallel_group
(self)
deepspeed/runtime/pipe/topology.py:452
↓ 18 callersMethodon_accelerator
(self, tensor)
accelerator/hpu_accelerator.py:240
↓ 18 callersMethodto
(self, *args, **kwargs)
deepspeed/inference/v2/inference_parameter.py:40
↓ 18 callersMethodzero_optimization_stage
(self)
deepspeed/runtime/engine.py:1207
↓ 17 callersMethod_op
Return torch.ops.deepspeed.<name>, raising clearly if not registered.
op_builder/supa/quantizer.py:23
↓ 17 callersFunctioncompare_gradients
Compare gradients between DDP and DeepSpeed. Uses PyTorch's default tolerances for the tensor dtype (e.g., for bfloat16: rtol=1.6e-2, atol=1e
tests/unit/v1/zero/test_zero_user_backward.py:159
↓ 17 callersFunctionfn
(compat_tensor: nn.Parameter)
deepspeed/inference/quantization/utils.py:201
↓ 17 callersFunctionskip_on_arch
(min_arch=7)
tests/unit/util.py:18
↓ 16 callersMethodbfloat16_enabled
(self)
deepspeed/runtime/engine.py:1300
↓ 16 callersMethodclear
(self)
deepspeed/runtime/zero/stage3.py:131
↓ 16 callersFunctioncollect_ddp_gradients
Collect gradients from DDP model
tests/unit/v1/zero/test_zero_user_backward.py:149
↓ 16 callersMethodfree_cpu_locked_tensor
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:374
↓ 16 callersFunctionget_shard_size_list
(total_size, mp_size, name=None)
deepspeed/module_inject/tp_shard.py:75
↓ 16 callersMethodget_world_group
(self)
deepspeed/comm/torch.py:413
↓ 16 callersMethodinstantiate_config
Given a DSModule key, attempt to instantiate
deepspeed/inference/v2/modules/module_registry.py:28
↓ 16 callersMethodmatch
(self, module)
deepspeed/module_inject/containers/vae.py:30
↓ 16 callersMethodrun_test
(self, test_config, r_tol)
tests/model/Megatron_GPT2/run_checkpoint_test.py:436
↓ 16 callersFunctionseed_everything
(seed=1234)
tests/unit/v1/moe/autoep_test_utils.py:223
↓ 16 callersMethodset_device
(self, device_index)
accelerator/hpu_accelerator.py:63
↓ 16 callersMethodset_iteration_index
Overrides the internal iteration index
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:757
↓ 16 callersMethodwall_clock_breakdown
(self)
deepspeed/runtime/engine.py:1064
↓ 15 callersMethodadd_tile_offset
Advances an iterator along logical dimensions of matrix in units of whole tiles
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:772
↓ 15 callersMethodall_to_all_single
(self, output, input, output_split_sizes, input_split_sizes, group=None, async_op=False)
deepspeed/comm/ccl.py:117
↓ 15 callersMethodfp16_enabled
(self)
deepspeed/runtime/engine.py:1297
↓ 15 callersMethodload
(self, path: str, map_location=None)
deepspeed/runtime/checkpoint_engine/checkpoint_engine.py:39
↓ 15 callersMethodnew_cpu_locked_tensor
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:367
↓ 15 callersMethodrun_collective
(self, name, **kwargs)
deepspeed/comm/ccl.py:63
↓ 15 callersFunctionsafe_get_full_grad
Assemble and return the fp32 gradient of a low-precision (e.g., fp16) parameter. The return data type is that used for gradient accum
deepspeed/utils/tensor_fragment.py:207
↓ 15 callersMethodselect
(self, base: str | None, commit_message: str = "")
ci/tests_fetcher.py:490
↓ 15 callersFunctionvalidate_autoep_config
Validate config constraints. Raises ValueError on invalid config.
deepspeed/module_inject/auto_ep_config.py:96
↓ 15 callersMethodzero_optimization_partition_weights
(self)
deepspeed/runtime/engine.py:1233
↓ 14 callersMethodDropout
csrc/includes/dropout.h:26
↓ 14 callersMethodGetWorkSpace
csrc/transformer/inference/includes/inference_context.h:188
↓ 14 callersFunction_test_activation_checkpoint
(module, *inputs)
tests/unit/runtime/activation_checkpointing/test_activation_checkpointing.py:65
↓ 14 callersFunctionallclose
(x, y)
tests/unit/ops/transformer/inference/test_gelu.py:18
↓ 14 callersFunctionbuild_folding_spec
Build the immutable per-stage folding spec from public config sizes.
deepspeed/module_inject/auto_ep_folding.py:81
↓ 14 callersFunctionconvert_to_shared
deepspeed/inference/v2/kernels/includes/memory_access_utils.h:586
↓ 14 callersFunctionconvert_to_shared
csrc/includes/memory_access_utils.h:586
↓ 14 callersMethodget
csrc/includes/memory_access_utils.h:74
↓ 14 callersMethodget
Returns a pointer
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:779
↓ 14 callersFunctiongetStreamFromPool
csrc/xpu/adam/multi_tensor_apply.dp.hpp:30
↓ 14 callersFunctionis_moe_param
(param: torch.Tensor)
deepspeed/moe/utils.py:27
↓ 14 callersMethodmemory_allocated
(self, device_index=None)
accelerator/hpu_accelerator.py:123
↓ 14 callersFunctionprint_rank_0
(message, debug=False, force=False)
deepspeed/runtime/zero/partition_parameters.py:114
↓ 14 callersFunctionrun_cpu_gloo_test
Run a small CPU/Gloo distributed test without requiring visible GPU devices.
tests/unit/v1/moe/autoep_test_utils.py:373
↓ 14 callersFunctionskip_on_device
()
tests/unit/model_parallelism/test_autotp_training.py:26
↓ 14 callersMethodvalid
Returns whether access is valid or not
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:826
↓ 14 callersMethodwait
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:205
↓ 13 callersMethod__init__
(self, dim=None, dtype=torch.float, eps=1e-5, weight=None, bias=None)
deepspeed/module_inject/layers.py:1029
↓ 13 callersFunctionbuild_managed_gas_config
fp32 config toggling managed_gradient_accumulation; micro-batch 1 so total_samples == micro-batch count.
tests/unit/v1/zero/test_zero_user_backward.py:1834
↓ 13 callersFunctioncheckpoint
Checkpoint a model or part of the model. This has been directly copied from torch.utils.checkpoint. Tensor arguments passed by keyword partic
deepspeed/runtime/activation_checkpointing/checkpointing.py:948
↓ 13 callersMethodcoalesce_grad_reduction
r"""Coalesce ZeRO 1/2/3 gradient reduction across multiple engine.backward() calls. One with-block == one optimizer step: every backward insid
deepspeed/runtime/engine.py:2999
↓ 13 callersMethodcommit
(self, message: str)
ci/test_tests_fetcher.py:98
↓ 13 callersMethoddevice_count
(self)
accelerator/hpu_accelerator.py:72
↓ 13 callersFunctionget_deepcompile_handle
()
deepspeed/compile/util.py:50
↓ 13 callersMethodget_rng_state
(self, device_index=None)
accelerator/hpu_accelerator.py:85
↓ 13 callersMethodgradient_accumulation_steps
(self)
deepspeed/runtime/engine.py:1334
↓ 13 callersMethodis_pinned
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:380
↓ 13 callersFunctionprint_rank_0
(message, debug=False, force=False)
deepspeed/runtime/zero/linear.py:32
↓ 13 callersMethodrecv
(self, tensor, src, group=None, tag=0)
deepspeed/comm/ccl.py:128
↓ 13 callersFunctionreset_random
(seed=1234)
tests/unit/inference/quantization/test_intX_quantization.py:29
↓ 13 callersMethodsend
(self, tensor, dst, group=None, tag=0)
deepspeed/comm/ccl.py:125
↓ 13 callersMethodset_gradient_accumulation_boundary
Manually overrides the DeepSpeed engine's gradient accumulation boundary state, this is an optional feature and should be used with c
deepspeed/runtime/engine.py:3234
↓ 13 callersMethodtrain_micro_batch_size_per_gpu
(self)
deepspeed/runtime/engine.py:1131
↓ 13 callersMethodwait
deepspeed/runtime/zero/mics.py:40
↓ 13 callersMethodwait
(self)
deepspeed/runtime/swap_tensor/pipelined_optimizer_swapper.py:34
↓ 12 callersMethod__init__
(self, hidden_dim, n_layers, freeze_params)
tests/unit/v1/zero/test_zero.py:245
↓ 12 callersFunction_assert_close
(ref, test, label, tol=1e-6)
tests/unit/v1/zero/test_zero_coalesce_grad_reduction.py:71
↓ 12 callersFunction_get_hf_tp_plan
Extract tp_plan from HuggingFace model. Merge plans from the model config, model class, and runtime instance. HuggingFace may replace the ins
deepspeed/runtime/tensor_parallel/config.py:149
↓ 12 callersMethod_get_param_partition_group
(self, param)
deepspeed/runtime/zero/stage3.py:594
↓ 12 callersMethodclear
< Efficiently disables all accesses guarded by mask
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_iterator_atomic.h:544
↓ 12 callersMethodclose
(self)
deepspeed/io/py_file_writer.py:17
↓ 12 callersMethoddump
(self, path)
deepspeed/compile/profilers/graph_profile.py:377
↓ 12 callersMethodget_param_id
(self, param)
deepspeed/runtime/zero/stage_1_and_2.py:1129
↓ 12 callersFunctioninstalled_cuda_version
(name="")
op_builder/builder.py:47
← previousnext →101–200 of 11,258, ranked by callers