MCPcopy Create free account

hub / github.com/deepspeedai/DeepSpeed / functions

Functions12,000 in github.com/deepspeedai/DeepSpeed

↓ 24 callersMethodwait
(self)
tests/unit/comm/test_dist.py:138
↓ 23 callersFunction_config
(zero_stage, world_size=2, contiguous_gradients=False, overlap_comm=False,
tests/unit/v1/zero/test_zero_coalesce_grad_reduction.py:16
↓ 23 callersFunction_make_gm
(graph)
tests/unit/v1/compile/test_offload_activation.py:63
↓ 23 callersMethoddecode
(self, *inputs, **kwargs)
deepspeed/model_implementations/diffusers/vae.py:56
↓ 23 callersMethodrun
(self)
tests/unit/common.py:157
↓ 23 callersMethodsizes
(self)
deepspeed/runtime/data_pipeline/data_sampling/indexed_dataset.py:546
↓ 23 callersMethodstore
csrc/deepspeed4science/evoformer_attn/kernel_backward.h:155
↓ 23 callersMethodsynchronize
(self)
tests/unit/v1/compile/test_graph_profile.py:47
↓ 23 callersMethodwait_stream
(self, other)
tests/unit/v1/zero/test_overlap_comm_record_stream.py:123
↓ 22 callersMethodStream
(self)
accelerator/hpu_accelerator.py:102
↓ 22 callersMethodautotp_size
(self)
deepspeed/runtime/engine.py:1432
↓ 22 callersFunctioncheckpoint
Checkpoint a model or part of the model. This has been directly copied from torch.utils.checkpoint. Tensor arguments passed by keyword partic
deepspeed/runtime/activation_checkpointing/checkpointing.py:1058
↓ 22 callersMethodeval
(self)
tests/unit/hybrid_engine/test_he_lora.py:87
↓ 22 callersFunctionget_caller_func
(frame=3)
deepspeed/utils/comms_logging.py:10
↓ 22 callersMethodget_param_id
(self, param)
deepspeed/runtime/zero/stage3.py:1519
↓ 22 callersFunctionz3_leaf_module
Returns whether a module in `model` has been flagged as a 'leaf' module. See `set_z3_leaf_modules` for more details. Args:
deepspeed/utils/z3_leaf_module.py:15
↓ 21 callersMethodGetCurrentStream
csrc/transformer/inference/includes/inference_context.h:228
↓ 21 callersFunction_run_pass
Drive both halves the way the schedule does: move everything, then keep what fits. The floor pass is profiled by the caller in production; here t
tests/unit/v1/compile/test_offload_activation.py:119
↓ 21 callersMethodclear
(self)
deepspeed/runtime/zero/stage3.py:133
↓ 21 callersMethodget_cache
Get the tensor associated with the given cache ID. Parameters: cache_id (int): The ID of the cache tensor to get.
deepspeed/inference/v2/ragged/kv_cache.py:183
↓ 21 callersMethodload_state_dict
(self, sd)
deepspeed/runtime/lr_schedules.py:674
↓ 21 callersMethodrecord_stream
(self, stream)
tests/unit/v1/zero/test_overlap_comm_record_stream.py:23
↓ 21 callersMethodresolves_data_dependency
(self)
accelerator/hpu_accelerator.py:50
↓ 21 callersMethodtype
()
deepspeed/runtime/sparse_tensor.py:39
↓ 20 callersFunction_make_mock_process_group
Return a mock object that satisfies dist.get_world_size / get_rank.
deepspeed/sequence/test_autosp.py:92
↓ 20 callersFunction_node_names
(graph)
tests/unit/v1/compile/test_offload_activation.py:134
↓ 20 callersMethod_splice_visual_into_text
(self, text_embeds, visual_embeds, input_ids)
deepspeed/sequence/test_autosp.py:282
↓ 20 callersFunctioncheckpoint_correctness_verification
(config_dict, models, hidden_d
tests/unit/checkpoint/common.py:166
↓ 20 callersMethodds_summary
(slf: torch.Tensor, use_debug_name: bool = False)
deepspeed/runtime/zero/partition_parameters.py:1617
↓ 20 callersMethodget_tensor_model_parallel_rank
(self)
deepspeed/runtime/pipe/topology.py:462
↓ 20 callersMethodlayer_norm
(inputs, gamma, beta, epsilon)
op_builder/npu/inference.py:54
↓ 20 callersMethodon_accelerator
(self, tensor)
accelerator/hpu_accelerator.py:242
↓ 20 callersMethodpartition_numel
()
deepspeed/runtime/zero/partition_parameters.py:1610
↓ 20 callersFunctionsafe_get_full_grad
Assemble and return the fp32 gradient of a low-precision (e.g., fp16) parameter. The return data type is that used for gradient accum
deepspeed/utils/tensor_fragment.py:207
↓ 20 callersFunctionskip_on_device
()
tests/unit/model_parallelism/test_autotp_custom_patterns.py:28
↓ 19 callersFunctioncollect_gradients_safe
Collect gradients from model parameters using safe_get_full_grad API
tests/unit/v1/zero/test_zero_user_backward.py:89
↓ 19 callersMethodfree_cpu_locked_tensor
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:374
↓ 19 callersMethodrun_test
(self, test_config, r_tol)
tests/model/Megatron_GPT2/run_func_test.py:483
↓ 19 callersFunctionvalidate_schedule
Validate that a DeepCompile pass schedule satisfies the registered pass contracts. ``schedule`` uses the ``[(step, passes), ...]`` format consume
deepspeed/compile/passes/contract.py:77
↓ 18 callersMethod_incr_stats
(self, key, incr=1)
deepspeed/io/base_file_writer.py:35
↓ 18 callersFunction_make_fwd_graph
A forward graph shaped like a partitioned one: the caller's output first, then saved values. x -> act_0 -> act_1 -> out. The activations are also
tests/unit/v1/compile/test_offload_activation.py:67
↓ 18 callersFunction_make_profile
(graph, peak=10**9, num_fwd_outputs=1)
tests/unit/v1/compile/test_offload_activation.py:88
↓ 18 callersMethod_swappable_optimizer_subgroup
(self, sub_group_id)
deepspeed/runtime/zero/stage3.py:1218
↓ 18 callersMethodcleanup
(self)
ci/test_tests_fetcher.py:105
↓ 18 callersMethoddata
(self)
deepspeed/runtime/utils.py:759
↓ 18 callersMethodget_model_parallel_group
(self)
deepspeed/runtime/pipe/topology.py:452
↓ 18 callersMethodnew_cpu_locked_tensor
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:367
↓ 18 callersMethodset_gradient_accumulation_boundary
Manually overrides the DeepSpeed engine's gradient accumulation boundary state, this is an optional feature and should be used with c
deepspeed/runtime/engine.py:3398
↓ 18 callersFunctionskip_on_arch
(min_arch=7)
tests/unit/util.py:18
↓ 18 callersMethodto
(self, *args, **kwargs)
deepspeed/inference/v2/inference_parameter.py:40
↓ 17 callersMethod_op
Return torch.ops.deepspeed.<name>, raising clearly if not registered.
op_builder/supa/quantizer.py:23
↓ 17 callersFunctioncompare_gradients
Compare gradients between DDP and DeepSpeed. Uses PyTorch's default tolerances for the tensor dtype (e.g., for bfloat16: rtol=1.6e-2, atol=1e
tests/unit/v1/zero/test_zero_user_backward.py:161
↓ 17 callersFunctionfn
(compat_tensor: nn.Parameter)
deepspeed/inference/quantization/utils.py:201
↓ 17 callersMethodget_world_group
(self)
deepspeed/comm/torch.py:513
↓ 17 callersFunctionseed_everything
(seed=1234)
tests/unit/v1/moe/autoep_test_utils.py:223
↓ 17 callersMethodset_device
(self, device_index)
accelerator/hpu_accelerator.py:63
↓ 17 callersMethodzero_optimization_stage
(self)
deepspeed/runtime/engine.py:1343
↓ 16 callersMethodbfloat16_enabled
(self)
deepspeed/runtime/engine.py:1441
↓ 16 callersFunctioncollect_autotp_universal_checkpoint_info
Collect the model-level conversion schema for AutoTP universal checkpoints. The returned `UNIVERSAL_CHECKPOINT_INFO` is intentionally limited to
deepspeed/module_inject/layers.py:590
↓ 16 callersFunctioncollect_ddp_gradients
Collect gradients from DDP model
tests/unit/v1/zero/test_zero_user_backward.py:151
↓ 16 callersMethodinstantiate_config
Given a DSModule key, attempt to instantiate
deepspeed/inference/v2/modules/module_registry.py:28
↓ 16 callersMethodmatch
(self, module)
deepspeed/module_inject/containers/vae.py:30
↓ 16 callersMethodpin
(self, tensor, make_copy=True, match_shape=True)
deepspeed/utils/pin_memory.py:41
↓ 16 callersMethodrun_test
(self, test_config, r_tol)
tests/model/Megatron_GPT2/run_checkpoint_test.py:436
↓ 16 callersMethodselect
(self, base: str | None, commit_message: str = "")
ci/tests_fetcher.py:490
↓ 16 callersMethodset_iteration_index
Overrides the internal iteration index
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:757
↓ 16 callersFunctionset_num_kv_heads
(num)
deepspeed/module_inject/tp_shard.py:15
↓ 16 callersFunctionskip_on_device
()
tests/unit/model_parallelism/test_autotp_training.py:27
↓ 16 callersMethodwall_clock_breakdown
(self)
deepspeed/runtime/engine.py:1200
↓ 15 callersMethodGetWorkSpace
csrc/transformer/inference/includes/inference_context.h:200
↓ 15 callersFunction_test_activation_checkpoint
(module, *inputs)
tests/unit/runtime/activation_checkpointing/test_activation_checkpointing.py:65
↓ 15 callersMethodadd_tile_offset
Advances an iterator along logical dimensions of matrix in units of whole tiles
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:772
↓ 15 callersMethodall_to_all_single
(self, output, input, output_split_sizes, input_split_sizes, group=None, async_op=False)
deepspeed/comm/ccl.py:117
↓ 15 callersMethodfp16_enabled
(self)
deepspeed/runtime/engine.py:1438
↓ 15 callersMethodget_param_id
(self, param)
deepspeed/runtime/zero/stage_1_and_2.py:1193
↓ 15 callersMethodload
(self, path: str, map_location=None)
deepspeed/runtime/checkpoint_engine/checkpoint_engine.py:39
↓ 15 callersMethodrun_collective
(self, name, **kwargs)
deepspeed/comm/ccl.py:63
↓ 15 callersFunctionvalidate_autoep_config
Validate config constraints. Raises ValueError on invalid config.
deepspeed/module_inject/auto_ep_config.py:96
↓ 15 callersMethodzero_optimization_partition_weights
(self)
deepspeed/runtime/engine.py:1377
↓ 14 callersMethodDropout
csrc/includes/dropout.h:26
↓ 14 callersMethod__init__
(self, dim=None, dtype=torch.float, eps=1e-5, weight=None, bias=None)
deepspeed/module_inject/layers.py:1331
↓ 14 callersFunction_make_param
(shape, meta=None)
tests/unit/checkpoint/test_autotp_uc_checkpoint.py:59
↓ 14 callersMethod_replace_module
(self, r_module, prev_name='', prev_class_name='')
deepspeed/module_inject/auto_tp.py:714
↓ 14 callersFunctionallclose
(x, y)
tests/unit/ops/transformer/inference/test_gelu.py:18
↓ 14 callersFunctionbuild_folding_spec
Build the immutable per-stage folding spec from public config sizes.
deepspeed/module_inject/auto_ep_folding.py:81
↓ 14 callersFunctionconvert_to_shared
deepspeed/inference/v2/kernels/includes/memory_access_utils.h:586
↓ 14 callersFunctionconvert_to_shared
csrc/includes/memory_access_utils.h:586
↓ 14 callersMethodget
csrc/includes/memory_access_utils.h:74
↓ 14 callersMethodget
Returns a pointer
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:779
↓ 14 callersFunctiongetStreamFromPool
csrc/xpu/adam/multi_tensor_apply.dp.hpp:30
↓ 14 callersFunctionget_deepcompile_handle
()
deepspeed/compile/util.py:50
↓ 14 callersFunctionis_moe_param
(param: torch.Tensor)
deepspeed/moe/utils.py:27
↓ 14 callersMethodmemory_allocated
(self, device_index=None)
accelerator/hpu_accelerator.py:123
↓ 14 callersFunctionprint_rank_0
(message, debug=False, force=False)
deepspeed/runtime/zero/partition_parameters.py:120
↓ 14 callersFunctionrun_cpu_gloo_test
Run a small CPU/Gloo distributed test without requiring visible GPU devices.
tests/unit/v1/moe/autoep_test_utils.py:373
↓ 14 callersMethodvalid
Returns whether access is valid or not
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_access_iterator_residual_last.h:826
↓ 14 callersMethodwait
csrc/aio/py_lib/deepspeed_py_io_handle.cpp:205
↓ 13 callersMethod__init__
(self, hidden_dim, n_layers, freeze_params)
tests/unit/v1/zero/test_zero.py:440
↓ 13 callersFunction_make_engine
()
tests/unit/runtime/rollout/test_hybrid_engine_rollout.py:26
↓ 13 callersFunction_make_tokenizer
()
tests/unit/runtime/rollout/test_hybrid_engine_rollout.py:33
← previousnext →101–200 of 12,000, ranked by callers