MCPcopy Create free account

hub / github.com/deepspeedai/DeepSpeed / functions

Functions10,922 in github.com/deepspeedai/DeepSpeed

↓ 2 callersMethodapply_tensor_parallelism
(self, mp_replace)
deepspeed/module_inject/containers/base.py:226
↓ 2 callersFunctionapply_to_tensors_only
Apply `function` to every Tensor in `value`. Args: functional: The function class to apply. value (Any): Target object to ap
deepspeed/runtime/zero/utils.py:148
↓ 2 callersFunctionassert_all_partitioned
For ZeRO-3, assert every non-persistent param is released after backward. The recompute bug left frozen params gathered after backward, so the re
tests/unit/v1/zero/test_zero_user_backward.py:219
↓ 2 callersFunctionassert_close_for_preferred_dtype
(actual, expected)
tests/unit/model_parallelism/test_autotp_custom_patterns.py:186
↓ 2 callersFunctionassert_group_matches_spec
Ensure cached ``ep_size_N`` rank lists match the requested folding spec.
deepspeed/module_inject/auto_ep_folding.py:496
↓ 2 callersFunctionassert_no_cuda_mismatch
(name="")
op_builder/builder.py:90
↓ 2 callersFunctionassert_persistent_resident
For ZeRO-3, assert every persistent param stays gathered (AVAILABLE) after backward. Persistent frozen params are added to a recompute owner duri
tests/unit/v1/zero/test_zero_user_backward.py:236
↓ 2 callersFunctionassert_tp_payload_consistent
(payload: RoutedAssignmentPayload, *, tp_group, tp_size: int)
deepspeed/moe/ep_tp_dispatch.py:210
↓ 2 callersMethodasync_step
Queue parameter for optimization in the worker process.
deepspeed/runtime/superoffload/superoffload_utils.py:220
↓ 2 callersMethodattention
(self, client_module)
deepspeed/module_inject/containers/vae.py:41
↓ 2 callersMethodattention_quantization
(self)
deepspeed/module_inject/containers/base.py:218
↓ 2 callersFunctionautoep_folding_gradient_reduction_strategy
Classify one folded TP/SP gradient as ``sum``, ``average``, or ``skip``. TP means Tensor Parallel and SP means Sequence Parallel. The parallel mo
deepspeed/module_inject/auto_ep_folding.py:341
↓ 2 callersFunctionavailable_preset_names
Return built-in AutoEP preset names in registry order.
deepspeed/module_inject/auto_ep_presets/registry.py:63
↓ 2 callersMethodavailable_swap_in_buffers
(self)
deepspeed/runtime/swap_tensor/partitioned_param_swapper.py:80
↓ 2 callersMethodbackward
(ctx, input_)
deepspeed/moe/mappings.py:101
↓ 2 callersMethodbackward_epilogue
(self, **kwargs)
deepspeed/runtime/base_optimizer.py:414
↓ 2 callersMethodbackward_prologue
(self)
deepspeed/runtime/base_optimizer.py:411
↓ 2 callersFunctionbasic_folder_validation
(dir)
deepspeed/checkpoint/reshape_utils.py:13
↓ 2 callersMethodbf16_master_weights_and_gradients
(self)
deepspeed/runtime/engine.py:1252
↓ 2 callersFunctionbias_add_activation
(C, bias=None, activation="")
deepspeed/ops/transformer/inference/triton/matmul_ext.py:69
↓ 2 callersMethodbroadcast_object_list
(self, object_list, src, group=None, device=None)
deepspeed/comm/torch.py:239
↓ 2 callersMethodbuffered_allreduce_fallback
(self, grads=None, elements_per_buffer=500000000)
deepspeed/runtime/engine.py:3603
↓ 2 callersFunctionbuild_inputs
(n_tokens: int, n_experts: int, n_top_k: int, do_padding: bool)
tests/unit/inference/v2/kernels/ragged_ops/test_moe_gather.py:35
↓ 2 callersFunctionbuild_rollout
Factory: construct the rollout engine specified by ``rollout_cfg.engine``. Args: rollout_cfg: :class:`RolloutConfig` (or any object with
deepspeed/runtime/rollout/__init__.py:33
↓ 2 callersFunctioncall_fn
()
tests/unit/v1/compile/test_graph_profile.py:98
↓ 2 callersMethodcan_reshape
(self, target_3d_desc)
deepspeed/checkpoint/reshape_3d_utils.py:56
↓ 2 callersFunctioncanonical_name
Generates a name from the acronyms of the tuning keys in the config dict. TRAIN_MICRO_BATCH_SIZE_PER_GPU is always included in the tuning keys. A
deepspeed/autotuning/utils.py:315
↓ 2 callersFunctionceil_div
Return ceil(a / b).
deepspeed/inference/v2/inference_utils.py:101
↓ 2 callersMethodcheck
(self, param_groups=None)
deepspeed/runtime/utils.py:260
↓ 2 callersFunctioncheck_equal
(first, second, atol=1e-2, verbose=False)
tests/unit/ops/adagrad/test_cpu_adagrad.py:20
↓ 2 callersFunctioncheck_equal
(first, second, atol=1e-2, verbose=False)
tests/unit/ops/lion/test_cpu_lion.py:20
↓ 2 callersFunctioncheck_equal
(first, second, atol=1e-2, verbose=False)
tests/unit/ops/adam/test_cpu_adam.py:25
↓ 2 callersMethodcheck_index
(self, i)
deepspeed/runtime/data_pipeline/data_sampling/indexed_dataset.py:168
↓ 2 callersFunctioncheck_internal_apis_for_count_used_parameters
Ensure the Torch internal APIs needed by `count_used_parameters_in_backward` exist.
deepspeed/runtime/utils.py:1429
↓ 2 callersMethodcheck_overflow
(self, partition_gradients=True)
deepspeed/runtime/zero/stage3.py:2999
↓ 2 callersMethodcheck_parity
(self, base_file, test_file, r_tol)
tests/model/Megatron_GPT2/run_func_test.py:536
↓ 2 callersFunctionclean_up
(exp: dict, reservations)
deepspeed/autotuning/scheduler.py:401
↓ 2 callersMethodclear
< Efficiently disables all accesses guarded by mask
csrc/deepspeed4science/evoformer_attn/iterators/epilogue_predicated_tile_iterator.h:151
↓ 2 callersMethodclear_all_gathered_params
(self)
tests/unit/v1/compile/test_graph_profile.py:62
↓ 2 callersMethodclear_hp_grads
(self)
deepspeed/runtime/bf16_optimizer.py:466
↓ 2 callersFunctionclip_grad_norm_
Clips gradient norm of an iterable of parameters. This has been adapted from Nvidia megatron. We add norm averaging to consider MoE params wh
deepspeed/runtime/utils.py:359
↓ 2 callersMethodcmd
(self)
deepspeed/nvme/ds_aio_job.py:20
↓ 2 callersMethodcmd
(self)
csrc/aio/py_test/ds_aio_job.py:20
↓ 2 callersFunctioncode
(dtype)
deepspeed/runtime/data_pipeline/data_sampling/indexed_dataset.py:116
↓ 2 callersFunctioncompare_lr_scheduler_states
(saved_model, loaded_model)
tests/unit/checkpoint/common.py:126
↓ 2 callersFunctioncompare_opt_state_dicts
(state0, state1, expected_mismatch_keys=[])
tests/unit/checkpoint/common.py:105
↓ 2 callersFunctioncompare_optimizer_states
(saved_model, loaded_model, hidden_dim, fp16=True)
tests/unit/checkpoint/common.py:118
↓ 2 callersMethodcompile
(self, *args, **kwargs)
deepspeed/runtime/pipe/module.py:692
↓ 2 callersMethodcomplete_component
Mark a component as completed. This should be called by the relevant setter of a direct property or a ParametrizedList. This method w
deepspeed/inference/v2/model_implementations/parameter_base.py:152
↓ 2 callersMethodcomplete_grad_norm_calculation_for_cpu_offload
(self, params)
deepspeed/runtime/zero/stage3.py:1783
↓ 2 callersMethodcompress_by_chunk
(self, cupy_bool_tensor, num_chunks)
deepspeed/runtime/compression/cupy.py:22
↓ 2 callersFunctionconsolidate_autoep_expert_files
Consolidate per-expert checkpoint files into full-expert universal format. For each AutoEP layer, loads all per-expert files, stacks into [E_
deepspeed/checkpoint/autoep_universal.py:207
↓ 2 callersFunctionconvert_zero_checkpoint_to_fp32_state_dict
Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be loaded with ``torch.load(file)`` + ``load_stat
deepspeed/utils/zero_to_fp32.py:628
↓ 2 callersMethodcopy_mv_from_cpu
(self, params)
deepspeed/ops/adam/zenflow_torch_adam.py:391
↓ 2 callersMethodcopy_mv_to_cpu
(self, params)
deepspeed/ops/adam/zenflow_torch_adam.py:396
↓ 2 callersFunctioncopy_to_device
Return a copy of tensor on specified device. Works on individual tensors, and tensors contained/nested in lists, tuples, and dicts. Param
deepspeed/runtime/utils.py:164
↓ 2 callersFunctioncreate_config_file
(tmpdir, zeroenabled=False)
tests/model/BingBertSquad/test_e2e_squad.py:30
↓ 2 callersFunctioncreate_deepspeed_engine_from_model
(model, zero_stage, gradient_accumulation_steps=1)
tests/unit/v1/zero/test_zero_user_backward.py:126
↓ 2 callersMethodcreate_ds_model_config
(self)
deepspeed/module_inject/containers/base.py:88
↓ 2 callersMethodcreate_logger
create a logger Args: name (str): name of the logger level: level of logger Raises: ValueError i
deepspeed/utils/logging.py:25
↓ 2 callersFunctioncreate_mem_table
(graph: Graph)
deepspeed/compile/list_schedule.py:94
↓ 2 callersFunctioncreate_model
(config_dict)
tests/unit/runtime/test_multiple_models.py:14
↓ 2 callersMethodcreate_module
(self, config=None)
deepspeed/module_inject/containers/opt.py:26
↓ 2 callersFunctioncreate_perf_jobs
(io_op_desc, log_dir, cmd_lines)
deepspeed/nvme/perf_run_sweep.py:235
↓ 2 callersFunctioncreate_perf_jobs
(io_op_desc, log_dir, cmd_lines)
csrc/aio/py_test/aio_bench_perf_sweep.py:226
↓ 2 callersFunctioncreate_predictor
()
deepspeed/compile/profilers/comm_profile.py:126
↓ 2 callersFunctioncreate_shard_offsets
(gm: GraphModule, s0_node: Node)
deepspeed/compile/util.py:540
↓ 2 callersFunctioncreate_symbolic_slice_indices
( gm: GraphModule, sym_seq_dim_node: Node, )
deepspeed/compile/util.py:582
↓ 2 callersMethodcupy2torch
(self, cupy_tensor)
deepspeed/runtime/compression/cupy.py:19
↓ 2 callersMethodcurrent_device
(self)
accelerator/cuda_accelerator.py:79
↓ 2 callersMethodcurrent_device_name
(self)
accelerator/xpu_accelerator.py:59
↓ 2 callersMethodcurrent_tokens
(self)
deepspeed/ops/transformer/inference/op_binding/workspace.py:129
↓ 2 callersMethodcurriculum_params_legacy
(self)
deepspeed/runtime/engine.py:950
↓ 2 callersMethodcxx_args
(self)
op_builder/xpu/builder.py:71
↓ 2 callersFunctiondebug_param2name_id_shape_device
(param)
deepspeed/utils/debug.py:76
↓ 2 callersFunctiondebug_rank0
(message: str)
deepspeed/runtime/zero/partitioned_param_coordinator.py:29
↓ 2 callersMethoddeepspeed_io
(self, dataset, batch_size=None, route=ROUTE_TR
deepspeed/runtime/engine.py:2486
↓ 2 callersFunctiondel_if_exists
Deletes a key from a dictionary if it exists. Args: t (string): target key to delete d (dict): dictionary to delete from
deepspeed/autotuning/utils.py:95
↓ 2 callersMethoddelete
(self, rel: str)
ci/test_tests_fetcher.py:93
↓ 2 callersMethoddequantize
(cls, fp_out, input_q, scale, group_size, q_mantisa_bits, q_exponent_bits)
op_builder/hpu/fp_quantizer.py:56
↓ 2 callersFunctiondetach_variable
(inputs, device=None)
deepspeed/runtime/activation_checkpointing/checkpointing.py:68
↓ 2 callersMethoddtype
(self)
deepspeed/runtime/data_pipeline/data_sampling/indexed_dataset.py:571
↓ 2 callersFunctiondump_param_fragment
(dir, tp_index, dp_index, state_name, state_flat_tensor, param_name, offset, numel)
deepspeed/checkpoint/ds_to_universal.py:196
↓ 2 callersMethodeigenvalue_gas_boundary_resolution
(self)
deepspeed/runtime/engine.py:938
↓ 2 callersMethodeigenvalue_layer_num
(self)
deepspeed/runtime/engine.py:944
↓ 2 callersMethodenable
< CUTLASS_HOST_DEVICE enables all accesses guarded by mask
csrc/deepspeed4science/evoformer_attn/iterators/predicated_tile_iterator_atomic.h:551
↓ 2 callersMethodenable_profiling
(self, enabled)
tests/unit/v1/compile/test_graph_profile.py:59
↓ 2 callersMethodenable_symm_mem_for_group
(self, group_name)
deepspeed/comm/torch.py:455
↓ 2 callersFunctionenable_universal_checkpoint
(param_list)
deepspeed/checkpoint/universal_checkpoint.py:238
↓ 2 callersFunctionencode_world_info
(world_info)
deepspeed/launcher/runner.py:401
↓ 2 callersMethodenter_backward
Enter backward context. Call at the start of backward pass.
deepspeed/runtime/base_optimizer.py:439
↓ 2 callersMethodexit_backward
Exit backward context. Call at the end of backward pass.
deepspeed/runtime/base_optimizer.py:443
↓ 2 callersMethodextend_kv_cache
Extend the KV-cache for the sequence. Arguments: new_ids (Union[List[torch.IntTensor], torch.IntTensor]): For each alloc
deepspeed/inference/v2/ragged/sequence_descriptor.py:235
↓ 2 callersMethodfast_enabled
(self)
deepspeed/autotuning/autotuner.py:241
↓ 2 callersFunctionfast_free_schedule
(graph: Graph, available_mem: int, output_size: int, debug_log: bool)
deepspeed/compile/list_schedule.py:283
↓ 2 callersMethodfetch_sub_module
This method does the following (in order): 1. kick off fetch for parameters in immediately required sub module 2. kick off fetch for n
deepspeed/runtime/zero/partitioned_param_coordinator.py:310
↓ 2 callersMethodfile_path
(self)
deepspeed/io/base_file_writer.py:32
↓ 2 callersMethodfill_buffer
(src_tensor, src_offset, buffer_tensor, buffer_offset)
deepspeed/io/base_io_buffer.py:56
↓ 2 callersFunctionfill_indices_cpu
Pure-PyTorch CPU reference for filling permutation indices.
deepspeed/moe/ep_kernels.py:157
↓ 2 callersMethodfilter_match
Return the list of ranks whose coordinates match the provided criteria. Example: >>> X = ProcessTopology(axes=['pipe', 'data', 'm
deepspeed/runtime/pipe/topology.py:167
← previousnext →1,501–1,600 of 10,922, ranked by callers