MCPcopy Create free account

hub / github.com/ChenxinAn-fdu/POLARIS / functions

Functions1,563 in github.com/ChenxinAn-fdu/POLARIS

↓ 5 callersFunction_broadcast_tensor
broadcast tensor across mp_group
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_saver.py:119
↓ 5 callersFunction_broadcast_tensor
broadcast tensor across mp_group
verl/verl/models/llama/megatron/checkpoint_utils/llama_saver.py:119
↓ 5 callersFunction_hdfs_cmd
(cmd: str)
verl/verl/utils/hdfs_io.py:144
↓ 5 callersFunction_run_cmd
(cmd: str, timeout=None)
verl/verl/utils/hdfs_io.py:140
↓ 5 callersMethodall_gather
(self)
verl/tests/ray_gpu/test_worker_group_torch.py:39
↓ 5 callersFunctionapply_rotary_pos_emb
(q, k, cos, sin, position_ids)
verl/verl/models/qwen2/megatron/layers/parallel_attention.py:126
↓ 5 callersMethodcheck
(self)
verl/verl/utils/debug/profile.py:58
↓ 5 callersMethodcompute_log_prob
Compute logits given a batch of data. Args: data (DataProto): a batch of data represented by DataProto. It must contain key ```in
verl/verl/workers/actor/base.py:40
↓ 5 callersMethodcompute_ref_log_prob
(self, data: DataProto)
verl/verl/workers/fsdp_workers.py:659
↓ 5 callersMethodcompute_rm_score
(self, data: DataProto)
verl/recipe/prime/prime_dp_rm.py:168
↓ 5 callersMethodestimate_flops
Estimate the FLOPS based on the number of valid tokens in the current batch and the time taken. Args: batch_seqlens (Lis
verl/verl/utils/flops_counter.py:198
↓ 5 callersFunctionget_fsdp_wrap_policy
Get FSDP wrap policy for the module. Args: module: The module to get wrap policy for config: Configuration for wrap policy
verl/verl/utils/fsdp_utils.py:64
↓ 5 callersFunctionget_init_weight_context_manager
(use_meta_tensor=True, mesh: DeviceMesh = None)
verl/verl/utils/fsdp_utils.py:48
↓ 5 callersFunctionget_micro_data_parallel_group
()
verl/verl/workers/sharding_manager/megatron_vllm.py:571
↓ 5 callersMethodget_placement_groups
(self, strategy="STRICT_PACK", name=None)
verl/verl/single_controller/ray/base.py:98
↓ 5 callersMethodget_resource_pool
Get the resource pool of the worker_cls
verl/verl/trainer/ppo/ray_trainer.py:113
↓ 5 callersFunctionget_response_mask
end of sentence token can be int or list: 1 or [1, 2] e.g. response_id = torch.tensor([[20, 10, 34, 1, 0, 0, 0],
verl/verl/utils/torch_functional.py:154
↓ 5 callersFunctionget_reverse_idx
(idx_map)
verl/verl/utils/seqlen_balancing.py:250
↓ 5 callersFunctionimport_external_libs
(external_libs=None)
verl/verl/utils/import_utils.py:51
↓ 5 callersMethodinit_model
(self)
verl/verl/workers/fsdp_workers.py:909
↓ 5 callersFunctionpad_dataproto_to_divisor
Pad a DataProto to size divisible by size_divisor Args: size_divisor (int): size divisor Returns: data: (DataProto): the pad
verl/verl/protocol.py:69
↓ 5 callersFunctionprint_model_size
(model: nn.Module, name: str = None)
verl/verl/utils/model.py:154
↓ 5 callersMethodspawn
spawn to a dictionary of worker groups, each with a subset of method with prefix.
verl/verl/single_controller/ray/base.py:327
↓ 5 callersFunctionunpad_dataproto
(data: "DataProto", pad_size)
verl/verl/protocol.py:97
↓ 5 callersMethodupdate_actor
(self, data: DataProto)
verl/verl/workers/fsdp_workers.py:544
↓ 5 callersFunctionvalidate_ulysses_config
(num_heads, ulysses_sequence_size)
verl/verl/utils/ulysses.py:294
↓ 4 callersMethod__init__
(self)
verl/verl/single_controller/ray/base.py:519
↓ 4 callersMethod__init__
(self, dim, max_position_embeddings=2048, base=10000, device=None)
verl/verl/models/llama/megatron/layers/parallel_attention.py:39
↓ 4 callersMethod_balance_batch
Reorder the data on single controller such that each dp rank gets similar total tokens
verl/verl/trainer/ppo/ray_trainer.py:868
↓ 4 callersFunction_broadcast_tensor
broadcast tensor across mp_group
verl/verl/models/mcore/saver.py:129
↓ 4 callersFunction_broadcast_tp_shard_tensor
broadcast tensor in tp shards across mp_group
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_saver.py:158
↓ 4 callersFunction_broadcast_tp_shard_tensor
broadcast tensor in tp shards across mp_group
verl/verl/models/mcore/saver.py:168
↓ 4 callersFunction_broadcast_tp_shard_tensor
broadcast tensor in tp shards across mp_group
verl/verl/models/llama/megatron/checkpoint_utils/llama_saver.py:158
↓ 4 callersMethod_compute_loss_and_backward
Compute loss with optional sequence parallelism and remove padding features
verl/verl/trainer/fsdp_sft_trainer.py:278
↓ 4 callersFunction_compute_response_info
(batch: DataProto)
verl/verl/trainer/ppo/metric_utils.py:34
↓ 4 callersFunction_get_cpu_tensor
(tensor: torch.Tensor)
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_saver.py:112
↓ 4 callersFunction_get_cpu_tensor
(tensor: torch.Tensor)
verl/verl/models/mcore/saver.py:122
↓ 4 callersFunction_get_cpu_tensor
(tensor: torch.Tensor)
verl/verl/models/llama/megatron/checkpoint_utils/llama_saver.py:112
↓ 4 callersFunction_get_gpt_model
(model)
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_loader_depracated.py:60
↓ 4 callersFunction_get_gpt_model
(model)
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_loader.py:60
↓ 4 callersFunction_get_gpt_model
(model)
verl/verl/models/mcore/loader.py:63
↓ 4 callersFunction_get_gpt_model
(model)
verl/verl/models/llama/megatron/checkpoint_utils/llama_loader.py:62
↓ 4 callersFunction_get_gpt_model
(model)
verl/verl/models/llama/megatron/checkpoint_utils/llama_loader_depracated.py:62
↓ 4 callersFunction_is_non_local
(path: str)
verl/verl/utils/hdfs_io.py:148
↓ 4 callersFunction_pre_process_inputs
(pad_token_id, prompt_token_ids: torch.Tensor)
verl/verl/workers/rollout/sglang_rollout/sglang_rollout.py:60
↓ 4 callersMethod_save_checkpoint
(self)
verl/recipe/prime/prime_ray_trainer.py:222
↓ 4 callersMethodadd_assistant_message
Currently, we only support chatml format.
verl/verl/workers/rollout/schemas.py:105
↓ 4 callersFunctionall_gather_data_proto
(data: DataProto, process_group)
verl/verl/protocol.py:799
↓ 4 callersFunctionapply_fsdp2
model: AutoModelForCausalLM
verl/verl/utils/fsdp_utils.py:416
↓ 4 callersFunctionapply_kl_penalty
(data: DataProto, kl_ctrl: core_algos.AdaptiveKLController, kl_penalty="kl", multi_turn=False)
verl/verl/trainer/ppo/ray_trainer.py:145
↓ 4 callersFunctionbroadcast_dict_tensor
TODO: optimize this. Technically, we only need one broadcast
verl/verl/utils/torch_functional.py:186
↓ 4 callersFunctioncompute_reward
We compute dense reward here so that we can directly train RL without SFT
verl/tests/e2e/envs/digit_completion/task.py:135
↓ 4 callersMethodcompute_values
(self, data: DataProto)
verl/verl/workers/fsdp_workers.py:936
↓ 4 callersFunctioncreate_device_mesh
(world_size, fsdp_size)
verl/verl/workers/fsdp_workers.py:61
↓ 4 callersFunctioncreate_rl_dataset
Create a dataset. Arguments: data_config: The data config. tokenizer (Tokenizer): The tokenizer. processor (Processor): T
verl/verl/trainer/main_ppo.py:313
↓ 4 callersFunctioncreate_sft_dataset
Create a dataset.
verl/verl/trainer/fsdp_sft_trainer.py:523
↓ 4 callersMethodexecute_rank_zero_async
(self, method_name: str, *args, **kwargs)
verl/verl/single_controller/ray/base.py:386
↓ 4 callersFunctionextract_answer
(passage: str)
deepscaler/rewards/math_utils/utils.py:478
↓ 4 callersMethodfinish
(self)
verl/verl/utils/tracking.py:143
↓ 4 callersMethodget
(self)
verl/verl/utils/rendezvous/ray_backend.py:28
↓ 4 callersFunctionget_constant_schedule_with_warmup
( optimizer: Optimizer, num_warmup_steps: int, last_epoch: int = -1, )
verl/verl/utils/torch_functional.py:433
↓ 4 callersFunctionget_cosine_schedule_with_warmup
Create a schedule with a learning rate that decreases following the values of the cosine function between the initial lr set in the optimizer
verl/verl/utils/torch_functional.py:390
↓ 4 callersFunctionget_sharding_strategy
(device_mesh)
verl/verl/workers/fsdp_workers.py:69
↓ 4 callersFunctionget_supported_model
(model_type: str)
verl/verl/models/mcore/registry.py:104
↓ 4 callersFunctioninit_mcore_model
Initialize a Mcore model. Args: tfconfig: The transformer config. hf_config: The HuggingFace config. pre_process: Op
verl/verl/models/mcore/registry.py:118
↓ 4 callersFunctionis_digit
(s)
verl/verl/utils/reward_score/prime_math/grader.py:111
↓ 4 callersFunctionload_mcore_dist_weights
(parallel_model, dist_weight_path, is_value_model=False)
verl/verl/utils/model.py:405
↓ 4 callersFunctionload_megatron_gptmodel_weights
Load weights for mcore GPT model.
verl/verl/utils/model.py:355
↓ 4 callersMethodmake_iterator
r"""Make an iterator from the DataProto. This is built upon that TensorDict can be used as a normal Pytorch dataset. See https://pytorch.org/t
verl/verl/protocol.py:587
↓ 4 callersFunctionrotate_half
Rotates half the hidden dims of the input.
verl/verl/models/qwen2/megatron/layers/parallel_attention.py:119
↓ 4 callersFunctionrotate_half
Rotates half the hidden dims of the input.
verl/verl/models/llama/megatron/layers/parallel_attention.py:142
↓ 4 callersMethodrun
(self, config)
verl/recipe/sppo/main_sppo.py:52
↓ 4 callersMethodsave_checkpoint
(self, step)
verl/verl/trainer/fsdp_sft_trainer.py:412
↓ 4 callersFunctionset_ulysses_sequence_parallel_group
Set ulysses sequence parallel process group.
verl/verl/utils/ulysses.py:30
↓ 4 callersMethodshared_embedding_or_output_weight
(self)
verl/verl/models/qwen2/megatron/modeling_qwen2_megatron.py:601
↓ 4 callersMethodupdate_critic
(self, data: DataProto)
verl/verl/workers/fsdp_workers.py:959
↓ 4 callersFunctionupdate_model_config
Update the module config with the override_config_kwargs. Args: module_config: The module config from Huggingface Transformers. ov
verl/verl/utils/model.py:49
↓ 3 callersMethod__init__
(self, dim, max_position_embeddings=2048, base=10000, device=None)
verl/verl/models/qwen2/megatron/layers/parallel_attention.py:43
↓ 3 callersMethod_bind_worker_method
Bind the worker method to the WorkerGroup
verl/verl/single_controller/base/worker_group.py:143
↓ 3 callersFunction_broadcast_tp_shard_tensor
broadcast tensor in tp shards across mp_group
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_loader_depracated.py:172
↓ 3 callersFunction_broadcast_tp_shard_tensor
broadcast tensor in tp shards across mp_group
verl/verl/models/mcore/loader.py:177
↓ 3 callersFunction_broadcast_tp_shard_tensor
broadcast tensor in tp shards across mp_group
verl/verl/models/llama/megatron/checkpoint_utils/llama_loader_depracated.py:174
↓ 3 callersMethod_build_model_optimizer
(self)
verl/verl/trainer/fsdp_sft_trainer.py:164
↓ 3 callersMethod_build_param_references
(self, pp_rank, maintain_weight=False)
verl/verl/workers/sharding_manager/megatron_vllm.py:126
↓ 3 callersMethod_build_rollout
(self, trust_remote_code=False)
verl/verl/workers/fsdp_workers.py:343
↓ 3 callersFunction_concat_data_proto_or_future
(output: List)
verl/verl/single_controller/base/decorator.py:180
↓ 3 callersMethod_execute_remote_single_worker
(self, worker, method_name: str, *args, **kwargs)
verl/verl/single_controller/ray/base.py:375
↓ 3 callersFunction_fetch_tp_shard_tensor
fetch tensor in tp shards
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_loader.py:114
↓ 3 callersFunction_fetch_tp_shard_tensor
fetch tensor in tp shards
verl/verl/models/llama/megatron/checkpoint_utils/llama_loader.py:116
↓ 3 callersMethod_forward_micro_batch
(self, micro_batch, prompt_length)
verl/recipe/prime/prime_dp_rm.py:48
↓ 3 callersFunction_get_base_transformer_config
Create a base TransformerConfig with common parameters across different model architectures. TODO: (ycl) use dataclass or converter config?
verl/verl/models/mcore/config_converter.py:26
↓ 3 callersFunction_get_current_mem_info
Get current memory usage.
verl/verl/utils/debug/performance.py:24
↓ 3 callersFunction_get_gpt_model
(model)
verl/verl/models/qwen2/megatron/checkpoint_utils/qwen2_saver.py:83
↓ 3 callersFunction_get_gpt_model
(model)
verl/verl/models/mcore/saver.py:92
↓ 3 callersFunction_get_gpt_model
(model)
verl/verl/models/llama/megatron/checkpoint_utils/llama_saver.py:83
↓ 3 callersMethod_init_hf_config_and_tf_config
(self, model_path, dtype, override_model_config)
verl/verl/single_controller/base/megatron/worker.py:42
↓ 3 callersMethod_load_checkpoint
(self)
verl/recipe/prime/prime_ray_trainer.py:255
↓ 3 callersFunction_pre_process_inputs
(pad_token_id, prompt_token_ids: torch.Tensor)
verl/verl/workers/rollout/vllm_rollout/fire_vllm_rollout.py:49
↓ 3 callersMethod_set_cos_sin_cache
(self, seq_len, device, dtype)
verl/verl/models/llama/megatron/layers/parallel_attention.py:51
↓ 3 callersFunction_split_args_kwargs_data_proto
(chunks, *args, **kwargs)
verl/verl/single_controller/base/decorator.py:50
← previousnext →101–200 of 1,563, ranked by callers