MCPcopy Create free account

hub / github.com/JinaLeejnl/AlignX / functions

Functions298 in github.com/JinaLeejnl/AlignX

↓ 1 callersMethodevaluate
(self, eval_dataloader, steps=0)
train/OpenRLHF/openrlhf/trainer/dpo_trainer.py:241
↓ 1 callersMethodevaluate
(self, eval_dataloader, steps=0)
train/OpenRLHF/openrlhf/trainer/sft_trainer.py:221
↓ 1 callersMethodevaluate
(self, eval_dataloader, steps=0)
train/OpenRLHF/openrlhf/trainer/kd_trainer.py:209
↓ 1 callersFunctionexist_and_not_none
(d, key)
train/OpenRLHF/openrlhf/datasets/utils.py:17
↓ 1 callersMethodfit
(self, args, consumed_samples=0, num_update_steps_per_epoch=None)
train/OpenRLHF/openrlhf/trainer/prm_trainer.py:93
↓ 1 callersMethodfit
(self, args, consumed_samples=0, num_update_steps_per_epoch=None)
train/OpenRLHF/openrlhf/trainer/kto_trainer.py:95
↓ 1 callersMethodfit
(self, args, consumed_samples=0, num_update_steps_per_epoch=None)
train/OpenRLHF/openrlhf/trainer/rm_trainer.py:105
↓ 1 callersMethodfit
(self, args, consumed_samples=0, num_update_steps_per_epoch=None)
train/OpenRLHF/openrlhf/trainer/dpo_trainer.py:106
↓ 1 callersMethodfit
( self, args, prompts_dataloader, pretrain_dataloader, consumed_sample
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:186
↓ 1 callersMethodfit
(self, args, consumed_samples=0, num_update_steps_per_epoch=None)
train/OpenRLHF/openrlhf/trainer/sft_trainer.py:101
↓ 1 callersMethodfit
(self, args, consumed_samples=0, num_update_steps_per_epoch=None)
train/OpenRLHF/openrlhf/trainer/kd_trainer.py:98
↓ 1 callersMethodflush
Ensure all experience has been send to critic
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:743
↓ 1 callersFunctiongenerate
(args)
train/OpenRLHF/openrlhf/cli/interactive_chat.py:7
↓ 1 callersMethodgenerate
(self, *args, **kwargs)
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:48
↓ 1 callersMethodget_advantages_and_returns
Function that computes advantages and returns from rewards and values. Calculated as in the original PPO paper: https://arxiv.org/abs/1707.063
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:338
↓ 1 callersMethodget_cumulative_returns
Function that computes advantages and returns from rewards using REINFORCE. REINFORCE uses cumulative returns without the GAE (Genera
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:396
↓ 1 callersFunctionget_eval_ds_config
( offload, stage=0, bf16=True, )
train/OpenRLHF/openrlhf/utils/deepspeed_utils.py:60
↓ 1 callersFunctionget_optimizer_grouped_parameters
( model, weight_decay, no_decay_name_list=["bias", "layer_norm.weight", "layernorm.weight", "norm.
train/OpenRLHF/openrlhf/utils/deepspeed_utils.py:85
↓ 1 callersFunctionget_processor
(name)
train/OpenRLHF/openrlhf/utils/processor.py:99
↓ 1 callersFunctionget_profile
(history)
train/profile_utils.py:108
↓ 1 callersMethodget_reward
(self, queries)
train/OpenRLHF/openrlhf/cli/serve_rm.py:48
↓ 1 callersFunctionget_ring_attn_group
()
train/OpenRLHF/openrlhf/models/ring_attn_utils.py:14
↓ 1 callersFunctionget_train_ds_config
( offload, adam_offload=True, stage=2, bf16=True, max_norm=1.0, zpg=8, grad_accum_
train/OpenRLHF/openrlhf/utils/deepspeed_utils.py:13
↓ 1 callersFunctionlog_probs_from_logits
(logits: torch.Tensor, labels: torch.Tensor)
train/OpenRLHF/openrlhf/models/utils.py:79
↓ 1 callersMethodmake_experience
Turn samples into experience by calculating logprobs, values, rewards, and kl divergence.
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:263
↓ 1 callersMethodmoving_average
(self, model, model_ema, beta=0.992, device="cpu")
train/OpenRLHF/openrlhf/utils/deepspeed.py:269
↓ 1 callersMethodnormalize
(self, attribute: str, strategy)
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:209
↓ 1 callersMethodpin_memory
(self)
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:75
↓ 1 callersMethodppo_train
(self, global_steps=0)
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:260
↓ 1 callersMethodppo_train
(self)
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:20
↓ 1 callersMethodprepare_datasets
(self)
train/OpenRLHF/openrlhf/trainer/ray/ppo_actor.py:271
↓ 1 callersFunctionpreprocess_data
(data, input_template=None, input_key="input", output_key=None, apply_chat_template=None)
train/OpenRLHF/openrlhf/datasets/sft_dataset.py:10
↓ 1 callersFunctionpreprocess_data
(data, input_template=None, input_key="input", apply_chat_template=None)
train/OpenRLHF/openrlhf/datasets/prompts_dataset.py:6
↓ 1 callersFunctionpreprocess_data
Preprocess data from raw dataset to prompt, response, label Args: data: raw data from dataset
train/OpenRLHF/openrlhf/datasets/unpaired_preference_dataset.py:11
↓ 1 callersFunctionpreprocess_data
( data, input_template=None, prompt_key=None, chosen_key="chosen", rejected_key="rejected"
train/OpenRLHF/openrlhf/datasets/reward_dataset.py:11
↓ 1 callersMethodprocess_experiences
(self, experiences: List[Experience])
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:333
↓ 1 callersFunctionremove_padding_in_sequences
(items)
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:117
↓ 1 callersFunctionrequest_api_wrapper
Synchronous request API wrapper
train/OpenRLHF/openrlhf/utils/remote_rm_utils.py:11
↓ 1 callersFunctionreset_ring_attn_position_ids
Calculate position ids for packed_seq_ids[start:end]. For example, if the packed_seq_lens is [3, 2, 4, 1], start=2, end=8, the position i
train/OpenRLHF/openrlhf/models/ring_attn_utils.py:18
↓ 1 callersFunctionreward_normalization
(objs)
train/OpenRLHF/openrlhf/utils/processor.py:5
↓ 1 callersMethodsave_checkpoint
(self, tag)
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:192
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/prm_trainer.py:175
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/kto_trainer.py:186
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/rm_trainer.py:210
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/dpo_trainer.py:218
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:472
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/sft_trainer.py:199
↓ 1 callersMethodsave_logs_and_checkpoints
(self, args, global_step, step_bar, logs_dict={}, client_states={})
train/OpenRLHF/openrlhf/trainer/kd_trainer.py:187
↓ 1 callersFunctionset_ring_attn_group
(group)
train/OpenRLHF/openrlhf/models/ring_attn_utils.py:9
↓ 1 callersMethodset_seed
(self, seed: int)
train/OpenRLHF/openrlhf/utils/deepspeed.py:68
↓ 1 callersMethodsetup_ring_attn
(self)
train/OpenRLHF/openrlhf/utils/deepspeed.py:90
↓ 1 callersFunctionsplit_experience_batch
(experience: Experience)
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:40
↓ 1 callersMethodstop_remote_worker_execution_loop
(self)
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:69
↓ 1 callersFunctionstrip_sequence
(text, pad_token, eos_token)
train/OpenRLHF/openrlhf/cli/serve_rm.py:16
↓ 1 callersFunctiontokenize_fn
(texts)
train/OpenRLHF/openrlhf/cli/batch_inference.py:112
↓ 1 callersMethodtokenize_fn
(self, texts, device)
train/OpenRLHF/openrlhf/cli/serve_rm.py:74
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_ppo.py:17
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_ppo_ray.py:44
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_kto.py:16
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_sft.py:14
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_dpo.py:16
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_rm.py:15
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_kd.py:14
↓ 1 callersFunctiontrain
(args)
train/OpenRLHF/openrlhf/cli/train_prm.py:14
↓ 1 callersMethodtraining_step
(self, experience: Experience, global_steps)
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:324
↓ 1 callersMethodtraining_step
(self, experience: Experience)
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:59
↓ 1 callersFunctionupdate_ring_attn_params
Calculate the cu_seqlens for the current forward pass and pass the value to the substituted ring_flash_attn. Note that total_seq_len may
train/OpenRLHF/openrlhf/models/ring_attn_utils.py:43
↓ 1 callersFunctionzero_pad_sequences
(sequences: List[torch.Tensor], side: str = "left")
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:80
Method__getitem__
(self, idx: int)
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:202
Method__getitem__
(self, idx)
train/OpenRLHF/openrlhf/datasets/sft_dataset.py:107
Method__getitem__
(self, idx)
train/OpenRLHF/openrlhf/datasets/process_reward_dataset.py:53
Method__getitem__
(self, idx)
train/OpenRLHF/openrlhf/datasets/prompts_dataset.py:57
Method__getitem__
(self, index)
train/OpenRLHF/openrlhf/datasets/unpaired_preference_dataset.py:105
Method__getitem__
(self, idx)
train/OpenRLHF/openrlhf/datasets/reward_dataset.py:142
Method__init__
( self, dataset: Dataset, num_replicas: Optional[int] = None, rank: Optional[i
train/OpenRLHF/openrlhf/utils/distributed_sampler.py:66
Method__init__
( self, seed: int = 42, max_norm: float = 0.0, micro_train_batch_size=1,
train/OpenRLHF/openrlhf/utils/deepspeed.py:40
Method__init__
(self, fmt, datefmt=None)
train/OpenRLHF/openrlhf/utils/logging_utils.py:14
Method__init__
(self, args)
train/OpenRLHF/openrlhf/cli/serve_rm.py:29
Method__init__
( self, model, strategy, optim: Optimizer, train_dataloader, e
train/OpenRLHF/openrlhf/trainer/prm_trainer.py:30
Method__init__
( self, model, ref_model, strategy, tokenizer, optim: Optimize
train/OpenRLHF/openrlhf/trainer/kto_trainer.py:31
Method__init__
( self, model, strategy, optim: Optimizer, train_dataloader, e
train/OpenRLHF/openrlhf/trainer/rm_trainer.py:33
Method__init__
( self, model, ref_model, strategy, tokenizer, optim: Optimize
train/OpenRLHF/openrlhf/trainer/dpo_trainer.py:36
Method__init__
( self, strategy, actor: Actor, critic: nn.Module, reward_model: nn.Mo
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:59
Method__init__
( self, model, strategy, optim: Optimizer, train_dataloader, e
train/OpenRLHF/openrlhf/trainer/sft_trainer.py:34
Method__init__
( self, model, teacher_model, strategy, optim: Optimizer, trai
train/OpenRLHF/openrlhf/trainer/kd_trainer.py:34
Method__init__
(self, *args, **kwargs)
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:39
Method__init__
(self, world_size, rank, local_rank, master_addr, master_port)
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:16
Method__init__
( self, num_nodes, num_gpus_per_node, ray_actor_type: Type[BasePPORole],
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:157
Method__init__
PPOTrainer for ray. Args: vllm_engines (List, optional): vllm engines for text generation, if not specified, generate text by act
train/OpenRLHF/openrlhf/trainer/ray/ppo_actor.py:25
Method__init__
(self, init_kl_coef, target, horizon)
train/OpenRLHF/openrlhf/trainer/ppo_utils/kl_controller.py:12
Method__init__
(self, kl_coef)
train/OpenRLHF/openrlhf/trainer/ppo_utils/kl_controller.py:27
Method__init__
( self, sample_batch_size: int, limit: int = 0, cpu_offload: bool = True, packing_samples: bool = Fals
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:162
Method__init__
(self, *args, vllm_engines: List = None, packing_samples=False, **kwargs)
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:441
Method__init__
( self, dataset, tokenizer: Callable, max_length: int, strategy,
train/OpenRLHF/openrlhf/datasets/sft_dataset.py:37
Method__init__
( self, dataset, tokenizer: Callable, max_length: int, strategy,
train/OpenRLHF/openrlhf/datasets/process_reward_dataset.py:23
Method__init__
( self, dataset, tokenizer, strategy, input_template=None, )
train/OpenRLHF/openrlhf/datasets/prompts_dataset.py:29
Method__init__
( self, dataset, tokenizer: Callable, max_length: int, strategy, input_template=None, num_processors=8
train/OpenRLHF/openrlhf/datasets/unpaired_preference_dataset.py:47
Method__init__
( self, dataset, tokenizer: Callable, max_length: int, strategy,
train/OpenRLHF/openrlhf/datasets/reward_dataset.py:60
Method__init__
(self)
train/OpenRLHF/openrlhf/models/loss.py:16
Method__init__
(self, clip_eps: float = 0.2)
train/OpenRLHF/openrlhf/models/loss.py:33
← previousnext →101–200 of 298, ranked by callers