MCPcopy Create free account

hub / github.com/JinaLeejnl/AlignX / types & classes

Types & classes52 in github.com/JinaLeejnl/AlignX

↓ 16 callersClassActor
Actor model base class. Args: model (nn.Module): Actor Model. lora_rank (int): LoRA rank. lora_train_bias (str): LoR
train/OpenRLHF/openrlhf/models/actor.py:17
↓ 7 callersClassSFTDataset
Dataset for SFT model Args: dataset: dataset for SFT model tokenizer: tokenizer for SFT model max_length: max length
train/OpenRLHF/openrlhf/datasets/sft_dataset.py:27
↓ 4 callersClassPPORayActorGroup
A group of ray actors Functions start with 'async' should return list of object refs Args: num_nodes (int): Number of nodes for
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:142
↓ 4 callersClassPromptDataset
Dataset for PPO model Args: dataset: dataset for PPO model tokenizer: tokenizer for PPO model max_length: max length
train/OpenRLHF/openrlhf/datasets/prompts_dataset.py:19
↓ 4 callersClassRewardDataset
Dataset for reward model Args: dataset: dataset for reward model self.tokenizer: self.tokenizer for reward model sel
train/OpenRLHF/openrlhf/datasets/reward_dataset.py:50
↓ 3 callersClassExperience
Experience is a batch of data. These data should have the the sequence length and number of actions. Left padding for sequences is applied.
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:34
↓ 3 callersClassGPTLMLoss
GPT Language Model Loss
train/OpenRLHF/openrlhf/models/loss.py:11
↓ 3 callersClassSamples
Samples is a batch of data. There can be 2 formats to store the samples, batched or packed. The batched format means padding is applied to the
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:90
↓ 2 callersClassProcessRewardDataset
Dataset for process reward model Args: dataset: dataset for reward model self.tokenizer: self.tokenizer for reward model
train/OpenRLHF/openrlhf/datasets/process_reward_dataset.py:13
↓ 2 callersClassUnpairedPreferenceDataset
Unpaired preference dataset for algorithm, like KTO Args: dataset: raw dataset self.tokenizer: self.tokenizer for model
train/OpenRLHF/openrlhf/datasets/unpaired_preference_dataset.py:37
↓ 1 callersClassActorPPOTrainer
train/OpenRLHF/openrlhf/trainer/ray/ppo_actor.py:24
↓ 1 callersClassAdaptiveKLController
Adaptive KL controller described in the paper: https://arxiv.org/pdf/1909.08593.pdf
train/OpenRLHF/openrlhf/trainer/ppo_utils/kl_controller.py:6
↓ 1 callersClassBufferItem
BufferItem is an item of experience data. Shapes of each tensor: sequences: (S) action_log_probs: (A) values: (1) returns: (1)
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:15
↓ 1 callersClassCriticPPOTrainer
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:19
↓ 1 callersClassDPOLoss
DPO Loss
train/OpenRLHF/openrlhf/models/loss.py:108
↓ 1 callersClassDPOTrainer
Trainer for Direct Preference Optimization (DPO) training. Args: model (torch.nn.Module): The primary model to be trained. r
train/OpenRLHF/openrlhf/trainer/dpo_trainer.py:18
↓ 1 callersClassDeepspeedStrategy
The strategy for training with Accelerator.
train/OpenRLHF/openrlhf/utils/deepspeed.py:35
↓ 1 callersClassDistributedSampler
r"""Sampler that restricts data loading to a subset of the dataset. It is especially useful in conjunction with :class:`torch.nn.parallel.Dis
train/OpenRLHF/openrlhf/utils/distributed_sampler.py:17
↓ 1 callersClassEmpty
train/OpenRLHF/openrlhf/cli/interactive_chat.py:9
↓ 1 callersClassEmpty
train/OpenRLHF/openrlhf/cli/batch_inference.py:20
↓ 1 callersClassFixedKLController
Fixed KL controller.
train/OpenRLHF/openrlhf/trainer/ppo_utils/kl_controller.py:24
↓ 1 callersClassKDLoss
Language Model Knowledge Distillation Loss
train/OpenRLHF/openrlhf/models/loss.py:238
↓ 1 callersClassKDTrainer
Trainer for Knowledge Distillation. Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): The trainin
train/OpenRLHF/openrlhf/trainer/kd_trainer.py:16
↓ 1 callersClassKTOLoss
KTO loss for uneven sampling
train/OpenRLHF/openrlhf/models/loss.py:183
↓ 1 callersClassKTOTrainer
Trainer for KTO training. Args: model (torch.nn.Module): The primary model to be trained. ref_model (torch.nn.Module): The r
train/OpenRLHF/openrlhf/trainer/kto_trainer.py:13
↓ 1 callersClassLogExpLoss
Pairwise Loss for Reward Model Details: https://arxiv.org/abs/2204.05862
train/OpenRLHF/openrlhf/models/loss.py:95
↓ 1 callersClassNaiveExperienceMaker
Naive experience maker.
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:120
↓ 1 callersClassNaiveReplayBuffer
Naive replay buffer class. It stores experience. Args: sample_batch_size (int): Batch size when sampling. limit (int, optional):
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:153
↓ 1 callersClassNewLineFormatter
Adds logging prefix to newlines to align multi-line messages.
train/OpenRLHF/openrlhf/utils/logging_utils.py:11
↓ 1 callersClassPPOTrainer
Trainer for Proximal Policy Optimization (PPO) algorithm. Args: strategy (Strategy): The training strategy to use. actor (Ac
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:22
↓ 1 callersClassPRMLoss
Process Reward Model Loss
train/OpenRLHF/openrlhf/models/loss.py:259
↓ 1 callersClassPairWiseLoss
Pairwise Loss for Reward Model
train/OpenRLHF/openrlhf/models/loss.py:80
↓ 1 callersClassPolicyLoss
Policy Loss for PPO
train/OpenRLHF/openrlhf/models/loss.py:28
↓ 1 callersClassProcessRewardModelTrainer
Trainer for training a process reward model. Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): Th
train/OpenRLHF/openrlhf/trainer/prm_trainer.py:14
↓ 1 callersClassRemoteExperienceMaker
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:440
↓ 1 callersClassRewardModelProxy
train/OpenRLHF/openrlhf/cli/serve_rm.py:28
↓ 1 callersClassRewardModelTrainer
Trainer for training a reward model. Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): The traini
train/OpenRLHF/openrlhf/trainer/rm_trainer.py:16
↓ 1 callersClassSFTTrainer
Trainer for supervised fine-tuning (SFT). Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): The t
train/OpenRLHF/openrlhf/trainer/sft_trainer.py:16
↓ 1 callersClassValueLoss
Value Loss for PPO
train/OpenRLHF/openrlhf/models/loss.py:52
ClassActorModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/ppo_actor.py:187
ClassBasePPORole
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:52
ClassCriticModel
train/OpenRLHF/openrlhf/models/model.py:218
ClassCriticModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:64
ClassDistributedTorchRayActor
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:15
ClassLLMRayActor
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:14
ClassRayWorkerWrapper
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:38
ClassReferenceModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:63
ClassRewardModel
train/OpenRLHF/openrlhf/models/model.py:147
ClassRewardModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:106
ClassVanillaKTOLoss
KTO loss for even sampling
train/OpenRLHF/openrlhf/models/loss.py:147
ClassWorkerWrap
train/OpenRLHF/openrlhf/trainer/ray/vllm_worker_wrap.py:13
Classbdist_wheel
train/OpenRLHF/setup.py:44