Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/JinaLeejnl/AlignX
/ types & classes
Types & classes
52 in github.com/JinaLeejnl/AlignX
⨍
Functions
298
◇
Types & classes
52
↳
Endpoints
1
↓ 16 callers
Class
Actor
Actor model base class. Args: model (nn.Module): Actor Model. lora_rank (int): LoRA rank. lora_train_bias (str): LoR
train/OpenRLHF/openrlhf/models/actor.py:17
↓ 7 callers
Class
SFTDataset
Dataset for SFT model Args: dataset: dataset for SFT model tokenizer: tokenizer for SFT model max_length: max length
train/OpenRLHF/openrlhf/datasets/sft_dataset.py:27
↓ 4 callers
Class
PPORayActorGroup
A group of ray actors Functions start with 'async' should return list of object refs Args: num_nodes (int): Number of nodes for
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:142
↓ 4 callers
Class
PromptDataset
Dataset for PPO model Args: dataset: dataset for PPO model tokenizer: tokenizer for PPO model max_length: max length
train/OpenRLHF/openrlhf/datasets/prompts_dataset.py:19
↓ 4 callers
Class
RewardDataset
Dataset for reward model Args: dataset: dataset for reward model self.tokenizer: self.tokenizer for reward model sel
train/OpenRLHF/openrlhf/datasets/reward_dataset.py:50
↓ 3 callers
Class
Experience
Experience is a batch of data. These data should have the the sequence length and number of actions. Left padding for sequences is applied.
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:34
↓ 3 callers
Class
GPTLMLoss
GPT Language Model Loss
train/OpenRLHF/openrlhf/models/loss.py:11
↓ 3 callers
Class
Samples
Samples is a batch of data. There can be 2 formats to store the samples, batched or packed. The batched format means padding is applied to the
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:90
↓ 2 callers
Class
ProcessRewardDataset
Dataset for process reward model Args: dataset: dataset for reward model self.tokenizer: self.tokenizer for reward model
train/OpenRLHF/openrlhf/datasets/process_reward_dataset.py:13
↓ 2 callers
Class
UnpairedPreferenceDataset
Unpaired preference dataset for algorithm, like KTO Args: dataset: raw dataset self.tokenizer: self.tokenizer for model
train/OpenRLHF/openrlhf/datasets/unpaired_preference_dataset.py:37
↓ 1 callers
Class
ActorPPOTrainer
train/OpenRLHF/openrlhf/trainer/ray/ppo_actor.py:24
↓ 1 callers
Class
AdaptiveKLController
Adaptive KL controller described in the paper: https://arxiv.org/pdf/1909.08593.pdf
train/OpenRLHF/openrlhf/trainer/ppo_utils/kl_controller.py:6
↓ 1 callers
Class
BufferItem
BufferItem is an item of experience data. Shapes of each tensor: sequences: (S) action_log_probs: (A) values: (1) returns: (1)
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:15
↓ 1 callers
Class
CriticPPOTrainer
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:19
↓ 1 callers
Class
DPOLoss
DPO Loss
train/OpenRLHF/openrlhf/models/loss.py:108
↓ 1 callers
Class
DPOTrainer
Trainer for Direct Preference Optimization (DPO) training. Args: model (torch.nn.Module): The primary model to be trained. r
train/OpenRLHF/openrlhf/trainer/dpo_trainer.py:18
↓ 1 callers
Class
DeepspeedStrategy
The strategy for training with Accelerator.
train/OpenRLHF/openrlhf/utils/deepspeed.py:35
↓ 1 callers
Class
DistributedSampler
r"""Sampler that restricts data loading to a subset of the dataset. It is especially useful in conjunction with :class:`torch.nn.parallel.Dis
train/OpenRLHF/openrlhf/utils/distributed_sampler.py:17
↓ 1 callers
Class
Empty
train/OpenRLHF/openrlhf/cli/interactive_chat.py:9
↓ 1 callers
Class
Empty
train/OpenRLHF/openrlhf/cli/batch_inference.py:20
↓ 1 callers
Class
FixedKLController
Fixed KL controller.
train/OpenRLHF/openrlhf/trainer/ppo_utils/kl_controller.py:24
↓ 1 callers
Class
KDLoss
Language Model Knowledge Distillation Loss
train/OpenRLHF/openrlhf/models/loss.py:238
↓ 1 callers
Class
KDTrainer
Trainer for Knowledge Distillation. Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): The trainin
train/OpenRLHF/openrlhf/trainer/kd_trainer.py:16
↓ 1 callers
Class
KTOLoss
KTO loss for uneven sampling
train/OpenRLHF/openrlhf/models/loss.py:183
↓ 1 callers
Class
KTOTrainer
Trainer for KTO training. Args: model (torch.nn.Module): The primary model to be trained. ref_model (torch.nn.Module): The r
train/OpenRLHF/openrlhf/trainer/kto_trainer.py:13
↓ 1 callers
Class
LogExpLoss
Pairwise Loss for Reward Model Details: https://arxiv.org/abs/2204.05862
train/OpenRLHF/openrlhf/models/loss.py:95
↓ 1 callers
Class
NaiveExperienceMaker
Naive experience maker.
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:120
↓ 1 callers
Class
NaiveReplayBuffer
Naive replay buffer class. It stores experience. Args: sample_batch_size (int): Batch size when sampling. limit (int, optional):
train/OpenRLHF/openrlhf/trainer/ppo_utils/replay_buffer.py:153
↓ 1 callers
Class
NewLineFormatter
Adds logging prefix to newlines to align multi-line messages.
train/OpenRLHF/openrlhf/utils/logging_utils.py:11
↓ 1 callers
Class
PPOTrainer
Trainer for Proximal Policy Optimization (PPO) algorithm. Args: strategy (Strategy): The training strategy to use. actor (Ac
train/OpenRLHF/openrlhf/trainer/ppo_trainer.py:22
↓ 1 callers
Class
PRMLoss
Process Reward Model Loss
train/OpenRLHF/openrlhf/models/loss.py:259
↓ 1 callers
Class
PairWiseLoss
Pairwise Loss for Reward Model
train/OpenRLHF/openrlhf/models/loss.py:80
↓ 1 callers
Class
PolicyLoss
Policy Loss for PPO
train/OpenRLHF/openrlhf/models/loss.py:28
↓ 1 callers
Class
ProcessRewardModelTrainer
Trainer for training a process reward model. Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): Th
train/OpenRLHF/openrlhf/trainer/prm_trainer.py:14
↓ 1 callers
Class
RemoteExperienceMaker
train/OpenRLHF/openrlhf/trainer/ppo_utils/experience_maker.py:440
↓ 1 callers
Class
RewardModelProxy
train/OpenRLHF/openrlhf/cli/serve_rm.py:28
↓ 1 callers
Class
RewardModelTrainer
Trainer for training a reward model. Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): The traini
train/OpenRLHF/openrlhf/trainer/rm_trainer.py:16
↓ 1 callers
Class
SFTTrainer
Trainer for supervised fine-tuning (SFT). Args: model (torch.nn.Module): The model to be trained. strategy (Strategy): The t
train/OpenRLHF/openrlhf/trainer/sft_trainer.py:16
↓ 1 callers
Class
ValueLoss
Value Loss for PPO
train/OpenRLHF/openrlhf/models/loss.py:52
Class
ActorModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/ppo_actor.py:187
Class
BasePPORole
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:52
Class
CriticModel
train/OpenRLHF/openrlhf/models/model.py:218
Class
CriticModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/ppo_critic.py:64
Class
DistributedTorchRayActor
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:15
Class
LLMRayActor
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:14
Class
RayWorkerWrapper
train/OpenRLHF/openrlhf/trainer/ray/vllm_engine.py:38
Class
ReferenceModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:63
Class
RewardModel
train/OpenRLHF/openrlhf/models/model.py:147
Class
RewardModelRayActor
train/OpenRLHF/openrlhf/trainer/ray/launcher.py:106
Class
VanillaKTOLoss
KTO loss for even sampling
train/OpenRLHF/openrlhf/models/loss.py:147
Class
WorkerWrap
train/OpenRLHF/openrlhf/trainer/ray/vllm_worker_wrap.py:13
Class
bdist_wheel
train/OpenRLHF/setup.py:44