Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/allenai/RL4LMs
/ types & classes
Types & classes
140 in github.com/allenai/RL4LMs
⨍
Functions
555
◇
Types & classes
140
↓ 15 callers
Class
Sample
rl4lms/data_pools/text_generation_pool.py:8
↓ 6 callers
Class
MaskableCategoricalDistribution
Categorical distribution for discrete actions. Supports invalid action masking. :param action_dim: Number of discrete actions
rl4lms/algorithms/common/maskable/distributions.py:113
↓ 4 callers
Class
EvaluateActionsOutput
Dataclass for the output of the method policy.evaluate_actions(). This is invoked during training phase for each mini-batch in the rollout bu
rl4lms/envs/text_generation/policy/base_policy.py:24
↓ 4 callers
Class
PolicyOutput
Dataclass for the output of the method policy.foward_policy()
rl4lms/envs/text_generation/policy/base_policy.py:39
↓ 3 callers
Class
BeamSearchDecoderOnlyOutput
Base class for outputs of decoder-only generation models using beam search. Args: sequences (`torch.LongTensor` of shape `(batch_siz
rl4lms/envs/text_generation/hf_generation_utils.py:204
↓ 3 callers
Class
BeamSearchEncoderDecoderOutput
Base class for outputs of encoder-decoder generation models using beam search. Hidden states and attention weights of the decoder (respective
rl4lms/envs/text_generation/hf_generation_utils.py:239
↓ 3 callers
Class
GenerationOutputs
rl4lms/envs/text_generation/policy/base_policy.py:89
↓ 3 callers
Class
MeteorMetric
rl4lms/envs/text_generation/metric.py:107
↓ 3 callers
Class
Observation
rl4lms/envs/text_generation/observation.py:11
↓ 3 callers
Class
RougeRewardFunction
rl4lms/envs/text_generation/reward.py:163
↓ 2 callers
Class
CIDERMetric
rl4lms/envs/text_generation/metric.py:276
↓ 2 callers
Class
Cider
Main Class to compute the CIDEr metric
rl4lms/envs/text_generation/caption_metrics/cider.py:205
↓ 2 callers
Class
CiderScorer
CIDEr scorer.
rl4lms/envs/text_generation/caption_metrics/cider.py:53
↓ 2 callers
Class
GenerationInputs
rl4lms/envs/text_generation/policy/base_policy.py:81
↓ 2 callers
Class
KLController
rl4lms/envs/text_generation/kl_controllers.py:5
↓ 2 callers
Class
MaskLogitsProcessorCasualLM
rl4lms/algorithms/common/maskable/logits_processor.py:13
↓ 2 callers
Class
MaskLogitsProcessorSeq2SeqLM
rl4lms/algorithms/common/maskable/logits_processor.py:159
↓ 2 callers
Class
MaskableCategorical
Modified PyTorch Categorical distribution with support for invalid action masking. To instantiate, must provide either probs or logits, but
rl4lms/algorithms/common/maskable/distributions.py:18
↓ 2 callers
Class
RefPolicyOutput
Dataclass for the output of the method policy.get_ref_log_probs()
rl4lms/envs/text_generation/policy/base_policy.py:57
↓ 2 callers
Class
Spice
Main Class to compute the SPICE metric
rl4lms/envs/text_generation/caption_metrics/spice/spice.py:19
↓ 2 callers
Class
SpiceMetric
rl4lms/envs/text_generation/metric.py:304
↓ 2 callers
Class
SummaCConv
rl4lms/envs/text_generation/summ_metrics/summa_c.py:216
↓ 2 callers
Class
SummaCImager
rl4lms/envs/text_generation/summ_metrics/summa_c.py:60
↓ 2 callers
Class
SummaCZS
rl4lms/envs/text_generation/summ_metrics/summa_c.py:356
↓ 2 callers
Class
Tracker
rl4lms/envs/text_generation/logging_utils.py:15
↓ 2 callers
Class
ValueOutput
Dataclass for the output of the method policy.forward_value()
rl4lms/envs/text_generation/policy/base_policy.py:69
↓ 1 callers
Class
BERTScoreMetric
rl4lms/envs/text_generation/metric.py:163
↓ 1 callers
Class
BERTScoreRewardFunction
rl4lms/envs/text_generation/reward.py:251
↓ 1 callers
Class
BLEUMetric
rl4lms/envs/text_generation/metric.py:193
↓ 1 callers
Class
BLEURTRewardFunction
rl4lms/envs/text_generation/reward.py:486
↓ 1 callers
Class
BLEURewardFunction
rl4lms/envs/text_generation/reward.py:273
↓ 1 callers
Class
BeamSampleDecoderOnlyOutput
Base class for outputs of decoder-only generation models using beam sample. Args: sequences (`torch.LongTensor` of shape `(batch_siz
rl4lms/envs/text_generation/hf_generation_utils.py:290
↓ 1 callers
Class
BeamSampleEncoderDecoderOutput
Base class for outputs of encoder-decoder generation models using beam sampling. Hidden states and attention weights of the decoder (respecti
rl4lms/envs/text_generation/hf_generation_utils.py:325
↓ 1 callers
Class
CommonGenPrefRM
rl4lms/envs/text_generation/preference_reward.py:189
↓ 1 callers
Class
EvalCallack
rl4lms/envs/text_generation/utils_supervised.py:120
↓ 1 callers
Class
GreedySearchDecoderOnlyOutput
Base class for outputs of decoder-only generation models using greedy search. Args: sequences (`torch.LongTensor` of shape `(batch_
rl4lms/envs/text_generation/hf_generation_utils.py:62
↓ 1 callers
Class
GreedySearchEncoderDecoderOutput
Base class for outputs of encoder-decoder generation models using greedy search. Hidden states and attention weights of the decoder (respecti
rl4lms/envs/text_generation/hf_generation_utils.py:90
↓ 1 callers
Class
IntentAccuracyDailyDialog
rl4lms/envs/text_generation/metric.py:663
↓ 1 callers
Class
MaskableBernoulliDistribution
Bernoulli distribution for multibinary actions. Supports invalid action masking. :param action_dim: Number of binary actions
rl4lms/algorithms/common/maskable/distributions.py:258
↓ 1 callers
Class
MaskableDictRolloutBuffer
Dict Rollout buffer used in on-policy algorithms like A2C/PPO. Extends the RolloutBuffer to use dictionary observations It corresponds t
rl4lms/algorithms/common/maskable/buffers.py:122
↓ 1 callers
Class
MaskableDictRolloutBufferSamples
rl4lms/algorithms/common/maskable/buffers.py:27
↓ 1 callers
Class
MaskableEvalCallback
Callback for evaluating an agent. Supports invalid action masking. :param eval_env: The environment used for initialization :param callb
rl4lms/algorithms/common/maskable/callbacks.py:10
↓ 1 callers
Class
MaskableMultiCategoricalDistribution
MultiCategorical distribution for multi discrete actions. Supports invalid action masking. :param action_dims: List of sizes of discrete act
rl4lms/algorithms/common/maskable/distributions.py:173
↓ 1 callers
Class
MaskableRolloutBufferSamples
rl4lms/algorithms/common/maskable/buffers.py:17
↓ 1 callers
Class
MeteorRewardFunction
rl4lms/envs/text_generation/reward.py:126
↓ 1 callers
Class
OnPolicyAlgText
rl4lms/envs/text_generation/alg_wrappers.py:98
↓ 1 callers
Class
OnPolicyTrainer
A generic trainer for training LMs with onpolicy algorithms from SB3
rl4lms/envs/text_generation/training_utils.py:126
↓ 1 callers
Class
ParentToTTo
Official version
rl4lms/envs/text_generation/metric.py:486
↓ 1 callers
Class
PrioritySampler
rl4lms/core_components/sampler.py:6
↓ 1 callers
Class
RougeCombined
rl4lms/envs/text_generation/reward.py:208
↓ 1 callers
Class
RougeLMax
rl4lms/envs/text_generation/metric.py:555
↓ 1 callers
Class
SampleDecoderOnlyOutput
Base class for outputs of decoder-only generation models using sampling. Args: sequences (`torch.LongTensor` of shape `(batch_size*
rl4lms/envs/text_generation/hf_generation_utils.py:132
↓ 1 callers
Class
SampleEncoderDecoderOutput
Base class for outputs of encoder-decoder generation models using sampling. Hidden states and attention weights of the decoder (respectively
rl4lms/envs/text_generation/hf_generation_utils.py:161
↓ 1 callers
Class
SupervisedTrainer
A supervised trainer to train LMs (causal and seq2seq) on text generation tasks (wrapper on HF trainer)
rl4lms/envs/text_generation/training_utils.py:225
↓ 1 callers
Class
T5Dataset
rl4lms/envs/text_generation/preference_reward.py:90
↓ 1 callers
Class
TERMetric
rl4lms/envs/text_generation/metric.py:617
↓ 1 callers
Class
TransitionInfo
rl4lms/envs/text_generation/alg_wrappers.py:27
↓ 1 callers
Class
chrF
rl4lms/envs/text_generation/reward.py:584
↓ 1 callers
Class
chrFmetric
rl4lms/envs/text_generation/metric.py:640
Class
A2C
Advantage Actor Critic (A2C) Paper: https://arxiv.org/abs/1602.01783 Code: This implementation borrows code from https://github.com/ikos
rl4lms/algorithms/a2c/a2c.py:15
Class
ActionSpace
rl4lms/envs/common/action_space.py:5
Class
ActorCriticWarmStartMixin
rl4lms/envs/text_generation/warm_start.py:26
Class
ActorOnlyWarmStartMixin
rl4lms/envs/text_generation/warm_start.py:12
Class
AlgorithmRegistry
rl4lms/envs/text_generation/registry.py:203
Class
BLEURTMetric
rl4lms/envs/text_generation/metric.py:227
Class
BLEUToTTo
Official version
rl4lms/envs/text_generation/metric.py:528
Class
BaseEnv
A base class for all the environments
rl4lms/envs/common/base_env.py:12
Class
BaseMetric
rl4lms/envs/text_generation/metric.py:21
Class
BaseObservation
Placeholder for observation data class
rl4lms/envs/common/observation.py:7
Class
BaseObservationFeaturizer
rl4lms/envs/common/observation.py:14
Class
BatchedCommonGenPenaltyShapingFunction
rl4lms/envs/text_generation/reward.py:98
Class
BatchedRewardFunction
Computes rewards for several instances at once
rl4lms/envs/text_generation/reward.py:48
Class
CNNDailyMail
rl4lms/data_pools/custom_text_generation_pools.py:175
Class
CRD3DialogueGeneration
rl4lms/data_pools/custom_text_generation_pools.py:480
Class
CausalLMActorCriticPolicy
rl4lms/envs/text_generation/policy/causal_policy.py:37
Class
CommonGen
rl4lms/data_pools/custom_text_generation_pools.py:117
Class
CommonGenPenaltyShapingFunction
rl4lms/envs/text_generation/reward.py:71
Class
DailyDialog
rl4lms/data_pools/custom_text_generation_pools.py:553
Class
DataPoolRegistry
rl4lms/envs/text_generation/registry.py:87
Class
DateInText
rl4lms/envs/text_generation/test_metric.py:35
Class
DiversityMetrics
rl4lms/envs/text_generation/metric.py:333
Class
GenerationMixinWithRawScores
A class containing all functions for auto-regressive text generation, to be used as a mixin in [`PreTrainedModel`]. The class exposes [`~gen
rl4lms/envs/text_generation/hf_generation_utils.py:382
Class
IMDB
IMDB Dataset for sentiment continuation task
rl4lms/data_pools/custom_text_generation_pools.py:209
Class
IMDBForSeq2Seq
IMDB Dataset in seq2seq format to train supervised generator
rl4lms/data_pools/custom_text_generation_pools.py:241
Class
IWSLT2017EnDe
rl4lms/data_pools/custom_text_generation_pools.py:448
Class
IncreasingNumbersinText
rl4lms/envs/text_generation/test_metric.py:11
Class
IntentAccuracy
rl4lms/envs/text_generation/reward.py:608
Class
LMActorCriticPolicy
rl4lms/envs/text_generation/policy.py:25
Class
LMActorCriticPolicy
rl4lms/envs/text_generation/policy/base_policy.py:102
Class
LearnedBatchedRewardFunction
rl4lms/envs/text_generation/reward.py:318
Class
LearnedRewardFunction
rl4lms/envs/text_generation/reward.py:442
Class
LearnedRewardMetric
rl4lms/envs/text_generation/metric.py:44
Class
MaskableActorCriticCnnPolicy
CNN policy class for actor-critic algorithms (has both policy and value prediction). Used by A2C, PPO and the likes. :param observation_
rl4lms/algorithms/common/maskable/policies.py:319
Class
MaskableActorCriticPolicy
Policy class for actor-critic algorithms (has both policy and value prediction). Used by A2C, PPO and the likes. :param observation_spac
rl4lms/algorithms/common/maskable/policies.py:21
Class
MaskableActorCriticWarmStartMixin
rl4lms/envs/text_generation/warm_start.py:44
Class
MaskableDistribution
rl4lms/algorithms/common/maskable/distributions.py:100
Class
MaskableLMActorCriticPolicy
rl4lms/envs/text_generation/policy.py:550
Class
MaskableMultiInputActorCriticPolicy
MultiInputActorClass policy class for actor-critic algorithms (has both policy and value prediction). Used by A2C, PPO and the likes. :p
rl4lms/algorithms/common/maskable/policies.py:370
Class
MaskableRolloutBuffer
Rollout buffer that also stores the invalid action masks associated with each observation. :param buffer_size: Max number of element in the
rl4lms/algorithms/common/maskable/buffers.py:37
Class
MaskableSeq2SeqLMActorCriticPolicy
rl4lms/envs/text_generation/policy.py:922
next →
1–100 of 140, ranked by callers