↓ 2 callersFunctioncompute_advantage(data: DataProto, adv_estimator, gamma=1.0, lam=1.0, num_repeat=1, mask_truncated_samples=False)
code/DeepCoder/verl/verl/trainer/ppo/ray_trainer.py:125
↓ 2 callersFunctionevaluate(data_name, prompt_type, samples: list=None, file_path: str=None, max_num_samples=None, execute=False)
math/examples/math_eval/evaluate.py:42
↓ 2 callersFunctiongenerate_completions(model, tokenizer, prompts, batch_size=1, stop_id_sequences=None, add_special_tokens=True, disable_tqdm=False,
math/examples/math_eval/model_utils.py:75
↓ 2 callersFunctionget_eos_mask e.g. end of sentence token=1 response_id: [0, 0, 2, 42, 3, 5, 1, 0, 0] eos_mask: [1, 1, 1, 1, 1, 1, 1, 0, 0]
code/DeepCoder/verl/verl/utils/torch_functional.py:139