↓ 2 callersFunctionprepare_4d_causal_attention_mask(
*,
attention_mask: torch.Tensor,
dtype: torch.dtype,
q_len: int,
kv_len: int,
past_s
deepspec/modeling/eagle3/common.py:142
↓ 2 callersMethodrecord_dataset_metrics(
self,
*,
dataset_name: str,
metric_summary: dict[str, int | list[int]],
deepspec/eval/base_evaluator.py:691
↓ 2 callersFunctionsample_anchor_positions(
*,
seq_len: int,
loss_mask: torch.Tensor,
num_anchors: int,
device: torch.device,
)
deepspec/modeling/dspark/common.py:123
↓ 2 callersFunctionsave_checkpoint(
*,
model,
draft_model,
optimizer,
checkpoint_dir_root: str,
train_config,
next_m
deepspec/trainer/ckpt_manager.py:136
↓ 1 callersFunction_build_loss(
*,
loss_terms: dict[str, torch.Tensor],
global_denominators: dict[str, torch.Tensor],
ce_los
deepspec/modeling/dspark/loss.py:227
↓ 1 callersFunction_compute_training_schedule(
*,
world_size: int,
dataset_size: int,
local_batch_size: int,
global_batch_size: int,
deepspec/trainer/base_trainer.py:98
↓ 1 callersFunction_launch_eval(
*,
target_model_name_or_path: str,
checkpoint_dir: str,
step: int,
tensorboard_dir: str,
deepspec/trainer/base_trainer.py:138
↓ 1 callersFunction_print_summary(
*,
summary,
global_step: int,
next_micro_step: int,
micro_batches_per_epoch: int,
ma
deepspec/utils/training_logger.py:73
↓ 1 callersFunction_serialize_training_state(
*,
optimizer,
next_micro_step: int,
gradient_accumulation_steps: int,
global_rank: int,
deepspec/trainer/ckpt_manager.py:195
↓ 1 callersFunction_write_manifest(
*,
output_dir: str,
config,
train_data_paths,
target_layer_ids,
hidden_size: int,
scripts/data/prepare_target_cache.py:157
↓ 1 callersMethodbuild_dataset_payload(
self,
*,
metrics_row: dict[str, object],
confidence_row: dict,
args_
deepspec/eval/dspark/confidence_head.py:442
↓ 1 callersMethodbuild_dataset_row(
self,
*,
dataset_name: str,
metric_summary: dict[str, int | list[int]],
deepspec/eval/dspark/confidence_head.py:399
↓ 1 callersMethodbuild_metrics_row(
self,
*,
dataset_name: str,
metric_summary: dict[str, int | list[int]],
deepspec/eval/base_evaluator.py:469
↓ 1 callersFunctionbuild_target_cache_manifest(
*,
num_samples: int,
shards,
target_layer_ids,
hidden_size: int,
extra_fields=None,
deepspec/data/target_cache_dataset.py:580