MCPcopy Create free account

hub / github.com/KellerJordan/modded-nanogpt / functions

Functions2,320 in github.com/KellerJordan/modded-nanogpt

↓ 3 callersFunction_param_in_scope
(scope: str, name: str, p: Tensor)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:171
↓ 3 callersFunction_param_in_scope
(scope: str, name: str, p: Tensor)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:170
↓ 3 callersFunction_pid_to_block
( pid, M, BLOCK_SIZE_M: tl.constexpr, BLOCK_SIZE_N: tl.constexpr, GROUP_SIZE_M: tl.constex
triton_kernels.py:10
↓ 3 callersFunction_restore_named_param_buffer_state
(buffer_dict: dict, saved: dict[str, Tensor])
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:1465
↓ 3 callersFunction_run_val_loss
()
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:1095
↓ 3 callersFunction_run_val_loss
()
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:1094
↓ 3 callersFunction_symmetrize
(matrix: Tensor)
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:171
↓ 3 callersMethod_test_eigen_root_multi_dim
( self, A: Callable[[int], Tensor], n: int, root: int, epsilon: float,
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/tests/matrix_functions_test.py:400
↓ 3 callersMethod_test_newton_root_inverse_multi_dim
( self, A: Callable[[int], Tensor], n: int, root: int, epsilon: float,
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/tests/matrix_functions_test.py:578
↓ 3 callersMethod_test_split_tensor_block_recovery
( self, original_tensor: Tensor, expected_split_tensors: list[Tensor], start_i
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/tests/shampoo_fsdp_distributor_test.py:29
↓ 3 callersMethod_test_split_tensor_block_recovery
( self, original_tensor: Tensor, expected_split_tensors: list[Tensor], start_i
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/tests/shampoo_hsdp_distributor_test.py:27
↓ 3 callersFunction_weight_decay_type_resolver
Resolve a string to WeightDecayType.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/resolvers.py:40
↓ 3 callersMethodallocate_eye_tensor
( n: int, dtype: torch.dtype | None = None, device: torch.device | None = None )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_block_info.py:125
↓ 3 callersMethodapply
(self, old_window: int, new_window: int, alpha: int=1, beta: int=32)
train_gpt.py:1030
↓ 3 callersMethodapply
(self, old_window: int, new_window: int, alpha: int=1, beta: int=32)
records/track_1_short/2025-12-11_NorMuonOptimsAndFixes/profiler-example-traces/train_gpt-profiler-example.py:870
↓ 3 callersFunctioncompare_optimizer_state_dict
Recursively compares two optimizer state dicts for bitwise equivalence, skipping 'param_groups' keys. Args: ref_optim_state (dict[st
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/shampoo_checkpoint_test.py:77
↓ 3 callersMethodcompress_preconditioner_list
( self, local_grad_selector: tuple[bool, ...] )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/preconditioner_list.py:82
↓ 3 callersFunctionextract_state_dict_content
Converts nested dictionary with objects with state dict functionality. Args: input_dict (dict[str, Any]): Nested dictionary containing ob
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_state_dict_utils.py:48
↓ 3 callersMethodget
(self)
train_gpt_medium.py:1265
↓ 3 callersFunctionget_distributed_env
()
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/utils.py:66
↓ 3 callersFunctionget_window_size_blocks
(step: int)
records/track_2_medium/2025-11-12_BlockMaskRedundantOp/train_gpt_medium.py:461
↓ 3 callersFunctioninstantiate_optimizer
( cfg: DictConfig, params: Any, distributed_config: DistributedConfig | None = None, )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/utils.py:121
↓ 3 callersFunctionis_v_param
(name: str)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:444
↓ 3 callersFunctionlinear_relu_square
(a, b, aux=None, a_f8=None, b_f8=None, dequant_scale_ptr=None)
triton_kernels.py:483
↓ 3 callersFunctionload_checkpoint
Load model and optimizer state from checkpoint if available.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/utils.py:174
↓ 3 callersMethodnext_batch
(self, batch_size)
records/track_2_medium/2024-12-31_Target350M/train_gpt.py:356
↓ 3 callersMethodnext_batch
(self)
records/track_1_short/2024-10-09_SOAP/train_gpt2.py:645
↓ 3 callersMethodnext_batch
(self)
records/track_1_short/2024-12-04_ValueEmbed/train_gpt2.py:347
↓ 3 callersMethodnext_batch
(self)
records/track_1_short/2024-10-14_ModernArch/train_gpt2.py:301
↓ 3 callersMethodnext_batch
(self)
records/track_1_short/2024-10-10_Muon/train_gpt2.py:311
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:186
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:219
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260506_trustlight/train_gpt_simple_trustlight.py:122
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:127
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:240
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260501_contra_muon/train_gpt_simple_contra_muon_2.py:81
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260504_muloco_normuonh/train_gpt_simple_muloco_normuonh.py:69
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:155
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:282
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260509_contra_muon_split_cooldown/train_gpt_simple_contra_muon_split_cooldown.py:81
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260504_contra_muon_mlp_soapish/train_gpt_contra_normuon_soapish_mlp.py:82
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:125
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:218
↓ 3 callersFunctionnorm
(x: Tensor)
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:201
↓ 3 callersFunctionprepare_update_param_buffers
Allocates a persistent shadow copy of updated parameters.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_utils.py:338
↓ 3 callersMethodquantize
(self, dequantized_tensor: Tensor)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_quantization.py:90
↓ 3 callersFunctionredistribute_and_update_params
Redistributes updated parameters to each parameter's rank.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_utils.py:378
↓ 3 callersMethodreset
(self)
records/track_1_short/2024-10-09_SOAP/train_gpt2.py:635
↓ 3 callersMethodreset
(self)
records/track_1_short/2024-10-14_ModernArch/train_gpt2.py:291
↓ 3 callersMethodreset
(self)
records/track_1_short/2024-10-10_Muon/train_gpt2.py:301
↓ 3 callersMethodreset_parameters
(self)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_model_utils.py:88
↓ 3 callersFunctionrmsnorm
(x0, eps=1e-6)
records/track_1_short/2024-10-09_SOAP/train_gpt2.py:471
↓ 3 callersFunctionrmsnorm
(x0, eps=1e-6)
records/track_1_short/2024-10-10_Muon/train_gpt2.py:136
↓ 3 callersFunctionsetup_distribution
( backend: str, rank: int, world_size: int, local_rank: int )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/utils.py:81
↓ 3 callersFunctionsetup_per_rank_logging
Configure per-rank logging with rank prefix and optional debug level.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/utils.py:49
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:352
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:260
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:456
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:288
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:543
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:351
↓ 3 callersFunctionshould_soap_param
(name: str)
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:334
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:569
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:421
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:844
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:449
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:446
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:568
↓ 3 callersMethodstep
(self)
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:551
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:484
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:377
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260506_trustlight/train_gpt_simple_trustlight.py:286
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:285
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:511
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:313
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:598
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:376
↓ 3 callersFunctiontensor_cosine
(a: Tensor, b: Tensor, eps: float = 1e-8)
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:359
↓ 3 callersFunctiontrail_delta_diag_group
(name: str, p: Tensor)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:1647
↓ 3 callersFunctiontrail_delta_in_scope
(name: str, p: Tensor)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:1272
↓ 3 callersFunctiontranspose_copy
Tiled transpose copy: dst = src.T where src is (M, N) and dst is (N, M). Uses a 64x128 tiled Triton kernel with coalesced reads AND writes, a
triton_kernels.py:604
↓ 3 callersFunctionupdate_param_state_dict_object
( current_param_state_dict: dict[str, Any], param_state_dict_to_load: dict[str, Any], enable_missi
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_state_dict_utils.py:21
↓ 3 callersMethodwrap_model
( self, model: nn.Module, local_rank: int, backend: str, device_mesh:
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:194
↓ 2 callersFunction_active_schedule_steps
(step)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:2177
↓ 2 callersFunction_blend_extra_delta
(base_delta, extra_delta)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:923
↓ 2 callersMethod_cautious_wd_and_update_inplace
Cautious weight decay + parameter update. wd_tensor and lr_tensor are 0-D CPU tensors. Mantissa is tracked to enable higher precision
train_gpt.py:909
↓ 2 callersMethod_construct_model
( model_linear_layers_dims: tuple[int, ...], model_dead_layers_dims: tuple[int, ...],
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/shampoo_checkpoint_test.py:261
↓ 2 callersMethod_direction
Momentum -> SOAP -> muon_update; returns the raw (pre-radial) update. Mirrors the per-param body in step() — used by _circuit_muon_step so the
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:774
↓ 2 callersMethod_ensure_state
(self, p)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:756
↓ 2 callersMethod_finish
Radial scale -> u/w floor -> apply -> radius correction -> SOAP refresh.
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:814
↓ 2 callersFunction_fsdp_param_strategy_resolver
Resolve a string to FSDPParamAssignmentStrategy.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/resolvers.py:31
↓ 2 callersMethod_get_field_dict
Creates a dictionary containing shallow copies of this dataclass's fields. This method creates a dictionary where keys are field nam
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/shampoo_preconditioner_list.py:150
↓ 2 callersMethod_get_inverse_exponent
Retrieves the inverse exponent override based on the dimension and order. Args: dimension (int): The dimension for which
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/shampoo_preconditioner_list.py:1551
↓ 2 callersMethod_init_weights
(self, m: nn.Linear | CombinedLinear, seed: int)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/tests/shampoo_model_utils_test.py:27
↓ 2 callersFunction_initial_orthogonal_matrix
(matrix: Tensor)
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:175
↓ 2 callersFunction_initial_orthogonal_matrix
(matrix: Tensor)
records/track_3_optimization/results/20260518_soaph/train_gpt_simple_soaph.py:175
↓ 2 callersMethod_is_active_step
(self, opt, step: int)
train_gpt_medium.py:1530
↓ 2 callersFunction_load_data_shard
(file: Path)
records/track_2_medium/2025-11-12_BlockMaskRedundantOp/train_gpt_medium.py:317
↓ 2 callersFunction_load_data_shard
(filename)
records/track_1_short/2024-10-09_SOAP/train_gpt2.py:601
↓ 2 callersFunction_load_data_shard
(filename)
records/track_1_short/2024-10-14_ModernArch/train_gpt2.py:257
← previousnext →201–300 of 2,320, ranked by callers