MCPcopy Create free account

hub / github.com/KellerJordan/modded-nanogpt / functions

Functions2,320 in github.com/KellerJordan/modded-nanogpt

↓ 452 callersMethodget
(self)
records/track_1_short/2025-12-11_NorMuonOptimsAndFixes/profiler-example-traces/train_gpt-profiler-example.py:1179
↓ 157 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:1089
↓ 156 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:1043
↓ 94 callersMethodnumel
(self)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/preconditioner_list.py:98
↓ 84 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:781
↓ 84 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:780
↓ 72 callersMethodstate_dict
r"""Returns a nested state dictionary containing the whole internal dict of the module. OptimizerModules and other common data structures
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/optimizer_modules.py:35
↓ 71 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:763
↓ 63 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:1286
↓ 61 callersMethodrotary
(self, x_BTHD)
train_gpt.py:989
↓ 53 callersMethodbackward
(ctx, grad_output)
triton_kernels.py:1000
↓ 47 callersMethodtrain
(self)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributed_shampoo.py:1463
↓ 45 callersMethodeval
(self)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributed_shampoo.py:1491
↓ 42 callersFunctioncompress_list
Compresses sequence based on selector. NOTE: Despite the name, this function can compress both lists and tuples, but will always return a tup
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_utils.py:171
↓ 38 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260506_trustlight/train_gpt_simple_trustlight.py:497
↓ 36 callersMethodload
()
train_gpt.py:1585
↓ 33 callersMethodload_state_dict
This implementation requires the stored and loaded states to be fully initialized. Because of introduced strictness it allows us to:
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/optimizer_modules.py:122
↓ 31 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:632
↓ 31 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:676
↓ 23 callersFunctiongram_frobenius_norm_estimate
(G: Tensor, keepdim: bool = False, eps: float = 1e-10)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:389
↓ 20 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:597
↓ 19 callersMethod_verify_preconditioner_updates
Test helper function that verifies preconditioner updates and preconditioning. This function takes a preconditioner_list and
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/tests/preconditioner_list_test_utils.py:135
↓ 19 callersFunctioncompare_two_optimizers_on_weight_and_loss
Compare the performance of two optimizers on a simple neural network using the same device. Args: control_optim_factory (Callable[[P
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/tests/shampoo_test_utils.py:387
↓ 18 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260504_contra_muon_mlp_soapish/train_gpt_contra_normuon_soapish_mlp.py:372
↓ 17 callersFunctiongram_frobenius_norm_estimate
(G: Tensor, keepdim: bool = False, eps: float = 1e-10)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:293
↓ 17 callersFunctiongram_frobenius_norm_estimate
(G: Tensor, keepdim: bool = False, eps: float = 1e-10)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:348
↓ 17 callersMethodstep
(self, closure: None = None)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributed_shampoo.py:1363
↓ 16 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260501_contra_muon/train_gpt_simple_contra_muon_2.py:306
↓ 16 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260509_contra_muon_split_cooldown/train_gpt_simple_contra_muon_split_cooldown.py:306
↓ 16 callersFunctionrre_extrapolate
(iterates, regularization=1e-6, damping=1.0)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:660
↓ 15 callersMethod_instantiate_preconditioner_list
( self, **kwargs: object )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/tests/shampoo_preconditioner_list_test.py:248
↓ 14 callersFunctiongenerate_pairwise_indices
Generates accumulated pairwise indices for a given input list. This is useful for generating interval indices for iterating through a list given
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_utils.py:209
↓ 14 callersFunctionprint0
(s, console=False)
train_gpt_medium.py:1667
↓ 14 callersFunctionprint0
(s, console=False)
train_gpt.py:2025
↓ 14 callersFunctionrestore_tail_extrapolated_weights
(applied)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:1375
↓ 14 callersFunctiontrain_model
( optim_factory: Callable[[ParamsT], torch.optim.Optimizer], model_factory: Callable[ [], tupl
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/tests/shampoo_test_utils.py:145
↓ 13 callersMethod_shampoo_optim_factory
( distributed_config: DDPDistributedConfig | FullyShardDistributedConfig | HybridShard
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/shampoo_hybrid_shard_distributor_test.py:130
↓ 13 callersFunctioncompare_optimizer_on_cpu_and_device
Compare the performance of the same optimizer on a simple neural network across CPU and another device. Args: optim_factory (Callabl
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/tests/shampoo_test_utils.py:432
↓ 13 callersFunctioncompare_two_optimizers_models_devices_on_weight_and_loss
Compare the performance of two optimizers on models across different devices by evaluating their weights and loss. Args: control_opt
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/tests/shampoo_test_utils.py:226
↓ 13 callersFunctionconstruct_training_problem
( model_linear_layers_dims: tuple[int, ...], model_dead_layers_dims: tuple[int, ...] | None = (10, 10)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/tests/shampoo_test_utils.py:59
↓ 13 callersMethodmerge_and_block_gradients
Merge and block gradients. NOTE: This function MUST be called in the step function of the optimizer after the gradient has been updat
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_distributor.py:405
↓ 13 callersMethodupdate
(self, loss: torch.Tensor)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/loss_metrics.py:51
↓ 12 callersFunctionprint0
(s, console=False)
records/track_2_medium/2024-12-31_Target350M/train_gpt.py:412
↓ 11 callersFunctionget_all_non_abstract_subclasses
Retrieves all non-abstract (instantiable) subclasses of a given class. This function uses a helper function to recursively find all unique s
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/commons.py:20
↓ 11 callersFunctiongram_frobenius_norm_estimate
(G: Tensor, keepdim: bool = False, eps: float = 1e-10)
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:232
↓ 10 callersFunctioncompile_fsdp_parameter_metadata
Compiles parameter metadata necessary for FSDP Shampoo. Args: module (nn.Module): Module to compile metadata for. Returns: p
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_fsdp_utils.py:20
↓ 10 callersMethodget
()
train_gpt.py:1591
↓ 10 callersMethodis_dequantized_stored
(self)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_quantization.py:236
↓ 10 callersFunctionprint0
(s, console=False)
records/track_2_medium/2025-11-12_BlockMaskRedundantOp/train_gpt_medium.py:383
↓ 10 callersFunctionprint0
(s, console=False)
records/track_1_short/2025-12-11_NorMuonOptimsAndFixes/profiler-example-traces/train_gpt-profiler-example.py:1368
↓ 10 callersMethodupdate_preconditioners
( self, masked_grad_list: tuple[Tensor, ...], step: Tensor, perform_amortized_
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/preconditioner_list.py:69
↓ 9 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:279
↓ 9 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:187
↓ 9 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:215
↓ 9 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:278
↓ 9 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:261
↓ 9 callersFunction_create_model_and_params
( model_linear_layers_dims: tuple[int, ...] = (2, 5, 3), )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/shampoo_fsdp_utils_test.py:40
↓ 9 callersFunction_linear_ramp
(step: int, start_step: int, end_step: int)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:762
↓ 9 callersFunction_matrix_perturbation
Add epsilon * I to matrix (if square) or epsilon (if vector). Args: A (Tensor): Matrix of interest. epsilon (float): Value to add
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions.py:145
↓ 9 callersMethodlog
(self)
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/loss_metrics.py:60
↓ 9 callersFunctionmatrix_inverse_root
Computes matrix root inverse of square symmetric positive definite matrix. Args: A (Tensor): Square matrix of interest. root (Fra
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions.py:273
↓ 9 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260504_muloco_normuonh/train_gpt_simple_muloco_normuonh.py:328
↓ 8 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260519_dynmuon/train_gpt_simple_dynmuon.py:138
↓ 8 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:301
↓ 8 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:185
↓ 8 callersFunctionbatched
Batches an iterable into chunks of size n. Note: This is a re-implementation of itertools.batched which is available in Python 3.12+. Co
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/commons.py:52
↓ 8 callersFunctionmulti_dim_split
Chunks tensor across multiple dimensions based on splits. This function recursively splits a tensor along all of its dimensions using the spe
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_utils.py:115
↓ 8 callersFunctionprint0
(s, logonly=False)
records/track_1_short/2024-12-04_ValueEmbed/train_gpt2.py:403
↓ 8 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:323
↓ 7 callersMethod__init__
(self, dim: int)
train_gpt_medium.py:991
↓ 7 callersMethod__init__
(self, dim)
records/track_2_medium/2024-12-31_Target350M/train_gpt.py:193
↓ 7 callersMethod__init__
(self, dim: int)
records/track_1_short/2025-12-11_NorMuonOptimsAndFixes/profiler-example-traces/train_gpt-profiler-example.py:961
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/train_gpt_simple.py:116
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:246
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260501_muonsq/train_gpt_simple_muonsq.py:124
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260506_trustlight/train_gpt_simple_trustlight.py:182
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260501_contra_muon/train_gpt_simple_contra_muon_2.py:141
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260504_muloco_normuonh/train_gpt_simple_muloco_normuonh.py:129
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260430_muonh/train_gpt_simple_muonh.py:123
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:116
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260611_muonh_tuned_aux_3250/train_gpt_simple_muonh_tuned_aux_3250.py:123
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260527_psgd/train_psgd.py:118
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:342
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260505_newton_muon/train_gpt_simple_newton_muon.py:132
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260509_contra_muon_split_cooldown/train_gpt_simple_contra_muon_split_cooldown.py:141
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260504_contra_muon_mlp_soapish/train_gpt_contra_normuon_soapish_mlp.py:142
↓ 7 callersMethod__init__
(self, dim: int)
records/track_3_optimization/results/20260518_soaph/train_gpt_simple_soaph.py:116
↓ 7 callersFunction_assign_function_args_from_config
Creates a partial function with arguments from config that match func's parameter names. This function examines the fields in the config obj
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions.py:65
↓ 7 callersFunction_finish_extrapolation
(current, extrapolated, damping, orig_dtype)
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:723
↓ 7 callersMethod_precondition_grad
( grad: Tensor, preconditioned_dims_selector: tuple[bool, ...], preconditioner_list: t
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/shampoo_preconditioner_list.py:1369
↓ 7 callersMethod_shampoo_optim_factory
( distributed_config: DDPDistributedConfig | SingleDeviceDistributedConfig, preconditi
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/shampoo_ddp_distributor_test.py:92
↓ 7 callersMethod_shampoo_optim_factory
( distributed_config: HSDPDistributedConfig | SingleDeviceDistributedConfig, )
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/shampoo_hsdp_distributor_test.py:114
↓ 7 callersMethod_test_update_params_impl
Implementation of test_update_params - called by concrete test classes. This test verifies that: - use_masked_tensors=True: U
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/gpu_tests/distributor_test_utils.py:46
↓ 7 callersFunction_torch_dtype_resolver
Resolve a string to a torch.dtype.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/resolvers.py:16
↓ 7 callersMethodall_gather_into_tensor
()
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_ddp_distributor.py:288
↓ 7 callersFunctionget_device_mesh
Returns device mesh from provided device type, mesh, and mesh dim names. This function will cache previous meshes according to the input. Arg
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_dist_utils.py:35
↓ 7 callersFunctionmerge_small_dims
Reshapes tensor by merging small dimensions. This function merges adjacent dimensions of a tensor when their product is below the specified t
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_utils.py:30
↓ 7 callersFunctionnorm
(x: Tensor)
train_gpt_medium.py:839
↓ 7 callersFunctionprint0
(s, console=False, log=True)
records/track_3_optimization/results/20260518_soaph/train_gpt_simple_soaph.py:415
↓ 7 callersMethodstate_dict
Return the optimizer state as a dict.
train_gpt.py:689
next →1–100 of 2,320, ranked by callers