MCPcopy Create free account

hub / github.com/KellerJordan/modded-nanogpt / types & classes

Types & classes557 in github.com/KellerJordan/modded-nanogpt

↓ 24 callersClassBlockInfo
Utilities and metadata for each parameter block. Attributes: param (Tensor): The original parameter that contains the block. comp
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_block_info.py:19
↓ 24 callersClassDTensorBlockInfo
Utilities and metadata for each parameter block specific using DTensor. Attributes: param (Tensor): The original parameter that contains
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributor/shampoo_block_info.py:69
↓ 21 callersClassDistributedShampoo
Implements distributed Shampoo algorithm. -------- Features -------- 1. Layerwise Grafting: In order to tune Shampoo, we can "graft"
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/distributed_shampoo.py:138
↓ 17 callersClassAdaGradPreconditionerConfig
Configuration for AdaGrad preconditioner computation. Attributes: epsilon (float): Epsilon term for regularizing square-root of the aggre
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:95
↓ 17 callersClassHybridShardDistributedConfig
Configuration for HybridShard (per-parameter FSDP) distributed computation. Enables distributed computation and optimizer states (like ZeRO-1) vi
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1125
↓ 13 callersClassFullyShardDistributedConfig
Configuration for FullyShard (per-parameter FSDP) distributed computation. Attributes: target_parameter_dimensionality (int | float): Th
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1103
↓ 12 callersClassGeneralizedPrimalAveragingConfig
Configuration for generalized primal averaging in Shampoo. Generalized Primal Averaging (GPA) maintains two sequences of iterates: - The eval
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:762
↓ 10 callersClassLossMetrics
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/loss_metrics.py:25
↓ 9 callersClassDDPDistributedConfig
Configuration for DDP distributed computation. Enables distributed computation and optimizer states (like ZeRO-1) via DTensor for Shampoo. N
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1011
↓ 9 callersClassEighEigendecompositionConfig
Configuration for eigendecomposition with torch.linalg.eigh. The tolerance hyperparameter is used for a criterion that enables an adaptive eigend
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions_types.py:116
↓ 8 callersClassAdamPreconditionerConfig
Configuration for Adam preconditioner computation. Attributes: beta2 (float): Exponential moving average factor for second moment. (Defau
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:136
↓ 8 callersClassHSDPDistributedConfig
Configuration for HSDP distributed computation. Enables distributed computation and optimizer states (like ZeRO-1) via DTensor for Shampoo across
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1072
↓ 8 callersClassWrappedModel
Result of wrapping a model for distributed training.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:27
↓ 7 callersClassCastedLinear
records/track_2_medium/2024-12-31_Target350M/train_gpt.py:134
↓ 7 callersClassCastedLinear
records/track_1_short/2024-12-04_ValueEmbed/train_gpt2.py:131
↓ 7 callersClassLinear
records/track_3_optimization/train_gpt_simple.py:67
↓ 7 callersClassLinear
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:197
↓ 7 callersClassLinear
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:230
↓ 7 callersClassLinear
records/track_3_optimization/results/20260519_dynmuon/train_gpt_simple_dynmuon.py:83
↓ 7 callersClassLinear
records/track_3_optimization/results/20260501_muonsq/train_gpt_simple_muonsq.py:75
↓ 7 callersClassLinear
records/track_3_optimization/results/20260506_trustlight/train_gpt_simple_trustlight.py:133
↓ 7 callersClassLinear
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:138
↓ 7 callersClassLinear
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:251
↓ 7 callersClassLinear
records/track_3_optimization/results/20260501_contra_muon/train_gpt_simple_contra_muon_2.py:92
↓ 7 callersClassLinear
records/track_3_optimization/results/20260504_muloco_normuonh/train_gpt_simple_muloco_normuonh.py:80
↓ 7 callersClassLinear
records/track_3_optimization/results/20260430_muonh/train_gpt_simple_muonh.py:74
↓ 7 callersClassLinear
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:67
↓ 7 callersClassLinear
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:166
↓ 7 callersClassLinear
records/track_3_optimization/results/20260611_muonh_tuned_aux_3250/train_gpt_simple_muonh_tuned_aux_3250.py:74
↓ 7 callersClassLinear
records/track_3_optimization/results/20260513_shampoo_1_4_power/train_gpt_shampoo.py:67
↓ 7 callersClassLinear
records/track_3_optimization/results/20260527_psgd/train_psgd.py:70
↓ 7 callersClassLinear
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:293
↓ 7 callersClassLinear
records/track_3_optimization/results/20260505_newton_muon/train_gpt_simple_newton_muon.py:79
↓ 7 callersClassLinear
records/track_3_optimization/results/20260509_contra_muon_split_cooldown/train_gpt_simple_contra_muon_split_cooldown.py:92
↓ 7 callersClassLinear
records/track_3_optimization/results/20260504_contra_muon_mlp_soapish/train_gpt_contra_normuon_soapish_mlp.py:93
↓ 7 callersClassLinear
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:136
↓ 7 callersClassLinear
records/track_3_optimization/results/20260518_soaph/train_gpt_simple_soaph.py:67
↓ 7 callersClassLinear
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:229
↓ 7 callersClassLinear
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:212
↓ 7 callersClassSingleDeviceDistributedConfig
Configuration for Shampoo without any parallelism. Attributes: target_parameter_dimensionality (int | float): The idealized parameter dim
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:992
↓ 5 callersClassCastedLinear
train_gpt_medium.py:842
↓ 5 callersClassConvNet
Simple two-layer convolutional network for image classification. Takes in image represented by an order-3 tensor. Used for testing optimizers.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/convnet.py:16
↓ 5 callersClassDDPStrategy
DDP strategy.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:71
↓ 5 callersClassDictZipIterator
Iterator that yields dictionaries by zipping values from iterators in a dictionary. Given a dictionary mapping from strings to iterators,
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/dict_zip_iterator.py:16
↓ 5 callersClassFSDPDistributedConfig
Configuration for FSDP distributed computation. Passes in additional metadata necessary to run FSDP Shampoo. Attributes: target_para
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1051
↓ 5 callersClassFSDPParameterMetadata
FSDP Metadata for a parameter. Attributes: fqn (str): Fully qualified name of the parameter. shape (torch.Size): Shape of the par
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:893
↓ 5 callersClassHybridShardStrategy
HSDP v2 (hybrid_shard) strategy.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:181
↓ 5 callersClassPerturbationConfig
Configuration for perturbing/damping/regularizing matrix eigenvalues by a small value epsilon (provided in DistributedShampoo arguments) to guara
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions_types.py:22
↓ 5 callersClassPseudoInverseConfig
Configuration for filtering zero/near-zero singular values (i.e., determining rank) to return a pseudo-inverse when the matrix is non-invertible.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions_types.py:46
↓ 5 callersClassQuantizedTensorList
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_quantization.py:116
↓ 5 callersClassScheduleFreeConfig
Configuration for schedule-free optimization in Shampoo. Schedule-Free is an iterate averaging method that eliminates the need for learning rate
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:836
↓ 4 callersClassCombinedLinear
r"""Applies a linear transformation to the incoming data: :math:`y = xA^T + b` Compared to torch.nn.Linear, uses a combined parameter for both th
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/shampoo_model_utils.py:16
↓ 4 callersClassCoupledHigherOrderConfig
Configuration for matrix root inverse via coupled higher-order method. Attributes: rel_epsilon (float): Relative epsilon for coupled high
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions_types.py:217
↓ 4 callersClassDummyOptimizerModule
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/utils/tests/shampoo_state_dict_utils_test.py:24
↓ 4 callersClassEigenConfig
Configuration for matrix root inverse via an eigendecomposition. Attributes: rank_deficient_stability_config (RankDeficientStabilityConfi
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions_types.py:180
↓ 4 callersClassEigendecomposedShampooPreconditionerConfig
Configuration for Shampoo preconditioner computation with caching of the eigendecomposed factor matrices. Note: When using custom amortized_compu
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:337
↓ 4 callersClassFSDPStrategy
FSDP v1 strategy.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:97
↓ 4 callersClassHSDPStrategy
HSDP v1 strategy.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:123
↓ 4 callersClassKLSOAPH
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:269
↓ 4 callersClassNorMuonH
NorMuonH: NS-orthogonalised gradient + Adafactor-style row/column variance preconditioning (NorMuon, https://arxiv.org/pdf/2510.05491) + hyperball
records/track_3_optimization/results/20260504_muloco_normuonh/train_gpt_simple_muloco_normuonh.py:229
↓ 4 callersClassQREigendecompositionConfig
Configuration for eigenvalue decomposition via QR algorithm. Determines whether the QR algorithm has converged based on the estimated eigenvalues
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/matrix_functions_types.py:149
↓ 4 callersClassRMSNorm
records/track_3_optimization/train_gpt_simple.py:59
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260520_rre_extrapolation_pr300_2925/train_gpt_simple_rre_pr300_2925.py:189
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260611_tailema_2720_submission/train_gpt_tailema_2720.py:222
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260519_dynmuon/train_gpt_simple_dynmuon.py:73
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260501_muonsq/train_gpt_simple_muonsq.py:67
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260506_trustlight/train_gpt_simple_trustlight.py:125
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260609_soap_f1_auxb2_clean/train_gpt_clean_SOTA.py:130
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260529_tail_phase_readout_2850/train_gpt_tail_phase_readout_2850.py:243
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260501_contra_muon/train_gpt_simple_contra_muon_2.py:84
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260504_muloco_normuonh/train_gpt_simple_muloco_normuonh.py:72
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260430_muonh/train_gpt_simple_muonh.py:66
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260511_klsoap_h_lr_power_decay/train_gpt_simple_klsoap_h_lr_power_decay.py:59
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260619_cwd_rowfloor_tailema/train_gpt_cwd_SOTA.py:158
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260611_muonh_tuned_aux_3250/train_gpt_simple_muonh_tuned_aux_3250.py:66
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260513_shampoo_1_4_power/train_gpt_shampoo.py:59
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260527_psgd/train_psgd.py:62
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260520_tail_refinterp_2900/train_gpt_tail_refinterp_2900.py:285
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260505_newton_muon/train_gpt_simple_newton_muon.py:71
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260509_contra_muon_split_cooldown/train_gpt_simple_contra_muon_split_cooldown.py:84
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260504_contra_muon_mlp_soapish/train_gpt_contra_normuon_soapish_mlp.py:85
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260525_aurora_ema_ref/train_gpt_simple_aurora_ema_ref.py:128
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260518_soaph/train_gpt_simple_soaph.py:59
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260611_tailema_2730_submission/train_gpt_tailema_2730.py:221
↓ 4 callersClassRMSNorm
records/track_3_optimization/results/20260611_tailema_2730_submission/ablation/combo_2740/train_gpt_combo_2740.py:204
↓ 4 callersClassSOAPH
records/track_3_optimization/results/20260518_soaph/train_gpt_simple_soaph.py:237
↓ 4 callersClassShard
train_gpt.py:1530
↓ 4 callersClassTrainingStage
train_gpt.py:1727
↓ 3 callersClassCastedLinear
records/track_1_short/2025-12-11_NorMuonOptimsAndFixes/profiler-example-traces/train_gpt-profiler-example.py:826
↓ 3 callersClassEigenvalueCorrectedShampooPreconditionerConfig
Configuration for eigenvalue-corrected Shampoo/SOAP preconditioner computation. Recall that in eigenvalue-corrected Shampoo, the eigenvectors and
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:401
↓ 3 callersClassFullyShardStrategy
FSDP v2 (fully_shard) strategy.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:160
↓ 3 callersClassLoadBalancingConfig
Load balancing configuration for distributing workloads across ranks. The `cost_model` defines how the cost of a tensor is computed, and the dist
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:938
↓ 3 callersClassPerRankLoggingFormatter
Formatter that adds rank to the log message.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/utils.py:38
↓ 3 callersClassShampooPT2CompileConfig
Configuration for Shampoo PT2 compilation. Enables Shampoo pytorch compilation with configure to speed up model training. For more details: h
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1166
↓ 3 callersClassShampooRuntimeConfig
Runtime configuration for Shampoo. Only non-checkpointed options here. Attributes: eager_nan_check (bool): Flag for checking for NaN
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:1182
↓ 3 callersClassSingleGPUStrategy
Single GPU training (no wrapping).
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/examples/parallelism.py:57
↓ 3 callersClassSpectralDescentPreconditionerConfig
Configuration for spectral descent computation in DistributedShampoo. NOTE: This config can only be used for 2D parameters, or parameters that ha
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/shampoo_types.py:628
↓ 3 callersClassSpectralDescentPreconditionerList
Preconditioner list for spectral descent. NOTE: This algorithm can only be used for 2D parameters, or parameters that have been reshaped to 2D.
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/spectral_descent_preconditioner_list.py:19
↓ 2 callersClassAdagradPreconditionerList
Adagrad / RMSprop / Adam preconditioners for a list of parameters. Operations are performed in-place with foreach operators. NOTE: Does not
records/track_3_optimization/results/20260513_shampoo_1_4_power/distributed_shampoo/preconditioner/adagrad_preconditioner_list.py:33
↓ 2 callersClassBOSFinder
train_gpt_medium.py:1237
next →1–100 of 557, ranked by callers