Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/ByteDance-Seed/Triton-distributed
/ types & classes
Types & classes
521 in github.com/ByteDance-Seed/Triton-distributed
⨍
Functions
5,103
◇
Types & classes
521
↳
Endpoints
149
↓ 139 callers
Class
Builtin
python/little_kernel/language/builtin_base.py:177
↓ 63 callers
Class
TypeInferencer
Centralized type inferencer for LLType system. Uses modular components for maintainability and extensibility. Uses the unified Scope
python/little_kernel/core/passes/utils/type_inference/infer_type.py:37
↓ 59 callers
Class
group_profile
python/triton_dist/profiler_utils.py:205
↓ 54 callers
Class
Literal
Literal expression (integer, float, boolean constants)
python/little_kernel/core/expr.py:227
↓ 28 callers
Class
CppEmitter
C++ code emitter with context-aware LLType resolution and scope tracking. - Avoids redundant type declarations for in-scope variables (parame
python/little_kernel/codegen/codegen_base.py:39
↓ 27 callers
Class
TypeMismatchError
Raised when types are incompatible (e.g., int + float)
python/little_kernel/core/passes/utils/type_inference/type_inference_core.py:58
↓ 26 callers
Class
BinOp
Binary operation expression (e.g., a + b, a && b)
python/little_kernel/core/expr.py:388
↓ 24 callers
Class
CSVWriter
Unified CSV result writer with metadata header.
python/little_kernel/benchmark/utils.py:140
↓ 20 callers
Class
IntType
python/little_kernel/core/type_system.py:106
↓ 19 callers
Class
UnsupportedNodeError
Raised when an AST node type is not supported for inference
python/little_kernel/core/passes/utils/type_inference/type_inference_core.py:63
↓ 18 callers
Class
Var
Variable expression (access to local/global variables or parameters)
python/little_kernel/core/expr.py:246
↓ 17 callers
Class
TypeInferenceError
Base exception for type inference failures (with AST node context)
python/little_kernel/core/passes/utils/type_inference/type_inference_core.py:35
↓ 12 callers
Class
InputDependencyDesc
python/triton_dist/mega_triton_kernel/core/task_base.py:143
↓ 12 callers
Class
ModelBuilder
python/triton_dist/mega_triton_kernel/models/model_builder.py:86
↓ 11 callers
Class
vector
python/triton_dist/language/simt_ops.py:99
↓ 10 callers
Class
UnOp
Unary operation expression (e.g., !a, *p)
python/little_kernel/core/expr.py:294
↓ 9 callers
Class
FloatType
python/little_kernel/core/type_system.py:154
↓ 9 callers
Class
TupleType
Tuple type parameterized by a list of element types (e.g., Tuple[bool, int32, int32]).
python/little_kernel/core/type_system.py:433
↓ 8 callers
Class
IntFilter
A class to filter integers based on a defined rule. The rule can be an integer, a [min, max] list for a range, or None for a wildcard.
python/triton_dist/tools/tune/tune_gemm.py:152
↓ 8 callers
Class
ModelConfig
python/triton_dist/models/config.py:31
↓ 8 callers
Class
OutputTilingDesc
python/triton_dist/mega_triton_kernel/core/task_base.py:137
↓ 7 callers
Class
BarrierAllContext
You may use this to barrier all ranks in global, or just in intra-node team. NOTE: nvshmem_barrier_all is slower for intra-node only.
python/triton_dist/kernels/nvidia/common_ops.py:227
↓ 7 callers
Class
KV_Cache
python/triton_dist/models/kv_cache.py:29
↓ 7 callers
Class
PythonClassToCppStructConverter
Convert Python class AST to C++ struct definition. This visitor traverses a Python class definition and generates the corresponding
python/little_kernel/codegen/special_struct/struct_converter.py:41
↓ 6 callers
Class
BlockStmt
A block of sequential statements (e.g., body of an if/loop). Represents a scoped sequence of statements, common in structured control flow.
python/little_kernel/core/stmt.py:38
↓ 6 callers
Class
MoEOptimConfig
python/triton_dist/function/nvidia/common.py:407
↓ 6 callers
Class
UndefinedVariableError
Raised when referencing a variable not in scope/context
python/little_kernel/core/passes/utils/type_inference/type_inference_core.py:53
↓ 5 callers
Class
AllocateStmt
Memory allocation statement (dynamic memory management). Represents allocation of memory in CUDA's memory spaces (e.g., `int* x = new int[N];
python/little_kernel/core/stmt.py:309
↓ 5 callers
Class
AllocateTensorExpr
Expression for allocating a tensor (returns a tensor object). Mimics PyTorch's `torch.empty`, `torch.zeros`, etc. Supports multi-dimensional
python/little_kernel/core/expr.py:520
↓ 5 callers
Class
AssignStmt
Assignment statement (lhs = rhs). Assigns the value of an expression (rhs) to a mutable target (lhs).
python/little_kernel/core/stmt.py:62
↓ 5 callers
Class
CudaMallocBuffer
Raw cudaMalloc buffer that is P2P accessible (unlike PyTorch tensors).
python/little_kernel/design/test_flashcomm_multi_gpu.py:103
↓ 5 callers
Class
EpAll2AllFusedOp
Fused EP All-to-All + grouped GEMM MoE op for AMD GPUs.
python/triton_dist/layers/amd/ep_a2a_fused_layer.py:77
↓ 5 callers
Class
RawCudaBuffer
Raw cudaMalloc buffer for P2P-accessible cross-GPU memory.
python/little_kernel/design/test_flashcomm_torchrun.py:104
↓ 4 callers
Class
AllocateExpr
Base class for allocation expressions (returns a pointer/handle to allocated memory). Serves as a common parent for raw memory allocation (e.
python/little_kernel/core/expr.py:471
↓ 4 callers
Class
CallExpr
Function call expression with a return value. Unlike CallStmt (which is a statement with no return value), CallExpr is an expression that
python/little_kernel/core/expr.py:431
↓ 4 callers
Class
ForStmt
For-loop statement (structured iteration). Represents a counted loop with initialization, condition, and increment. Common in CUDA for th
python/little_kernel/core/stmt.py:122
↓ 4 callers
Class
Package
python/setup.py:263
↓ 4 callers
Class
ScopeManager
Unified symbol scope manager for all passes. Manages symbol scopes for passes, ensuring that local definitions take priority over g
python/little_kernel/core/passes/utils/scope_manager.py:119
↓ 4 callers
Class
SpecialStructType
Type for special structs like Scheduler that need custom code generation.
python/little_kernel/core/type_system.py:578
↓ 4 callers
Class
TP_Attn
Tensor Parallel Attention. QKV Projection: Column Parallelism on weights (sharded over head dimension). Output Projection: Row Parallelis
python/triton_dist/layers/amd/tp_attn.py:171
↓ 4 callers
Class
TP_MLP
Tensor Parallel MLP. This MLP uses a common TP strategy: 1. First linear layer (gate/up) weights are column-parallel. 2. Second linea
python/triton_dist/layers/amd/tp_mlp.py:48
↓ 4 callers
Class
TaskDependency
python/triton_dist/mega_triton_kernel/core/task_base.py:113
↓ 4 callers
Class
TestStruct
python/little_kernel/tests/unit/test_struct_stub.py:254
↓ 3 callers
Class
AllGatherGEMMTensorParallelContext
python/triton_dist/kernels/amd/allgather_gemm.py:873
↓ 3 callers
Class
AnnotateTypeHelper
python/little_kernel/core/type_system.py:325
↓ 3 callers
Class
CallStmt
Function call statement (for void functions or side effects). Differs from CallExpr: CallStmt is a standalone statement (no return value),
python/little_kernel/core/stmt.py:192
↓ 3 callers
Class
CudaEmitter
Unified CUDA code emitter. Generates standalone CUDA code using raw PTX intrinsics. No CuTe/CUTLASS dependency. Uses CUtensorMap directly for
python/little_kernel/codegen/codegen_cuda.py:33
↓ 3 callers
Class
DeclStmt
Variable declaration statement (with optional initialization). Declares a new variable with a type, name, and optional initial value. Sup
python/little_kernel/core/stmt.py:245
↓ 3 callers
Class
DenseModel
Dense model implementation for tensor parallel training. This model initializes the parameters, sets the forward pass method, and provides an
python/triton_dist/mega_triton_kernel/models/dense.py:108
↓ 3 callers
Class
Engine
python/triton_dist/models/engine.py:37
↓ 3 callers
Class
EnumDef
IR node representing an enum definition. This node is inserted into the Module body during materialize pass and processed during cod
python/little_kernel/core/passes/utils/ir_nodes.py:43
↓ 3 callers
Class
GemmARLayer
python/triton_dist/layers/nvidia/gemm_allreduce_layer.py:34
↓ 3 callers
Class
IfStmt
Conditional statement (if-else). Executes one of two blocks based on a boolean condition.
python/little_kernel/core/stmt.py:91
↓ 3 callers
Class
TypeConverter
Converts LLType to C++ type strings using registry.
python/little_kernel/codegen/registries/type_converter.py:30
↓ 2 callers
Class
AGGemmIntraNode
python/triton_dist/test/amd/test_ag_gemm_intra_node.py:76
↓ 2 callers
Class
AllGatherGEMMTensorParallelContext
python/triton_dist/kernels/metax/allgather_gemm.py:1021
↓ 2 callers
Class
AllGatherLayer
python/triton_dist/layers/nvidia/low_latency_allgather_layer.py:31
↓ 2 callers
Class
AllocateTensorStmt
Statement for allocating a tensor and assigning it to a variable. Combines tensor allocation (via `AllocateTensorExpr`) with variable assignm
python/little_kernel/core/stmt.py:361
↓ 2 callers
Class
AnnotationResolver
Handles resolution of type annotations.
python/little_kernel/core/passes/utils/type_inference/type_inference_visitors.py:71
↓ 2 callers
Class
Buffer
python/triton_dist/mega_triton_kernel/core/graph.py:82
↓ 2 callers
Class
CMakeExtension
python/setup.py:479
↓ 2 callers
Class
CallTypeInferencer
Handles type inference for function/method calls.
python/little_kernel/core/passes/utils/type_inference/type_inference_call.py:44
↓ 2 callers
Class
CommOp
python/triton_dist/layers/nvidia/p2p.py:40
↓ 2 callers
Class
CompiledKernel
Compiled CUDA kernel that can be launched from Python.
python/little_kernel/runtime/kernel.py:34
↓ 2 callers
Class
ConstantTypeInferencer
Handles type inference for constant values.
python/little_kernel/core/passes/utils/type_inference/type_inference_visitors.py:37
↓ 2 callers
Class
EPAllToAllLayoutDesc
python/triton_dist/layers/nvidia/ep_a2a_layer.py:52
↓ 2 callers
Class
EP_MoE
EP MoE
python/triton_dist/layers/nvidia/ep_moe.py:65
↓ 2 callers
Class
IntFilter
A class to filter integers based on a defined rule. The rule can be an integer, a [min, max] list for a range, or None for a wildcard.
python/triton_dist/tools/tune/find_topk.py:51
↓ 2 callers
Class
IpcH
python/little_kernel/design/test_ipc_minimal.py:33
↓ 2 callers
Class
LLType
Root base class for all types in the system. Ensures consistent interface for equality, hashing, and string representation. All types are
python/little_kernel/core/type_system.py:32
↓ 2 callers
Class
LoopModifier
Represents a loop modifier (e.g., ll.unroll, ll.parallel, ll.serial).
python/little_kernel/core/passes/utils/registries/loop_modifier_registry.py:31
↓ 2 callers
Class
MethodResolver
Centralized method return type resolver for type inference.
python/little_kernel/core/passes/utils/type_inference/method_resolver.py:33
↓ 2 callers
Class
MethodStubInfo
Information about a method in a struct stub.
python/little_kernel/language/intrin/struct_stub.py:44
↓ 2 callers
Class
ModuleProxy
python/triton_dist/language/extra/utils.py:30
↓ 2 callers
Class
PerfResult
python/triton_dist/test/nvidia/test_llm_ulysess_gemm_all2all_intra_node.py:100
↓ 2 callers
Class
PerfResult
python/triton_dist/test/nvidia/test_llm_ulysess_all2all_gemm_intra_node.py:104
↓ 2 callers
Class
PerfResult
python/triton_dist/test/nvidia/test_llm_ulysess_post_attn_all2all_intra_node.py:103
↓ 2 callers
Class
PerfResult
python/triton_dist/test/nvidia/test_all_to_all_single_gemm.py:57
↓ 2 callers
Class
PerfResult
python/triton_dist/test/nvidia/test_llm_ulysess_pre_attn_all2all_intra_node.py:149
↓ 2 callers
Class
Pointer
Annotate for pointer types (e.g., ptr[uint32]).
python/little_kernel/core/type_system.py:236
↓ 2 callers
Class
ProfilerBuffer
python/triton_dist/tools/profiler/context.py:65
↓ 2 callers
Class
ReturnStmt
Return statement (exits a function). May optionally return a value (for non-void functions).
python/little_kernel/core/stmt.py:225
↓ 2 callers
Class
SpGQAFlashDecodeAttention
python/triton_dist/layers/nvidia/sp_flash_decode_layer.py:44
↓ 2 callers
Class
SpUlysessOAll2AllGemmKernel
python/triton_dist/kernels/nvidia/sp_ulysess_o_all2all_gemm.py:513
↓ 2 callers
Class
SpUlysessQKVGemmAll2AllKernel
python/triton_dist/kernels/nvidia/sp_ulysess_qkv_gemm_all2all.py:545
↓ 2 callers
Class
StringType
python/little_kernel/core/type_system.py:204
↓ 2 callers
Class
SymmRocShmemBuffer
shmem/rocshmem_bind/pyrocshmem/python/pyrocshmem/__init__.py:47
↓ 2 callers
Class
TP_MoE
Tensor Parallel MoE. This MoE uses a common TP strategy: 1. First linear layer (gate/up) weights are column-parallel. 2. Second linea
python/triton_dist/layers/nvidia/tp_moe.py:48
↓ 2 callers
Class
Template
Annotate for template parameter types (e.g., template[uint32]).
python/little_kernel/core/type_system.py:303
↓ 2 callers
Class
TensorType
Tensor type parameterized by its element scalar type (e.g., tensor[int32]).
python/little_kernel/core/type_system.py:360
↓ 2 callers
Class
TmaDescriptorType
TMA (Tensor Memory Accelerator) descriptor type (singleton).
python/little_kernel/core/type_system.py:485
↓ 2 callers
Class
Tracker
this tracker contains multiple tracks to support overlaped tracks
python/triton_dist/tools/profiler/viewer.py:92
↓ 2 callers
Class
TritonDistEpContext
python/triton_dist/function/nvidia/common.py:141
↓ 2 callers
Class
WhileStmt
While-loop statement (condition-based iteration). Executes a block repeatedly while a condition remains true.
python/little_kernel/core/stmt.py:165
↓ 2 callers
Class
_IpcHandle
python/little_kernel/design/test_flashcomm_torchrun.py:91
↓ 1 callers
Class
ASTNodeVisitors
Handles type inference for various AST node types.
python/little_kernel/core/passes/utils/type_inference/type_inference_ast_visitors.py:41
↓ 1 callers
Class
AllGatherContext
tutorials/03a-inter-node-allgather.py:52
↓ 1 callers
Class
AllGatherContext
tutorials/03-inter-node-allgather.py:51
↓ 1 callers
Class
AllGatherGEMMTensorParallelContext
python/triton_dist/kernels/nvidia/allgather_gemm.py:450
↓ 1 callers
Class
AllReduceConfig
python/triton_dist/mega_triton_kernel/tasks/allreduce.py:36
next →
1–100 of 521, ranked by callers