Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/AtomaAI/atoma-infer
/ types & classes
Types & classes
173 in github.com/AtomaAI/atoma-infer
⨍
Functions
613
◇
Types & classes
173
↓ 4 callers
Class
GenerateRequest
backends/vllm/src/types.rs:19
↓ 1 callers
Enum
ModelWorkerError
backends/vllm/src/worker.rs:464
↓ 1 callers
Enum
TokenizerError
backends/vllm/src/tokenizer.rs:209
Class
Alibi
csrc/kernels/alibi.h:17
Class
AllGather
models/src/multi_gpu.rs:59
Class
AllReduce
models/src/multi_gpu.rs:123
Enum
AllocationStatus
backends/vllm/src/block_manager.rs:28
Class
Allreduce
csrc/kernels/utils.h:110
Class
Allreduce<2>
csrc/kernels/utils.h:123
Class
ApiDoc
server/src/server.rs:89
Class
AppState
server/src/server.rs:49
Class
Args
server/src/main.rs:24
Class
Attention
models/src/phi3.rs:113
Class
Attention
models/src/mistral.rs:113
Class
Block
models/src/llama.rs:384
Class
Block
models/src/llama_nccl.rs:212
Class
BlockAllocator
backends/vllm/src/block_allocator.rs:18
Enum
BlockAllocatorError
backends/vllm/src/block_allocator.rs:123
Enum
BlockDevice
backends/vllm/src/block.rs:24
Enum
BlockError
backends/vllm/src/block.rs:288
Class
BlockInfo
csrc/kernels/block_info.h:12
Class
BlockSpaceManager
backends/vllm/src/block_manager.rs:37
Enum
BlockSpaceManagerError
backends/vllm/src/block_manager.rs:1123
Class
Cache
Cache for Llama model
models/src/llama.rs:141
Class
CacheConfig
backends/vllm/src/config.rs:137
Enum
CacheConfigError
backends/vllm/src/config.rs:326
Class
CacheEngine
`CacheEngine` - Manages the KV cache. This class is responsible for initializing and managing the GPU and CPU KV caches. It also provides methods for
backends/vllm/src/worker.rs:486
Enum
CacheEngineError
backends/vllm/src/worker.rs:658
Class
CausalSelfAttention
models/src/llama.rs:203
Class
CausalSelfAttention
models/src/llama_nccl.rs:31
Class
ChatCompletionChunk
server/src/api/chat_completions.rs:1046
Class
ChatCompletionResponse
server/src/api/chat_completions.rs:936
Enum
ChatResponse
server/src/server.rs:171
Class
Choice
server/src/api/chat_completions.rs:947
Class
Config
models/src/llama.rs:85
Interface
Config
`Config` - trait for a LLM model's configuration type
backends/vllm/src/model_executor.rs:116
Enum
ConfigError
backends/vllm/src/model_executor.rs:597
Class
DecodeTokenizerRequest
`DecodeTokenizerRequest` - A request to decode a single token ID into text
backends/vllm/src/tokenizer.rs:25
Class
DecoderLayer
models/src/phi3.rs:311
Class
DecoderLayer
models/src/mistral.rs:314
Class
Delta
server/src/api/chat_completions.rs:1081
Class
Dropout
csrc/kernels/dropout.h:12
Enum
EarlyStopping
backends/vllm/src/sampling_params.rs:24
Class
EncodeTokenizerRequest
Represents a request to encode a string input into tokens.
backends/vllm/src/tokenizer.rs:10
Enum
EngineError
backends/vllm/src/llm_engine.rs:653
Enum
EngineRequest
Represents different types of requests that can be sent to the LLM engine.
backends/vllm/src/llm_service.rs:53
Interface
ErrString
server/src/api/validate_schema.rs:42
Interface
Evictor
backends/vllm/src/evictor.rs:6
Enum
EvictorError
backends/vllm/src/evictor.rs:139
Class
ExecuteModelRequest
backends/vllm/src/sequence.rs:2158
Class
FcfsPolicy
backends/vllm/src/policy.rs:55
Enum
FinishReason
server/src/api/chat_completions.rs:956
Class
FlashAttention
Flash attention It encapsulates the flash attention algorithm for fast attention computation. It is further compatible with the paged attention algor
models/src/flash_attention.rs:175
Class
FlashAttention
Flash-attention v2 layer.
csrc/src/lib.rs:15
Class
FlashAttentionDecodingMetadata
`FlashAttentionDecodingMetadata` - Structure wrapping the metadata required for running flash and paged attention kernels for decoding inference
models/src/flash_attention.rs:11
Class
FlashAttentionKvCache
Flash-attention v2 layer, with Key-Value cache. NOTE: We are not passing in each Key and Value tensor for the decoding phase. This is because we plan
csrc/src/lib.rs:1503
Class
FlashAttentionMetadata
`FlashAttentionMetadata` - Structure wrapping the metadata required for running flash and paged attention kernels
models/src/flash_attention.rs:67
Class
FlashAttentionPrefillMetadata
`FlashAttentionPrefillMetadata` - Structure wrapping the metadata required for running flash and paged attention kernels for prefill inference
models/src/flash_attention.rs:34
Class
FlashAttentionVarLen
Flash-attention v2 layer, with variable sequence lengths.
csrc/src/lib.rs:573
Class
Flash_bwd_kernel_traits
csrc/kernels/kernel_traits.h:186
Class
Flash_bwd_params
csrc/kernels/flash.h:138
Class
Flash_fwd_kernel_traits
csrc/kernels/kernel_traits.h:51
Class
Flash_fwd_params
csrc/kernels/flash.h:46
Class
Flash_kernel_traits
csrc/kernels/kernel_traits.h:16
Class
GenerateParameters
backends/vllm/src/types.rs:32
Class
GenerateRequestOutput
backends/vllm/src/llm_engine.rs:526
Class
GenerateStreamingOutput
backends/vllm/src/llm_engine.rs:621
Class
InferenceOutput
backends/vllm/src/llm_engine.rs:599
Class
LRUEvictor
backends/vllm/src/evictor.rs:62
Class
Llama
models/src/llama.rs:432
Class
Llama
models/src/llama_nccl.rs:266
Class
Llama3RopeConfig
models/src/llama.rs:22
Enum
Llama3RopeType
models/src/llama.rs:13
Class
LlamaConfig
models/src/llama.rs:37
Enum
LlamaEosToks
models/src/llama.rs:31
Class
LlamaModel
Represents a Llama language model. This struct encapsulates the configuration, device, data type, and the actual Llama model.
backends/vllm/src/models/llama.rs:29
Class
LlamaModel
Represents a Llama language model. This struct encapsulates the configuration, device, data type, and the actual Llama model.
backends/vllm/src/models/llama_nccl.rs:30
Class
LlmEngine
`LlmEngine` - An asynchronous worker responsible for scheduling new requests and communicating with the `ModelExecutor` service to send new requests f
backends/vllm/src/llm_engine.rs:36
Class
LlmService
`LlmService` - the entrypoint of the Atoma's inference service. It receives requests from the Atoma's event subscriber service. It validates and token
backends/vllm/src/llm_service.rs:72
Enum
LlmServiceError
backends/vllm/src/llm_service.rs:446
Class
LogProb
backends/vllm/src/sequence.rs:22
Class
LogicalTokenBlock
backends/vllm/src/block.rs:35
Class
Mask
csrc/kernels/mask.h:111
Class
MaxOp
csrc/kernels/utils.h:90
Class
MaxOp<float>
csrc/kernels/utils.h:95
Enum
Message
server/src/api/chat_completions.rs:178
Enum
MessageContent
server/src/api/chat_completions.rs:448
Enum
MessageContentPart
server/src/api/chat_completions.rs:502
Class
MessageContentPartImageUrl
server/src/api/chat_completions.rs:535
Class
MistralConfig
models/src/mistral.rs:12
Class
MistralModel
models/src/mistral.rs:366
Class
Mlp
models/src/llama.rs:354
Class
Mlp
models/src/phi3.rs:278
Class
Mlp
models/src/llama_nccl.rs:184
Class
Mlp
models/src/mistral.rs:282
Class
MockModel
backends/vllm/src/tests/mod.rs:35
Enum
Model
server/src/api/chat_completions.rs:28
Class
ModelConfig
backends/vllm/src/config.rs:17
Interface
ModelExecutor
`ModelExecutor` trait - interface for running AI inference from a LLM
backends/vllm/src/model_executor.rs:144
Enum
ModelExecutorError
backends/vllm/src/model_executor.rs:585
next →
1–100 of 173, ranked by callers