Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/UCSB-AI/Soft-Thinking
/ endpoints
Endpoints
79 in github.com/UCSB-AI/Soft-Thinking
⨍
Functions
6,405
◇
Types & classes
1,237
↳
Endpoints
79
Route
_mul_attn_scale
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/models/llama4.py:None
Route
available_models
app.get("/v1/models", response_class=ORJSONResponse)
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
cancel_batches
app.post("/v1/batches/{batch_id}/cancel")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
clamp_position
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/model_executor/forward_batch_info.py:None
Route
classify_request
app.api_route("/classify", methods=["POST", "PUT"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
close_session
app.api_route("/close_session", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
configure_logging
app.api_route("/configure_logging", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
copy_two_array
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/mem_cache/memory_pool.py:None
Route
custom_routing_function
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/models/llama4.py:None
Route
delete_file
app.delete("/v1/files/{file_id}")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
dump_expert_distribution_record_async
app.api_route("/dump_expert_distribution_record", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
encode_request
app.api_route("/encode", methods=["POST", "PUT"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
flush_cache
app.api_route("/flush_cache", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
flush_cache
app.post("/flush_cache")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
generate
app.route("/generate", methods=["POST"])
sglang_soft_thinking_pkg/examples/runtime/engine/custom_server.py:None
Route
generate_from_file_request
app.api_route("/generate_from_file", methods=["POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
generate_request
app.api_route("/generate", methods=["POST", "PUT"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
generate_stream
app.route("/generate_stream", methods=["POST"])
sglang_soft_thinking_pkg/examples/runtime/engine/custom_server.py:None
Route
generate_text
app.post("/generate")
sglang_soft_thinking_pkg/examples/runtime/engine/fastapi_engine_inference.py:None
Route
get_last_loc
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/managers/schedule_batch.py:None
Route
get_model_info
app.get("/get_model_info")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
get_model_info
app.get("/get_model_info")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
get_models
app.get("/v1/models")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
get_server_info
app.get("/get_server_info")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
get_server_info
app.get("/get_server_info")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
get_weights_by_name
app.api_route("/get_weights_by_name", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
grouped_topk
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/layers/moe/topk.py:None
Route
handle_completion_request
app.post("/v1/chat/completions")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
handle_generate_request
app.post("/generate")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
health
app.get("/health")
sglang_soft_thinking_pkg/python/sglang/srt/utils.py:None
Route
health
app.get("/health")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
health_check
app.get("/health")
sglang_soft_thinking_pkg/python/sglang/srt/disaggregation/mini_lb.py:None
Route
health_generate
app.get("/health_generate")
sglang_soft_thinking_pkg/python/sglang/srt/utils.py:None
Route
health_generate
app.get("/health_generate")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
init_weights_update_group
app.post("/init_weights_update_group")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
layer_norm_func
torch.compile(backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/models/commandr.py:None
Route
open_session
app.api_route("/open_session", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
openai_v1_batches
app.post("/v1/batches")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
openai_v1_chat_completions
app.post("/v1/chat/completions")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
openai_v1_completions
app.post("/v1/completions")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
openai_v1_embeddings
app.post("/v1/embeddings", response_class=ORJSONResponse)
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
openai_v1_files
app.post("/v1/files")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
parse_function_call_request
app.post("/parse_function_call")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
release_memory_occupation
app.api_route("/release_memory_occupation", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
resolve_future_token_ids
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/managers/tp_worker_overlap_thread.py:None
Route
resolve_future_topk_info
torch.compile(dynamic=True, backend=get_compiler_backend())
sglang_soft_thinking_pkg/python/sglang/srt/managers/tp_worker_overlap_thread.py:None
Route
resume_memory_occupation
app.api_route("/resume_memory_occupation", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
retrieve_batch
app.get("/v1/batches/{batch_id}")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
retrieve_file
app.get("/v1/files/{file_id}")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
retrieve_file_content
app.get("/v1/files/{file_id}/content")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
sagemaker_chat_completions
app.post("/invocations")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
sagemaker_health
app.get("/ping")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
separate_reasoning_request
app.post("/separate_reasoning")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
set_internal_state
app.api_route("/set_internal_state", methods=["POST", "PUT"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
start_expert_distribution_record_async
app.api_route("/start_expert_distribution_record", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
start_profile_async
app.api_route("/start_profile", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
stop_expert_distribution_record_async
app.api_route("/stop_expert_distribution_record", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
stop_profile_async
app.api_route("/stop_profile", methods=["GET", "POST"])
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
test_bmm_fp8
pytest.mark.parametrize("input_dtype", [torch.float8_e4m3fn, torch.float8_e5m2])
sglang_soft_thinking_pkg/sgl-kernel/tests/test_bmm_fp8.py:None
Route
test_init_new_standard_case
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_dp_rank
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_invalid_ipv6_address
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_ipv4_address
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_ipv6_address
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_malformed_ipv4_address
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_malformed_ipv4_address_invalid_port
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_malformed_ipv6_address_invalid_port
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_malformed_ipv6_address_missing_bracket
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_malformed_ipv6_address_missing_port
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_malformed_ipv6_address_wrong_separator
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_init_new_with_single_node_dp_attention
patch("sglang.srt.server_args.is_port_available")
sglang_soft_thinking_pkg/test/srt/test_server_args.py:None
Route
test_merge_attn_states
pytest.mark.parametrize("output_dtype", DTYPES)
sglang_soft_thinking_pkg/sgl-kernel/tests/test_merge_state_v2.py:None
Route
test_nvfp4_gemm
pytest.mark.skipif( skip_condition, reason="Nvfp4 Requires compute capability of 10 or above." )
sglang_soft_thinking_pkg/sgl-kernel/tests/test_fp4_gemm.py:None
Route
test_quantize_to_fp4
pytest.mark.skipif( skip_condition, reason="Nvfp4 Requires compute capability of 10 or above." )
sglang_soft_thinking_pkg/sgl-kernel/tests/test_fp4_quantize.py:None
Route
test_quantize_to_fp4_padded
pytest.mark.skipif( skip_condition, reason="Nvfp4 Requires compute capability of 10 or above." )
sglang_soft_thinking_pkg/sgl-kernel/tests/test_fp4_quantize.py:None
Route
update_weights_from_disk
app.post("/update_weights_from_disk")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
update_weights_from_distributed
app.post("/update_weights_from_distributed")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
update_weights_from_tensor
app.post("/update_weights_from_tensor")
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None
Route
vertex_generate
app.post(os.environ.get("AIP_PREDICT_ROUTE", "/vertex_generate"))
sglang_soft_thinking_pkg/python/sglang/srt/entrypoints/http_server.py:None