MCPcopy Create free account

hub / github.com/Luce-Org/lucebox-hub / functions

Functions2,878 in github.com/Luce-Org/lucebox-hub

↓ 1 callersFunctionadd_domino_aux_heads
(writer, arch: str, aux_path: Path | None)
server/scripts/convert_dflash_to_gguf.py:258
↓ 1 callersFunctionadd_dspark_aux_heads
(writer, arch: str, aux_path: Path | None)
server/scripts/convert_dflash_to_gguf.py:311
↓ 1 callersFunctionadd_step_tel
server/src/deepseek4/deepseek4_layer_split_adapter.cpp:49
↓ 1 callersFunctionalign_up_size
server/src/qwen35/gguf_target_loader.cpp:123
↓ 1 callersFunctionalign_up_size
server/src/deepseek4/deepseek4_loader.cpp:143
↓ 1 callersFunctionalign_up_size
server/src/gemma4/gemma4_loader.cpp:129
↓ 1 callersFunctionanalyze_cosine_similarity
Measure cosine similarity between h[l] and h[l+1] (Fate §4.2). High similarity validates cross-layer prediction: if cos(h[l], h[l+1]) ≈ 1, th
scripts/train_predictor.py:314
↓ 1 callersFunctionanthropic_json
(req: dict, chat: dict, model: str)
harness/clients/llamacpp_compat_proxy.py:267
↓ 1 callersFunctionanthropic_sse
(obj: dict)
harness/clients/llamacpp_compat_proxy.py:346
↓ 1 callersFunctionanthropic_text
(body: dict[str, Any] | str)
harness/client_test_runner.py:552
↓ 1 callersFunctionapprox_token_count
(text: str)
harness/benchmarks/generation_benchmark.py:54
↓ 1 callersFunctionarch_supports_pflash_compression
server/src/common/backend_factory.cpp:32
↓ 1 callersFunctionarch_supports_remote_draft
server/src/common/backend_factory.cpp:28
↓ 1 callersMethodattach
(self, proc: subprocess.Popen[bytes])
server/scripts/phase_split_dual_gpu.py:88
↓ 1 callersFunctionbackend_device_description
server/src/common/backend_precision.cpp:17
↓ 1 callersFunctionbackend_device_logical_name
server/src/common/backend_precision.cpp:32
↓ 1 callersFunctionbackend_name
server/src/common/backend_precision.cpp:44
↓ 1 callersFunctionbalanced_braces_end
Find the index one past the `}` that matches `text[open] == '{'`. Respects nested {}/[] depth and skips over "..." / '...' / `...` string literals (wi
server/src/server/tool_parser.cpp:200
↓ 1 callersMethodbegin_request
server/src/common/layer_split_backend.h:26
↓ 1 callersFunctionbenchmark_decode
(decoder, prompt_ids, gen_tokens, tokenizer, buffers, prefill_op)
optimizations/megakernel/bench_pp_tg_nvfp4.py:151
↓ 1 callersFunctionbenchmark_hf
(model_name, tokenizer, prompt_ids, args)
optimizations/megakernel/final_bench_nvfp4.py:241
↓ 1 callersFunctionbenchmark_megakernel
(decoder, tokenizer, prompt_ids, args)
optimizations/megakernel/final_bench_nvfp4.py:158
↓ 1 callersFunctionbenchmark_prefill
(decoder, ids_t, prompt_len, buffers, prefill_op, warmup_runs, measure_runs)
optimizations/megakernel/bench_pp_tg_nvfp4.py:138
↓ 1 callersFunctionbf16_bits_to_f32
server/src/qwen35/qwen35_backend.cpp:43
↓ 1 callersFunctionbf16_bits_to_float
server/src/hip_compat/cuda_bf16.h:39
↓ 1 callersFunctionbf16_bits_to_float
server/hip_compat/cuda_bf16.h:63
↓ 1 callersFunctionbf16_bytes_to_f32
(raw: bytes, shape)
server/scripts/quantize_gemma_dflash_q8.py:77
↓ 1 callersFunctionbf16_bytes_to_f32
(raw: bytes, shape: list[int])
server/scripts/quantize_draft_q8.py:106
↓ 1 callersFunctionbf16_to_f16_array
Convert an array of bf16 values to fp16 via f32 intermediate.
server/src/draft/draft_safetensors_loader.cpp:431
↓ 1 callersFunctionbf16_to_f32_array
Convert an array of bf16 values to f32 in place into a destination buffer.
server/src/draft/draft_safetensors_loader.cpp:423
↓ 1 callersFunctionbind_snapshot_tensor
server/src/qwen35/qwen35_target_shard_ipc_daemon.cpp:108
↓ 1 callersFunctionblocks
(content)
optimizations/spark/spark/extract_sessions.py:24
↓ 1 callersMethodbuild
server/test/test_kvflash.cpp:110
↓ 1 callersFunctionbuild_cached_attn_prefn
Build a cached pre-FFN graph for a FULL-ATTENTION layer. With the step-invariant set_rows KV write (kv_write_rows input) and a 256-aligned FA span (kv
server/src/qwen35moe/qwen35moe_pipelined_decode.cpp:112
↓ 1 callersFunctionbuild_cached_batched_cold_graph
server/src/common/moe_expert_compute_ipc.cpp:186
↓ 1 callersFunctionbuild_cached_cold_batched_graph
Cached batched COLD routed graph (CPU backend, no shared expert). Mirror of build_cached_hot_batched_graph for the cold expert stack; used by the mixe
server/src/common/moe_hybrid_ffn_eval.cpp:757
↓ 1 callersFunctionbuild_cached_decode_attn_graph
server/src/deepseek4/deepseek4_graph.cpp:1112
↓ 1 callersFunctionbuild_cached_decode_ffn_graph
server/src/deepseek4/deepseek4_graph.cpp:291
↓ 1 callersFunctionbuild_cached_decode_hc_post_graph
server/src/deepseek4/deepseek4_graph.cpp:1438
↓ 1 callersFunctionbuild_cached_decode_output_graph
server/src/deepseek4/deepseek4_graph.cpp:380
↓ 1 callersFunctionbuild_cached_deltanet_prefn
Build a cached pre-FFN graph for a DeltaNet layer. DeltaNet layers have no kv_start-dependent views — the graph structure is identical across tokens.
server/src/qwen35moe/qwen35moe_pipelined_decode.cpp:47
↓ 1 callersFunctionbuild_causal_mask_f16
server/src/qwen3/qwen3_drafter.cpp:45
↓ 1 callersFunctionbuild_child_cmd
(args, section)
optimizations/megakernel/bench_pp_tg_nvfp4.py:310
↓ 1 callersFunctionbuild_cross_layer_pairs
Build Fate-style cross-layer training pairs: (h[l], experts[l+1]). Records are token-major: layers 0..num_layers-1 per token in sequence. For
scripts/train_predictor.py:285
↓ 1 callersFunctionbuild_deepseek4_moe_hybrid_storage_from_file_with_mmap
server/src/deepseek4/deepseek4_loader.cpp:786
↓ 1 callersFunctionbuild_delta_net_chunked
server/src/delta_net_chunked.cpp:29
↓ 1 callersFunctionbuild_exact_prompt_ids
(tokenizer, target_tokens)
optimizations/megakernel/final_bench_nvfp4.py:52
↓ 1 callersFunctionbuild_exact_prompt_ids
(tokenizer, target_tokens)
optimizations/megakernel/bench_pp_tg_nvfp4.py:50
↓ 1 callersFunctionbuild_gemma4_attn_block
Attention block for a single layer (handles both full and SWA).
server/src/gemma4/gemma4_graph.cpp:147
↓ 1 callersFunctionbuild_gemma4_per_layer_input
server/src/gemma4/gemma4_graph.cpp:417
↓ 1 callersFunctionbuild_haystack
(target_tok, ctx: int, depth_frac: float, filler_text: str | None = None)
server/scripts/laguna_pflash_niah.py:59
↓ 1 callersMethodbuild_hint
server/src/server/tool_hint.cpp:176
↓ 1 callersFunctionbuild_hip_chunk_graph_b
server/src/qwen3/qwen3_graph.cpp:128
↓ 1 callersFunctionbuild_indexer_compressor_step
server/src/deepseek4/deepseek4_graph.cpp:682
↓ 1 callersFunctionbuild_indexer_score
server/src/deepseek4/deepseek4_graph.cpp:729
↓ 1 callersFunctionbuild_laguna_attn_block
Attention block. Handles BOTH full and SWA layers; the only differences are - n_head[il] (per-layer) - rope_freq_base + n_rot (per layer-type) - YaRN
server/src/laguna/laguna_target_graph.cpp:642
↓ 1 callersFunctionbuild_laguna_dense_ffn
server/src/laguna/laguna_target_graph.cpp:378
↓ 1 callersFunctionbuild_laguna_moe_block
MoE block: sigmoid router with score-correction bias, sum-normalize selected weights, scale routed combine by expert_weights_scale (=2.5 for Laguna),
server/src/laguna/laguna_target_graph.cpp:411
↓ 1 callersFunctionbuild_laguna_moe_block_full
Phase 2.1: full MoE dispatch (sigmoid + score-correction bias + sum-norm + scale 2.5 + always-on shared expert). Mirrors llama.cpp's build_moe_ffn for
server/src/laguna/laguna_target_graph.cpp:430
↓ 1 callersFunctionbuild_laguna_moe_block_hybrid
Hybrid MoE block: same router as build_laguna_moe_block_full, but the routed experts are served from the bounded hot stack via a global->local LUT, an
server/src/laguna/laguna_target_graph.cpp:495
↓ 1 callersFunctionbuild_long_prompt
Needle-In-A-Haystack-shaped prompt for the cache test. Uses a coarse `target_tokens * 4.0` sizing — this script only needs a long, determinis
server/scripts/test_full_compress_cache.py:51
↓ 1 callersFunctionbuild_moe_hybrid_storage
server/src/common/moe_hybrid_storage.cpp:203
↓ 1 callersFunctionbuild_moe_routing
server/src/deepseek4/deepseek4_graph.cpp:1674
↓ 1 callersFunctionbuild_net
(model, n_embd, n_expert, dev)
optimizations/spark/spark/train_pregate.py:47
↓ 1 callersFunctionbuild_parser
()
harness/client_test_runner.py:1831
↓ 1 callersFunctionbuild_parser
()
harness/benchmarks/generation_benchmark.py:421
↓ 1 callersFunctionbuild_prefers_bf16_projection
Returns true when this build should keep draft projection weights as BF16. CUDA builds keep BF16 only when built for native BF16 tensor-core support;
server/src/draft/draft_safetensors_loader.cpp:451
↓ 1 callersFunctionbuild_prompt
Build a chat-templated prompt that hits ``target_tokens`` ±20%. Returns (text, n_tokens).
server/scripts/bench_agent.py:277
↓ 1 callersFunctionbuild_residual_combine_graph
server/src/common/moe_hybrid_ffn_eval.cpp:2056
↓ 1 callersFunctionbuild_stall_tool_prefix
server/src/server/http_server.cpp:448
↓ 1 callersFunctionbuild_step_graph
Build a fresh single-token forward graph. We rebuild per step so that `kv_start` updates drive the correct KV cache slot. The graph is cheap to rebuil
server/test/test_generate.cpp:63
↓ 1 callersFunctionbytes_to_np
(raw: bytes, dtype: str, shape: list[int])
server/scripts/convert_dflash_to_gguf.py:204
↓ 1 callersMethodcan_dflash_decode
server/src/common/layer_split_backend.h:36
↓ 1 callersFunctionchat_format_for_arch
server/src/server/chat_template.cpp:47
↓ 1 callersFunctionchat_post
(port: int, payload: dict, timeout=600)
server/scripts/bench_agent_loop.py:59
↓ 1 callersFunctionchat_post
(payload, timeout=120)
server/scripts/quality_ab_simple.py:71
↓ 1 callersFunctionchat_post
(payload: dict)
server/scripts/test_multi_turn_prefix_cache.py:96
↓ 1 callersFunctionchat_post
(payload, timeout=GEN_TIMEOUT)
server/scripts/quality_humaneval_plus.py:90
↓ 1 callersFunctioncheck_lossless
Compare greedy spec-decode (df) against greedy autoregressive (ar). A raw bit-exact compare is too strict on its own: the target sees draft t
server/scripts/profile.py:301
↓ 1 callersFunctionchunk_and_sample
server/src/common/spark_corpus.cpp:97
↓ 1 callersFunctionchunk_s_ff
server/src/qwen3/qwen3_graph.cpp:61
↓ 1 callersFunctionchunks_from_text
(txt, size, min_size)
optimizations/spark/spark/extract_sessions.py:93
↓ 1 callersFunctionclaude_blocks
Claude Code message.content (string or array of typed blocks) -> text.
server/src/common/spark_corpus.cpp:28
↓ 1 callersMethodclose
(self)
server/scripts/laguna_pflash_niah.py:301
↓ 1 callersFunctioncoerce_relaxed_json
Try strict json::parse first; on failure rewrite single- and backtick-quoted strings to double-quoted, wrap bare identifier keys in double quotes, and
server/src/server/tool_parser.cpp:229
↓ 1 callersFunctioncollect_sessions
[(session_file, parser_fn, source_tag), ...] from the enabled sources.
optimizations/spark/spark/extract_sessions.py:101
↓ 1 callersMethodcompress
C++ drafter score+compress via daemon. Returns compressed token ids. Daemon command: compress <bin> <keep_x1000> <drafter_gguf> <drafter_arch
optimizations/pflash/pflash/dflash_client.py:232
↓ 1 callersMethodcompress
(self, drafter_ids: list[int], keep_x1000: int, lookahead: int, chunk: int, pool: int)
server/scripts/laguna_pflash_niah.py:234
↓ 1 callersMethodcompress
(self, counted_ids: Path, *, keep_ratio: float, lookahead: int, chunk_size: int, pool_kernel:
server/scripts/phase_split_dual_gpu.py:154
↓ 1 callersMethodcompute_batch
Batched variant used by prefill. The default keeps implementations simple and lets remote backends override it to amortize IPC overhead.
server/src/common/moe_expert_compute.h:71
↓ 1 callersFunctioncompute_compress_ratios
─── Compute per-layer compression ratios (matches ds4.c logic) ─────────
server/src/deepseek4/deepseek4_loader.cpp:213
↓ 1 callersFunctioncompute_default_tiers
Compute the effort tiers from max_tokens + complex_problem_max_tokens using the spec §3.3 formula. `think_max` and `complex_think_max` are derived in
server/src/server/model_card.cpp:120
↓ 1 callersFunctioncompute_disk_cache_salt
─── Disk-cache identity salt ─────────────────────────────────────────── Compute a 16-byte salt from inputs that affect KV cache validity: model path
server/src/server/http_server.cpp:825
↓ 1 callersFunctioncompute_ds4_hybrid_budget_info
server/src/deepseek4/deepseek4_backend.cpp:237
↓ 1 callersFunctioncompute_mixed_layer_split_plan
server/src/common/layer_split_utils.cpp:46
↓ 1 callersMethodconfirm_full_snap
server/src/server/prefix_cache.cpp:422
↓ 1 callersMethodconfirm_inline_snap
server/src/server/prefix_cache.cpp:295
↓ 1 callersMethodcontinued_interval
Get the continued-interval setting.
server/src/server/disk_prefix_cache.h:157
↓ 1 callersFunctionconvert_bf16_feature_to_storage
server/src/common/dflash_feature_ring.cpp:154
↓ 1 callersFunctionconvert_device_f32_to_feature_type
server/src/common/dflash_feature_ring.cpp:126
← previousnext →1,001–1,100 of 2,878, ranked by callers