Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/anomalyco/opencode-bench
/ functions
Functions
110 in github.com/anomalyco/opencode-bench
⨍
Functions
110
◇
Types & classes
15
↓ 9 callers
Function
testConsistency
( judge: Judge, systemPrompt: string, diffPair: DiffPair, scoreType: "logic-equivalence" | "api-signat
tests/judgeConsistencyMedium.test.ts:74
↓ 7 callers
Function
average
(values: number[])
src/util/math.ts:1
↓ 6 callers
Function
cloneScores
( scores: EvaluationRunExport["scores"], averageShift: number, varianceShift = 0, )
scripts/discord-sample.ts:73
↓ 6 callers
Function
createJudge
(name: JudgeName)
tests/scoreAggregation.test.ts:20
↓ 6 callers
Function
evaluateAndShow
( name: string, systemPrompt: string, reference: string, candidate: string, scoreType: string, )
scripts/show-test-outputs.ts:16
↓ 6 callers
Function
testConsistency
* Run consistency test: evaluate the same diff pair N times and check results.
tests/judgeConsistency.test.ts:81
↓ 4 callers
Function
getZenLanguageModel
(modelId: string)
src/zenModels.ts:111
↓ 4 callers
Function
weightedSum
(entries: { value: number; weight: number }[])
src/util/math.ts:11
↓ 3 callers
Function
calculateMean
(values: number[])
src/util/statistics.ts:8
↓ 3 callers
Function
date
()
src/util/logger.ts:19
↓ 3 callers
Function
format
(...messages: any[])
src/util/logger.ts:7
↓ 3 callers
Function
runCommands
( commands: string[], opts: { logger: Logger.Instance; cwd: string }, )
src/eval.ts:281
↓ 3 callers
Function
testConsistency
( judge: Judge, systemPrompt: string, diffPair: DiffPair, scoreType: "logic-equivalence", runs: numb
tests/judgeConsistencyComplex.test.ts:57
↓ 2 callers
Function
buildBarChartUrl
( data: BarChartData, options?: { width?: number; height?: number; backgroundColor?: string;
src/util/charts.ts:135
↓ 2 callers
Function
fileExists
(path: string)
src/util/fs.ts:4
↓ 2 callers
Function
formatExecution
(execution: Metric.CommandExecution)
src/metrics/checks.ts:115
↓ 2 callers
Function
formatUsage
(usage: { input: number; output: number })
cli.ts:69
↓ 2 callers
Function
getRequestClient
()
src/util/github.ts:7
↓ 2 callers
Function
listNames
()
src/tasks/index.ts:74
↓ 2 callers
Function
parseArgs
(argv: string[])
scripts/determine-job-url.ts:26
↓ 2 callers
Function
sessionKey
(model: string, cwd: string)
src/agents/codex.ts:27
↓ 2 callers
Function
toInputId
(agent: string, model: string)
scripts/sync-workflow-inputs.ts:25
↓ 2 callers
Function
usage
()
scripts/determine-job-url.ts:18
↓ 1 callers
Function
buildAverageChartUrl
( evalName: string, models: ModelSummary[], )
scripts/discord-sample.ts:372
↓ 1 callers
Function
buildDynamicContext
(runs: EvaluationRunExport[])
scripts/analysis.ts:38
↓ 1 callers
Function
buildInputMapping
()
scripts/build-workflow-matrix.ts:42
↓ 1 callers
Function
buildOverallChartUrl
( evalSummaries: EvalSummary[], )
scripts/discord-sample.ts:397
↓ 1 callers
Function
buildPayloads
( evalSummaries: EvalSummary[], analysisLinks: Map<string, string>, )
scripts/discord-sample.ts:463
↓ 1 callers
Function
buildRadarChartUrl
( data: RadarChartData, options?: { width?: number; height?: number; backgroundColor?: string;
src/util/charts.ts:27
↓ 1 callers
Function
calculateStdDev
(values: number[])
src/util/statistics.ts:19
↓ 1 callers
Function
cleanupRepository
( cwd: string, logger: Logger.Instance, )
src/eval.ts:380
↓ 1 callers
Function
cloneRepositoryAtCommit
(repo: string, commitSha: string)
src/eval.ts:372
↓ 1 callers
Function
collectJsonFiles
(root: string)
scripts/merge-benchmark-exports.ts:8
↓ 1 callers
Function
createDiffComparisonPrompt
( diffPair: DiffPair, scoreType: "logic-equivalence", )
tests/judgeConsistencyComplex.test.ts:49
↓ 1 callers
Function
createDiffComparisonPrompt
* Helper to create the user prompt for diff comparison. * Uses the same prompt creation functions as production.
tests/judgeConsistency.test.ts:65
↓ 1 callers
Function
createDiffComparisonPrompt
( diffPair: DiffPair, scoreType: "logic-equivalence" | "api-signature" | "integration-points", )
tests/judgeConsistencyMedium.test.ts:59
↓ 1 callers
Function
createRegistration
( name: string, module: { default?: Definition<TModel>; models?: ReadonlyArray<TModel>;
src/agents/index.ts:59
↓ 1 callers
Function
ensureProviders
()
src/zenModels.ts:51
↓ 1 callers
Function
evaluateWithJudge
( judge: Judge, systemPrompt: string, userPrompt: string, )
tests/judgeCompatibility.test.ts:50
↓ 1 callers
Function
evaluateWithJudge
* High Complexity Judge Consistency Tests * * These tests verify that judges handle very complex scenarios: * - Architectural refactors (class → fu
tests/judgeConsistencyComplex.test.ts:28
↓ 1 callers
Function
evaluateWithJudge
* Evaluate a diff pair directly using the judge's LLM. * This bypasses git operations and uses static diffs for consistency testing.
tests/judgeConsistency.test.ts:40
↓ 1 callers
Function
evaluateWithJudge
* Medium Complexity Judge Consistency Tests * * These tests verify that judges produce consistent scores on more complex scenarios: * - Nested loop
tests/judgeConsistencyMedium.test.ts:38
↓ 1 callers
Function
fetchCommits
( owner: string, repo: string, from: string, to: string, )
src/util/github.ts:55
↓ 1 callers
Function
fetchComparisonDiff
( owner: string, repo: string, from: string, to: string, )
src/util/github.ts:18
↓ 1 callers
Function
fetchJobs
( owner: string, repo: string, runId: number, )
scripts/determine-job-url.ts:49
↓ 1 callers
Function
finalizeChanges
(baselineCommit: string)
src/eval.ts:168
↓ 1 callers
Function
formatExecutionForLog
(execution: Metric.CommandExecution)
src/eval.ts:358
↓ 1 callers
Function
formatScore
(score: Eval.Result["score"])
cli.ts:71
↓ 1 callers
Function
generateAnalysis
(runs: EvaluationRunExport[])
scripts/analysis.ts:98
↓ 1 callers
Function
generateDiff
(baselineCommit: string)
src/eval.ts:224
↓ 1 callers
Function
generatePrompt
( def: z.infer<typeof definitionSchema>, diff: CommitDiff, opts: { logger: Logger.Instance }, )
src/tasks/index.ts:176
↓ 1 callers
Function
getOrCreateThread
(model: string, cwd: string)
src/agents/codex.ts:54
↓ 1 callers
Function
inferEndpoint
(modelId: string)
src/zenModels.ts:89
↓ 1 callers
Function
judgeScore
( criterionName: string, judge: string, context: Metric.Context, opts: { logger: Logger.Instan
src/eval.ts:240
↓ 1 callers
Function
load
()
src/tasks/index.ts:85
↓ 1 callers
Function
loadAnalysisLinks
()
scripts/discord-sample.ts:434
↓ 1 callers
Function
loadDataset
()
scripts/build-workflow-matrix.ts:73
↓ 1 callers
Function
loadExport
()
scripts/discord-sample.ts:256
↓ 1 callers
Function
load_runs
(files: List[Path])
visualize_instability.py:24
↓ 1 callers
Function
logError
(value: unknown, options: Agent.RunOptions)
src/agents/claude-code.ts:37
↓ 1 callers
Function
logJson
(value: unknown, options: Agent.RunOptions)
src/agents/claude-code.ts:23
↓ 1 callers
Function
logTurnItems
(items: ThreadItem[], options: Agent.RunOptions)
src/agents/codex.ts:31
↓ 1 callers
Function
main
()
visualize_instability.py:135
↓ 1 callers
Function
main
()
scripts/build-workflow-matrix.ts:88
↓ 1 callers
Function
main
()
scripts/determine-job-url.ts:97
↓ 1 callers
Function
main
()
scripts/analysis.ts:118
↓ 1 callers
Function
main
()
scripts/discord-sample.ts:599
↓ 1 callers
Function
main
()
scripts/sync-workflow-inputs.ts:34
↓ 1 callers
Function
melt_scores
(runs: List[Dict])
visualize_instability.py:45
↓ 1 callers
Function
normalizeModelId
(modelId: string)
src/zenModels.ts:78
↓ 1 callers
Function
plot_instability
(df: pd.DataFrame, output: Path)
visualize_instability.py:61
↓ 1 callers
Function
resolveContentLink
()
scripts/discord-sample.ts:542
↓ 1 callers
Function
resolveZenApiKey
()
src/zenModels.ts:24
↓ 1 callers
Function
resolveZenBaseUrl
()
src/zenModels.ts:42
↓ 1 callers
Function
runCommand
(command: string, cwd: string)
src/eval.ts:297
↓ 1 callers
Function
runOnce
( agentName: string, modelId: string, taskId: string, opts: { logger: Logger.Instance;
src/eval.ts:41
↓ 1 callers
Function
sendWebhook
( webhookUrl: string, payload: unknown, partIndex: number, totalParts: number, )
scripts/discord-sample.ts:567
↓ 1 callers
Function
serializeError
(error: unknown)
src/agents/claude-code.ts:51
↓ 1 callers
Function
sessionKey
(model: string, cwd: string)
src/agents/claude-code.ts:19
↓ 1 callers
Function
sessionKey
(model: string, cwd: string)
src/agents/opencode.ts:53
↓ 1 callers
Function
toDescription
(agent: string, model: string)
scripts/sync-workflow-inputs.ts:30
↓ 1 callers
Function
toEvalSummaries
(exportData: EvaluationRunExport[])
scripts/discord-sample.ts:267
↓ 1 callers
Function
usage
()
scripts/analysis.ts:110
↓ 1 callers
Function
variance
(avg: number, values: number[])
src/util/math.ts:5
↓ 1 callers
Function
withRetries
( fn: () => Promise<T>, options: { retries: number; timeoutMs: number; logger: Logger.Instance
src/util/retry.ts:3
Function
buildModelRadarChartUrl
* Builds a shareable QuickChart radar chart URL for a model's per-metric scores. * Currently unused in the Discord webhook, but retained for future s
scripts/discord-sample.ts:343
Function
calculateConfidenceInterval
( values: number[], _confidenceLevel: number = 0.95, )
src/util/statistics.ts:33
Function
calculateFleissKappa
(judgeScores: number[][])
src/util/statistics.ts:80
Function
calculateRange
(values: number[])
src/util/statistics.ts:143
Function
cleanup
()
src/agents/opencode.ts:136
Function
computeAverageScore
(model: ModelSummary)
scripts/discord-sample.ts:362
Function
create
(prefix?: string)
src/util/logger.ts:6
Function
createUserPrompt
(context: Metric.Context)
src/metrics/test-coverage.ts:163
Function
createUserPrompt
(context: Metric.Context)
src/metrics/logic-equivalence.ts:210
Function
createUserPrompt
(context: Metric.Context)
src/metrics/api-signature.ts:135
Function
createUserPrompt
(context: Metric.Context)
src/metrics/integration-points.ts:166
Function
createUserPrompt
(context: Metric.Context)
src/metrics/checks.ts:93
Function
formatFallbackSummary
(runs: EvaluationRunExport[])
scripts/analysis.ts:65
Function
generate
(opts: { logger: Logger.Instance })
src/tasks/index.ts:105
Function
get
(taskId: string)
src/tasks/index.ts:57
next →
1–100 of 110, ranked by callers