Public Calibration

Cost of Capital & Financing

Kaelum Bench · FMB-FIN-WACC-01

This view covers the concrete 60-task suite only. Its provisional 600-point score uses deterministic verification only. It exposes sanitized score, execution, token, and cost aggregates, with no prompts, responses, expected solutions, task IDs, provider generation IDs, keys, rationales, digests, or file paths.

Provisional · Deterministic

Cost of Capital & Financing · 60-task sub-benchmark

Calibration results

Sanitized lifecycle, coverage, score, token, and cost aggregates for FMB-FIN-WACC-01. Results are provisional and specific to the recorded model configuration.

Public Calibration
Sub-benchmark
Cost of Capital & Financing · FMB-FIN-WACC-01
Models
10 calibration runs
Coverage
60 tasks per model
Deterministic
600 deterministic points

Execution detail

Model runs

Provisional deterministic results use deterministic verification only.

Provisional · Configuration-specific calibration · Single runs; no statistical ranking.

google-vertex/global · high reasoning

gemini-3.5-flash — open run evidence

google/gemini-3.5-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

81.7%

490.0 / 600

Valid

56 valid answers

4 invalid JSON responses

Provider

0 provider failures

Tokens

153,785

Cost

$0.9374

akashml/fp8 · max reasoning

qwen3.6-35b-a3b — open run evidence

qwen/qwen3.6-35b-a3b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

80.0%

480.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

269,903

Cost

$0.2311

morph · max reasoning

minimax-m3 — open run evidence

minimax/minimax-m3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

23.3%

140.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

63,382

Cost

$0.0519

alibaba · xhigh reasoning

deepseek-v4-flash — open run evidence

deepseek/deepseek-v4-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

85.0%

510.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

284,580

Cost

$0.0691

xai · high reasoning

grok-4.5 — open run evidence

x-ai/grok-4.5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

73.3%

440.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

110,506

Cost

$0.3736

together · xhigh reasoning

glm-5.2 — open run evidence

z-ai/glm-5.2

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

21.7%

130.0 / 600

Valid

59 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

56,178

Cost

$0.0934

together · high reasoning

nemotron-3-ultra-550b-a55b — open run evidence

nvidia/nemotron-3-ultra-550b-a55b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

30.0%

180.0 / 600

Valid

54 valid answers

4 invalid JSON responses

Provider

0 provider failures

Tokens

65,449

Cost

$0.0946

modelrun/fp4 · max reasoning

kimi-k2.6 — open run evidence

moonshotai/kimi-k2.6

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

93.3%

560.0 / 600

Valid

59 valid answers

1 invalid JSON response

Provider

0 provider failures

Tokens

348,721

Cost

$1.04

moonshotai/int4 · max reasoning

kimi-k3 — open run evidence

moonshotai/kimi-k3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

91.7%

550.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

118,817

Cost

$0.9527

azure/us-east-2 · max reasoning

claude-sonnet-5 — open run evidence

anthropic/claude-sonnet-5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

85.0%

510.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

338,143

Cost

$2.55