Public Calibration

M&A, LBO & Capital Allocation

Kaelum Bench · FMB-FIN-MA-01

This view covers the concrete 60-task suite only. Its provisional 600-point score uses deterministic verification only. It exposes sanitized score, execution, token, and cost aggregates, with no prompts, responses, expected solutions, task IDs, provider generation IDs, keys, rationales, digests, or file paths.

Provisional · Deterministic

M&A, LBO & Capital Allocation · 60-task sub-benchmark

Calibration results

Sanitized lifecycle, coverage, score, token, and cost aggregates for FMB-FIN-MA-01. Results are provisional and specific to the recorded model configuration.

Public Calibration
Sub-benchmark
M&A, LBO & Capital Allocation · FMB-FIN-MA-01
Models
10 calibration runs
Coverage
60 tasks per model
Deterministic
600 deterministic points

Execution detail

Model runs

Provisional deterministic results use deterministic verification only.

Provisional · Configuration-specific calibration · Single runs; no statistical ranking.

xai · high reasoning

grok-4.5 — open run evidence

x-ai/grok-4.5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

91.7%

550.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

70,899

Cost

$0.1814

azure/us-east-2 · max reasoning

claude-sonnet-5 — open run evidence

anthropic/claude-sonnet-5

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

98.3%

590.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

147,009

Cost

$0.7925

moonshotai/int4 · max reasoning

kimi-k3 — open run evidence

moonshotai/kimi-k3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

100.0%

600.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

73,124

Cost

$0.4041

together · xhigh reasoning

glm-5.2 — open run evidence

z-ai/glm-5.2

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

61.7%

370.0 / 600

Valid

59 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

42,762

Cost

$0.0658

morph · max reasoning

minimax-m3 — open run evidence

minimax/minimax-m3

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

56.7%

340.0 / 600

Valid

59 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

51,014

Cost

$0.0413

akashml/fp8 · max reasoning

qwen3.6-35b-a3b — open run evidence

qwen/qwen3.6-35b-a3b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

91.7%

550.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

196,337

Cost

$0.1656

modelrun/fp4 · max reasoning

kimi-k2.6 — open run evidence

moonshotai/kimi-k2.6

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

98.3%

590.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

215,531

Cost

$0.6196

together · high reasoning

nemotron-3-ultra-550b-a55b — open run evidence

nvidia/nemotron-3-ultra-550b-a55b

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

60.0%

360.0 / 600

Valid

58 valid answers

2 invalid JSON responses

Provider

0 provider failures

Tokens

50,034

Cost

$0.0705

alibaba · xhigh reasoning

deepseek-v4-flash — open run evidence

deepseek/deepseek-v4-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

96.7%

580.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

130,557

Cost

$0.0292

google-vertex/global · high reasoning

gemini-3.5-flash — open run evidence

google/gemini-3.5-flash

StatusProvisional · Deterministic
Progress

60 / 60

Deterministic

98.3%

590.0 / 600

Valid

60 valid answers

0 invalid JSON responses

Provider

0 provider failures

Tokens

101,408

Cost

$0.5631