Vals-Smith

/ apache / spark

PUBLIC

Updated 7/20/2026

Apache Spark - A unified analytics engine for large-scale data processing

29 Branches 49128 Commits 3522 Contributors 58 Tasks

Key Takeaways

Cost / Test vs. Accuracy

Grok 4.5 resolves 47 tasks for $0.71 per test, while GPT-5.6 Sol resolves 49 for $2.46.

Latency vs. Accuracy

Grok 4.5 reaches 47 of 58 tasks in 227 seconds, compared with 49 tasks in 588 seconds for GPT-5.6 Sol.

Average token use / test

Input
Output
Reasoning
Cache read
Cache write
Claude Sonnet 5
11.2M
Claude Opus 4.7
6.7M
Claude Opus 4.8
4.8M
GLM 5.2 (Fireworks)
4.0M
Claude Fable 5
3.8M
Kimi K3
3.1M
Gemini 3.5 Flash
2.8M
GPT-5.6 Luna
2.8M
Claude Haiku 4.5 (Thinking)
2.3M
GPT-5.6 Sol
2.2M
GPT 5.5
2.0M
Muse Spark 1.1
1.6M
Grok 4.5
999K
Gemini 3.1 Pro Preview (02/26)
913K
GPT-5.6 Terra
805K

Tasks with failures

PassedFailed
Model12226c41cd649d1db5e68217fb4e2274217233b158308de00384d5e8475a771484342a50932d264876d2653eb496b240386db4ab9715a4377dc70c188359ec9d760a9a3bb3f7a8265e3af739ddb22a865babd0eec07d9bec1fb0aac76b9e2c9c45a6cd3b583d8b8f39ea9d6a7ec7173ced150f9f2f6bde
GPT-5.6 Sol
Claude Opus 4.8
Claude Fable 5
Grok 4.5
GLM 5.2
Kimi K3
Claude Sonnet 5
Claude Opus 4.7
GPT-5.6 Luna
Muse Spark 1.1
GPT-5.6 Terra
Gemini 3.5 Flash
GPT 5.5
Claude Haiku 4.5 (Thinking)
Gemini 3.1 Pro Preview (02/26)

Head-to-head

VS

Accuracy

84.48%Δ 1.72%

82.76%

Cost / test

$2.46Δ $2.09

$4.55

Latency

588sΔ 450s

1038s

Cost distribution

$0.00$8.75$17.50

Latency distribution

0s1721s3442s

Input token distribution

010.8M21.6M

Output token distribution

097.9K195.7K

Task outcomes

58 tasks

Both
A only
B only
Neither