Back to feed
arXiv cs.CL·

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

Signal
78
Hype
15
In three linesUnpredictaBench evaluates LLMs' ability to capture true underlying distributions across 448 problems (statistical distributions, stochastic programs, natural scenarios). The KS@N metric uses the Kolmogorov-Smirnov test. No model exceeds 40% at KS@100, revealing a major gap in distributional sampling capability.
Read source
Your take?
BenchmarksEvalsReasoning

Summary generated by Claude — human-verified