Retour au feed
arXiv cs.AI·

FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

Signal
78
Hype
15
En 3 lignesFALSIFYBENCH évalue le raisonnement inductif de 12 LLMs via des jeux de découverte de règles inspirés de la tâche Wason 2-4-6. Les modèles de raisonnement surpassent les modèles instruction-tuned, mais aucun n'approche la performance optimale. Le succès dépend principalement de la capacité à tester négativement et falsifier les hypothèses.
Lire la source
Ton avis ?
BenchmarksRaisonnementÉvaluations

Résumé généré par Claude — vérifié par l'humain