Retour au feed
arXiv cs.AI·

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

Signal
78
Hype
25
En 3 lignesPoker Arena évalue sept modèles LLM frontier sur le Texas Hold'em sans limite via une architecture mémoire trois niveaux et neuf axes cognitifs (calibrage des mises, conscience positionnelle, etc.). Claude Opus 4.6 gagne +$15,730 jetons mais classe 5e sur le score moyen des axes, révélant que les classements scalaires masquent la structure réelle des capacités.
Lire la source
Ton avis ?
BenchmarksRaisonnementClaudeÉvaluations

Résumé généré par Claude — vérifié par l'humain