Retour au feed
arXiv cs.AI·

Evaluation of LLMs for Mathematical Formalization in Lean

Signal
78
Hype
15
En 3 lignesComparaison de LLMs pour la génération de preuves formelles en Lean 4. Gemini 3.1 Pro et Claude Opus 4.7 obtiennent les meilleures performances (92% et 86% de succès respectivement via refine@32). NVIDIA Nemotron 3 Super et GPT-OSS 120B offrent le meilleur rapport coût-efficacité (<0,01$ par preuve correcte).
Lire la source
Ton avis ?
BenchmarksClaudeGeminiRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain