A benchmark for tiny LLMs based on a real world problem: natural language file search (using monkeSearch)
Signal
72
Hype
25
En 3 lignesBenchmark pour petits LLM (<3B paramètres) évaluant la capacité à parser du langage naturel en JSON structuré pour la recherche de fichiers. 9 modèles testés (Gemma-3 270M à DeepSeek R1 Distill 1.5B) sur 80 requêtes couvrant types de fichiers, contexte temporel et spécificité. Résultats : modèles 0.8B–1.5B surpassent les sub-0.5B.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain