Retour au feed
arXiv cs.CL·

Benchmarking Knowledge Editing using Logical Rules

Signal
72
Hype
18
En 3 lignesNouvel benchmark pour évaluer les techniques d'édition de connaissances dans les LLM. Les méthodes existantes (ROME, FT) réussissent à insérer des faits directs mais échouent sur les conséquences logiques : écart de performance jusqu'à 24% entre connaissance directe et connaissance déduite.
Lire la source
Ton avis ?
BenchmarksFine-tuningRaisonnement

Résumé généré par Claude — vérifié par l'humain