Agent Skill Evaluation and Evolution: Frameworks and Benchmarks
Étude systématique des frameworks d'évaluation et d'évolution des compétences d'agents IA. Catégorise l'évolution en quatre paradigmes : feedback d'exécution, distillation de trajectoires, compression et apprentissage par renforcement. Analyse six catégories de benchmarks et identifie les lacunes structurelles pour construire des écosystèmes de compétences généralisables et sûrs.