Topic

#Llama

Llama est une famille de grands modèles de langage open-weight développée par Meta AI, utilisable en recherche et en production. Par exemple, Llama 3 peut être exécuté localement ou affiné sur des données personnalisées via Hugging Face Transformers.

40Articles
5Sources
59Signal moyen
arXiv cs.AI·

ARIADNE: Agnostic Routing for Inference-time Adapter DyNamic sElection

ARIADNE est un framework sans entraînement pour sélectionner dynamiquement des adaptateurs au moment de l'inférence. Il représente chaque adaptateur par des centroïdes calculés à partir des embeddings de son ensemble d'entraînement. Testé sur Llama 3.2 1B avec 23 tâches NLP, il récupère 97,44% des performances optimales et atteint 89,7% de précision sur 44 tâches.

Fine-tuningLlamaBenchmarks
SIG
78
HYP
00
arXiv cs.AI·

Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

Audit de mécanismes internes du modèle LLaMA 3.1-8B-Instruct sur 54 prompts moraux utilisant Transluce. Découverte d'un « Situational Anchor Effect » : les représentations domaine-spécifiques dominent indépendamment du contenu éthique. L'éthique reste constante en capacité mais très sensible au cadre interprétatif du prompt. Identification d'un neurone candidat (L16/N3837) stable en température.

LlamaAlignementÉvaluations
SIG
72
HYP
00
Reddit r/LocalLLaMA·

Open sourcing InfiniteKV: a KV cache that files old tokens as 104-byte searchable records in RAM or on disk instead of deleting them. Mistral-7B answered from token 76,747, 2.3x past its trained window. Colab demo

InfiniteKV compresse le KV cache en enregistrements de 104 bytes indexables stockés en RAM ou sur disque, au lieu de supprimer les anciens tokens. Mistral-7B répond correctement à token 76,747 (2.3× sa fenêtre d'entraînement de 32,768). Un million de tokens nécessite ~3 GB au lieu de 122 GB.

Open sourceInfrastructureLlama
SIG
82
HYP
00
arXiv cs.CL·

Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

Les modèles de langage deviennent surconfiants quand on augmente le budget de raisonnement au-delà d'un seuil critique. Ce phénomène, appelé Calibration Drift Under Reasoning (CDUR), est étudié sur Llama-3.1-8B et Llama-3.3-70B. Les auteurs proposent CABStop, une règle d'arrêt calibrée pour arrêter le raisonnement quand la confiance diverge de l'exactitude réelle.

LlamaRaisonnementÉvaluations
SIG
72
HYP
00
arXiv cs.LG·

Dual-Stance Evaluation of Sycophancy: The Structure of Agreement and the Limits of Intervention

Une étude sur le steering d'activation montre que réduire la sycophantie dans Llama-3-8B-Instruct supprime aussi l'accord avec des énoncés factuellement corrects. Les représentations sycophantique et factuelle occupent des sous-espaces distincts mais le vecteur de steering les affecte également, révélant un fossé entre lisibilité et écrivabilité des activations.

LlamaAlignementSécurité IA
SIG
78
HYP
00