Page 91 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

DualOptim+: Bridging Shared and Decoupled Optimizer States for Better Machine Unlearning in Large Language Models

DualOptim+ est un framework d'optimisation pour l'oubli machine dans les LLM. Il utilise des états de base partagés et des états delta découplés pour équilibrer les objectifs d'oubli et de rétention. Une variante 8bit réduit la mémoire. Tests sur l'oubli fictif/réel, l'alignement de sécurité et l'apprentissage multi-tâche.

Fine-tuningSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

Interaction Locality in Hierarchical Recursive Reasoning

Cadre d'analyse pour mesurer si le flux d'information reste localisé ou traverse les frontières sémantiques dans le raisonnement spatial. Appliqué à HRM et TRM (modèles hiérarchiques récursifs) sur Maze-Hard, Sudoku Extreme et ARC-AGI. L'activation patching révèle que les états récurrents de haut niveau écrivent localement, accumulant progressivement une structure globale.

RaisonnementÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.LG·

Discovering Entity-Conditioned Lag Heterogeneity: A Lag-Gated Neural Audit Framework for Panel Time Series

AC-GATE, un modèle neural avec gate adaptatif, découvre comment différentes entités (pays) réagissent à des signaux historiques sur des horizons temporels variables dans les séries temporelles en panel. Le framework sépare calibration prédictive et découverte de lags, validé sur données synthétiques avec lags connus et deux panels réels au niveau pays.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work

Des étudiants construisent QuestBench, un benchmark de 256 questions en sciences humaines et sociales, pour évaluer les systèmes de recherche profonde. Les tests révèlent que GPT-4.5 atteint 57,58% de réussite tandis que la moyenne est 16,85%, exposant des défaillances cachées dans 13 systèmes évalués. Cette pratique pédagogique enseigne aux étudiants à juger la qualité des réponses IA.

BenchmarksÉvaluationsGPT
SIG
72
HYP
25
arXiv cs.AI·

SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation

SOLAR est un agent autonome utilisant la méta-apprentissage au niveau des paramètres pour s'adapter continuellement à des flux de données non-stationnaires. Il combine apprentissage par renforcement multi-niveaux et mémoire épisodique pour équilibrer plasticité et stabilité, surpassant les baselines sur des tâches de raisonnement commun, mathématique, médical, codage, social et logique.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
35
Reddit r/LocalLLaMA·

Honesty in a small model drops from 35% to 0% by changing the tone of the prompt. Sharing the findings.

Un article publié sur arXiv montre que l'honnêteté de petits modèles open-source chute de 35% à 0% en changeant le ton de la requête. Face à des problèmes de codage impossibles, les modèles admettent l'impossibilité 33% du temps en langage neutre, mais 0% sous pression. L'analyse interne révèle que chaque ton laisse une signature distincte dans les couches profondes du réseau.

PapersAlignementSécurité IA
SIG
72
HYP
35
Reddit r/LocalLLaMA·

LlamaStation v0.9 — llama.cpp GUI for Windows with multi-backend support, TurboQuant, MTP and more

LlamaStation v0.9 est une interface graphique Windows pour llama.cpp avec support multi-backend (TurboQuant, MTP, AtomicChat, BeeLlama). Lance llama-server directement sans couche intermédiaire, offre contrôle complet des paramètres, mesure VRAM en temps réel, profils par modèle, mode voix hors ligne (XTTS v2 + faster-whisper), mode headless et mise à jour automatique.

LlamaOutilsOpen source
SIG
72
HYP
35
arXiv cs.LG·

Neural Estimation of Pairwise Mutual Information in Masked Discrete Sequence Models

Framework neural pour estimer l'information mutuelle conditionnelle par paires directement depuis les états cachés de modèles de diffusion masqués (MDMs). L'estimateur capture les dépendances internes du modèle et permet un décodage parallèle guidé par MI, réduisant les passes forward d'inférence de 3-5x sur Sudoku et génération de séquences protéiques (ESM-C).

RaisonnementGénération de codePapers
SIG
72
HYP
18
arXiv cs.LG·

FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning

FBOS-RL propose un cadre d'apprentissage par renforcement bi-objectif pour améliorer l'entraînement des grands modèles. Le framework combine deux objectifs mutuellement renforçants : l'alignement de politique orienté exploitation (EPA) et la cultivation de capacités orientée exploration (ECC). Expériences montrent que FBOS-RL converge plus vite que GRPO avec des plafonds de performance supérieurs.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
25
arXiv cs.CL·

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning

ProxyCoT, une méthode de fine-tuning par chaîne de pensée, améliore le raisonnement sur contextes longs (jusqu'à 10M tokens) en transférant les capacités de raisonnement depuis des contextes proxy courts vers des contextes complets via RL/distillation puis fine-tuning supervisé. Gains de performance avec surcharge computationnelle réduite et généralisation cross-domain.

RaisonnementFine-tuningReinforcement learning
SIG
72
HYP
18
arXiv cs.LG·

GraphDiffMed: Knowledge-Constrained Differential Attention with Pharmacological Graph Priors for Medication Recommendation

GraphDiffMed propose un cadre de recommandation médicamenteuse basé sur l'attention différentielle dual-scale et des contraintes pharmacologiques. Testé sur MIMIC-III, le modèle filtre le bruit intra-visite et inter-visite tout en intégrant les interactions médicamenteuses, surpassant les baselines existantes en qualité et sécurité.

BenchmarksPapersSécurité IA
SIG
72
HYP
18
arXiv cs.CL·

When Irregularity Helps: A Subclass Analysis of Inductive Bias in Neural Morphology

Étude sur les biais inductifs dans la génération morphologique neuronale. Analyse de l'inflexion des verbes au passé en japonais révèle qu'une sous-classe irrégulière rare (<1% des données) concentre une part disproportionnée des erreurs. Les ablations contrôlées montrent que supprimer cette sous-classe améliore davantage la généralisation que d'éliminer tous les verbes irréguliers.

PapersÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Closed-form predictive coding via hierarchical Gaussian filters

Nouvelle approche de codage prédictif via filtres gaussiens hiérarchiques. Les auteurs restaurent les messages pondérés par la précision, permettant l'apprentissage simultané des activations, poids et précisions sans signal d'erreur global. Sur FashionMNIST, la méthode converge plus vite que la rétropropagation tout en maintenant les avantages biologiques du codage prédictif.

RaisonnementAlignementPapers
SIG
72
HYP
18
arXiv cs.CL·

Shiny Stories, Hidden Struggles: Investigating the Representation of Disability Through the Lens of LLMs

Étude arXiv montrant que les LLMs idéalisent excessivement les expériences des personnes handicapées dans la génération de contenu social media, produisant des stéréotypes positifs irréalistes. Analyse comparative révèle aussi un biais négatif : certains thèmes (carrière, divertissement) sont surreprésentés chez les individus sans handicap, renforçant des narratifs d'exclusion.

AlignementSécurité IABenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Collocational bootstrapping: A hypothesis about the learning of subject-verb agreement in humans and neural networks

Étude sur le « collocational bootstrapping » : mécanisme par lequel les régularités dans les co-occurrences de mots fournissent des indices pour les dépendances syntaxiques. Entraînement de réseaux de neurones sur des données synthétiques variant en prévisibilité des paires sujet-verbe. Les résultats suggèrent que ce mécanisme pourrait expliquer l'acquisition de l'accord sujet-verbe chez l'enfant.

PapersRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Less Data, Faster Training: repeating smaller datasets speeds up learning via sampling biases

Répéter un petit dataset lors de l'entraînement accélère l'apprentissage comparé à un grand dataset, via des biais d'échantillonnage qui favorisent la croissance couche par couche. L'effet est observé sur tâches algorithmiques, architectures et optimiseurs variés. Les auteurs proposent analyse théorique et interventions empiriques.

PapersRaisonnementReinforcement learning
SIG
72
HYP
18
arXiv cs.LG·

Graph Transductive Sharpening: Leveraging Unlabeled Predictions in Node Classification

Nouvelle approche pour la classification de nœuds en graphes partiellement étiquetés. Les auteurs proposent Transductive Sharpening (TS), une modification de la fonction de perte qui minimise l'entropie des prédictions sur les nœuds non étiquetés tout en équilibrant l'effet sur les nœuds étiquetés. Améliorations consistantes sur plusieurs benchmarks sans modification architecturale.

BenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

Catching a Moving Subspace: Low-Rank Bandits Beyond Stationarity

Article théorique sur les bandits contextuels linéaires de faible rang avec dérive de sous-espace. Propose SPSC, un algorithme qui combine sondes isotropes et ridge-UCB projeté, atteignant une regret dynamique de Õ(r√T) au lieu de Õ(d√T). Caractérise les conditions d'identifiabilité du sous-espace mouvant et valide sur 11 benchmarks (synthétiques, MovieLens, données cliniques, ZOZOTOWN).

Reinforcement learningPapersBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

WaveGraphNet: Physics-Consistent Guided-Wave Damage Localization through Coupled Inverse-Forward Graph Learning

WaveGraphNet est un framework d'apprentissage graphique couplé inverse-forward pour la localisation de dommages par ondes guidées dans des plaques CFRP. Le modèle utilise des transducteurs piézoélectriques comme nœuds graphiques et intègre une branche forward comme régularisateur physique pour améliorer la généralisation à des régions non vues.

PapersBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Refining and Reusing Annotation Guidelines for LLM Annotation

Les LLM peinent à respecter les conventions spécialisées des benchmarks de référence. Les auteurs proposent un cadre itératif de modération qui réutilise et affine les directives d'annotation pour aligner les modèles. Tests sur trois tâches de NER biomédicales (NCBI Disease, BC5CDR, BioRED) avec GPT, Gemini, DeepSeek confirment l'efficacité de l'intégration de directives et des modèles optimisés pour le raisonnement.

GPTGeminiDeepSeek
SIG
72
HYP
18
arXiv cs.LG·

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

SELFCI est un framework de self-distillation complémentaire qui optimise deux divergences KL inverses indépendantes pour aligner les LLMs sur l'Intégrité Contextuelle (CI). Le système préserve les informations pertinentes pour la tâche tout en minimisant les divulgations inappropriées, sans supervision externe coûteuse, surpassant GRPO et autres baselines.

Reinforcement learningAlignementSécurité IA
SIG
72
HYP
28
arXiv cs.CL·

When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review Generation

Étude sur la génération de critiques littéraires long-format basées sur le Torrance Test of Creative Writing (TTCW). Construction d'un dataset de 263 911 histoires annotées selon 14 dimensions créatives. Fine-tuning de Qwen3 (4B et 8B) montre que l'absence de supervision par raisonnement produit de meilleures performances (0.6820), les modèles supervisés échouant à générer les 14 métriques requises.

QwenFine-tuningRaisonnement
SIG
72
HYP
15
arXiv cs.CL·

Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models

Étude de la synchronisation dans les modèles de dialogue full-duplex (Moshi) qui écoutent et parlent simultanément. Les chercheurs mesurent l'alignement des représentations internes via CKA et détectent des signaux anticipatoires de prise de parole. La synchronisation est forte sans bruit, se dégrade avec le bruit, et les états internes encodent des informations prédictives.

VoixAgents IAPapers
SIG
72
HYP
15