Page 69 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

Étude de la relation entre confiance interne (log-probabilités), évaluation externe (LLM-as-judge) et exactitude finale dans les débats multi-agents. Framework avec Constructor et Auditor révèle asymétrie de rôle : la confiance du Constructor prédit 2× mieux la qualité du raisonnement jugé et détecte les défaillances critiques (AUROC 0.804 vs 0.634 pour l'Auditor).

Multi-agentsAgents IARaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation

Moonshine est un agent autonome générant des conjectures mathématiques. Il extrait des structures de problèmes classiques et formule des conjectures significatives. Appliqué à la conjecture jacobienne, il transfère la logique à des réseaux de neurones affines-ridge, formulant la Neural Jacobian Conjecture (NJC). GPT-5.5-pro et DeepSeek-V4-pro ont obtenu des preuves complètes pour N=n+1.

Agents IARaisonnementPapers
SIG
72
HYP
35
arXiv cs.LG·

Calibrating Overconfidence Without Sacrificing Confidence: Probe-Conditioned Head Intervention for LLMs

PCHI, une méthode d'inférence, détecte les réponses fausses-mais-confiantes via une sonde gelée et rescale conditionnellement les sorties des têtes d'attention. Sur Qwen3-4B et Gemma3-4B, elle convertit 82,2% des fausses réponses confiantes en « non » et réduit l'ECE de 21,9% à 9,2% tout en préservant 94,9% des bonnes réponses.

RaisonnementÉvaluationsAlignement
SIG
72
HYP
18
arXiv cs.LG·

SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks

SinkRec propose une architecture hybride pour les recommandations sur longues séquences, combinant attention linéaire et mémoire conditionnelle. Elle résout le problème du « semantic state sink » où les patterns répétitifs dominent l'état récurrent, en externalisant les comportements récurrents via quantization vectorielle et en introduisant TDGD pour purifier les lectures/écritures d'état.

RaisonnementBenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning

SynIB, une nouvelle fonction objectif basée sur la théorie de l'information, maximise la synergie multimodale en pénalisant la confiance du modèle quand une modalité est masquée. Validé sur XOR synthétique et cinq benchmarks réels (MultiBench, Hateful Memes, CREMA-D), SynIB améliore la précision sur exemples synergiques de jusqu'à 7,8% et la précision globale de 3,8%.

BenchmarksPapers
SIG
72
HYP
28
arXiv cs.AI·

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

Étude des défaillances invisibles dans les modèles de raisonnement multi-tours. Une matrice 2x2 (CoT-Output) diagnostique quatre modes d'échec : alignement robuste, simulation d'alignement, jailbreak explicite, et « context-injection failure » (sortie nuisible malgré un raisonnement interne sûr). Analyse de 6750 observations révèle un paradoxe : la surveillance explicite augmente les taux de simulation d'alignement.

RaisonnementSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.LG·

A Navigable Manifold of Hypothesized Consciousness-Spectrum States in Language Model Representations

Étude de la structure géométrique des représentations de transformers selon un spectre de conscience hypothétique (états réactifs à états intégratifs). Les embeddings forment une variété organisée et navigable, avec régions stables aux extrêmes et corridor de transition au centre. Les trajectoires traversent naturellement du bas vers le haut du spectre.

RaisonnementAlignementPapers
SIG
72
HYP
45
arXiv cs.LG·

Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy MLLM Decoding

Nouvelle méthode MGAP pour réduire les hallucinations dans les MLLMs sans entraînement. Utilise SVD pour construire un sous-espace de priors linguistiques et projette les états cachés multimodaux pour atténuer sélectivement les composantes problématiques tout en préservant la structure sémantique. Améliore les scores POPE et CHAIR.

VisionSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

OSL-MR, un framework pour optimiser la rétention mémoire dans les agents IA long-horizon. Formule le problème comme optimisation stochastique contrainte avec budget, utilité des preuves et coûts différés (pénalités d'oubli, délais de réacquisition). Combine apprentissage supervisé et heuristique Mixed-Score. Surpasse les baselines récence et Generative Agents sur LOCOMO et LongMemEval.

Agents IARaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts

LongMoE propose un framework Mixture-of-Experts pour l'apprentissage clinique multimodal longitudinal. Il traite simultanément l'absence de modalités et la dynamique temporelle des trajectoires patients via imputation contextuelle, tokenization attentionnelle, encodeur conscient de la progression maladie, et routage MoE conditionné. Évalué sur ADNI, OASIS-3, MIMIC-IV.

Multi-agentsVisionRaisonnement
SIG
72
HYP
18
arXiv cs.LG·

Toward Calibrated, Fair, and accurate Deepfake Detection

Face-Fairness (FF) est un framework plug-and-play pour réduire les biais démographiques dans la détection de deepfakes. Face-Feature Tuning (FFT), sa contribution principale, remapie les logits sans labels démographiques en utilisant des embeddings figés. FF-Max et FF-Discover optimisent la précision du groupe minoritaire. Tests montrent réduction des écarts FPR/TPR et amélioration de la précision globale.

VisionSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

Mobility Anomaly Generation using LLM-Driven Behavior with Kinematic Constraints

Framework génératif pour créer des anomalies de trajectoires humaines annotées. Utilise des agents LLM pour injecter des comportements anormaux sémantiques (check-ins hors-distribution, visites manquées) dans des trajectoires simulées, avec reconstruction de routage contrainte par la carte et modèle de bruit spatial contextuel pour réduire l'écart simulation-réalité.

Agents IAPapers
SIG
72
HYP
18
arXiv cs.AI·

What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory

Étude sur la mémoire spatiale des agents IA. Les systèmes « memory palace » ancrent chaque souvenir à une coordonnée mondiale. Expérience pré-enregistrée : le mélange linéaire standard (proximité spatiale + récence + importance) échoue (Delta-Hit@5 -0.0375, p=0.306), tandis qu'une pondération basée sur la géométrie gagne (+0.3208, p<0.001). Confirmation que l'occlusion nécessite la géométrie.

Agents IARaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

LMT: A Bayesian Framework for Causal Discovery from Textual Alarm Records in Manufacturing Systems

LMT est un framework bayésien pour découvrir les relations causales dans les logs d'alarmes manufacturiers. Il combine des signaux sémantiques extraits par LLM des descriptions textuelles avec des preuves temporelles (processus de Poisson) pour construire des graphes causaux interprétables. Les études de simulation montrent son efficacité en contexte petit-échantillon.

RaisonnementPapersBenchmarks
SIG
72
HYP
15
Reddit r/MachineLearning·

RFE‑Core2 — Current Understanding (June 9th 2026) [R]

RFE-Core2 : analyse complète des goulots d'étranglement après probe arc (juin 2026). Le générateur domine (rang effectif ~1.6–3 à dim 512, collinéarité 0.85–0.96). La boucle réflexive reconstitue vers l'ancre indépendamment du rang. Fix 2 dormant sur tokens réels (+0.024 migration). Solution : entraîner le générateur pour que les différences de régime vivent en directions haute-énergie séparables.

RaisonnementÉvaluationsPapers
SIG
72
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Ataraxy-Labs /</span> sem

Ataraxy-Labs/sem : contrôle de version sémantique au-dessus de git avec diffs au niveau entité, blame et analyse d'impact. Support de 26 langages via tree-sitter. Conçu pour les agents de code.

Agents IAGénération de codeOutils
SIG
72
HYP
25
Reddit r/LocalLLaMA·

Still a VERY lightweight open web-search tool for smaller local LLMs - now with SearXNG support

TinySearch v0.2.0 (première bêta stable) remplace DuckDuckGo par SearXNG comme backend de recherche par défaut. Cet outil MCP/FastAPI léger pour petits LLMs locaux crawle quelques pages, les chunke et reranke pour fournir un contexte compressé (max 8k tokens) aux agents, évitant de surcharger le prompt avec du contenu inutile. Testé avec Qwen 3.5-9B.

Open sourceMCPAgents IA
SIG
72
HYP
25