Page 68 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

Recursive Binding on a Budget: Subspace Carving in Order-p Tensor Memories

OSC (Orthogonal Subspace Carving) résout le dilemme entre Tensor Product Representations (croissance exponentielle) et Vector Symbolic Architectures (compression bruyante). En projetant sur l'espace nul de la base des rôles avant agrégation en tenseur d'ordre-p fixe, OSC découple l'ordre du tenseur de la profondeur structurelle, permettant la liaison récursive profonde avec empreinte mémoire constante.

RaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

CRUMB: Efficient Prior Fitted Network Inference via Distributionally Matched Context Batching

CRUMB est une méthode d'inférence pour les réseaux pré-ajustés (PFN) qui réduit la complexité quadratique de l'attention en sélectionnant un sous-ensemble d'entraînement distribué via minimisation MMD. Testé sur 51 datasets TabArena avec TabPFNv2, TabICLv1, TabICLv2, CRUMB surpasse les stratégies existantes et résiste à la dérive de covariables.

BenchmarksRAGPapers
SIG
72
HYP
18
arXiv cs.AI·

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT est un framework de reinforcement learning pour améliorer le raisonnement spatial des MLLMs. Il génère des états intermédiaires vérifiables et des visualisations via chaînes de raisonnement de transition. Entraîné avec GRPO, SVoT atteint 65% de gain de précision sur des domaines étendus (Pacman, Gather) nécessitant interactions multi-objets.

Reinforcement learningVisionRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

SWARR combine l'attention à fenêtre glissante (SWA) avec l'apprentissage par renforcement pour le raisonnement mathématique. Après conversion supervisée d'un modèle SA préentraîné, l'RL adapte les trajectoires générées au contrainte SWA, réduisant l'écart de performance tout en conservant la complexité linéaire. Expériences sur benchmarks de raisonnement mathématique.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
18
arXiv cs.LG·

OmniLoc: A Geometry-Aware Foundation Model for Anchor-Free UE Localization Across Diverse Indoor Environments

OmniLoc est un modèle de fondation pour la localisation intérieure sans ancre basée sur les mesures sans fil. Il utilise une tokenization unifiée, un Transformer conscient de la géométrie et un module d'estimation de position géométriquement cohérent. Évalué sur des datasets internes et publics, il surpasse les méthodes existantes avec forte généralisation cross-environnement.

PapersBenchmarksRaisonnement
SIG
72
HYP
28
arXiv cs.LG·

Mirror Descent Beyond Euclidean Stability: An Exponential Separation in Initialization Sensitivity

Mirror Descent (MD) avec régularisateurs non-quadratiques montre une sensibilité exponentielle à l'initialisation, contrairement à Gradient Descent. Sur objectifs convexes lisses avec régularisateurs KL, une perturbation ε initiale s'amplifie à min{polylog⁻¹(1/ε), εe^Ω(ηT)} après T itérations. Ajouter une régularisation Bregman vers un point d'ancrage stabilise la dynamique.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
15
arXiv cs.CL·

Compatibility-Aware Dynamic Fine-Tuning for Large Language Models

CADFT (Compatibility-Aware Dynamic Fine-Tuning) étend Dynamic Fine-Tuning en contrôlant la variance au niveau des échantillons. La méthode utilise un signal de compatibilité dérivé des vraisemblances du modèle pour moduler les mises à jour supervisées et supprime les gradients haute-variance des démonstrations incompatibles. Expériences montrent amélioration de la stabilité, généralisation et initialisation RL.

Fine-tuningReinforcement learningPapers
SIG
72
HYP
18
arXiv cs.CL·

LatticeBridge: Rare-Event Sequential Inference for Faithful Structured Sequence Synthesis

LatticeBridge résout la génération de séquences structurées contraintes via inférence d'événements rares. Le système combine un modèle de langage compact, des automates compilés par instance, et un décodeur SMC tordu avec rééchantillonnage. Sur 2 610 tâches (CommonGen, E2E NLG, WikiBio), il améliore la satisfaction exacte des ancres et la couverture moyenne par rapport aux baselines greedy/beam.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker améliore le raisonnement multimodal en fournissant des récompenses au niveau des étapes sans entraîner explicitement un modèle de récompense de processus. La méthode réécrire les traces de raisonnement, applique GRPO avec des récompenses basées sur des rollouts (taux de succès empirique), et améliore Qwen3-VL-8B-Instruct sur quatre benchmarks vidéo (Video-MMMU, MMVU, VideoMathQA, LongVideoBench).

RaisonnementReinforcement learningVision
SIG
72
HYP
25
arXiv cs.CL·

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

Afrispeech Semantics évalue le raisonnement sémantique audio dans les modèles de langage parlé sur cinq tâches : inférence, cohérence, plausibilité, dérive d'accent et retenue d'accent. L'étude révèle des limitations critiques dans l'évaluation du raisonnement audio au-delà de la transcription, notamment face aux variations d'accent et aux changements de domaine.

BenchmarksVoixÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data

Étude arXiv analysant les hallucinations LLM comme conséquence structurelle de trois décisions architecturales : l'auto-attention confond entités via apprentissage de co-occurrence, l'objectif MLE optimise probabilité sans contrainte factuelle, le décodage autorégressif cascade les erreurs sans révision. Les pathologies de données amplifient mais ne causent pas indépendamment ces défaillances.

RaisonnementAlignementPapers
SIG
72
HYP
15
arXiv cs.LG·

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation de facteurs radiaux complètement monotones. Dimension des features = Dm (sketch size m × radial draws D), sans dépendance O(d²). Garanties : non-biais, bornes operator-norm contrôlées par dimensions intrinsèques, stabilité spectrale pour kernel ridge regression.

PapersBenchmarksEmbeddings
SIG
72
HYP
08
arXiv cs.LG·

Loss Landscape Diagnosis for Gradient-Based Gray-Scott System Inversion: Disentangling the Roles of PINN Components

Étude de la géométrie du paysage de perte pour l'inversion de systèmes Gray-Scott via rétropropagation directe à travers la PDE. Sans réseau de neurones, la perte résiduelle est quadratique et lisse ; le réseau neuronal ne peut pas corriger un sous-espace de paramètres mal posé, il complète seulement les données observées. Implications pour la conception des PINNs.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> BerriAI /</span> litellm

litellm est un SDK Python et serveur proxy (AI Gateway) unifiant l'accès à 100+ APIs LLM (OpenAI, Anthropic, Bedrock, Azure, VertexAI, Cohere, HuggingFace, VLLM, NVIDIA NIM) avec suivi des coûts, garde-fous, équilibrage de charge et logging.

InfrastructureOpen sourceOutils
SIG
72
HYP
25
arXiv cs.AI·

ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

ReflectiChain combine LLM et apprentissage par renforcement pour les chaînes d'approvisionnement via un modèle monde (SC-WM) en espace latent 6D avec conservation physique. Sur benchmark Semi-Sim (10 nœuds, risque SIR), amélioration de 33% en cohérence rationnelle, 82.3% d'opérabilité sous chocs adversariaux, comportement anti-fragile (+40.2%).

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring

Étude sur le fine-tuning séquentiel de LLaMA-3.1-8B pour l'évaluation automatique d'essais. Le modèle entraîné progressivement sur les éléments de discours (lead → position → claim → evidence → conclusion) atteint F1=65% (evidence) et 87% (conclusion), surpassant LLaMA-70B. Démontre que l'ordre d'apprentissage aligné à la structure du texte améliore la cohérence.

LlamaFine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Which LoRA? An Empirical Study on the Effectiveness of LoRA Techniques During Multilingual Instruction Tuning

Étude empirique comparant LoRA et 4 variantes sur l'instruction tuning multilingue. Résultats : aucun avantage significatif des variantes complexes vs LoRA basique pour équilibrer transfert cross-lingual et rétention de connaissances. Analyse des embeddings : représentations linguistiques similaires indépendamment de la technique LoRA.

Fine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies

AutoPDE est un agent IA qui résout les équations aux dérivées partielles (EDP) en maintenant explicitement la stratégie numérique comme objet inspectable. L'approche combine analyse d'EDP, sélection de méthodes numériques et calibrage adaptatif. Sur PDE Agent Bench, AutoPDE atteint 54,5% de réussite, surpassant la meilleure baseline de 14,2 points.

Agents IAGénération de codeRaisonnement
SIG
72
HYP
25
arXiv cs.LG·

Uncertainty-aware Multi-fidelity Closure via Conditional Normalizing Flows

Article proposant une approche multi-fidélité basée sur les normalizing flows conditionnels pour améliorer la précision des modèles réduits (ROM). Le framework apprend un mappage probabiliste entre coefficients ROM basse-fidélité et haute-fidélité, avec quantification d'incertitude. Deux stratégies testées sur équations de Navier-Stokes 2D : apprentissage direct et résiduel, ce dernier surpassant le premier.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs

Article arXiv proposant une généralisation des méthodes de décodage contrastif pour gérer les conflits entre contexte externe et priors paramétriques dans les LLM. Introduit le paradigme « conflict-aware » et la méthode Adaptive Regime Routing (ARR) qui route dynamiquement entre régimes selon les signaux de conflit, améliorant la résistance EM de <6% à 16-33% sur TriState-Bench.

RaisonnementRAGÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Hidden Consensus:Preference-Validity Compression in Human Feedback

Étude sur l'agrégation des retours humains en RLHF : réduire les jugements hétérogènes à une seule récompense scalaire masque les désaccords culturels, linguistiques ou normatifs légitimes. Analyse de 321 événements de préférence en Malaisie : 79% des prompts contiennent plusieurs réponses acceptables que l'agrégation par majorité élimine. Propose une approche préservant la pluralité des interprétations valides.

Reinforcement learningAlignementÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

QSplitFL: Capability Aware Deep Q-Learning for Optimal Split Point Selection in Split Federated Learning

QSplitFL propose un framework Deep Q-Network pour sélectionner automatiquement le point de division optimal dans le Split Federated Learning. Utilisant des métriques matérielles légères (CPU, mémoire, batterie, latence réseau) plutôt que les poids du modèle, l'approche avec architecture DQN par comité améliore la convergence sur MNIST, Fashion-MNIST, CIFAR-10/100 avec CNN, ResNet50, MobileNetV4, ConvNeXt.

Reinforcement learningPapersBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

Where You Inject Diversity Matters: A Unified Framework for Diverse Generation

Framework unifié pour caractériser les méthodes de génération diverse au test-time. Les auteurs proposent l'injection de diversité au niveau des spécifications intermédiaires, améliorant la diversité de sortie sur 5 tâches et 4 modèles tout en maintenant la qualité. Analyse des facteurs clés : diversité des sources et transmission vers la sortie finale.

Prompt engineeringRaisonnementGénération de code
SIG
72
HYP
18