Page 86 sur 192

ToutHaut signalRécent
7679 articles
Reddit r/MachineLearning·

Augmented Equivariant Mesh Networks for Anatomical Mesh Segmentation (ICML 2026 Workshops) [R]

EAMS (Equivariant Anatomical Mesh Segmentor) applique l'équivariance rotationnelle aux réseaux de mailles pour la segmentation anatomique 3D. Le modèle (<2M paramètres) maintient la performance sous perturbations géométriques (rotation 40°) où les méthodes existantes chutent de 25-26 points IoU. Évalué sur 4 tâches cliniques (anévrisme intracrânien, segmentation intra-orale, foie).

PapersVisionRaisonnement
SIG
72
HYP
18
Reddit r/MachineLearning·

[P] I built a system that lets you ask questions about any GitHub repo and get answers grounded in the actual source code [P]

GitRAG permet de poser des questions sur n'importe quel repo GitHub public et obtient des réponses ancrées dans le code source avec chemins de fichiers et numéros de lignes. Le système combine parsing AST, embeddings denses, index BM25, fusion RRF et reranking Cohere avant génération via llama-3.3-70b sur Groq. Supporte 15+ langages.

RAGEmbeddingsGénération de code
SIG
72
HYP
35
arXiv cs.LG·

Overcoming "Physics Shock" in Earth Observation A Heteroscedastic Uncertainty Framework for PINN-based Flood Inference

Un cadre PINN avec incertitude hétéroscédastique pour la cartographie des inondations à partir de données SAR. Le modèle Attention-Gated FNO-UNet intègre un protocole Warm-Start et modélise l'incertitude aléatoire pour éviter la divergence de gradient (« Physics Shock »). Sur Sen1Floods11 : +25% IoU vs baselines déterministes, avec bornes de confiance calibrées.

PapersRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions

Nouvel article arXiv proposant DINOSaur, méthode sans entraînement pour la détection d'anomalies continue en environnement industriel. Combine backbone DINOv3 gelé, mémoire coreset indexée spatialement et scoring d'anomalies restreint. Atteint zéro oubli, surpasse tous les baselines sur 5 protocoles, inférence <100ms sur Jetson Orin Nano avec adaptation on-device <30s.

BenchmarksVision
SIG
72
HYP
25
arXiv cs.LG·

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

Agent-ToM est un framework d'apprentissage pour surveiller les agents LLM autonomes via le raisonnement Theory-of-Mind. Il infère les croyances, intentions et déviations comportementales des agents pour détecter les comportements malveillants cachés. Évalué sur SHADE-Arena et CUA-SHADE-Arena, il surpasse les baselines d'ensemble tout en utilisant un pipeline de vérification à deux appels.

Agents IASécurité IARaisonnement
SIG
72
HYP
28
arXiv cs.LG·

Generative Representation Learning on Hyper-relational Knowledge Graphs via Masked Discrete Diffusion

KREPE, une méthode d'apprentissage génératif pour graphes de connaissances hyper-relationnels, utilise la diffusion discrète masquée pour générer des faits complets à partir de requêtes partiellement observées. Unifie prédiction de liens et génération de faits dans un seul cadre, surpassant les baselines LLM sur les benchmarks standard.

PapersBenchmarksRaisonnement
SIG
72
HYP
28
arXiv cs.LG·

A lift for input-convex neural network training

Nouvelle méthode d'entraînement pour les réseaux de neurones input-convexes (ICNN) via une hypernetwork non-contrainte qui émet les poids inter-couches. Approche inspirée des lifts de problèmes inverses, elle contourne les limitations du gradient descent projeté et de la reparamétrisation softplus. Résultats sur estimation de densités log-concaves et flots normalisants convexes montrent convergence améliorée.

PapersRaisonnementReinforcement learning
SIG
72
HYP
15
arXiv cs.AI·

EvoSci: A Bio-Inspired Multi-Agent Framework for the Evolution of Scientific Discovery

EvoSci est un framework multi-agent bio-inspiré pour la découverte scientifique utilisant des LLM. Il intègre évolution, graphes de connaissances et agents spécialisés (mentor, chercheur, reviewer) pour générer, évaluer et affiner itérativement des idées de recherche. Sur des sujets réels, EvoSci atteint un score peer-review ICLR de 4.90 et classement Top-10 de 54%.

Multi-agentsAgents IARaisonnement
SIG
72
HYP
35
arXiv cs.AI·

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

Article arXiv argumentant que les LLM échouent en raisonnement causal et planification long-horizon faute de modèles du monde. Les auteurs introduisent Latent Dynamics Inference (LDI) et Flux, un environnement de raisonnement séquentiel en langage naturel. Agents RL avec accès à l'espace latent atteignent 79% de taux de victoire vs 11% pour LLM, révélant des défaillances en suivi d'état persistant.

RaisonnementReinforcement learningPapers
SIG
72
HYP
35
arXiv cs.AI·

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

Étude sur la reproductibilité des systèmes IA en finance réglementée (crédit, fraude, blanchiment). Identifie trois sources de non-déterminisme : variance des explications post-hoc (modèles tabulaires), échantillonnage stochastique (graphes), divergence batch-dépendante (LLM agents). Propose framework d'évaluation avec métriques RBO, D_cos, TDI, PSD pour audit.

ÉvaluationsSécurité IARégulation
SIG
72
HYP
15
arXiv cs.CL·

Generating Legal Commentaries from Case Databases via Retrieval, Clustering, and Generation

Pipeline automatisé transformant 4.555 décisions du Tribunal fédéral allemand en commentaires juridiques. Extraction de chunks, résumé du raisonnement, embedding et clustering. LLMs génèrent titres et sections enrichies de citations, fusionnées en commentaires cohérents. Évaluation sur 5 dimensions (pertinence, fidélité des citations, distinction des clusters, ordre logique).

RAGGénération de codeÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

Unveil est un framework d'embedding visual-textuel pour la récupération de documents multi-modaux. Il intègre features textuelles et visuelles via distillation de connaissance, transférant les capacités sémantiques d'un modèle visual-textuel vers un modèle purement visuel. Résultats : amélioration de la précision et de l'efficacité de retrieval sans parsing.

RAGEmbeddingsVision
SIG
72
HYP
25
arXiv cs.CL·

Teaching Through Analogies: A Modular Pipeline for Educational Analogy Generation

Pipeline modulaire pour générer des analogies éducatives en quatre étapes (source, sous-concepts, explication, évaluation). Évaluation de 12 LLMs sur deux datasets annotés (SCAR, ParallelPARC). Les sous-concepts améliorent la qualité des explications et la précision de la récupération. Claude Sonnet 4.6 aligne mieux avec les classements humains qu'avec les scores absolus.

ClaudePapersÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Improving the Completeness and Comparability of Segment Disclosures: A Large Language Model Approach

Un framework basé sur LLM extrait les divulgations de segments des formulaires 10-K pour améliorer la complétude et la comparabilité des données financières. Le système utilise RAG pour intégrer les informations entre plusieurs périodes et entreprises, démontrant son efficacité pour l'analyse longitudinale et l'alignement géographique cross-firm.

RAGBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Omissive Bias in Religious Representation: Benchmarking LLM Answers to Everyday Ethical Decision-making

Étude de l'« omissive bias » : les LLMs omettent systématiquement les perspectives religieuses dans leurs réponses à des questions éthiques quotidiennes. Benchmark AllFaith avec 150 questions (deuil, pardon, relations) évalué sur 27 modèles. Résultat : sous-représentation religieuse asymétrique, plus marquée pour les situations pratiques que pour les questions existentielles.

BenchmarksAlignementSécurité IA
SIG
72
HYP
15
arXiv cs.LG·

ChainzRule: Sample-Efficient, Robust Deep Learning Across Tabular, NLP, and Vision Tasks

ChainzRule remplace les activations standard par des couches polynomiales apprises avec régularisation différentielle (DREG), une pénalité jacobienne calculée analytiquement. Testé sur tabular, NLP et vision : 85,71% sur Pima Diabetes, 46,20% sur SST-5 avec encodeur gelé (5% des données d'entraînement de RNTN), 55,79% sur SST-5 fine-tuné BERT, +2,32% sur CIFAR-10-C. Améliore robustesse et efficacité échantillon.

BenchmarksPapersRaisonnement
SIG
72
HYP
28
arXiv cs.LG·

Optimizing Digital Therapeutic Interventions: Online Learning under Endogenous Adherence

Framework de soutien décisionnel pour thérapies numériques modélisant les effets des recommandations et de l'adhérence des patients via un système dynamique linéaire. Algorithme UCB-BOLD proposé pour la sélection de traitement en ligne avec garanties de regret sublinéaire. Évaluation sur données de micro-essais randomisés : 2-3x moins de regret que les benchmarks.

Reinforcement learningRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

PrivFusion: A Privacy-preserving Multi-Agent Framework for Harmonizing Distributed Datasets

PrivFusion est un framework multi-agent préservant la confidentialité pour harmoniser automatiquement des datasets hétérogènes avant l'entraînement fédéré. Testé sur quatre datasets COVID-19, il utilise des agents pour analyser les données locales, regrouper les features sémantiquement similaires et recommander des transformations itératives sans centraliser les données sensibles.

Multi-agentsAgents IA
SIG
72
HYP
25
arXiv cs.LG·

Riemannian Archetypal Analysis: Interpretable non-linear data analysis on deformed star distributions

Nouvelle approche d'analyse archétypale sur variétés riemanniennes avec géométrie pullback data-driven. Combine interprétabilité de l'analyse archétypale classique et flexibilité des modèles non-linéaires via distributions en étoile déformées. Tests sur MNIST montrent géodésiques significatives et projections de débruitage géométriquement conscientes.

PapersRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Cascade-KDE: Robust Time-Series Restoration under Out-of-Distribution Impulse Corruptions

Cascade-KDE est une méthode sans apprentissage pour restaurer les séries temporelles corrompues par du bruit gaussien et des pics aberrants. Elle estime une densité spatio-temporelle, applique une troncature robuste pour limiter l'influence des anomalies, puis affine via cascade exponentielle. Testée sur ECG et dégradation batterie, elle préserve les pics de dérivée mieux que les filtres classiques.

BenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

Towards Verifiable Transformers: Solver-Checkable Circuit Explanations

Framework Verifiable Transformers convertissant circuits Transformer en propriétés vérifiables par solveur SMT. Extraction de circuits task-localisés et vérification formelle d'équivalence fonctionnelle, nécessité des arêtes, invariance et robustesse. Démonstration sur tâches symboliques et GPT-2 scale avec architecture SMT-représentable (Signed L1 BandNorm, sparsemax, LeakyReLU).

RaisonnementSécurité IAPapers
SIG
72
HYP
18
arXiv cs.AI·

Neuro-Inspired Inverse Learning for Planning and Control

Framework neuro-inspiré pour la planification et le contrôle embodié. L'Inverter utilise l'Inverse Learning (IL) pour générer des séquences d'actions multi-étapes. Améliore les baselines offline-RL et diffusion-planner sur D4RL (+24.2% en moyenne) avec 100-1000x moins de calcul à l'inférence. Application : synthèse de portes quantiques avec fidélité GRAPE en 1000x plus rapide.

RaisonnementReinforcement learningRobotique
SIG
72
HYP
18