Page 92 sur 192

ToutHaut signalRécent
7679 articles
Reddit r/MachineLearning·

OpenAI claims a general-purpose reasoning model found a counterexample to Erdos's unit-distance bound [D]

OpenAI annonce qu'un modèle de raisonnement général a découvert un contre-exemple à la conjecture d'Erdős sur les distances unitaires en géométrie discrète. Le modèle a construit des ensembles de points planaires avec plus de n^{1+δ} distances unitaires, réfutant la borne supérieure conjecturée. La preuve a été vérifiée par un pipeline d'évaluation IA puis révisée par des mathématiciens.

RaisonnementOpenAIPapers
SIG
72
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> lance-format /</span> lance

Lance est un format lakehouse ouvert pour l'IA multimodale. Convertit depuis Parquet en 2 lignes de code avec accès aléatoire 100x plus rapide, indexation vectorielle et versioning. Compatible Pandas, DuckDB, Polars, PyArrow, PyTorch.

Recherche vectorielleEmbeddingsOpen source
SIG
72
HYP
35
arXiv cs.CL·

A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation

MAFIG, un framework multi-agent, utilise plusieurs agents LLM et des évaluateurs spécialisés pour générer des items de compréhension de lecture avec contrôle de difficulté robuste. La méthode construit des séquences de contraintes de features produisant une difficulté monotoniquement croissante, surpassant les approches single-agent existantes.

Multi-agentsAgents IAGénération de code
SIG
72
HYP
18
arXiv cs.CL·

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

Un article de position critique les méthodes d'Uncertainty Quantification (UQ) pour LLMs, arguant qu'elles ne font que du clustering non supervisé. Ces approches quantifient la cohérence interne des générations plutôt que leur exactitude externe, échouant à détecter les « hallucinations confiantes ». L'auteur propose un changement de paradigme vers une UQ ancrée dans la vérité objective.

Sécurité IAAlignementÉvaluations
SIG
72
HYP
25
arXiv cs.CL·

EmbGen: Teaching with Reassembled Corpora

EmbGen est un pipeline de génération de données synthétiques qui décompose un corpus en paires entité-description, les réassemble via similarité d'embeddings, puis génère des paires QA avec sampling par proximité et clusters spécialisés. Sur trois datasets, EmbGen améliore la précision binaire de 12,5% (5M tokens) à 88,9% (20M tokens) sur le dataset le plus hétérogène comparé aux baselines.

Fine-tuningRAGEmbeddings
SIG
72
HYP
18
arXiv cs.CL·

Are Rationales Necessary and Sufficient? Tuning LLMs for Explainable Misinformation Detection

Papier arXiv proposant LONSREX, un pipeline de synthèse de données pour affiner les LLM en détection de désinformation explicable. Les auteurs identifient deux problèmes : les rationales filtrées sur label binaire sont insuffisantes, et les LLM forts produisent des rationales verbeux inutiles. LONSREX introduit une métrique évaluant la nécessité et suffisance de chaque étape de vérification.

LlamaFine-tuningÉvaluations
SIG
72
HYP
25
arXiv cs.AI·

Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency

Learn-by-Wire Guard (LBW-Guard) est une couche de gouvernance autonome qui supervise l'optimiseur AdamW pendant l'entraînement de modèles de langage. Testé sur Qwen2.5-7B avec WikiText-103, LBW-Guard réduit la perplexité finale de 13.21 à 10.74 (−18.7%) et accélère l'entraînement de 1.10×. Sous stress de learning-rate extrême (LR=3e-3), AdamW échoue (perplexité 1885.24) tandis que LBW-Guard reste stable (11.57).

QwenReinforcement learningBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation

MOTAB, une nouvelle méthode de distillation du raisonnement LLM, résout le problème des biais d'exposition dual en surveillant dynamiquement la génération de l'étudiant et en revenant en arrière quand elle s'écarte d'une limite de sécurité adaptative. Testé sur LIMO-v2 et AceReason, MOTAB améliore les performances de ~3% en atténuant les biais d'exposition classiques et inverses.

RaisonnementFine-tuningPapers
SIG
72
HYP
25
arXiv cs.LG·

VCR: Learning Valid Contextual Representation for Incomplete Wearable Signals

VCR est un framework auto-supervisé pour l'apprentissage de représentations robustes à partir de capteurs portables incomplets. Il utilise un tokenizer orthogonal pour séparer les sémantiques partagées des résidus spécifiques à chaque modalité, et un backbone mixture-of-experts conscient des absences. VCR améliore les performances en santé numérique même avec modalités manquantes simples ou multiples.

PapersEmbeddingsReinforcement learning
SIG
72
HYP
18
arXiv cs.LG·

Multi-Pedestrian Safety Warning at Urban Intersections Use Case of Digital Twin

Système d'alerte de sécurité pour piétons aux carrefours urbains utilisant un jumeau numérique couplé à des capteurs (caméra, UWB) et modélisation prédictive de trajectoires. Déployé sur le testbed COSMOS à New York, le système génère des alertes en temps réel via edge-cloud computing et réduit significativement les temps de réaction des usagers vulnérables.

VisionInfrastructureSécurité IA
SIG
72
HYP
28
arXiv cs.AI·

Discoverable Agent Knowledge -- A Formal Framework for Agentic KG Affordances (Extended Version)

Framework formel pour décrire les capacités des graphes de connaissances vis-à-vis des agents. Étend les standards VoID/DCAT avec l'Agentic Affordance Profile (AAP) pour spécifier ce qu'un agent peut prouver, les hypothèses de fermeture et l'alignement vocabulaire. Identifie les divergences entre schéma et régime d'inférence comme source d'échecs épistémiques.

Agents IARAGPapers
SIG
72
HYP
15
arXiv cs.AI·

Progressive Autonomy as Preference Learning: A Formalization of Trust Calibration for Agentic Tool Use

Formalisation de l'étalonnage de la confiance pour les agents autonomes via apprentissage de préférences. Un gateway utilise un processus gaussien pour modéliser la tolérance au risque humain à partir de retours binaires (approuver/refuser), et escalade les décisions incertaines à l'humain. Approche structurée comme optimisation bayésienne préférentielle.

Agents IARaisonnementSécurité IA
SIG
72
HYP
18
arXiv cs.AI·

Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses

Étude arXiv évaluant l'intégration des LLM dans la recherche par sondage sur la préparation aux catastrophes. Framework à 5 étapes testé sur 946 résidents de Floride (ouragan Milton 2024). Le modèle A-TLM proposé surpasse les méthodes classiques d'imputation (RMSE 1.439 vs 1.496) en conditions MNAR avec structure théorique PMT.

RAGRaisonnementÉvaluations
SIG
72
HYP
25
arXiv cs.LG·

From Cumulative Constraints to Adaptive Runtime Safety Control for Nonstationary Reinforcement Learning

CPSS (Constraint Projection Safety Shield) convertit les budgets de sécurité cumulatifs en seuils de contrôle adaptatifs au niveau des états pour l'apprentissage par renforcement non-stationnaire. Le mécanisme ajuste dynamiquement les contraintes de risque selon le contexte, garantit la satisfaction des seuils par état et réduit les violations de sécurité dans des scénarios de fusion autoroutière.

Reinforcement learningSécurité IARaisonnement
SIG
72
HYP
18
arXiv cs.CL·

IMLJD: A Computational Dataset for Indian Matrimonial Litigation Analysis

IMLJD est un dataset de 3,613 jugements indiens couvrant les litiges matrimoniaux (IPC 498A, loi sur la protection des femmes contre la violence domestique, CrPC 482). Données de la Cour suprême (2000-2024, 1,474 cas) et de la Haute Cour du Karnataka (2018-2024, 2,139 cas). Taux d'annulation : 57,6% à la Cour suprême vs 39,7% au Karnataka. Dataset, code et graphe de connaissances publiés en open source.

BenchmarksPapersOpen source
SIG
72
HYP
15
arXiv cs.AI·

Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts

ReElicit est un framework d'optimisation bayésienne pour tuner les system prompts avec feedback agrégé uniquement. Un LLM élicite dynamiquement un espace de features compact et interprétable, puis un processus Gaussien sélectionne des vecteurs cibles optimisés en prompts déployables. Sur 10 tâches avec budget de 30 évaluations, ReElicit surpasse les baselines d'optimisation de prompts.

Prompt engineeringRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

KAN-MLP-Mixer: A comprehensive investigation of the usage of Kolmogorov-Arnold Networks (KANs) for improving IMU-based Human Activity Recognition

Étude comparative de Kolmogorov-Arnold Networks (KANs) vs MLPs pour la reconnaissance d'activité humaine (HAR) basée sur IMU. Les KANs excellent sur données propres mais échouent sur données bruitées réelles. L'architecture hybride KAN-MLP proposée atteint +5,33% de F1-score macro sur 8 datasets publics, surpassant les baselines pures.

BenchmarksPapers
SIG
72
HYP
25
arXiv cs.LG·

An Integrated Forecasting Prototype for Emergency Department Boarding Time to Support Proactive Operational Decision Making

Prototype de prévision du temps d'attente aux urgences utilisant des modèles de séries temporelles (DLinear, NLinear) sur données hospitalières réelles. Intègre météo, jours fériés et événements locaux. Horizons de prévision : 6, 8, 10, 12 et 24 heures. Application MLOps développée pour déploiement opérationnel.

BenchmarksInfrastructureOutils
SIG
72
HYP
15
arXiv cs.AI·

Conflict-Resilient Multi-Agent Reasoning via Signed Graph Modeling

SIGMA est un framework multi-agent basé sur graphes signés qui modélise explicitement les relations de confiance, conflit et neutralité entre agents LLM. Via passage de messages conscient des conflits et agrégation pondérée, il supprime les signaux contradictoires et renforce les agents fiables. Tests sur 6 benchmarks montrent des gains de précision et résilience aux conflits.

Multi-agentsRaisonnementAgents IA
SIG
72
HYP
28