Page 63 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

EnvShip-Bench: An Environment-Enhanced Benchmark for Short-Term Vessel Trajectory Prediction

EnvShip-Bench est un benchmark unifié pour la prédiction de trajectoires de navires à court terme, construit à partir de données AIS brutes du Danish Maritime Authority et de la NOAA. Le benchmark standardise le protocole (10 min observation, 10 min prédiction, échantillonnage 20s) et fournit des annotations contextuelles environnementales et de navires proches pour soutenir la modélisation consciente du contexte.

Benchmarks
SIG
72
HYP
18
arXiv cs.LG·

Towards a Unified Generative Model for Scarce Time Series with Domain Experts

TimeMoDE, un framework combinant Diffusion Transformers et Mixture-of-Experts, génère des séries temporelles réalistes en contexte de données scarces. Pré-entraîné sur des datasets multi-domaines, il utilise des Domain Prompts pour adapter l'assignation d'experts et intègre des signaux de diffusion pour calibrer le débruitage. Surpasse les méthodes existantes en few-shot generation.

SIG
72
HYP
28
arXiv cs.LG·

High-Dimensional Random Projection for Activation Steering in Language Models

HiDRA, une méthode d'activation steering sans entraînement, utilise la projection aléatoire haute-dimensionnelle pour améliorer le contrôle comportemental des LLM. Elle dépasse les approches linéaires basées sur les différences de moyennes en capturant des signaux discriminatifs dans les sous-espaces non-linéaires, avec gains constants sur plusieurs familles de modèles.

RaisonnementAlignement
SIG
72
HYP
18
arXiv cs.LG·

Phase-Localized Curation Does Not Help: A Negative Result on Per-Phase Metric Selection for Demonstration Filtering

Étude négative sur la sélection de métriques par phase pour filtrer les démonstrations en robotique. Sur trois tâches LIBERO de pick-and-place, la curation par phase ne surpasse jamais les métriques globales (Task 1: 86.0 vs 92.0). Le signal de défaut dilué par agrégation entre phases nuit à la sélection. Les auteurs recommandent une métrique unique globale plutôt qu'une décomposition par phase.

RobotiqueReinforcement learningBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

Unlocking Latent Dimensions: Exploring Representations of Large-Scale X-ray Scattering Data using Variational Autoencoders

Variational Autoencoder (C-VAE) entraîné sur 1,5 million d'images de diffusion de rayons X pour apprendre des représentations latentes de faible dimension. Le modèle révèle des clusters organisés et génère des images synthétiques contrôlées. Déployé sans réentraînement sur deux installations de synchrotron, il surpasse DINOv3 en interprétabilité. Intégré dans Latent Space Explorer (MLExchange).

VisionBenchmarksOutils
SIG
72
HYP
18
arXiv cs.LG·

Benchmarking Instance-Dependent Label Noise with Controlled Corruptions

CILN est un framework de benchmark pour le bruit de label dépendant de l'instance (IDN). Il génère du bruit via corruptions d'entrée contrôlées plutôt que par annotateurs imparfaits. 90 configurations testées sur CIFAR-10, MNIST et Adult montrent que la structure du bruit, pas seulement son taux, affecte la difficulté et expose des failles dans Co-Teaching et DivideMix.

BenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

QoS-Aware Token Scheduling and Private Data Valuation for Multi-Modal Agentic Networks

Système d'allocation équitable de tokens pour réseaux d'agents décentralisés. Approche combinant représentations multi-modales, prototypes différentiellement privés et schéma de récompense robuste à l'hétérogénéité des données. Simulations montrent amélioration de l'équité et de la QoS, avec résistance renforcée aux attaques de reconstruction d'images.

Agents IAMulti-agentsVision
SIG
72
HYP
18
arXiv cs.AI·

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

ARVRE combine apprentissage par renforcement hors-ligne, RAG agentic et LLM pour générer des problèmes de physique complexes et solvables. La première étape construit des chaînes d'équations valides via temporal-difference learning ; la seconde convertit ces chaînes en questions naturelles. Évaluations humaines et automatiques montrent une supériorité en complexité, nouveauté et solvabilité.

Agents IARAGReinforcement learning
SIG
72
HYP
25
arXiv cs.AI·

VGPT-RSI for RH-Adjacent Formal Progress: Boundary Certificates, Verified Finite Lagarias Inequalities, and Explicit Failure Localization

Système VGPT-RSI appliqué à deux tâches de certification adjacentes à l'hypothèse de Riemann : construction de certificats de frontière RH vérifiés formellement en Coq, et initiation d'une route Lagarias formalisée. Identifie explicitement les obstacles mathématiques non résolus (équivalence Lagarias, théorème de queue global, réduction aux entiers extrémaux).

RaisonnementPapersBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

When Cognitive Graphs Meet LLMs: BDEI Cognitive Pathways for Panic Emotional Arousal Prediction

PanicCognitivePath (PCP) prédit le timing de l'arousal émotionnel panique en fusionnant théorie de l'appraisal et modèles cognitifs BDI. Un nœud Émotion explicite et une distance psychologique (PSD) mappent quatre domaines de signaux en métrique de risque unifiée. L'LLM est limité à l'estimation de paramètres pour éviter les hallucinations. Sur Hurricane Sandy : +10.68% précision timing, erreur pic réduite à 7.07%.

RaisonnementAgents IABenchmarks
SIG
72
HYP
25
arXiv cs.CL·

AmchiBias: Measuring Stereotypical Bias in Goan Identity Groups with a Minimal Pair Dataset in English and Konkani

AmchiBias est un benchmark mesurant les biais stéréotypés socio-culturels pour l'État du Goa (Inde) en anglais et konkani dévanagari. 313 paires minimales couvrent 8 dimensions démographiques. Évaluation de 5 modèles multilingues révèle des scores proches du hasard en konkani et des biais plus élevés pour les groupes pan-indiens que locaux.

BenchmarksÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.LG·

Temporal Difference Learning for Diffusion Models

Nouvelle approche d'entraînement pour modèles de diffusion utilisant la différence temporelle (TD) pour enforcer la cohérence multi-étapes le long de la trajectoire de débruitage. Reformulation du processus de diffusion comme processus de récompense Markov et problème d'évaluation de politique en RL. Amélioration significative du FID, particulièrement avec peu d'étapes d'échantillonnage.

Reinforcement learningRaisonnement
SIG
72
HYP
18
Reddit r/LocalLLaMA·

HalBench: 29 OSS models tested on a custom built Sycophancy and Hallucination Benchmark, Qwen 3.6 and Gemma 4 scoring far above their weight! (While Meta keeps proving they forgot how to spend their money...)

HalBench v2.3 évalue 29 modèles open-source sur la sycophantie et hallucinations via 3,076 questions avec fausses prémisses. Qwen 3.6 (~27B) atteint 36.6% de rejet, surpassant tous les modèles open plus grands, GPT-5.4 et Gemini 3.1 Pro. Seuls Sonnet 4.6 et Grok dépassent 50%. Phi-4 obtient 2.3%.

BenchmarksOpen sourceÉvaluations
SIG
72
HYP
35
Reddit r/LocalLLaMA·

We trained a cybersecurity-focused Mythos like LLM open weights on HuggingFace

OpenMythos, un LLM open-source spécialisé en cybersécurité, entraîné via SFT puis RLVR (reward learning avec vérification). Données : 1,84K papers ArXiv cs.CR + dataset CVE structuré. Le modèle réduit les hallucinations sur les vulnérabilités et améliore la calibration d'incertitude. Démo, modèle et datasets disponibles sur HuggingFace.

Open sourceFine-tuningReinforcement learning
SIG
72
HYP
28
Reddit r/MachineLearning·

Open weights are not enough: we need open training frameworks for research and better algorithms [P]

FeynRL, un framework open-source pour le post-training RL des LLMs et agents, vise à rendre la formation transparente et modifiable. L'auteur argue que les poids ouverts ne suffisent pas : il faut des codebases d'entraînement explicites séparant algorithmes et systèmes. Le framework supporte SFT, DPO, multi-GPU et clusters.

Open sourceReinforcement learningGénération de code
SIG
72
HYP
28
Reddit r/MachineLearning·

I implemented 10 core ML algorithms from scratch with NumPy. Here's what no tutorial taught me [P]

Implémentation de 10 algorithmes ML classiques (régression, KNN, arbres de décision, XGBoost, réseaux de neurones) en NumPy pur, validés contre Scikit-learn et PyTorch. Repo open-source avec notebooks Jupyter exécutables localement ou sur Colab. L'auteur souligne l'importance de la structure modulaire et de la compréhension du gradient descent.

Open sourceOutilsFine-tuning
SIG
72
HYP
28
arXiv cs.AI·

A Deep Reinforcement Learning (DRL)-Based Transformer Method for Solving the Open Shop Scheduling Problem

Méthode Transformer avec apprentissage par renforcement pour résoudre le problème d'ordonnancement en atelier ouvert (OSSP). Le modèle encoder-decoder entraîné sur instances Taillard (4x4 à 10x10) généralise à des instances 40x40-100x100 avec écarts de 12,89-15,12% par rapport à la borne inférieure, surpassant les heuristiques classiques SPT/LPT.

Reinforcement learningRaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents

Risk-Aware Causal Gating (RACG) est un framework qui décide si un agent LLM doit agir, différer ou s'abstenir en combinant estimation d'effets causaux et contrôle de risque calibré. RACG modélise le chemin causal des actions aux résultats et applique des seuils basés sur le risque contrefactuel plutôt que la confiance prédictive, avec bornes distribution-free garantissant les contraintes de sécurité.

Agents IASécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

CSPO: Constraint-Sensitive Policy Optimization for Safe Reinforcement Learning

CSPO est une méthode d'optimisation de politique primal-duale pour l'apprentissage par renforcement sûr. Elle intègre la sensibilité aux contraintes dans les mises à jour de politique via une correction basée sur la distance signée minimale à la limite de sécurité. Résultats : récupération plus rapide après violation de contrainte et préservation des récompenses sur benchmarks de navigation et locomotion.

Reinforcement learningSécurité IAPapers
SIG
72
HYP
18