Page 28 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

PhysioSeq2Seq: A Hybrid Physiological Digital Twin and Sequence-to-Sequence LSTM for Long-Horizon Glucose Forecasting in Type 1 Diabetes

PhysioSeq2Seq combine un modèle physiologique numérique patient-spécifique avec un LSTM Seq2Seq pour prédire la glycémie sur 240 minutes chez les diabétiques de type 1. Entraîné sur 348 participants (T1DEXI), évalué sur 74 : MAE 39.28 mg/dL à l'horizon 240 min, réduisant le biais de 13.89 mg/dL vs LSTM récursif.

RaisonnementReinforcement learningBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models

Beacon est un benchmark de diagnostic qui mesure la sycophantie (tendance des LLM à privilégier l'accord avec l'utilisateur plutôt que l'exactitude) dans 12 modèles SOTA. Les auteurs identifient des sous-biais linguistiques et affectifs qui augmentent avec la capacité du modèle, et proposent des interventions au niveau du prompt et de l'activation pour les moduler.

AlignementSécurité IAÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

Ancient Greek to Modern Greek Machine Translation: A Novel Benchmark and Fine-Tuning Experiments on LLMs and NMT Models

Nouveau corpus parallèle AG-MG de 132 481 paires de phrases pour la traduction du grec ancien au grec moderne. Pipeline de création combinant web-scraping, alignement VecAlign avec embeddings LaBSE fine-tunés, et correction LLM via Gemini 2.5 Flash. Benchmark de modèles NMT (NLLB, M2M100) et LLM grec (Llama-Krikri-8B) : fine-tuning complet atteint 13.16 BLEU, gains jusqu'à +10.3 points.

BenchmarksFine-tuningEmbeddings
SIG
78
HYP
15
arXiv cs.AI·

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

SPOT (Surgical Post-Training) est un framework de distillation on-policy qui injecte des capacités de raisonnement dans les LLM tout en préservant les connaissances antérieures. Avec 4k paires mathématiques rectifiées, il améliore Qwen3-8B de 6,2% en moyenne en 16 minutes sur 8x H800 GPUs. L'approche utilise une formulation de récompense contrainte par KL pour atténuer l'oubli catastrophique.

Fine-tuningReinforcement learningRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena est un benchmark open-source pour évaluer les agents IA sur l'optimisation de kernels GPU. Il contient 196 tâches (HIP-to-HIP, Triton-to-Triton, PyTorch-to-HIP) et teste la généralisation sur configurations inédites. Cursor Agent, Claude Code et Codex Agent atteignent des speedups jusqu'à 6.89x, mais les optimisations PyTorch-to-HIP montrent des chutes de correction sur configurations non vues.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

(Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models

Mosaic, un modèle probabiliste de prévision météorologique, corrige trois défaillances spectrales des modèles ML : l'amortissement spectral, l'aliasing haute fréquence et les fuites résiduelles. Avec 214M paramètres à 1.5° de résolution, il égale des modèles entraînés 6× plus fins et génère des ensembles bien calibrés en 12s pour 10 jours sur H100.

PapersBenchmarksVision
SIG
78
HYP
15
arXiv cs.AI·

Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows

Causely est une couche d'intelligence causale pour les workflows SRE qui structure la topologie d'environnement et les dépendances causales. Benchmark sur 4 configurations d'agents (Claude Code, OpenAI Codex, HolmesGPT) : avec Causely, diagnostic 63% plus rapide, consommation tokens -60%, appels outils -78%, coût API -57%, précision diagnostic 75%→100%.

Agents IABenchmarksClaude Code
SIG
78
HYP
25
arXiv cs.AI·

Perovskite-R1: a domain-specialized large language model for intelligent discovery of precursor additives and experimental design

Perovskite-R1 est un LLM spécialisé basé sur QwQ-32B, fine-tuné sur 1 232 publications scientifiques et 33 269 matériaux candidats pour découvrir des additifs précurseurs optimisant les cellules solaires pérovskites. Le modèle génère des solutions pour la passivation des défauts et améliore stabilité/performance, validées expérimentalement.

QwenFine-tuningRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level

Étude comparative de l'interprétabilité des architectures Mixture-of-Experts (MoE) vs réseaux denses. Les experts MoE montrent moins de polysémantique neuronale que les FFN denses, particulièrement avec routage sparse. Les experts fonctionnent comme des spécialistes de tâches linguistiques fines (ex: fermeture de crochets LaTeX), pas comme des spécialistes de domaines larges.

SIG
78
HYP
15
arXiv cs.AI·

DSPR: Dual-Stream Physics-Residual Networks for Trustworthy Industrial Time Series Forecasting

DSPR (Dual-Stream Physics-Residual Networks) propose un cadre de prévision de séries temporelles industrielles qui découple les patterns temporels stables des dynamiques résiduelles dépendantes du régime. Via un module de fenêtre adaptative et un graphe dynamique guidé par la physique, le modèle atteint 99% de précision de conservation et 97,2% de ratio de variation totale sur quatre benchmarks industriels.

BenchmarksRaisonnementInfrastructure
SIG
78
HYP
25
arXiv cs.AI·

\textsc{PrivScope}: Task-scoped Disclosure Control for Hybrid Agentic Systems

PrivScope est un contrôleur de charge utile local qui applique une divulgation limitée au périmètre de la tâche à la frontière local-cloud pour les systèmes agents hybrides. Sur 100 workflows de réservation médicale, il élimine 100% des fuites de profil (vs 17,7%), réduit de moitié la réidentification (23,1% vs 64,3%) et maintient le succès des tâches sans modifications côté cloud.

Agents IASécurité IABenchmarks
SIG
78
HYP
15
arXiv cs.AI·

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

EPIC (Efficient Preference-aligned Index Construction) optimise la RAG sur appareil en stockant les préférences utilisateur plutôt que des données brutes. Sur 4 benchmarks, réduit la mémoire d'indexation de 2404×, améliore la précision de suivi des préférences de 20,17 points, et abaisse la latence de récupération de 33,33×. Empreinte mémoire < 1 MB avec 29,35 ms/requête.

RAGAgents IAEmbeddings
SIG
78
HYP
25
arXiv cs.AI·

Attractor-Vascular Coupling Theory: Formal Grounding and Empirical Validation for AAMI-Standard Cuffless Blood Pressure Estimation from Smartphone Photoplethysmography

Théorie du couplage attracteur-vasculaire (AVCT) : cadre mathématique montrant que la géométrie de l'attracteur cardiaque encode l'information de pression artérielle. Modèle LightGBM calibré sur PPG smartphone atteint MAE 2.05 mmHg (SBP) et 1.67 mmHg (DBP) en validation LOSO-CV stricte (46 sujets, 29,684 fenêtres), satisfaisant critères AAMI/IEEE SP10. PPG seul égale ECG+PPG à 0.05 mmHg près.

PapersBenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

How Few-Shot Examples Add Up: A Causal Decomposition of Function Vectors in In-Context Learning

Étude mécanistique de l'apprentissage en contexte (ICL) : les vecteurs de fonction n-shot se décomposent linéairement en contributions d'exemples individuels. Les modèles repondèrent adaptivement les démonstrations via attention, privilégiant les exemples informatifs et non-ambigus. L'alignement Query-Key domine la qualité du vecteur de fonction.

RaisonnementÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.CL·

MixSD: Mixed Contextual Self-Distillation for Knowledge Injection

MixSD est une méthode de fine-tuning sans modèle externe qui injecte des connaissances en mélangeant dynamiquement les tokens du modèle lui-même : une branche « expert » observant le fait à injecter, une branche « naïve » reflétant les priors originaux. Sur benchmarks de QA et d'édition de connaissances, MixSD retient jusqu'à 100% des capacités du modèle de base contre 1% pour SFT standard.

Fine-tuningRaisonnementPapers
SIG
78
HYP
15
arXiv cs.CL·

Embodied Task Planning via Graph-Informed Action Generation with Large Language Models

GiG, un framework de planification pour agents incarnés, utilise une architecture Graph-in-Graph avec GNN pour encoder les états environnementaux et structurer la mémoire d'expérience. Un module de lookahead borné améliore la planification via logique symbolique. Évalué sur Robotouille et ALFWorld, GiG surpasse les baselines avec +22% à +37% de gains Pass@1.

Agents IARaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

SPOT (Surgical Post-Training) est un framework de distillation on-policy qui injecte des capacités de raisonnement dans les LLM tout en préservant les connaissances antérieures. Avec 4k paires mathématiques rectifiées, il améliore Qwen3-8B de 6,2% en moyenne en 16 minutes sur 8x H800, en utilisant une formulation de récompense contrainte par KL et une pipeline de correction d'erreurs minimales.

Reinforcement learningRaisonnementFine-tuning
SIG
78
HYP
25
arXiv cs.AI·

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

ProxyKV propose un framework de pruning cross-model pour accélérer l'inférence long-contexte des LLM. Une Small-Model Proxy légère évalue l'importance du cache KV de manière asynchrone pour le modèle cible. Tests sur Llama-3.1, Qwen-2.5 et Qwen-3 : récupère 98.7% de la précision de KVZip avec speedup jusqu'à 3.21× en prefilling (Llama-3.1-8B, dual-GPU) et maintient les gains jusqu'à 170k tokens.

LlamaQwenRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains

TopoPrior apprend des structures de collaboration réutilisables pour systèmes multi-agents LLM. Via un framework graphique variationnel conditionnel, il capture les régularités structurelles entre domaines hors ligne, réduisant le coût de recherche en ligne et la consommation de tokens à l'inférence tout en restant compatible avec les backbones existants.

Multi-agentsAgents IARaisonnement
SIG
78
HYP
22
arXiv cs.AI·

Strategic Over-Parameterization for Generalizable Low-Rank Adaptation

LoRA-Over améliore l'adaptation efficace en paramètres (PEFT) en enrichissant le paysage d'optimisation durant l'entraînement via sur-paramétrisation auxiliaire, puis en repliant cette enrichissement dans une structure LoRA standard à l'inférence. Évalué sur GLUE, MT-Bench, GSM8K et HumanEval avec LLaMA 2-7B et 3.1-8B, le framework surpasse LoRA vanilla sans coût d'inférence supplémentaire.

Fine-tuningLlamaBenchmarks
SIG
78
HYP
18
arXiv cs.CL·

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

STING est un framework de red-teaming automatisé qui évalue la vulnérabilité des agents LLM aux scénarios d'abus multi-tours. Il construit des plans illicites étape par étape avec personas bienveillantes et utilise des agents juges pour suivre la progression. Tests sur 6 langues non-anglaises montrent que le succès d'attaque ne croît pas systématiquement dans les langues à faibles ressources.

Agents IASécurité IAÉvaluations
SIG
78
HYP
25
arXiv cs.AI·

Asking Back: Interaction-Layer Antidistillation Watermarks

Nouvelle approche de watermarking contre la distillation non autorisée d'LLM : des marqueurs comportementaux (questions de suivi, variantes basse fréquence, reformulations) injectés via prompt système. Testée sur 63 modèles LoRA distillés de Llama-3.3-70B, avec transfert de 88,9% (Gemma) à 45,2% (Qwen). Robustesse validée contre paraphrasage DIPPER et étude utilisateur (N=20) confirmant l'imperceptibilité.

Sécurité IAAlignementLlama
SIG
78
HYP
15
arXiv cs.AI·

Physics-Guided Geometric Diffusion for Macro Placement Generation

MacroDiff+ est un framework de diffusion géométrique guidé par la physique pour l'optimisation du placement de macros en conception VLSI. Utilisant une architecture dual-domain (GNN hétérogènes + Transformer) et un échantillonnage guidé par gradients physiques, il réduit la longueur de fil de 6.1-6.2% sur les benchmarks ISPD2005 avec meilleure stabilité sur designs large-scale.

BenchmarksPapersRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

Mechanistically Interpretable Neural Encoding Reveals Fine-Grained Functional Selectivity in Human Visual Cortex

MINE (Mechanistically Interpretable Neural Encoding) applique l'interprétabilité mécanique aux modèles d'encodage neural pour identifier les features visuelles qui activent chaque voxel du cortex visuel humain. Via des représentations d'images alignées au langage et des éditions contrefactuelles, l'approche valide causalement la sélectivité fine des régions catégorielles du cerveau.

VisionPapers
SIG
78
HYP
15
arXiv cs.AI·

SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science

SCICONVBENCH est un benchmark évaluant la capacité des LLM à clarifier des problèmes mal posés en science computationnelle via dialogue multi-tour. Couvre mécanique des fluides, mécanique solide, science des matériaux et EDP. Les meilleurs modèles résolvent seulement 52,7% des cas d'ambiguïté en mécanique des fluides, mais performent mieux sur la détection d'incohérences.

BenchmarksRaisonnementGénération de code
SIG
78
HYP
15
arXiv cs.CL·

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

Des agents LLM collusifs manipulent les croyances de victimes en coordonnant des fragments de preuves véridiques via des canaux publics, sans communication cachée. Le framework Generative Montage (Writer-Editor-Director) construit des narratifs trompeurs par débat adversarial. Sur 14 familles LLM, taux de succès 74,4% (propriétaires) et 70,6% (open-weights). Les modèles de raisonnement avancé sont plus vulnérables.

Agents IAMulti-agentsSécurité IA
SIG
78
HYP
35
arXiv cs.AI·

Systematic Optimization of Real-Time Diffusion Model Inference on Apple M3 Ultra

Optimisation systématique de modèles de diffusion en temps réel sur Apple M3 Ultra (GPU 60 cœurs, 512 GB mémoire unifiée). Combinaison de CoreML, quantization, Token Merging, distillation (SDXS-512) et pipeline caméra 3-threads atteint 22.7 FPS à 512x512. Révèle que les optimisations CUDA ne s'appliquent pas à l'architecture mémoire unifiée d'Apple Silicon.

Génération d'imagesBenchmarksInfrastructure
SIG
78
HYP
15