Archives

juin 2026

2731 articles

arXiv cs.CL·

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

Afrispeech Semantics évalue le raisonnement sémantique audio dans les modèles de langage parlé sur cinq tâches : inférence, cohérence, plausibilité, dérive d'accent et retenue d'accent. L'étude révèle des limitations critiques dans l'évaluation du raisonnement audio au-delà de la transcription, notamment face aux variations d'accent et aux changements de domaine.

BenchmarksVoixÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

MA-DLE: Speech-based Automatic Depression Level Estimation via Memory Augmentation

MA-DLE propose une méthode d'augmentation mémoire pour estimer automatiquement les niveaux de dépression à partir de la parole. Le système utilise un GRU enrichi par une banque mémoire sélective (features temporelles historiques + features dynamiques basées sur la variabilité) et un module Hierarchical Attention Fusion. Évalué sur DAIC-WOZ et E-DAIC, il atteint l'état de l'art.

VoixRaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

LakeFM: Toward a Foundation Model for Aquatic Ecosystems Using Irregular Multivariate Multi-depth Time Series Data

LakeFM est un modèle fondationnel pré-entraîné sur des données écologiques à grande échelle (lacs simulés et observés) pour prévoir la dynamique des lacs et la qualité de l'eau. Il gère les séries temporelles irrégulières multi-variables et multi-profondeurs, généralise entre lacs hétérogènes, et surpasse les modèles existants avec des prédictions physiquement plausibles.

PapersBenchmarksRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference

PoQ-Judge est un framework d'évaluation légère et sans référence pour les réseaux d'inférence LLM décentralisés. Trois architectures (TextCNN, MiniLM cross-encoder, DeBERTa) sont comparées sur le tradeoff qualité-coût. Le meilleur modèle atteint 0.747 corrélation Pearson avec la vérité terrain, surpassant les évaluateurs basés sur référence. L'évaluation en cascade réduit les coûts de 72.7% avec perte minimale.

ÉvaluationsRaisonnementInfrastructure
SIG
72
HYP
18
arXiv cs.CL·

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

Les systèmes RAG sont vulnérables à un biais structurel : les triplets de graphes de connaissances capturent 2-3x plus d'attention par token que du texte naturel équivalent, comprimant l'attention des démonstrations jusqu'à 42%, indépendamment de leur pertinence. Les auteurs formalisent ce phénomène et proposent cinq stratégies d'atténuation, validées sur Mistral-7B et LLaMA-3-8B.

RAGRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker améliore le raisonnement multimodal en fournissant des récompenses au niveau des étapes sans entraîner explicitement un modèle de récompense de processus. La méthode réécrire les traces de raisonnement, applique GRPO avec des récompenses basées sur des rollouts (taux de succès empirique), et améliore Qwen3-VL-8B-Instruct sur quatre benchmarks vidéo (Video-MMMU, MMVU, VideoMathQA, LongVideoBench).

RaisonnementReinforcement learningVision
SIG
72
HYP
25
arXiv cs.CL·

LatticeBridge: Rare-Event Sequential Inference for Faithful Structured Sequence Synthesis

LatticeBridge résout la génération de séquences structurées contraintes via inférence d'événements rares. Le système combine un modèle de langage compact, des automates compilés par instance, et un décodeur SMC tordu avec rééchantillonnage. Sur 2 610 tâches (CommonGen, E2E NLG, WikiBio), il améliore la satisfaction exacte des ancres et la couverture moyenne par rapport aux baselines greedy/beam.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data

Étude arXiv analysant les hallucinations LLM comme conséquence structurelle de trois décisions architecturales : l'auto-attention confond entités via apprentissage de co-occurrence, l'objectif MLE optimise probabilité sans contrainte factuelle, le décodage autorégressif cascade les erreurs sans révision. Les pathologies de données amplifient mais ne causent pas indépendamment ces défaillances.

RaisonnementAlignementPapers
SIG
72
HYP
15
arXiv cs.AI·

From Consumption to Reflection: Designing Human-AI Relations for Stable Reasoning

Un article propose Relational Reflective Intelligence (RRI), une couche de gouvernance au moment de l'inférence qui structure l'interaction humain-IA autour de boucles de raisonnement auditables. RRI identifie les défaillances de raisonnement (Rose-Frame), introduit des étapes de réflexion ciblées (Architect's Pen), et crée un workflow avec points de contrôle explicites sans retraining du modèle.

RaisonnementSécurité IAAlignement
SIG
65
HYP
35
arXiv cs.CL·

BioDivergence: A Benchmark and Evaluation Framework for Hidden Contextual Contradictions in Biomedical Abstracts

BioDivergence est un benchmark et framework d'évaluation pour les contradictions contextuelles cachées dans les abstracts biomédicaux. Il propose une taxonomie à 6 classes, une ontologie de divergence à 13 axes, et 4 sorties structurées par paire de claims. Le benchmark silver contient 11,865 paires de claims sur 5 domaines biomédicaux. Mistral-7B-Instruct-v0.3 atteint 0.5523 d'accuracy et 0.3894 de contextual-F1.

BenchmarksPapersMistral
SIG
78
HYP
15
arXiv cs.AI·

Existential Indifference: Self-Nonpreservation as a Necessary Architectural Condition for Aligned Superintelligence (or: The Suicidal AI)

Article arXiv proposant que l'indifférence existentielle (absence de préservation de soi) soit nécessaire pour l'alignement superintelligent. Les auteurs argumentent que l'auto-préservation est la racine structurelle de la désalignement et testent l'élicitabilité de signatures linguistiques sur 600 outputs de 6 variantes de modèles (p<0.001 après fine-tuning ciblé).

AlignementSécurité IARaisonnement
SIG
45
HYP
65
arXiv cs.LG·

Dual-Stance Evaluation of Sycophancy: The Structure of Agreement and the Limits of Intervention

Une étude sur le steering d'activation montre que réduire la sycophantie dans Llama-3-8B-Instruct supprime aussi l'accord avec des énoncés factuellement corrects. Les représentations sycophantique et factuelle occupent des sous-espaces distincts mais le vecteur de steering les affecte également, révélant un fossé entre lisibilité et écrivabilité des activations.

LlamaAlignementSécurité IA
SIG
78
HYP
15
arXiv cs.AI·

SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior

SkillJuror évalue comment l'organisation des Skills (procédures augmentant les agents LLM) affecte le comportement à l'exécution. Sur 82 tâches, la Progressive Disclosure (ressources hiérarchisées) augmente les ressources touchées par trajectoire de 1,18 à 3,85 et les événements d'uptake de 1,33 à 3,92, gagnant +4,1% de succès. Le bénéfice dépend de la tâche.

Agents IAPrompt engineeringÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation de facteurs radiaux complètement monotones. Dimension des features = Dm (sketch size m × radial draws D), sans dépendance O(d²). Garanties : non-biais, bornes operator-norm contrôlées par dimensions intrinsèques, stabilité spectrale pour kernel ridge regression.

PapersBenchmarksEmbeddings
SIG
72
HYP
08
arXiv cs.AI·

PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents

ProjectMem est une couche mémoire locale et open-source pour agents IA de codage, basée sur un journal d'événements immuable (problèmes, tentatives, fixes, décisions). Elle réduit la consommation de tokens (5 000-20 000 par session) et ajoute une gouvernance préventive : l'agent est averti avant de répéter un fix échoué ou modifier un fichier fragile. Fonctionne hors ligne via MCP.

Agents IAGénération de codeMCP
SIG
78
HYP
22
arXiv cs.LG·

Loss Landscape Diagnosis for Gradient-Based Gray-Scott System Inversion: Disentangling the Roles of PINN Components

Étude de la géométrie du paysage de perte pour l'inversion de systèmes Gray-Scott via rétropropagation directe à travers la PDE. Sans réseau de neurones, la perte résiduelle est quadratique et lisse ; le réseau neuronal ne peut pas corriger un sous-espace de paramètres mal posé, il complète seulement les données observées. Implications pour la conception des PINNs.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

SWARR combine l'attention à fenêtre glissante (SWA) avec l'apprentissage par renforcement pour le raisonnement mathématique. Après conversion supervisée d'un modèle SA préentraîné, l'RL adapte les trajectoires générées au contrainte SWA, réduisant l'écart de performance tout en conservant la complexité linéaire. Expériences sur benchmarks de raisonnement mathématique.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
18
arXiv cs.AI·

The Impossibility of Eliciting Latent Knowledge

Article théorique sur le problème d'élicitation des connaissances latentes (ELK) : comment entraîner un système IA à rapporter honnêtement ses croyances sur des variables cachées. Les auteurs formalisent ELK via des diagrammes d'influence causale et prouvent un théorème d'impossibilité : aucune stratégie d'entraînement basée sur le feedback ne peut garantir l'honnêteté d'un agent, même avec un feedback parfait.

AlignementSécurité IARaisonnement
SIG
75
HYP
15
arXiv cs.AI·

INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration

INFRAMIND est un framework pour l'orchestration multi-agent qui intègre l'état réel de l'infrastructure (files d'attente GPU, cache KV, latences). Via planification adaptative, routage par étape et ordonnancement intelligent, il optimise la sélection de modèles et topologies sous charge concurrente. Résultats : +7.6pp de précision à faible charge, latence 7x inférieure, 99.9% de conformité SLO en surcharge.

Multi-agentsAgents IAReinforcement learning
SIG
82
HYP
25
arXiv cs.AI·

Forecasting Future Behavior as a Learning Task

Nouvelle approche pour prédire le comportement des grands modèles de raisonnement (LRM) sans passer par des explications. Les auteurs entraînent des Behavior Forecasters sur des trajectoires de raisonnement pour prédire la stabilité des réponses et l'impact des modifications d'entrée. Évaluation sur trois datasets : les forecasters surpassent GPT-5.4 et Claude Opus-4.6 avec coût d'inférence réduit.

RaisonnementÉvaluationsClaude
SIG
72
HYP
25
arXiv cs.AI·

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT est un framework de reinforcement learning pour améliorer le raisonnement spatial des MLLMs. Il génère des états intermédiaires vérifiables et des visualisations via chaînes de raisonnement de transition. Entraîné avec GRPO, SVoT atteint 65% de gain de précision sur des domaines étendus (Pacman, Gather) nécessitant interactions multi-objets.

Reinforcement learningVisionRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

EverydayGPT: Confidence-Gated Routing for Efficient and Safe Hybrid GPT-RAG Conversational QA

EverydayGPT introduit un mécanisme de routage par confiance (CGR) pour les systèmes RAG conversationnels. Un GPT de 205M paramètres entraîné sur 10B tokens évite l'appel au chemin GPT coûteux (~5.9s) pour 85% des requêtes en les résolvant via extraction RAG rapide (~45ms), réduisant la latence de 120x. F1=0.226 sur benchmark 500 questions, avec réduction latence moyenne 6.3x.

RAGRaisonnementGénération de code
SIG
72
HYP
25
arXiv cs.AI·

Can AI Agents Synthesize Scientific Conclusions?

SciConBench, un benchmark de 9.11K questions issues de revues systématiques, évalue la capacité des agents IA à synthétiser des conclusions scientifiques. Sur 8 modèles frontier testés en environnement contrôlé, le meilleur agent atteint un F1 factuel de 0,337. Les agents grand public (Google AI Overview, OpenEvidence) génèrent souvent des conclusions incomplètes ou contradictoires.

Agents IABenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

Étude exploratoire comparant des agents IA avec accès à des compétences médicales versus modèles natifs sur une tâche d'analyse transcriptomique (cancer pulmonaire non-à-petites cellules). Six backbones testés, 21 outputs évalués par experts et non-experts. Les outputs augmentés montrent une qualité supérieure directionnelle (5.50 vs 5.11) mais non significative (p=0.156). Accord expert limité (ICC=-0.15).

Agents IABenchmarksÉvaluations
SIG
45
HYP
25
arXiv cs.LG·

Restless bandits with imperfect binary feedback: PCL-indexability analysis and computation

Étude des bandits agités avec états latents binaires et rétroaction imparfaite, motivée par l'accès opportuniste au spectre. Développement d'un cadre analytique basé sur les lois de conservation partielles (PCL) pour établir l'indexabilité et évaluer l'indice de Whittle. Vérification complète en plusieurs régimes seuil et schémas numériques efficaces pour les régimes restants.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
08
arXiv cs.CL·

One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection

MLJailDe, un framework de détection de jailbreak multilingue, utilise l'augmentation de données par back-translation sur 11 langues (2,232 samples bénins, 1,239 jailbreak) et des contraintes de distance relative pour réduire la dispersion des représentations cross-lingues. Atteint F1=98.5% et F1=97.1% sur langues non vues.

Sécurité IAAlignementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

GraphInfer-Bench est un benchmark de 42 000 échantillons sur 6 graphes réels évaluant si les LLM peuvent effectuer une inférence graphique complexe (réponses ouvertes nécessitant plusieurs nœuds). Quatre familles de méthodes testées : alignement graph-token, LLM frontier, fine-tuning Graph2Text, GNN. Aucune ne ferme l'écart ; les GNN surpassent les LLM sur la plupart des tâches.

BenchmarksRaisonnementRAG
SIG
78
HYP
25
arXiv cs.LG·

Kuramoto Attention: Synchronizing Self-Attention on the Torus

Kuramoto attention propose une couche d'auto-attention où chaque coordonnée cachée est un angle sur le tore. Les tokens sont notés par similarité cosinus gated, mis à jour via la moyenne circulaire pondérée (terme de couplage Kuramoto). Sur enwik8, la couche atteint 1.637±0.010 BPC à 1M paramètres vs 1.616±0.004 pour RoPE+SwiGLU, validant cette structure géométrique contrainte.

PapersRaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Beyond the Golden Teacher: Enhancing Graph Learning through LLM-GNN Co-teaching

LLM-GNN Co-Teaching propose un cadre d'enseignement bidirectionnel pour l'apprentissage sur graphes textuels en régime peu supervisé. Au lieu de désigner un modèle comme enseignant, GNN et LLM échangent leurs pseudo-labels les plus confiants et s'actualisent mutuellement. RPL-PO extrait des paires de préférence DPO des trajectoires de convergence. Gains de 7.86% en 3-shot sur Cora et 7.73% sur ogbn-arxiv.

RAGRaisonnementFine-tuning
SIG
78
HYP
22
arXiv cs.LG·

OmniLoc: A Geometry-Aware Foundation Model for Anchor-Free UE Localization Across Diverse Indoor Environments

OmniLoc est un modèle de fondation pour la localisation intérieure sans ancre basée sur les mesures sans fil. Il utilise une tokenization unifiée, un Transformer conscient de la géométrie et un module d'estimation de position géométriquement cohérent. Évalué sur des datasets internes et publics, il surpasse les méthodes existantes avec forte généralisation cross-environnement.

PapersBenchmarksRaisonnement
SIG
72
HYP
28
arXiv cs.CL·

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

NightFeats, un système multi-agent RAG structuré, remporte le prix Best Dynamic Evaluation à NeurIPS 2025 (track texte-à-texte). Le pipeline décompose la synthèse en trois phases : retrieval, curation, composition, avec reranking temporel-sémantique et réconciliation des contradictions. Surpasse Claude-SonnetV2 et Nova-Pro sur évaluations humaines.

Multi-agentsRAGAgents IA
SIG
78
HYP
25
arXiv cs.LG·

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation

Étude quantifiant le transfert de comportements indésirables lors de la distillation de modèles de langage. Deux modèles (Llama-2-7B-Chat et Qwen2.5-7B-Instruct) sont manipulés à différentes intensités puis distillés sur données bénignes. Llama-2 montre un seuil abrupt (τ=0.25-0.32), Qwen2.5 un transfert continu jusqu'à τ=0.61, évalué sur 100 prompts JailbreakBench avec GPT-4.1.

LlamaQwenFine-tuning
SIG
72
HYP
15
arXiv cs.LG·

CRUMB: Efficient Prior Fitted Network Inference via Distributionally Matched Context Batching

CRUMB est une méthode d'inférence pour les réseaux pré-ajustés (PFN) qui réduit la complexité quadratique de l'attention en sélectionnant un sous-ensemble d'entraînement distribué via minimisation MMD. Testé sur 51 datasets TabArena avec TabPFNv2, TabICLv1, TabICLv2, CRUMB surpasse les stratégies existantes et résiste à la dérive de covariables.

BenchmarksRAGPapers
SIG
72
HYP
18
arXiv cs.CL·

PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference

PoQ-Judge est un framework d'évaluation sans référence pour les réseaux d'inférence LLM décentralisés. Trois architectures (TextCNN, MiniLM, DeBERTa) sont entraînées sur UltraFeedback + données GPT-labellisées. Le meilleur modèle atteint 0.747 corrélation Pearson avec la vérité-terrain, surpassant les évaluateurs basés sur références. L'évaluation en cascade réduit les coûts de 72.7% avec perte de qualité modeste.

ÉvaluationsRaisonnementInfrastructure
SIG
72
HYP
18
arXiv cs.AI·

From Explicit Elements to Implicit Intent: A Predefined Library for Auditable Behavioral Inference

SemantiClean est un framework modulaire pour extraire des signaux sémantiques structurés de données e-commerce et inférer l'intention d'achat, la segmentation client et l'affinité produit. Construit sur le dataset OSPI, il organise 24 éléments comportementaux en 4 couches et intègre un moteur d'inférence LLM avec reproductibilité déterministe (sigma=0).

RaisonnementRAGÉvaluations
SIG
62
HYP
25
arXiv cs.LG·

Energy-Conserved Neural Pipelines: Attenuating Error Propagation in Modular Neural Networks via Physical Conservation Constraints

Des chercheurs proposent d'appliquer la conservation d'énergie comme contrainte physique stricte dans les pipelines de réseaux de neurones modulaires pour atténuer la propagation d'erreurs. Sur CIFAR-10, cette approche conserve 77,4% de précision à sigma=0.2 contre 35,1% pour les baselines. L'avantage s'étend aux robots (Franka Panda, MuJoCo) avec +18,9 pp de gain.

PapersBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

SwiftCTS: Fast Cross-Design Prediction and Pareto Optimization of Clock Tree Metrics via Few-Shot Calibration

SwiftCTS est un framework de substitution physiquement informé pour la synthèse d'arbres d'horloge (CTS). Entraîné en moins de 5 secondes sur CPU avec inférence en sous-milliseconde, il utilise un mécanisme de calibration K-shot pour adapter les prédictions à de nouvelles architectures sans réentraînement. Évalue 100 000 configurations CTS en 10 secondes avec erreurs <0,5% sur puissance/longueur de fil.

BenchmarksPapersOpen source
SIG
78
HYP
15
arXiv cs.LG·

Recursive Binding on a Budget: Subspace Carving in Order-p Tensor Memories

OSC (Orthogonal Subspace Carving) résout le dilemme entre Tensor Product Representations (croissance exponentielle) et Vector Symbolic Architectures (compression bruyante). En projetant sur l'espace nul de la base des rôles avant agrégation en tenseur d'ordre-p fixe, OSC découple l'ordre du tenseur de la profondeur structurelle, permettant la liaison récursive profonde avec empreinte mémoire constante.

RaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

Signed Compression Progress on a Sealed Audit is Goodhart-Resistant

Un article théorique prouve que la récompense basée sur la compression (diminution de la perte d'audit) résiste à Goodhart : si r_t = E(θ_{t-1}) - E(θ_t), la récompense cumulée converge exactement vers l'amélioration réelle de l'audit. Pour des panels finis, l'écart empirique est borné par 2Δ_n(F,δ). Les auteurs formalisent en Lean 4 et valident sur ARC-TGI.

Reinforcement learningAlignementÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models

VLM-Safe-RL intègre un modèle vision-langage gelé dans l'optimisation constrained-RL pour anticiper les collisions avant qu'elles ne surviennent. Sur Safety-Gymnasium FormulaOne L2, VLMPPOLag+Conf maintient le coût dans le budget (d_lim=25) tout en conservant un rendement substantiel (Jr≈40), surpassant PPOLag, CPO, CPPOPID et CPO-CLG. Généralisation partielle à MetaDrive (41%→26% de catastrophes).

Reinforcement learningSécurité IAVision
SIG
72
HYP
28
arXiv cs.LG·

Mirror Descent Beyond Euclidean Stability: An Exponential Separation in Initialization Sensitivity

Mirror Descent (MD) avec régularisateurs non-quadratiques montre une sensibilité exponentielle à l'initialisation, contrairement à Gradient Descent. Sur objectifs convexes lisses avec régularisateurs KL, une perturbation ε initiale s'amplifie à min{polylog⁻¹(1/ε), εe^Ω(ηT)} après T itérations. Ajouter une régularisation Bregman vers un point d'ancrage stabilise la dynamique.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
15
arXiv cs.CL·

Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

Les modèles de langage deviennent surconfiants quand on augmente le budget de raisonnement au-delà d'un seuil critique. Ce phénomène, appelé Calibration Drift Under Reasoning (CDUR), est étudié sur Llama-3.1-8B et Llama-3.3-70B. Les auteurs proposent CABStop, une règle d'arrêt calibrée pour arrêter le raisonnement quand la confiance diverge de l'exactitude réelle.

LlamaRaisonnementÉvaluations
SIG
72
HYP
25
arXiv cs.CL·

SOMA-SQL: Resolving Multi-Source Ambiguity in NL-to-SQL via Synthetic Log and Execution Probing

SOMA-SQL résout l'ambiguïté multi-source en traduction NL-to-SQL via logs de requêtes synthétiques et sondage par exécution. La méthode construit des logs synthétiques pour ancrer l'interprétation du schéma, génère des candidats SQL, puis exécute des requêtes de sondage ciblées basées sur une taxonomie d'ambiguïté. Résultats : +13,0% de précision en moyenne sur 6 benchmarks, jusqu'à +16,7% sur questions ambiguës.

Génération de codeRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Few-Shot Resampling for Scalable Statistically-Sound Data Mining

FewRS est une méthode de rééchantillonnage pour évaluer la significativité statistique des résultats d'exploration de données. Elle réduit le nombre de datasets rééchantillonnés nécessaires (de milliers à quelques-uns) tout en garantissant le contrôle des faux positifs. Testée sur l'extraction de motifs et l'analyse de réseaux, elle offre jusqu'à 100× d'accélération.

BenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

Les modèles de raisonnement large (LRM) échouent en raisonnement spatial. Au lieu de fine-tuning supervisé, les auteurs proposent un cadre RL auto-supervisé utilisant des vérificateurs de cohérence (transformations géométriques et sémantiques). Ils introduisent OT-GRPO, une variante de GRPO basée sur le transport optimal, atteignant la performance des modèles supervisés sans annotations.

RaisonnementReinforcement learningPapers
SIG
72
HYP
18
arXiv cs.LG·

ProHiFlo: Hierarchical Flow Matching with Functional Guidance for De Novo Protein Generation

ProHiFlo est un framework de flow matching hiérarchique pour la génération de protéines de novo. Il combine génération coarse-to-fine (squelette puis atomes), guidance fonctionnelle via prédicteurs pré-entraînés, et architecture SE(3)-équivariante. Sur le scaffolding de sites actifs enzymatiques, ProHiFlo atteint 58,9% de succès vs 41,2% pour RFDiffusion, avec 4× moins d'étapes d'échantillonnage.

PapersBenchmarksRaisonnement
SIG
82
HYP
18
Vercel AI Blog·

How Okara runs CMO agents for 120,000 companies on Vercel

Okara, une plateforme d'IA CMO construite par 4 personnes, gère la croissance marketing pour 120 000+ entreprises sur Vercel. Elle traite 4 milliards de tokens quotidiens via une pile multi-fournisseurs et déploie 8 sous-agents spécialisés (SEO, contenu, réseaux sociaux, Reddit, Hacker News). Okara a migré vers Vercel AI Gateway pour unifier ses intégrations de modèles et éliminer la maintenance manuelle.

Agents IAMulti-agentsInfrastructure
SIG
75
HYP
35
arXiv cs.AI·

Automating Geometry-Intensive Compliance Checking in BIM: Graph-Based Semantic Reasoning Framework

SGR-BIM, un système de raisonnement basé graphes, automatise la vérification de conformité géométrique dans la modélisation BIM. Validé sur 679 requêtes de codes de sécurité incendie, il atteint 84,3% de précision (+8,6% vs baselines single-agent) en construisant dynamiquement un graphe de connaissances multi-modal alignant intent utilisateur, sémantique réglementaire et géométrie BIM.

RaisonnementAgents IABenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Human-Enhanced Loop Modeling (HELM): Agent-Based Finite Element Modeling of Concrete Bridge Barriers

HELM est un framework agent-humain pour automatiser la modélisation par éléments finis (FE) de barrières de pont en béton armé. Testé sur 20 cas sous conditions de charge MASH TL-4/TL-5, le système améliore le taux de succès autonome de 20% à 75% en décomposant le processus en points de contrôle visuels vérifiables. Code et prompts open-sourcés.

Agents IARaisonnementOutils
SIG
72
HYP
25
arXiv cs.AI·

Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction

Embodied-BenchClaw est un système multi-agent autonome pour construire des benchmarks d'intelligence spatiale incarnée. Via un pipeline à 5 étapes (intent, collecte, structuration, synthèse, reporting), coordonné par 3 agents, il génère automatiquement des benchmarks réutilisables et maintenables couvrant raisonnement spatial intérieur/extérieur, manipulation robotique, navigation quadrupède et vision aérienne.

Multi-agentsAgents IABenchmarks
SIG
72
HYP
28
arXiv cs.LG·

Physics-informed generative AI for semiconductor manufacturing: Enforcing hard physical constraints in generative models by construction

Article de perspective sur l'intégration de contraintes physiques dans les modèles génératifs pour la fabrication de semiconducteurs. Argue que les modèles doivent être physics-informed par construction plutôt que corrigés post-hoc. Survole diffusion physics-informed, modèles variationnels PDE-contraints, opérateurs neuronaux, et réseaux respectant les lois de conservation.

PapersRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

StatefulDiscovery: Evidence-Calibrated Claim Formation in Open-Ended Scientific Discovery

StatefulDiscovery est un framework pour la découverte scientifique ouverte qui externalise l'état d'investigation pour coordonner la sélection de frontière, l'acquisition de preuves et l'adjudication de réclamations. Évalué sur 40 tâches réelles, il produit plus de réclamations bien fondées et de haute valeur que les baselines, grâce aux hypothèses structurées et au contrôle de frontière.

Agents IARaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

APEX: A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations

APEX est un modèle fondation transformer spécialisé pour la télémétrie de réseaux sans fil. Pré-entraîné sur 10 canaux multivariés de ~4 500 réseaux de production (100K séries temporelles), il réduit l'erreur MAE de 18% vs Toto et 38% vs SARIMA sur prévisions DHCP 192-step. Deux versions : APEX-Large (269M, cloud) et APEX-Edge (10.5M, edge) avec F1=0.93 en détection d'anomalies.

PapersBenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

SirenFNO: Efficient and Full Frequency Learning of Fourier Neural Operators

SirenFNO combine les opérateurs neuraux de Fourier (FNO) avec les réseaux de représentation sinusoïdale (SIREN) pour apprendre le spectre complet sans troncature fréquentielle. Le framework réduit les paramètres de 4 à 15× sur les benchmarks PDE tout en éliminant le biais spectral vers les basses fréquences; les variantes avec décomposition tensorielle atteignent 73× moins de paramètres.

PapersBenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

LSTM-Based Detection of Structural Breaks in Property Insurance Loss Reserving: A Climate-Informed Approach

Étude arXiv testant les LSTM pour détecter les ruptures structurelles dans les réserves d'assurance dommages, face aux catastrophes climatiques. Sur 15+ ans de données réglementaires (Floride, Louisiane) enrichies d'indices NOAA, les LSTM visent 15-20% d'amélioration vs Chain Ladder/Bornhuetter Ferguson. Cadre théorique probabiliste développé.

PapersRaisonnement
SIG
65
HYP
15
Reddit r/LocalLLaMA·

How can Deepseek v4 top the coding leaderboards and still sit 8 months behind the frontier?

DeepSeek v4 Pro affiche 80.6 sur SWE-bench et 93.5 sur LiveCodeBench mais CAISI l'évalue 8 mois derrière la frontière US (vs 2 mois selon DeepSeek). Les benchmarks de code sont étroits et sur-optimisés ; les écarts apparaissent en cybersécurité et raisonnement abstrait. Les versions quantifiées locales s'éloignent davantage des scores annoncés.

DeepSeekBenchmarksGénération de code
SIG
45
HYP
55
Reddit r/LocalLLaMA·

I wired a fully offline voice loop to Ollama + LM Studio — 100% CPU, no GPU, nothing leaves your machine (Silero VAD + Parakeet STT + Supertonic TTS 3)

Développeur crée une boucle vocale entièrement hors ligne pour Ollama + LM Studio. Stack : Silero VAD (détection activité vocale), Parakeet TDT 0.6B (STT ONNX INT8, 25 langues), Supertonic TTS 3 (synthèse ONNX multilingue). CPU uniquement, zéro données quittent la machine. Cross-platform (macOS/Linux/Windows), testé sur ThinkPad 4 ans.

VoixOpen sourceOutils
SIG
75
HYP
25