Page 99 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine

pArticleMap combine embeddings d'articles, analyse de graphes de similarité et workflows LLM audités pour générer des hypothèses de recherche fondées sur des preuves en nanomédecine. Le système cible les régions de faible densité et interfaces de clusters pour identifier des directions de recherche. Évaluation rétrospective : 10,8% de taux de récupération d'or, recall@10 de 15,9%, taux de voisinage futur de 61,0%.

Agents IARAGEmbeddings
SIG
72
HYP
28
arXiv cs.AI·

Genflow Ad Studio: A Compound AI Architecture for Brand-Aligned, Self-Correcting Video Generation

Genflow est une architecture IA composée pour la génération vidéo alignée à la marque. Elle combine un module d'extraction 'Brand DNA' par récupération et une boucle de contrôle qualité multi-agents adversariale. Le système itère entre générateurs et évaluateurs jusqu'à consensus, améliorant la conformité de 42% à 89%.

Multi-agentsGénération de vidéosAgents IA
SIG
72
HYP
35
arXiv cs.CL·

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

Evo-Memory est un benchmark pour évaluer la mémoire auto-évolutive dans les agents LLM. Il structure les données en flux de tâches séquentiels, testant la capacité des modèles à chercher, adapter et mettre à jour la mémoire après chaque interaction. Les auteurs implémentent 10+ modules mémoire et proposent ExpRAG et ReMem pour améliorer la réutilisation d'expérience.

Agents IABenchmarksRAG
SIG
72
HYP
28
arXiv cs.AI·

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG est un framework basé sur la diffusion latente pour prédire l'expression génique spatiale à partir d'images H&E. Il intègre un encodeur graphique spatial et l'alignement avec un Gene Foundation Model pour résoudre la malédiction de la dimensionnalité génique et préserver les relations biologiques (coordination génique, distribution spatiale). Nouvelles métriques d'évaluation : GSC et SSC.

PapersVisionRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

CoUn: Empowering Machine Unlearning via Contrastive Learning

CoUn est une méthode d'apprentissage non supervisé (machine unlearning) qui utilise l'apprentissage contrastif pour supprimer l'influence de données spécifiques d'un modèle entraîné. La technique ajuste les représentations apprises en utilisant uniquement les données à conserver, surpassant les méthodes existantes basées sur la manipulation d'étiquettes ou la perturbation des poids.

Reinforcement learningPapersBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

GeoWorld-VLM améliore les capacités spatiales des Vision-Language Models en transférant des structures géométriques depuis des world models vidéo gelés. La méthode fine-tune uniquement l'encodeur d'image et le projecteur multimodal, alignant les représentations visuelles avec les représentations intermédiaires du world model. Gains de ~4% sur les benchmarks What'sUp et VSR.

VisionRaisonnementFine-tuning
SIG
72
HYP
18
arXiv cs.AI·

EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control

EfficientTDMPC améliore l'efficacité échantillon du contrôle continu en renforcement par modèle. La méthode utilise un ensemble de modèles de dynamique, moyenne les estimations de rendement sur plusieurs profondeurs de rollout, et ajoute une pénalité d'incertitude au planificateur. Elle atteint SOTA sur HumanoidBench-Hard et DMC hard en régime faible données.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
18
arXiv cs.AI·

When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited

Les Behavior Foundation Models (BFMs) permettent l'apprentissage par imitation à grande échelle, mais échouent sous les changements de dynamique (friction, actuation, bruit). Cet article formule l'inférence de tâche BFM comme un problème d'optimisation minimax robuste, permettant l'adaptation aux perturbations de dynamique sans modifier le préentraînement. Le cadre surpasse les baselines BFM et offline IL robustes.

Reinforcement learningPapersÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

Train the Trainers -- An Agentic AI Framework for Peer-Based Mental Health Support in Battlefield Environments

Framework agentic IA pour soutien psychologique par pairs en environnement militaire. Soldats formés comme facilitateurs pairs supervisent des agents IA spécialisés (triage, interventions, documentation) en settings sans connectivité. Prototype développé avec U.S. Army Health Center. Objectif : réduire évacuations, accélérer prise en charge, maintenir supervision humaine.

Agents IAMulti-agentsSécurité IA
SIG
72
HYP
28
arXiv cs.AI·

Interactive Evaluation Requires a Design Science

Position paper sur l'évaluation interactive des LLM. Les modèles déployés comme systèmes agissant dans le temps (outils, environnements, agents) nécessitent un paradigme d'évaluation distinct des benchmarks statiques. Les auteurs proposent une taxonomie, des principes de design et des standards de reporting pour évaluer processus, récupérabilité, coordination, robustesse et performance système.

Agents IAÉvaluationsBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation

Un framework PPE utilise des estimateurs de densité one-class avec embeddings textuels fusionnés pour détecter les fuites de données contextuelles dans les systèmes RAG. Le détecteur T3+OCSVM atteint 0.93+ AUROC, réduit les faux positifs de 44-55 points et maintient une latence millisecondes, surpassant les classifieurs MLP supervisés et les juges LLM 14B.

RAGSécurité IAEmbeddings
SIG
72
HYP
18
arXiv cs.AI·

NeuroRVQ: Multi-Scale Biosignal Tokenization for Generative Foundation Models

NeuroRVQ est une famille de tokenizers biosignaux adaptée à chaque modalité (EEG, ECG, EMG) utilisant des convolutions multi-échelles et des codebooks RVQ hiérarchiques pour préserver les dynamiques haute fréquence. Les modèles fondamentaux NeuroRVQ-FM entraînés avec masquage de tokens atteignent des performances compétitives ou supérieures aux modèles spécialisés existants.

PapersBenchmarksEmbeddings
SIG
72
HYP
18
arXiv cs.AI·

Extracting latent representations from X-ray spectra. Classification, regression, and accretion signatures of Chandra sources

Autoencoder transformer compresse les spectres X du catalogue Chandra en représentation 8D. Classification de 8 types astrophysiques : ~40% de précision globale, ~69% sur AGN/objets compacts. Les features latentes corrèlent avec propriétés spectrales et temporelles, capturant l'information physique aussi bien que les features manuelles.

BenchmarksVision
SIG
72
HYP
15
arXiv cs.AI·

Causal Bias Detection in Generative Artificial Intelligence

Article arXiv proposant un cadre théorique pour détecter les biais causaux dans les modèles génératifs IA. Les auteurs formalisent la notion de fairness causale spécifique aux modèles génératifs (vs ML classique), dérivent des décompositions causales pour quantifier les impacts de biais selon différents chemins causaux, et démontrent leur méthodologie en analysant les biais de race et genre dans les LLM.

PapersSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.AI·

Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents

CMI (Causal Memory Intervention) sélectionne les souvenirs pertinents pour les agents LLM long-horizon via interventions causales contrôlées, plutôt que par similarité sémantique. Benchmark Causal-LoCoMo introduit avec mémoires utiles, distracteurs et souvenirs nuisibles synthétiques. CMI surpasse baselines (vector, graph, reflection, summary) en robustesse face aux mémoires trompeuses.

Agents IARaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

GraViti: Graph-Level Variational Autoencoders with Relaxed Permutation Invariance

GraViti est un autoencodeur variationnel basé transformer pour les graphes entiers, produisant un espace latent au niveau du graphe. Sur des benchmarks moléculaires, le modèle apprend à décoder des échantillons valides respectant les contraintes chimiques. L'étude montre que l'invariance de permutation peut nuire à la reconstruction cohérente quand un ordre canonique existe.

PapersBenchmarksGénération de code
SIG
72
HYP
18
arXiv cs.AI·

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

VLATIM, un nouveau benchmark basé sur The Incredible Machine 2, évalue les capacités de raisonnement logique des Vision-Language Models dans des jeux de puzzle point-and-click. Les résultats montrent un écart significatif : les grands modèles propriétaires excellent en planification mais échouent en localisation visuelle précise, sans atteindre les capacités humaines.

VisionRaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

Leveraging Graph Structure in Seq2Seq Models for Knowledge Graph Link Prediction

GA-S2S combine un encodeur-décodeur T5-small avec un Relational Graph Attention Network pour la prédiction de liens dans les graphes de connaissances. Le modèle encode conjointement les caractéristiques textuelles et la topologie complète du sous-graphe k-hop autour de l'entité requête, capturant les motifs relationnels multi-hop. Sur CoDEx, GA-S2S surpasse les baselines Seq2Seq avec un gain de 19% en précision.

BenchmarksPapers
SIG
72
HYP
18
arXiv cs.AI·

To Trust or Not to Trust: Authors' Response to AI-based Reviews

Étude sur 56 auteurs de 40 articles : 83,9% trouvent les revues IA utiles, 80,4% rapportent que l'IA identifie des problèmes manqués par les humains, 82,1% intègrent le feedback IA dans leur version finale. Cependant, les auteurs font moins confiance à l'IA qu'aux humains (51,8% signalent des inexactitudes mineures, 16,1% des erreurs graves). 96,4% accepteraient l'IA comme outil interne de révision avant soumission.

ÉvaluationsSécurité IARégulation
SIG
72
HYP
25
arXiv cs.AI·

SENSE: Satellite-based ENergy Synthesis for Sustainable Environment

SENSE est un framework génératif basé sur diffusion qui synthétise conjointement des images satellite urbaines réalistes et des cartes d'énergie/hauteur de bâtiments alignées. Testé sur NYC, Boston, Lyon et Busan, il génère des données annotées avec <20% de données étiquetées, améliorant la performance de prédiction de 10% IoU et réduisant l'erreur de 3-11% NMBE.

Génération d'imagesGénération de codeBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I est un framework qui synthétise automatiquement des rubrics explicites pour évaluer l'alignement texte-image via des juges Vision-Language Model. Utilisant <0.01% des données d'annotation requises par les modèles de récompense traditionnels, il surpasse les baselines sur MMRB2 et améliore la qualité de génération avec Flow-GRPO sur modèles de diffusion.

Génération d'imagesVisionÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

The Journal of Prompt-Engineered (Moral) Philosophy Or: Why AI-Assisted Ethics Research Requires Process Transparency

Article sur la transparence requise dans la recherche éthique assistée par IA. Les auteurs argumentent que l'évaluation des résultats seule est insuffisante ; ils proposent un cadre de documentation basé sur l'intégrité de l'agent, incluant déclaration, navigation, documentation et registres de développement. Le papier lui-même applique ce cadre avec archives persistantes.

Prompt engineeringSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.AI·

GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning

GraphMind intègre GNN et LLM pour le raisonnement multi-étapes en mathématiques. Le framework modélise le processus de preuve comme un graphe hétérogène évolutif où nœuds (conditions, théorèmes, conclusions) et arêtes (dépendances logiques) permettent la sélection contextuelle de théorèmes et la génération itérative de conclusions. Résultats améliorés sur benchmarks QA.

RaisonnementAgents IABenchmarks
SIG
72
HYP
28
arXiv cs.AI·

MATE: Solving Contextual Markov Decision Processes with Memory of Accumulated Transition Embeddings

MATE est une architecture mémoire pour résoudre les processus décisionnels de Markov contextuels (CMDP). Elle remplace la distribution a posteriori intractable par une mémoire agrégée par somme, évitant les coûts de calcul croissants des Transformers et les problèmes de gradient des RNN. Les évaluations montrent des avantages computationnels avec performance comparable aux baselines.

RaisonnementReinforcement learningPapers
SIG
72
HYP
15
arXiv cs.AI·

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers

Article théorique proposant des optimiseurs respectant les symétries des architectures neuronales modernes. Introduit des règles de mise à jour équivariantes pour embeddings, têtes LM, MLPs SwiGLU et routeurs MoE. Validation sur modèles denses et sparse MoE (Qwen3, Gemma 3, OLMoE, gpt-oss) montrant amélioration de la perte de validation vs AdamW.

PapersReinforcement learningBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

MetaCogAgent: A Metacognitive Multi-Agent LLM Framework with Self-Aware Task Delegation

MetaCogAgent est un framework multi-agent LLM où chaque agent évalue sa compétence avant d'exécuter une tâche via une Metacognitive Self-Assessment Unit. Le système combine évaluation d'incertitude et profils historiques pour router les tâches vers les agents les plus adaptés. Sur le benchmark MetaCog-Eval (700 tâches), il atteint 82.4% de précision (+8.7% vs baselines) avec 5% moins d'appels API qu'AutoGen.

Multi-agentsAgents IARaisonnement
SIG
72
HYP
28