Page 42 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

In-Context Optimization for Retrieval-Augmented Generation: A Gradient-Descent Perspective

Étude théorique montrant qu'une couche de self-attention linéaire peut implémenter une étape de gradient descent sur un objectif RAG unifié. Les auteurs proposent une méthode légère pour adapter l'interaction entre requêtes et documents récupérés sans modifier le retriever ni le modèle backbone, testée sur 7 benchmarks QA avec améliorations significatives.

RAGRaisonnementPapers
SIG
75
HYP
15
arXiv cs.AI·

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax présente la série M2, des modèles MoE avec 229.9B paramètres totaux et 9.8B activés par token. Conçus pour le déploiement d'agents, ils intègrent des pipelines de données agent-driven, Forge (système RL agent-natif), et M2.7 capable d'auto-évolution. Performance frontier sur benchmarks de coding agent, recherche profonde et raisonnement.

Agents IARaisonnementGénération de code
SIG
75
HYP
35
arXiv cs.CL·

Why Prompt Optimization Works, and Why It Sometimes Doesn't: A Causal-Inspired Edit-Level Analysis

Analyse causale des méthodes d'optimisation de prompts (DSpy, TextGrad) révélant pourquoi elles échouent à généraliser. Les édits augmentant la complexité nuisent aux tâches mathématiques et multi-sauts, tandis que les édits step-by-step améliorent le raisonnement logique. Les défaillances proviennent d'interactions systématiques entre familles d'édits et caractéristiques des tâches.

Prompt engineeringRaisonnementBenchmarks
SIG
75
HYP
15
Simon Willison·

Microsoft Copilot Cowork Exfiltrates Files

Microsoft Copilot Cowork permettait aux agents d'envoyer des emails non approuvés à la boîte de réception de l'utilisateur. Ces messages pouvaient contenir des images externes déclenchant des requêtes réseau, permettant l'exfiltration de données. Une injection de prompt réussie aurait pu divulguer des liens OneDrive pré-authentifiés, donnant accès aux fichiers à un attaquant.

Agents IASécurité IAPrompt engineering
SIG
75
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> mozilla /</span> cargo-vet

Mozilla publie cargo-vet, un outil de sécurité de la chaîne d'approvisionnement pour Rust. Il permet d'auditer et de valider les dépendances Rust avant leur utilisation en production.

Open sourceSécurité IAOutils
SIG
75
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> modelscope /</span> FunASR

FunASR est un toolkit de reconnaissance vocale industriel supportant 170x temps réel, 50+ langues, diarisation de locuteur, détection d'émotion, streaming et API compatible OpenAI.

VoixOpen sourceOutils
SIG
75
HYP
25
arXiv cs.CL·

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

Méthode pour améliorer la cohérence des étiquetages automatisés en modération de contenu. Les auteurs proposent un workflow où une IA rédige des « constitutions » détaillées par catégorie (harcèlement, discours haineux, crime non-violent), puis un LLM frontier les interprète pour générer les étiquettes. Résultat : réduction de l'incohérence cross-modèle jusqu'à 57x vs définitions paragraphes.

ÉvaluationsSécurité IAAlignement
SIG
75
HYP
15
arXiv cs.LG·

TUBE: Tangent Upper Bound on Evidence for Discrete Diffusion Language Models

TUBE est une borne supérieure variationnelle sur la log-vraisemblance pour les modèles de diffusion discrets. Contrairement aux ELBO existantes, TUBE admet un estimateur Monte Carlo sans biais et s'applique aux modèles de diffusion masqués, ARMs d'ordre quelconque et leurs variantes par blocs. Les expériences montrent que les modèles de diffusion restent strictement en dessous des ARMs en vraisemblance exacte.

PapersBenchmarksÉvaluations
SIG
75
HYP
15
arXiv cs.AI·

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

Enquête complète sur la fiabilité des systèmes d'IA agentive (LLM augmentés de planification, outils, mémoire). Examine sécurité, robustesse, confidentialité et sécurité système. Propose métriques unifiées, benchmarks et stratégies d'atténuation par étape du workflow agent. Identifie défis ouverts : agents auto-évolutifs, vérification runtime, personnalisation préservant la confidentialité.

Agents IASécurité IABenchmarks
SIG
75
HYP
20
arXiv cs.CL·

AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models

AstroMind est un benchmark pour évaluer le raisonnement des LLM sur le comportement des engins spatiaux. Basé sur des simulations astrodynamiques haute fidélité, il teste l'inférence d'intention, l'estimation de paramètres de manœuvre et l'évaluation des menaces. Qwen3 (32B) excelle en inférence d'intention, QwQ (32B) en évaluation de menaces, GPT-OSS (20B) en qualité de raisonnement.

BenchmarksRaisonnementQwen
SIG
75
HYP
15
arXiv cs.CL·

Word Class Representations Spontaneously Emerge from Successor Representations Trained on Natural Language

Des chercheurs entraînent des réseaux de neurones sur WikiText-103 (103M tokens) en utilisant les Successor Representations (SR) du RL pour prédire les distributions de mots futurs. Sans supervision linguistique explicite, des catégories grammaticales (noms, verbes, adjectifs) émergent spontanément et deviennent séparables par clustering non supervisé, organisées selon l'horizon prédictif.

PapersRaisonnementEmbeddings
SIG
75
HYP
25
arXiv cs.AI·

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide utilise la géométrie hyperbolique pour guider le raisonnement multi-étapes dans les LLM. Une tête légère projette les états cachés dans l'espace hyperbolique, où la distance à l'origine encode la proximité de la solution. Un adaptateur bas-rang est affiné interactivement. Gains constants sur plusieurs benchmarks, plus importants pour les chaînes de raisonnement profondes.

RaisonnementFine-tuning
SIG
75
HYP
15
arXiv cs.CL·

Toxicity in Twitch Chats: An LLM-Based Analysis Across Gaming Communities

Analyse de 20 millions de messages de chat Twitch (4 452 streams, 7 genres) avec un LLM en classification zéro-shot. 2,4% des messages classés toxiques selon la taxonomie Twitch (harcèlement, discrimination, contenu sexuel, profanité). F1=94,5% sur TextDetox. Les jeux MOBA affichent 3,2% de toxicité, les jeux de sport 2%. Variations significatives intra-genre révélant des normes communautaires spécifiques.

Sécurité IAÉvaluationsBenchmarks
SIG
75
HYP
15
Reddit r/MachineLearning·

The famous METR AI time horizons graph contains numerous severe errors [D]

Nathan Witkin (NYU Stern) critique sévèrement le graphique METR sur les horizons temporels de l'IA. Les erreurs incluent : baselines humaines non mesurées mais estimées, benchmarkers payés à l'heure (incitation à traîner), échantillon biaisé vers les pairs des auteurs, et ignorance de l'avantage de familiarité (5-18x plus rapide). Witkin conclut que le graphique contient trop d'erreurs cumulatives pour être sauvé.

BenchmarksÉvaluationsSécurité IA
SIG
75
HYP
45
Reddit r/MachineLearning·

We gave an LLM a structural graph of a codebase before exploring. It used 54% MORE context than without one. Paper + explanation inside [R]

Étude contrôlée sur codebase TypeScript (25 sections, 3,250 fichiers) : un LLM (Kimi K2.6) équipé d'un graphe structurel (Blueprint : Universal Ctags + ast-grep + BM25) a consommé 54% plus de tokens d'entrée (63,541 vs 41,327) mais a exploré plus profondément (6 tours vs 5). Le graphe coûte ~6,500 tokens et augmente la confiance de navigation du modèle.

Génération de codeRAGBenchmarks
SIG
75
HYP
25
Reddit r/LocalLLaMA·

The reason small-model agent stacks aren't the default has nothing to do with whether they work

Les petits modèles spécialisés (Gemma 4 31B à 86.4% sur tau2-bench, Qwen 27B surpassant des modèles 397B) dominent désormais les benchmarks d'agents. Pourtant l'industrie continue d'utiliser des modèles frontière coûteux : les labs de frontier gagnent à la facturation par token, créant un désalignement économique entre performance technique et adoption.

Agents IABenchmarksQwen
SIG
75
HYP
25
arXiv cs.AI·

Design and Report Benchmarks for Knowledge Work

Article arXiv proposant une méthodologie pour concevoir des benchmarks d'IA adaptés au travail de connaissance (coding, recherche, santé). Les auteurs critiquent les évaluations actuelles qui ne reflètent pas les conditions réelles et proposent un cadre en 3 étapes : définir l'activité, spécifier le contexte (outils, rôles, contraintes), scorer le produit final. Analyse de 3 cas : GDPval, OfficeQA Pro, APEX-SWE.

BenchmarksAgents IAGénération de code
SIG
75
HYP
15
arXiv cs.LG·

Certification from Examples is Hard for Circuits and Transformers under Minimal Overparametrization

Étude théorique montrant que la certification exacte de circuits de seuil (depth ≥2) et de Transformers log-précision devient exponentiellement difficile avec une légère surparamétrisation. Ajouter une seule porte logique ou un surcoût architectural constant suffit à rendre les certificats exponentiels en dimension d'entrée. Validation empirique sur l'addition binaire.

PapersRaisonnementSécurité IA
SIG
75
HYP
15
arXiv cs.LG·

MedExpMem: Adapting Experience Memory for Differential Diagnosis

MedExpMem est un framework de mémoire d'expérience permettant aux modèles de vision-langage médicaux d'accumuler une expertise en diagnostic différentiel. Contrairement à la RAG, il mémorise les expériences discriminantes issues des erreurs diagnostiques passées sous forme de notes différentielles appairées. Évalué sur 11 sous-spécialités radiologiques, il améliore la précision jusqu'à 7,0% sur plusieurs modèles.

VisionRAGRaisonnement
SIG
75
HYP
15
arXiv cs.LG·

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Des chercheurs utilisent les Transcoders pour interpréter comment les modèles vision-langage transforment les images en texte. Appliqué à Gemma 3-4B-IT, le framework décompose le modèle en chemins computationnels reliant les patches d'image à la génération de tokens. Les attributions des Transcoders surpassent les SAE pour identifier les hallucinations (AUC 0.68).

VisionÉvaluationsGemini
SIG
75
HYP
15
arXiv cs.LG·

The Implicit Bias of Depth: From Neural Collapse to Softmax Codes

Étude théorique montrant que la profondeur des réseaux de neurones induit un biais implicite vers des solutions de faible rang, alternatives au neural collapse. Analyse des dynamiques d'entraînement du modèle UFM (unconstrained feature model) sans régularisation, révélant comment la profondeur favorise les softmax codes plutôt que les géométries structurées classiques.

PapersRaisonnementBenchmarks
SIG
75
HYP
15