Archives

juin 2026

2731 articles

arXiv cs.LG·

MedicalRec: Medical recommender system for image classification without retraining

MedicalRec est un système de recommandation basé transformer pour sélectionner automatiquement le meilleur modèle de classification d'images médicales sans réentraînement. Construit sur MedicalRec-Bench (5000+ enregistrements de modèles testés sur cancer de peau, tumeurs, plaies, cancer du sein, IRM), le système atteint HitRate@100 de 75,5% avec 4 variantes (5-18 features).

BenchmarksVisionOutils
SIG
72
HYP
25
arXiv cs.AI·

Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents

CICL, une couche de contexte décisionnelle, sélectionne et compresse les preuves pertinentes pour les agents LLM utilisant des outils. Sur 50 instances SWE-bench, le réranking Qwen3.6 améliore hit@1 de 0,58 à 0,78 et MRR@10 de 0,634 à 0,790. Le système évalue les unités par impact décisionnel, gain de résultat, nécessité et risque de transfert négatif.

Agents IARAGBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection

SAGE est un framework multi-agent piloté par LLM pour la détection de fraude. Il coordonne trois agents spécialisés utilisant un arbre diagnostique à six couches et un processus de décision Markovien guidé par gradients en langage naturel. Sur cinq datasets de fraude et cinq backbones LLM, SAGE améliore le F1 de 40,86% en moyenne et gagne 96% des comparaisons.

Agents IAMulti-agentsRaisonnement
SIG
75
HYP
25
arXiv cs.AI·

How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

Étude comparative de 24 variantes de modèles (270M-8B) fine-tunés en LoRA pour l'extraction d'informations marchands dans les transactions financières. Qwen 3.5 4B atteint 96.60% F1 (vs 96.95% pour LLaMA 3.1-8B) avec moitié moins de paramètres. Le modèle 0.8B Qwen 3.5 obtient 94.75% F1, rivalisant avec des modèles 2.5-4x plus grands.

Fine-tuningLlamaQwen
SIG
78
HYP
15
arXiv cs.LG·

Outage Detection in Self-Healing Smart Grids Using Reinforcement Learning with Spectral Graph Neural Networks

Cadre de renforcement spectral pour la gestion des pannes dans les réseaux de distribution électrique. Utilise des réseaux de neurones graphiques spectraux pour apprendre une politique optimale de restauration d'énergie. Évalué sur les systèmes de test IEEE 13-bus, 34-bus et 123-bus avec performance quasi-optimale en temps réel.

Reinforcement learningPapers
SIG
72
HYP
18
arXiv cs.AI·

Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

Contract2Tool infère automatiquement des contrats d'outils (préconditions, effets, risques, coûts) à partir de métadonnées, schémas et traces d'exécution. Les contrats appris atteignent 0.980 de succès en tâches multi-étapes, proche des 0.990 avec contrats manuels, tout en réduisant les outils visibles de 100 à 1 et l'usage de tokens de 26,172 à 2,528.

Agents IAOutilsRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models

Étude diagnostique des défaillances dans le respect de la hiérarchie d'instructions par les modèles de raisonnement (Gemma-4-31B-IT, Qwen3.6-35B-A3B, Claude Sonnet 4.6). Framework blanc qui localise les pannes en trois catégories : identification d'instructions, résolution de conflits, réalisation de réponse. Deux mécanismes d'auto-monitoring sans entraînement réduisent les violations de 81-99%.

RaisonnementSécurité IAAlignement
SIG
72
HYP
25
arXiv cs.AI·

Automatic Extraction of Structured Information from Brain MRI Reports Using an Open-Weight Large Language Model

Étude sur l'extraction automatique de données structurées à partir de rapports IRM cérébrale en néerlandais. LLaMA 3.1 atteint 90-96% de précision pour les scores visuels (atrophie temporale médiale, atrophie corticale globale, Fazekas), 93% pour la détection de microhémorragies, mais 66-80% pour les variables numériques. Le few-shot prompting améliore les résultats numériques (92% pour microhémorragies).

LlamaPrompt engineeringÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

Étude empirique d'agents IA généralistes sur un pipeline neuroscience (optogénétique). Les agents résolvent des étapes individuelles mais échouent sur l'end-to-end : manque de critères d'itération prédéfinis, faiblesse en jugement scientifique et interprétation visuelle. Défis absents des benchmarks : gestion des ressources, généralisation sur données massives.

Agents IAGénération de codeÉvaluations
SIG
72
HYP
18
Reddit r/LocalLLaMA·

2X tk/s (from 19.4 -> 38.1 tk/s on 1 x MI50) Playing with a hypothesis like speculative decoding.. but instead of an additional side model, exploiting that I can run multiple computations side-by-side AS IF I had Qwen3.6-27B loaded twice in memory - small quants don't use all the available compute.

Optimisation de décodage spéculatif : doublement du débit (19.4 → 38.1 tk/s sur MI50) en exécutant plusieurs calculs parallèles avec le même modèle quantifié Q8, exploitant que les petites quantifications n'utilisent que 25% de la puissance de calcul disponible.

Open source
SIG
65
HYP
25
Reddit r/LocalLLaMA·

I fine-tuned Parakeet 0.6B for medical ASR — open weights, local Mac/CUDA/CPU

Fine-tuning de Parakeet 0.6B pour la transcription médicale en poids ouverts (CC-BY-4.0). Omi Med STT v1 atteint 2.37% M-WER (erreurs sur termes cliniques) vs 8.36% du modèle de base, avec 145× RTFx. Runtime multi-plateforme (MLX/NeMo/GGUF). Benchmark sur 1,513 clips médicaux : surpasse Whisper Large v3 Turbo et Qwen3 ASR en précision clinique.

Open sourceGénération de codeBenchmarks
SIG
82
HYP
18
The Decoder·

Microsoft Research's Lens proves detailed captions matter more than raw scale for training efficient image generators

Microsoft Research présente Lens, un modèle texte-vers-image de 3,8 milliards de paramètres qui égale des rivaux bien plus grands sur les benchmarks, avec un coût d'entraînement réduit. La clé : 800 millions de captions détaillées générées par GPT-4.1 au lieu de textes alt vagues. Code et poids disponibles en open-source.

Génération d'imagesBenchmarksOpen source
SIG
78
HYP
25
Reddit r/LocalLLaMA·

An Implementation of NanoQuant: A flexible binary quantization method

NanoQuant est une méthode de quantification post-entraînement qui compresse les modèles transformers denses à 1-bit et sub-1-bit par poids. L'implémentation utilise une factorisation en matrices binaires avec vecteurs d'échelle, permettant des ratios de compression jusqu'à 16x sur matrices f16. Une étape de fine-tuning est nécessaire pour aligner les sorties quantifiées.

Open sourcePapersFine-tuning
SIG
72
HYP
25
Reddit r/LocalLLaMA·

I bundled a fully local LLM inside my Unity game. No internet, no cloud, no API key. The conversation is the gameplay.

Un développeur a intégré un LLM local dans son jeu Unity 'Simulation Simulator', sans internet ni API. Le gameplay repose sur des conversations naturelles avec une IA qui génère 5 fins différentes selon les interactions. Le jeu explore la théorie de la simulation et la philosophie via un dialogue organique et non-scriptés.

LlamaGénération de codeAgents IA
SIG
65
HYP
45
Reddit r/LocalLLaMA·

Looking for a local "NotebookLM for lawyers" setup – what am I doing wrong?

Un avocat cherche à construire un système local de RAG pour analyser des dossiers judiciaires (correspondances, contrats, décisions) avec citations. Après tests sur Qwen 3.5 9B et gpt-oss-20b via LM Studio + Big RAG, il rencontre deux problèmes : vitesse insuffisante (~2.2 tok/s) et refus du modèle de citer ses propres documents, générant des explications génériques au lieu d'analyses basées sur le contexte fourni.

RAGQwenOpen source
SIG
35
HYP
15
Reddit r/MachineLearning·

LLM Relational Intelligence: A 4-Month Research Experiment on Multi-Model Behavioral Alignment with Human Communication [R]

Expérience de 4 mois testant si les fenêtres de contexte peuvent être engineered pour que les modèles frontière (GPT, Claude, Gemini, Grok) interagissent de manière indistinguishable d'une interaction humaine. Gemini montre la meilleure « relational intelligence ». L'auteur traite la fenêtre de contexte comme environnement comportemental plutôt que simple interface.

Prompt engineeringGPTClaude
SIG
35
HYP
65
Reddit r/MachineLearning·

Why I stopped using semantic embeddings for tool selection and switched back to BM25 [D]

Un développeur d'agents a abandonné les embeddings sémantiques pour la sélection d'outils au profit de BM25. Avec 140 outils MCP en production, la similarité cosinus sur descriptions courtes (<50 tokens) échouait (64% accuracy) : les discriminants clés (noms spécifiques) se diluaient dans l'espace embedding. BM25 sur projection texte plate atteint 81% top-1.

Agents IAMCPRAG
SIG
75
HYP
15
Reddit r/LocalLLaMA·

Used local Ollama (gemma4:e4b + nomic-embed-text) to bulk-generate AI summaries for 4300 arXiv papers and push them to a remote Cloudflare DB — pipeline walkthrough

Développeur a construit ArxivExplorer, moteur de recherche sémantique arXiv avec résumés générés par IA. Pipeline local utilise Ollama : gemma4:e4b (8B) pour résumés structurés JSON, nomic-embed-text (137M) pour embeddings 768-dim. 4300 papiers traités, taux succès ~95%, stockage via Cloudflare D1/Vectorize. REST API 100× plus rapide que wrangler.

RAGEmbeddingsOpen source
SIG
75
HYP
25
The Decoder·

Microsoft tightens rules for conflict zones after investigation into Israel's military use of Azure

Microsoft conclut son enquête sur l'utilisation militaire d'Azure par Israël et met en place de nouvelles vérifications des droits humains. Le rapport ne précise pas le contenu réel des données militaires examinées et omet les départs de personnel chez Microsoft Israël. Enjeux : infrastructure cloud, surveillance de masse et sélection de cibles IA à Gaza.

RégulationSécurité IAAlignement
SIG
65
HYP
35
Reddit r/LocalLLaMA·

Been watching real adversarial input hit my detection API for six months. Here's what's actually landing.

Analyse de 6 mois d'attaques réelles contre une API de détection d'injections de prompts (Bordair). Trois patterns dominent : configurations multi-tours invisibles isolément, exploitation du momentum conversationnel, et redéfinition de rôles exploitant l'utilité du modèle. Les classifieurs single-message échouent systématiquement. Défenses stateful recommandées.

Prompt engineeringSécurité IAAgents IA
SIG
72
HYP
28
Reddit r/LocalLLaMA·

Meddies PII: An Open Multilingual De-identification Model for Clinical Text

Meddies PII est un modèle open-source multilingue de dé-identification pour textes cliniques. Il extrait les identifiants patients (noms, numéros de dossier, adresses, dates) tout en préservant les données cliniques pertinentes (symptômes, médicaments, résultats de labo). Dataset synthétique généré avec prompting dynamique, couvrant notes précipitées, formulaires infirmiers, exports JSON/XML et textes multilingues.

Open sourceSécurité IAOutils
SIG
75
HYP
20
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Andyyyy64 /</span> whichllm

Outil open-source pour identifier le meilleur LLM local selon votre matériel. Classement basé sur benchmarks réels et à jour, pas sur le nombre de paramètres. Une commande pour tester instantanément.

Open sourceBenchmarksOutils
SIG
65
HYP
35