Page 73 sur 192

ToutHaut signalRécent
7679 articles
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> IBM /</span> mcp-context-forge

IBM lance mcp-context-forge, une passerelle IA et registre proxy pour MCP, A2A et APIs REST/gRPC. Unifie les endpoints avec découverte centralisée, garde-fous et gestion. Optimise l'appel d'agents et d'outils, supporte les plugins.

MCPAgents IAOutils
SIG
72
HYP
28
Reddit r/LocalLLaMA·

The Gap Between Claude and Local: Can a Self-Hosted Coding Agent Compete?

Comparaison pratique entre Claude Opus 4.7 et des modèles locaux (OpenCode) pour un agent de codage. Test sur une suite Playwright E2E (Laravel 12 + Livewire) : Claude génère 203 tests sans compaction de contexte (1M tokens), l'agent local plafonne à 140 tests avec 4 compactions sur 24GB RTX 4090. Conclusion : viable mais pas quotidien ; la qualité du plan prédit celle de l'implémentation.

ClaudeAgents IAGénération de code
SIG
72
HYP
28
The Decoder·

New open-source voice model listens nonstop and decides every 0.4 seconds whether to speak or stay silent

Un modèle vocal open-source écoute en continu et décide toutes les 0.4 secondes s'il doit parler ou rester silencieux. Contrairement à GPT-4o ou Qwen3.5-Omni, Audio Interaction traite transcription, traduction et chat en flux unique, détectant bruits ambiants (toux). Code, poids et données d'entraînement disponibles sur GitHub sous licence Apache 2.0.

VoixOpen sourceAgents IA
SIG
72
HYP
35
arXiv cs.AI·

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

OPT* est une famille de tâches d'optimisation pour entraîner le raisonnement pas-à-pas des LLM sur des espaces de recherche croissants. Les auteurs proposent deux régimes : optimisation en ligne guidée par solveur (utilisant un oracle de valeur) et RL hors ligne basé sur la recherche. L'entraînement améliore le raisonnement d'optimisation itérative.

RaisonnementReinforcement learningBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

GuardNet est un système de garde-fou basé sur un ensemble de réseaux de neurones peu profonds (BiLSTMs, 47M paramètres) pour détecter les attaques par injection de prompt et jailbreak sur LLMs. L'approche privilégie la diversité des exemples et le calibrage des seuils plutôt que la taille du modèle. Performance : AUROC 0.747 sur dataset aveugle (n=200), F1 0.92 sur benchmark propriétaire, latence ~50ms CPU.

Sécurité IABenchmarksLlama
SIG
72
HYP
25
arXiv cs.AI·

SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

SciVisAgentSkills propose une collection de compétences réutilisables pour augmenter les agents de codage (Codex, Claude Code) dans l'analyse et la visualisation de données scientifiques. Évalué sur 108 tâches multi-étapes avec SciVisAgentBench, le framework améliore les performances en encodant l'expertise spécifique aux outils ParaView, napari, VMD et TTK.

Agents IAGénération de codeBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

SentinelBench: A Benchmark for Long-Running Monitoring Agents

SentinelBench est un benchmark open-source pour évaluer les agents IA sur des tâches de monitoring long terme (minutes à heures). Il contient 100 tâches dans 10 environnements web synthétiques (email, calendriers, finance, réseaux professionnels). Le benchmark mesure le temps de réaction, l'utilisation de ressources et la complétion de tâches, révélant le compromis entre réactivité et coût.

Agents IABenchmarksÉvaluations
SIG
72
HYP
25
arXiv cs.AI·

EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts

EpiEvolve est un agent auto-évolutif qui adapte un modèle LLM de prévision épidémiologique en streaming sans modifier ses poids. Via mémoire épisodique hiérarchique et réflexion sur les erreurs, il atteint 0.629 de précision sur les hospitalisations COVID-19 (vs 0.561 pour le modèle statique), réduisant le délai de récupération après changement de régime de 5 à 2 semaines.

Agents IARaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

An interpretable and trustworthy AI framework for large-scale longitudinal structure-pain association studies using data from the Osteoarthritis Initiative (OAI)

Framework IA combinant deep learning pour prédiction MOAKS (score OA du genou) et modélisation statistique longitudinale. Sur 2,175 genoux (Osteoarthritis Initiative), amélioration MCC : BML 0.69→0.91, cartilage 0.45→0.80, extrusion méniscale 0.59→0.89. Deux trajectoires de douleur identifiées ; lésions osseuses, perte cartilagineuse et extrusion méniscale associées à progression rapide (OR 1.62-2.50).

VisionÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

I Know What You Meme, Even If it Emerged Today: Understanding Evolving Memes through Open-World Knowledge Acquisition

Cadre Query Retrieve Conclude pour interpréter les mèmes multimodaux émergents via acquisition de connaissances open-web. Identifie les lacunes de savoir, récupère des preuves externes, synthétise des connaissances contextuelles. Benchmark curé 2024-2026 avec annotations. Améliore compréhension et détection sur trois datasets.

VisionRAGBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Uncertainty Aware Functional Behavior Prediction and Material Fatigue Assessment for Circular Factory

Cadre de prédiction fonctionnelle avec quantification d'incertitude pour évaluer la réutilisabilité de produits retournés en usine circulaire. Combine encodeur convolutif + LSTM pour prédire 9 variables fonctionnelles (moyenne/variance gaussienne) et analyse de fatigue matériau par éléments finis. Précision 96,52% sur tests retenus.

Reinforcement learningÉvaluationsBenchmarks
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Running Qwen3.6-35B-A3B on a laptop RTX 4060 (8GB) — what worked, what didn't, and a surprising speculative-decoding result

Utilisateur optimise Qwen3.6-35B-A3B (MoE 35B/3B actifs) sur RTX 4060 8GB. Configuration finale : --no-mmap critique (11→43 tok/s), ≥1.5GB VRAM libre obligatoire, CPU bottleneck dominant. Speculative decoding +26% (contradictoire vs benchmarks communautaires). Architecture hybride (10 couches attention + 40 GDN) explique résultats contre-intuitifs.

QwenGénération de codeFine-tuning
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Microsoft should've released something like Qwen3.6-27B / Gemma-4-31B already. They released MAI models now

Microsoft lance 7 modèles MAI : MAI-Thinking-1 (1T params, 256K contexte) rivalise avec les meilleurs modèles de sa classe en ingénierie logicielle ; MAI-Code-1-Flash (5B params actifs) intégré à GitHub Copilot et VS Code ; MAI-Image-2.5 pour texte-vers-image et édition ; MAI-Transcribe-1.5 (SOTA, 5x plus rapide) ; MAI-Voice-2 pour synthèse vocale. Pas de poids ouverts annoncés, licences propriétaires.

Génération de codeRaisonnementVision
SIG
72
HYP
35
arXiv cs.CL·

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

AURA est un système d'agents LLM situés qui détecte les besoins implicites au-delà de la requête littérale. Entre la perception de scène et l'utilisation d'outils, il génère un IntentFrame structuré avec un score d'écart pour contrôler le budget de sondage. Sur un benchmark de 100 requêtes, AURA améliore la couverture des besoins implicites de +0.07 (p < 10^-6) par rapport à ReAct.

Agents IARaisonnementÉvaluations
SIG
72
HYP
28
arXiv cs.LG·

GOTabPFN: From Feature Ordering to Compact Tokenization for Tabular Foundation Models on High-Dimensional Data

GOTabPFN introduit une méthode de compression de features pour les modèles tabulaires fondamentaux en régimes haute-dimensionnelle/faible-échantillon. Graph-guided Ordering with Local Refinement (GO-LR) ordonne les features, puis Neuro-Inspired Subunit Compression les agrège en meta-features. Résultats : stabilité et précision améliorées sous contrainte de tokens sur benchmarks tabulaires.

BenchmarksFine-tuningPapers
SIG
72
HYP
18
arXiv cs.CL·

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

Framework d'interprétabilité pour l'évaluation automatique de transcriptions pédagogiques basée sur des rubriques. Combine attributions SHAP avec rationales générées par LLM. Sur 6k segments annotés : modèles fine-tunés surpassent les LLMs en précision mais compressent les scores ; SHAP identifie les phrases déterminantes avec transfert robuste entre architectures, contrairement aux rationales LLM.

ÉvaluationsRaisonnementPapers
SIG
72
HYP
15
arXiv cs.LG·

Towards Unified and Data-Efficient Prognostics and Health Management with Tabular Foundation Models

Un framework applique des modèles fondationnels tabulaires à des séries temporelles industrielles pour la prédiction de durée de vie utile restante et le diagnostic. Convertissant les signaux en lignes tabulaires, ces modèles surpassent les transformers et arbres boostés sur des tâches PHM hétérogènes avec efficacité données élevée.

BenchmarksPapersRaisonnement
SIG
72
HYP
18