Page 36 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

SocraticPO: Policy Optimization via Interactive Guidance

SocraticPO est un framework de policy optimization pour LLMs qui augmente les rollouts RL avec des guidances en langage naturel de style socratique. Un enseignant diagnostique les erreurs et fournit des corrections concises, associées à une décroissance de récompense pour éviter que le modèle ne dépende de l'aide. Testé sur SciKnowEval, il surpasse les baselines RL et auto-distillation.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.CL·

Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

ParaEval, un framework d'évaluation, corrige les biais des benchmarks MCQA en testant les modèles avec plusieurs paraphrases par option. Les scores standards confondent familiarité avec une formulation exacte et vraie compréhension. Sur modèles 1B-8B avec connaissances identiques, ParaEval réduit les écarts de performance artificiels de 2 points à moins de 1 point.

ÉvaluationsBenchmarks
SIG
75
HYP
15
Reddit r/LocalLLaMA·

Releasing Apodex-1.0 Smol Models (0.8B, 2B, 4B Open-Weights) optimized for Agentic Verification + AgentHarness Evals

Apodex-1.0 publie des modèles légers open-weights (0.8B, 2B, 4B) optimisés pour les workflows d'agents locaux. Spécialisés en vérification indépendante et fact-checking dans des boucles agentic, ils remplacent les appels répétés à des modèles 70B+. AgentHarness, le framework d'évaluation, est également open-sourcé.

Agents IAOpen sourceÉvaluations
SIG
75
HYP
35
arXiv cs.LG·

STARIXNet: Multivariate and Multi-attribute Deep Learning Approach to Real-Time Resource Allocation in Cloud Platforms

STARIXNet est un réseau de neurones léger pour l'allocation de ressources en temps réel dans les clouds. Il capture les relations spatio-temporelles entre plusieurs métriques système (saisonnalité, tendance, auto-régression, variables exogènes) et priorise la stabilité des services avant la précision de prédiction. Déployé chez Walmart, il génère 10-50% d'économies.

InfrastructureBenchmarksGénération de code
SIG
75
HYP
25
arXiv cs.LG·

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

LEAF est une méthode RL basée sur des arbres rétrospectifs pour l'entraînement post-training de LLM conscients de la parole. Elle améliore l'attribution de crédit en groupant les réponses par préfixes partagés et assignant des avantages au niveau des spans. LEAF surpasse GRPO sur les benchmarks de question-réponse et traduction vocale.

Reinforcement learningRaisonnementVoix
SIG
75
HYP
15
arXiv cs.AI·

SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection

SAGE est un framework multi-agent piloté par LLM pour la détection de fraude. Il coordonne trois agents spécialisés utilisant un arbre diagnostique à six couches et un processus de décision Markovien guidé par gradients en langage naturel. Sur cinq datasets de fraude et cinq backbones LLM, SAGE améliore le F1 de 40,86% en moyenne et gagne 96% des comparaisons.

Agents IAMulti-agentsRaisonnement
SIG
75
HYP
25
Reddit r/MachineLearning·

Why I stopped using semantic embeddings for tool selection and switched back to BM25 [D]

Un développeur d'agents a abandonné les embeddings sémantiques pour la sélection d'outils au profit de BM25. Avec 140 outils MCP en production, la similarité cosinus sur descriptions courtes (<50 tokens) échouait (64% accuracy) : les discriminants clés (noms spécifiques) se diluaient dans l'espace embedding. BM25 sur projection texte plate atteint 81% top-1.

Agents IAMCPRAG
SIG
75
HYP
15
Reddit r/LocalLLaMA·

Used local Ollama (gemma4:e4b + nomic-embed-text) to bulk-generate AI summaries for 4300 arXiv papers and push them to a remote Cloudflare DB — pipeline walkthrough

Développeur a construit ArxivExplorer, moteur de recherche sémantique arXiv avec résumés générés par IA. Pipeline local utilise Ollama : gemma4:e4b (8B) pour résumés structurés JSON, nomic-embed-text (137M) pour embeddings 768-dim. 4300 papiers traités, taux succès ~95%, stockage via Cloudflare D1/Vectorize. REST API 100× plus rapide que wrangler.

RAGEmbeddingsOpen source
SIG
75
HYP
25
Reddit r/LocalLLaMA·

Meddies PII: An Open Multilingual De-identification Model for Clinical Text

Meddies PII est un modèle open-source multilingue de dé-identification pour textes cliniques. Il extrait les identifiants patients (noms, numéros de dossier, adresses, dates) tout en préservant les données cliniques pertinentes (symptômes, médicaments, résultats de labo). Dataset synthétique généré avec prompting dynamique, couvrant notes précipitées, formulaires infirmiers, exports JSON/XML et textes multilingues.

Open sourceSécurité IAOutils
SIG
75
HYP
20
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> magenta /</span> magenta-realtime

Magenta RealTime 2 est un modèle open-weights de Google pour la génération musicale en temps réel. Il permet de créer de la musique live avec latence minimale, accessible via open-source.

DeepMindOpen source
SIG
75
HYP
25
arXiv cs.AI·

Online Pandora's Box for Contextual LLM Cascading

Papier arXiv proposant un modèle contextuel en ligne pour optimiser les requêtes à plusieurs APIs LLM. Le cadre « Pandora's Box » adapte la sélection d'APIs selon le contexte, avec une phase de requête (coût dépendant de la sortie) et une phase de sélection (récompense observée). L'approche combine estimation GMM des indices de réservation et bornes UCB, atteignant une regret cumulée en Õ(√T).

Agents IARaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.LG·

ShallowBench: Benchmarking Generative Drug Design Models on Shallow-Pocket Targets

ShallowBench est un benchmark de 5 780 cibles protéiques à poches peu profondes extrait de CrossDocked2020, conçu pour évaluer les modèles génératifs de conception de médicaments sur des cibles difficiles comme KRAS et MYC. Les modèles actuels montrent une affinité de liaison prédite plus faible sur ces interfaces à faible concavité, révélant le besoin d'innovations architecturales nouvelles.

BenchmarksGénération de codePapers
SIG
75
HYP
20
arXiv cs.AI·

A Geometric Account of Activation Steering through Angle-Norm Decomposition

Étude empirique sur le steering d'activation dans les modèles de langage. Les auteurs décomposent les interventions en composantes angulaires et radiales, montrant que les concepts résident principalement dans la structure angulaire mais que la norme reste importante pour la stabilité. Recommandation : paramétrer le steering par composantes interprétables plutôt que par un coefficient additif unique.

RaisonnementAlignementPapers
SIG
75
HYP
15
arXiv cs.LG·

RECAP: Regression Evaluation for Continual Adaptation of Prompts

RECAP est un benchmark mesurant l'adaptation continue de prompts sous contraintes évolutives en production. Six méthodes d'optimisation de prompts évaluées sur quatre LLMs montrent aucune amélioration significative en protocole proactif (adaptation avant test). Les approches actuelles, conçues pour cadres offline/réactifs, échouent en déploiement avec contraintes changeantes.

Prompt engineeringAgents IABenchmarks
SIG
75
HYP
15
arXiv cs.LG·

Spatiotemporal Imputation with Graph-Informed Flow Matching

GiFlow, un framework de flow matching informé par graphe, résout l'imputation de données manquantes dans les systèmes spatiotemporels (qualité de l'air, trafic urbain). Il remplace le prior gaussien standard par un prior construit via filtrage spatiotemporel, et utilise un modèle de champ vectoriel hybride combinant attention spatiale, attention temporelle et propagation spatiotemporelle. Code disponible.

PapersBenchmarksRaisonnement
SIG
75
HYP
15
arXiv cs.LG·

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

Les LLM exécutent habituellement tous les layers dans un ordre fixe. Cette recherche révèle que des exécutions dynamiques (PoLar) peuvent sauter ou boucler les layers selon chaque input, réduisant la profondeur tout en maintenant ou améliorant la précision. Un réseau de prédiction léger génère des programmes d'exécution personnalisés, améliorant les résultats sur les benchmarks de raisonnement mathématique.

RaisonnementBenchmarksPapers
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> ggml-org /</span> llama.cpp

llama.cpp est un projet C/C++ pour l'inférence de modèles LLM. Disponible sur GitHub, il permet d'exécuter des modèles de langage de manière efficace en C/C++.

LlamaGénération de codeOpen source
SIG
75
HYP
15