Page 44 sur 192

ToutHaut signalRécent
7679 articles
Reddit r/LocalLLaMA·

Moved from prompt-based output validation to schema-enforced execution — the reliability numbers are significant

Comparaison systématique de deux approches pour générer des sorties structurées avec Claude : instructions textuelles + parsing post-génération (65-70% de succès) vs tool_use avec schémas typés et contraintes enum (90-95%+). La validation au niveau API élimine les erreurs de parsing et réduit drastiquement le débogage en aval.

ClaudePrompt engineeringOutils
SIG
75
HYP
15
Reddit r/LocalLLaMA·

HalBench: I built a custom sycophancy and hallucination benchmark and tested 4 frontier models (Sonnet 4.6, Grok 4.3, GPT 5.4 and Gemini 3.1 Pro), looking for input on what OSS models to run next!

HalBench : benchmark open-source mesurant la sycophantie et les hallucinations sur 3 200 prompts à fausses prémisses testés sur 4 modèles (Sonnet 4.6, Grok 4.3, GPT-5.4, Gemini 3.1 Pro). Sonnet 4.6 obtient 0.565/1, Grok 4.3 0.498, GPT-5.4 0.381, Gemini 3.1 Pro 0.339. Dataset, code et résultats publics.

BenchmarksÉvaluationsSécurité IA
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> azure-devops-mcp

Microsoft publie un serveur MCP pour Azure DevOps, permettant aux agents IA d'accéder directement aux fonctionnalités Azure DevOps.

MCPAgents IAOutils
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> vllm-project /</span> vllm

vLLM est un moteur d'inférence et de serving haute performance pour LLMs, optimisé pour le débit et l'efficacité mémoire.

InfrastructureOpen source
SIG
75
HYP
15
arXiv cs.AI·

Not all uncertainty is alike: volatility, stochasticity, and exploration

Article théorique sur l'exploration adaptative en environnements incertains. Distingue volatilité (drift des récompenses) et stochasticité (bruit d'observation) : la première augmente l'exploration optimale, la seconde la réduit. Propose CAUSE, bonus d'exploration en forme fermée via control-as-inference, validé sur bandits gaussiens avec dynamiques latentes.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.CL·

Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations

Les explications en anglais pour auditer des LLM multilingues masquent un compromis : elles obtiennent un meilleur accord avec les rationales humaines mais perdent leur ancrage causal dans les prédictions du modèle. Sur 3 tâches et 5 langues, la compréhensibilité se dégrade jusqu'à 5,7x en pivot anglais, même avec une précision stable. Les auteurs recommandent d'auditer dans la langue d'entrée.

Évaluations
SIG
75
HYP
15
arXiv cs.LG·

Emergence of Frontier Superposition: M\"obius attractor and Cascade Supervision

Article théorique sur l'émergence de superposition dans les Transformers pour le raisonnement en profondeur. Identifie un attracteur de Möbius sous symétrie S_n et une supervision en cascade qui permettent à la descente de gradient de converger vers un état de superposition équipondéré sur graphes Erdős-Rényi. Prédictions analytiques validées expérimentalement (cosinus final 0.37 vs 0.69).

RaisonnementPapersReinforcement learning
SIG
75
HYP
15
arXiv cs.LG·

Symmetry in the Wild: The Role of Equivariance in Neural Fluid Surrogates

Les architectures équivariantes améliorent les surrogates neuraux pour la dynamique des fluides (CFD) lorsque les données manquent de régularités fortes, mais dégradent les performances sur des datasets fortement alignés. AB-GATr, un transformateur géométrique E(3)-équivariant, surpasse l'augmentation de données sur aérodynamique automobile et hémodynamique.

RaisonnementBenchmarksPapers
SIG
75
HYP
15
arXiv cs.CL·

OpenCompass: A Universal Evaluation Platform for Large Language Models

OpenCompass est une plateforme d'évaluation open-source pour LLM proposant une architecture modulaire avec 5 composants clés : système de configuration, partitionnement de tâches, exécution/ordonnancement, unité d'exécution et visualisation. Supporte évaluateurs rule-based, LLM-as-a-Judge et en cascade sur benchmarks multi-domaines (connaissance, raisonnement, code, science).

BenchmarksÉvaluationsOpen source
SIG
75
HYP
25
arXiv cs.LG·

PROWL: Prioritized Regret-Driven Optimization for World Model Learning

PROWL introduit un curriculum adversarial avec contrainte KL pour améliorer la robustesse des world models vidéo. Une politique expose les trajectoires haute-erreur d'un modèle diffusion tandis qu'un buffer PAT (Prioritized Adversarial Trajectory) re-classe les données selon l'erreur de prédiction et le progrès d'apprentissage. Évaluation sur MineRL montre une robustesse accrue sur trajectoires OOD.

RaisonnementReinforcement learningPapers
SIG
75
HYP
15
arXiv cs.AI·

MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization

MOCHA est un algorithme d'optimisation multi-objectif pour affiner les skills d'agents LLM. Il utilise la scalarisation de Chebyshev et l'annealing exponentiel pour explorer la frontière de Pareto complète, y compris les régions non-convexes. Sur 6 tâches, MOCHA améliore la performance de 7,5% en moyenne (jusqu'à 14,9% sur FEVER) tout en découvrant deux fois plus de variantes Pareto-optimales que les baselines.

Agents IAPrompt engineeringReinforcement learning
SIG
75
HYP
25
arXiv cs.AI·

Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models

Étude des attaques jailbreak contre les modèles de raisonnement (LRM) via apprentissage par renforcement. Les chercheurs montrent que le taux de succès des attaques corrèle avec les patterns d'attention du modèle. Ils proposent une méthode RL intégrant des signaux d'attention dans la fonction de récompense, testée sur 5 LRM avec résultats supérieurs en efficacité et transférabilité.

RaisonnementReinforcement learningSécurité IA
SIG
75
HYP
35
Reddit r/LocalLLaMA·

An overview of modern LLM compiler stack: writing an interactive and hackable compiler

Un développeur a construit un compilateur ML minimaliste en Python/CUDA pur, sans dépendances externes. Il abaisse des transformers (TinyLlama, Qwen2.5-7B) via 6 IRs successifs jusqu'à des kernels CUDA. Sur RTX 5090, performance à 0.96× du stack PyTorch production, avec 32/84 formes de kernel surpassant les optimisations manuelles (jusqu'à 5.6× plus rapide).

Génération de codeInfrastructureOpen source
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> NVlabs /</span> Sana

NVIDIA Labs publie Sana, un modèle de diffusion transformer linéaire pour la synthèse d'images haute résolution. Architecture efficace réduisant la complexité computationnelle tout en maintenant la qualité visuelle.

Génération d'imagesOpen sourcePapers
SIG
75
HYP
25
arXiv cs.CL·

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models

TABOM, une méthode de post-entraînement pour modèles de diffusion linguistiques, aligne l'optimisation sur la trajectoire de décodage multi-étapes facile-vers-difficile observée en inférence. Via une modélisation Boltzmann des préférences de démasquage, elle dérive un objectif de ranking par paires qui réduit le décalage entraînement-inférence et améliore les performances en nouveaux domaines.

Fine-tuningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.AI·

VGGT-CD: Training-Free Robust Registration for 3D Change Detection

VGGT-CD est un pipeline sans entraînement pour la détection de changements 3D à partir d'images multi-vues. Il découple l'enregistrement inter-temporel de l'interférence des changements dynamiques via une inférence conjointe d'images-clés et une purification des reconstructions denses. Sur le benchmark World Across Time, il réduit l'erreur de trajectoire de 44% en extérieur et 59% en intérieur, 6× plus rapide.

VisionBenchmarksPapers
SIG
75
HYP
15
arXiv cs.AI·

Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation

RAT (Randomized Advantage Transformation) estime les gradients de politique naturelle régularisés via rétropropagation directe, sans construire explicitement la matrice de Fisher. La méthode utilise la formule de Woodbury et les itérations de Kaczmarz aléatoires sur mini-batches on-policy. Résultats comparables ou supérieurs aux méthodes de gradient naturel établies sur benchmarks de contrôle continu et visuel.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15