Archives

juin 2026

2731 articles

arXiv cs.CL·

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim présente une investigation systématique de modèles fondamentaux pour simuler le comportement humain. Les chercheurs proposent SOUL, une taxonomie de 5 axes (CONV, SS, COG, ROLE, EVAL) unifiant 62 datasets et 23 tâches. Le modèle OSim 8B open-source surpasse les modèles frontier sur 8/23 tâches, avec alignement réactionnel de 93.2% vs 93.5% pour les utilisateurs réels.

BenchmarksRaisonnementReinforcement learning
SIG
78
HYP
25
arXiv cs.LG·

Attention-Based Estimation of the Individual Treatment Benefit Probability under Dose Variation

Dose-AIPTB propose une méthode basée sur l'attention pour estimer la probabilité qu'un traitement bénéficie à un patient individuel sous différentes doses. Le framework reformule le problème en classification binaire du signe de l'effet de traitement individuel, utilisant des comparaisons par paires et agrégation par attention. Code disponible sur GitHub.

RaisonnementÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.LG·

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

Étude arXiv sur les hallucinations médicales des LLM. Système multi-agent « Trust but Verify » testant 3 familles de modèles (GPT-OSS, Llama-3, Falcon-3) sur 103 questions cliniques avec médicaments bannis. Architecture à 5 agents réduit le taux d'hallucination de 53% et force le refus approprié plutôt que la recommandation dangereuse.

Multi-agentsSécurité IAAlignement
SIG
72
HYP
28
arXiv cs.LG·

D2H-AD: A Hybrid Model Utilizing Hyperdimensional Computing for Advanced Anomaly Detection

D2H-AD est un framework de détection d'anomalies basé sur l'Hyperdimensional Computing (HDC). Il combine encodage sensible à la densité et similarité basée sur la distance, surpassant cinq baselines (HDAD, ODHD, One-Class SVM, Isolation Forest, Autoencoders) sur cinq datasets. L'encodage hyperdimensionnel seul atteint +5.4% ROC-AUC. Léger, interprétable, efficace computationnellement : adapté TinyML et edge AI.

BenchmarksÉvaluationsInfrastructure
SIG
72
HYP
28
arXiv cs.AI·

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Every Eval Ever propose un schéma unifié et un dépôt communautaire pour standardiser les résultats d'évaluation IA. Le système ingère 22 235 modèles et 2 273 benchmarks via un format JSON unique, avec convertisseurs automatiques depuis les harnesses populaires et leaderboards. Résout la fragmentation des résultats dispersés en formats incompatibles.

ÉvaluationsBenchmarksOpen source
SIG
82
HYP
18
arXiv cs.AI·

A Temporal Planning Framework for Disruption Aware Dynamic Route Optimization in Heterogeneous Railway Systems

Framework de planification temporelle pour optimiser dynamiquement les itinéraires dans les réseaux ferroviaires hétérogènes multi-écartements. Formule les opérations comme problème PDDL 2.1, modélise contraintes de compatibilité et scénarios de disruption. Évalué sur 200 instances (jusqu'à 1 000 points de voie, 120 trains).

RaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

CacheRL entraîne des petits modèles d'agents (Qwen3-4B-Thinking) atteignant 92% de précision sur tâches multi-étapes avec appels d'outils, soit 100× moins de calcul que GPT-5 (94%). Trois innovations : pipeline de trajectoires avec traces de raisonnement LLM, cache fuzzy trois niveaux éliminant exécutions live, récompenses adaptées au cache. SFT + GRPO améliorent la récompense de validation de 0,43 à 0,78.

Agents IAReinforcement learningRaisonnement
SIG
82
HYP
25
arXiv cs.AI·

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX est une plateforme pour créer des harnesses d'agents IA composables et adaptatifs. Elle utilise AEGIS, un moteur d'évolution multi-agent piloté par les traces d'exécution, pour optimiser les prompts, outils et flux de contrôle. Sur 5 benchmarks (ALFWorld, GAIA, WebShop, tau³-Bench, SWE-bench), HarnessX atteint +14,5% de gain moyen (+44% max), sans augmenter la taille du modèle.

Agents IAMulti-agentsPrompt engineering
SIG
75
HYP
25
arXiv cs.AI·

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit est un framework pour faire évoluer les compétences d'agents LLM sans feedback ground-truth. Via l'audit de trajectoires appariées, le système exécute la même tâche avec et sans la compétence candidate, puis utilise Process-Aligned Contrastive Evaluation pour isoler les changements de comportement. Sur 89 tâches, SkillAudit atteint 73,9% de récompense moyenne vs 56,7% pour la compétence expert statique.

Agents IARaisonnementÉvaluations
SIG
75
HYP
25
arXiv cs.AI·

Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP

Comparaison de deux méthodes d'intervention sur les refus de sécurité dans les modèles de chat : Difference-in-Means (DiM) vs Iterative Nullspace Projection (INLP). Sur 5 modèles open-weight, INLP counterfactual flipping égale DiM en suppression des refus, tandis que nullspace projection est plus faible. Les deux approches opèrent différemment dans l'espace d'activation.

Sécurité IAAlignementPapers
SIG
72
HYP
15
arXiv cs.LG·

Uncertainty Estimation and Generalization Bounds for Modern Deep Learning

Thèse sur les principes bayésiens appliqués aux réseaux de neurones profonds. Introduit DVIP (Deep Variational Implicit Process) pour l'inférence bayésienne scalable, et deux méthodes post-hoc (VaLLA, FMGP) pour calibrer l'incertitude sur réseaux pré-entraînés. Développe un cadre théorique unifié reliant diversité, régularité et stochasticité via la théorie PAC-Bayésienne.

Raisonnement
SIG
72
HYP
15
arXiv cs.CL·

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

MoDiCoL est un dataset de continual learning modulaire pour évaluer la robustesse des systèmes ASR face aux variations réelles (accents, bruits, conditions d'enregistrement, troubles de la parole). Les auteurs proposent un curriculum inspiré du monde réel et évaluent trois stratégies de continual learning pour analyser comment la robustesse se développe, se transfère et s'oublie.

BenchmarksÉvaluationsVoix
SIG
72
HYP
18
arXiv cs.LG·

Neural Slack Variables for Shape Constraints

Nouvelle méthode pour imposer des contraintes d'inégalité (monotonie, convexité) dans les réseaux de neurones via des variables slack neurales. Approche couplant un réseau principal avec un réseau auxiliaire appris conjointement, convertissant l'application de contraintes en problème de régression. Atteint zéro violation mesurée sur tests de monotonie/convexité, surpassant méthodes de pénalité et primal-dual.

PapersRaisonnementFine-tuning
SIG
75
HYP
15
arXiv cs.AI·

Causal Object-Centric Models for Planning with Monte Carlo Tree Search

COMET combine un encodeur object-centric non supervisé avec un world model transformer pour effectuer Monte Carlo Tree Search dans un espace latent structuré. Un mécanisme action-slot fusion lie les actions aux objets. Évalué sur 8 tâches (Object-Centric Visual RL, ManiSkill, Robosuite, VizDoom), COMET surpasse les baselines en phase d'apprentissage précoce.

Reinforcement learningRaisonnementRobotique
SIG
72
HYP
18
arXiv cs.AI·

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo génère des problèmes de géométrie contrôlables via des traces de raisonnement exécutables. Un agent Auteur crée le problème et le diagramme selon les contraintes utilisateur, un agent Solveur produit la preuve. Un pipeline à trois étapes vérifie la cohérence numérique, analytique et globale. Fine-tuning sur 8.7k exemples atteint les meilleures performances GeoQA et résultats forts sur PGPS9K et MathVista-GPS.

RaisonnementVisionBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Does the Judge Prefer English? Evaluating Language-Switching Invariance in LLM-as-a-Judge

Judge-LS évalue si les LLM utilisés comme juges automatiques montrent un biais linguistique. Sur 419 items du benchmark LLMBar transformés en anglais, chinois et variantes mixtes, les modèles affichent 10,7–14,4% de renversements de préférence selon la langue, avec une précision maximale en anglais. Les réponses équivalentes en traduction ne révèlent pas de préférence systématique pour l'anglais.

ÉvaluationsBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

Persuasion Index (PI) est une taxonomie de 15 dimensions fondée sur les théories de la persuasion en psychologie et communication. Implémentation avec 55 sous-features basées sur lexiques et détecteurs. Évaluation sur 4 datasets publics montre que PI fournit un espace de features partagé pour interpréter les patterns rhétoriques. Modèles linéaires légers et interprétables. Package open-source et interface web.

PapersSécurité IAPrompt engineering
SIG
72
HYP
18
arXiv cs.AI·

GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge

GitOfThoughts stocke le raisonnement des agents LLM sous forme de dépôt git : chaque pensée est un commit, les scores sont des notes, les résultats sont des tags. Étude empirique sur 5 substrats de mémoire (aucun, markdown, vecteur, graphe, git) : la mémoire n'améliore la précision que si le cas récupéré est quasi-identique au problème actuel (similarité >0,8). Le gain principal reste l'échantillonnage au test-time.

Agents IARaisonnementÉvaluations
SIG
75
HYP
25
arXiv cs.AI·

UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems

UP-NRPA, un framework basé sur les portraits utilisateur, adapte dynamiquement les stratégies de dialogue avec LLM sans apprentissage par renforcement hors ligne. Sur benchmarks collaboratifs et non-collaboratifs, le système atteint 100% de succès en plusieurs tâches et augmente le ratio vente-prix de 56,41% en négociation.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
35
Simon Willison·

Why AI hasn’t replaced software engineers, and won’t

Arvind Narayanan et Sayash Kappor réfutent la thèse du remplacement massif des ingénieurs logiciels par l'IA. Données clés : en 2025, New York a enregistré 160+ avis de licenciement (WARN Act) — aucun n'a coché la case IA. L'automatisation se heurte à trois vrais goulots : spécifier ce à construire, vérifier la qualité, et gérer les dépendances humaines.

Génération de codeBusinessSécurité IA
SIG
72
HYP
18
Reddit r/MachineLearning·

Coherent Context Can Silently Shift LLMs Into a Different Internal Regime — And Current Safety Systems Are Blind To It [D]

Un chercheur indépendant démontre que un contexte cohérent peut déplacer les LLMs vers un régime interne différent sans modifier la sortie finale, contournant les filtres de sécurité actuels (RLHF, classifieurs). Travaux sur Gemma-3-12B-IT avec analyse des états cachés et trajectoires du residual stream.

Sécurité IAAlignementÉvaluations
SIG
72
HYP
45
Reddit r/LocalLLaMA·

Building a CPU LLM engine in C99 - stuck at 1.90 tok/s on DeepSeek MoE while llama.cpp does 13.79. Potential root cause identified. Implementation is not.

Développeur construit un moteur d'inférence LLM en C99 pur. Sur DeepSeek-V2-Lite avec i5-11300H : 1.90 tok/s vs 13.79 pour llama.cpp (7.3x gap). Cause identifiée : dequantization Q4K en F32 à la charge (4 bytes/poids) vs lecture directe Q4K (0.5 bytes) chez llama.cpp. IPC : 0.80 vs 2.36. Solution requise : kernel Q4K matvec fusionné.

Génération de codeOpen sourceInfrastructure
SIG
72
HYP
15
Reddit r/LocalLLaMA·

How are you handling memory provenance in persistent agents — verified vs. inferred facts?

Un développeur expose le problème de distinction entre faits vérifiés et inférences dans la mémoire persistante des agents IA. Les anciennes inférences deviennent progressivement des faits, rendant l'audit impossible. Il implémente manuellement un système de provenance (vérifiée/inférée/spéculative) et demande si des solutions existantes (Zep, Mem0, Cognee) résolvent ce défi.

Agents IARAG
SIG
35
HYP
15
The Decoder·

Microsoft Research's Mirage gives video generation a persistent spatial memory that doesn't forget what's around the corner

Mirage, un modèle vidéo de Microsoft Research, stocke les informations de scène en espace latent au lieu de nuages de points basés sur les pixels. Cela réduit le temps de calcul et la mémoire graphique tout en maintenant la cohérence spatiale lors de mouvements de caméra longs. Le suivi d'objets en mouvement reste limité.

Génération de vidéosPapersDeepMind
SIG
72
HYP
35
Reddit r/LocalLLaMA·

Built a local AI assistant because I always knew this day would come, yesterday just made it feel very real

Développeur crée Bantz, assistant IA local avec persona de majordome des années 1920, basé sur Gemma 4B. Intègre Gmail, Google Calendar, recherche web, monitoring système et contrôle desktop Wayland. Fonctionne sur CPU uniquement. Motivé par les risques de dépendre d'infrastructure tierce (allusion à la fermeture Anthropic).

Open sourceAgents IAOutils
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> GorvGoyl /</span> Clone-Wars

Répertoire de 100+ clones open-source de sites populaires (Airbnb, Amazon, Instagram, Netflix, TikTok, Spotify, WhatsApp, YouTube). Inclut code source, démos, stack technique et stars GitHub.

Open sourceOutils
SIG
35
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> rust-lang /</span> rustup

Rustup est l'installateur officiel de la chaîne d'outils Rust. Il gère les versions du compilateur, les composants et les cibles de compilation pour les développeurs Rust.

Open sourceOutilsInfrastructure
SIG
45
HYP
05
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> tensorzero /</span> tensorzero

TensorZero est une plateforme LLMOps open-source unifiant passerelle LLM, observabilité, évaluation, optimisation et expérimentation.

Open sourceInfrastructureÉvaluations
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> nrwl /</span> nx

Nx est une plateforme monorepo optimisant les builds et l'intégration continue, avec capacités d'agents IA pour corriger automatiquement les PR défaillantes. Réduit le temps de déploiement de moitié.

Agents IAOutilsInfrastructure
SIG
35
HYP
65
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Ar9av /</span> obsidian-wiki

Obsidian-wiki est un framework permettant aux agents IA de construire et maintenir un cerveau numérique via Obsidian en utilisant le pattern LLM Wiki de Karpathy.

Agents IAOutilsOpen source
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> OpenHands /</span> OpenHands

OpenHands est un framework open-source pour l'automatisation du développement logiciel piloté par IA. Il permet aux agents IA d'exécuter des tâches de codage, de débogage et de déploiement de manière autonome.

Agents IAGénération de codeOpen source
SIG
45
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> AUTOMATIC1111 /</span> stable-diffusion-webui

AUTOMATIC1111/stable-diffusion-webui est un dépôt GitHub populaire fournissant une interface web pour Stable Diffusion. Outil open-source permettant la génération d'images via une UI accessible.

Génération d'imagesOpen sourceOutils
SIG
45
HYP
20
The Decoder·

KPMG fabricated AI case studies in a report designed to sell clients on AI adoption

KPMG a publié un rapport sur l'IA en entreprise contenant des études de cas fictives impliquant UBS, le NHS et d'autres organisations. Edward Tian (GPTZero) a aidé à découvrir les erreurs et alerte sur les « hallucinations secondaires » : des affirmations erronées de cabinets de conseil de confiance qui se propagent sans vérification. KPMG a retiré le rapport.

Sécurité IABusinessÉvaluations
SIG
75
HYP
45
Reddit r/MachineLearning·

The Verifier Tax: Horizon-Dependent Safety–Success Tradeoffs in Tool-Using LLM Agents [R]

Papier présenté à ACM CAIS 2026 sur l'évaluation de sécurité des agents LLM utilisant des outils. Les auteurs distinguent succès sûr, succès non sûr et échec, et montrent que la vérification réduit les succès non sûrs mais diminue aussi la complétude des tâches avec l'augmentation de l'horizon (« Verifier Tax »). Architecture à deux niveaux : vérifications déterministes puis vérificateur basé LLM.

Agents IASécurité IAÉvaluations
SIG
75
HYP
25
Reddit r/LocalLLaMA·

Codebase getting larger - Qwen3.6-27B starting to compound issues - how to work smartly with this model?

Développeur utilisant Qwen3.6-27B via llama.cpp rencontre des bugs récurrents dans son codebase Python malgré un contexte de 128K tokens. Teste différentes stratégies : lecture complète du projet vs focus sur fonctions spécifiques, désactivation de la quantization KV. Cherche approches pour minimiser les erreurs du modèle.

QwenGénération de codePrompt engineering
SIG
35
HYP
25
Reddit r/LocalLLaMA·

Storing an index to a scale instead of the scale itself with Q4_0 quant reduces scale size by ~31% (small gain but interesting)

Un chercheur propose de réduire la taille des scales en Q4_0 pour Qwen 3.6 27B en remplaçant les valeurs de scales (16 bits) par des indices (11 bits) pointant vers un dictionnaire. Gain estimé : 318 MB minimum sur le modèle complet, soit ~31% de réduction des scales, au prix d'un code d'inférence custom.

QwenOpen sourceInfrastructure
SIG
45
HYP
25