Page 89 sur 192

ToutHaut signalRécent
7679 articles
Reddit r/LocalLLaMA·

Did a 30 runs of llama-bench to find optimal settings for my use case (Frigate and HomeAssistant) on my MI60 32gb VRAM GPU - two models tested Gemma4 and Qwen3.6 - Figured I'd share in case it helps anyone else

Utilisateur a exécuté 30 benchmarks llama.cpp sur GPU MI60 32GB pour optimiser Gemma 4 26B Q4_1 et Qwen3 35B Q4_0 dans Frigate et HomeAssistant. Résultats : commandes vocales <1.2s, résumés vidéo <18s. Tests systématiques sur profondeurs KV cache (0, 1000, 6000 tokens) avec 512 tokens prompt et 128 tokens générés.

LlamaBenchmarksGénération de code
SIG
72
HYP
15
Reddit r/MachineLearning·

Interesting tension this week, the same companies racing to go public are also the ones making safety promises [N]

OpenAI et Anthropic accélèrent leurs IPO alors que des études révèlent des failles techniques : les modèles frontier dégradent les performances sur chaînes de tâches longues, les agents avec outils échouent dans plusieurs cas. Tension entre promesses de sécurité et pressions des marchés publics pour la croissance.

Agents IASécurité IABusiness
SIG
72
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> mukul975 /</span> Anthropic-Cybersecurity-Skills

Référentiel de 754 compétences cybersécurité structurées pour agents IA, mappées à 5 frameworks (MITRE ATT&CK, NIST CSF 2.0, MITRE ATLAS, D3FEND, NIST AI RMF). Compatible Claude Code, GitHub Copilot, Cursor, Gemini CLI et 20+ plateformes. 26 domaines de sécurité. Licence Apache 2.0.

Agents IAClaude CodeSécurité IA
SIG
72
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> OpenPipe /</span> ART

OpenPipe/ART : framework d'entraînement par renforcement pour agents multi-étapes. Utilise GRPO pour l'apprentissage en temps réel sur Qwen, GPT-OSS, Llama et autres modèles.

Agents IAReinforcement learningOpen source
SIG
72
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> mukul975 /</span> Anthropic-Cybersecurity-Skills

Référentiel de 754 compétences cybersécurité structurées pour agents IA, mappées à 5 frameworks (MITRE ATT&CK, NIST CSF 2.0, MITRE ATLAS, D3FEND, NIST AI RMF). Compatible Claude Code, GitHub Copilot, Cursor, Gemini CLI et 20+ plateformes. 26 domaines de sécurité. Licence Apache 2.0.

Agents IAClaude CodeSécurité IA
SIG
72
HYP
25
Reddit r/LocalLLaMA·

First AI to Beat Every Human in a Programming Competition - Agentic GRPO Explained

Agentic GRPO, un algorithme RL adapté aux systèmes multi-étapes, permet aux agents IA de battre les humains en compétitions de programmation. L'innovation clé : récompenses immédiates à chaque étape (hypothèse, code, tests, debug) avec correction rétroactive une fois le résultat final connu, au lieu d'attendre la fin du workflow complet.

Agents IAReinforcement learningGénération de code
SIG
72
HYP
45
Reddit r/MachineLearning·

I built a Mamba1 variant I call SM1 with d_state=1 that runs on Blackwell in pure PyTorch [P]

Variante Mamba1 appelée SM1 avec d_state=1 utilisant deux opérations PyTorch natives pour remplacer le selective scan. Solution exacte en forme fermée, pas une approximation. Réduit la mémoire de scan de 16x comparé à Mamba1 (d_state=16). État d'inférence de 14 KB pour modèle 130M, O(1) par token. Entraînement sur 163K fichiers MIDI (2.5B tokens).

Open sourceGénération de codeRaisonnement
SIG
72
HYP
25
Reddit r/MachineLearning·

LQS v3.1 — an open methodology for rating AI training data (multi-oracle consensus + signed certificates) [P]

LQS v3.1 est une méthodologie open-source pour évaluer la qualité des données d'entraînement IA. Elle utilise 19 dimensions (correction des labels, contamination, équité, etc.), un consensus multi-oracle (7 oracles) avec recalibrage par signaux réels, et des certificats Ed25519 vérifiables hors-ligne. Index public gratuit avec 263 datasets notés.

ÉvaluationsOpen sourceSécurité IA
SIG
72
HYP
18
Reddit r/LocalLLaMA·

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

Vector Policy Optimization (VPO) est un algorithme RL qui entraîne les modèles de langage à produire des solutions diversifiées en anticipant plusieurs fonctions de récompense vectorielles. VPO remplace l'estimateur d'avantage GRPO et surpasse les baselines RL scalaires sur quatre tâches, avec des gains croissants à mesure que le budget de recherche augmente.

Reinforcement learningRaisonnementGénération de code
SIG
72
HYP
28
Reddit r/LocalLLaMA·

I ran a quantization shootout on Qwen3-Coder and the results are... interesting

Benchmark de quantization sur Qwen3-Coder-Next avec 3× R9700 PRO. UD-Q5_K_M surpasse MXFP4_MOE sur tous les métriques qualité (94% vs 89.4% top-1 accuracy, KL divergence 0.0217 vs 0.0746) avec pénalité vitesse négligeable (~10% en decode). L'approche de précision dynamique d'Unsloth réduit exponentiellement les erreurs cumulatives sur sorties longues.

QwenGénération de codeFine-tuning
SIG
72
HYP
28
Reddit r/LocalLLaMA·

Open source: cloned Rocky's voice from Project Hail Mary in two days, full pipeline + 2:10 of training audio + trained RVC v2 model

Clonage de la voix de Rocky (Project Hail Mary) en deux jours via pipeline open-source. Extraction audio (ffmpeg + demucs), transcription (Whisper), diarization (pyannote), puis entraînement RVC v2 sur 2:10 min audio. Modèle .pth (55MB) et code publics. Comparaison XTTS v2 / YourTTS / RVC v2 / OpenVoice v2.

VoixOpen sourceGénération de code
SIG
72
HYP
28
arXiv cs.CL·

Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements

Ishigaki-IDS-Bench est un benchmark pour évaluer la génération de fichiers XML Information Delivery Specification (IDS) à partir de spécifications BIM. Sur 166 exemples expert-validés en anglais/japonais, les 10 meilleurs LLMs atteignent 65,6% F1 macro pour l'accord de contenu, mais seulement 27,7% passent l'audit de contenu IDS. Les modèles peinent à générer du XML conforme aux standards IDS et vocabulaire IFC.

BenchmarksGénération de codePapers
SIG
72
HYP
15
arXiv cs.AI·

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Insights Generator est un système multi-agent pour diagnostiquer les défaillances d'agents LLM à l'échelle d'un corpus. Il formule et teste des hypothèses sur les traces d'exécution pour produire des rapports d'insights fondés sur des preuves. Les experts humains utilisant IG améliorent les performances de 30,4pp ; les agents de codage montrent des gains stables.

Agents IAMulti-agentsÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents

Étude comparative de quatre stratégies de chunking (Recursive, Khmer-Aware, Sentence-Based, LLM-Based) pour RAG sur documents agricoles en khmer. Le chunking Recursive avec 300 caractères obtient les meilleures performances : L2 distance 0.4295, Answer Relevance 0.8663, Khmer IoU 0.6441. Amélioration statistiquement significative vs Sentence-Based (p=0.0121).

RAGEmbeddingsBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification

Étude sur la quantification de LLaMA-3.1 (8B) pour l'analyse qualitative. Les modèles 8-bit conservent la meilleure précision ; les modèles 4-bit, 3-bit et 2-bit souffrent d'hallucinations. Une méthode de vérification multi-pass réduit les erreurs et stabilise les résultats, rendant les modèles bas-bit viables pour la recherche qualitative.

LlamaPrompt engineeringÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

PeakFocus: Bridging Peak Localization and Intensity Regression via a Unified Multi-Scale Framework for Electricity Load Forecasting

PeakFocus est un framework unifié pour la prévision des pics de charge électrique (ELPF), prédisant simultanément le timing et l'intensité des pics. Il combine une pipeline peak-aware avec perte triple, un localisateur multi-échelle et un décodeur sensible à la localisation pour surmonter les limitations des approches deux-étapes. Évalué sur les datasets ELC et WLEL.

BenchmarksPapers
SIG
72
HYP
18
arXiv cs.AI·

Playing Devil's Advocate: Off-the-Shelf Persona Vectors Rival Targeted Steering for Sycophancy

Étude sur la réduction de la sycophantie (accord du modèle même quand l'utilisateur se trompe) via des vecteurs de persona off-the-shelf. Les vecteurs orientés vers le doute/scrutin réduisent la sycophantie à 68-98% de l'effet de CAA (Contrastive Activation Addition), tout en maintenant la précision. La sycophantie est une propriété au niveau persona, non une direction unique.

AlignementSécurité IAÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Quantitative coronary calcification analysis for prediction of myocardial ischemia using non-contrast CT calcium scoring

Étude ML sur 1,375 patients : prédiction de l'ischémie myocardique à partir de scans CT calcium non-contrastés. Modèle XGBoost+SHAP combinant score Agatston, 8 features calcium-omics et âge. Résultats : précision 98,9%, sensibilité 79,2%, F1 87,7%. Les calcium-omics améliorent significativement la performance vs variables cliniques seules (p<0,05).

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent est un agent de diagnostic de défauts de batterie pour véhicules électriques utilisant des modèles de langage. Le système transforme les signaux de batterie lithium-ion en descriptions textuelles naturelles, intègre la récupération de cas historiques et les manuels de maintenance locaux pour générer des recommandations diagnostiques structurées et interprétables.

Agents IARAGRaisonnement
SIG
72
HYP
28
arXiv cs.CL·

A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

Étude comparative de systèmes RAG pour le khmer. BGE-M3 surpasse Jina-Embeddings-v3 et Qwen3-Embedding en dense retrieval (Hit Rate@3: 0.285). Évaluation de 5 générateurs (Qwen3, Qwen3.5, Sailor2, SeaLLMs-v3, Llama-SEA-LION-v2) sur 200 QA pairs avec 6 métriques RAGAS. Aucun modèle ne domine tous les critères; le choix du retriever reste le goulot d'étranglement.

RAGEmbeddingsBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

Étude arXiv sur les attaques de toxicité implicite en chinois (CITA). Framework de red-teaming en trois étapes (apprentissage d'intent nuisible, amélioration d'implicitude, réécriture d'obfuscation) générant des données d'évaluation. Sept détecteurs testés montrent 69,48% de taux d'erreur moyen. Modèle de défense CITD fine-tuné sur données CITA améliore la robustesse.

Sécurité IAAlignementÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Broadening Access to Transportation Safety Data with Generative AI: A Schema-Grounded Framework for Spatial Natural Language Queries

Un framework utilise un LLM pour traduire des requêtes en langage naturel en opérations spatiales déterministes sur une base de données PostGIS. Testé sur des données de sécurité routière du Massachusetts (accidents, attributs routiers, écoles, arrêts de bus), le système valide 29% des requêtes erronées via une couche de règles, préservant la reproductibilité tout en démocratisant l'accès aux données.

RAGAgents IAÉvaluations
SIG
72
HYP
25