Page 93 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Fine-tuning language encoding models on slow fMRI improves prediction for fast ECoG

Des chercheurs utilisent l'IRM fonctionnelle (fMRI) pour améliorer les modèles d'encodage entraînés sur l'ECoG (électrocorticographie). En affinant des représentations de langage parlé sur fMRI, ils obtiennent de meilleures prédictions ECoG malgré une résolution temporelle 100× inférieure. Les performances s'améliorent avec plus de données fMRI.

Fine-tuningRaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

Base Models Look Human To AI Detectors

Les détecteurs IA commerciaux (GPTZero, Pangram) classent le texte des modèles de base comme humain, contrairement aux versions instruction-tuned. Les chercheurs proposent HIP (Humanization by Iterative Paraphrasing), un pipeline qui affine minimalement un modèle de base en paraphraseur itératif. Testé sur Llama-3 et Qwen-3 (0.6B-70B), HIP améliore la ressemblance humaine tout en préservant la sémantique.

LlamaQwenFine-tuning
SIG
72
HYP
35
arXiv cs.CL·

Drifting Objectives for Refining Discrete Diffusion Language Models

TokenDrift applique les méthodes de drifting (correction d'objectif) aux modèles de diffusion discrets pour le langage. La technique lève les prédictions catégoriques en features soft-token, applique un drifting anti-symétrique dans un espace sémantique gelé, et rétropropage vers les logits. Sur MDLM et DUO, TokenDrift réduit la perplexité de génération de 89% et 86% à 4 NFE.

PapersGénération de codeRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

Un article arXiv introduit le critère de validité « Generative-Evaluative Agreement » (GEA) pour évaluer si un LLM peut scorer correctement les réponses qu'il a lui-même générées. Sur un test adaptatif à deux étapes, le modèle récupère ~70% de la variance intentionnelle avec biais positif systématique. GEA est fort (r>0.7) pour les compétences syntaxiques mais proche de zéro pour les compétences de conception.

ÉvaluationsRaisonnementSécurité IA
SIG
72
HYP
18
arXiv cs.CL·

How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence

Étude de robustesse des pipelines d'analyse de mise en page (DLA) utilisés en RAG et QA sur documents longs. Les auteurs identifient un biais d'empreinte et proposent un cadre d'audit léger mesurant la perte structurelle au niveau des blocs (B-SLR). Sur 1 000 pages avec MinerU et PP-StructureV3, B-SLR corrèle mieux avec l'instabilité OCR (R²=0.727/0.916) que les métriques surfaciques (R²=0.384/0.110).

PapersÉvaluationsRAG
SIG
72
HYP
18
arXiv cs.AI·

Evaluating the Utility of Personal Health Records in Personalized Health AI

Étude évaluant Gemini 3.0 Flash sur 2,257 requêtes de patients avec contexte de dossiers médicaux personnels (PHR). Amélioration significative de l'utilité des réponses avec données PHR (p<0.001). Identification de lacunes : désorientation temporelle, confabulations rares. Framework d'évaluation développé pour surveiller la qualité des réponses basées sur PHR.

GeminiRAGÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

LambdaPO propose une optimisation de politique par comparaisons appariées pour l'alignement des modèles de raisonnement. Contrairement à GRPO qui utilise une baseline statistique unique, LambdaPO décompose l'avantage en différentiels de récompense pairwise entre trajectoires, pondérés par la confiance du modèle. Une récompense de densité sémantique enrichit le signal d'optimisation sur tâches mathématiques et QA.

Reinforcement learningRaisonnementAlignement
SIG
72
HYP
28
arXiv cs.LG·

Metric-Gradient Projection for Stable Multi-Agent Policy Learning

HPML (Hodge-Projected Multi-agent Learning) stabilise l'apprentissage multi-agent en projetant le champ de mise à jour conjointe sur une composante métrique-gradient. La méthode utilise une projection de type Hodge dans un espace L² de champs vectoriels, implémentée via réalisations basées graphes et réseaux de neurones amortis. Résultats : stabilité améliorée et rendements normalisés supérieurs sur benchmarks CTDE.

Multi-agentsReinforcement learningPapers
SIG
72
HYP
15
arXiv cs.LG·

Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints

LILAC+ propose un cadre pour l'apprentissage par renforcement continu sûr en environnements non-stationnaires. Le système combine trois mécanismes adaptatifs : contraintes de sécurité basées sur le contexte, contraintes de vitesse d'adaptation, et application de budget-à-état. Évalué en simulation de conduite, il réduit les violations de sécurité sous changement de distribution tout en maintenant la performance.

Reinforcement learningSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.CL·

Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning

Conditional Entropy Shaping (CES) contrôle dynamiquement l'entropie des tokens pour équilibrer concision et précision du raisonnement. Implémenté sur DeepSeek-R1-Distill-7B, CES pénalise les tokens haute-entropie sur les chemins corrects et les récompense sur les chemins erronés. Résultats : amélioration de la précision avec réduction de la longueur des réponses sur 12 benchmarks mathématiques.

DeepSeekRaisonnementReinforcement learning
SIG
72
HYP
28
arXiv cs.CL·

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

Étude sur l'injection de compétences cross-modales : transfert d'expertise d'un LLM spécialisé vers un VLM via fusion de modèles. Analyse systématique de 3 aspects : scénarios (succès en suivi d'instructions et cross-lingue, échec en raisonnement mathématique), méthodes (TA et DARE surpassent les alternatives), hyperparamètres. Évite SFT coûteux.

Fine-tuningVisionRaisonnement
SIG
72
HYP
18
Reddit r/MachineLearning·

I built a tool that shows you what GPT-2 is "thinking" in real-time as it generates 3D graph of concept activations per token [R]

AXON visualise en temps réel les activations de concepts dans GPT-2 via un graphe 3D force-directed. Un Sparse Autoencoder décompose le residual stream en features interprétables (géographie, villes, langues) à chaque token généré. Stack : TransformerLens + SAELens (backend), FastAPI WebSocket, Three.js (frontend). ~35ms/token sur GPU.

GPTOpen sourceOutils
SIG
72
HYP
35
Reddit r/LocalLLaMA·

PrivateScribe.ai - Fully local, MIT licensed, free AI transcription built with HIPAA/legal safeguards in mind - One Year Update!

PrivateScribe.ai, plateforme de transcription open-source entièrement locale (MIT), annonce sa v1 avec app macOS signée. Stack : FasterWhisper, pyannote, Ollama, Vite/Flask/SQLite. Chiffrement 256-bit, zéro appels réseau, audit trail, diarisation. Conçu pour cliniques, avocats, thérapeutes avec conformité HIPAA.

Open sourceVoixGénération de code
SIG
72
HYP
28
Reddit r/LocalLLaMA·

A tool I built to generate 3D objects with functional, articulated parts. It's on github, and is mostly LLM-agnostic.

Outil open-source pour générer des objets 3D articulés avec pièces fonctionnelles. Au lieu de diffusion (blobs point-cloud), le pipeline utilise un LLM comme compilateur de code structuré, générant du code Python Blender natif ciblant des nœuds spécifiques. Frontend Flutter/Three.js, model-agnostic. Gemini recommandé ; modèles locaux hallucinent encore sur les transformations matricielles complexes.

Génération de codeOpen sourceOutils
SIG
72
HYP
35
Reddit r/LocalLLaMA·

Public Repository "Codegraph" claims to reduce Claude, Cursor, Codex, and OpenCode API tool calls by 94% locally, an innovation that could directly offset the most recent Claude API pricing model.

Codegraph, un outil open-source de Colbymchenry, réduit les appels API Claude/Cursor de 94% en utilisant un graphe de connaissances pré-indexé (relations de symboles, call graphs). Les tests montrent 3 appels vs 52 sans l'outil sur VS Code TypeScript, avec accélération de 72-82%.

ClaudeGénération de codeAgents IA
SIG
72
HYP
45
Reddit r/MachineLearning·

Graph spectral analysis (Fiedler value + Scheffer CSD indicators) predicts grokking 21k steps before loss function - five reproducible experiments [R]

Analyse spectrale des graphes de poids (valeur de Fiedler + indicateurs CSD de Scheffer) pour prédire le grokking 21k étapes avant la convergence. Cinq expériences reproductibles sur CPU : détection précoce, distinction grokking/oubli catastrophique, intervention guidée (91.7% vs 2.6%), accélération 48x sur tâches séquentielles. Limité à MLPs 2-couches et transformers 1-couche.

PapersÉvaluationsRaisonnement
SIG
72
HYP
28
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> rtk-ai /</span> rtk

rtk est un proxy CLI en Rust qui réduit la consommation de tokens LLM de 60-90% sur les commandes dev courantes. Binaire unique, zéro dépendance.

OutilsInfrastructureGénération de code
SIG
72
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Michael-A-Kuykendall /</span> shimmy

Shimmy : serveur d'inférence Rust compatible API OpenAI, sans dépendances Python. Supporte GGUF et SafeTensors, échange de modèles à chaud, découverte automatique, binaire unique. Gratuit.

Open sourceInfrastructureGénération de code
SIG
72
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> tirth8205 /</span> code-review-graph

Code-Review-Graph crée un graphe de connaissances local pour Claude Code. Il construit une carte persistante de la base de code, réduisant les tokens de 6,8× sur les reviews et jusqu'à 49× sur les tâches quotidiennes.

Claude CodeRAGGénération de code
SIG
72
HYP
45