Page 74 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Bootstrapping Semantic Layer from Execution for Text-to-SQL

GATE (Grounding After Test from Execution) bootstrappe les groundings manquants en text-to-SQL via feedback d'exécution. Le système maintient plusieurs hypothèses de grounding ouvertes, exécute les parties déjà groundées pour obtenir des observations, puis valide et mémorise les hypothèses confirmées. Cette mémoire d'exécution s'accumule et améliore les performances sur benchmarks réels et contrôlés.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing

PERSUASIONTRACE est un framework pour étudier la persuasion dans les interactions humain-LLM. Il enregistre les changements de croyances multi-tours, annote les stratégies rhétoriques (logos/pathos/ethos), et évalue les simulateurs par fidélité aux dynamiques humaines réelles. Un modèle bayésien maintenant un état de croyance latent explicite atteint 81/100 en ressemblance humaine vs 64 pour les LLMs vanilla.

RaisonnementÉvaluationsSécurité IA
SIG
72
HYP
28
arXiv cs.CL·

When New Generators Arrive: Lifelong Machine-Generated Text Attribution via Ridge Feature Transfer

RidgeFT, un framework d'apprentissage continu sans rejeu d'exemplaires, attribue les textes générés par IA à leurs modèles sources. La méthode gèle un encodeur entraîné initialement, stocke des statistiques suffisantes par classe, et utilise la régression ridge en forme fermée pour adapter les nouveaux générateurs tout en conservant les anciens.

BenchmarksSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.CL·

An ERP Study on Recursive Locative Processing in Mandarin-Speaking Children with Autism

Étude ERP sur 24 enfants (12 autistes, 12 contrôles) examinant le traitement des constructions locatives récursives en mandarin. Les enfants autistes montrent une prédiction structurale réduite (P200 atténué), une intégration sémantique accrue (N400 augmenté) et une réanalyse syntaxique diminuée (P600 réduit), avec variabilité inter-individuelle accrue en latéralisation hémisphérique.

RaisonnementSécurité IA
SIG
72
HYP
08
arXiv cs.LG·

CausalPOI: Spatio-Temporal Graph-Based Causal Modeling for Cold-Start POI Check-in Forecasting

CausalPOI propose un framework de causal representation learning pour prédire les patterns de check-in de nouveaux Points of Interest (POI) en milieu urbain. Le modèle utilise des graphes spatio-temporels fonctionnels et simule des scénarios contrefactuels pour capturer les effets causaux des interventions urbaines, surpassant les baselines sur les données SafeGraph.

PapersRaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

Efficient Punctuation Restoration via Weighted Lookahead Scoring Method for Streaming ASR Systems

Méthode de restauration de ponctuation pour ASR streaming basée sur un scoring non-autorégressif avec lookahead limité. Préserve la transcription et décide à chaque limite de mot via comparaison d'hypothèses. Sur IWSLT 2017 : F1 macro 0.893 sans fine-tuning (K=2) et 0.937 avec fine-tuning, surpassant baselines prompt et ELECTRA.

Génération de codeBenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Using Large Language Models to Support High Volume Application Review for an Undergraduate Research Program

Purdue University utilise GPT-4o, GPT-5-mini et GPT-5.2 pour évaluer 1 200 candidatures au programme SURF 2026. Les modèles notent les déclarations d'intention sur 6 critères (0-3 points), générant scores et justifications en 4,6 heures. GPT-5.2 adhère mieux à la grille d'évaluation. La révision finale par coordinateur prend 4 heures au lieu de plusieurs semaines.

GPTOpenAIÉvaluations
SIG
72
HYP
25
arXiv cs.LG·

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

Étude de screening factoriel par étapes pour l'optimisation d'hyperparamètres en micro-préentraînement sur GPU unique avec budget limité. 613 expériences testent l'effet de batch, profondeur et largeur du modèle sur 2-24h. Les facteurs D, A, B, C restent significatifs après correction statistique; la recherche aléatoire converge vers des régions similaires sans attribution causale.

Fine-tuningBenchmarksInfrastructure
SIG
72
HYP
15
arXiv cs.CL·

PEFT of SLM for Telecommunications Customer Support: A Comparative Study of LoRA Configurations with Energy Consumption Analysis

Étude systématique du fine-tuning efficace (LoRA) sur Qwen2.5-3B pour l'assistance client télécoms. 16 configurations LoRA évaluées sur 30 000 exemples synthétiques générés via Gemini 2.0 Flash. Résultat clé : la perte de validation (0.5024) ne corrèle pas avec la qualité jugée par GPT-5.2 et Claude 4.5 Sonnet. Analyse énergétique incluse.

QwenFine-tuningÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

Learning Manifold and It\^o Dynamics with Branched Neural Rough Differential Equations

Les équations différentielles neurales branchées (B-NRDEs) étendent les NRDEs pour capturer les dynamiques Itô sur variétés. Elles utilisent une structure Hopf-algébrique basée sur les arbres racinés de Grossman-Larson et Munthe-Kaas-Wright, préservant exactement les contraintes de variété. Validation sur volatilité Bergomi, dynamiques SO(3) et matrices SPD.

PapersRaisonnementReinforcement learning
SIG
72
HYP
15
arXiv cs.LG·

PyCC.id: A package for hypothesis-driven equation discovery with structural identifiability

PyCC.id est une bibliothèque Python pour la découverte d'équations différentielles guidée par hypothèses. Elle utilise des « squelettes » structurels inspirés par les courbes caractéristiques pour réduire l'espace de recherche et vérifier l'identifiabilité structurelle des modèles candidats. Supporte réseaux de neurones, régression symbolique et régression sparse.

Génération de codePapersOpen source
SIG
72
HYP
15
arXiv cs.CL·

Predict and Reconstruct: Joint Objectives for Self-Supervised Language Representation Learning

Nouvelle approche de pré-entraînement combinant MLM (Masked Language Modeling) et JEPA (Joint Embedding Predictive Architecture) pour les encodeurs texte. Modèle hybride entraîné sur Wikipedia anglais avec budget identique. Résultats : embeddings plus uniformes (-0.16 vs -0.05), géométrie spectrale riche, meilleur équilibre sémantique-lexical sur benchmarks GLUE.

PapersFine-tuningEmbeddings
SIG
72
HYP
18
Reddit r/LocalLLaMA·

BeeLlama v0.3.1 – latest llama.cpp with extras! DFlash, MTP, q6_0 cache, TurboQuant. Single RTX 3090: Qwen 3.6 27B & Gemma 4 31B up to 177.8 tps (4.93x over baseline)

BeeLlama v0.3.1 met à jour llama.cpp avec MTP, support Gemma 4 12B, DFlash multi-GPU et nouvelles options de cache (q6_0, TQ3_1S, TQ4_1S). Sur RTX 3090, Qwen 3.6 27B atteint 177.8 tps (4.93x baseline), Gemma 4 31B aussi optimisé. Binaires précompilés et images Docker fournis.

LlamaOpen sourceGénération de code
SIG
72
HYP
35
Reddit r/LocalLLaMA·

I accidentally crippled my 4x RTX 3090 LLM rig with a hidden PCIe 2.0 x4 slot and fixing it doubled Mistral 128B performance

Un utilisateur a découvert qu'une RTX 3090 était connectée à un slot PCIe 2.0 x4 caché sur sa carte mère Gigabyte X399, limitant les performances à 11 tok/s sur Mistral 128B. Après réorganisation des GPUs et configuration correcte du tensor-split, les performances ont doublé à 24,7 tok/s. Avertissement pour les builds multi-GPU sur cartes HEDT anciennes.

MistralLlamaInfrastructure
SIG
72
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> yvgude /</span> lean-ctx

LeanCTX est un système d'exploitation de contexte local pour le développement IA. Un binaire unique compresse, mémorise, route et vérifie les tokens entre le code et le modèle. 63 outils MCP, 10 modes de lecture, jusqu'à 99% d'économies de tokens. Compatible Cursor, Claude Code, Copilot, Windsurf, Gemini.

MCPGénération de codeOutils
SIG
72
HYP
45