Page 84 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

ChildEval: When large language models meet children's personalities

ChildEval est un benchmark contenant 29K profils de personnalité d'enfants (3-6 ans) pour évaluer la capacité des LLM à inférer et suivre les préférences enfant-centrées en conversations longues. Le dataset couvre 5 catégories principales et 14 sous-catégories de la vie quotidienne. Les résultats montrent que le fine-tuning sur ChildEval améliore les performances.

BenchmarksFine-tuningÉvaluations
SIG
72
HYP
25
arXiv cs.LG·

High-Fidelity Industrial Crash Dynamics Prediction via Geometry-Aware Operator Learning with Memory-Efficient Low-Rank Attention

GeoTransolver, un framework d'operator learning géométrie-aware, prédit avec précision la dynamique de crash automobile à l'échelle industrielle. Sur des datasets de bumper beam et véhicule complet, il capture les déformations plastiques et profils d'accélération. Une modification FLARE réduit la mémoire de 2x tout en améliorant la précision pour les transitoires haute-fréquence.

PapersBenchmarksRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Soro: A Lightweight Foundation Model and Chatbot for Tajik

Soro est une famille de modèles de langage spécialisés en tadjik, basée sur Gemma 3, entraînée sur 1,9 milliard de tokens tadjiks (web, PDF, matériel éducatif). Après fine-tuning supervisé sur 40K exemples, Soro surpasse Gemma 3 sur des benchmarks tadjiks créés par les auteurs et conserve les performances en anglais. Quantification FP8/INT4 validée pour déploiement edge en milieu scolaire.

GeminiFine-tuningBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Diagnosing Live Within-Policy Instruction Conflicts in LLM Agents with Witnessed Resolution Profiles

WIRE est un pipeline d'évaluation qui diagnostique les conflits de règles au sein d'une même politique de prompt LLM. Sur 6 politiques publiques, l'outil extrait 276 règles et identifie 170 paires de règles en collision dure. Seulement 35,4% des cas testés respectent les deux règles simultanément ; 64,6% violent au moins une règle source.

Agents IAPrompt engineeringÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

Étude comparative de modèles vision-langage (VLM) versus OCR traditionnel sur des éditions critiques du grec ancien. Les VLM génèrent du texte plausible mais non visuellement fondé, révélant une dépendance excessive aux priors linguistiques. Perturbations d'images et mesures d'ancrage au niveau des tokens montrent que les erreurs fluentes persistent même sans signal visuel.

VisionÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.AI·

Identifying and Understanding Human Values in Text: A Tailorable LLM-based Architecture

Architecture modulaire basée sur LLM pour détecter et quantifier l'intensité des valeurs humaines dans du texte. Trois modules coordonnés : génération de spécifications de valeurs, étiquetage de textes, assignation de support/résistance gradué. Évaluation sur ValueEval dataset avec plusieurs LLMs, démontrant la généralité du pipeline.

AlignementÉvaluationsRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

Simorgh at SemEval-2026 task 7: Region-Aware Hybrid Retrieval for Low-Resource Cultural Reasoning in Multilingual Question Answering

Simorgh propose une approche de récupération hybride (BM25 + similarité sémantique) avec pondération régionale pour répondre à des questions culturelles multilingues sur le benchmark BLEnD (30 langues). Utilise Qwen3-14B quantisé. Améliore la stabilité cross-lingue mais révèle des écarts de performance liés au déséquilibre des données d'entraînement.

RAGBenchmarksQwen
SIG
72
HYP
18
arXiv cs.CL·

Keyphrase Generative Representation of Youth Crisis Conversations Beyond Static Taxonomies

Analyse de 703 975 conversations SMS de jeunes en crise (Kids Help Phone, 2018-2023). Introduction de Keyphrase Generative Representation (KGR), un LLM contraint générant des phrases-clés spécifiques au contexte. Taxonomie étendue de 19 à 39 labels avec précision 0.96. KGR identifie 81% de phrases-clés pertinentes et améliore le workflow de recherche thématique (+0.45 en précision vs processus manuel).

LlamaPrompt engineeringRAG
SIG
72
HYP
18
arXiv cs.CL·

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

Les modèles de langage parlé (SLM) pour la synthèse vocale en langues peu dotées souffrent d'un compromis : les données synthétiques améliorent la précision phonétique mais suppriment la variabilité prosodique (Synthetic Erosion). Les auteurs proposent deux cadres d'auto-alignement (DGSA et TDSC) pour récupérer l'expressivité, surpassant ElevenLabs et Gemini Pro, avec clonage vocal zéro-shot pour le lao.

VoixPapersRaisonnement
SIG
72
HYP
28
Reddit r/MachineLearning·

noisekit - CLI for generating realistic degraded speech datasets for ASR benchmarking [P]

noisekit est un CLI open-source pour générer des datasets de parole dégradée annotés, permettant de benchmarker les modèles STT sur des conditions réalistes (télécom G.711, bruit ambiant, réverbération). Résout le problème : les datasets publics (FLEURS, CommonVoice) sont trop propres pour évaluer la performance en production. Compatible HuggingFace AudioFolder, inclut métriques PESQ/SNR/NISQA.

VoixÉvaluationsBenchmarks
SIG
72
HYP
25
Reddit r/MachineLearning·

EMA-Gated Temporal Sequence Compression in Vision Transformers [P]

NeuroFlow est un framework de routage dynamique pour l'inférence vidéo des Vision Transformers. Il exploite la redondance temporelle via une moyenne mobile exponentielle (EMA) des embeddings de patches pour éliminer les tokens stationnaires. Architecture B atteint 55.80× d'accélération (678 ms → 11.9 ms sur SigLIP 1792p) à 97.37% de fidélité. Code disponible.

VisionPapersOpen source
SIG
72
HYP
35
Reddit r/MachineLearning·

Cross-species RSA: same learning rules (BP, PC, STDP, FA) tested against both human fMRI and macaque electrophysiology [P]

Étude comparative de règles d'apprentissage (BP, PC, STDP, FA) testées sur fMRI humain et électrophysiologie macaque (V1/V2/V4/IT). STDP et PC dominent en V1/V2 (ρ ≈ 0.30/0.28), conservant le pattern humain. En IT, l'alignement dépend de la capacité du modèle (ResNet-50: ρ ≈ 0.25) plutôt que de la règle. Code et deux papers (arxiv 2604.16875, 2605.22401) disponibles.

PapersBenchmarksRaisonnement
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Turning every "no thats not what i meant" in chat into actual LoRA training data

Un développeur a créé une app desktop (TideForge) qui transforme les corrections en chat en données d'entraînement LoRA. Après chaque réponse, un bouton « Teach » permet de noter la correction souhaitée ; les exemples s'accumulent et déclenchent un fine-tuning PEFT sur Qwen 0.6B. Test initial : 110 corrections, loss 4.25→0.73, l'adapter conserve l'identité face aux jailbreaks. App gratuite, Windows, GGUF compatible.

Fine-tuningOpen sourceOutils
SIG
72
HYP
35
Reddit r/LocalLLaMA·

Does Engram Do Memory Retrieval in Autoregressive Image Generation?

Un module Engram (mémoire associative O(1) par hash) injecté dans des Transformers pour la génération d'images autorégressives sur ImageNet 256×256 n'améliore pas la qualité (FID) malgré des gains FLOP. Les expériences (gate-clamp, donor-probe, table gelée) révèlent que le module fonctionne comme un chemin résiduel architectural gated, non comme un mécanisme de récupération adressée par contenu.

PapersGénération d'imagesBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

On the Role of Inductive Bias in Time-Series Pretraining: A Case Study in Learning Generalizable Representations for Clinical Time Series

PathoFM, un transformer encodeur préentraîné sur des séries temporelles cliniques (analyse de marche en lésion médullaire), combine trois objectifs : Local Completion, Temporal Continuity et Unsupervised In-Context Dynamics. L'étude montre que les objectifs centrés sur la dynamique produisent les meilleures représentations transférables entre tâches de classification et régression.

PapersRaisonnementFine-tuning
SIG
72
HYP
18
arXiv cs.LG·

Two-Parameter Flows for Learning Population Dynamics of Physical Systems

Nouvelle méthode pour apprendre la dynamique de densités de probabilité haute-dimension sans trajectoires labellisées. Les flux à deux paramètres apprennent les transports de temps d'échantillonnage vers les marginales, puis extraient la dynamique physique par régression sur trajectoires synthétiques couplées. Approche scalable en haute dimension, compatible avec les phénomènes rotationnels.

PapersRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Dynamic Link Prediction with Temporally Enhanced Signed Graph Neural Networks

Framework modulaire pour améliorer les GNN signés avec contexte temporel. Introduit HCIM (Historical Context Integration Module) combinant pondération temporelle, LSTM et attention multi-tête pour prédire les liens dans les réseaux temporels signés. Testé sur Bitcoin OTC, Bitcoin Alpha, Reddit avec améliorations statistiquement significatives vs baseline statique.

PapersBenchmarksRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

MULTISEISMO: A Multimodal Seismic Dataset and Model for Cross-Modal Seismic Understanding

MultiSeismo est un dataset multimodal de 16K+ événements sismiques (2010-2023) intégrant enregistrements de sismographes, cartes d'intensité, données géographiques et métadonnées textuelles. Les auteurs développent SeisModal, un modèle spécialisé basé sur Unified IO 2 avec encodeur temporel, surpassant les GMMs génériques sur des tâches de raisonnement sismique multimodal.

BenchmarksPapersVision
SIG
72
HYP
25
arXiv cs.LG·

Semigroup Consistency as a Diagnostic for Learned Physics Simulators

Nouvelle métrique de diagnostic pour les simulateurs physiques appris : l'erreur de semi-groupe mesure la cohérence temporelle en comparant l'évolution directe sur s+t avec l'évolution composée (s puis t). Testée sur dynamiques thermiques et Burgers avec ConvNet et FNO, corrélation Spearman ρ=0.635 avec dégradation en long-horizon. Utile comme évaluation post-hoc plutôt que comme objectif d'entraînement.

BenchmarksÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.LG·

When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning

Une étude arXiv révèle que des démonstrations correctes peuvent dégrader les performances en in-context learning (ICL). Les chercheurs introduisent des perturbations préservant la tâche pour montrer que la correction n'implique pas l'utilité : modifier l'entrée d'un exemplaire tout en conservant une sortie correcte peut réduire la précision, particulièrement sur les petits modèles et tâches difficiles.

Prompt engineeringRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

AI evaluation may bias perceptions: The importance of context in interpreting academic writing

Étude montrant que les méthodes d'évaluation de l'usage de l'IA dans les publications scientifiques produisent des biais importants sans tenir compte des différences contextuelles entre pays et domaines. Les benchmarks « pooled » confondent variations stylistiques préexistantes avec texte généré par LLM, surestimant l'IA dans certains contextes et la sous-estimant dans d'autres.

ÉvaluationsPapersSécurité IA
SIG
72
HYP
15
arXiv cs.CL·

Evidence Absence Is Not Evidence Insufficiency: Diagnosing NEI Construction Artifacts in Fact Verification

NEI-CAP, un protocole de diagnostic pour évaluer la construction des labels « Not Enough Information » dans les benchmarks de vérification de faits. Les chercheurs montrent que la compétence NEI ne transfère pas fiablement entre constructions : les modèles entraînés sur des indices de raccourci échouent à reconnaître l'insuffisance de preuves sémantiquement liée. Tests sur SciFact, FEVER et HoVer.

BenchmarksÉvaluationsPapers
SIG
72
HYP
15