Page 35 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

The Impossibility of Eliciting Latent Knowledge

Article théorique sur le problème d'élicitation des connaissances latentes (ELK) : comment entraîner un système IA à rapporter honnêtement ses croyances sur des variables cachées. Les auteurs formalisent ELK via des diagrammes d'influence causale et prouvent un théorème d'impossibilité : aucune stratégie d'entraînement basée sur le feedback ne peut garantir l'honnêteté d'un agent, même avec un feedback parfait.

AlignementSécurité IARaisonnement
SIG
75
HYP
15
arXiv cs.CL·

Teaching Diffusion to Speculate Left-to-Right

Les modèles de diffusion peuvent accélérer le décodage spéculatif des LLM en générant des blocs de tokens en parallèle. Cet article identifie un décalage entre l'entraînement bidirectionnel et la vérification gauche-à-droite, et propose trois interventions (pondération positionnelle, focal loss, chain loss) qui augmentent la longueur acceptée des drafts de 21-76% sur six benchmarks sans coût supplémentaire.

Génération de codeRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.LG·

Federated continual learning: A comprehensive survey on lifelong and privacy-preserving learning over distributed and non-stationary data

Enquête systématique sur l'apprentissage fédéré continu (FCL), qui combine l'apprentissage fédéré préservant la vie privée avec l'apprentissage continu sur données non-stationnaires. Identifie les limites des méthodes FL classiques face aux distributions évolutives et propose une taxonomie multi-dimensionnelle des approches FCL pour applications réelles (santé, IoT industriel, cybersécurité, villes intelligentes).

Benchmarks
SIG
75
HYP
15
Vercel AI Blog·

How Okara runs CMO agents for 120,000 companies on Vercel

Okara, une plateforme d'IA CMO construite par 4 personnes, gère la croissance marketing pour 120 000+ entreprises sur Vercel. Elle traite 4 milliards de tokens quotidiens via une pile multi-fournisseurs et déploie 8 sous-agents spécialisés (SEO, contenu, réseaux sociaux, Reddit, Hacker News). Okara a migré vers Vercel AI Gateway pour unifier ses intégrations de modèles et éliminer la maintenance manuelle.

Agents IAMulti-agentsInfrastructure
SIG
75
HYP
35
Reddit r/LocalLLaMA·

I wired a fully offline voice loop to Ollama + LM Studio — 100% CPU, no GPU, nothing leaves your machine (Silero VAD + Parakeet STT + Supertonic TTS 3)

Développeur crée une boucle vocale entièrement hors ligne pour Ollama + LM Studio. Stack : Silero VAD (détection activité vocale), Parakeet TDT 0.6B (STT ONNX INT8, 25 langues), Supertonic TTS 3 (synthèse ONNX multilingue). CPU uniquement, zéro données quittent la machine. Cross-platform (macOS/Linux/Windows), testé sur ThinkPad 4 ans.

VoixOpen sourceOutils
SIG
75
HYP
25
The Decoder·

Anthropic study shows AI needs hours, not weeks, to build exploits from security patches

Anthropic démontre que son modèle Mythos Preview convertit les correctifs de sécurité (Firefox, Windows kernel) en exploits fonctionnels en quelques heures pour quelques milliers de dollars, sans expertise spécialisée. Huit chaînes d'attaque complètes ont été finalisées avant que les mises à jour automatiques de Microsoft ne touchent un seul appareil.

AnthropicSécurité IABenchmarks
SIG
75
HYP
35
arXiv cs.CL·

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD est une méthode de distillation de connaissance pour transformer un modèle dense en étudiant MoE sans routeur explicite. Le framework en 4 étapes (initialisation + entraînement) utilise le clustering de neurones du professeur et l'optimisation adaptative pour obtenir des gains sur les benchmarks de raisonnement mathématique, l'étudiant MoE égalant ou surpassant le professeur dense.

Fine-tuningRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.CL·

TabClaw: An Interactive and Self-Evolving Agent for Spreadsheet Manipulation and Table Reasoning

TabClaw est un agent IA open-source pour l'analyse de tableaux et feuilles de calcul. Il accepte des fichiers CSV/Excel en langage naturel, expose un plan d'exécution éditable, utilise une boucle ReAct avec agents spécialisés pour le raisonnement multi-tables, et enregistre les workflows pour extraire des compétences réutilisables et s'adapter aux préférences utilisateur.

Agents IAMulti-agentsRaisonnement
SIG
75
HYP
25
arXiv cs.LG·

SocraticPO: Policy Optimization via Interactive Guidance

SocraticPO est un framework de policy optimization pour LLMs qui augmente les rollouts RL avec des guidances en langage naturel de style socratique. Un enseignant diagnostique les erreurs et fournit des corrections concises, associées à une décroissance de récompense pour éviter que le modèle ne dépende de l'aide. Testé sur SciKnowEval, il surpasse les baselines RL et auto-distillation.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.LG·

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench est un benchmark de 1 000 trajectoires d'actions éthiques/non-éthiques pour évaluer la capacité des LLM à prédire les comportements nuisibles avant qu'ils ne se produisent. Les résultats montrent que même les modèles forts peinent à cette tâche de monitoring prédictif, soulignant le besoin de raisonnement orienté vers l'avenir en matière de sécurité.

Sécurité IAÉvaluationsAgents IA
SIG
75
HYP
25