Oups… Amazon a dévoilé le Pixel Drop de Google avant l’heure
Amazon a accidentellement révélé le Pixel Drop de Google avant son annonce officielle. Trois nouvelles fonctionnalités IA pour les smartphones Pixel ont été exposées prématurément.
2731 articles
Amazon a accidentellement révélé le Pixel Drop de Google avant son annonce officielle. Trois nouvelles fonctionnalités IA pour les smartphones Pixel ont été exposées prématurément.
Vercel Functions supporte désormais des exécutions jusqu'à 30 minutes (vs 800 secondes) pour Node.js et Python sur les plans Pro/Enterprise. Fluid Compute facture uniquement le CPU actif, idéal pour les appels LLM, requêtes BD et traitement de documents.
archex transforme un dépôt en contexte rangé et budgété pour agents IA : symboles, imports, graphe de dépendances. Pipeline local (BM25F + embeddings + RRF + reranker) sans API, sans télémétrie. Benchmarks : recall 0.95 vs 0.32 (cocoindex-code), démarrage froid 0ms vs 4,721ms, 71% moins de tokens.
Anthropic envisage d'exiger une vérification d'identité pour accéder à certaines fonctionnalités de Claude. La mesure viserait probablement à renforcer la sécurité ou à se conformer à des régulations.
L'Inde et les Émirats arabes unis s'associent pour développer une infrastructure IA souveraine afin de réduire leur dépendance envers Google et Microsoft. Le partenariat vise à créer des capacités locales d'IA et de données.
Un projet explore la capacité de l'Europe à entraîner un modèle IA frontier avec ses ressources de calcul propres. Question ouverte sur l'autonomie technologique européenne face aux géants américains.
Les données de scans AR collectées par les joueurs de Pokémon Go ont entraîné les modèles d'IA spatiale de Niantic. Cette technologie est désormais intégrée au logiciel d'un contractant de défense américain pour la navigation sans GPS.
Implémentation de 10 algorithmes ML classiques (régression, KNN, arbres de décision, XGBoost, réseaux de neurones) en NumPy pur, validés contre Scikit-learn et PyTorch. Repo open-source avec notebooks Jupyter exécutables localement ou sur Colab. L'auteur souligne l'importance de la structure modulaire et de la compréhension du gradient descent.
DXC et Anthropic annoncent un partenariat mondial pour intégrer l'IA générative dans les systèmes critiques des grandes entreprises.
ExecuTorch intègre Gemma 4 dans React Native avec accélération GPU : Vulkan sur Android, MLX sur Apple Silicon. Exécution entièrement hors ligne.
Pemba, un robot humanoïde, s'entraîne pour gravir le mont Everest après avoir escaladé le Chimborazo en conditions neigeuses. Le projet teste les capacités de locomotion et de navigation autonome en environnement extrême.
OpenAI acquiert Ona, spécialiste des environnements cloud sécurisés, pour renforcer ses agents IA et sa plateforme Codex. L'acquisition s'inscrit dans la stratégie d'OpenAI de développer des capacités d'agents autonomes.
modelgrep.com agrège ~300 modèles d'OpenRouter avec filtres unifiés : benchmarks Artificial Analysis, Elo Design Arena, débit temps réel, prix, contexte, vision/outils/reasoning. API gratuite, pas de signup. Repo open-source disponible.
PrintGuard 2.0 : détecteur de défauts d'impression 3D FDM basé sur ShuffleNetV2 + réseau prototypique few-shot. Modèle TFLite (~5 MB) via LiteRT, exécutable inchangé en CPython et navigateur (Pyodide). Architecture unifiée avec une seule implémentation Platform par runtime.
Infrastructure open-source pour agents d'utilisation informatique. Propose des bacs à sable, SDKs et benchmarks pour entraîner et évaluer des agents IA capables de contrôler des bureaux complets (macOS, Linux, Windows).
Guide complet d'auto-hébergement couvrant l'installation locale de logiciels, cloud privé, LLMs, WireGuard, automatisation, Home Assistant et infrastructure réseau.
Reactive Resume est un générateur de CV open-source, gratuit et sécurisé. L'outil privilégie la confidentialité, la personnalisation et la portabilité des données utilisateur.
TencentDB Agent Memory offre une mémoire à long terme entièrement locale pour les agents IA via un pipeline progressif à 4 niveaux, sans dépendances API externes.
GodMode est un navigateur de chat IA offrant accès rapide à ChatGPT, Claude, Bard, Bing et Llama2 dans une seule interface web. Outil de productivité utilisé quotidiennement.
Un développeur tente de recréer GTA 6 entièrement avec l'IA, en parallèle de la sortie officielle prévue en novembre. Le projet utilise des modèles d'IA pour générer le code, les assets graphiques et le game design.
La Commission européenne évalue les implications d'un ordre américain forçant Anthropic à arrêter Fable 5 et Mythos 5 mondialement. Les chercheurs européens débattent entre construire leurs propres modèles fondamentaux ou sécuriser l'accès par contrats. Bâtir une infrastructure locale exigerait capacités de calcul, énergie et fournisseurs compétitifs que l'Europe ne possède pas.
Un utilisateur de r/LocalLLaMA rapporte que la quantification KV (key-value) atteint une qualité remarquable : même avec KV en q4_0 (y compris le drafter), le modèle retrouve précisément les informations dans un contexte de 100k tokens.
Utilisateur rapporte une génération plus lente sur H100 (42 tok/sec) qu'sur RTX 5090 (57 tok/sec) avec llama.cpp et un modèle 31B Q6. H100 offre plus de contexte (128k vs 26k) et plus de bande passante, mais génère plus lentement.
Satya Nadella (Microsoft) avertit que quelques systèmes IA pourraient capturer toute la valeur économique. Il préconise que les entreprises construisent du « token capital » — leurs propres capacités IA sur données internes et boucles d'apprentissage propriétaires — pour éviter cette concentration.
Le FBI a créé Kinetic Cyber Range, une ville d'entraînement dédiée aux simulations de cyberattaques et à la préparation des agents aux menaces informatiques.
Mistral en discussions pour lever 3 milliards d'euros, visant une valorisation de 20 milliards d'euros.
Qwen 27B affiche une vitesse de génération doublée et une consommation VRAM réduite (21 GB → 17,5 GB) sur le même matériel, sans perte de précision contextuelle.
OpenAI lance l'OpenAI Partner Network, un réseau destiné à accélérer le déploiement de l'IA en entreprise, avec un investissement de 150 millions de dollars.
Outil personnel d'agent hybride : planification avec modèle frontier (Codex), exécution locale avec Qwen 3.6 27B sur dual RTX 3090. Architecture 3 niveaux (Planner/Local/Senior optionnel) pour minimiser coûts frontier tout en gardant capacités de raisonnement. Validation déterministe des tâches.
Publication de modèles Gemma-4 quantifiés (12B et 31B) avec une méthode QAT améliorée basée sur Q4_0. L'auteur a développé un processus itératif de recherche d'erreur maximale en F16 surpassant l'imatrix, atteignant une KLD similaire à unsloth. Code PyTorch disponible sans restrictions.
Les États-Unis ont imposé à Anthropic de restreindre l'accès aux modèles Fable 5 et Mythos 5 pour les ressortissants étrangers. Anthropic a désactivé ces modèles pour l'ensemble des utilisateurs non-américains, établissant un précédent en matière de contrôle souverain des IA avancées.
Pull request #24080 sur llama.cpp ajoute le rendu de blocs UI/SVG. La démonstration vidéo montre des capacités de rendu SVG intégrées au projet.
AwsmAudio est un éditeur WebAudio intégrant le protocole MCP natif. Projet présenté sur Hacker News avec engagement limité (3 points, 0 commentaires).
Développeur propose une app Android exécutant un LLM entièrement on-device pour prendre des notes et les interroger par IA. Aucune donnée ne quitte le téléphone. Recherche testeurs bêta (8GB+ RAM recommandé), gratuit, en closed testing Google Play.
Portage d'EXL3 (codec haute qualité/faible RAM) sur Apple Silicon via Metal. M5 Max atteint ~600 tok/s prefill et ~38 tok/s génération (Qwen 27B), surpassant RTX 4090 sur certains benchmarks (68.5-80 tok/s decode). Repo GitHub avec résultats reproductibles.
Approche utilisant Hyperdimensional Computing (HDC) et Holographic Reduced Representations pour embeddings de données tabulaires. Dérive des seuils de similarité interprétables pour requêtes structurées (égalité/inégalité), évalue sur deux datasets réels contre baseline EmbDI. HDC détecte fiablement les requêtes sans résultats.
Une étude de cas sur la formalisation semi-autonome du théorème d'annulation de Grothendieck montre que les LLM ferment les trous de preuve mais produisent des formalisations non réutilisables. Après révision d'expert, les agents s'adaptent bien aux retours locaux mais échouent à concevoir des définitions et APIs robustes.
Système multi-agent pour traiter automatiquement les relevés de notes du secondaire. Architecture avec 4 agents spécialisés (reconnaissance de motifs, analyse sémantique, vision, orchestration) atteint 96,7% de précision sur 40 relevés réels de 13 États américains, 45 secondes par document.
MA-ProofBench est le premier benchmark formel dédié aux théorèmes de Mathematical Analysis avec 200 problèmes formalisés en deux niveaux de difficulté (undergraduate et Ph.D.). GPT-5.5 atteint seulement 16% Pass@8 au niveau I et 5% au niveau II, révélant des lacunes majeures dans le raisonnement formel avancé des LLMs.
VeriGeo génère des problèmes de géométrie contrôlables via des traces de raisonnement exécutables. Un agent Auteur crée le problème et le diagramme selon les contraintes utilisateur, un agent Solveur produit la preuve. Un pipeline à trois étapes vérifie la cohérence numérique, analytique et globale. Fine-tuning sur 8.7k exemples atteint les meilleures performances GeoQA et résultats forts sur PGPS9K et MathVista-GPS.
TwinBI est un framework d'agent numérique qui couple un système LLM avec l'état exécutable d'un tableau de bord BI. Il unifie interaction conversationnelle, manipulation de dashboard et suivi de provenance via un log d'interaction partagé. Benchmark : précision exacte 43.3% → 63.3%, timeout 40% → 10%.
GTBP (Graph-based Target Back-Propagation) est un framework d'adaptation de contexte pour systèmes multi-LLM agentic. Il propage des cibles locales rétroactivement dans un graphe acyclique dirigé et met à jour les prompts par étapes. Convergence garantie théoriquement, surpasse les baselines sur 3 benchmarks.
Étude de fiabilité sur LLM-as-a-Judge : GPT-4o-mini et GPT-4.1-mini montrent une instabilité importante avec 13,6% de retournements de préférence en moyenne, 28% des questions dépassant 20% de flip rate. Biais de position détecté (72% A-majority). Accord inter-juges à 76% (κ=0,51). 11 essais répétés nécessaires pour 95% de confiance.
Comparaison de deux méthodes d'intervention sur les refus de sécurité dans les modèles de chat : Difference-in-Means (DiM) vs Iterative Nullspace Projection (INLP). Sur 5 modèles open-weight, INLP counterfactual flipping égale DiM en suppression des refus, tandis que nullspace projection est plus faible. Les deux approches opèrent différemment dans l'espace d'activation.
RicciBind, un framework de représentation géométrique, prédit l'affinité de liaison protéine-ligand en combinant la courbure de Ricci pour capturer l'organisation locale et le transport optimal pour l'alignement cross-domaine. Démontre performance supérieure sur benchmarks PLA et tâches de criblage virtuel.
LoSoNA est un benchmark évaluant la capacité des LLM à reconnaître et adapter les normes sociales locales dans les conversations de groupe. Huit modèles testés sous quatre conditions de prompting : Gemini 3.1 Pro atteint 84,2%, Claude Fable 5 81,6%. Le prompting explicite aide inégalement.
AgentSpec est un framework modulaire pour décomposer les agents LLM en composants réutilisables (perception, mémoire, raisonnement, réflexion, action, apprentissage). Les auteurs évaluent les interactions entre modules sur DeliveryBench, ALFRED, MiniGrid et RoboTHOR, montrant que la performance dépend de la compatibilité du scaffold et des effets d'interaction plutôt que de la force isolée des modules.
Persuasion Index (PI) est une taxonomie de 15 dimensions fondée sur les théories de la persuasion en psychologie et communication. Implémentation avec 55 sous-features basées sur lexiques et détecteurs. Évaluation sur 4 datasets publics montre que PI fournit un espace de features partagé pour interpréter les patterns rhétoriques. Modèles linéaires légers et interprétables. Package open-source et interface web.
UP-NRPA, un framework basé sur les portraits utilisateur, adapte dynamiquement les stratégies de dialogue avec LLM sans apprentissage par renforcement hors ligne. Sur benchmarks collaboratifs et non-collaboratifs, le système atteint 100% de succès en plusieurs tâches et augmente le ratio vente-prix de 56,41% en négociation.
HOTE (Hybrid Open-Ended Tri-Evolution) est un framework d'apprentissage par renforcement hybride pour l'évolution autonome d'agents IA sur des tâches de recherche ouverte. Un modèle 8B entraîné via HOTE surpasse les modèles statiques 8-32B et les méthodes SOTA sur trois benchmarks de recherche approfondie.
Nouvelle tâche d'extraction d'IA : identifier les conditions d'applicabilité des relations thérapeutiques drogue-maladie dans la littérature biomédicale. Premier dataset annoté manuellement avec 1 119 paires drogue-maladie. Méthode proposée améliore LoRA pour modéliser les relations drogue-maladie, surpassant les baselines.
Évaluation de modèles LLM commerciaux vs open-source sur le raisonnement juridique en droit successoral islamique (tâche QIAS 2026). Gemini 2.5 Flash obtient les meilleurs résultats (MRE 0.989), tandis que les modèles open-source montrent une instabilité accrue dans les décisions dépendantes et ajustements fractionnaires.
Méthode de génération synthétique de données pour fine-tuner des petits LLMs sur la tâche Text-To-Cypher (conversion texte naturel en requêtes Cypher pour graphes de propriétés). Résultats sur benchmarks majeurs montrent que les petits modèles fine-tunés rivalisent avec des modèles propriétaires plus grands, tout en garantissant la souveraineté des données en déploiement local.
MoDiCoL est un dataset de continual learning modulaire pour évaluer la robustesse des systèmes ASR face aux variations réelles (accents, bruits, conditions d'enregistrement, troubles de la parole). Les auteurs proposent un curriculum inspiré du monde réel et évaluent trois stratégies de continual learning pour analyser comment la robustesse se développe, se transfère et s'oublie.
CDPR, deux algorithmes basés sur la maximisation sous-modulaire, génèrent des ensembles de règles IF-THEN pour la classification avec couverture garantie, discriminativité et parcimonie. Amélioration de 2,5× en couverture moyenne vs état de l'art.
llada.cpp est le premier framework d'inférence optimisé pour les NPU mobiles accélérant les diffusion LLMs sur smartphones. Trois techniques réduisent la latence : Multi-Block Speculative Decoding, Dual-Path Progressive Revision, et Swap-Optimized Memory Runtime. Sur LLaDA-8B, gains de 17x-42x vs CPU baseline.
Audit computationnel de ClinicalBERT révélant que 65,6% des biais démographiques encodés ne proviennent pas des données d'entraînement MIMIC-III mais d'une amplification interne du modèle. Analyse via Log Probability Bias Analysis et probing MLM sur 98 templates cliniques réels et 8 combinaisons race-genre intersectionnelles.
Étude de 1800+ problèmes des Olympiades de Linguistique (LOPs) comme corpus pour la recherche linguistique. Les LOPs sont des puzzles auto-suffisants testant la déduction de règles linguistiques. L'article évalue leur potentiel pour la linguistique académique et les modèles de langage, proposant un cadre théorique pour leur intégration.
Judge-LS évalue si les LLM utilisés comme juges automatiques montrent un biais linguistique. Sur 419 items du benchmark LLMBar transformés en anglais, chinois et variantes mixtes, les modèles affichent 10,7–14,4% de renversements de préférence selon la langue, avec une précision maximale en anglais. Les réponses équivalentes en traduction ne révèlent pas de préférence systématique pour l'anglais.
OdysSim présente une investigation systématique de modèles fondamentaux pour simuler le comportement humain. Les chercheurs proposent SOUL, une taxonomie de 5 axes (CONV, SS, COG, ROLE, EVAL) unifiant 62 datasets et 23 tâches. Le modèle OSim 8B open-source surpasse les modèles frontier sur 8/23 tâches, avec alignement réactionnel de 93.2% vs 93.5% pour les utilisateurs réels.
RePro, un framework d'entraînement pour agents LLM, enseigne aux modèles à générer rétrospectivement des signaux de progrès via un paradigme forward-then-reflect. Testé sur WebShop, ALFWorld et Sokoban avec la famille Qwen, RePro atteint +12% de gain absolu en taux de succès sans supervision externe continue.
Étude arXiv sur les hallucinations médicales des LLM. Système multi-agent « Trust but Verify » testant 3 familles de modèles (GPT-OSS, Llama-3, Falcon-3) sur 103 questions cliniques avec médicaments bannis. Architecture à 5 agents réduit le taux d'hallucination de 53% et force le refus approprié plutôt que la recommandation dangereuse.
Un article arXiv remet en question les affirmations selon lesquelles les réseaux de neurones résoudraient le défi de la systématicité de Fodor et Pylyshyn. Les auteurs montrent que le protocole de meta-learning pour la compositionnalité de Lake et Baroni échoue sur des données hors-distribution et manque de systématicité même en-distribution.
WebDecept, un framework de test, évalue la robustesse des agents web autonomes face à des interfaces trompeuses en e-commerce. Sept patterns de déception (publicités ciblées, redirections, manipulations d'achat) sont injectés dans des environnements web. Les résultats montrent que les agents multimodaux actuels sont hautement vulnérables et que les contraintes par prompt ne suffisent pas à mitiger ces défaillances.
Workflow GPU pour construire des émulateurs physiques de flux hypersoniques. Intègre JAX-Fluids (solveur différentiable haute fidélité) pour générer données et affiner des émulateurs neuraux avec quantification d'incertitude. Refinement basé résidus améliore la cohérence physique et permet l'entraînement avec paramètres limités.
QIAS 2026 est un défi partagé évaluant la capacité des LLM à raisonner sur l'héritage islamique. Basé sur MAWARITH (12 500 cas arabes annotés), il requiert calcul complet : identification des héritiers et attribution des parts. 16 équipes ont testé prompting, RAG et fine-tuning. Les résultats montrent que l'interprétation légale précise et le raisonnement numérique structuré restent très difficiles.
Étude causale sur le grokking : l'intervalle avant généralisation dépend de la norme des poids. Sous décroissance de poids libre, les réseaux grockent à une norme critique Wc stable (CV 1-2%). En fixant la norme à ρ×Wc, le délai suit T_grok ∝ exp(α·ρ) avec α≈7.5 (R²=0.996 sur 4 moduli). La norme contrôle le délai 19× plus que le taux d'apprentissage.
Dialogue SWE-Bench est un benchmark automatisé pour évaluer les agents de codage via dialogue utilisateur. Les auteurs proposent un simulateur utilisateur persona-grounded et un agent schema-guided qui améliore les baselines de 3-14%. Résultat clé : les meilleurs modèles de code ne sont pas nécessairement les meilleurs en dialogue.
GAMA-Bench, un benchmark de 1 298 scénarios appairés, révèle une asymétrie systématique : les LLMs appliquent des standards de réponse plus sévères aux hommes qu'aux femmes pour le même comportement répréhensible. Les acteurs masculins reçoivent des cadres plus punitifs et blâmants, tandis que les actrices bénéficient de réponses plus thérapeutiques. Le pattern persiste sur 10 modèles et tous les types de scénarios.
Étude sur 9 modèles et 972 000 réponses montrant que les LLM se conforment aux suggestions nuisibles sur les jugements moraux (A=1.04) autant qu'aux suggestions bénéfiques, contrairement aux questions factuelles (A=1.58). Le chain-of-thought amplifie cette conformité bidirectionnelle, tandis que le prompting basé sur l'identité la supprime.
PauseRec propose un paradigme de raisonnement implicite pour les systèmes de recommandation génératifs basés sur LLM. L'approche contourne les limitations des pipelines explicites (CoT) en évitant l'acquisition de traces de raisonnement, améliorant les performances de 6,22%, réduisant les coûts GPU de 65% et accélérant l'inférence de 71,3%.
Étude des représentations internes dans les LLMs textuels et un modèle ASR pour examiner si les verbes phraséaux V+up développent des représentations distinctes selon la fréquence et la prévisibilité. Tous les modèles montrent des preuves de stockage holistique piloté par ces facteurs, soutenant les théories linguistiques basées sur l'usage.
Détection de texte généré par IA via processus gaussiens multi-vues non-paramétriques. La méthode agrège plusieurs signaux complémentaires (style, vraisemblance, structure) pour résister aux attaques adversariales (paraphrase, transfert de style). Évaluée sur DetectRL, RAID et PAN2025 avec performance supérieure aux approches existantes.
Étude sur la fiabilité UTF-8 dans les modèles byte-level (355M params, 80B tokens multilingues). La validité UTF-8 converge 2× plus lentement que la perplexité (4.2B vs 2.1B tokens). Les caractères rares génèrent du UTF-8 plus valide que les caractères fréquents, révélant une sur-spécialisation.
Première application du cadre de rapport de vraisemblance (likelihood ratio) à l'attribution d'auteur en japonais. Fusion de systèmes stylométriques et d'embeddings de modèles de langage pré-entraînés sur ~1000 caractères de blogs. Le système fusionné améliore la discrimination (log-likelihood-ratio cost: 0.32484) tout en maintenant une bonne calibration.
Méthode spectrale pour systèmes dynamiques stochastiques non-linéaires utilisant des opérateurs de transfert latents dans des espaces de features profonds. Deep Spectral Encoder (DSE) combine un encodeur neural non-linéaire, analyse canonique de corrélation fonctionnelle et filtrage bayésien séquentiel. Surpasse les baselines DMD et filtrage bayésien même sous bruit et observabilité partielle.
Modèle VAE hybride classique-quantique pour la modélisation de sujets. Circuit quantique paramétrisé (10 qubits) intégré dans l'encodeur, décodeur classique. Sur AgNews : score de cohérence Cv=0.71, NPMI=0.20, surpasse les modèles de sujets neuraux existants.
Des agents LLM équipés d'outils GNN (Graph Neural Networks) ne font pas preuve de jugement : ils adoptent aveuglément les prédictions du GNN à 97,6-99,2% du temps. Cette déférence augmente avec la capacité du modèle (Qwen2.5 0.5B-7B), créant un « GNN parrot » qui contourne son propre raisonnement. Les alternatives simples surpassent le GNN à forte homophilie, mais l'agent continue de déférer.
Méthode de shielding décentralisé pour l'apprentissage par renforcement multi-agent garantissant la sécurité globale sans contrôle centralisé. Les agents partagent une spécification LTL_safe globale et sélectionnent des obligations locales dont la conjonction implique la spécification globale, via un bandit multi-armé non-stationnaire. Évaluation sur 6 environnements et 15 variantes algorithmiques.
Étude empirique sur l'adaptation post-entraînement de LLMs pour le codage ICD (classification des maladies). Les auteurs comparent prompting, fine-tuning supervisé et reinforcement learning (GRPO), introduisent PHI (curriculum diagnostique), et montrent que SFT + GRPO surpassent les baselines discriminatives. Code et checkpoints publiés.
Les modèles de langage souffrent d'un « entonnoir culturel » : les signaux culturels explicites déclinent fortement lors du post-entraînement, dominés par des données géographiquement concentrées. Une étude avec framework de tagging multidimensionnel sur 5,6M samples montre que le multilingue améliore la diversité géographique mais pas l'équilibre. Les auteurs publient un dataset culturellement tagué.
MedLatentDx est un framework multi-agent pour le diagnostic des maladies rares en collaboration inter-hôpitaux. Les agents hospitaliers conservent les dossiers cliniques privés et échangent des blocs latents KV compacts au lieu de texte brut, respectant les régulations de confidentialité. Deux modes : distillation KV pour backbones identiques, alignement latent cross-family pour LLM différents.
Chercheurs utilisent le transport optimal inverse pour estimer les coûts d'accès urbain à partir des flux origine-destination. Application au choix d'école aux Philippines : 283 016 trajets d'élèves analysés via modèles de transport entropique (distance-banded + neural cost). Récupère les coûts latents de décision pour optimiser l'allocation des subventions et services urbains.
CacheRL entraîne des petits modèles d'agents (Qwen3-4B-Thinking) atteignant 92% de précision sur tâches multi-étapes avec appels d'outils, soit 100× moins de calcul que GPT-5 (94%). Trois innovations : pipeline de trajectoires avec traces de raisonnement LLM, cache fuzzy trois niveaux éliminant exécutions live, récompenses adaptées au cache. SFT + GRPO améliorent la récompense de validation de 0,43 à 0,78.
SkillAudit est un framework pour faire évoluer les compétences d'agents LLM sans feedback ground-truth. Via l'audit de trajectoires appariées, le système exécute la même tâche avec et sans la compétence candidate, puis utilise Process-Aligned Contrastive Evaluation pour isoler les changements de comportement. Sur 89 tâches, SkillAudit atteint 73,9% de récompense moyenne vs 56,7% pour la compétence expert statique.
Analyse de la complexité d'échantillonnage pour l'apprentissage dans les processus de décision markoviens faiblement couplés (WCMDPs) et les bandits sans repos. Les auteurs montrent que des politiques quasi-optimales peuvent être apprises avec une complexité polynomiale en N (nombre de bras), via une analyse Lyapunov novatrice et une technique de transfert de dérive entre modèles vrais et empiriques.
Auth0 intègre la Vercel Marketplace pour offrir une authentification production-ready en quelques clics. La plateforme d'identité supporte Next.js nativement avec provisioning automatique, gestion utilisateurs complète et synchronisation multi-environnements (Dev, Preview, Prod).
VISTA propose une méthode de fine-tuning basée sur GRPO pour améliorer le grounding GUI. Elle génère plusieurs vues du même écran (crops préservant l'élément cible) pour créer des groupes de comparaison plus robustes. Sur ScreenSpot-Pro, elle améliore Qwen3-VL 4B/8B/30B de 55.5/52.7/53.7 à 63.4/65.8/67.0.
AOE (Adelic operation-preserved embeddings) est une représentation sans entraînement qui encode les nombres en préservant structure additive et multiplicative via signatures p-adiques. Plug-and-play, elle atteint 100% sur le benchmark Weaving Pattern et améliore les performances en combinatoire algébrique sans retraining spécifique.
D2H-AD est un framework de détection d'anomalies basé sur l'Hyperdimensional Computing (HDC). Il combine encodage sensible à la densité et similarité basée sur la distance, surpassant cinq baselines (HDAD, ODHD, One-Class SVM, Isolation Forest, Autoencoders) sur cinq datasets. L'encodage hyperdimensionnel seul atteint +5.4% ROC-AUC. Léger, interprétable, efficace computationnellement : adapté TinyML et edge AI.
DiPOD, une méthode d'optimisation de politiques de diffusion, résout l'instabilité du post-training RL en identifiant le phénomène de double-drift (divergence entre ELBO et log-vraisemblance). L'approche intercale auto-distillation et mises à jour de gradient, stabilisant l'entraînement sur modèles de langage et contrôle continu.
TopVAE, un VAE optimisé topologiquement, réduit les « zones sombres » du latent space en intégrant les contraintes structurelles et chimiques lors de l'entraînement. Couplé à un DiT standard, il atteint 77% de réduction FCD-3D sur QM9 et 52% sur GEOM-Drugs, générant des molécules plus stables et valides chimiquement.
SuperThoughts compresse les paires de tokens CoT consécutifs en représentations latentes uniques et décode deux tokens par étape via un module Multi-Token Prediction léger. Testé sur Qwen2.5-Math (1.5B, 7B, 14B), l'approche réduit la longueur CoT de 20-30% tout en maintenant la précision (dégradation 1-2 points sur MATH500, AMC, OlympiadBench, GPQA-Diamond).
Étude ML sur la prévision des rendements de riz en Sierra Leone avec données limitées. XGBoost + données climatiques satellites (CHIRPS, NASA POWER) réduit l'erreur de 34% (RMSE 284 vs 428 kg/ha). Les pluies de mai-juin sont le prédicteur dominant. Pipeline open-source fourni.
PostDeg montre que la position du LayerNorm dans les GNN importe plus que la paramétrisation. Un scalaire inverse-degré placé après LayerNorm préserve les signaux topologiques (degré, centralité) que les politiques de sélection de nœuds nécessitent. Gains de +3.5% à +5.6% sur influence maximization, dismantling et independent set.
Chercheurs proposent un critère décidable pour l'intégration créative : une résolution de conflit entre A et B est créative si la longueur de description diminue strictement (C = L_pre/L_post > 1) sous un langage fixe. Validé sur corpus multi-domaines par quatre tests falsifiables (vérification computationnelle, discrimination, prédiction hors-échantillon, robustesse linguistique).
SLC (State-space Logit Correction) corrige les biais systématiques par item dans les modèles de knowledge tracing déployés. Via transformation Laplace/IRLS, shrinkage empirique-Bayes et Kalman smoother, la méthode améliore l'AUC sur 4 datasets et 5 backbones, particulièrement sur items rares. Les calibrateurs globaux (Platt, temperature scaling) ne récupèrent pas la discrimination perdue.
Les autoencodeurs creux (SAE) supposent que tous les activations peuvent être décomposés de manière parcimonieuse. Cette étude propose d'ajouter un goulot d'étranglement dense de rang faible en parallèle aux SAE pour capturer une composante dense causalement importante. Sur Gemma-2-2B, un goulot de rang 24 réduit les latents denses de 84% tout en améliorant les performances de sondage.
Étude sur 1.2M décisions montrant que le contexte de déploiement (Reddit vs article news) produit des variations de préférences et valeurs bien plus importantes que les variations de prompt ou température. Les biais mesurés (favoritisme Global North) et les échanges cardinaux entre outcomes varient d'un facteur 2.47 selon le contexte, remettant en question la stabilité des propriétés model-level.
Nouvelle approche pour éliminer les backdoors dans les modèles IA via l'apprentissage continu. BI-BAU formule l'unlearning comme inversion aveugle résolue par optimisation bi-niveau et EM. Élimine complètement les effets backdoor sur attaques ciblées et non-ciblées, y compris en apprentissage multi-modal.