GLM-5.2 is now 1st on Design Arena — ahead of the now unavailable Claude Fable 5.
GLM-5.2 atteint la 1ère place du classement Design Arena, devançant Claude Fable 5 qui n'est plus disponible. Le modèle de Zhipu AI domine le benchmark de conception.
2731 articles
GLM-5.2 atteint la 1ère place du classement Design Arena, devançant Claude Fable 5 qui n'est plus disponible. Le modèle de Zhipu AI domine le benchmark de conception.
Google DeepMind collabore avec le gouvernement britannique sur un prototype IA pour accélérer les décisions de planification immobilière au Royaume-Uni.
Benchmark du modèle Minimax M3 en 4-bit MLX sur Mac Studio M3 512GB. Résultats : TTFT 3.1s (pp1024/tg128), throughput 147.7 tok/s, pic mémoire 226.6GB. Batching continu : speedup 1.83x à 4 requêtes parallèles (49.9 tok/s).
GitHub Models, le service d'accès aux modèles IA via GitHub, n'accepte plus de nouveaux clients. La plateforme ferme ses portes aux inscriptions fraîches.
GLM-5.2 sort en poids ouverts avec licence MIT. Fenêtre de contexte 1M, deux modes de raisonnement, performances fortes en coding sur les arenas. Modèle open-source contrairement aux versions API-only.
Lexar propose de stocker les modèles IA locaux sur SSD plutôt qu'en RAM pour contourner les limitations mémoire. La stratégie vise à réduire les coûts matériels et rendre l'inférence IA accessible sur des appareils avec peu de RAM.
DeepSeek V4 Pro offre des performances comparables à Claude à 5% du coût. L'article analyse les écarts technologiques et économiques entre les modèles, sans détails chiffrés précis sur les benchmarks ou les tarifs exacts.
GLM-5.2 est disponible en API ($1.4/M tokens input, $4.4/M output) et en poids open-source MIT sur HuggingFace. Ollama l'intègre déjà. Benchmarks : 81.0 Terminal-Bench 2.1, 62.1 SWE-bench Pro, 74.4 FrontierSWE. Contexte 1M, deux modes thinking (High/Max).
Microsoft envisage une version fine-tuned de DeepSeek V4 comme option moins chère pour Copilot Cowork. L'entreprise bascule aussi à une facturation à l'usage, Charles Lamanna estimant que les tarifs forfaitaires ne sont pas durables.
Un thread Reddit propose de créer un modèle communautaire via calcul distribué en utilisant une approche Mixture-of-Experts (MoE). La stratégie « Branch-Train-Stitch » distribue un modèle prototype dense à des participants qui l'entraînent indépendamment sur leur matériel, puis fusionnent les sous-modèles en MoE. Les décisions clés incluent la taille du prototype (2B ou 7B) selon la VRAM disponible.
GLM-5.2 devient le premier modèle open-weights à dépasser 80% sur Terminal-Bench, surpassant tous les autres modèles ouverts et Gemini. Classé frontier-level à coût réduit.
GLM-5.2 atteint la 2e place du classement WebDev Arena. Le modèle Qwen positionne bien face aux concurrents majeurs.
Genesis AI présente Eno, un robot humanoïde conçu pour accomplir des tâches complexes sans priorité esthétique. Le design privilégie l'utilité fonctionnelle.
Un tribunal de Berlin juge que les résumés IA de Google constituent un « nouveau format de résultat de recherche » sans influence décisive de Google sur le contenu. Une entreprise de parfum avait poursuivi Google car ses résumés IA affichaient ses marques aux côtés de contrefaçons. La décision contraste partiellement avec un jugement de Munich tenant Google responsable des réponses IA inexactes.
GLM-5.2, le modèle de Zhipu AI, est désormais accessible via HuggingChat. Pas de détails techniques fournis dans l'annonce.
Benchmark pour petits LLM (<3B paramètres) évaluant la capacité à parser du langage naturel en JSON structuré pour la recherche de fichiers. 9 modèles testés (Gemma-3 270M à DeepSeek R1 Distill 1.5B) sur 80 requêtes couvrant types de fichiers, contexte temporel et spécificité. Résultats : modèles 0.8B–1.5B surpassent les sub-0.5B.
GPT-NL est un modèle de langage souverain entraîné pour le néerlandais, développé aux Pays-Bas. Le projet vise à réduire la dépendance aux modèles américains et à préserver l'indépendance technologique linguistique.
Mistral annonce une nouvelle famille de modèles open-weight en juillet. Le tweet d'Arthur Mensch (CEO) confirme le lancement sans détails techniques supplémentaires dans l'extrait.
Glint Research présente Glimmer 1, un modèle de langage fondationnel de 10k paramètres entraîné sur 500K tokens de FineWeb-Edu. Architecture standard Llama avec 16 dimensions cachées, 2 couches, 4 têtes d'attention et fenêtre de contexte de 512 tokens. Benchmarks : arc_easy 25.46%, wikitext-2 perplexité 14.73 (byte).
GLM-5.2 est disponible. Le modèle de zai-org améliore les capacités de raisonnement et de compréhension par rapport aux versions antérieures.
Publication d'une version GGUF du modèle Command-A-Plus-05-2026 sur Hugging Face. L'auteur invite les utilisateurs à tester avec la dernière version de llama.cpp et à partager leurs benchmarks de tokens/seconde.
Anthropic signale des erreurs élevées affectant plusieurs versions de Claude. Les utilisateurs rapportent des dysfonctionnements sur la plateforme. Pas de détails techniques fournis dans le titre.
Release de datasette-tailscale 0.1a0, plugin alpha expérimental permettant de déployer un serveur Datasette via Tailscale. Utilise les bindings Python de la librairie tailscale-rs pour connecter une instance locale à un Tailnet.
GateGPT atteint 56k tokens/sec sur FPGA à 80 MHz en optimisant le cache KV des Transformers. Démonstration d'accélération matérielle pour l'inférence.
Développeur crée un vérificateur de benchmark pour la manipulation robotique qui compile des démonstrations humaines en graphes objet-centriques et valide les rollouts indépendamment, évitant les fuites d'information. Soulève la question : est-ce utile face aux métriques ad-hoc actuelles, ou résout-il un non-problème ?
Georgi Gerganov (créateur de llama.cpp) utilise quotidiennement Qwen3.6-27B pour des tâches de codage sur M2 Ultra et RTX 5090. Il l'intègre via un agent léger (pi) avec prompt système personnalisé pour l'assistance à la maintenance ggml-org.
Article argumentant pour les modèles open-weight face aux labs frontier. Critique la concentration du pouvoir chez quelques entreprises et plaide pour l'accessibilité et la transparence des poids de modèles IA.
SpaceX acquiert Anysphere (créateur de Cursor) pour 60 milliards de dollars, deux jours après son IPO. L'objectif : renforcer xAI pour rattraper Anthropic et OpenAI dans la course aux modèles d'IA.
Sakana AI lance Marlin, un agent de recherche approfondie générant des rapports stratégiques de plus de 100 pages. Le système prend 8 heures pour produire des analyses détaillées, marquant un changement de paradigme vers la profondeur plutôt que la rapidité.
Anthropic revient sur sa décision de bloquer l'accès à Claude via des wrappers tiers pour claude-p. La communauté soupçonne un revirement de communication plutôt qu'un changement stratégique durable, contrairement aux bannissements antérieurs d'OpenClaw et Hermes.
VibeThinker-3B atteint 94.3 sur AIME'26, 80.2 sur LiveCodeBench v6 et 96.1% de réussite sur des concours LeetCode inédits. Le modèle démontre que les petits modèles peuvent atteindre des performances de frontier en raisonnement mathématique et codage grâce à des signaux de vérification clairs.
Salesforce acquiert Fin pour 3,6 milliards de dollars pour renforcer sa stratégie IA d'entreprise. L'acquisition vise à accélérer le développement de capacités d'IA générative intégrées à sa plateforme.
Entretien avec Finbarr Timbers sur les recettes de post-training des modèles frontier. Discussion des techniques d'optimisation et des approches actuelles pour améliorer les performances des grands modèles de langage.
Le ministère de la Justice américain invoque la sécurité nationale pour défendre les turbines à gaz non autorisées d'xAI dans un procès de la NAACP, affirmant que le chatbot Grok est essentiel aux opérations militaires.
Alibaba annonce Qwen Robot Suite, une suite logicielle pour robotique basée sur ses modèles Qwen. Détails techniques et capacités non précisés dans l'extrait.
Ineffable Intelligence lève 1,1 milliard de dollars et s'appuie sur Google Cloud pour développer ses ambitions en superintelligence. Le partenariat inclut l'infrastructure cloud nécessaire aux entraînements de modèles à grande échelle.
DiffusionGemma génère 256 tokens en parallèle avec attention bidirectionnelle, permettant l'auto-correction avant finalisation. Contrairement aux modèles autorégressifs figés après chaque token, cette architecture pourrait améliorer les appels d'outils structurés malgré une qualité de base inférieure à Gemma 4. Reste à tester si la correction bidirectionnelle compense la qualité plus faible.
Burn est une bibliothèque tensor et framework de deep learning nouvelle génération axé sur la flexibilité, l'efficacité et la portabilité.
Homarr est un tableau de bord moderne avec 40+ intégrations, 20K+ icônes intégrées, authentification native et configuration par drag-and-drop sans YAML.
Outil open-source pour générer automatiquement des captures d'écran d'app store via IA. Automatise la création de visuels marketing pour applications mobiles.
NocoBase est une plateforme open-source combinant IA et no-code pour construire rapidement des systèmes métier. L'IA opère sur une infrastructure éprouvée en production avec interface WYSIWYG, garantissant vitesse et fiabilité.
Outil convertissant du code en graphe de connaissances interactif explorable et interrogeable. Compatible Claude Code, Cursor, Copilot, Gemini CLI et autres éditeurs.
Microsoft publie Fara-7B, un modèle 7B optimisé pour les tâches agentic et l'utilisation d'ordinateur. Le modèle vise l'efficacité computationnelle tout en maintenant des capacités d'agent autonome.
Utilisateur teste Qwen3.6 27B en quantization extrême (IQ3 XXS turbo4) vs Q8 sur tâche de review de code. IQ3 XXS (5min, 1230pp/50tg) produit recommandations comparables à Q8 (1h56m, 306pp/3tg). Conclusion : quantization agressive suffisante pour coding si prompt/jugement solides.
Un ingénieur ML rapporte que ses ablations offline (retraining avec/sans feature) donnaient des résultats opposés à la production. Quatre changements : Best Offer feature (+0.12pp offline → -0.19pp prod), backfill données enchères (+0.37pp prod), trimming outliers (-0.19pp offline → +1.11pp prod), encodeur CatBoost. Causes : train/serve skew, distribution shift non mesurée, population drift, instabilité baseline.
L'Institut de la langue estonienne publie un benchmark mesurant la susceptibilité des modèles de langage IA à la propagande russe. Aucun détail technique ou résultat chiffré fourni dans l'extrait.
Un utilisateur partage une instruction système pour améliorer le raisonnement de Gemma 12b QAT. La technique vise à réduire les biais cognitifs et à adapter la profondeur de réflexion selon le contexte. Elle fonctionne bien sur les questions pièges mais échoue partiellement sur certains problèmes selon leur formulation.
Les distillations Qwen/Claude circulant sur r/LocalLLaMA (Qwopus, Fable 5 sur Qwen 3.6) utilisent 4k-10k samples d'entraînement, insuffisant pour améliorer les performances. Comparé aux 700k samples des distillations DeepSeek-R1 officielles, ces modèles ne dépassent pas le Qwen de base et dégradent légèrement la qualité malgré un style de raisonnement différent.
Nvidia émet jusqu'à 25 milliards de dollars de dette sur le marché obligataire pour financer son expansion dans l'IA. Cette mobilisation de capital renforce la position du géant des semiconducteurs face à la concurrence croissante.
Initiative Trace Commons : collecte de traces de sessions de codage sous licence CC-BY-4.0 pour entraîner des modèles open-source et open-weight. Objectif : contrebalancer l'avantage compétitif d'Anthropic et OpenAI qui accumulent des données propriétaires via Claude Code et Codex.
Anthropic abandonne sa refonte impopulaire du système de facturation pour le Claude Agent SDK avant son lancement. Les applications tiers continueront à puiser dans les limites d'abonnement standard au lieu de crédits séparés.
DeepSeek lève 50 milliards de yuans (7,4 milliards USD) lors de son premier tour de financement externe, atteignant une valorisation de 50 milliards USD.
N2 Pro (rebrandé Rio-3.5) démontre des performances solides en benchmarks de code sur macOS 128GB. L'utilisateur rapporte une cohérence 100% sans hallucinations sur des tests privés llama.cpp, surpassant les modèles testés précédemment sauf GPT-5.x.
OpenAI a dépensé 34 milliards de dollars l'année passée, bien plus que l'année précédente. Aucun détail sur l'allocation des coûts n'est fourni.
AeroLLM, application open source optimisée pour Apple Silicon, permet d'exécuter localement des LLM, TTS et STT via une interface graphique. Utilise MLX pour l'inférence native, télécharge les modèles depuis Hugging Face avec recommandations RAM, expose une API optionnelle. Version 0.1.0 disponible.
Hydra Host lève 100 millions de dollars menés par Kindred Ventures pour développer ses usines dédiées à l'IA et accélérer son expansion.
Meta intègre l'IA dans Facebook via un nouveau mode de recherche exploitant les publications publiques. La plateforme promet des réponses plus rapides aux requêtes utilisateurs.
Claude Fable 5 a été interdit à l'export sous contrôle américain après qu'une demande simple « fix this code » ait permis de générer des exploits de sécurité. Kate Moussouris dénonce l'absurdité : les modèles de code doivent corriger les bugs, notamment les vulnérabilités. Bannir cette capacité affaiblirait la défense cyber.
Le FBI et Google ont démantelé un réseau de cybercriminels chinois utilisant Gemini pour des attaques. Google a riposté contre ces abus de sa plateforme.
quicktok est un tokeniseur BPE écrit en C++ produisant des tokens byte-identiques à tiktoken. Il encode 2–3.6× plus vite que bpe-openai et 4–11× plus vite que tiktoken lui-même. Supporte cl100k, o200k, GPT-OSS, Llama-3, Qwen2.5/3. Optimisations : trie 2-byte, caches denses, pretokenizer compilé.
OpenAI a multiplié ses pertes par 8 en 2025, avec des dépenses atteignant 34 milliards de dollars. La trajectoire financière de l'entreprise montre une accélération des investissements en infrastructure et R&D.
Framework Base Sequence Analysis encode le comportement d'agents autonomes LLM en séquences symboliques (X/E/P/V). Analyse de 347 traces de production ReAct révèle que P-X-P réduit le succès de 10.4% et P-ratio prédit négativement (r=-0.256). Governor, système d'intervention runtime, augmente le succès de +6.2% et réduit tokens de 44%. Validation sur 2000 trajectoires SWE-agent.
NVIDIA présente Nemotron 3 Ultra, un modèle MoE hybride Mamba-Transformer de 550B paramètres (55B actifs) pré-entraîné sur 20T tokens avec contexte 1M. Utilise SFT, RL et distillation multi-enseignants. Atteint ~6x le débit d'inférence des LLM publics avec précision équivalente. Checkpoints, données et recette open-sourcés sur HuggingFace.
Étude introduisant un cadre géométrique pour identifier des « engrams IA » — traces mémoire dans les réseaux de neurones profonds analogues aux unités biologiques. Les auteurs dérivent un estimateur en forme fermée permettant de manipuler chirurgicalement les connaissances apprises (composition, effacement) via arithmétique linéaire, sans optimisation itérative. Validation sur MLPs et LLMs.
SERAF, un framework de prévision de séries temporelles, combine récupération de segments historiques et descriptions textuelles auto-générées. Approche multimodale testée sur 7 datasets réels pour améliorer les prédictions au-delà de la simple similarité numérique.
DR-DCI combine retrieval et Direct Corpus Interaction pour les agents de recherche sur larges corpus. Le système utilise un retriever pour remplir dynamiquement un workspace local où l'agent exécute des opérations précises (filtrage, comparaison, vérification). Sur Browsecomp-Plus, DR-DCI atteint 71,2% de précision (+8,3 points vs DCI brut) et reste stable jusqu'à 10M documents, là où DCI brut devient instable.
Étude Bayésienne sur l'impact des régulations anti-pollution à Londres (2010-2020). Un modèle LSTM Bayésien intégrant données PM2.5, météo et 32 mesures politiques estime une réduction moyenne de 1.88 µg/m³ (IC 95%: 1.64-2.12), soit -12.35% relatif. Effets croissants 2013-2019.
Audit de mécanismes internes du modèle LLaMA 3.1-8B-Instruct sur 54 prompts moraux utilisant Transluce. Découverte d'un « Situational Anchor Effect » : les représentations domaine-spécifiques dominent indépendamment du contenu éthique. L'éthique reste constante en capacité mais très sensible au cadre interprétatif du prompt. Identification d'un neurone candidat (L16/N3837) stable en température.
CogGuard est un framework de prédiction proactive pour services edge utilisant des LLM hors-ligne pour construire des profils cognitifs et opérationnels, puis des SLM pour scorer en temps réel. Réduction de 48% du temps de construction de profils et 19% du fine-tuning distribué sur clusters hétérogènes. Erreur réduite de 15.4% vs baseline sur données éducatives.
VIBEMed est un framework multi-agent avec mécanisme d'auto-évolution pour le support décisionnel clinique. Trois agents spécialisés (diagnostic, traitement, évolution) intègrent l'historique des sessions patients et les résultats passés pour améliorer itérativement les décisions médicales. Résultats sur planification oncologique et cas complexes.
Metric Match est une méthode pour évaluer la fiabilité des juges LLM avec moins d'annotations humaines. Elle sélectionne un sous-ensemble d'échantillons dont les étiquettes synthétiques correspondent aux métriques de fiabilité de la population. Sur 15 datasets, elle réduit l'erreur d'estimation de 18,7% et les besoins en annotation de 32,5%, économisant $1,041.67 dans un cas médical.
DAG-SHAP, une nouvelle méthode d'attribution de features basée sur l'intervention sur les arêtes dans les graphes acycliques dirigés. Améliore les méthodes Shapley existantes en capturant simultanément l'externalité et l'influence exogène des features. Code disponible sur GitHub.
ASAG, une méthode sans entraînement basée sur l'analyse des distributions d'attention, détecte le surapprentissage dans les modèles de raisonnement et arrête la génération de manière adaptative. Testé sur DeepSeek-R1-Distill et Qwen3, elle améliore la précision de 3,2% tout en réduisant les tokens générés de 40% sur Qwen3-8B.
TruDi introduit des politiques de diffusion pour l'apprentissage par renforcement on-policy massivement parallèle. La méthode intègre une contrainte de divergence KL sur la trajectoire de diffusion complète pour stabiliser l'entraînement. Évaluation sur 73 tâches : surpasse les baselines, gains significatifs sur contrôle humanoïde.
Edu-Theater est un système multi-agent basé LLM pour simuler le comportement d'apprenants à grande échelle. Il utilise une approche cohort-aware avec diagnostic ciblé plutôt que des historiques denses par apprenant, réduisant les appels LLM et les données nécessaires. Testé sur deux datasets réels, il améliore la précision de simulation et les applications aval comme les tests adaptatifs.
Étude des propriétés de convergence de Monte Carlo Exploring Starts (MCES) en apprentissage par renforcement tabulaire. Les auteurs construisent des contre-exemples montrant que MCES peut converger vers des solutions sous-optimales, même avec exploration initiale. Une modification basée sur l'ajustement des taux d'apprentissage par fréquence de mise à jour garantit la convergence à l'optimalité.
M-CTX est un framework de récupération de contexte spatial pour l'analytique de trajectoires. Il remplace trois étapes brute-force (récupération OSM, calcul SDF, recherche de voisins) par des opérateurs indexés. Sur un corpus maritime de 5,48M anchors, il réduit le temps de construction de contexte de 17 jours CPU à 1,8 heures (speedup 226x), avec reproduction exacte du contexte de référence.
Nouvelle méthode d'évaluation pratique pour la traduction simultanée parole-à-parole (SimulS2ST) sur longs énoncés continus. Utilise ASR, alignement forcé et embeddings de phrases pour récupérer timestamps et aligner texte cible aux phrases source, puis calcule latence et qualité (YAAL, xCOMET) au niveau phrase. Révèle accumulation substantielle de latence sur longs discours.
AC-GPT modifie les Transformers causaux pour évaluer et générer à partir de conditionnels arbitraires (passé, futur, contextes mixtes) en un seul passage avant. La méthode préserve l'ordre gauche-droite et l'objectif de prédiction du token suivant, permettant l'affinage des LLMs existants sans dégrader les performances standard.
TimeMoDE, un framework combinant Diffusion Transformers et Mixture-of-Experts, génère des séries temporelles réalistes en contexte de données scarces. Pré-entraîné sur des datasets multi-domaines, il utilise des Domain Prompts pour adapter l'assignation d'experts et intègre des signaux de diffusion pour calibrer le débruitage. Surpasse les méthodes existantes en few-shot generation.
CONCORD est un framework pour RAG asynchrone sur device-cloud avec isolation documentaire. Il utilise un contrôle de dette d'attente et une supplémentation minimale guidée par certificat pour réduire la synchronisation et le transfert de données. Améliore le débit de 1.66× à 2.15× sur Natural Questions et WikiText-2 tout en réduisant la communication par token de plus de 100×.
ChatPlanner est un framework utilisant des LLMs fine-tunés avec RAG pour extraire les préférences utilisateur en langage naturel et les intégrer dans un algorithme d'optimisation de trajets en transport public. Évalué sur 8 personas et 5 contextes, le système combine fine-tuning (structure de sortie) et RAG (contexte spécifique) pour identifier des solutions ignorées par les planificateurs existants.
PolyKV optimise la compression du cache KV en appliquant des stratégies hétérogènes par couche transformer, plutôt qu'une politique uniforme. Sur LLaMA-3.1-8B et Qwen3-8B, avec budget KV de 512 tokens, PolyKV récupère 54,5% et 25,7% de l'écart de performance LongBench versus FullKV.
CDAT couple l'attention Transformer avec des dynamiques d'attracteurs inspirées des réseaux de neurones continus (CANN). Le modèle combine une énergie d'attention von Mises-Fisher avec un raffinement Hopfield et une modulation excitation-inhibition. Résultats SOTA en détection d'anomalies et classification de graphes.
Framework de bandit contextuel multi-bras pour optimiser le bouche-à-oreille stimulé via réseaux sociaux. L'approche apprend les probabilités individuelles de débordement (spillover) et classe les utilisateurs connectés pour maximiser les récompenses. Expériences sur données réelles montrent une amélioration de la précision de ciblage et des récompenses par rapport aux méthodes baseline.
Étude théorique montrant que les réseaux de neurones entraînés par gradient peuvent atteindre le compromis optimal calcul-statistique pour les modèles single-index gaussiens. L'algorithme proposé (réseau deux couches) atteint une complexité d'échantillon Õ(d^{s*/2} ∨ d) correspondant à la borne inférieure SQ, avec extension au cas k-sparse via perturbation de poids.
TriAdReview propose une architecture adversariale triangulaire avec deux modèles reviewers (ingénierie et sécurité) pour améliorer la génération de documents techniques. Sur 75 expériences, le système triple atteint +10.1% vs baseline (26.2 vs 23.8/50, p<0.05), avec gains forts en audit sécurité (+27.6%), génération code (+20.8%), design architecture (+15.6%), mais dégradation sur analyse requirements (-7.5%).
YB Mixer est une couche de mélange de tokens dérivée de structures de fermions libres et de l'équation de Yang-Baxter généralisée. Elle utilise l'algèbre d'Ising pour créer une structure fermionique orthogonale préservant la norme, avec matrices de transfert commutantes permettant une inférence sans ordre. Un générateur circulant spectral assure la généralisation à des séquences plus longues.
IRTS-ToolBench, un benchmark de 1 700 questions sur 10 types de tâches et 13 domaines, évalue comment les LLM et agents IA traitent les séries temporelles irrégulières (asynchrones, valeurs manquantes informatives, fréquences variables). Comble le fossé entre benchmarks TSQA existants (données régulières) et déploiements réels.
Étude sur l'évaluation des modèles de raisonnement au-delà de la simple précision. Les auteurs introduisent deux métriques : susceptibilité (si le biais casse une réponse correcte) et reconnaissance (si la trace mentionne explicitement le contenu biaisé). Sur GSM8K, GPT-4o et Claude Sonnet 4 montrent des taux de susceptibilité similaires (1,3% vs 1,2%) mais des taux de reconnaissance très différents (13,0% vs 75,0%).
StarOR couple la recherche arborescente (MCTS) avec l'apprentissage par renforcement au moment de l'inférence pour la modélisation d'optimisation. Le système décompose le processus en quatre étapes, affine un adaptateur LoRA via GRPO à chaque nœud, et utilise un système de récompense multi-facettes sans labels. Résultats SOTA sur cinq benchmarks avec backbone 4B.
Mask-Proof est un pipeline automatisé qui transforme des preuves mathématiques réelles en tâches vérifiables avec étapes masquées. Le benchmark contient 292 problèmes curatés. Sur 17 modèles testés, les modèles renforcés en raisonnement surpassent les modèles standards de 12-27%. L'évaluateur atteint 96,8% d'accord avec les annotateurs experts.
Des transformers à deux couches classifient les courbes elliptiques rationnelles (rang 0 vs 1) avec >99% de précision à partir de 128 traces de Frobenius. L'analyse mécanistique révèle qu'un circuit sparse de 20 neurones implémente l'heuristique de Mestre-Nagao (poids log(p)/(p·log B), r=0.997), découverte autonome d'un résultat de théorie analytique des nombres.
The AI Scientist automatise l'intégralité du cycle de recherche : génération d'idées, code, expériences, analyse de données, rédaction manuscrite et peer review. Un manuscrit généré a passé la première sélection d'un workshop majeur (taux d'acceptation 70%). Le système utilise des foundation models dans une architecture multi-agents.
Étude comparative de 19 types de couches GNN pour la prédiction de trajectoires en conduite autonome. Les couches ARMA, Chebyshev et topology-aware surpassent les autres. L'agrégation par somme, l'attention multi-tête et la pondération par distance de saut améliorent significativement la précision.
Étude comparant modèles ML (régression logistique, random forest, SVM, transformers, LSTM, GRU) pour prédire les résultats d'examen à partir de signaux physiologiques (activité électrodermale, fréquence cardiaque, température cutanée). Les random forests surpassent les modèles deep learning en efficacité computationnelle et interprétabilité.
FastMix automatise l'optimisation du mélange de données pour l'entraînement de modèles via descente de gradient. La méthode reformule la sélection de mélange comme un problème d'optimisation bilinéaire, optimisant conjointement les coefficients de mélange et les paramètres du modèle. Un seul modèle proxy suffit, réduisant drastiquement le coût de recherche comparé aux approches antérieures.
Nouvelle architecture neuronale séparable (SNA) combinant approximation neuronale et décomposition tensorielle pour résoudre des EDP haute-dimensionnelle. Cadre variationnel (VSNA) garantissant bien-posedness et convergence. Démontre 150 000x speedup vs FEM sur GPU A100 pour simulation paramétrique 7D et inversion thermique Inconel 718 en temps réel (<100ms).
Article théorique sur les modèles causaux structurels relationnels (RSCM), extension des SCM de Pearl aux environnements avec objets et relations variables. Propose des critères d'identification symbolique et des modèles neuraux causaux relationnels testés sur scènes de trafic simulées.
Article théorique sur le routage dynamique de requêtes vers plusieurs modèles d'embedding. Formalise le problème comme un bandit contextuel linéaire adversarial avec experts low-rank. Propose l'algorithme Hypentropy Policy Gradient (HPG) avec regret Õ(s√MT) sans malédiction de dimensionnalité.