Show HN: Claw Patrol, a security firewall for agents
Claw Patrol est un firewall de sécurité conçu pour les agents IA. Le projet, présenté sur Hacker News, vise à contrôler et sécuriser les actions des agents autonomes.
2731 articles
Claw Patrol est un firewall de sécurité conçu pour les agents IA. Le projet, présenté sur Hacker News, vise à contrôler et sécuriser les actions des agents autonomes.
Benchmark TTS révisé avec système de notation objectif et vote en aveugle. 46 modèles évalués via une arène ELO live. Interface Hugging Face et repo GitHub disponibles pour tester les TTS locaux.
Cohere lance North Mini Code, son premier modèle dédié aux développeurs. Le modèle est optimisé pour la génération et la complétion de code, avec support multilingue et intégration dans l'écosystème Hugging Face.
Un tribunal régional allemand déclare Google responsable du contenu de ses AI Overviews. La cour rejette les protections limitées de responsabilité applicables aux moteurs de recherche traditionnels. Google avait faussement lié deux éditeurs à de la fraude avec des affirmations absentes des sources citées.
Un juge a annulé un procès après avoir découvert que les deux parties avaient utilisé l'IA pour préparer leurs dossiers. Le magistrat a retiré les avocats de l'affaire, soulevant des questions sur l'utilisation non supervisée d'outils IA en contexte juridique.
Google DeepMind lance Gemini 3.5 Live Translate, un système de traduction vocale en temps quasi réel intégré à Google AI Studio, Google Translate et Google Meet. La traduction préserve la fluidité et le naturel de la parole originale.
Apple Intelligence permet à Siri de comprendre et analyser le contenu de l'écran iPhone. La fonctionnalité transforme l'interface en terrain d'interaction intelligent pour des actions contextuelles.
Étude comparant les performances des LLM avec les algorithmes classiques d'optimisation d'hyperparamètres. Résultats montrant les forces et limites respectives de chaque approche pour l'ajustement de modèles.
Avertissement sur OpenCode Go/Zen : les utilisateurs signalent l'impossibilité de supprimer leur compte. Plusieurs issues GitHub restent sans réponse depuis longtemps. Les développeurs répondent vaguement qu'ils ajouteront « probablement » cette fonctionnalité.
Guide pratique pour construire un agent IA basique capable de planifier des tâches longues. Couvre les concepts fondamentaux et l'implémentation d'un système de planification multi-étapes.
Des fabricants chinois produisent des cartes V100 PCIe demi-hauteur, une seule fente, avec NVLink. Noyau soudé sur PCB personnalisé, refroidissement passif, 75W par défaut ou 300W en version alternative. 16 cm × 7,5 cm. Prévu à ~220 USD (16 GB), version 32 GB en développement. Vidéo Bilibili, pas encore en vente.
Un utilisateur a déployé un bot d'arbitrage sur Polymarket et partage les résultats réels de ses opérations. L'article détaille la performance, les coûts et les défis rencontrés lors de l'exécution d'une stratégie automatisée sur le marché de prédiction.
Google DeepMind lance Gemma 4 12B, un modèle multimodal unifié sans encodeur dédié. Le modèle traite texte, images et vidéo dans une architecture unique, optimisé pour l'inférence sur appareils.
Méthode de génération texte-vers-CAO utilisant des LLM pour produire des modèles 3D contrôlables et fidèles aux instructions. Combine traitement du langage naturel et géométrie 3D pour transformer des descriptions textuelles en fichiers CAO exploitables.
Google DeepMind annonce un investissement dans la robotique européenne pour développer des systèmes autonomes avancés. L'initiative vise à renforcer les capacités de recherche et d'application pratique en robotique sur le continent.
La Chine prévoit d'investir 295 milliards de dollars dans un réseau national de centres de données IA sur cinq ans. Au moins 80 % des composants proviendraient de fournisseurs domestiques comme Huawei, excluant les fournisseurs américains. Taïwan envisage de criminaliser le trafic de puces IA vers la Chine.
OpenAI améliore la mémoire de ChatGPT avec un système reliant les échanges passés aux besoins actuels. Cette fonctionnalité devient accessible aux utilisateurs gratuits.
Apple a annoncé CoreAI à la WWDC, un moteur d'inférence on-device pour remplacer CoreML. Supporte les modèles jusqu'à 20B paramètres via conversion Python. Performance vs MLX/llama.cpp non encore documentée.
Article explorant comment les agents IA utilisent des techniques de recherche avancées au-delà des approches basiques. Analyse l'architecture et les capacités des systèmes d'agents modernes pour optimiser la recherche et la récupération d'informations.
Implémentation Rust native CPU-only de LFM2.5-8B-A1B avec support des tool calls. Decode ~37 tokens/s sur Ryzen 7950X, prefill non optimisé. Consommation mémoire ~7GB, compatible 16GB RAM. Publié en crate cargo.
Un modèle post-entraîné capable de réaliser des pen tests au lieu de refuser l'analyse de code. Approche contrastant avec les garde-fous classiques des LLM.
Les ingénieurs de Nextdoor utilisent Codex avec GPT-5.5 pour investiguer les bugs difficiles à reproduire, développer multi-plateforme et se concentrer sur les résultats produit.
Prototype décentralisé utilisant des embeddings locaux (EmbeddingGemma-300M) pour remplacer les index centralisés. Les appareils communiquent en peer-to-peer, classent les contenus par distance sémantique (cosine similarity) sans serveur ni ranking global. Extension proposée aux agents IA découvrant mutuellement leurs besoins/offres par proximité sémantique.
Apple déploie une fonction de sécurité automatisant le remplacement des mots de passe compromis avant leur exploitation. La fonctionnalité détecte les fuites et initie le changement sans intervention utilisateur.
Agent-skills : framework open-source pour équiper les agents IA de compétences d'ingénierie production. Dépôt GitHub visant à standardiser les capacités des agents de codage.
Dépôt GitHub compilant les system prompts et modèles internes de 25+ outils IA (Claude Code, Cursor, Devin AI, Perplexity, Replit, v0, etc.). Inclut aussi des outils open-source. Ressource pour reverse-engineer les instructions système des assistants populaires.
Ataraxy-Labs/sem : contrôle de version sémantique au-dessus de git avec diffs au niveau entité, blame et analyse d'impact. Support de 26 langages via tree-sitter. Conçu pour les agents de code.
Cube Core est une couche sémantique open-source pour l'IA, le BI et l'analytics embarquée. Le projet gagne en popularité sur GitHub Trending.
Chroma est une infrastructure de recherche vectorielle pour applications IA. Le projet GitHub trending propose des outils de stockage et requête de vecteurs d'embeddings pour RAG et systèmes basés sur des modèles de langage.
Asm est un gestionnaire de compétences universel pour agents IA de codage. Le projet GitHub propose une infrastructure pour orchestrer et gérer les capacités des agents autonomes.
DesktopCommanderMCP est un serveur MCP pour Claude offrant le contrôle du terminal, la recherche dans le système de fichiers et l'édition de fichiers avec diff.
ARIS (Auto-Research-In-Sleep) : framework léger basé Markdown pour recherche ML autonome. Boucles de révision cross-modèles, découverte d'idées et automatisation d'expériences. Compatible Claude Code, Codex, OpenClaw et tout agent LLM.
Action GitHub utilisant Claude pour analyser automatiquement les changements de code et détecter les vulnérabilités de sécurité.
Discussion Reddit sur l'adoption réelle des techniques de ML préservant la vie privée (differential privacy, federated learning, inférence on-device) en production. L'auteur constate une littérature active mais questionne le déploiement industriel réel, les défis d'ingénierie, l'impact sur les performances et les coûts.
Nvidia mise sur la demande d'IA dans les PC grand public, au-delà des utilisateurs niche. La stratégie repose sur des cas d'usage non encore validés et une adoption incertaine du marché de masse.
Apple présente une version repensée de Siri lors de la WWDC 2026, utilisant des modèles de fondation développés avec Google. Pour les requêtes complexes, l'assistant s'appuie sur les GPU Nvidia.
Construction d'un serveur LLM miniature sur Jetson Orin NX avec benchmarking. Gemma 4 26B quantifié en Q2_K_XL atteint 66K tokens de contexte, 14.65 tok/s à 8K contexte et 10.21 tok/s à 60K contexte. Support des appels d'outils multiples pour agents Hermes.
Un agent IA a construit une galerie 3D de Paris en chaînant deux Hugging Face Spaces. Le système a orchestré automatiquement la génération d'images et la création d'environnement 3D sans intervention manuelle.
LG Group renforce son partenariat avec NVIDIA pour construire une infrastructure d'AI Factory destinée à accélérer ses projets d'intelligence artificielle.
OpenAI abandonne son objectif d'automatisation complète d'ici 2028, privilégiant un modèle de collaboration homme-machine. Altman et Pachocki appellent à un organisme international capable de ralentir le développement des modèles frontière si nécessaire.
The Weather Company migre son infrastructure vers Vercel et v0, servant 350 millions d'utilisateurs mensuels. La refonte réduit le délai design-publication de jours à heures et augmente la vélocité de 80%. 2,2 milliards de coordonnées calculées toutes les 15 minutes.
TinySearch v0.2.0 (première bêta stable) remplace DuckDuckGo par SearXNG comme backend de recherche par défaut. Cet outil MCP/FastAPI léger pour petits LLMs locaux crawle quelques pages, les chunke et reranke pour fournir un contexte compressé (max 8k tokens) aux agents, évitant de surcharger le prompt avec du contenu inutile. Testé avec Qwen 3.5-9B.
OpenAI a déposé confidentiellement un formulaire S-1 auprès de la SEC, première étape formelle vers une introduction en bourse. L'entreprise qualifie le processus de « compromis compliqué » sans calendrier défini. Le dépôt d'Anthropic ajoute de la pression concurrentielle.
OpenAI prépare son entrée en Bourse suite au dépôt confidentiel confirmé par l'éditeur de ChatGPT, quelques jours après l'annonce similaire d'Anthropic.
Un chercheur a fine-tuné un modèle de langage pour générer du contenu optimisé pour les cerveaux ADHD, en maximisant l'engagement dopaminergique. L'approche combine fine-tuning sur des données curées et évaluation via des métriques comportementales.
L'INSEE constate une croissance française de +0,9 % acquis à mi-2026. L'impact de l'IA sur l'activité économique demeure modeste malgré les attentes.
Uber et Wayve adoptent un modèle de séparation flotte/logiciel pour les robotaxis à Londres (juin 2026), tandis que Waymo privilégie l'intégration verticale. Les deux stratégies s'opposent sur le contrôle de la chaîne de valeur.
Red Hat et NVIDIA annoncent une infrastructure commune pour les agents IA lors du Red Hat Summit 2026. Le partenariat renforce les capacités d'IA agentique des deux entreprises.
Un chercheur teste Gemma 4 31B pour comprendre du code académique complexe et niche. Gemma 4 31B surpasse Qwen 3.6 (27B et 35B) et égale Claude Opus 4.7 en compréhension des dépendances entre composants. Qwen 3.6 montre de l'enthousiasme excessif mais détecte une amélioration locale que les autres modèles manquent.
Les outils open source de Microsoft ont été compromis pour voler les mots de passe de développeurs IA. Une attaque de supply chain a ciblé des dépôts Microsoft, exposant les credentials d'accès.
Latent Space présente FrontierCode, un benchmark pour évaluer la qualité du code généré par IA au-delà des métriques superficielles. L'outil mesure la robustesse et la fiabilité des solutions plutôt que leur simple fonctionnalité.
Quasar-Preview de silx-ai, modèle open-source avec contexte de 5M tokens, est disponible sur Hugging Face. Pas de détails techniques ou benchmarks fournis dans le post.
Benchmark comparatif de Gemma 4 26B en quantifications 4-bit, 6-bit et QAT 8-bit sur MLX. Tests : 50 questions MMLU_PRO et 100 HumanEval. Le 6-bit obtient 58% MMLU_PRO et 98% HumanEval ; le 4-bit 56% et 90% ; le QAT 8-bit 52% et performance HumanEval non complète.
LFNO (Laplace-Fourier Neural Operator) combine les avantages spectraux des opérateurs de Laplace et Fourier via une décomposition explicite en régimes transitoires et stationnaires. Évalué sur 9 benchmarks (3 systèmes ODE, 6 systèmes PDE incluant Navier-Stokes), LFNO surpasse les opérateurs existants sur les ODE et rivalise avec FNO sur les PDE.
Nouvelle méthode d'évaluation pour agents sociaux IA : un agent évaluateur interagit activement avec l'agent cible pour générer des situations spécifiques testant des critères sociaux (gestion de conflits, etc.). Testé sur 32 critères dans un environnement de simulation de vie, améliore la couverture et l'accord avec les labels humains par rapport aux méthodes passives.
IntentPOI, un framework en deux étapes utilisant les LLM, prédit le prochain Point-of-Interest en inférant d'abord l'intention de l'utilisateur (mobilité historique, comportements pairs, contexte temporel), puis en sélectionnant les POI alignés. Surpasse 11 baselines sur trois datasets réels.
PPV (Propagational Proxy Voting) surpasse le vote majoritaire sur MMLU-Pro (+1.5 pp, +2.24 pp sur sous-ensemble non-trivial, p~1.0e-14). Cette agrégation non-supervisée exploite l'entropie des lettres et la géométrie du raisonnement pour pondérer 128 générations partitionnées en 16 groupes, sans labels ni entraînement auxiliaire.
Nouveau dataset industriel MMIO (80K+ samples, 6 super-catégories, 18 sous-catégories) pour la détection de défauts en zéro-shot. Méthode RTVP (Refined Text-Visual Prompt) basée sur Mobile-SAM avec adaptation de domaine guidée par expert. Atteint 42.2% AP zéro-shot et 24.7% AP en scènes fermées.
AI-MASLD, un framework d'audit de stress, évalue 7 LLMs médicaux sur 240 cas cliniques avec perturbations narratives. Tous performent bien en baseline, mais divergent sous stress réaliste. Les modèles quantifiés masquent l'effondrement fonctionnel ; le fine-tuning médical dégrade stabilité logique et équité. Un modèle open-weight égale les alternatives propriétaires sur tous les critères de sécurité.
EditSR propose un framework deux couches pour la régression symbolique neurale. Une première couche génère des expressions via décodage autorégressif, une deuxième couche (Rectifier) corrige les erreurs syntaxiques par édition pas-à-pas. Le Rectifier est préentraîné pour maintenir l'efficacité sans relancer la recherche globale. Gains significatifs sur expressions complexes.
ThinkBooster est un framework unifié pour le scaling du calcul au test-time (TTC) des modèles de raisonnement. Il intègre une librairie Python modulaire, un benchmark évaluant performance et efficacité computationnelle, et un service proxy compatible OpenAI. Résultats sur tâches mathématiques et de codage montrent les trade-offs performance-coût des stratégies TTC.
Un protocole de communication agent-à-agent (RCP) automatise les échanges entre régulateurs et demandeurs dans l'examen des réacteurs nucléaires avancés. Testé sur 1 236 documents de la NRC, il réduit les coûts de 50-77% (21-44M USD vs 89M USD) et les délais de 65% (15 mois vs 42 mois). Applicable à d'autres secteurs réglementés, les économies potentielles atteindraient 210-330 milliards USD/an.
Nouvelle approche de systèmes IA modulaires construits par contributions décentralisées de petits modèles spécialisés. Les systèmes participatifs surpassent les LLMs monolithiques de 15,4% sur 15 tâches (raisonnement, factualité) et résolvent 15% de problèmes où tous les modèles individuels échouent.
Prithvi-EO-2.0, un modèle géospatial fondationnel, testé sur 19 événements de crue (2017-2025) à travers 6 continents. Précision variable selon le type de couverture terrestre : cultures 52% IoU, zones arborées 4%. Détection riveraine forte (F1=0.69). 23 modes de défaillance identifiés, l'ingénierie du pipeline domine les erreurs initiales.
PathoSage est un framework à trois étapes pour le raisonnement multimodal en pathologie computationnelle. Il sépare explicitement la récupération de connaissances, la collecte de preuves et l'adjudication des preuves via un système de délibération structurée. Un système Beta-Bernoulli sans entraînement modélise la fiabilité des outils pour réduire les hallucinations et les biais d'ancrage.
MemToolAgent améliore l'utilisation d'outils par les agents LLM via un système de mémoire structuré. Le framework extrait des expériences passées en entrées mémoire, les récupère dynamiquement et génère des réflexions basées sur les retours utilisateur. Gains de 29%, 80% et 17% sur WorkBench, NESTFUL et PEToolBench sans fine-tuning.
Article théorique sur les limites cognitives des chatbots dans la résolution de problèmes. Les auteurs argumentent que les LLM encodent des « propagations métaphoriques » artificielles issues des données d'entraînement, incapables de reproduire la compréhension humaine. Conclusion : l'amélioration des LLM ne permettra pas aux chatbots de devenir des partenaires de réflexion équivalents aux humains.
IRSL intègre la théorie de la réponse aux items (IRT) aux lois d'échelle des modèles de langage, réduisant la complexité de O(M×N) à O(M+N). Validé sur 6,612 checkpoints et 37,682 questions, l'approche Beta-IRT atteint une précision comparable avec 99,9% moins de questions (50 par benchmark).
Étude benchmarking montrant que les méthodes d'interprétabilité (IML) appliquées aux modèles génomiques produisent souvent des explications contradictoires et ne localisent pas les motifs régulateurs connus. Les auteurs proposent un cadre d'évaluation rigoureux inspiré des essais cliniques pour remplacer la validation anecdotique actuelle.
Nouvelle métrique « Contribution Weights » pour analyser les transformers au-delà des poids d'attention. Intègre magnitude des vecteurs de valeur et alignement directionnel. Surpasse les métriques basées sur l'attention pour identifier les tokens critiques. Révèle que les « attention sinks » jouent un rôle actif de suppression d'information, stabilisant les représentations.
Les LLM pour la génération d'assemblages LEGO souffrent du problème PhysHack : structures physiquement valides mais géométriquement mal alignées. Les auteurs proposent PVPO, une méthode RL sample-efficient couplant faisabilité physique et récompenses géométriques en voxel-space. Résultats : amélioration de l'alignement sémantique, stabilité structurelle et calibration.
DiffOR propose un nouveau paradigme pour la régression ordinale en la formulant comme une tâche de génération continue. Le framework utilise des modèles de diffusion pour récupérer des valeurs ordinales via débruitage itératif, avec une stratégie de double découplage (agrégation multi-échelle et perception dynamique du débruitage) pour préserver la topologie ordinale. Validé sur 12 benchmarks.
Une méthode post-hoc réduit les biais de fine-tuning en tronquant la queue de la décomposition SVD des mises à jour de poids (ΔW). Testée sur 3 modèles (0.5B–7B) et 4 benchmarks, elle diminue l'écart de performance sur groupes sous-représentés jusqu'à 5× (CivilComments) avec <2pp de perte d'accuracy, sans retraining ni labels de groupe.
Article théorique prouvant que l'ordonnancement optimal des filtres séquentiels minimise le coût total en les triant par ratio croissant coût/probabilité de rejet. Simulations Monte Carlo confirment la domination stricte sur les heuristiques courantes.
MST-Direct étendu à grande échelle pour simulation géostatistique multivariée et conditionnelle via transport optimal de Sinkhorn. Résout scalabilité (O(nC) mémoire), extension multivariée et conditionnement par kriging. Validation sur 6 variables, grilles 200×200 et 100×100 avec 200 données observées. Reproduit distribution jointe exactement vs approximation PPMT.
Les modèles de diffusion de langage (DLMs) utilisent l'attention bidirectionnelle, ce qui invalide les techniques de cache KV classiques pour les préfixes partagés. Les chercheurs proposent bicache, une méthode qui identifie dynamiquement la profondeur de couche sûre pour réutiliser les KVs des préfixes partagés. Résultat : 36–98% d'amélioration du débit sans effondrement d'accuracy.
STARIXNet est un réseau de neurones léger pour l'allocation de ressources en temps réel dans les clouds. Il capture les relations spatio-temporelles entre plusieurs métriques système (saisonnalité, tendance, auto-régression, variables exogènes) et priorise la stabilité des services avant la précision de prédiction. Déployé chez Walmart, il génère 10-50% d'économies.
RL4F est un benchmark open-source d'apprentissage par renforcement hors-ligne pour le contrôle du plasma dans la fusion nucléaire. Basé sur des données historiques du tokamak DIII-D, il évalue des méthodes imitation learning et offline RL sur quatre tâches de suivi multi-actuateurs (rotation, densité, température, pression). Les méthodes offline model-based RL obtiennent les meilleures performances moyennes.
Framework de prévision des files d'attente aux portes de départ et points de contrôle de sécurité aéroportuaires. Architecture Transformer capture les dépendances temporelles et corrélations inter-installations à partir des longueurs de files, temps d'attente et débits de passagers. Prédictions fiables jusqu'à 2 heures.
HASA propose une allocation de sous-réseaux pour l'apprentissage fédéré hétérogène en ressources et données. La méthode assigne les largeurs de sous-réseaux selon des scores d'hétérogénéité calculés à partir des données locales, sous contrainte de budget de calcul fixe. Sur prédiction de titre (7 clients), HASA améliore la précision moyenne de 13,82% à 14,32% et renforce la performance des clients les plus faibles.
Des chercheurs proposent un framework GNN pour classifier les groupes finis selon leur solvabilité, en utilisant des représentations graphiques comme les graphes de Cayley. Le modèle apprend à distinguer les groupes solvables des non-solvables à partir de l'information structurelle du graphe seul, testé sur des groupes hors de l'ensemble d'entraînement.
ScaleSweep optimise la quantification NVFP4 (format FP4 4-bit supporté par hardware) des LLMs via balayage de candidats d'échelle de bloc. Théoriquement borné pour réduire l'espace de recherche, la méthode préserve >93% des performances full-precision sur Llama et Qwen en quantification end-to-end (poids, activations, KV cache, query states).
Query Lens étend Logit Lens pour interpréter les features des autoencodeurs creux en analysant conjointement les clés (encoder) et valeurs (decoder). La méthode capture les effets indirects via les modules aval, révélant des signatures de tokens cohérentes pour des features opaques sous Logit Lens. Hypothèse : les modules aval lisent les features via des sous-espaces spécifiques par couche.
Cadre de pruning structuré utilisant des algorithmes de bandits multi-bras (MAB) pour supprimer des neurones complets dans les réseaux de neurones profonds. Évalue UCB1, Thompson Sampling, Epsilon-Greedy et autres politiques sur tâches de classification, régression et apprentissage profond. UCB1 et Thompson Sampling surpassent le pruning basé sur la magnitude et le modèle non élagué.
Étude appliquant Random Forest Recursive Feature Elimination aux données d'enquête ménagère nigériane (2018/19) pour identifier les prédicteurs minimaux de pauvreté, quintiles de bien-être et inégalités. RF-RFE atteint 90% de précision pour la pauvreté avec 5 variables de revenu, 80% pour quintiles saisonniers. Les méthodes ML réduisent les besoins en données tout en conservant l'information distributionnelle.
LEAF est une méthode RL basée sur des arbres rétrospectifs pour l'entraînement post-training de LLM conscients de la parole. Elle améliore l'attribution de crédit en groupant les réponses par préfixes partagés et assignant des avantages au niveau des spans. LEAF surpasse GRPO sur les benchmarks de question-réponse et traduction vocale.
QDSP est un framework d'apprentissage structuré pour prédire la mortalité ou paralysie cérébrale chez les nourrissons de très faible poids à la naissance. Sur une cohorte de 51 patients, il atteint 92% d'accuracy et 0.9714 AUC, surpassant XGBoost, TabNet et TabPFN. L'interprétabilité via SHAP identifie des prédicteurs cliniques pertinents comme la leucomalacie périventriculaire kystique.
SRT propose un framework de super-résolution pour séries temporelles via flux rectifié disentanglé. La méthode décompose l'entrée en composantes trend/saisonnière, les aligne via représentation neurale implicite, et utilise un mécanisme d'attention cross-résolution. SRT-large pré-entraîné démontre capacités zero-shot sur 9 datasets publics.
MetaEvo propose un framework deux étapes pour l'évolution continue d'agents LLM. Il combine l'optimisation basée sur les préférences pour améliorer l'abstraction de principes, puis accumule et réutilise ces principes dans une architecture modulaire. Résultats sur benchmarks de raisonnement montrent des améliorations continues sans plateau.
Étude théorique formalisent la propagation de données dans les Transformers comme système de contrôle non-linéaire. Pour le modèle mean-field avec self-attention et couches feed-forward affines, les distributions gaussiennes restent gaussiennes. Cela réduit la dynamique à un système de contrôle bilinéaire fini gouvernant moyenne et covariance, reliant l'expressivité des Transformers à des équations de Riccati.
Framework topologique pour comparer les GNNs entraînés en mappant les Stochastic Block Models sur la sphère n-dimensionnelle. Utilise la compacité de l'espace graphon, le lemme de régularité faible de Frieze-Kannan et la continuité Lipschitz des MPNNs. Produit une « empreinte » de faible dimension pour la recherche de candidats de transfer-learning sans réentraînement.
Les expériences de mélange de données pré-entraînement échouent souvent lors du passage à l'échelle car le taux de répétition des données de haute qualité change avec le budget de tokens. Une procédure de sous-échantillonnage contrôlant la répétition permet de récupérer le mélange optimal avec 1/16 des tokens cibles (757M paramètres), réduisant l'erreur de 0.75 à 0.05.
UNIQ introduit une calibration conforme pour adapter la conservatisme dans l'apprentissage par renforcement hors ligne. Basé sur IQL, la méthode utilise un ensemble multi-expectile et la prédiction conforme pour estimer l'incertitude sans distribution, ajustant dynamiquement la pénalité selon la couverture locale des données. Sur D4RL MuJoCo, UNIQ surpasse IQL avec 10× moins de mémoire qu'EDAC.
ResearchClawBench évalue la capacité des agents IA à conduire des recherches scientifiques autonomes sur 40 tâches couvrant 10 domaines. Claude Code atteint 21.5/100, Claude-Opus 20.7/100. Les défaillances concentrent sur les protocoles expérimentaux, l'appariement des preuves et les lacunes conceptuelles.
Étude de 21 méthodes de routage LLM sur 5 benchmarks révélant un plateau d'accuracy : la plupart convergent vers une performance similaire loin de l'oracle. Le goulot d'étranglement provient d'une prédictibilité insuffisante — les routeurs apprennent des tendances globales plutôt que des signaux spécifiques par requête. Datasets plus larges, encodeurs plus forts et fine-tuning bout-à-bout améliorent les résultats.
Étude arXiv proposant une architecture hybride FT-Transformer + XGBoost avec stacking pour prédire le churn client sur données structurées. Atteint 62,10% F1 et 0,861 AUC-ROC sur dataset bancaire public, surpassant MLP de 3,37 points F1. Gère le déséquilibre de classe sans suréchanillonnage synthétique.
Article théorique proposant des « contrats de kernel » pour borner la divergence entre les kernels d'entraînement et d'inférence en post-training. Framework spécifiant les écarts acceptables en précision finie, avec clauses numériques, statistiques et de routage. Dérive des bornes de dérive logit à distance de variation totale et applique à l'RL.
CARTOGRAPH est une couche de vérification pour scientifiques IA autonomes, combinant sélection d'expériences, fermeture d'ambiguïté et détection d'insuffisance de bibliothèque. Sur cinq benchmarks, CARTOGRAPH-A surpasse la projection brute (129W/0T/15L, p<10^-21). Le système refuse correctement 4/4 réclamations jugées inconcluses en réanalyse manuelle du système A-Lab.
Framework mathématique (HEF) modélisant l'émergence comme transition de phase dans un paysage de mécanismes. Étude empirique sur 111 expériences de grokking dans transformers : convergence vers 0.9745±0.014 indépendamment de l'initialisation, pic de norme des poids avant grokking dans 92% des cas, courbes d'accuracy s'effondrant sur tanh (R²=0.93).
SPIN est un framework de coordination décentralisée pour essaims multi-agents sur plateformes edge. Il modélise les topologies d'essaim comme réseaux tensoriels compressés, réduisant la complexité de O(n^m) à O(m·n·χ²). Une pipeline neuro-symbolique hybride combine encodeurs de coordination neuraux pré-entraînés hors ligne avec filtres de rééchantillonnage zéro-shot basés sur la dérivée de Radon-Nikodým.