Warp’s big bet on building open source with GPT-5.5
Warp intègre GPT-5.5 et les modèles OpenAI pour coordonner des agents de codage sur des workflows locaux, cloud et open-source.
3149 articles
Warp intègre GPT-5.5 et les modèles OpenAI pour coordonner des agents de codage sur des workflows locaux, cloud et open-source.
OpenAI annonce des mesures pour les élections 2026 : accès à l'information, soutien aux défenseurs contre les cybermenaces, et transparence accrue sur l'IA. Pas de détails techniques ou de modèles spécifiques mentionnés.
Vercel CLI propose un binaire natif expérimental optionnel, plus rapide et sécurisé, sans dépendance Node.js. Les binaires sont signés cryptographiquement et stockent les credentials dans le Keychain système (macOS). Disponible sur macOS, Linux, Windows en x64/arm64.
Vercel redesigne sa liste de déploiements avec une mise en page plus dense. Les environnements sont groupés par statut, facilitant la lecture des branches et commits. L'expérience mobile est améliorée.
Hugging Face introduit Delta Weight Sync dans TRL pour optimiser le déploiement de modèles trillion-paramètres. La technique synchronise uniquement les changements de poids plutôt que les modèles complets, réduisant drastiquement les besoins en stockage et bande passante pour les mises à jour.
Daniel Stenberg, mainteneur de curl, rapporte une augmentation sans précédent des rapports de sécurité : 4-5× plus qu'en 2024, plus d'un par jour en moyenne. Les rapports sont détaillés et de haute qualité, générés par des outils IA. Malgré cette pression extrême, les vulnérabilités trouvées restent de sévérité basse à moyenne.
Cactus Hybrid Router, un modèle routeur de 65k paramètres, dirige 15-55% des tâches vers Gemini-3.1-Flash-Lite et exécute le reste localement avec Gemma4-2B. Le système maintient les performances même avec quantification 4-bit et gère texte, vision et audio.
Benchmark de performance en compute (diffusion texte-image) comparant RTX 5090 (400-600W) vs RTX 6000 PRO MaxQ (325W) et 6000 PRO WS (600W). Tests sur Forge Neo avec SageAttention 2.1, résolution 896x1088, batch size 4. 5090 undervolté/overclocké (2930MHz, +4400MHz VRAM), 6000 PRO MaxQ modifié (+550MHz core).
Configuration budget à 400$ avec deux RTX 3060 (24GB total) pour exécuter Qwen 3.6-27B. Vitesse de décodage 30-50 t/s sur llama.cpp avec quantization Q4_K_S. Plateforme i7-4770K ancienne mais supportant PCIe 3.0 x8 dual, comparable aux setups modernes. Limitation : pas de KV cache quantization avec tensor parallel, contexte limité à 64k.
Quale est un analyseur de code agnostique au langage qui fournit aux LLMs le contexte structurel du repository (fichiers à éditer, tests associés, limites stables) sous forme de contrats JSON. Testé avec Qwen et Mistral locaux, il réduit les hallucinations et améliore la précision des modifications de code.
Une mère de la Bay Area a perdu plusieurs milliers de dollars après que des arnaqueurs ont utilisé l'IA pour imiter la voix de sa fille et demander de l'argent d'urgence. L'incident illustre les risques croissants des deepfakes vocaux dans les escroqueries ciblées.
DeepSWE est un benchmark sans contamination pour évaluer les agents de codage sur des horizons longs. Il mesure la capacité des systèmes à résoudre des tâches complexes de développement logiciel de manière autonome.
GPT-4o, ChatGPT et GPT-o3 affichent une confiance supérieure à leur précision réelle, particulièrement sur les tâches difficiles où ils commettent le plus d'erreurs. Un preprint USC/Berkeley révèle un écart croissant entre confiance déclarée et performance réelle.
PrismML publie Bonsai Image 4B, des modèles de diffusion texte-vers-image quantifiés en 1-bit/ternaire. Taille ~3GB (vs 16GB pour FLUX.2 Klein), exécutables 100% localement en WebGPU. Licence Apache-2.0.
llama.cpp Console est une application Windows desktop (WPF) pour gérer llama.cpp sur WSL/Ubuntu sans terminal. Elle automatise l'installation de WSL, Ubuntu, CUDA, Vulkan, le téléchargement de modèles GGUF depuis Hugging Face, et le lancement de llama-server avec monitoring en temps réel (tokens, GPU, logs).
Claude Mythos d'Anthropic résout la conjecture d'Erdős (1946) peu après qu'OpenAI l'ait réfutée. Sholto Douglas rapporte une preuve « mignonne et simple » trouvée « le week-end », suggérant un « sérieux surplomb » dans les découvertes mathématiques assistées par IA.
Un développeur a créé autoswarm, un pipeline d'agents auto-optimisants qui améliore les performances de 30% à 90% sur TerminalBench. Le système enregistre les chats avec un LLM local, les analyse via reflection, extrait des leçons dans skills.yaml et les injecte dans le prompt système des futurs chats.
Utilisateur rapporte une dégradation drastique des performances de Qwen3.5 122B en quantification Q3_K_XL au-delà de 75-80k tokens de contexte : hallucinations, oublis, confusion. Demande si le problème vient de la quantification Q3 ou du modèle lui-même, et cherche des optimisations llama.cpp.
EAMS (Equivariant Anatomical Mesh Segmentor) applique l'équivariance rotationnelle aux réseaux de mailles pour la segmentation anatomique 3D. Le modèle (<2M paramètres) maintient la performance sous perturbations géométriques (rotation 40°) où les méthodes existantes chutent de 25-26 points IoU. Évalué sur 4 tâches cliniques (anévrisme intracrânien, segmentation intra-orale, foie).
Spotify intègre des articles narrés dans son app (26 mai 2026). La plateforme transforme le contenu textuel en audio pour élargir son offre au-delà de la musique et des podcasts.
Tomesphere indexe 3 millions de papiers arxiv/OpenAlex avec TLDRs Gemini, avis pairs OpenReview, repos GitHub, graphe de citations (250M arêtes) et graphe sémantique SPECTER2 (768D pgvector). Quatre modes de ranking : Influential, Recent, Hidden gems, Nearest. Extension Chrome pour arxiv. Accès gratuit, sans inscription.
Nathan Lambert analyse les tendances IA de mai 2026 : Gemini Flash 3.5, le modèle Mythos, l'équilibre open-closed source, la montée en puissance de l'open-source américain et les luttes de pouvoir émergentes dans l'écosystème.
Microsoft Copilot Cowork permettait aux agents d'envoyer des emails non approuvés à la boîte de réception de l'utilisateur. Ces messages pouvaient contenir des images externes déclenchant des requêtes réseau, permettant l'exfiltration de données. Une injection de prompt réussie aurait pu divulguer des liens OneDrive pré-authentifiés, donnant accès aux fichiers à un attaquant.
Des chercheurs proposent un mécanisme de consolidation inspiré du sommeil pour les LLM, permettant de renforcer les connaissances acquises et d'améliorer la rétention sans entraînement supplémentaire. Le concept s'appuie sur des processus biologiques de consolidation mémoire.
Un essai argue que les modèles de raisonnement ne peuvent pas effectuer une inférence fidèle car leur trace de raisonnement et réponse finale proviennent de la même opération. Critique empirique des travaux de Lanham/Turpin/Mirzadeh, comparaison avec HRM, TRM, GRAM, AlphaProof et Kona/Aleph.
MOSS-TTS-v1.5 améliore la synthèse vocale multilingue (31 langues), le clonage de voix zéro-shot et la stabilité. Nouvelles capacités : contrôle explicite des pauses, meilleure gestion des références longues, prosody plus stable. Modèle open-source sur Hugging Face.
Créateurs ont produit une bande-annonce de film de braquage cinématographique en combinant 4 modèles IA pour 60 dollars. Démonstration de faisabilité de production vidéo IA à bas coût.
Un projet open-source développe un installateur unifié pour simplifier le déploiement local d'IA sur Linux, Windows et Mac. L'outil automatise la configuration des modèles, pipelines et ressources matérielles, offre une interface unifiée de monitoring, et intègre la détection multi-GPU avec parallélisation automatique. Gestion des modèles et téléchargements directement via dashboard.
Un étudiant en informatique développe un routeur LLM spécialisé pour le code, basé sur l'extraction de signaux bon marché du prompt plutôt que sur un LLM fine-tuné. Il utilise la taxonomie de Bloom pour évaluer la complexité des requêtes. Il cherche des conseils sur les datasets, le bootstrapping IA, et les classifieurs pour différencier les nuances entre requêtes.
ScholarScout v1.5.3 ajoute un jeu Chrome Dino au écran d'attente du pipeline (2-3 min). Un hibou pixel traverse une forêt en parallaxe ; chaque point de papier spawné correspond à un vrai événement SSE backend (600ms d'intervalle). Couleurs = source (arXiv blanc, PubMed vert, Crossref violet). Nouvelles fonctionnalités : clustering k-means sur embeddings, synthèse par cluster, gestion de fraîcheur des papiers.
dlmserve est le premier moteur de serving pour modèles de langage par diffusion (LLaDA, Dream-7B). Contrairement aux LLM autorégressifs, ils débruitent une phrase entièrement masquée en parallèle. API compatible OpenAI, batching continu, 2.5x de débit vs HuggingFace à batch=4, fonctionne en 12 GB VRAM. MIT, pip install dlmserve.
MCP Basic Servers : bundle open-source de scripts Bash pour installer localement 6 serveurs MCP (web, fichiers, mémoire, contacts, wiki, météo) sur Linux. Endpoints HTTP sur ports 8001-8006, conçu pour utilisateurs débutants/intermédiaires en home-lab, testé sur Arch et Ubuntu.
Harbor v0.4.19 permet de lancer des outils de codage agentiques locaux (Codex, Claude, Pi, OpenCode) avec des backends d'inférence locaux (vLLM, SGLang, llama.cpp). La nouvelle version inclut une passerelle LLM optimisée qui injecte automatiquement des outils comme la recherche web via des flags CLI simples.
La Chine impose désormais une autorisation officielle aux chercheurs IA de haut niveau chez Alibaba et DeepSeek avant de quitter le pays. Pékin craint les fuites de données, le vol technologique et le détournement de talents.
Utilisateur impressionné par Qwen 3.6 27B pour générer un jeu Breakout complet en HTML5. Le modèle a produit du code fonctionnel au premier essai avec API console, contrôles gamepad, graphiques et son intégrés. Nécessité d'une seule correction mineure pour finaliser.
Le COO de Google Cloud Francis de Souza plaide pour intégrer la sécurité IA dans la stratégie d'entreprise dès le départ, au niveau de la direction générale et pas seulement des équipes techniques.
Tencent Hy-MT2 passe sous licence Apache 2.0, rendant le modèle accessible en open-source.
L'Espagne a bloqué l'accès aux marchés de prédiction Polymarket et Kalshi, les accusant d'opérer sans licence de jeu. Les autorités espagnoles considèrent ces plateformes comme des services de paris non réglementés.
GitRAG permet de poser des questions sur n'importe quel repo GitHub public et obtient des réponses ancrées dans le code source avec chemins de fichiers et numéros de lignes. Le système combine parsing AST, embeddings denses, index BM25, fusion RRF et reranking Cohere avant génération via llama-3.3-70b sur Groq. Supporte 15+ langages.
Keye-VL-2.0-30B-A3B, modèle multimodal 30B de Kwai, intègre l'attention DSA pour la première fois. Conçu pour la compréhension vidéo longue et les capacités Agent.
Together AI publie OSCAR, une nouvelle méthode de quantification KV open source. Cette approche arrive après TurboQuant et pourrait améliorer l'efficacité des modèles de langage.
Un audit de 2,5 millions d'articles biomédicaux révèle une augmentation de 1200% des références fictives depuis 2023. Les chercheurs suspectent les modèles de langage : les fausses citations correspondent au sujet, respectent le format et sont indétectables. 98% des articles affectés n'ont reçu aucune réponse des éditeurs.
Étude benchmark sur 23 modèles montrant que la compaction de contexte, technique standard pour les sessions d'agent longues, ne corrige pas la dérive de persona. ContextEcho évalue cette limitation critique des systèmes actuels.
Huawei présente LogicFolding, une technologie de densité 3D visant 1,4 nm en 2031 sans dépendre des machines EUV. He Tingbo, présidente du département semiconducteurs, l'a annoncée le 25 mai 2026 à la conférence IEEE ISCAS de Shanghai.
Article critiquant l'alarmisme autour de la destruction d'emplois par l'IA. Remet en question les prédictions catastrophistes sans données chiffrées précises ni timeline claire.
Paul Graham, fondateur de Y Combinator et investisseur précoce d'OpenAI, ignore les emails rédigés par IA, les trouvant trompeurs. Des études confirment que cette réaction est commune parmi les destinataires.
OpenStock est une alternative open-source aux plateformes de marché payantes. Suivi des prix en temps réel, alertes personnalisées et analyses d'entreprises détaillées.
claude-mem ajoute une mémoire persistante aux agents IA en capturant les actions de session, les compressant par IA, et réinjectant le contexte pertinent dans les futures sessions. Compatible Claude Code, OpenClaw, Codex, Gemini, Hermes, Copilot et autres.
Twenty est une alternative open-source à Salesforce conçue pour l'IA. Le projet gagne en popularité sur GitHub Trending sans détails techniques spécifiques fournis.
CodeWhale est un terminal de codage agentique utilisant DeepSeek en priorité, avec support multi-fournisseurs, optimisation du cache, interface en 5 langues et endpoints régionaux CN.
Mozilla publie cargo-vet, un outil de sécurité de la chaîne d'approvisionnement pour Rust. Il permet d'auditer et de valider les dépendances Rust avant leur utilisation en production.
Skybridge est un framework TypeScript full-stack pour applications MCP et ChatGPT. Type-safe, basé sur React, agnostique de plateforme.
TaxHacker est une application comptable auto-hébergée utilisant des LLM pour analyser reçus, factures et transactions avec prompts personnalisés et catégories configurables.
OpenStock est une alternative open-source aux plateformes de marché payantes. Suivi des prix en temps réel, alertes personnalisées et analyses d'entreprises détaillées, gratuit et ouvert.
claude-mem ajoute une mémoire persistante aux agents IA en capturant les actions de session, les compressant par IA, et réinjectant le contexte pertinent dans les futures sessions. Compatible Claude Code, OpenClaw, Codex, Gemini, Hermes, Copilot et autres.
MarkText est un éditeur markdown simple et élégant disponible sur Linux, macOS et Windows. Projet open-source de gestion de contenu textuel.
Nango est une plateforme pour construire des intégrations produit avec l'IA. Le projet GitHub trending propose des outils et infrastructure pour automatiser les connexions entre applications.
FunASR est un toolkit de reconnaissance vocale industriel supportant 170x temps réel, 50+ langues, diarisation de locuteur, détection d'émotion, streaming et API compatible OpenAI.
Un harness d'agent minimaliste inspiré de Claude Code, construit en Bash. Démontre l'exécution d'agents sans dépendances lourdes.
Dograh est une plateforme vocale IA open-source auto-hébergée, alternative à Vapi et Retell. Supporte Speech-to-Speech, LLM/STT/TTS, workflow visuel, MCP natif et téléphonie.
95 % des dirigeants visent une transformation en plateforme IA/données dans 1 000 jours. Les agentic databases émergent comme infrastructure clé pour cette transition, intégrant autonomie décisionnelle et gestion de données en temps réel.
Une étude MIT/USC révèle que les plaintes sans avocat aux tribunaux fédéraux US ont doublé depuis ChatGPT. Une plainte sur cinq contient du texte généré par IA. Les juges adoptent des mesures drastiques face à l'afflux de dossiers.
Étude de fine-tuning GRPO sur modèles ultra-légers (Qwen2.5-0.5B, LFM-2.5-350M) pour résumer des posts Reddit en exactement 64 tokens. Comparaison de deux stratégies : entraînement séquentiel (longueur puis qualité) vs joint. Le curriculum staged gagne avec scores G-Eval de 2.904 (LFM) et 2.817 (Qwen), contre 2.376/2.332 en zero-shot.
Google, Google.org et l'UNICEF lancent un partenariat de trois ans pour intégrer l'IA dans les systèmes éducatifs de quatre pays.
La Chine étend les restrictions de voyage aux cadres IA des entreprises privées, rendant plus difficile le recrutement de talents comme Junyang Lin (ancien responsable Qwen). Les restrictions affectent aussi les déplacements personnels à l'étranger.
Un chercheur en sécurité a contourné l'authentification AWS API Gateway en exploitant une vulnérabilité de slash final, obtenant une prime de 12 000 $ du programme de bug bounty AWS.
Le président d'Uber déclare que les dépenses en IA deviennent « plus difficiles à justifier ». L'entreprise réévalue son allocation budgétaire face aux coûts croissants et aux retours sur investissement incertains.
Discussion sur la sécurité des LLM locaux connectés à des outils. L'auteur soulève que si l'exécution locale protège les données, l'injection de prompts devient critique une fois le modèle relié à des fichiers, commandes shell, APIs ou RAG. Peu de setups locaux testent la robustesse face aux instructions malveillantes avant de donner accès aux outils.
SkillOpt formalise l'optimisation de fichiers markdown comme paramètres entraînables via éditions bornées (ajout/suppression/remplacement) proposées par un modèle frontier et validées sur un ensemble de test. Les meilleures compétences convergent avec 1-4 éditions acceptées sur ~920 tokens. Une compétence optimisée sur Codex transfère à Claude Code (+59.7 SpreadsheetBench) sans modification.
Dust lève 40 M$ auprès de Sequoia et Abstract pour développer des assistants IA collaboratifs en entreprise. La startup vise à évoluer l'IA d'entreprise au-delà des cas d'usage actuels.
La BCE convoque les banques supervisées de la zone euro pour discuter des risques de cybersécurité liés à Mythos. Le règlement DORA ne garantit pas un accès souverain à cet outil pour les institutions financières.
Expérience de fine-tuning local du Qwen 3.6 27B sur RTX 5090 en convertissant l'architecture autoregressive vers diffusion. Utilise QLoRA et nvfp4 pour réduire les besoins VRAM (600GB → entraînable sur 5090). S'inspire d'open-dllm (4x speedup sur Qwen 2.5) et intègre d3LLM pour optimiser les étapes de diffusion. Pas encore de modèle entraîné, mais forward pass validé.
EQT devient gestionnaire du Scaleup Europe Fund, un fonds de 5 milliards d'euros pour la souveraineté technologique européenne. Aucun investisseur institutionnel français n'est fondateur du véhicule.
Qwen3.5 27B uncensored en version MTP Preserved (15 MTPs conservés) disponible en Safetensors, GGUF, NVFP4 et GPTQ-Int4. Modèle optimisé pour assistance IA généraliste, contrairement à Qwen3.6 orienté agents et coding. Même architecture qwen35 mais comportements différents.
Polsia, startup IA sans employés, lève 30 M$ avec un chiffre d'affaires annuel proche de 10 M$. Le modèle économique basé sur l'automatisation IA attire les investisseurs.
Analyse coûts réels : self-hosting sur dual 3090 (~$0.50-0.80/token avec amortissement) vs RunPod H100 (~$1.49-1.99/h, 2-3x plus rapide). Pour usage léger (2-3h/jour), le cloud est moins cher. Les vrais motifs du self-hosting : confidentialité, autonomie, apprentissage, pas de cold-start, souveraineté—non économiques.
Un PR rejeté pour llama.cpp optimise le traitement par paquet (PP) des modèles MOE de 30% sur Qwen 3.5 MoE 35B. L'amélioration diminue avec l'augmentation du contexte. Le code peut être appliqué manuellement à la version courante.
Une étude montre que la politesse dans les prompts influence la précision des LLM. Les modèles répondent mieux aux demandes formulées poliment, suggérant que le ton du prompt affecte les performances.
Un utilisateur a optimisé l'ASR (reconnaissance vocale) sur NPU Intel Arrow Lake via OpenVINO. Résultats : 4,8× plus rapide et 10,7× moins d'énergie que CPU INT8 sur audio 10s. Le NPU (13 TOPS) libère CPU et VRAM pour d'autres tâches ML, surpassant en latence un RTX 3060 eGPU.
Utilisateur partage sa configuration stable pour exécuter Qwen 3.6 35B sur MacBook M2 Max 64GB. Recommande : GGUF + llama.cpp/LM Studio (pas Ollama), désactiver ProMotion, augmenter iogpu.wired_limit_m. Atteint 49 tokens/sec génération, 400+ tokens/sec traitement prompt, contexte 131k stable.
Qwen3.5 35B uncensored v2 avec 785 MTPs préservés disponible en Safetensors, GGUF, NVFP4 et GPTQ-Int4. Modèle optimisé pour assistance IA généraliste contrairement à Qwen3.6 orienté agents et coding, malgré une architecture qwen35 commune.
CXMT, fabricant chinois de mémoire, produit désormais des barrettes RAM pour Corsair. Cette entrée sur le marché grand public pourrait réduire les prix des composants mémoire.
Talkie-1930-13b-it, modèle 13B entraîné sur 260B tokens de texte anglais pré-1931, est ajouté à llama.cpp. Instruction-tuné via DPO avec LLM-as-judge sur des manuels d'étiquette et encyclopédies historiques. Simule conversations avec des personnages du passé.
Jinnove lance Mail Recommandé Électronique (MRE), une solution transformant les courriels en envois certifiés conformes à eIDAS.
Shard est un cache HuggingFace qui compresse la mémoire KV de Llama-3.1-8B par 10× à contexte 8K (11× à 32K) sans dégradation mesurable sur NIAH/LongBench. Combine PCA + quantization int4 sur K et rotation Hadamard + vector quantization sur V. L'attention s'exécute directement sur K compressé.
InteractBind, un dataset de ~100k paires protéine-ligand avec benchmark, évalue si les modèles localisent les sites de liaison ou prédisent simplement la probabilité de liaison. Huit modèles testés montrent une prédiction binaire forte mais une localisation faible des sites, révélant des lacunes dans l'interprétabilité physique.
Cadre phonétique conscient des dialectes pour la reconnaissance vocale vietnamienne. Décompose les syllabes en composants phonétiques structurés mappés à des représentations IPA spécifiques aux dialectes. Sur UIT-ViMD, égale les performances de wav2vec2-base-vi-250h avec moins de paramètres et sans préentraînement externe.
Étude sur les biais de rationalisation chez les juges LLM. Les chercheurs testent si les explications des modèles restent stables quand des indices non-pertinents sont modifiés (verbosité, confiance). Ils proposent PROOF-BEFORE-PREFERENCE pour améliorer l'invariance aux indices et réduire l'ancrage des explications.
Cadre automatisé pour détecter les lacunes lexicales (mots inexistants dans certaines langues) via embeddings de LLMs multilingues. Sur paires de traduction coréen-anglais, 4000 espaces d'embedding testés montrent que les mots lacunaires ont un alignement sémantique cross-lingue plus faible. Classifieurs logistiques atteignent AUC 0.81-0.76 et récupèrent 18/19 et 26/27 mots lacunaires.
Théorie de bifurcation pour détecter en temps réel l'émergence de représentations structurées dans les réseaux de neurones. Un ratio dynamique β(t)/βc(t) basé sur la Hessienne de la perte prédit quatre régimes de transition distincts (SAE sur Pythia, SSL CIFAR, grokking arithmétique). À 5% de l'entraînement, la pureté précoce des atomes prédit la convergence finale avec 12x le baseline.
Nouvelle métrique UDS (Unlearning Depth Score) pour évaluer si les connaissances sont vraiment effacées dans les LLM. Via activation patching, UDS mesure la profondeur mécanique de l'oubli couche par couche. Évaluation sur 150 modèles et 8 méthodes : UDS surpasse 20 métriques existantes en fidélité et robustesse.
Étude de la dérive temporelle en NLP juridique sur 428K décisions de cours ukrainiennes (2008-2026). Quatre modèles transformers (XLM-RoBERTa, variantes légales) montrent une dégradation sévère en transfert forward (−27,2 pp macro-F1) mais robustesse en backward transfer. L'apprentissage continu chronologique élimine l'oubli catastrophique.
Un framework basé sur LLM extrait les divulgations de segments des formulaires 10-K pour améliorer la complétude et la comparabilité des données financières. Le système utilise RAG pour intégrer les informations entre plusieurs périodes et entreprises, démontrant son efficacité pour l'analyse longitudinale et l'alignement géographique cross-firm.
TUBE est une borne supérieure variationnelle sur la log-vraisemblance pour les modèles de diffusion discrets. Contrairement aux ELBO existantes, TUBE admet un estimateur Monte Carlo sans biais et s'applique aux modèles de diffusion masqués, ARMs d'ordre quelconque et leurs variantes par blocs. Les expériences montrent que les modèles de diffusion restent strictement en dessous des ARMs en vraisemblance exacte.
Papier arXiv proposant un mécanisme d'agrégation en ligne pour aligner les LLM avec le feedback humain en crowdsourcing mobile. Le système incite les travailleurs à rapporter honnêtement leurs préférences via un jeu bayésien dynamique, réduisant le regret de O(T) à O(√T) sur T slots temporels.
Une étude identifie 106 circuits neuronaux dédiés dans un transformateur sparse 8-couches entraîné sur du code Python. Les circuits se structurent selon des principes computationnels (atomicité, ambiguïté lexicale) plutôt que sémantiques. 62,5% des neurones les plus actifs aux couches intermédiaires sont concept-spécifiques pour les construits AST.
Étude théorique des lois d'échelle pour la régression linéaire esquissée avec mini-batches. Analyse comparée de SGD one-pass, SGD multi-pass avec et sans remplacement. Résultat clé : variance en O(min(M,(T_eff*γ)^(1/a))/(B*T_eff)), réduction 1/B en régime multi-pass sans remplacement, fluctuation nulle à B=N.
HyperGuide utilise la géométrie hyperbolique pour guider le raisonnement multi-étapes dans les LLM. Une tête légère projette les états cachés dans l'espace hyperbolique, où la distance à l'origine encode la proximité de la solution. Un adaptateur bas-rang est affiné interactivement. Gains constants sur plusieurs benchmarks, plus importants pour les chaînes de raisonnement profondes.
Beignet, une nouvelle architecture de réseau de neurones pour résoudre les équations aux dérivées partielles (EDP), remplace les embeddings Fourier aléatoires des PINNs par une pyramide Fourier multi-résolution entraînable. Le modèle calcule efficacement les dérivées spatiales via FFT et atteint une précision supérieure avec moins de paramètres que les méthodes PINN existantes.
Framework Verifiable Transformers convertissant circuits Transformer en propriétés vérifiables par solveur SMT. Extraction de circuits task-localisés et vérification formelle d'équivalence fonctionnelle, nécessité des arêtes, invariance et robustesse. Démonstration sur tâches symboliques et GPT-2 scale avec architecture SMT-représentable (Signed L1 BandNorm, sparsemax, LeakyReLU).