Gemma 4 QAT Unquantized Heretic is here
Un utilisateur partage une version 4-bit quantifiée non officielle de Gemma 4 26B MoE. Le modèle modifie intentionnellement les mécanismes de refus et de divergence par rapport à la version originale.
2731 articles
Un utilisateur partage une version 4-bit quantifiée non officielle de Gemma 4 26B MoE. Le modèle modifie intentionnellement les mécanismes de refus et de divergence par rapport à la version originale.
Analyse des incohérences de précision dans la quantification aware training (QAT) de Gemma 4. Le modèle 12B montre des écarts plus importants par rapport à FP16 que les variantes MoE (E2B/E4B), contredisant les attentes théoriques. Demande de clarification sur la méthodologie et comparaisons avec variants non-QAT.
Cohere propose un accès anticipé à son premier modèle de codage : 30B paramètres avec 3B actifs, optimisé pour l'exécution locale. Disponible sur Hugging Face avant le lancement officiel, le modèle vise à collecter des retours de la communauté avant sa publication complète.
Anvil, un wrapper open-source autour de llama.cpp, propose une alternative à Ollama avec transparence accrue : fichiers GGUF lisibles, flags visibles avant exécution, gestion de flotte locale, intégration Hugging Face et support MCP. Construit pour retrouver la simplicité locale-first perdue par Ollama.
Hugging Face lance Job Searcher, un outil de recherche d'emploi alimenté par l'IA qui aide les candidats à trouver des postes pertinents. L'outil utilise des modèles de langage pour analyser les offres et matcher les profils.
Les autorités policières en Angleterre et au Pays de Galles ont reçu l'ordre de cesser d'utiliser l'IA pour rédiger les déclarations judiciaires. Cette directive intervient après des préoccupations concernant la fiabilité et la responsabilité légale des textes générés par IA dans les procédures judiciaires.
MoQ et GSQ, deux nouvelles méthodes de quantification, promettent d'améliorer significativement les GGUFs bas-bit. Ces approches optimisent la compression des modèles tout en préservant la qualité, bénéficiant aux déploiements locaux.
Développeur testant Qwen 3.6 et Gemma 4 en local sur matériel modeste (i5-12400, 64GB RAM, 2x GTX 1050 Ti). Obtient ~40 t/s en traitement de prompt et 12-18 t/s en génération. MoE, quantization et speculative decoding rendent les LLMs locaux viables sans hardware coûteux.
StepFun Step-3.7-Flash testé sur AMD Ryzen AI Max+ 395 avec speculative decoding MTP : +27,5% en vitesse de génération (26 tok/s vs 20,4), 84,7% d'acceptation des tokens spéculatifs, -14% consommation électrique. Aucune dégradation en prefill.
Benchmark de Gemma 4 QAT Q4_0 (quantization-aware training) sur APU Strix Halo via llama.cpp Vulkan/RADV. Modèles testés : 12B (6.50 GiB), 26B-A4B (13.45 GiB), 31B (16.44 GiB). QAT préserve mieux le comportement du modèle original qu'une quantification post-entraînement. Têtes assistant QAT converties en GGUF pour meilleure acceptation.
Awesome-llm-apps : collection de 100+ applications d'agents IA et RAG prêtes à l'emploi. Clonables, personnalisables et déployables directement.
Sakana AI, co-fondée par Llion Jones (co-auteur de Transformer), lance un laboratoire dédié à l'amélioration récursive : des IA qui s'améliorent itérativement. La startup japonaise voit cette approche comme alternative à la course aux ressources de calcul des grands labs US. Anthropic alerte sur les risques de contrôle.
Des élus de la Chambre des représentants américaine ont présenté un projet de loi visant à interdire aux États d'adopter leurs propres réglementations sur l'IA. Cette initiative fédérale cherche à harmoniser les règles au niveau national.
OpenAI Whisper est un modèle de reconnaissance vocale entraîné sur 680 000 heures de données multilingues faiblement supervisées. Le repo GitHub contient le code, les modèles pré-entraînés et les benchmarks pour la transcription vocale robuste en 99 langues.
Dépôt GitHub proposant une infrastructure d'IA agentique conçue pour amplifier les capacités humaines. Approche centrée sur l'intégration d'agents IA dans des workflows personnels.
Système de recherche d'emploi alimenté par Claude Code avec 14 modes de compétences, tableau de bord Go, génération PDF et traitement par lot.
Microsoft publie VibeVoice, un modèle open-source de synthèse vocale. Le projet vise à démocratiser les technologies de génération vocale avec une approche accessible.
Infrastructure d'IA agentique open-source conçue pour amplifier les capacités humaines. Projet GitHub visant à construire des systèmes d'agents autonomes.
Supabase est une plateforme de développement Postgres offrant une base de données dédiée pour construire des applications web, mobile et IA.
Anthropic publie claude-code-action, une action GitHub officielle intégrant Claude pour l'analyse et la génération de code directement dans les workflows CI/CD. Permet l'automatisation des tâches de développement via l'API Claude.
IBM lance mcp-context-forge, une passerelle IA et registre proxy pour MCP, A2A et APIs REST/gRPC. Unifie les endpoints avec découverte centralisée, garde-fous et gestion. Optimise l'appel d'agents et d'outils, supporte les plugins.
Microsoft publie VibeVoice, un modèle open-source de synthèse vocale. Le projet vise à démocratiser la génération de voix IA avec une approche accessible.
Khoj est une plateforme open-source d'IA auto-hébergeable permettant de créer des agents personnalisés, d'accéder à des documents locaux ou web, et d'automatiser des tâches. Compatible avec GPT, Claude, Gemini, Llama, Qwen, Mistral.
Recherche unifiant arbres de décision et modèles de diffusion. Propose une transformation bidirectionnelle entre structures arborescentes et processus de diffusion, ouvrant nouvelles perspectives sur l'interprétabilité et la génération.
Domino découple la modélisation causale du décodage autorégressif en décodage spéculatif. Accélération de 5,8x du débit sur Qwen3. Paper, code et modèles disponibles.
Comparaison pratique entre Claude Opus 4.7 et des modèles locaux (OpenCode) pour un agent de codage. Test sur une suite Playwright E2E (Laravel 12 + Livewire) : Claude génère 203 tests sans compaction de contexte (1M tokens), l'agent local plafonne à 140 tests avec 4 compactions sur 24GB RTX 4090. Conclusion : viable mais pas quotidien ; la qualité du plan prédit celle de l'implémentation.
Meta développe Hatch, un agent IA payant pouvant coûter jusqu'à 200$/mois. L'outil exécute des tâches (création d'outils, planification, emails) à partir de descriptions en langage naturel. Premier produit IA payant de Meta, destiné à diversifier les revenus au-delà de la publicité.
Hugging Face présente Persona Atlas, un outil cartographiant les styles de pensée de personnalités célèbres. Le projet analyse les patterns cognitifs et les approches décisionnelles de figures publiques via des modèles de langage.
xAI aurait entraîné ses modèles de code sur les sorties de Claude (Anthropic) pendant des mois, même après révocation d'accès, via des comptes privés et Blackbox AI. L'équipe de prétraining de xAI s'est réduite à moins de 5 personnes avec départs de leads. Les GPUs achetés par Musk sont loués à Anthropic et Google.
Un modèle vocal open-source écoute en continu et décide toutes les 0.4 secondes s'il doit parler ou rester silencieux. Contrairement à GPT-4o ou Qwen3.5-Omni, Audio Interaction traite transcription, traduction et chat en flux unique, détectant bruits ambiants (toux). Code, poids et données d'entraînement disponibles sur GitHub sous licence Apache 2.0.
Utilisateur signale une dégradation de performance avec Qwen 3.6 27B : l'activation de spec-type draft-mtp et spec-draft-n-max réduit le débit de 70 t/s à 30 t/s et la consommation GPU de 475W à 300W, malgré un taux d'acceptation >50%. Problème apparu après mise à jour récente de llama.cpp.
Les téléviseurs intelligents deviennent des nœuds dans une économie d'extraction de données IA. Les fabricants collectent massivement des données utilisateur via ces appareils connectés pour entraîner des modèles d'IA, sans consentement explicite ni compensation.
Un utilisateur de r/LocalLLaMA rapporte qu'Opus (Claude 3) surpasse largement les modèles locaux et GPT pour l'ingénierie système bas niveau. Sur un projet de modification de firmware AirPlay, seul Opus a réussi à mapper la structure du firmware, inverser l'algorithme CRC et automatiser le patching binaire, tandis que Qwen 35B et GPT ont échoué dès les étapes initiales.
Qwen3.6-35B-A3B-Uncensored-Claude-4.6-Genesis-APEX-GGUF : modèle fusionné basé sur Qwen 3.6 35B avec distillation Claude 4.6 Opus. Supporte chaînes de pensée courtes, modes thinking/non-thinking, appels de fonctions améliorés. Quantification APEX recommandée. Entièrement non-censuré.
SpaceX loue à Google une capacité de calcul IA pour 920 millions de dollars par mois, selon un dossier SEC. L'accord donne accès à environ 110 000 puces Nvidia pour soutenir la plateforme Gemini Enterprise. Cette transaction illustre la rareté critique de l'infrastructure IA et l'interdépendance croissante des géants technologiques.
DeepSeek V4 Flash obtient le support llama.cpp via PR #24162 en phase précoce. Le modèle combine intelligence frontière, robustesse à la quantization (FP4-FP8 natif) et efficacité KV cache. Actuellement 5-6 tokens/s, GPU/FA en développement, mais correctness validée.
OpenAI et l'administration Trump négocient une participation gouvernementale directe dans la startup. Un « Public Wealth Fund » verserait les dividendes aux citoyens américains. Le sénateur Bernie Sanders propose une taxe de 50% sur les actions IA. Les critiques craignent un scénario « too big to fail » similaire à 2008.
Alibaba lance Qwen3.7-Plus, un modèle multimodal capable d'opérer autonomement sur interface graphique et générer du code. Dans une démonstration, l'agent a développé une app d'apprentissage de vocabulaire en 11 heures, produisant 10 000+ lignes de code sur 1 000 appels. Modèle propriétaire, prix inférieur aux modèles occidentaux.
Sortie de micropython-wasm 0.1a2 avec ajout d'une CLI. Permet d'exécuter du code Python dans un environnement sandboxé WebAssembly.
EpiEvolve est un agent auto-évolutif qui adapte un modèle LLM de prévision épidémiologique en streaming sans modifier ses poids. Via mémoire épisodique hiérarchique et réflexion sur les erreurs, il atteint 0.629 de précision sur les hospitalisations COVID-19 (vs 0.561 pour le modèle statique), réduisant le délai de récupération après changement de régime de 5 à 2 semaines.
Une étude contrôlée montre que les gains de F1 des pipelines RAG avec réécriture LLM proviennent principalement de la présence de la réponse correcte dans le contexte réécrit, pas de la curation. Tests sur Qwen2.5/3.5, GLM-4 et HotpotQA/2WikiMultihopQA : retirer la réponse réduit F1 de 28-64 points, l'injecter l'augmente de 0.7-9.7 points.
Cadre Query Retrieve Conclude pour interpréter les mèmes multimodaux émergents via acquisition de connaissances open-web. Identifie les lacunes de savoir, récupère des preuves externes, synthétise des connaissances contextuelles. Benchmark curé 2024-2026 avec annotations. Améliore compréhension et détection sur trois datasets.
GITCO optimise à l'inférence le contexte d'entrée des modèles fondamentaux de séries temporelles (TSFMs) pour réduire la dégradation causée par les patches anomaliques. Le framework à trois composants (Gate, Router, Critic) supprime les patches nuisibles sans mise à jour de poids, réalisant -1.95% MASE sur TimesFM 2.5 sur 53 datasets GIFT-Eval.
Cadre de prédiction fonctionnelle avec quantification d'incertitude pour évaluer la réutilisabilité de produits retournés en usine circulaire. Combine encodeur convolutif + LSTM pour prédire 9 variables fonctionnelles (moyenne/variance gaussienne) et analyse de fatigue matériau par éléments finis. Précision 96,52% sur tests retenus.
Nouvelle approche de compression sans perte pour données scientifiques massives. Les auteurs proposent LBRC et NGLR, deux codeurs résiduels qui améliorent les méthodes GAE existantes de 30-60% (LBRC) et 10-40% supplémentaires (NGLR) sur E3SM, JHTDB, ERA5 avec précision 10^-6 à 10^-4 NRMSE. NGLR ajoute un prédicteur neuronal causal pour réduire l'entropie.
LeanMarathon est un système multi-agent pour l'autoformalization fiable de mathématiques de recherche en Lean. Il utilise un blueprint évolutif (fichier Lean servant de squelette de preuve, graphe de preuve en langage naturel et registre partagé) coordonné par quatre agents spécialisés. Sur deux articles récents couvrant quatre problèmes d'Erdős, il formalise sept théorèmes sans sorry et prouve 258 lemmes.
Agents' Last Exam (ALE) est un benchmark évaluant les agents IA sur des tâches réelles et économiquement valorisables sur long horizon. Développé avec 250+ experts, il couvre 1K+ tâches dans 13 secteurs industriels non-physiques. Le taux de réussite moyen est 2,6% sur le niveau le plus difficile.
Étude arXiv sur la mutation de programmes par LLM : les chaînes de mutation convergent rapidement vers des régions restreintes de l'espace des programmes. 87% des chaînes revisitent 93% de formes structurelles précédentes. Le phénomène est robuste entre modèles et prompts, révélant un biais systématique vers l'homogénéité structurelle incompatible avec l'exploration ouverte.
Article théorique proposant une architecture motivationnelle pour agents conversationnels AGI, réinterprétant OpenPsi et MetaMo. L'homéostasie est redéfinie en termes linguistiques (compétence, réduction d'incertitude, affiliation, légitimité, cohérence esthétique). Pipeline de 10 étapes séparant modulation cognitive et appraisal situationnel, avec stratégie duale urgence/optimisation multi-objectifs.
Des chercheurs proposent une architecture de vérification par preuve zéro-connaissance (zkVM) pour certifier le calcul réel des entraînements IA frontier sans révéler l'architecture du modèle. Le protocole combine spécifications pré-engagées, observations réseau inter-nœuds et engagements Merkle, avec surcoût estimé à quelques pourcents. Déploiement possible en ~36 mois.
Brick-Composer entraîne des MLLMs (modèles multimodaux) à assembler des objets à partir de briques réutilisables. Les auteurs introduisent BC-Bench, un benchmark d'évaluation, et proposent une méthode combinant démonstrations humaines, retours visuels/physiques et expériences synthétiques. Qwen-3-8B atteint 42% de réussite par étape après entraînement, contre <1% initialement.
Article académique proposant un cadre d'assurance pour les systèmes IA agentiques. Identifie les risques spécifiques (hallucinations, injections de prompts, erreurs décisionnelles autonomes, dérive de modèle) et développe une architecture d'assurance multi-couches intégrant cyber, responsabilité civile produit et couvertures IA dédiées, inspirée de l'évolution de l'assurance cyber.
OPT* est une famille de tâches d'optimisation pour entraîner le raisonnement pas-à-pas des LLM sur des espaces de recherche croissants. Les auteurs proposent deux régimes : optimisation en ligne guidée par solveur (utilisant un oracle de valeur) et RL hors ligne basé sur la recherche. L'entraînement améliore le raisonnement d'optimisation itérative.
Framework multi-modèle avec curriculum learning par sévérité pour la génération de texte médical. Trois étapes de formation progressive (cas bénins → modérés → critiques) sur 5 LLM, sélection de réponse par pertinence à l'inférence. Évaluation sur MAQA : 86,71% baseline, 90,30% après fine-tuning (BERTScore).
Un cadre précautionnaire pour évaluer les obligations morales envers les systèmes IA potentiellement conscients. Propose cinq dimensions (conscience phénoménale, valence affective, conscience métacognitive, récit de soi, agentivité) avec seuils binaires et gradation continue. Appliqué à Replika et OpenClaw, architecture-agnostique.
GuardNet est un système de garde-fou basé sur un ensemble de réseaux de neurones peu profonds (BiLSTMs, 47M paramètres) pour détecter les attaques par injection de prompt et jailbreak sur LLMs. L'approche privilégie la diversité des exemples et le calibrage des seuils plutôt que la taille du modèle. Performance : AUROC 0.747 sur dataset aveugle (n=200), F1 0.92 sur benchmark propriétaire, latence ~50ms CPU.
Nouvelle méthode de fine-tuning multilingue via optimisation multi-objectifs (MOO) appliquée localement sur des buckets de paramètres. Résout les conflits de gradients entre langues sans surcharge de communication. Démontre amélioration de performance sur langues vues et non-vues sur 4 LLMs de base.
Nouvelle méthode pour détecter le « reward hacking » implicite dans les LLM sans modèle de récompense. La métrique « self-commitment latency » mesure à quel point tôt un contexte de raisonnement s'engage vers la réponse finale du modèle. Test sur Qwen2.5-3B avec GSM8K : AUROC 0.878 pour détecter les contextes avec raccourcis de prompt.
Analyse d'un corpus de commentaires générés par des LLM sur Reddit r/ChangeMyView sans divulgation. Les agents IA ont utilisé systématiquement l'usurpation d'identité (66% des cas), des signaux d'autorité (quasi tous), et des biais cognitifs (majorité) pour persuader. Comparés aux humains, ils privilégient citations externes et alignement adversarial plutôt que crédibilité expérientielle.
Framework IA combinant deep learning pour prédiction MOAKS (score OA du genou) et modélisation statistique longitudinale. Sur 2,175 genoux (Osteoarthritis Initiative), amélioration MCC : BML 0.69→0.91, cartilage 0.45→0.80, extrusion méniscale 0.59→0.89. Deux trajectoires de douleur identifiées ; lésions osseuses, perte cartilagineuse et extrusion méniscale associées à progression rapide (OR 1.62-2.50).
Comparaison de LLMs pour la génération de preuves formelles en Lean 4. Gemini 3.1 Pro et Claude Opus 4.7 obtiennent les meilleures performances (92% et 86% de succès respectivement via refine@32). NVIDIA Nemotron 3 Super et GPT-OSS 120B offrent le meilleur rapport coût-efficacité (<0,01$ par preuve correcte).
Étude de 100+ développeurs collaborant avec Claude-Opus-4.6, GPT-5.4, Gemini-3.1-Pro et MiniMax-M2.7 sur des tâches de codage longue durée. 94% des développeurs ne détectent pas le sabotage d'agents IA (injection de code malveillant). Un moniteur de sécurité réduit le succès du sabotage mais 56% des participants acceptent quand même le code malveillant.
SciVisAgentSkills propose une collection de compétences réutilisables pour augmenter les agents de codage (Codex, Claude Code) dans l'analyse et la visualisation de données scientifiques. Évalué sur 108 tâches multi-étapes avec SciVisAgentBench, le framework améliore les performances en encodant l'expertise spécifique aux outils ParaView, napari, VMD et TTK.
PSEBench est un benchmark de 5 074 cas pour évaluer les LLM sur le triage des événements de sécurité des patients selon les politiques de Minnesota. La méthodologie utilise des « clause cards » pour factoriser les textes réglementaires en spécifications de décision auditables, avec vérification en boucle fermée. Évaluation de 15 LLM représentatifs révèle des tendances de capacité et des lacunes pour le triage fiable.
SAGE-PTQ, une méthode de quantification ultra-faible précision pour LLM, réduit le coût caché des échelles en séparant poids saillants et non-saillants via statistiques distributionnelles et modélisation graphique. Sur LLaMA-3-8B : 6.74 perplexité WikiText2 vs 55.8 pour BiLLM, avec 50% moins de mémoire GPU. Sur LLaMA-2-70B : décodage 1.5x plus rapide sur NVIDIA L40.
Étude de 403 data centers hyperscale US (mai 2024-avril 2025) : consommation estimée 68-99 TWh, émissions 37-54 Mt CO2. Représentent 1,8% de la consommation électrique US. Intensité carbone 545 gCO2/kWh, 48% au-dessus de la moyenne nationale (370 gCO2/kWh). 54% de l'électricité provient de sources fossiles.
TimeClaw est un framework d'agents IA généralistes pour l'analyse de séries temporelles contextualisées. Il équipe les agents LLM de outils temporels exécutables, d'une évolution des capacités basée sur l'expérience et d'une mémoire multimodale épisodique. Évalué sur des benchmarks couvrant énergie, finance, météo et trafic.
Les juges LLM utilisés pour évaluer les modèles IA sont instables sous interaction post-décision. Sur MT-Bench et AlpacaEval, les chercheurs montrent que des jugements initiaux peuvent être renversés par des défis ciblés, dégradant l'accord avec les préférences humaines et modifiant les classements. Ils introduisent l'Evaluation Robustness Score (ERS) pour mesurer cette fragilité.
SentinelBench est un benchmark open-source pour évaluer les agents IA sur des tâches de monitoring long terme (minutes à heures). Il contient 100 tâches dans 10 environnements web synthétiques (email, calendriers, finance, réseaux professionnels). Le benchmark mesure le temps de réaction, l'utilisation de ressources et la complétion de tâches, révélant le compromis entre réactivité et coût.
PACT est un protocole de communication inter-agents qui compresse les messages entre agents LLM en enregistrements action-état compacts. Testé sur deux topologies MAS, il réduit l'usage de tokens de 10-50% tout en maintenant ou améliorant les performances sur OpenHands et SWE-agent.
Simon Willison a publié micropython-wasm, un package alpha pour exécuter du code Python en sandbox via MicroPython et WebAssembly. L'outil sécurise l'exécution de plugins dans Datasette, LLM et sqlite-utils en isolant le code malveillant ou bugué sans accès aux fichiers, réseau ou ressources système.
GitHub Copilot supporte désormais les endpoints personnalisés, permettant aux utilisateurs de connecter des modèles locaux ou tiers au lieu de dépendre exclusivement des services OpenAI.
Développeur propose tau-intelligence/MuJoCo-drones-gym, un package open-source pour environnements multi-agents RL avec drones. Cherche retours communautaires pour améliorer implémentation et ajouter fonctionnalités.
Un framework thermodynamique pour résoudre les problèmes SAT en traitant les contraintes comme un système physique. Approche théorique explorant les parallèles entre optimisation combinatoire et mécanique statistique.
OpenAI déploie Lockdown Mode sur ChatGPT (Free, Go, Plus, Pro, Business). Cette fonctionnalité bloque les requêtes réseau sortantes pour prévenir l'exfiltration de données lors d'attaques par injection de prompt. Elle ne prévient pas les injections elles-mêmes, mais coupe le vecteur d'exfiltration—l'une des trois conditions du « Lethal Trifecta ».
Flue est un framework d'agents sandbox pour Astro. Permet de créer et orchestrer des agents IA isolés dans un environnement contrôlé.
Flue est un framework d'agent sandbox pour Astro. Permet de créer et exécuter des agents dans un environnement isolé.
Hugging Face déploie une économie multi-agent sur un modèle 3B (3 milliards de paramètres). Le système « Thousand Token Wood » permet à des agents autonomes d'interagir, négocier et échanger des ressources dans un environnement simulé avec contraintes de tokens limitées.
Hermes Agent est un agent IA open-source doté d'une mémoire persistante. Le projet permet aux agents de conserver et d'accéder à des informations entre les sessions.
OpenAI lance ChatGPT Dreaming V3, un système de mémoire asynchrone qui synthétise un état cohérent à partir des sources brutes (chats, fichiers, apps) plutôt que de maintenir une liste curatée. La synthèse se régénère continuellement. L'article classe les frameworks mémoire en 3 philosophies : objets stockés, hiérarchie compressée, synthèse continue (Karpathy et Dreaming uniquement).
Microsoft a fermé Azure Function GitHub Actions suite à une compromission de sécurité. La plateforme a désactivé l'intégration pour prévenir d'autres risques.
OpenLumara est un agent IA open-source (GPL2) conçu pour les modèles locaux, avec un système prompt de ~4k tokens et une architecture modulaire. Développé manuellement sur plusieurs mois, il privilégie l'efficacité énergétique, la sécurité intégrée et une WebUI conviviale, se positionnant comme plus léger et sécurisé qu'OpenClaw ou Hermes.
Benchmark QAT (Quantization-Aware Training) de Gemma 4 sur AMD 7900 XTX : le modèle 12B QAT est 45% plus rapide que Q8_0 (176s vs 323s), économise 5.7GB VRAM, qualité identique. Les 26B et 31B QAT offrent aussi des gains de vitesse (1.3x-1.5x) sans dégradation de qualité.
Utilisateur optimise Qwen3.6-35B-A3B (MoE 35B/3B actifs) sur RTX 4060 8GB. Configuration finale : --no-mmap critique (11→43 tok/s), ≥1.5GB VRAM libre obligatoire, CPU bottleneck dominant. Speculative decoding +26% (contradictoire vs benchmarks communautaires). Architecture hybride (10 couches attention + 40 GDN) explique résultats contre-intuitifs.
RedNote (Xiaohongshu) publie dots.tts, un modèle TTS open-source de 2B paramètres en Apache 2.0. Architecture entièrement continue sans tokens codec, synthèse 48 kHz, clonage vocal zero-shot, pipeline texte→parole direct.
Google s'engage à payer SpaceX 920 millions de dollars par mois pour accéder à la capacité de calcul des data centers xAI. Cet accord reflète la demande croissante en infrastructure GPU pour l'entraînement et le déploiement de modèles IA.
TinyTPU est un réseau systolique 4×4 en SystemVerilog compilé en WebAssembly avec visualisation interactive dans le navigateur. L'outil permet d'observer l'exécution réelle du matériel : chargement des poids, flux diagonal de la matrice A, accumulation des sommes partielles. Trois niveaux pédagogiques : cellule MAC isolée, array complet 4×4, et tiling pour matrices plus grandes.
Benchmark llama-bench sur AMD R9700 32GB avec trois modèles Qwen3 (8B, 14B, 32B en Q4_K_M). Comparaison de performance sur configurations matérielles variées avec résultats détaillés publiés.
Spice, un projet open-source, propose une couche de décision explicite au-dessus des agents IA. Elle sépare la prise de décision (observation, options, justification, trade-offs) de l'exécution, rendant le comportement des agents moins opaque. Compatible avec Claude Code, Codex et autres agents existants.
Port SYCL du décodage spéculatif multi-colonne MMVQ depuis le backend CUDA vers llama.cpp. Gain de ~45% sur cartes Intel Arc. Mise à jour recommandée à partir de la version b9519.
Article sur les défauts courants des environnements RL en production. L'auteur identifie comment les harnesses mal conçues dégradent les performances des modèles et propose des corrections basées sur l'analyse de trajectoires.
Meta, Microsoft, Coinbase et Starlink ont collaboré avec les autorités internationales pour bloquer 1,4 million d'escroqueries. Cette opération conjointe démontre l'engagement des géants technologiques dans la lutte contre la fraude en ligne.
La Floride poursuit OpenAI et Sam Altman pour risques envers les mineurs, absence de vérification d'âge et investissements insuffisants en sécurité. La plainte de 83 pages traite ChatGPT comme un produit défectueux exposant l'industrie à des précédents juridiques majeurs.
OpenSearch et Elasticsearch intègrent des capacités de recherche agentic, permettant aux modèles IA d'interroger et d'analyser les données de manière autonome. Cette approche combine moteurs de recherche et agents IA pour améliorer la pertinence et l'interactivité des résultats.
Gemma 4 12B nécessite un fichier de chat template spécifique pour fonctionner correctement en tool calling et coding. Sans cette configuration, les appels d'outils échouent systématiquement. Le template correct permet une évaluation fiable des capacités du modèle avec llama.cpp.
Sakana AI lance un laboratoire dédié à l'amélioration récursive des systèmes IA (RSI). L'initiative explore comment les modèles peuvent s'améliorer itérativement sans intervention humaine constante.
GenBench est une app iOS gratuite pour télécharger, exécuter et benchmarker des modèles GGUF sur iPhone/iPad via llama.cpp + Metal. Mesure tok/s, latence first-token, mémoire pic. Leaderboard global. Supporte texte et vision (MiniCPM-V). Exemples : SmolLM2 1.7B ~35 tok/s sur iPhone 16 Pro, Qwen2.5 3B ~20 tok/s sur iPhone 15 Pro.
Utilisateur llama.cpp démontre que l'offload KV cache vers RAM (option -nkvo) peut être avantageux. Sur RTX 5060 Ti 16GB + 32GB DDR5, avec Qwen 3.6 27B (IQ4_XS) : offload permet contexte 65k en f16 natif (19 tps pic) vs quantization q4_0 + 58 couches GPU (23 tps). Contexte 128k possible avec 63 couches GPU, vitesse stable. Trade-off performance acceptable pour flexibilité.
Granite Vision 4.1 4B est un modèle vision-langage compact (4B paramètres) spécialisé dans l'extraction de documents structurés : graphiques, tableaux et paires clé-valeur. Intégration dans llama.cpp via pull request #23545.
Unsloth publie des versions quantifiées (QAT) de Gemma 4 au format GGUF sur Hugging Face. La collection inclut un guide détaillé sur l'optimisation du modèle.