Topic

#DeepSeek

DeepSeek est une entreprise chinoise spécialisée en IA, connue pour ses modèles de langage open-source performants et économiques. Son modèle DeepSeek-R1 a notamment démontré des capacités de raisonnement comparables aux meilleurs modèles occidentaux.

40Articles
11Sources
63Signal moyen
Reddit r/LocalLLaMA·

DeepSeek v4 Pro is too big for such a "midrange" performance, or am I missing something?

Un utilisateur remet en question la pertinence de DeepSeek v4 Pro (1.6T paramètres) face à ses performances médiocres comparées à des modèles plus petits : GLM 5.2 (750B), Kimi K2.7 (1T), MiniMax M3 (450B) et MiMo v2.5 Pro (1T) surpassent ses benchmarks. Interrogation sur l'intérêt réel du modèle au-delà de l'infrastructure d'inférence Huawei.

DeepSeekBenchmarksOpen source
SIG
35
HYP
00
Reddit r/LocalLLaMA·

How can Deepseek v4 top the coding leaderboards and still sit 8 months behind the frontier?

DeepSeek v4 Pro affiche 80.6 sur SWE-bench et 93.5 sur LiveCodeBench mais CAISI l'évalue 8 mois derrière la frontière US (vs 2 mois selon DeepSeek). Les benchmarks de code sont étroits et sur-optimisés ; les écarts apparaissent en cybersécurité et raisonnement abstrait. Les versions quantifiées locales s'éloignent davantage des scores annoncés.

DeepSeekBenchmarksGénération de code
SIG
45
HYP
00
Reddit r/LocalLLaMA·

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4 introduit Lookahead Sparse Attention (LSA), un paradigme d'inférence qui réduit l'empreinte mémoire KV cache à 13,5% du baseline sur contextes ultra-longs (500K tokens). Un Neural Memory Indexer prédit les demandes futures et conserve uniquement les chunks critiques en GPU, sans charger le modèle backbone complet. Résultats : +0,6% de précision moyenne sur LongBench-v2, LongMemEval, RULER.

DeepSeekRaisonnementBenchmarks
SIG
82
HYP
00
arXiv cs.AI·

Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation

Moonshine est un agent autonome générant des conjectures mathématiques. Il extrait des structures de problèmes classiques et formule des conjectures significatives. Appliqué à la conjecture jacobienne, il transfère la logique à des réseaux de neurones affines-ridge, formulant la Neural Jacobian Conjecture (NJC). GPT-5.5-pro et DeepSeek-V4-pro ont obtenu des preuves complètes pour N=n+1.

Agents IARaisonnementPapers
SIG
72
HYP
00
arXiv cs.LG·

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

TENP propose un cadre de pruning structuré pour les modèles MoE (Mixture-of-Experts). La méthode identifie les experts importants et applique un pruning au niveau des neurones aux experts moins importants, avec un pattern trapézoïdal. Sur DeepSeek avec 40% sparsité de routage et 63.76% de paramètres activés, la perte de précision est limitée à 1 point, avec +10% sur la génération de code.

DeepSeekQwenBenchmarks
SIG
78
HYP
00
arXiv cs.CL·

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

Étude d'évaluation de LLMs (GPT-5.1, GPT-5 mini, Claude Sonnet 4.5 + Thinking, DeepSeek-V3.1) sur leur capacité à générer plusieurs réponses à une même requête scientifique en variant la complexité du langage. Sur 98 requêtes, Claude Sonnet 4.5 ne maintient une complexité cohérente que 46% du temps. Framework d'évaluation basé sur étude formative avec 16 participants.

ÉvaluationsClaudeGPT
SIG
72
HYP
00
arXiv cs.CL·

G^2C-MT: Graph-Guided Context Selection for Document-Level Machine Translation

G²C-MT propose une sélection de contexte guidée par graphe pour la traduction automatique au niveau du document. Le système modélise les dépendances discursives entre paragraphes via un graphe léger et utilise une marche aléatoire biaisée en profondeur pour extraire des chemins de contexte. Testé sur DeepSeek-V3, Gemini-2.5-Flash-lite et Qwen-2.5/3, l'approche surpasse les baselines sur plusieurs domaines.

PapersBenchmarksDeepSeek
SIG
72
HYP
00
The Decoder·

New review paper argues code is how AI agents think and act, not just what they produce

Un article de recherche soutient que le véritable goulot d'étranglement des agents IA autonomes n'est pas le modèle de langage mais la couche logicielle qui l'entoure : outils, mémoire, tests et limites de permissions transforment un modèle sans état en agent fonctionnel. Deepseek construit une équipe dédiée « Harness » à Pékin confirmant cette thèse.

Agents IADeepSeekGénération de code
SIG
65
HYP
00
Reddit r/LocalLLaMA·

GH200 NVL2 or 8x RTX 6000 Blackwell for running Kimi K2.6 / DeepSeek V4 locally? (5 devs, agentic coding)

Développeur cherche la meilleure infrastructure (~100-150k$) pour servir localement Kimi K2.6 et DeepSeek V4 en équipe de 5 (coding agentic). Compare dual GH200 NVL2 (1.2TB mémoire unifiée, 95k$) vs 8x RTX 6000 Blackwell (768GB VRAM, 140k$). Test GH200 seul : 23 tok/s en décodage 2-bit, mais préfill lent et modèles débordent en mémoire lente.

DeepSeekKimiAgents IA
SIG
45
HYP
00
arXiv cs.AI·

Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal

Les modèles de raisonnement (LRM) encodent le refus conjointement dans les activations résiduelles et la chaîne de pensée (CoT). Sur DeepSeek-R1-Distill-LLaMA-8B, le steering d'activation inverse le refus dans 39% des cas avec CoT fixe, mais 70% sans CoT. Régénérer la CoT sous steering atteint 94% de succès, révélant que le refus est distribué entre activations et CoT.

RaisonnementSécurité IAAlignement
SIG
78
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Hmbown /</span> CodeWhale

CodeWhale est un terminal de codage agentique utilisant DeepSeek en priorité, avec support multi-fournisseurs, optimisation du cache, interface en 5 langues et endpoints régionaux CN.

Agents IAGénération de codeDeepSeek
SIG
45
HYP
00
Reddit r/LocalLLaMA·

The reason small-model agent stacks aren't the default has nothing to do with whether they work

Les petits modèles spécialisés (Gemma 4 31B à 86.4% sur tau2-bench, Qwen 27B surpassant des modèles 397B) dominent désormais les benchmarks d'agents. Pourtant l'industrie continue d'utiliser des modèles frontière coûteux : les labs de frontier gagnent à la facturation par token, créant un désalignement économique entre performance technique et adoption.

Agents IABenchmarksQwen
SIG
75
HYP
00