Topic

#Gemini

Gemini est la famille de modèles d'IA multimodaux développés par Google DeepMind, capables de traiter texte, images, audio et vidéo. Par exemple, Gemini 1.5 Pro peut analyser de longs documents et des vidéos dans une même requête.

40Articles
9Sources
60Signal moyen
arXiv cs.LG·

When the Next Step Is Not One Step: Distribution-Aware Execution Modeling for Concurrent Go Programs

Modèle 7B fine-tuné pour prédire l'étape suivante dans des programmes Go concurrents en apprenant une distribution d'événements plutôt qu'une étiquette unique. Sur 798 prédictions issues de bugs réels (CockroachDB, Kubernetes, gRPC, etcd), atteint 36.2% de précision avec <1000 traces, surpassant Gemini 3.5 Flash zéro-shot (34.8%). Dataset, adapters et outils publiés.

Génération de codeBenchmarksFine-tuning
SIG
78
HYP
00
Reddit r/LocalLLaMA·

Why might DiffusionGemma be better at tool calls than its benchmark quality suggests

DiffusionGemma génère 256 tokens en parallèle avec attention bidirectionnelle, permettant l'auto-correction avant finalisation. Contrairement aux modèles autorégressifs figés après chaque token, cette architecture pourrait améliorer les appels d'outils structurés malgré une qualité de base inférieure à Gemma 4. Reste à tester si la correction bidirectionnelle compense la qualité plus faible.

GeminiGénération de codeRaisonnement
SIG
35
HYP
00
arXiv cs.AI·

Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models

Fine-tuner des modèles vision-langage sur des listes de coordonnées denses améliore le grounding visuel mais induit des répétitions parasites. Sur Gemma 4 12B, une LoRA haute capacité élève F1@0.3 de 0.007 à 0.448 mais crée un taux de doublons de 0.080. Un contrôle au niveau objet élimine les répétitions (taux 0.000) tout en préservant la performance (F1 0.490).

Fine-tuningVisionBenchmarks
SIG
72
HYP
00
Reddit r/LocalLLaMA·

Diffusion Gemma is 4x faster, but makes 6x more mistakes!

Benchmark sur H100 (FP8) : DiffusionGemma 26B génère 763 tok/s (3.7s) vs Gemma4 218 tok/s (15.1s), mais produit 28 erreurs factuelles sur 61 faits testés contre 5 pour Gemma4. DiffusionGemma invente noms, dates et chiffres (Clara Clley comme mère de Jobs, BeBox à $9,999 au lieu de $1,600). Le modèle diffusion génère 256 tokens simultanément et polit le texte sans vérifier la factualité.

GeminiBenchmarksÉvaluations
SIG
72
HYP
00
arXiv cs.CL·

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

Shopping Reasoning Bench : benchmark expert de 525 missions (232 single-turn, 293 multi-turn) avec 10863 rubriques binaires pondérées pour évaluer les assistants conversationnels de shopping. Évaluation de 9 modèles (GPT, Claude, Gemini) : taux de réussite 57-77%, dégradation de 4-18 points au fil de la conversation, écart de 13-29 points entre critères obligatoires et optionnels.

BenchmarksGPTClaude
SIG
75
HYP
00
Reddit r/LocalLLaMA·

Some contrived tests comparing the accuracy of different Gemma and Qwen quantizations

Comparaison empirique de quantifications Gemma et Qwen sur trois tâches (arithmétique, dates présidentielles, attention). Gemma-4-31B-Q4_K_S atteint 83,8% en arithmétique et 87% en attention. Qwen3.6-27B-Q4_K_S obtient 95,5% en arithmétique et 100% en présidents. Les résultats montrent l'impact majeur du modèle et du schéma de quantification sur la précision.

GeminiQwenÉvaluations
SIG
72
HYP
00
Reddit r/LocalLLaMA·

Anyone gotten Gemma 4 12B (unified audio) to actually attend to speech with a large system prompt?

Utilisateur rapporte que Gemma 4 12B (modèle unifié audio/vision/texte) ignore l'audio quand le system prompt dépasse ~21k tokens. Le modèle fonctionne bien avec prompt minimal mais génère des réponses génériques/halluccinées avec contexte dense. Comportement reproductible sur vLLM, llama.cpp et LiteRT-LM. Semble être une limite d'attention inhérente.

GeminiVoixMulti-agents
SIG
45
HYP
00