Retour au feed
Reddit r/LocalLLaMA·

Gemma 4 models benchmarked on with Triple GPU

Signal
72
Hype
15
En 3 lignesBenchmark de Gemma 4 sur triple GPU (3× GTX-1070, 24 GiB VRAM total). Gemma-4-26B-A4B-qat atteint 123.5 t/s en prompt processing et 53.08 t/s en génération. Gemma-4-E4B-BF16 affiche 302.16 t/s mais génération limitée à 11.54 t/s. Tests sur llama.cpp build 9204 avec quantifications GGUF.
Lire la source
Ton avis ?
GeminiBenchmarksOpen sourceInfrastructure

Résumé généré par Claude — vérifié par l'humain