Débutant 9 minGTX 16

Quel LLM sur GTX 1650 / 1660 / Super / Ti ?

La gamme GTX 16 (avril 2019) — 1650, 1660, 1660 Super, 1660 Ti — est Turing sans RT ni Tensor Cores. 4 à 6 Go de VRAM selon modèle, TDP 75-125 W. En 2026, à 80-160 € d'occasion, ce sont les cartes les moins gourmandes encore capables de LLM léger. Mais VRAM limitée (4-6 Go) et l'absence de Tensor Cores les cantonne aux petits modèles 3B. Ce guide détaille chaque variante.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur Windows, macOS, Linux

#La gamme GTX 16

Turing sans RT
Même architecture que RTX 20 mais sans RT Cores ni Tensor Cores.
Gamme
GTX 1650 (4 Go), 1660 (6 Go), 1660 Super (6 Go), 1660 Ti (6 Go).
TDP
75 W (1650) à 125 W (1660 Ti).

#1. Les 4 variantes

Comparatif GTX 16
CarteVRAMBande p.Mistral 7B Q4Prix 2026
GTX 16504 Go128 Go/s❌ débordement~80 € occ.
GTX 16606 Go192 Go/s10 t/s tangent~100 € occ.
GTX 1660 Super6 Go336 Go/s14 t/s~130 € occ.
GTX 1660 Ti6 Go288 Go/s16 t/s~150 € occ.

#2. Modèles utilisables

GTX 1660 Super — modèles LLM
ModèleQuantVRAMTokens/sec
Llama 3.2 1BQ8_01,4 Go55-65 t/s
Qwen 2.5 3BQ5_K_M2,2 Go28-34 t/s
Llama 3.2 3BQ8_03,4 Go22-26 t/s
Mistral 7BQ4_K_M4,4 Go14-18 t/s (tangent)
!
GTX 1650 4 Go : inadaptée LLM
Mistral 7B Q4 (4,4 Go) + contexte = déborde les 4 Go. Limitée à Llama 3.2 3B ou plus petit. Pour LLM, à éviter (sauf usage Llama 3.2 1B draft).

#Verdict 2026

GTX 1660 Super
Meilleur choix de la gamme pour LLM entrée de gamme. Mistral 7B Q4 à 14 tok/s — utilisable.
GTX 1650
À éviter pour LLM. 4 Go insuffisants.
Préférez RTX 3050 8 Go neuve
Pour ~180 € vs ~150 € (1660 Ti), +33 % VRAM, Tensor Cores, support long terme.

#Questions fréquentes

Peut-on faire tourner un LLM sur GTX 1660 ?+
Oui, Mistral 7B Q4 à 10-18 tok/s selon variante (1660, Super ou Ti). Suffisant pour découvrir le LLM local.
Quelle GTX 16 pour LLM ?+
GTX 1660 Super — meilleur rapport bande passante / prix. La 1660 Ti est légèrement plus rapide mais 20 € plus chère en occasion.
La GTX 1650 4 Go peut-elle faire tourner Mistral 7B ?+
Non confortablement. Q4 (4,4 Go) déborde avec contexte. Restez sur Llama 3.2 3B Q5 (2 Go) ou plus petit.
GTX 1660 Super ou RTX 3050 pour LLM ?+
RTX 3050 si budget neuf 180 € : Tensor Cores, 8 Go VRAM (vs 6), support 2028+. GTX 1660 Super occasion 130 € : correct pour budget serré, 3-5 ans d'usage restant.
Les GTX 16 supportent-elles Flash Attention ?+
Non — pas de Tensor Cores. llama.cpp utilise le fallback CUDA standard. Performances correctes mais pas optimales.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.