Moondream : le modèle de vision qui tient partout
Les modèles multimodaux impressionnants pèsent des dizaines de gigaoctets et immobilisent une carte graphique entière. Moondream prend le problème par l'autre bout : un modèle de vision de très petite taille, qui tient dans quelques gigaoctets, répond en une poignée de secondes et fait tourner sur un ordinateur ordinaire des tâches qu'on croyait réservées au cloud — décrire une image, répondre à une question dessus, localiser un objet. Il ne remplace pas un grand modèle ; il rend possible ce qu'un grand modèle rend trop coûteux.
#Un modèle de vision de poche
Moondream est un modèle de langage visuel compact : il reçoit une image et une question en texte, et répond en texte. Sa particularité est sa taille — de l'ordre de quelques centaines de millions à deux milliards de paramètres selon la variante, là où les modèles de vision courants se comptent en dizaines de milliards.
Cette différence d'échelle change la nature des usages possibles. Un modèle qui traite une image en une ou deux secondes sur du matériel modeste peut être appelé sur un flux de milliers de photos, sur un poste sans carte graphique dédiée, ou sur une machine embarquée. Le même travail avec un grand modèle serait techniquement supérieur et pratiquement irréalisable.
#Ce qu'il sait faire
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
- Décrire une image
- Produire une légende, courte ou détaillée. C'est l'usage le plus fiable, et celui qui sert à indexer un fonds photographique.
- Répondre à une question sur l'image
- « Combien de personnes ? », « La porte est-elle ouverte ? », « De quelle couleur est le véhicule ? »
- Localiser un objet
- Renvoyer la position d'un élément désigné, ce qui permet de recadrer ou de compter automatiquement.
- Lire du texte court
- Un panneau, une étiquette, un titre. À ne pas confondre avec une reconnaissance optique de document.
La bonne façon de s'en servir est de poser des questions fermées et précises. Un petit modèle répond bien à « y a-t-il un casque sur la tête de la personne ? » et se disperse sur « analyse cette scène ».
#Ce qu'il consomme
| Moondream | Modèle de vision 7-8 milliards | Modèle de vision 30 milliards et plus | |
|---|---|---|---|
| Mémoire nécessaire | Quelques Go | 6 à 10 Go | 20 Go et plus |
| Sans GPU dédié | Envisageable | Lent | Non |
| Vitesse par image | Une à quelques secondes | Quelques secondes | Dizaines de secondes |
| Traitement par lots de milliers d'images | Réaliste | Long | Irréaliste en local |
| Raisonnement sur une scène complexe | Limité | Correct | Bon |
#Les usages où il gagne
- 01Indexer une photothèque
- 02Filtrer avant un gros modèle
- 03Décrire des images pour l'accessibilité
- 04Surveiller un flux
- Panorama des modèles multimodaux en local
- Qwen VL : la vision locale haut de gamme
- Pour lire un document scanné, c'est l'OCR qu'il faut
#Ce qu'il ne faut pas lui demander
- Lire un document entier
- Ce n'est pas un moteur de reconnaissance optique. Une page dense de texte relève d'un outil d'OCR, pas d'un petit modèle de vision.
- Du comptage précis sur une scène chargée
- Les petits modèles se trompent sur les objets nombreux ou partiellement masqués.
- Du raisonnement en plusieurs étapes
- Déduire une intention, une chronologie ou une relation causale dépasse ce format.
- Une décision sans vérification
- Sur un usage à conséquence, la sortie d'un petit modèle se contrôle. Il se trompe avec la même assurance qu'un grand.
#Moondream ou un gros modèle de vision
La question à se poser n'est pas « lequel est le meilleur » mais « combien d'images, et pour quelle décision ». Une poignée d'images par jour et des questions ouvertes : prenez le plus gros modèle que votre carte accepte. Des milliers d'images et une question fermée répétée : un petit modèle rend le projet possible, et c'est le seul critère qui compte.
Une architecture en cascade combine les deux : le petit modèle traite tout et signale les cas intéressants, le grand modèle n'intervient que sur ceux-là. Sur un fonds important, c'est le schéma qui offre le meilleur rapport entre qualité et temps de calcul.
#FAQ
Moondream est-il gratuit ?+
Faut-il une carte graphique ?+
Sait-il lire un document scanné ?+
Moondream ou un modèle de vision plus gros ?+
Peut-on l'utiliser sur beaucoup d'images à la suite ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.