MiniCPM en local (Ollama) : le multimodal compact
MiniCPM est la famille de modèles compacts d'OpenBMB : des LLM et surtout des modèles vision-langage taillés pour tourner là où les gros modèles ne passent pas. Ce guide montre comment installer MiniCPM avec Ollama, faire de la vision et de l'OCR sur une petite carte, et situer honnêtement le modèle face aux ténors comme Qwen-VL. L'objectif : un multimodal qui tient sur 8 Go de VRAM, voire sur un mini-PC.
#Pourquoi MiniCPM
MiniCPM est développé par OpenBMB, un laboratoire issu de l'université Tsinghua et de la société ModelBest. La famille tient sur deux branches : des modèles de texte pur (MiniCPM, MiniCPM3-4B) et surtout la série vision-langage MiniCPM-V, qui est la vraie raison d'installer ces modèles en local. Là où la plupart des modèles multimodaux capables commencent à 12 ou 30 milliards de paramètres, MiniCPM-V vise 8 milliards et en dessous, tout en restant compétitif sur la vision et l'OCR.
L'idée directrice de la série, c'est le rapport capacité/taille. Un MiniCPM-V de 8B lit un document, décrit une image, extrait un tableau ou transcrit du texte manuscrit sans mobiliser un GPU de 24 Go. Pour du edge — un mini-PC, un serveur discret, une carte d'entrée de gamme — c'est exactement le compromis recherché : assez petit pour tenir dans la VRAM disponible, assez bon pour être utile en production.
- Multimodal compact
- MiniCPM-V accepte texte + image (et selon les versions, plusieurs images ou de la vidéo) dans un modèle de 8B ou moins.
- OCR solide
- L'un des points forts historiques de la série : lecture de documents, captures d'écran, tableaux et texte dense, y compris sur des images haute résolution.
- Licence permissive
- Poids publiés sur Hugging Face avec un usage local et de recherche large ; vérifiez la licence exacte de la version que vous téléchargez avant tout usage commercial.
- Petite empreinte
- En Q4, un 8B tient autour de 5 à 6 Go de VRAM pour la partie langage, ce qui laisse de la marge sur une carte 8 Go.
#Prérequis
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
Le montage est volontairement simple : Ollama comme daemon d'inférence, et n'importe quel client (terminal, Open WebUI, votre propre script) par-dessus. Ollama gère le téléchargement du modèle, le projecteur vision et le serveur d'API.
- Ollama installé
- Le daemon écoute par défaut sur http://localhost:11434. Si ce n'est pas encore fait, voir le guide d'installation d'Ollama plus bas.
- VRAM
- 8 Go suffisent pour MiniCPM-V 8B en Q4. Une RTX 3060 12 Go, une 4060/4070, ou un Mac Apple Silicon à mémoire unifiée conviennent largement.
- CPU seul possible
- MiniCPM-V tourne aussi sans GPU sur une machine avec assez de RAM, mais attendez-vous à quelques tokens par seconde seulement — acceptable pour un OCR ponctuel, pas pour du temps réel.
- Une image de test
- Gardez sous la main une capture d'écran ou un scan de document pour valider la vision dès l'installation.
#Installer MiniCPM avec Ollama
La bibliothèque Ollama publie MiniCPM-V sous le tag minicpm-v. Au moment de la rédaction, ce tag par défaut correspond à MiniCPM-V 2.6 (8 milliards de paramètres, quantifié en Q4). Vérifiez la page du modèle sur ollama.com si une version plus récente est disponible : la commande reste la même, seul le tag change.
- 01Récupérer le modèle visionUn simple pull télécharge à la fois les poids du modèle de langage et le projecteur vision (le composant qui transforme une image en tokens). Comptez environ 5 à 6 Go de téléchargement.
- 02Lancer un premier chatollama run minicpm-v ouvre une session interactive. Posez une question texte pour vérifier que le modèle répond, avant même de tester la vision.
- 03Envoyer une imageDans la session, indiquez le chemin absolu d'un fichier image à la fin de votre prompt. Ollama détecte le chemin, encode l'image et la passe au modèle.
- 04Brancher une interfaceUne fois le modèle tiré, il apparaît dans Open WebUI ou tout client compatible OpenAI qui pointe vers le port 11434. Pratique pour glisser-déposer des images.
Pour la partie texte pure, OpenBMB propose aussi MiniCPM3-4B, un petit modèle de langage de 4 milliards de paramètres. Il n'a pas de vision, mais c'est une base légère et rapide pour du résumé ou de la classification sur du très petit matériel. Selon les versions publiées, il peut être disponible sous un tag dédié dans la bibliothèque Ollama ou en GGUF sur Hugging Face.
#Vision et OCR au quotidien
C'est là que MiniCPM-V justifie son existence. Le modèle est particulièrement à l'aise sur les tâches documentaires : lire une facture, transcrire une capture d'écran, extraire les lignes d'un tableau, décrire le contenu d'une photo. La série a été pensée pour gérer des images haute résolution, ce qui compte énormément en OCR — un texte fin illisible sur une petite miniature devient exploitable en pleine résolution.
En pratique, formulez des prompts précis. « Décris cette image » donne une description générale ; « Transcris fidèlement tout le texte visible, en conservant la mise en page » donne un résultat d'OCR bien plus propre. Pour extraire des données structurées, demandez explicitement un format : JSON, Markdown, ou un tableau.
Autre usage qui marche bien : la description d'interface pour de l'automatisation ou de l'accessibilité. MiniCPM-V lit une capture d'écran et vous dit quels boutons et champs sont présents, ce qui peut alimenter un agent ou générer des textes alternatifs en masse.
#La vision qui tient sur 8 Go de VRAM
L'argument central de MiniCPM en local, c'est la frugalité mémoire. En Q4_K_M, la partie langage d'un 8B occupe environ 5 Go ; le projecteur vision ajoute une part modeste, et le cache de contexte grandit avec le nombre de tokens (texte + image). Sur une carte 8 Go, vous restez confortablement dans l'enveloppe pour des images de taille raisonnable.
- Q4_K_M
- Le meilleur compromis par défaut : ~5-6 Go pour le 8B, qualité quasi intacte. À privilégier sur 8 Go de VRAM.
- Q5_K_M / Q8_0
- Un cran de qualité en plus si vous avez 12 Go et plus ; utile quand l'OCR bute sur du texte très dense.
- Images haute résolution
- Plus l'image est grande, plus elle génère de tokens visuels et gonfle la mémoire. Réduisez la résolution si vous saturez.
- Fenêtre de contexte
- Gardez un num_ctx raisonnable (4k-8k) : une fenêtre énorme réserve de la VRAM même vide et n'apporte rien pour de l'OCR page par page.
#Face à Qwen-VL, le match des compacts
Le concurrent direct de MiniCPM-V dans la catégorie 7-8B, c'est Qwen2.5-VL 7B (disponible sous qwen2.5vl:7b dans Ollama). Les deux couvrent le même terrain : description d'image, OCR, questions sur un document. Le choix se joue sur des détails plus que sur un écart de génération.
- MiniCPM-V
- Réputé très solide en OCR et sur les documents haute résolution, avec une empreinte mémoire un peu plus légère. Bon défaut pour du edge pur.
- Qwen2.5-VL
- Écosystème plus large, fort en compréhension d'image générale, ancrage spatial (bounding boxes) et vidéo ; profite de l'élan général des Qwen.
- Verdict pratique
- Testez les deux sur VOS images. Sur de l'OCR documentaire serré, MiniCPM-V surprend souvent ; sur de la compréhension de scène riche, Qwen-VL tient bien la corde.
La bonne nouvelle : les deux tournent sous le même Ollama, avec la même API. Basculer de l'un à l'autre, c'est changer le nom du modèle dans votre requête. Rien n'empêche d'avoir les deux installés et de router selon la tâche.
#Les usages edge où MiniCPM brille
MiniCPM a été conçu avec l'edge en tête, et OpenBMB a beaucoup communiqué sur le fait de faire tourner ses modèles vision jusque sur des téléphones et des cartes embarquées. En pratique, sur du matériel grand public modeste, voici les scénarios où le compromis taille/capacité paie vraiment.
- 01Numérisation locale de documentsUn mini-PC ou un NAS avec GPU d'entrée de gamme transforme un dossier de scans en texte cherchable, sans jamais envoyer un document sensible dans le cloud.
- 02Assistant hors-ligne sur portableSur un laptop Apple Silicon ou une carte 8 Go, MiniCPM-V donne un assistant capable de lire l'écran et de répondre sur des captures, même sans connexion.
- 03Prétraitement pour un pipelineEn amont d'un système plus lourd, MiniCPM-V fait le tri : détecter le type de document, extraire les champs évidents, et n'escalader vers un gros modèle que les cas difficiles.
- 04Accessibilité et alt-text de masseGénérer des descriptions d'images pour un site ou une bibliothèque de médias, en lot, à coût nul une fois le matériel amorti.
#Dépannage
- Le modèle ignore l'image
- Vérifiez que le chemin du fichier est correct et accessible depuis le dossier où tourne Ollama. Un chemin absolu évite les surprises. En API, l'image doit être en base64 dans le champ images.
- OCR bâclé ou tronqué
- L'image est probablement trop compressée ou en trop basse résolution. Fournissez une version nette et plus grande, et demandez explicitement une transcription fidèle avec mise en page.
- Réponses lentes
- Si vous êtes en CPU pur, c'est attendu. Sur GPU, contrôlez que le modèle n'est pas partiellement déchargé en RAM (ollama ps) à cause d'un contexte ou d'une image trop lourds.
- Sortie non structurée
- Pour du JSON fiable, imposez le schéma dans le prompt et, si votre client le permet, activez le mode format JSON d'Ollama.
- Version inattendue
- Le tag minicpm-v évolue. Fixez une version précise (ex. minicpm-v:8b) si vous voulez un comportement reproductible en production.
#Pour aller plus loin
MiniCPM s'inscrit dans un montage local classique. Ces guides du site complètent directement celui-ci :
- Installer Ollama en 5 minutes
- Le prérequis de ce guide, pas à pas sur Windows, macOS et Linux.
- LLM multimodal vision en local
- Le panorama général de l'analyse d'images avec Ollama, pour resituer MiniCPM-V parmi les autres modèles vision.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour arbitrer finement entre qualité d'OCR et VRAM disponible sur votre carte.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.