Intermédiaire 10 minEdge

MiniCPM en local (Ollama) : le multimodal compact

MiniCPM est la famille de modèles compacts d'OpenBMB : des LLM et surtout des modèles vision-langage taillés pour tourner là où les gros modèles ne passent pas. Ce guide montre comment installer MiniCPM avec Ollama, faire de la vision et de l'OCR sur une petite carte, et situer honnêtement le modèle face aux ténors comme Qwen-VL. L'objectif : un multimodal qui tient sur 8 Go de VRAM, voire sur un mini-PC.

Par Samir K.·Màj 2026-09-22·Testé sur Windows, macOS, Linux

#Pourquoi MiniCPM

MiniCPM est développé par OpenBMB, un laboratoire issu de l'université Tsinghua et de la société ModelBest. La famille tient sur deux branches : des modèles de texte pur (MiniCPM, MiniCPM3-4B) et surtout la série vision-langage MiniCPM-V, qui est la vraie raison d'installer ces modèles en local. Là où la plupart des modèles multimodaux capables commencent à 12 ou 30 milliards de paramètres, MiniCPM-V vise 8 milliards et en dessous, tout en restant compétitif sur la vision et l'OCR.

L'idée directrice de la série, c'est le rapport capacité/taille. Un MiniCPM-V de 8B lit un document, décrit une image, extrait un tableau ou transcrit du texte manuscrit sans mobiliser un GPU de 24 Go. Pour du edge — un mini-PC, un serveur discret, une carte d'entrée de gamme — c'est exactement le compromis recherché : assez petit pour tenir dans la VRAM disponible, assez bon pour être utile en production.

Multimodal compact
MiniCPM-V accepte texte + image (et selon les versions, plusieurs images ou de la vidéo) dans un modèle de 8B ou moins.
OCR solide
L'un des points forts historiques de la série : lecture de documents, captures d'écran, tableaux et texte dense, y compris sur des images haute résolution.
Licence permissive
Poids publiés sur Hugging Face avec un usage local et de recherche large ; vérifiez la licence exacte de la version que vous téléchargez avant tout usage commercial.
Petite empreinte
En Q4, un 8B tient autour de 5 à 6 Go de VRAM pour la partie langage, ce qui laisse de la marge sur une carte 8 Go.
i
Deux familles à ne pas confondre
« MiniCPM » tout court désigne les modèles de texte ; « MiniCPM-V » (et les variantes -o avec audio) désigne les modèles vision. Pour l'analyse d'images et l'OCR, c'est MiniCPM-V qu'il vous faut.

#Prérequis

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

Le montage est volontairement simple : Ollama comme daemon d'inférence, et n'importe quel client (terminal, Open WebUI, votre propre script) par-dessus. Ollama gère le téléchargement du modèle, le projecteur vision et le serveur d'API.

Ollama installé
Le daemon écoute par défaut sur http://localhost:11434. Si ce n'est pas encore fait, voir le guide d'installation d'Ollama plus bas.
VRAM
8 Go suffisent pour MiniCPM-V 8B en Q4. Une RTX 3060 12 Go, une 4060/4070, ou un Mac Apple Silicon à mémoire unifiée conviennent largement.
CPU seul possible
MiniCPM-V tourne aussi sans GPU sur une machine avec assez de RAM, mais attendez-vous à quelques tokens par seconde seulement — acceptable pour un OCR ponctuel, pas pour du temps réel.
Une image de test
Gardez sous la main une capture d'écran ou un scan de document pour valider la vision dès l'installation.

#Installer MiniCPM avec Ollama

La bibliothèque Ollama publie MiniCPM-V sous le tag minicpm-v. Au moment de la rédaction, ce tag par défaut correspond à MiniCPM-V 2.6 (8 milliards de paramètres, quantifié en Q4). Vérifiez la page du modèle sur ollama.com si une version plus récente est disponible : la commande reste la même, seul le tag change.

  1. 01
    Récupérer le modèle vision
    Un simple pull télécharge à la fois les poids du modèle de langage et le projecteur vision (le composant qui transforme une image en tokens). Comptez environ 5 à 6 Go de téléchargement.
  2. 02
    Lancer un premier chat
    ollama run minicpm-v ouvre une session interactive. Posez une question texte pour vérifier que le modèle répond, avant même de tester la vision.
  3. 03
    Envoyer une image
    Dans la session, indiquez le chemin absolu d'un fichier image à la fin de votre prompt. Ollama détecte le chemin, encode l'image et la passe au modèle.
  4. 04
    Brancher une interface
    Une fois le modèle tiré, il apparaît dans Open WebUI ou tout client compatible OpenAI qui pointe vers le port 11434. Pratique pour glisser-déposer des images.
Terminal
# Télécharger MiniCPM-V (8B, Q4 par défaut)
ollama pull minicpm-v

# Vérifier qu'il est bien présent
ollama list

# Lancer un chat interactif
ollama run minicpm-v

Pour la partie texte pure, OpenBMB propose aussi MiniCPM3-4B, un petit modèle de langage de 4 milliards de paramètres. Il n'a pas de vision, mais c'est une base légère et rapide pour du résumé ou de la classification sur du très petit matériel. Selon les versions publiées, il peut être disponible sous un tag dédié dans la bibliothèque Ollama ou en GGUF sur Hugging Face.

Passer une image en une ligne
Depuis le shell, vous pouvez tout envoyer d'un coup sans entrer en mode interactif : ollama run minicpm-v "Décris cette image ./photo.jpg". Le chemin peut être relatif au dossier courant.

#Vision et OCR au quotidien

C'est là que MiniCPM-V justifie son existence. Le modèle est particulièrement à l'aise sur les tâches documentaires : lire une facture, transcrire une capture d'écran, extraire les lignes d'un tableau, décrire le contenu d'une photo. La série a été pensée pour gérer des images haute résolution, ce qui compte énormément en OCR — un texte fin illisible sur une petite miniature devient exploitable en pleine résolution.

En pratique, formulez des prompts précis. « Décris cette image » donne une description générale ; « Transcris fidèlement tout le texte visible, en conservant la mise en page » donne un résultat d'OCR bien plus propre. Pour extraire des données structurées, demandez explicitement un format : JSON, Markdown, ou un tableau.

Python — API Ollama
import base64, requests

with open("facture.png", "rb") as f:
    img = base64.b64encode(f.read()).decode()

r = requests.post("http://localhost:11434/api/generate", json={
    "model": "minicpm-v",
    "prompt": "Extrais le total, la date et le numero de facture en JSON.",
    "images": [img],
    "stream": False,
})
print(r.json()["response"])
!
Vérifiez toujours l'OCR
Aucun modèle vision compact n'est fiable à 100 % sur des chiffres critiques (montants, références, dates). Pour un usage comptable ou juridique, gardez une relecture humaine ou un contrôle de cohérence sur les champs sensibles.

Autre usage qui marche bien : la description d'interface pour de l'automatisation ou de l'accessibilité. MiniCPM-V lit une capture d'écran et vous dit quels boutons et champs sont présents, ce qui peut alimenter un agent ou générer des textes alternatifs en masse.


#La vision qui tient sur 8 Go de VRAM

L'argument central de MiniCPM en local, c'est la frugalité mémoire. En Q4_K_M, la partie langage d'un 8B occupe environ 5 Go ; le projecteur vision ajoute une part modeste, et le cache de contexte grandit avec le nombre de tokens (texte + image). Sur une carte 8 Go, vous restez confortablement dans l'enveloppe pour des images de taille raisonnable.

Q4_K_M
Le meilleur compromis par défaut : ~5-6 Go pour le 8B, qualité quasi intacte. À privilégier sur 8 Go de VRAM.
Q5_K_M / Q8_0
Un cran de qualité en plus si vous avez 12 Go et plus ; utile quand l'OCR bute sur du texte très dense.
Images haute résolution
Plus l'image est grande, plus elle génère de tokens visuels et gonfle la mémoire. Réduisez la résolution si vous saturez.
Fenêtre de contexte
Gardez un num_ctx raisonnable (4k-8k) : une fenêtre énorme réserve de la VRAM même vide et n'apporte rien pour de l'OCR page par page.
Le débordement CPU
Si Ollama signale que le modèle déborde en RAM (offload CPU), c'est souvent l'image ou le contexte, pas les poids. Baissez la résolution de l'image ou num_ctx avant de descendre en quantification.

#Face à Qwen-VL, le match des compacts

Le concurrent direct de MiniCPM-V dans la catégorie 7-8B, c'est Qwen2.5-VL 7B (disponible sous qwen2.5vl:7b dans Ollama). Les deux couvrent le même terrain : description d'image, OCR, questions sur un document. Le choix se joue sur des détails plus que sur un écart de génération.

MiniCPM-V
Réputé très solide en OCR et sur les documents haute résolution, avec une empreinte mémoire un peu plus légère. Bon défaut pour du edge pur.
Qwen2.5-VL
Écosystème plus large, fort en compréhension d'image générale, ancrage spatial (bounding boxes) et vidéo ; profite de l'élan général des Qwen.
Verdict pratique
Testez les deux sur VOS images. Sur de l'OCR documentaire serré, MiniCPM-V surprend souvent ; sur de la compréhension de scène riche, Qwen-VL tient bien la corde.

La bonne nouvelle : les deux tournent sous le même Ollama, avec la même API. Basculer de l'un à l'autre, c'est changer le nom du modèle dans votre requête. Rien n'empêche d'avoir les deux installés et de router selon la tâche.

Terminal
# Comparer les deux compacts sur la meme image
ollama run minicpm-v "Transcris le texte de ce ticket ./ticket.jpg"
ollama run qwen2.5vl:7b "Transcris le texte de ce ticket ./ticket.jpg"

#Les usages edge où MiniCPM brille

MiniCPM a été conçu avec l'edge en tête, et OpenBMB a beaucoup communiqué sur le fait de faire tourner ses modèles vision jusque sur des téléphones et des cartes embarquées. En pratique, sur du matériel grand public modeste, voici les scénarios où le compromis taille/capacité paie vraiment.

  1. 01
    Numérisation locale de documents
    Un mini-PC ou un NAS avec GPU d'entrée de gamme transforme un dossier de scans en texte cherchable, sans jamais envoyer un document sensible dans le cloud.
  2. 02
    Assistant hors-ligne sur portable
    Sur un laptop Apple Silicon ou une carte 8 Go, MiniCPM-V donne un assistant capable de lire l'écran et de répondre sur des captures, même sans connexion.
  3. 03
    Prétraitement pour un pipeline
    En amont d'un système plus lourd, MiniCPM-V fait le tri : détecter le type de document, extraire les champs évidents, et n'escalader vers un gros modèle que les cas difficiles.
  4. 04
    Accessibilité et alt-text de masse
    Générer des descriptions d'images pour un site ou une bibliothèque de médias, en lot, à coût nul une fois le matériel amorti.
i
Edge ne veut pas dire magique
Sur téléphone ou carte embarquée, la latence grimpe et la quantification est plus agressive. MiniCPM y est utilisable pour des tâches ponctuelles, pas pour un flux d'images en continu. Calibrez vos attentes selon le matériel réel.

#Dépannage

Le modèle ignore l'image
Vérifiez que le chemin du fichier est correct et accessible depuis le dossier où tourne Ollama. Un chemin absolu évite les surprises. En API, l'image doit être en base64 dans le champ images.
OCR bâclé ou tronqué
L'image est probablement trop compressée ou en trop basse résolution. Fournissez une version nette et plus grande, et demandez explicitement une transcription fidèle avec mise en page.
Réponses lentes
Si vous êtes en CPU pur, c'est attendu. Sur GPU, contrôlez que le modèle n'est pas partiellement déchargé en RAM (ollama ps) à cause d'un contexte ou d'une image trop lourds.
Sortie non structurée
Pour du JSON fiable, imposez le schéma dans le prompt et, si votre client le permet, activez le mode format JSON d'Ollama.
Version inattendue
Le tag minicpm-v évolue. Fixez une version précise (ex. minicpm-v:8b) si vous voulez un comportement reproductible en production.

#Pour aller plus loin

MiniCPM s'inscrit dans un montage local classique. Ces guides du site complètent directement celui-ci :

Installer Ollama en 5 minutes
Le prérequis de ce guide, pas à pas sur Windows, macOS et Linux.
LLM multimodal vision en local
Le panorama général de l'analyse d'images avec Ollama, pour resituer MiniCPM-V parmi les autres modèles vision.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour arbitrer finement entre qualité d'OCR et VRAM disponible sur votre carte.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.