Débutant 10 minMobile

LLM en local sur iPhone et iPad : apps et modèles qui tournent vraiment

Faire tourner un LLM local sur iPhone, c'est possible et ça marche vraiment : les puces Apple Silicon (série A et M) et le framework MLX permettent d'exécuter des modèles de 1 à 8 milliards de paramètres hors ligne, directement sur l'appareil. Ce guide fait le tri entre les apps qui tiennent leurs promesses, explique ce que la RAM change réellement selon votre iPhone ou iPad, et pose les vrais repères de performance — sans marketing.

Par Clara M.·Màj 2026-07-20·Testé sur macOS 14+

#Pourquoi faire tourner un LLM local sur iPhone

Un LLM local sur iOS exécute tout le calcul sur votre appareil : aucun serveur, aucun abonnement, aucune donnée qui quitte le téléphone. C'est l'inverse d'une app comme ChatGPT, qui envoie chaque message vers le cloud. Les raisons de vouloir ça sont concrètes : confidentialité totale (notes médicales, brouillons, code), fonctionnement en avion ou sans réseau, et zéro coût récurrent une fois le modèle téléchargé.

La contrepartie est réelle : un iPhone n'a ni la mémoire ni la puissance d'un PC équipé d'une RTX 4070. On ne fait pas tourner un modèle 70B dans sa poche. Mais un 3B correctement quantifié suffit largement pour résumer un texte, reformuler un mail, répondre à des questions simples ou traduire — le tout hors ligne et instantanément accessible.

i
Ce qui est réaliste sur mobile
Visez des modèles de 1B à 8B en quantization Q4. En-dessous de 1B, la qualité s'effondre ; au-dessus de 8B, seuls les iPad Pro et iPhone haut de gamme récents suivent, et encore lentement.

#Apple Silicon, MLX et Neural Engine

Les iPhone et iPad modernes partagent l'architecture Apple Silicon avec les Mac : une puce système (série A sur iPhone, série M sur iPad Pro) et surtout une mémoire unifiée partagée entre CPU, GPU et Neural Engine. C'est ce pool de RAM commun qui rend l'inférence LLM possible sur mobile — le modèle est chargé une fois et accessible par tous les cœurs sans copie.

MLX est le framework de machine learning d'Apple, pensé pour cette mémoire unifiée. Les apps iOS sérieuses l'utilisent (ou llama.cpp compilé avec Metal) pour exploiter le GPU de la puce. C'est là que se fait l'essentiel du calcul d'inférence : le GPU Metal, pas le CPU seul.

!
Ce que la Neural Engine ne fait pas (encore)
On croit souvent que la Neural Engine (ANE) accélère les LLM. En pratique, la génération de texte token par token passe aujourd'hui surtout par le GPU Metal via MLX ou llama.cpp. L'ANE excelle sur des modèles à graphe fixe (vision, Face ID), moins sur la génération autoregressive. Ne comptez pas dessus pour vos tokens/sec.
Mémoire unifiée
CPU, GPU et ANE partagent la même RAM. C'est le facteur limitant n°1 pour la taille de modèle que vous pouvez charger.
GPU Metal
Fait tourner l'inférence via MLX ou llama.cpp. C'est ce qui détermine vos tokens par seconde.
Neural Engine (ANE)
Puissante mais spécialisée. Peu exploitée pour la génération de texte LLM à ce jour.

#Prérequis et RAM par appareil

Sur iOS, la RAM est le seul chiffre qui compte vraiment, et Apple ne la met pas en avant. C'est pourtant elle qui décide si un modèle se charge ou fait crasher l'app. Voici les repères pour les appareils récents.

iPhone 15 / 15 Plus
6 Go de RAM. Confortable pour du 1B–3B en Q4. Un 3B tourne, un 7B est à la limite et laisse peu de marge au système.
iPhone 15 Pro / 16 / 16 Pro
8 Go. Le sweet spot mobile : 3B fluide, 7B–8B jouable en Q4 avec un contexte modéré.
iPhone 17 Pro
12 Go (gamme Pro récente). Marge réelle pour un 7B–8B confortable et des contextes plus longs.
iPad Pro M4
16 Go ou plus selon config. La meilleure cible iOS : 8B fluide, et des modèles plus gros deviennent envisageables.
Règle de pouce mémoire
iOS ne laisse pas une app monopoliser toute la RAM. Comptez qu'une app tierce dispose grosso modo de la moitié à deux tiers de la RAM physique. Sur un iPhone 8 Go, prévoyez un budget modèle réaliste autour de 4–5 Go — soit un 7B en Q4 serré, ou un 3B très confortable.

Les ordres de grandeur mémoire d'un modèle quantifié Q4 sont les mêmes que sur desktop : un 3B pèse environ 2 Go, un 7B environ 5 Go, un 8B un peu plus. Ajoutez la mémoire du contexte (KV cache), qui grandit avec la longueur de conversation. C'est pour ça qu'un contexte long peut faire tomber une app qui démarrait pourtant bien.

#Les apps iOS qui tiennent la route

L'App Store regorge d'apps « IA » qui ne sont que des façades vers le cloud. Pour du vrai local, il faut une app qui télécharge le modèle sur l'appareil et l'exécute avec MLX ou llama.cpp. Voici les valeurs sûres.

PocketPal AI
Gratuite et open source. Télécharge des modèles GGUF depuis Hugging Face et les exécute via llama.cpp. Interface chat simple, réglages de contexte et de température. Le point de départ recommandé.
LLM Farm
Open source, très paramétrable. Supporte de nombreux formats et permet de régler finement l'inférence. Plus technique, idéale pour tester différents modèles.
Enclave / MLX-based apps
Apps s'appuyant sur MLX, le framework Apple. Bonnes performances sur Apple Silicon récent, souvent orientées confidentialité.
Private LLM
App payante, propose des modèles quantifiés optimisés et une expérience clé en main. Pas de configuration à faire, tout est packagé.
i
GGUF, le format de fichier des modèles
La plupart de ces apps chargent des fichiers GGUF — le format de llama.cpp. Vous choisissez la quantization au téléchargement : Q4_K_M est le meilleur compromis taille/qualité, exactement comme sur PC. Évitez le FP16 sur mobile, bien trop lourd.

#Installer et lancer un modèle : pas à pas

L'exemple ci-dessous utilise PocketPal AI, gratuite et représentative du flux général. La logique est la même dans les autres apps.

  1. 01
    Installer l'app
    Téléchargez PocketPal AI depuis l'App Store. Aucun compte requis, aucune connexion à un serveur.
  2. 02
    Choisir un modèle
    Ouvrez la bibliothèque de modèles intégrée. L'app propose des modèles adaptés au mobile (Llama 3.2 3B, Qwen2.5 3B, Gemma 3 1B/4B, Phi-4-mini). Commencez petit : un 1B ou 3B en Q4.
  3. 03
    Télécharger
    Lancez le téléchargement (quelques centaines de Mo à ~2 Go selon la taille). Faites-le en Wi-Fi. Le fichier reste stocké localement sur l'appareil.
  4. 04
    Charger le modèle
    Sélectionnez le modèle téléchargé pour le charger en mémoire. Si l'app se ferme ici, c'est un manque de RAM : choisissez plus petit ou fermez les autres apps.
  5. 05
    Discuter hors ligne
    Ouvrez un chat et posez une question. Activez le mode avion pour vérifier : tout continue de fonctionner, la preuve que rien ne sort de l'appareil.

Pour les curieux qui veulent la voie la plus brute, il est aussi possible de compiler llama.cpp soi-même, mais iOS ne permet pas d'exécuter du code arbitraire hors d'une app signée : en pratique, passer par une app dédiée est la seule voie réaliste pour la grande majorité des utilisateurs.

#Quels modèles choisir selon la RAM

Le bon modèle dépend d'abord de votre appareil. Voici des recommandations concrètes, du plus modeste au plus capable, tous en quantization Q4.

iPhone 15 / 15 Plus (6 Go)
Gemma 3 1B ou Llama 3.2 1B pour la fluidité ; Qwen2.5 3B ou Llama 3.2 3B pour plus de qualité. Restez sur des contextes courts.
iPhone 16 / 16 Pro (8 Go)
3B en usage quotidien fluide. Un 7B–8B (Llama 3.1 8B, Qwen2.5 7B) tourne en Q4 avec un contexte modéré — plus lent mais nettement plus capable.
iPhone 17 Pro (12 Go)
7B–8B confortable, contextes plus longs, et modèles de raisonnement légers envisageables.
iPad Pro M4 (16 Go+)
8B fluide en usage réel ; les modèles jusqu'à ~14B deviennent testables, avec une vitesse qui reste correcte grâce au GPU M4.
Petit et récent bat gros et ancien
Un modèle 3B de 2025 (Llama 3.2, Qwen2.5, Gemma 3) répond souvent mieux qu'un 7B plus vieux, tout en consommant moitié moins de RAM. Sur mobile, privilégiez la génération de modèle avant la taille brute.

Sur le français, Gemma 3 et les modèles Qwen2.5 s'en sortent bien pour leur taille. Pour du résumé, de la reformulation et des réponses courtes, un 3B suffit. Pour du raisonnement ou du code plus sérieux, la limite du mobile se fait sentir vite — c'est le moment de basculer vers une machine à la maison.

#Confidentialité totale : rien ne sort de l'appareil

C'est l'argument massue du local sur mobile. Une fois le modèle téléchargé, aucune requête réseau n'est nécessaire pour discuter. Vos prompts, vos documents, vos brouillons restent sur l'iPhone. Aucune télémétrie de conversation, aucun entraînement sur vos données, aucun risque de fuite serveur.

Vérifiez en mode avion
Le test le plus simple : coupez tout réseau et vérifiez que le chat fonctionne toujours. S'il marche hors ligne, rien ne transite.
Attention aux apps hybrides
Certaines apps « IA » basculent silencieusement vers le cloud quand le modèle local échoue. Préférez les apps 100 % locales et open source pour lever le doute.
Données sensibles
Notes de santé, documents pro sous NDA, informations personnelles : le local est le seul moyen d'être certain qu'elles ne quittent jamais votre appareil.
i
Local ne veut pas dire infaillible
Le modèle ne fuite pas vos données, mais il peut se tromper (hallucinations). Pour des décisions importantes, gardez un œil critique — la confidentialité n'est pas la même chose que la fiabilité.

#Dépannage et astuces

L'app crashe au chargement du modèle
Manque de RAM. Fermez toutes les autres apps, choisissez un modèle plus petit (3B au lieu de 7B) ou une quantization plus légère (Q4 au lieu de Q5/Q8).
Réponses très lentes
Réduisez la longueur du contexte et le nombre de tokens générés. Vérifiez aussi la chaleur : un iPhone chaud throttle et ralentit l'inférence.
L'iPhone chauffe et la batterie fond
L'inférence sollicite le GPU à fond. C'est normal sur des sessions longues. Faites des pauses, évitez de générer en continu, restez branché pour l'usage intensif.
Le modèle répond à côté
Normal pour un très petit modèle sur une tâche complexe. Simplifiez la demande ou montez d'une taille si votre RAM le permet.
Téléchargement bloqué
Les fichiers GGUF sont volumineux. Restez en Wi-Fi et évitez de mettre l'app en arrière-plan pendant le téléchargement.

#Pour aller plus loin

Le mobile est parfait pour l'usage nomade et confidentiel, mais pour les tâches lourdes vous voudrez une vraie machine. Ces guides du site prolongent celui-ci :

Faire tourner un LLM en local sur Android
L'équivalent côté Android : PocketPal, MLC Chat et llama.cpp via Termux, avec les mêmes contraintes de RAM.
Installer Ollama sur macOS (Apple Silicon)
Pour passer du téléphone au Mac : la mémoire unifiée M1/M2/M3/M4 pousse bien plus loin, jusqu'aux modèles 32B et au-delà.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Comprendre pourquoi Q4_K_M est le compromis recommandé sur mobile comme sur PC, et quand monter en Q5/Q8.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.