LLM en local sur iPhone et iPad : apps et modèles qui tournent vraiment
Faire tourner un LLM local sur iPhone, c'est possible et ça marche vraiment : les puces Apple Silicon (série A et M) et le framework MLX permettent d'exécuter des modèles de 1 à 8 milliards de paramètres hors ligne, directement sur l'appareil. Ce guide fait le tri entre les apps qui tiennent leurs promesses, explique ce que la RAM change réellement selon votre iPhone ou iPad, et pose les vrais repères de performance — sans marketing.
#Pourquoi faire tourner un LLM local sur iPhone
Un LLM local sur iOS exécute tout le calcul sur votre appareil : aucun serveur, aucun abonnement, aucune donnée qui quitte le téléphone. C'est l'inverse d'une app comme ChatGPT, qui envoie chaque message vers le cloud. Les raisons de vouloir ça sont concrètes : confidentialité totale (notes médicales, brouillons, code), fonctionnement en avion ou sans réseau, et zéro coût récurrent une fois le modèle téléchargé.
La contrepartie est réelle : un iPhone n'a ni la mémoire ni la puissance d'un PC équipé d'une RTX 4070. On ne fait pas tourner un modèle 70B dans sa poche. Mais un 3B correctement quantifié suffit largement pour résumer un texte, reformuler un mail, répondre à des questions simples ou traduire — le tout hors ligne et instantanément accessible.
#Apple Silicon, MLX et Neural Engine
Les iPhone et iPad modernes partagent l'architecture Apple Silicon avec les Mac : une puce système (série A sur iPhone, série M sur iPad Pro) et surtout une mémoire unifiée partagée entre CPU, GPU et Neural Engine. C'est ce pool de RAM commun qui rend l'inférence LLM possible sur mobile — le modèle est chargé une fois et accessible par tous les cœurs sans copie.
MLX est le framework de machine learning d'Apple, pensé pour cette mémoire unifiée. Les apps iOS sérieuses l'utilisent (ou llama.cpp compilé avec Metal) pour exploiter le GPU de la puce. C'est là que se fait l'essentiel du calcul d'inférence : le GPU Metal, pas le CPU seul.
- Mémoire unifiée
- CPU, GPU et ANE partagent la même RAM. C'est le facteur limitant n°1 pour la taille de modèle que vous pouvez charger.
- GPU Metal
- Fait tourner l'inférence via MLX ou llama.cpp. C'est ce qui détermine vos tokens par seconde.
- Neural Engine (ANE)
- Puissante mais spécialisée. Peu exploitée pour la génération de texte LLM à ce jour.
#Prérequis et RAM par appareil
Sur iOS, la RAM est le seul chiffre qui compte vraiment, et Apple ne la met pas en avant. C'est pourtant elle qui décide si un modèle se charge ou fait crasher l'app. Voici les repères pour les appareils récents.
- iPhone 15 / 15 Plus
- 6 Go de RAM. Confortable pour du 1B–3B en Q4. Un 3B tourne, un 7B est à la limite et laisse peu de marge au système.
- iPhone 15 Pro / 16 / 16 Pro
- 8 Go. Le sweet spot mobile : 3B fluide, 7B–8B jouable en Q4 avec un contexte modéré.
- iPhone 17 Pro
- 12 Go (gamme Pro récente). Marge réelle pour un 7B–8B confortable et des contextes plus longs.
- iPad Pro M4
- 16 Go ou plus selon config. La meilleure cible iOS : 8B fluide, et des modèles plus gros deviennent envisageables.
Les ordres de grandeur mémoire d'un modèle quantifié Q4 sont les mêmes que sur desktop : un 3B pèse environ 2 Go, un 7B environ 5 Go, un 8B un peu plus. Ajoutez la mémoire du contexte (KV cache), qui grandit avec la longueur de conversation. C'est pour ça qu'un contexte long peut faire tomber une app qui démarrait pourtant bien.
#Les apps iOS qui tiennent la route
L'App Store regorge d'apps « IA » qui ne sont que des façades vers le cloud. Pour du vrai local, il faut une app qui télécharge le modèle sur l'appareil et l'exécute avec MLX ou llama.cpp. Voici les valeurs sûres.
- PocketPal AI
- Gratuite et open source. Télécharge des modèles GGUF depuis Hugging Face et les exécute via llama.cpp. Interface chat simple, réglages de contexte et de température. Le point de départ recommandé.
- LLM Farm
- Open source, très paramétrable. Supporte de nombreux formats et permet de régler finement l'inférence. Plus technique, idéale pour tester différents modèles.
- Enclave / MLX-based apps
- Apps s'appuyant sur MLX, le framework Apple. Bonnes performances sur Apple Silicon récent, souvent orientées confidentialité.
- Private LLM
- App payante, propose des modèles quantifiés optimisés et une expérience clé en main. Pas de configuration à faire, tout est packagé.
#Installer et lancer un modèle : pas à pas
L'exemple ci-dessous utilise PocketPal AI, gratuite et représentative du flux général. La logique est la même dans les autres apps.
- 01Installer l'appTéléchargez PocketPal AI depuis l'App Store. Aucun compte requis, aucune connexion à un serveur.
- 02Choisir un modèleOuvrez la bibliothèque de modèles intégrée. L'app propose des modèles adaptés au mobile (Llama 3.2 3B, Qwen2.5 3B, Gemma 3 1B/4B, Phi-4-mini). Commencez petit : un 1B ou 3B en Q4.
- 03TéléchargerLancez le téléchargement (quelques centaines de Mo à ~2 Go selon la taille). Faites-le en Wi-Fi. Le fichier reste stocké localement sur l'appareil.
- 04Charger le modèleSélectionnez le modèle téléchargé pour le charger en mémoire. Si l'app se ferme ici, c'est un manque de RAM : choisissez plus petit ou fermez les autres apps.
- 05Discuter hors ligneOuvrez un chat et posez une question. Activez le mode avion pour vérifier : tout continue de fonctionner, la preuve que rien ne sort de l'appareil.
Pour les curieux qui veulent la voie la plus brute, il est aussi possible de compiler llama.cpp soi-même, mais iOS ne permet pas d'exécuter du code arbitraire hors d'une app signée : en pratique, passer par une app dédiée est la seule voie réaliste pour la grande majorité des utilisateurs.
#Quels modèles choisir selon la RAM
Le bon modèle dépend d'abord de votre appareil. Voici des recommandations concrètes, du plus modeste au plus capable, tous en quantization Q4.
- iPhone 15 / 15 Plus (6 Go)
- Gemma 3 1B ou Llama 3.2 1B pour la fluidité ; Qwen2.5 3B ou Llama 3.2 3B pour plus de qualité. Restez sur des contextes courts.
- iPhone 16 / 16 Pro (8 Go)
- 3B en usage quotidien fluide. Un 7B–8B (Llama 3.1 8B, Qwen2.5 7B) tourne en Q4 avec un contexte modéré — plus lent mais nettement plus capable.
- iPhone 17 Pro (12 Go)
- 7B–8B confortable, contextes plus longs, et modèles de raisonnement légers envisageables.
- iPad Pro M4 (16 Go+)
- 8B fluide en usage réel ; les modèles jusqu'à ~14B deviennent testables, avec une vitesse qui reste correcte grâce au GPU M4.
Sur le français, Gemma 3 et les modèles Qwen2.5 s'en sortent bien pour leur taille. Pour du résumé, de la reformulation et des réponses courtes, un 3B suffit. Pour du raisonnement ou du code plus sérieux, la limite du mobile se fait sentir vite — c'est le moment de basculer vers une machine à la maison.
#Confidentialité totale : rien ne sort de l'appareil
C'est l'argument massue du local sur mobile. Une fois le modèle téléchargé, aucune requête réseau n'est nécessaire pour discuter. Vos prompts, vos documents, vos brouillons restent sur l'iPhone. Aucune télémétrie de conversation, aucun entraînement sur vos données, aucun risque de fuite serveur.
- Vérifiez en mode avion
- Le test le plus simple : coupez tout réseau et vérifiez que le chat fonctionne toujours. S'il marche hors ligne, rien ne transite.
- Attention aux apps hybrides
- Certaines apps « IA » basculent silencieusement vers le cloud quand le modèle local échoue. Préférez les apps 100 % locales et open source pour lever le doute.
- Données sensibles
- Notes de santé, documents pro sous NDA, informations personnelles : le local est le seul moyen d'être certain qu'elles ne quittent jamais votre appareil.
#Dépannage et astuces
- L'app crashe au chargement du modèle
- Manque de RAM. Fermez toutes les autres apps, choisissez un modèle plus petit (3B au lieu de 7B) ou une quantization plus légère (Q4 au lieu de Q5/Q8).
- Réponses très lentes
- Réduisez la longueur du contexte et le nombre de tokens générés. Vérifiez aussi la chaleur : un iPhone chaud throttle et ralentit l'inférence.
- L'iPhone chauffe et la batterie fond
- L'inférence sollicite le GPU à fond. C'est normal sur des sessions longues. Faites des pauses, évitez de générer en continu, restez branché pour l'usage intensif.
- Le modèle répond à côté
- Normal pour un très petit modèle sur une tâche complexe. Simplifiez la demande ou montez d'une taille si votre RAM le permet.
- Téléchargement bloqué
- Les fichiers GGUF sont volumineux. Restez en Wi-Fi et évitez de mettre l'app en arrière-plan pendant le téléchargement.
#Pour aller plus loin
Le mobile est parfait pour l'usage nomade et confidentiel, mais pour les tâches lourdes vous voudrez une vraie machine. Ces guides du site prolongent celui-ci :
- Faire tourner un LLM en local sur Android
- L'équivalent côté Android : PocketPal, MLC Chat et llama.cpp via Termux, avec les mêmes contraintes de RAM.
- Installer Ollama sur macOS (Apple Silicon)
- Pour passer du téléphone au Mac : la mémoire unifiée M1/M2/M3/M4 pousse bien plus loin, jusqu'aux modèles 32B et au-delà.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Comprendre pourquoi Q4_K_M est le compromis recommandé sur mobile comme sur PC, et quand monter en Q5/Q8.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.