IA locale pour mairies et collectivités territoriales
Une mairie traite chaque jour des courriers d'administrés, des projets de délibération, des comptes rendus et des demandes d'état civil. Ce sont des données personnelles, parfois sensibles, que la collectivité a l'obligation de protéger. L'IA pour collectivités territoriales telle que la vendent les éditeurs passe presque toujours par un cloud américain, ce qui pose un problème juridique et politique. Ce guide montre comment déployer un LLM open-weight sur un serveur de la collectivité, quels usages en tirer dès la première semaine, et combien ça coûte réellement, du secrétariat de mairie de 2 000 habitants à l'intercommunalité de 200 agents.
#Pourquoi une IA locale en collectivité territoriale
Le problème d'une collectivité n'est pas d'avoir accès à une IA. Les agents en ont déjà une : ChatGPT sur le téléphone personnel, Copilot dans la suite bureautique, un assistant dans la messagerie. Le problème est que ces usages se font sans cadre, avec des données d'administrés copiées dans des services dont la collectivité ne maîtrise ni l'hébergement, ni la conservation, ni la réutilisation. Le DPO (délégué à la protection des données, obligatoire pour toute autorité publique depuis 2018) n'a aucune visibilité dessus.
Un LLM auto-hébergé inverse la logique. Le modèle tourne sur une machine dans les locaux de la collectivité ou chez son hébergeur habituel. Aucun texte ne sort du réseau. Le responsable de traitement reste la collectivité, sans sous-traitant supplémentaire à contractualiser, sans transfert hors Union européenne, sans clause à négocier avec un géant qui ne négocie pas. Et le coût est un investissement matériel ponctuel, pas un abonnement par agent qui gonfle avec l'usage.
Ce n'est pas une solution universelle. Un modèle local de 8 à 30 milliards de paramètres est moins brillant que les meilleurs modèles propriétaires sur les tâches ouvertes. Mais les tâches d'une mairie sont rarement ouvertes : reformuler un courrier, structurer une délibération, résumer un rapport de 40 pages, répondre à une question sur le règlement du cimetière. Sur ces tâches cadrées, avec un bon prompt et les bons documents, un modèle de la taille de Mistral Small ou Qwen3 14B fait le travail.
#Les cas d'usage qui marchent en mairie
Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
Le meilleur moyen de rater un projet d'IA en collectivité est de promettre un « assistant citoyen » qui répond à tout sur le site de la ville. Le meilleur moyen de le réussir est de commencer par les tâches internes répétitives où les agents perdent du temps et où l'erreur est facile à détecter. Voici celles qui fonctionnent bien avec un modèle local.
- Courriers aux administrés
- Réponse à une demande de dérogation scolaire, accusé de réception d'une réclamation, notification de décision. L'agent donne les éléments factuels et le sens de la réponse, le modèle rédige dans le registre administratif, l'agent relit et signe. Le gain se mesure sur les courriers à faible enjeu, qui sont la majorité.
- Projets de délibération
- Passer d'une note de service ou d'un devis à un projet de délibération structuré (visas, considérants, dispositif). Le modèle respecte bien la forme si on lui fournit deux ou trois délibérations existantes comme modèles. Le fond reste au secrétariat général et au juriste.
- Comptes rendus et synthèses
- Résumer un rapport d'un bureau d'études, extraire les décisions d'un compte rendu de commission, produire une synthèse d'une consultation publique de 300 contributions. Un modèle avec un contexte de 32 000 tokens absorbe un document d'une centaine de pages.
- Accueil et standard
- Aider l'agent d'accueil à répondre vite et juste : horaires de la déchetterie, pièces à fournir pour un acte de naissance, tarifs du périscolaire. Cela passe par un RAG (retrieval-augmented generation) qui s'appuie sur les documents officiels de la collectivité, pas sur la mémoire du modèle.
- Marchés publics
- Première relecture d'un CCTP pour repérer les incohérences, reformulation de critères d'analyse, aide à la rédaction du rapport d'analyse des offres. Le modèle ne décide rien, il accélère la lecture.
- Traduction et accessibilité
- Traduire une notice pour des administrés non francophones, réécrire un courrier en langage clair (FALC, facile à lire et à comprendre). Les modèles récents sont solides en français et dans les principales langues européennes.
Deux cas à écarter au départ. Le premier est toute décision individuelle automatisée (attribution d'une aide sociale, calcul d'un tarif au quotient familial) : le code des relations entre le public et l'administration impose d'informer l'usager d'un traitement algorithmique et d'en expliquer les règles, et le règlement européen sur l'IA classe l'évaluation de l'accès aux prestations publiques essentielles parmi les systèmes à haut risque. Le second est l'agent conversationnel public exposé sur le site de la ville, qui exige une maturité (tests, supervision, gestion des dérives) que peu de collectivités ont au premier projet.
#Pourquoi le cloud américain coince pour une collectivité
L'argument n'est pas idéologique, il est juridique. Une collectivité est responsable de traitement au sens du RGPD. Quand elle utilise un service d'IA en ligne, l'éditeur devient sous-traitant et un contrat conforme à l'article 28 doit encadrer la relation : finalités, durées, sécurité, sous-traitants ultérieurs, sort des données en fin de contrat. Avec les grands services grand public, ce contrat est un contrat d'adhésion que la collectivité ne peut pas amender, et les conditions permettent souvent la conservation des échanges et, selon l'offre, leur utilisation pour améliorer le service.
- Transferts hors UE
- Un hébergement aux États-Unis est un transfert vers un pays tiers. Il repose aujourd'hui sur le cadre de protection des données UE-États-Unis (décision d'adéquation de juillet 2023), déjà contesté devant les juridictions européennes. Le précédent Schrems II (invalidation du Privacy Shield en 2020) montre que ce socle peut disparaître du jour au lendemain, et la collectivité doit alors justifier son traitement autrement.
- Cloud Act
- La loi américaine de 2018 permet aux autorités des États-Unis d'exiger d'un fournisseur soumis à leur droit la remise de données, où qu'elles soient stockées. Un hébergement dans un centre de données européen d'un fournisseur américain ne protège pas contre cette exigence. C'est précisément ce que le référentiel SecNumCloud de l'ANSSI cherche à exclure.
- Doctrine « cloud au centre »
- La circulaire du Premier ministre de 2021, actualisée en 2023, impose aux administrations de l'État d'héberger les données sensibles sur des offres qualifiées SecNumCloud et immunisées contre les législations extraterritoriales. Elle ne s'applique pas directement aux collectivités, mais elle fixe le niveau d'exigence auquel un élu ou un DPO peut se référer, et les préfectures s'en inspirent dans leurs échanges avec les collectivités.
- Analyse d'impact
- Le traitement de données d'administrés par une IA générative, à l'échelle d'une collectivité, entre dans les cas où une analyse d'impact relative à la protection des données (article 35 du RGPD) est fortement recommandée. Elle est bien plus simple à rédiger quand il n'y a ni transfert ni sous-traitant.
- Secret et données sensibles
- Les services sociaux (CCAS), la police municipale et l'état civil manipulent des données de santé, des infractions et des situations familiales. Ces catégories sont exclues des conditions d'usage de la plupart des services d'IA grand public, et leur envoi vers un tiers non contractualisé constitue une violation de données à notifier à la CNIL.
En auto-hébergement, la plupart de ces points disparaissent par construction. Il reste des obligations, et elles sont réelles : tenir le registre des traitements à jour avec ce nouvel outil, définir les durées de conservation des conversations, informer les agents, encadrer les usages par une charte. Mais ce sont des obligations que la collectivité sait déjà remplir pour ses autres logiciels.
#Prérequis et gouvernance
Avant d'acheter du matériel, trois décisions à prendre en réunion, pas devant un terminal.
- Qui porte le projet
- Un binôme : un porteur métier (directeur général des services, secrétaire général) et un référent technique (responsable informatique, ou le prestataire informatique de la commune, ou le service mutualisé de l'intercommunalité). Sans porteur métier, le projet reste un jouet du service informatique.
- Où tourne le serveur
- Dans la collectivité, dans le centre de données de l'intercommunalité ou du département, ou chez un hébergeur français. Les trois sont compatibles avec ce guide. Pour une petite commune, le service informatique mutualisé de la communauté de communes est souvent la meilleure option : un serveur, dix mairies.
- Quelles données entrent
- Décider à l'avance quels documents alimenteront le RAG (règlements, délibérations publiées, procédures internes) et ce qui n'y entrera pas (dossiers individuels du CCAS, données de la police municipale). Cette liste est le cœur de l'entrée au registre des traitements.
- Compétences
- Un technicien à l'aise avec Linux et Docker suffit pour l'installation et l'exploitation. Le RAG demande un peu plus de méthode (préparation des documents), pas plus de code.
- Réseau
- Le serveur doit être joignable depuis les postes des agents (réseau interne ou VPN) et ne doit jamais être exposé directement sur internet. Un reverse proxy avec authentification est le minimum si l'accès dépasse le réseau local.
Côté achat, une machine sous 40 000 € HT relève des marchés sans publicité ni mise en concurrence préalable, ce qui couvre toutes les configurations de ce guide. Il faut tout de même une demande de devis comparés et une justification du besoin au dossier. La plupart des configurations décrites plus bas s'achètent d'ailleurs sur le catalogue de l'UGAP ou auprès de l'assembleur habituel de la collectivité.
#Dimensionner serveur et budget
La question qui détermine tout est la taille du modèle que vous voulez servir, et donc la mémoire vidéo (VRAM) disponible. En quantification Q4_K_M, la plus courante, un modèle de 7 à 8 milliards de paramètres occupe environ 5 Go, un 14B environ 9 Go, un 24 à 32B entre 15 et 19 Go, un 70B environ 40 Go. Il faut ajouter la mémoire du contexte (les documents en cours de lecture), qui grimpe vite sur des textes longs. Le nombre d'agents simultanés compte moins qu'on l'imagine : dans une mairie, dix agents équipés génèrent rarement plus de deux ou trois requêtes en même temps.
Trois paliers couvrent la quasi-totalité des collectivités. Les fourchettes de prix ci-dessous sont des ordres de grandeur, à confirmer par devis : elles varient selon le fournisseur, la mémoire, le stockage et la garantie.
- Palier 1 : commune de moins de 5 000 habitants
- Un poste de travail ou un mini-serveur avec une carte à 12 ou 16 Go de VRAM (type RTX 4070, RTX 4080 ou équivalent), 32 Go de RAM, 1 To de SSD. Modèles cibles : Qwen3 8B ou 14B, Gemma 3 12B. Budget matériel indicatif de 1 500 à 2 500 € HT. Cinq à dix agents, rédaction et résumé, RAG sur les règlements de la commune.
- Palier 2 : ville moyenne ou intercommunalité
- Une station avec une carte à 24 Go (RTX 4090 ou équivalent professionnel), 64 Go de RAM, 2 To de SSD, ou un Mac Studio avec 64 Go de mémoire unifiée. Modèles cibles : Mistral Small 24B, Qwen3 32B en Q4, gpt-oss 20B. Budget indicatif de 3 500 à 6 000 € HT. Vingt à cinquante agents, tous les cas d'usage de ce guide.
- Palier 3 : grande collectivité ou service mutualisé départemental
- Un serveur rackable avec une ou deux cartes professionnelles à 48 Go (ou plus), alimentation redondante, intégré à la salle serveurs existante. Modèles cibles : 70B en Q4, ou plusieurs modèles spécialisés servis en parallèle. Budget indicatif à partir de 10 000 € HT, souvent 15 000 à 25 000 € HT avec le support constructeur. Plusieurs centaines d'agents, plusieurs collectivités membres.
À ces montants s'ajoutent l'électricité (une station avec une carte grand public consomme entre 300 et 500 W en charge, très peu au repos), quelques jours d'installation et de paramétrage par le référent technique ou un prestataire, et surtout le temps de formation des agents, qui est le vrai coût du projet. À titre de comparaison, un abonnement à un assistant d'IA propriétaire pour cinquante agents dépasse généralement le prix du palier 2 dès la première année, et se renouvelle chaque année.
#Déploiement pas à pas
Le déroulé ci-dessous suppose un serveur Linux (Ubuntu ou Debian) avec une carte NVIDIA et les pilotes installés. La stack est Ollama pour servir les modèles et Open WebUI pour l'interface avec comptes utilisateurs, historique et RAG intégré.
- 01Installer Ollama et le rendre accessible sur le réseauLe script officiel installe Ollama comme service systemd. Par défaut, il n'écoute que sur la machine elle-même (http://localhost:11434). Pour que l'interface, installée dans un conteneur, puisse le joindre, on le fait écouter sur toutes les interfaces, en s'assurant que le pare-feu du serveur bloque le port 11434 depuis l'extérieur.
- 02Télécharger un ou deux modèlesCommencez par un modèle de taille moyenne et un petit modèle rapide. Le premier pour la rédaction et la synthèse, le second pour les tâches courtes et l'accueil. Le téléchargement représente plusieurs gigaoctets, à prévoir hors des heures d'ouverture si la connexion de la mairie est modeste.
- 03Installer Open WebUIOpen WebUI s'installe en un conteneur Docker et se connecte à Ollama. Le premier compte créé est administrateur. Désactivez ensuite l'inscription libre et créez les comptes des agents à la main ou via l'annuaire (LDAP ou SSO sont pris en charge dans les réglages d'administration).
- 04Alimenter la base documentaireDans l'espace de travail d'Open WebUI, créez une collection par thème (règlements, délibérations, procédures RH) et déposez les PDF et documents Word. Préférez des documents propres, à jour, sans scan d'images. Reliez ensuite chaque collection à un modèle personnalisé avec un prompt système qui décrit le rôle attendu.
- 05Rédiger les prompts système par métierUn modèle personnalisé « Courrier administratif » avec la charte rédactionnelle de la collectivité, un « Délibération » avec la structure attendue et deux exemples, un « Accueil » relié à la collection des informations pratiques. Ces modèles apparaissent comme des outils prêts à l'emploi pour les agents, qui n'ont pas à savoir prompter.
- 06Sécuriser et sauvegarderReverse proxy avec certificat TLS devant Open WebUI, accès limité au réseau interne ou au VPN, sauvegarde quotidienne du volume de données d'Open WebUI (comptes, conversations, documents) et de la configuration. Inscrivez l'outil au registre des traitements avec une durée de conservation des conversations, et paramétrez la purge en conséquence.
Pour ne pas laisser le port 11434 ouvert à tout le réseau, restreignez-le au serveur lui-même et au conteneur avec le pare-feu (ufw ou nftables). Le guide du site sur la sécurisation d'un serveur Ollama détaille cette partie ainsi que la mise en place du reverse proxy. Si la collectivité dispose déjà d'un hyperviseur Proxmox, une machine virtuelle avec passage de la carte graphique est une bonne façon d'intégrer ce serveur à l'infrastructure existante.
#Accompagner les agents sans les remplacer
La crainte du remplacement est la première réaction dans un service quand on annonce une IA. Elle est légitime, et y répondre par des slogans ne marche pas. Ce qui marche est de dire précisément ce que l'outil fait et ne fait pas, et de le montrer sur le travail réel des agents.
- Le modèle propose, l'agent décide
- Aucun document produit par le modèle ne part sans relecture et signature humaine. Cette règle figure dans la charte d'usage, et le prompt système de chaque modèle personnalisé le rappelle en pied de réponse. Elle protège la collectivité (responsabilité) et l'agent (il reste l'auteur).
- Former sur les cas réels
- Deux heures par service, sur les courriers et dossiers de la semaine, pas sur des exemples génériques. L'objectif est que chaque agent reparte avec trois situations où l'outil lui fait gagner du temps, et deux où il ne faut pas l'utiliser.
- Expliquer les hallucinations
- Un modèle local invente des références juridiques, des articles de code et des chiffres avec la même assurance qu'une réponse juste. Les agents doivent savoir que toute référence légale produite par le modèle est à vérifier sur Légifrance, et que le RAG réduit ce risque sur les documents de la collectivité sans le supprimer.
- Rendre l'usage visible
- Une convention interne : mention « rédigé avec l'aide d'un assistant, relu par [agent] » dans les documents de travail, jamais dans les actes officiels. Elle dédramatise l'usage et facilite le contrôle.
- Associer les représentants du personnel
- L'introduction d'un outil d'IA touche à l'organisation du travail. Une information du comité social territorial (CST) avant le déploiement évite qu'il l'apprenne par la rumeur et transforme le projet en conflit.
- Mesurer sans surveiller
- Suivez le nombre d'utilisateurs actifs et les retours qualitatifs, pas la productivité individuelle. Les journaux de conversation servent au dépannage et à la conformité, pas à l'évaluation des agents, et la charte doit le dire.
Dans les collectivités qui ont procédé ainsi, l'adoption ne pose pas de problème : les agents adoptent volontiers un outil qui enlève la partie ingrate d'un courrier. Le point de vigilance est ailleurs : quelques agents s'en remettent trop au modèle et cessent de relire. La relecture croisée sur les premières semaines et un rappel régulier des hallucinations constatées sont les meilleurs garde-fous.
#Pièges et dépannage
- Réponses lentes ou saccadées
- Le modèle déborde de la VRAM et une partie tourne sur le processeur. Vérifiez avec ollama ps la répartition GPU/CPU. Prenez un modèle plus petit, une quantification plus agressive, ou réduisez la taille de contexte demandée par Open WebUI.
- Le RAG répond à côté
- Le plus souvent, les documents sont mal découpés (PDF scannés, tableaux, mises en page complexes). Convertissez-les en texte propre avant dépôt, supprimez les versions obsolètes des règlements, et testez chaque collection avec dix questions dont vous connaissez la réponse.
- Le modèle ne connaît pas le vocabulaire territorial
- Il ne sait pas ce qu'est un CCAS, une DETR ou une DSP dans votre contexte. Ajoutez un glossaire de la collectivité dans le prompt système ou dans une collection dédiée.
- Un agent a collé un dossier social dans une conversation
- Ce n'est pas une fuite hors de la collectivité, mais c'est un traitement hors périmètre. Supprimez la conversation, rappelez la charte, et si nécessaire ajustez les droits d'accès aux modèles par groupe d'utilisateurs dans Open WebUI.
- Mise à jour qui casse tout
- Figez les versions : tag de l'image Open WebUI, version d'Ollama, liste exacte des modèles. Testez les mises à jour sur une machine secondaire ou une machine virtuelle avant de toucher au serveur des agents.
- Le serveur est joignable depuis l'extérieur
- Contrôlez régulièrement qu'aucune redirection de port ou règle de pare-feu n'expose 11434 ou le port d'Open WebUI sur l'adresse publique de la mairie. Des milliers de serveurs Ollama ouverts sont recensés en permanence sur internet.
#Pour aller plus loin
Ce guide pose le cadre et le déploiement de base. Ces guides du site détaillent les briques que vous allez manipuler ensuite :
- Déployer un chatbot IA pour son équipe sur intranet
- Le détail du reverse proxy Nginx, de l'authentification, de la supervision et de la sauvegarde des conversations pour un déploiement Open WebUI multi-utilisateurs.
- Sécuriser son serveur Ollama
- Vérifier son exposition, ajouter une authentification, TLS et bonnes pratiques réseau. À lire avant d'ouvrir l'accès au-delà du réseau local.
- LLM local et RGPD : la conformité données privées
- Le cadre légal complet (RGPD, règlement européen sur l'IA, recommandations de la CNIL) pour documenter l'analyse d'impact et l'entrée au registre.
- RAG local avec Ollama sans coder
- Pour comprendre ce qui se passe quand vous déposez des documents dans une collection et améliorer la qualité des réponses de l'accueil.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour arbitrer entre un modèle plus gros en Q4 et un modèle plus petit en Q8 selon la VRAM du serveur acheté.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.