Avancé 10 minAgents

AutoGen en local : ce qui marche et ce qui casse

AutoGen construit des systèmes à partir d'agents qui se parlent entre eux. Branché sur un modèle local, il fonctionne — jusqu'à un point qui dépend presque entièrement de la taille du modèle et de la longueur de corde qu'on laisse à la conversation. En local, chaque tour de parole est une génération sur votre propre carte graphique : la discipline n'est pas dans le prompt, elle est dans les limites.

Par Mohamed Meguedmi·Màj 2026-09-25·Testé sur Windows, macOS, Linux

#Le modèle de conversation

Là où un cadriciel de chaînes demande de définir des étapes, AutoGen demande de définir des participants. Un agent assistant propose ; un agent mandataire vous représente, exécute éventuellement du code et renvoie le résultat ; une discussion de groupe fait intervenir plusieurs spécialistes sous un gestionnaire qui décide qui parle. Le comportement émerge de ces échanges.

C'est réellement puissant pour les tâches ouvertes — déboguer, itérer sur une analyse — et c'est exactement ce qui rend le coût imprévisible. Une chaîne fixe fait N appels au modèle. Une conversation en fait autant qu'il en faut, et « autant qu'il en faut » est décidé par le modèle dont vous doutez justement.

#Le brancher sur un modèle local

Le kit Copilote Local

Ce guide t'amène au modèle. Le kit t'amène au copilote qui code dans ton éditeur.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
  1. 01
    Servir le modèle
  2. 02
    Configurer le client
  3. 03
    Déclarer honnêtement les capacités
  4. 04
    Augmenter la fenêtre de contexte
!
Fixez un nombre maximum de tours avant le premier essai
Pas après. L'expérience inaugurale typique d'une conversation multi-agents en local consiste à découvrir, vingt minutes plus tard, que deux agents se félicitent mutuellement depuis le troisième message pendant que la carte graphique tourne à plein régime.

#L'exécution de code : à confiner

Le schéma qui rend AutoGen séduisant — un agent écrit du code, un mandataire l'exécute, l'erreur revient, l'agent corrige — est aussi celui qui fait tourner du code écrit par un modèle sur votre machine. On l'exécute dans un conteneur, sans identifiants, sans réseau si la tâche ne l'exige pas, jamais contre votre dossier personnel. Et tout contenu récupéré depuis l'extérieur — un ticket, une page web, un fichier de documentation — doit être considéré comme potentiellement hostile.

#La taille du modèle, encore

Ce qui se passe réellement dans une conversation
Classe de modèleComportement
3 à 8 milliardsMessages fluides, appels d'outils peu fiables, aucune discipline d'arrêt. Boucle.
12 à 14 milliardsLes échanges à deux agents aux rôles nets fonctionnent ; les discussions de groupe divaguent.
24 à 32 milliardsLe plancher praticable pour les discussions de groupe et les boucles d'exécution de code.
70 milliards et plusComportement le plus proche du cloud, assez lent pour que les longues conversations deviennent du traitement par lots.

Préférez des modèles entraînés à l'appel d'outils et à la sortie structurée. C'est le même plafond que rencontrent tous les cadriciels d'agents locaux : la prose est facile, les formats stricts ne le sont pas.

#AutoGen ou CrewAI

Deux modèles mentaux différents
Vous voulezPrenez
Des rôles définis, des passages de relais ordonnés, un coût prévisibleCrewAI
Une conversation ouverte, de l'itération, des boucles corriger-réessayerAutoGen
Un graphe explicite avec un état que vous contrôlezUn cadriciel orienté graphe
Un seul agent qui modifie un dépôtUn agent de code dédié

#FAQ

AutoGen fonctionne-t-il avec Ollama ?+
Oui, via le point d'accès compatible OpenAI : adresse de base, nom du modèle et clé factice. Pour plusieurs agents simultanés, un serveur conçu pour la concurrence se comporte nettement mieux.
Pourquoi mes agents parlent-ils sans fin ?+
Aucune condition d'arrêt efficace, et souvent un modèle trop petit pour la reconnaître. Fixez un nombre maximum de tours, définissez une phrase d'arrêt explicite, et donnez un modèle plus grand au rôle de gestionnaire.
Est-il prudent de laisser un agent exécuter du code ?+
Uniquement dans un conteneur, sans identifiants et avec un accès réseau restreint. L'exécuteur lance du code écrit par un modèle qui a peut-être lu du texte contrôlé par un tiers.
Quel est le plus petit modèle utilisable ?+
Autour de 12 à 14 milliards de paramètres pour des échanges simples à deux agents, et 24 à 32 milliards pour des discussions de groupe ou des boucles de code.
AutoGen ou CrewAI ?+
CrewAI pour des rôles définis et des passages de relais prévisibles ; AutoGen pour la conversation ouverte et la résolution itérative. Les deux sont aussi sensibles l'un que l'autre à la qualité du modèle en local.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.