Monde
Systèmes Basés Sur LLM Au-delà D'une Boucle Naïve Vers Une Architecture de Niveau Production

L'auteur soutient qu'une boucle de base est correcte mais insuffisante, la comparant à un pilote solitaire par rapport à une campagne aérienne complète avec des planificateurs, des escadrons parallèles, des budgets de carburant et des débriefings. L'article améliore chaque composant d'un harnais de base en utilisant la composition de petites primitives testables des outils typés avec validation Pydantic, un DAG de plan pour l'exécution parallèle, une mémoire à plusieurs niveaux sous un budget de récupération, une hiérarchie de vérification, des budgets multidimensionnels et un traceur, le tout relié par un orchestrateur mince. La conception divise les rôles en Planificateur, Exécutant et Critique pour éviter de surcharger un seul prompt.
Pour illustrer, l'article construit un agent de comparaison de villes qui prend une liste de villes et produit un rapport sur la population, le fuseau horaire et des résumés narratifs. La tâche se décompose en recherches indépendantes (neuf appels d'outils pour trois villes) qui peuvent s'exécuter en parallèle, tandis que le rapport final dépend de la réalisation de toutes les recherches. Les outils ont des coûts variables lectures de dictionnaire en mémoire pour la population et le fuseau horaire, et appels LLM pour les résumés et l'agrégation, créant une pression budgétaire réaliste.
Pour la reproductibilité, les outils de recherche utilisent un dictionnaire simulé, CITY_FACTS, et les parties basées sur LLM peuvent s'exécuter contre un vrai modèle Anthropic ou un fournisseur simulé déterministe. Le fournisseur simulé renvoie des réponses sensibles au rôle un plan canonique, des résumés modèles et des verdicts basés sur des règles, pour séparer les bugs d'orchestration des problèmes de planification du modèle. Les outils typés avec des modèles Pydantic fournissent une validation à l'exécution, un schéma JSON pour les API d'utilisation d'outils, une documentation pour le planificateur et des hooks de comptabilité des coûts, permettant une validation rapide avant les appels coûteux. L'article note qu'une suite d'évaluation, des benchmarks de récupération et des pools de travailleurs spécialisés seront couverts dans un futur article.
Source : Hacker News





