作者认为,基本循环是正确的但不够充分,将其比作孤胆飞行员与拥有规划者、并行中队、燃料预算和事后审查的全面空中战役。该文章通过组合小型、可测试的原语来升级基本框架的每个组件:带有Pydantic验证的类型化工具、用于并行执行的计划DAG、在检索预算下的分层内存、验证层级、多维预算以及追踪器,所有这些都由一个轻量级编排器连接。设计将角色分为规划者、执行者和批评者,以避免单个提示过载。为说明问题,文章构建了一个城市比较代理,它接收城市列表并生成关于人口、时区和叙述摘要的报告。任务分解为独立的查找(三个城市九次工具调用),可以并行运行,而最终报告依赖于所有查找完成。工具具有不同的成本:内存字典读取用于人口和时区,LLM调用用于摘要和聚合,从而产生现实的预算压力。为了可重复性,查找工具使用模拟字典CITY_FACTS,而LLM支持的部分可以针对真实的Anthropic模型或确定性模拟提供程序运行。模拟提供程序返回角色感知的响应——规范计划、模板化摘要和基于规则的裁决——以将编排错误与模型规划问题分开。带有Pydantic模型的类型化工具提供运行时验证、用于工具使用API的JSON Schema、供规划者使用的文档以及成本核算挂钩,从而在昂贵调用之前实现快速失败验证。文章指出,评估套件、检索基准和专业化工作池将在未来的文章中介绍。