著者は、基本的なループは正しいが不十分であり、それを単独のパイロットと、プランナー、並行飛行隊、燃料予算、事後レビューを備えた完全な航空作戦と比較している。この投稿は、小さなテスト可能なプリミティブの合成を使用して基本ハーネスの各コンポーネントをアップグレードする:Pydantic検証付きの型付きツール、並列実行のためのプランDAG、取得予算下の階層化メモリ、検証階層、多次元予算、トレーサー、すべてを薄いオーケストレーターで配線する。設計は役割をプランナー、ワーカー、クリティックに分割し、単一のプロンプトに過負荷をかけないようにする。例として、投稿は都市のリストを受け取り、人口、タイムゾーン、物語の要約に関するレポートを生成する都市比較エージェントを構築する。タスクは独立したルックアップ(3都市で9回のツール呼び出し)に分解され、並列実行できるが、最終レポートはすべてのルックアップの完了に依存する。ツールには異なるコストがある:人口とタイムゾーンにはインメモリ辞書読み取り、要約と集約にはLLM呼び出しがあり、現実的な予算圧力を生み出す。再現性のため、ルックアップツールはモック辞書CITY_FACTSを使用し、LLMベースの部分は実際のAnthropicモデルまたは決定論的モックプロバイダーに対して実行できる。モックプロバイダーは役割認識応答(標準プラン、テンプレート化された要約、ルールベースの判定)を返し、オーケストレーションのバグとモデルの計画問題を分離する。Pydanticモデル付きの型付きツールは、実行時検証、ツール使用API用のJSONスキーマ、プランナー用のドキュメント、コスト会計フックを提供し、高価な呼び出しの前にフェイルファスト検証を可能にする。投稿は、評価スイート、取得ベンチマーク、専門ワーカープールが将来の投稿で取り上げられることに言及している。