同じ言語モデルを異なるエージェントフレームワークに組み込むと、結果が大きく異なることがよくあります。このばらつきは通常、モデル自体ではなく、プロンプト、ツールスキーマ、メモリ、実行ループを定義するハーネス(周辺システム)に起因します。エンジニアは、実際の原因がハーネスの設計不良であるにもかかわらず、モデルに問題を帰属させがちです。この記事では、モデルは推論と生成を担当し、ハーネスはコンテキスト、ツールアクセス、対話パターンを制御するという明確な境界を提案します。各層を個別にテストすることで、チームはボトルネックを特定し、エージェントの信頼性を向上できます。この考え方は、本番グレードのエージェントを構築するすべての人にとって不可欠であり、ハーネスの調整で解決できる問題にファインチューニングの労力を無駄にすることを防ぎます。
エージェントのパフォーマンス問題を、モデル能力とハーネス設計の分離によってデバッグする実践的フレームワーク。