AIエージェントの評価を革新するMotorwayとAWSの取り組み
– Motorwayは、AIエージェントによる在庫検索の効率化を進め、従来の手作業を大幅に短縮しました。
– AWSとの協力により、エンドツーエンドの評価パイプラインを構築し、エージェントの正確性を50件に1件に向上させました。
– AIエージェントの評価は、ツール使用の正確さや推論の一貫性を多層的に確認する新しい方法で行われています。
– 本番運用での問題検知時間を数時間から数分に短縮し、業務の迅速化を実現しました。

MotorwayとAIエージェントの進化
英国のオンライン中古車マーケットプレイス、Motorwayは、AIを駆使した在庫検索エージェントの開発により、ディーラーの業務プロセスに革命を起こしています。最大8,000のディーラーが参加する日常的なオークションでは、ディーラーが自然言語で車両を検索できるようにし、生産性を大幅に高めました。特に、検索が自然言語で行えるようになったことが、時間と手間を大いに削減しています。
エージェント評価の課題と解決策
Motorwayは、AIエージェントの自信に満ちた応答が実際に正確であることを証明するために、AWSと協力してエージェント評価の構築に取り組みました。誤った判断はディーラーの信頼を損なうため、セマンティック検索の誤解や、複数ターンの会話での文脈のズレを最小化するための工夫が求められていました。
そこでMotorwayとAWSは評価パイプラインを構築し、誤った検索結果の割合を1/8から1/50に低減させ、問題の検出時間を数時間から数分に大幅に短縮しました。この実現には、特にStrands Agents SDK そしてAmazon Bedrock AgentCoreが重要な役割を果たし、AIエージェントを広範に管理運用できるシステムとなっています。
三層の評価フレームワーク
作成されたAI評価フレームワークは三層に分かれ、各層に特有の合否を基準にパスが設定されています。第一層では、ツールの使い方が95%を超える正確さであることが求められ、エージェントが正しいツールとパラメータで答えているか検証されます。第二層では、85%以上のしきい値で論理的な推論を評価し、第三層では90%以上の正確性で応答の有用性と正確性が検証されます。
このように細分化された評価を行うことにより、より安定した運用が可能とされ、ディーラーが提供するサービスの品質向上に貢献しています。
本番環境の監視とパフォーマンス向上
Motorwayは、実稼働環境でのパフォーマンスを向上させるため、本番時でも継続的にAIエージェントを監視しています。AgentCore Evaluationsはオープンテレメトリーの計装を通じて、正確なモニタリングを可能にし、不測の事態への迅速な対応力を提供しています。
これにより、デプロイ後の監視体制も強化され、セーフティネットがより堅固なものになっています。実装後の結果として、ツール選択の正確さは87%から98%に向上し、タスク完了率も大幅に改善されました。
まとめ
MotorwayとAWSの協力により、AIエージェントの評価と運用は著しく進化しました。これは、他の分野においても多くの示唆を与えるものであり、AI活用の最前線での重要性を示しています。エンドユーザーにとっては、信頼性の高いサービスが提供されることこそが、最も重要な価値と言えるでしょう。



