
Synapse開発日記: AIエージェントの回答品質を継続的にテストする
エンジニアの佐野です。Synapse という社内 AI エージェントを運用しています。Synapse のような AI エージェントは LLM やプロンプト、セマンティックレイヤーの変更によって回答品質が急に落ちることがあります。そこで今回は、Synapse の回答品質を継続的に評価するために、SQL の Execution Accuracy、参照テーブルの完全一致、自然言語回答の Rubric 評価を組み合わせたテスト基盤を作った話を書きます。目的は LLM の回答を100%正しくすること、ではなく、利用者にとって困るデグレを早く検知すること、です。 生成 AI は出力に不確実性を孕んでおり、
まだブックマークされていません
X に入る文: Synapse開発日記: AIエージェントの回答品質を継続的にテストする