大喜利で理解するLLM as a Judge

アプリのAI機能が増えるほど、その出力をどのように評価するかが難しい課題になりつつあります。 明確な正解がある処理であればテストで品質を担保できますが、「回答の良し悪し」のような定性的な評価を機械的に測ることは容易ではありません。 そうした評価に使える手法の一つに、「LLM as a Judge」というものがあ…