9/10、Model B が 8/10) は、相対的なメトリクス (たとえば、Model A のほうが Model B より優れている) よりも、通常は付与しにくくなります。ペアワイズ評価 を使用すると、2 つのモデルの出力を相対的に順位付けして比較できます。この手法は、テキスト生成、要約、質問応答のような主観的なタスクで、どのモデルの性能が優れているかを判断したい場合に役立ちます。ペアワイズ評価では、特定の入力に対してどのモデルが最適かを示す、相対的な選好順位を取得できます。
次のコードサンプルは、PreferenceScorer という class-based scorer を作成して、Weave でペアワイズ評価を実装する方法を示しています。PreferenceScorer は 2 つのモデル ModelA と ModelB を比較し、入力テキスト内の明示的なヒントに基づいて、モデル出力の相対スコアを返します。
PreferenceScorer の結果に基づく ModelA と ModelB の相対的な選好順位が得られます。
評価