Skip to main content
Weave の評価でモデルをスコア付けする場合、絶対値のメトリクス (たとえば、Model A が 9/10、Model B が 8/10) は、相対的なメトリクス (たとえば、Model A のほうが Model B より優れている) よりも、通常は付与しにくくなります。ペアワイズ評価 を使用すると、2 つのモデルの出力を相対的に順位付けして比較できます。この手法は、テキスト生成、要約、質問応答のような主観的なタスクで、どのモデルの性能が優れているかを判断したい場合に役立ちます。ペアワイズ評価では、特定の入力に対してどのモデルが最適かを示す、相対的な選好順位を取得できます。
この方法は回避策であり、今後のリリースで変更される可能性があります。ペアワイズ評価をサポートする、より堅牢な API を提供する予定です。
次のコードサンプルは、PreferenceScorer という class-based scorer を作成して、Weave でペアワイズ評価を実装する方法を示しています。PreferenceScorer は 2 つのモデル ModelAModelB を比較し、入力テキスト内の明示的なヒントに基づいて、モデル出力の相対スコアを返します。
この評価を実行すると、PreferenceScorer の結果に基づく ModelAModelB の相対的な選好順位が得られます。
評価