これはインタラクティブなノートブックです。ローカルで実行することも、以下のリンクを利用することもできます:
Evaluation の入力ソースとして使用する方法を紹介します。最後には、HuggingFace データセット内の行をインデックスで参照し、各行をモデルが想定する形式に前処理して、スコア付けされた結果を Weave でトラッキングする評価パイプラインを構築できます。このパターンは、既存の HuggingFace データセットを、まず Weave ネイティブのデータセットに変換することなくモデル評価に使いたい場合に便利です。
このガイドでは、HuggingFace データセットを Weave の評価で使用するための回避策を紹介します。この方法は現時点でも利用できますが、外部データセット向けのよりシームレスなインテグレーションも現在開発中です。
セットアップとインポート
HuggingFace データセットを読み込んで準備する
インデックスでは、各行が一意の ID を持つように、
hf_id とあわせて hf_hub_name をエンコードしてください。Weave は、この一意のダイジェスト値を使用して、評価中に特定のデータセットエントリをトラッキングし、参照します。処理関数と評価関数を定義する
preprocess_example: インデックス参照を、評価に必要な実際のデータに変換します。hf_eval: モデルの出力をどのようにスコアリングするかを定義します。function_to_evaluate: 実際に評価対象となる関数またはモデルです。
評価を作成して実行します
Evaluation に組み込み、モデルに対して実行します。hf_index の各エントリに対して、Weave は次の手順を実行します。
preprocess_exampleが HuggingFace データセットから対応するデータを取得します。- Weave は前処理済みのデータを
function_to_evaluateに渡します。 hf_evalが出力をスコアリングします。- Weave は結果をトラッキングします。