Weave for Agents はパブリック プレビューです。一般提供前に、機能、API、Agents view UI は変更される可能性があります。
Get started
- https://wandb.ai にアクセスし、project を選択します。
- サイドバー メニューで Agents を選択し、project に保存されているすべてのエージェントとの会話を表示します。
- タブバーで シグナル を選択します。

主要な用語
- Turn: ユーザーとエージェントの1往復のやり取りです。
- Rating: 一致したスパンに割り当てられる、0.0〜1.0の数値スコアです。
- Tags: 一致したスパンに割り当てられるラベルです。たとえば、“user-frustration” や “nsfw” などがあります。
シグナルの表
時間範囲セレクターと Filter バーを使用して、Scorer、エージェント、スコア範囲、または期間で結果を絞り込みます。Score volume タイムラインには、Weave が評価またはタグ付けしたシグナルの件数が表示されます。これは表に表示されている行を反映しており、タイムライン上でドラッグしてフィルターできます。
新しいシグナルを作成する
Scorer の種類
- Rating: 一致した各 span に 0〜1 のスコアを割り当てます。
- Tags: 一致した各 span に最大 10 個のタグを割り当てます。シグナル UI では、少なくとも 1 つのタグに一致した span の行のみが表示されるため、出力が表示されなくても Tags Scorer は正常に実行されている可能性があります。
一致するターンのみをスコアリング
Agent name、Operation name、Tool name、または Request model などで絞り込めます。Weave では、複数のフィルターを AND 条件で組み合わせます。すべてのターンをスコアリングするには、フィルター行の末尾にある x を選択して、そのフィルターを削除します。
プロンプトテンプレート
{input_messages}、{output_messages}、{system_instructions} などのテンプレート変数を展開します。
評価テンプレート
Scorer名
詳細設定
- 推論モデル: スコアリングに使用する LLM です。利用可能な場合は、Serverless Inference をデフォルトとして使用することをおすすめします。
- サンプル率: トラフィックの多いエージェントでは、サンプル率を設定すると、すべてのターンではなく一部のターンのみをスコアリングしてコストを削減できます。