lc-evaluation 0.13.0

Evaluation framework for langchainrust — Evaluator trait, built-in evaluators, dataset runner
Documentation

Evaluation 模块 - LLM 应用评测

提供 Evaluator / PairwiseEvaluator trait、内置评测器、数据集加载与批量运行器, 用于量化 prompt/模型改动的效果。

核心类型:

  • EvalError / Score / Example / Dataset / Evaluator / Predictor
  • PairwiseEvaluator(成对比较,P1-1 与单点并列的一等公民)
  • EvalRunner 与报告 Report(含原文 + 标准差 + 失败清单)
  • 内置评测器: ExactMatch / StringDistance / EmbeddingSimilarity / LLMAsJudge
  • 其它评测器: Bleu / Faithfulness / PairwiseJudge / ContainsKeyword / RegexMatch

示例

use lc_evaluation::{EvalRunner, ExactMatch, StringDistance, Dataset, Example};
let dataset = Dataset::new(vec![Example::new("2+2?", "4")]);
let runner = EvalRunner::new(vec![Box::new(ExactMatch), Box::new(StringDistance)]);
// let report = runner.run(&dataset, &predictor).await?;