Skip to main content

Crate lc_evaluation

Crate lc_evaluation 

Source
Expand description

Evaluation 模块 - LLM 应用评测

提供 Evaluator trait、内置评测器、数据集加载与批量运行器, 用于量化 prompt/模型改动的效果。

核心类型:

  • EvalError / Score / Example / Dataset / Evaluator / Predictor
  • EvalRunner 与报告 Report
  • 内置评测器: ExactMatch / StringDistance / EmbeddingSimilarity / LLMAsJudge
  • 其它评测器: Bleu / Faithfulness / PairwiseJudge / ContainsKeyword / RegexMatch

§示例

use lc_evaluation::{EvalRunner, ExactMatch, StringDistance, Dataset, Example};
let dataset = Dataset::new(vec![Example::new("2+2?", "4")]);
let runner = EvalRunner::new(vec![Box::new(ExactMatch), Box::new(StringDistance)]);
// let report = runner.run(&dataset, &predictor).await?;

Structs§

Bleu
BLEU 评测器(默认 BLEU-4)。
ContainsKeyword
关键词包含评测器:检查预测是否包含指定关键词。
Dataset
数据集
EmbeddingSimilarity
EvalRunner
批量运行器
ExactMatch
Example
评测样例
Faithfulness
忠实度评测器(幻觉检测):回答有多忠于参考上下文。
LLMAsJudge
LengthCheck
长度检查评测器:预测长度(按字符)是否落在 [min, max] 范围。
PairwiseJudge
成对比较评测器(用 LLM 当裁判,二选一)。
RegexMatch
正则匹配评测器:检查预测是否匹配正则。
Report
评测报告
Score
评测分数(0.0–1.0,1.0 为最佳)
StringDistance

Enums§

EvalError
评测错误
Verdict
成对比较结果

Traits§

Evaluator
评测器 trait
Predictor
预测器 trait(待评测的对象:LLMChain / Agent 等)