pub fn evaluate_retrieval(
cases: &[EvaluationCase],
predictions: &[RankedPrediction],
cutoffs: &[usize],
) -> Result<EvaluationReport>Expand description
Scores ranked evidence retrieval without an LLM judge.
The same metrics are usable for LoCoMo dialog evidence, LongMemEval
session evidence, and coding-agent provenance. Missing predictions count as
misses; unknown and duplicate case identifiers are rejected.
ยงErrors
Rejects empty cutoffs, duplicate identifiers, empty relevance sets, and predictions for unknown cases.