AI快讯 / AI 开源项目

llm-eval-harness

A tiny, dependency-free Python harness for scoring LLM answers against a gold set (exact / contains / numeric matching, CI-friendly).

原文来源AI 开源 Releases
查看官方原文

A tiny, dependency-free Python harness for scoring LLM answers against a gold set (exact / contains / numeric matching, CI-friendly).