返回全部项目

LLM Evaluation Playbook

一套实践指南和 Python 小工具,把评测要求落实为明确考点、容差检查与可审阅的题包。

来源核对日期: 2026-09-12

EVALUATION / METHOD方法示意
01 / 定义可判定的任务

一个结论。 一条可查的依据。

01明确输入与交付物
02设定规则与数值容差
03隔离参考答案,检查题包
任务规范 → 评分规则 → 可运行的检查
01 / 问题背景

实际问题

同一考点被不同人理解成不同含义、舍入差异改变判分、参考答案混入模型输入,都会让评测结果失去可靠依据。

02 / 职责与参与

我的贡献

  • 主导任务设计要求,选择需要明确表达和自动检查的规则。
  • 借助 AI 起草文档与实现工具,再检查合成样例、判分边界和验证结果。
工作方式:产品主导,AI 辅助实现,逐步检查与迭代。
03 / 方案判断

关键选择与取舍

01

先写可观察的标准,再讨论分数

选择
区分硬性要求与分级质量维度,为判分写出具体锚点。
代价与取舍
模板只提供一种评分设计,实际题目仍应遵守所属评测的规则。
如何检查
评分规则检查器定位模糊表述,合成题目把考点与答案放在一起供人核对。
02

把容差写成数据

选择
明确使用绝对值、相对值、百分点、区间或集合规格。
代价与取舍
工具能执行已写明的范围,但无法替设计者判断范围是否合理。
如何检查
通过、失败和边界样例共同验证容差检查器。
03

同时检查答案与题包

选择
分别声明模型输入与评审资料,并一起检查必要文件及引用关系。
代价与取舍
文件名和表格规则能发现已知打包错误,不能识别所有语义层面的泄漏。
如何检查
题包检查器与合成样例和自动测试一起在 CI 中运行。
04 / 深入了解

查看成果样例

动手了解项目

看看一个答案为什么通过或不通过

SYNTH-SaaS-001 完全使用合成数据。这个公开教学样例展示裁判材料;真实评测包会将其与模型输入分开。

计算收入变化

计算下一季度的月度经常性收入(MRR),准确指出造成流失金额最多的两个群组,并说明扩张收入使用哪个时点的基数。

按群组合并两份公开 CSV;比率为 MRR 的小数比例。
群组MRR (USD)流失率扩张率
C1Enterprise1,800,0000.030.02
C2Growth1,200,0000.040.025
C3MidMarket900,0000.080.03
C4SMB Legacy700,0000.140.01
C5SMB New250,0000.060.04
C6Startup100,0000.090.05
C7Edu30,0000.050.02
C8Nonprofit20,0000.040.01

这项工作说明了什么

v0.2.0 公开了方法文档、可复用模板、三个命令行检查工具及一套完整的合成 SaaS 题目。17 项自动测试在 Python 3.9、3.11 和 3.12 的 CI 环境中运行。

从结论回到来源

查看原始依据

当前边界

  • 公开样例均为合成内容,不包含客户题目、评分细则或私密反馈记录。
  • 本地检查通过不等于题目质量、评审校准或模型能力已经获得验证。

工具与方法

PythonEvaluation designNumeric tolerancesTask validation