实际问题
同一考点被不同人理解成不同含义、舍入差异改变判分、参考答案混入模型输入,都会让评测结果失去可靠依据。
我的贡献
- 主导任务设计要求,选择需要明确表达和自动检查的规则。
- 借助 AI 起草文档与实现工具,再检查合成样例、判分边界和验证结果。
工作方式:产品主导,AI 辅助实现,逐步检查与迭代。
关键选择与取舍
01
先写可观察的标准,再讨论分数
- 选择
- 区分硬性要求与分级质量维度,为判分写出具体锚点。
- 代价与取舍
- 模板只提供一种评分设计,实际题目仍应遵守所属评测的规则。
- 如何检查
- 评分规则检查器定位模糊表述,合成题目把考点与答案放在一起供人核对。
02
把容差写成数据
- 选择
- 明确使用绝对值、相对值、百分点、区间或集合规格。
- 代价与取舍
- 工具能执行已写明的范围,但无法替设计者判断范围是否合理。
- 如何检查
- 通过、失败和边界样例共同验证容差检查器。
03
同时检查答案与题包
- 选择
- 分别声明模型输入与评审资料,并一起检查必要文件及引用关系。
- 代价与取舍
- 文件名和表格规则能发现已知打包错误,不能识别所有语义层面的泄漏。
- 如何检查
- 题包检查器与合成样例和自动测试一起在 CI 中运行。
查看成果样例
动手了解项目
看看一个答案为什么通过或不通过
SYNTH-SaaS-001 完全使用合成数据。这个公开教学样例展示裁判材料;真实评测包会将其与模型输入分开。
计算收入变化
计算下一季度的月度经常性收入(MRR),准确指出造成流失金额最多的两个群组,并说明扩张收入使用哪个时点的基数。
| 群组 | MRR (USD) | 流失率 | 扩张率 |
|---|---|---|---|
| C1Enterprise | 1,800,000 | 0.03 | 0.02 |
| C2Growth | 1,200,000 | 0.04 | 0.025 |
| C3MidMarket | 900,000 | 0.08 | 0.03 |
| C4SMB Legacy | 700,000 | 0.14 | 0.01 |
| C5SMB New | 250,000 | 0.06 | 0.04 |
| C6Startup | 100,000 | 0.09 | 0.05 |
| C7Edu | 30,000 | 0.05 | 0.02 |
| C8Nonprofit | 20,000 | 0.04 | 0.01 |
这项工作说明了什么
v0.2.0 公开了方法文档、可复用模板、三个命令行检查工具及一套完整的合成 SaaS 题目。17 项自动测试在 Python 3.9、3.11 和 3.12 的 CI 环境中运行。
查看原始依据
当前边界
- 公开样例均为合成内容,不包含客户题目、评分细则或私密反馈记录。
- 本地检查通过不等于题目质量、评审校准或模型能力已经获得验证。