返回全部项目

Structure-Aware RAG (Empirical)

探索纯文本解析与保留版式的解析方式,如何影响金融表格问答。

来源核对日期: 2026-09-12

01 / 问题背景

实际问题

PDF 表格被摊平成文字后,数字可能与行标签或年份脱离。检索得到的段落看起来相关,却无法支持正确答案。

02 / 职责与参与

我的贡献

  • 主导比较问题的设定与结果解释。
  • 借助 AI 开展实验,检查解析样例和错误分析。
工作方式:产品主导,AI 辅助实现,逐步检查与迭代。
03 / 方案判断

关键选择与取舍

01

比较文档的两种表达方式

选择
对照纯文本提取与 Markdown 表格表达,并记录后续检索和生成设置。
代价与取舍
公开证据属于初步结果,范围限定在一份来源文档。
如何检查
技术报告提供了解析样例、结果表和逐题错误类别。

这项工作说明了什么

案例的价值在于解释版式丢失、检索遗漏、算术错误和语义歧义怎样分别导致回答失败。

从结论回到来源

查看原始依据

当前边界

  • 公开题库有 30 题;历史汇总为 8 项含部分分的计分。原始逐题 CSV 未公开,自动评分器也未实现报告所述的 ±1% 人工评分口径。本页不宣称整体准确率提升。
  • 实验使用商业解析服务和本地生成,不代表所有处理都留在本地,也不代表已经同行评审。

工具与方法

PythonRAGDocument parsingError analysis