项目证明材料填写参考｜根据实际表单字数裁剪，优先保留研究代理项目

【主项目：Research Agent Bench】
项目链接：https://github.com/Zhi-Chao-PAN/research-agent-bench/releases/tag/reviewer-snapshot-2026-09-23-r2
研究问题：研究代理能否在最多六次开发集反馈内，为加权 RRF 检索选出比同预算预设搜索更好的参数？
实验任务：固定 NFCorpus 的 BM25/TF-IDF 排名、参数边界、指数增益 nDCG@10、先行假设、六次调用预算和开发集选优规则；选择冻结后，再由监督端计算公开测试成绩。仓库公开评价器、三条新增六轮代理轨迹、候选及反馈、189 点参数面和 100 组无需 LLM 的等预算随机搜索。
结果与判断：三条新增代理轨迹选出同一配置，只有一组唯一测试排序；公开测试得分 0.307044，低于预设六点搜索的 0.307294，不能证明代理稳定优于搜索。公开测试参数面此前已被研究者查看，属于探索性研究。
可核验性：公开仓库修正了旧申请包的数据准备入口；发布前从固定上游 ZIP 重建缓存，并独立复核旧数值结果。`PAPER_TO_TASK.md` 对照 RRF/BEIR 英文原论文、代码实现与任务适配理由。公开 CI 实际构建 Docker 审计镜像并断网运行轨迹检查与虚构数据六次预算演示；这些检查不代表在容器内重建 NFCorpus，也不证明本人 Docker 熟练。原始第三方语料与完整排名缓存不随仓库发布，按 README 下载与重建。
个人范围：本轮设计整理、代码实现、执行和分析使用 AI 辅助；本人愿现场按给定材料独立解释评价器、运行入口与失败原因，不把 AI 产物写成已独立完成的研究成果。

【第二项目：LoRA 输入纠错与词序鲁棒性】
项目链接：https://github.com/Zhi-Chao-PAN/lora-robustness-reproduction/releases/tag/reviewer-snapshot-2026-09-23
研究问题：修正 RoBERTa 分词输入后，小参数量微调能否在常规 MRPC 句对任务上接近全量微调，且能否应对 PAWS 词序压力？
实验设计：分类头、全量微调、query/value LoRA-r8 三方法，各做 4/12 轮、三个训练种子；另有两个单种子 rank 诊断和一次从头重复，共 21 次已记录训练。发现旧 tokenizer 缺少 BPE merges 后撤回旧性能解释，逐条核对 4,076 条 MRPC 编码并重新训练。
结果与判断：12 轮 LoRA 与全量微调的 MRPC 平均 F1 分别为 0.9074 与 0.9081；PAWS balanced accuracy 分别为 0.5009 与 0.5003，接近常量分类基线。不能将前者的小差值解释为方法等效，也不能宣称词序鲁棒性或完整复现 LoRA 论文结果表。
可核验性：公开固定协议、源码、依赖、每运行汇总、分析图表和纠错记录；公开 CI 复核文件哈希与汇总指标，发布时还复核了 tokenizer 资产与 LoRA 实现不变量。CI 不能代替重新训练。模型权重、第三方原始数据和逐条预测未公开，需要依照仓库说明另行取得并重跑。
个人范围：本轮实现和分析由 AI 辅助；本人独立复跑及英文论文方法理解须以现场试作证明。

【补充项目，仅在表单允许增加第三项时使用】
电池容量重建/去噪机制审查识别了两模型都经相同 EMA 与 running-minimum 后处理达到零单调性违例的事实，因此不以零违例宣称 PINN 独有的安全优势。该实验使用固定的六条电芯 CSV 快照和 LOGO 协议，尚未闭合官方 CALCE 原始数据链，不是未来 RUL 预测或部署安全证明。新增三训练种子、六电芯的 36 行公开汇总已并入主分支；18 个种子与留出电芯组合的平均 RMSE，PINN 为 0.9814 Ah，LSTM 为 0.2221 Ah。公开报告与复核脚本：https://github.com/Zhi-Chao-PAN/safety-critical-battery-prognostics/tree/74953917964a52798b3c352564aadbcf68f4d912/experiments/logo_capacity_reconstruction 。
