实际问题
一个漂亮分数可能掩盖错误输入、分布迁移、反复查看公开测试集或有竞争力的搜索基线。可信的申请证据必须暴露这些失败模式,也要说明成果归属的边界。
我的贡献
- 提出用 AI 辅助尽可能增强申请证据,并保留可供审阅的协议、产物、纠错记录和负结果。
- 本轮实验、分析与文案由 AI 辅助完成;个人理解、独立复跑、代码讲解和限时试做能力仍待证明。
证据状态:AI 辅助执行;本人独立复跑与讲解待完成。
关键选择与取舍
01
撤回建立在错误 tokenizer 入口上的成绩
- 选择
- 审计发现 tokenizer 后端缺少 merges 且编码不一致后,撤回旧成绩,切换到经过逐条核对的输入入口,并从头训练。
- 代价与取舍
- 纠正输入使更方便的旧结果失效,却保证后续比较建立在正确输入上。
- 如何检查
- 纠正后的矩阵包含 20 次正式训练和 1 次从头重复;全量证据包核对 tokenizer、逐条预测、checkpoint 与选优记录。
02
用词序压力集检查常规得分
- 选择
- 先在 MRPC 完成模型选择,再将六个固定的 12 轮 full/LoRA checkpoint 用于 PAWS,并同时报告 balanced accuracy、负类召回与 F1。
- 代价与取舍
- 12 轮 LoRA 的 MRPC 平均 F1 为 0.9074,但 PAWS balanced accuracy 只有 0.5009,接近常量分类基线;公开压力测试属于探索性分析,不是盲测确认。
- 如何检查
- 一页证明 PDF 概述结果;LoRA 公开仓库保留结果表、纠错、错误分析与核验范围,固定审阅快照的公开 CI 已通过。
03
预设搜索胜出时仍保留代理结果
- 选择
- 让三条空白上下文代理轨迹各使用六次开发调用,冻结选择后,再与预设六点搜索比较 NFCorpus 公开测试结果。
- 代价与取舍
- 三条轨迹都选择同一配置并得到 0.307044,低于预设搜索的 0.307294;它们只形成一组唯一测试排序,不是三份独立泛化证据。
- 如何检查
- 公开的研究代理仓库包含任务代码、先行假设、六轮日志、选择锁、报告与原始数据重建路径。r2 快照新增论文方法到任务设计的对照索引,以及经 CI 实测的 Docker 离线轨迹核验与虚构数据演示;容器检查不复跑 NFCorpus,也不证明申请人本人熟练使用 Docker。此前已查看公开测试,因此这只是探索性扩展。
这项工作说明了什么
证据包记录了纠正后的 20 次 LoRA 正式训练与 1 次重复、接近随机水平的 PAWS 压力结果,以及三条未胜过预设搜索的新增六次调用代理轨迹。它最有价值的信号是保留了纠错和负结果,而不是宣称某个方法获胜。
查看原始依据
当前边界
- AI 辅助执行和整理不构成申请人独立研究或编程能力的证明;仍需本人复跑、解释和现场试做。
- 发布后的复跑是 AI 代理在同一机器上、使用留存资产对一个固定配置完成的一次重复;它不是重新下载资产、跨机器测试、完整 21 次运行复现,也不能证明申请人本人训练或调试过模型。
- MRPC validation、PAWS labeled test 与 NFCorpus public test 都用于探索性研究;这些结果不是盲测基准,也不能推出 LoRA 的一般结论或代理优于搜索。
- 一页 PDF 与报名增量包本身不含完整原始预测、模型权重及排名缓存。关联仓库公开源码、日志和汇总结果,第三方数据及权重需按上游规则另行获取;本人独立复跑仍待完成。
- 实验只覆盖一个语言模型骨干、两个句对数据集、一项检索任务,以及少量训练种子和代理轨迹。