一页纸概览
产品需求文档
竞品分析
评测集设计
迭代记录
技术方案
问答实例集
迭代记录
迭代记录
先调整产品逻辑与评测口径,再调整模型。每次实验只改变一类条件。下列日期除另有说明外为 2026 年 9 月 11 日至 12 日。
第 0 轮:使流程可测
| 问题 | 仅有演示,无法说明效果好坏。 |
| 动作 | 本地 PDF 入库,双栏解析,关键词与语义混合检索,20 道当时针对样例的题目,以及引用校验。 |
| 验证 | 召回 0.95,nDCG 0.89,忠实度 0.75,可追溯 1.00。 |
| 结论 | 链路可以闭环。较难题目与结题偏弱。结题分数中有一道题目标文献绑定错误,不能视为检索偶然失败。 |
第 1 轮:界面与产品定位不一致
| 问题 | 主界面年份滑条类似外部数据库检索;写作文案类似代写。这与「用户已经自己建库」矛盾。 |
| 动作 | 年份默认隐藏,仅保留元数据与高级选项。写作阶段改为核对引用,并声明输出不能作为正文。 |
| 验证 | 沿主路径手工检查;评测分数不应因此大幅变化。不计入检索实验。 |
| 结论 | 界面控件会改变使用者对产品品类的理解。发现层控件不应出现在使用层。 |
第 2 轮:替换真实语料并重写题目
| 问题 | 3 篇合成 PDF 不能代表中文双栏、扫描件与毕业论文。沿用样例题目会得出虚假结论。 |
| 动作 | 移走样例,解析用户服装设计 PDF,35 篇、264 段进入索引(扫描件未进入)。按阶段与难度重写 20 题,并加入库外题。 |
| 验证 | 原文抽取:召回 0.95,nDCG 0.84,忠实度 0.63,可追溯 1.00。 |
| 结论 | 不得与样例库分数横向比较。抽取结果几乎不可读,库外题未拒答。近义提问 nDCG 约为 0.29。表现较差的正例中,目标文献已在库内,问题不在库规模。 |
第 3 轮:仅调整生成
| 问题 | 真库上原文抽取不可用;需要观察大模型是否以流畅度换取引用纪律。 |
| 动作 | 同一索引、同一 20 题,仅启用大模型与既有引用校验,不更换语义表示。 |
| 验证 | 召回 1.00,nDCG 0.89,忠实度 0.82,可追溯 1.00。校验未删除句子。库外题拒答。写作题抄录 70.7% 与 83%。近义提问 nDCG 仍为 0.29。 |
| 结论 | 可读性与拒答主要取决于生成;排序取决于语义表示。可追溯未下降,说明校验先于扩大生成能力。停止条件成立:没有用流畅度替换引用纪律。 |
第 4 轮:使用体验(不改变实验口径)
| 问题 | 列表题名显示为英文,原文区出现识别乱码,无法管理文献,扫描件被当作已读。 |
| 动作 | 中文文件名优先;原文区改为 PDF 页图;文献库支持上传、筛选、删除并重建索引;双栏与三栏按阅读顺序还原;无文字层标注为空。 |
| 验证 | 自动化测试与手工检查。扫描件仍为 0 字。部分文件的文本层本身不可用,页图仍可阅读。 |
| 结论 | 解析失败必须暴露,不能用模型补全假装已经读过。这些改动不改变四项评测数字。 |
尚未进行的实验
| 问题 | 计划动作 | 验证方式 |
| 近义排序偏弱(nDCG 0.29) | 仅更换语义表示方法 | 同一 20 题;观察较难题目与开题近义题的 nDCG |
| 五阶段命中仍集中在文前部分 | 识别中文摘要、引言与结论 | 各阶段前 10 条结果的章节分布是否分开 |
| 0.82 仅为词重叠 | 抽样核对,并与 RAGAS 对照 | 不单独优化重叠分数 |
不应将「nDCG 从 0.84 变为 0.89」叙述为检索进步。该变化发生在不同生成条件之下,近义题排序并未改善。