2026.05 – 至今。面向研究生的本地论文库助手:仅基于用户导入的 PDF 检索原文,按开题至结题的任务约束组织回答;依据不足时明确说明,不代写论文正文。
研究生撰写学位论文时,关键工作往往不是继续检索新文献,而是判断已经下载入库的论文能否支撑当前任务。现有工具常把「发现尚未阅读的论文」与「使用已经入库的论文」混在同一套问答里。模型容易依据训练语料补全表述,使用者难以区分句子来自本地文献还是模型记忆。开题、综述、方法、写作、结题对合格答案的要求并不相同,通用问答却只有一种输出形态。
本项目要解决的问题是:在用户自己的 PDF 库内,按研究阶段给出有出处、可拒答、不代写的工作稿。具体目标如下。
| 目标 | 验收标准 |
|---|---|
| 仅依据库内文本作答 | 库中无对应结论的题目须输出「未找到依据」,不得编造文献 |
| 阶段对应研究任务,而非代写 | 开题说明覆盖与缺口,综述做对照,方法拆解做法,写作核对事实与数字,结题整理可回溯的原话 |
| 引用可回溯 | 每条引用须指向本轮命中文献的标题、章节与页码 |
| 效果可复验 | 20 题金标可重复运行,不同实验条件的分数分开记录,不得混报 |
范围上明确排除:不抓取知网或其他学术检索接口,不代替用户发现新论文;不代写开题报告、文献综述、方法章节或论文正文;不以款式图等视觉材料作为检索对象;扫描件若无文字层,标注为空,不将识别结果伪装成已通读。
在调研知网 CNKI AI、Elicit、NotebookLM 之后可以看到,常见「学术 AI」实际分属两层。知网与 Elicit 回答的是「还有哪些论文尚未阅读」,属于发现层;NotebookLM 回答的是「如何把已有材料综合成可读文本」,属于通用笔记层。研究者更常遇到的问题是第三层:已经收下的 PDF,是否足以支撑当前这一步。
知网的知识源是平台收录,生成质量不能替代「本篇开题能否成立」。Elicit 默认文献可在开放网络中被索引,中文设计学期刊、本校毕业论文与扫描件并非其主场。NotebookLM 同样使用用户上传材料,但没有开题至结题的任务约束,默认倾向综合成篇,较少主动声明库不足以回答。
因此,本产品定位为使用层工作台:只根据用户导入的 PDF 作答,不承担文献发现,不代写正文。发现类产品无法作答,意味着需要继续检索;本产品无法作答,意味着现有库存在缺口,开题或答辩存在风险。基于这一判断,评测集中写入一道库外题目,标准答案即为「未找到依据」。
| 知网 CNKI AI | Elicit | NotebookLM | 文献工作台 | |
|---|---|---|---|---|
| 主要场景 | 平台内检索与阅读 | 按研究问题抽取证据 | 理解材料并辅助成稿 | 判断本地库能否支撑当前任务 |
| 知识来源 | 知网收录 | 开放学术索引 | 用户当次上传 | 用户本地 PDF 库 |
| 是否代写 | 偏生成式综述 | 偏结构化抽取 | 偏综合叙述 | 不代写正文 |
| 研究阶段 | 无 | 偏综述与抽取 | 无 | 开题至结题五阶段 |
| 库中无依据时 | 继续检索 | 调整问法 | 仍常综合作答 | 明确输出「未找到依据」 |
| 中文设计学文献 | 发现能力强 | 覆盖弱 | 一般 | 以真实本地库验收 |
主要用户为服装设计或设计学方向研究生,手头已有数十篇 PDF,并处于开题至结题之间的某一阶段。次要用户需要本地文献库,不便将全文上传至公有云。当前版本以本机运行为默认形态。
使用过程为:导入既有 PDF,选择当前研究阶段,就覆盖、对照、做法、数字或原话提问,阅读工作稿、引用列表与对应 PDF 页。若系统声明未找到依据,用户再决定补充文献或修改问题,而不是采纳一段流畅但无出处的表述。
| 阶段 | 用户任务 | 预期产出 | 应避免的产出 |
|---|---|---|---|
| 开题 | 判断研究方向能否成立 | 说明库中已覆盖的框架与要素,并标出缺口 | 生成开题报告 |
| 综述 | 对照既有文献的立场 | 归纳异同与边界,并标注出处 | 可直接粘贴的 Related Work |
| 方法 | 寻找可借鉴的做法 | 整理步骤、分类与工艺,不提出新方法 | 直接给出新的技术方案 |
| 写作 | 核对事实、数字与出处 | 一句可引用事实及其页码 | 扩写为论文正文 |
| 结题 | 准备答辩表述 | 可回溯至原文的要点;没有则明确说明 | 用无关段落勉强作答 |
五个阶段描述的是当前写作任务,而不是再次筛选论文。同一批 PDF 下,切换阶段只改变取证重点与输出结构,系统不会据此从外部补充文献。时间范围通常已在下载前完成筛选,因此主界面默认不提供年份控件,以免被理解为外部数据库检索。
检索同时使用关键词匹配与语义匹配:篇名、数字、专名依赖前者,近义或口语化提问依赖后者,再按排名融合,避免单一分数尺度主导结果。生成之后校验引用,本轮未命中的文献不得进入出处,否则删除相应句子。若无足够依据,先声明未找到,再说明本轮命中文本实际讨论的内容及其不足。
可信度优先于流畅度。答案仅允许来自本轮检索片段;引用可追溯须达到 1.00,启用大模型后若低于 0.9,视为回归。写作阶段只提供可引用事实,不输出可直接作为论文正文的长段落。
已实现能力包括:PDF 上传与索引重建、中文文件名优先于封面英文题名、无文字层标注、混合检索、分阶段工作稿、引用须来自本轮命中、以 PDF 原页展示依据。自动撰写综述、多模态检索、与知网或文献管理工具实时同步,不在本阶段范围之内。

检索界面:左侧选择当前任务,中部输入问题,命中后右侧展示对应 PDF 页。

文献库:支持上传、筛选与删除。无文字层的扫描件单独标注,不视为已入库文本。
评测集先于模型迭代完成。共 20 题,覆盖五个阶段、四个难度。较易题目接近标题或摘要用语,其次为同义改写,再次为近义或跨段归纳,最难一档包含跨篇综合、数字核对,以及库中不存在对应结论的题目。每题绑定目标文献;库外题的目标文献为空,期望输出「未找到依据」。
| 指标 | 定义 | 当前结果 |
|---|---|---|
| 文档召回 | 目标文献是否出现在前 10 条结果中 | 1.00 |
| nDCG@10 | 目标文献的排序质量 | 0.89 |
| 忠实度 | 答案语句与命中片段的词重叠程度 | 0.82(词重叠估计,非人工逐句审阅) |
| 引用可追溯 | 所列引用是否均能指向本轮检索结果 | 1.00 |
样例库与真实论文库使用不同题目,分数不得横向比较。需要单独观察的题目包括:库外题必须整题拒答;「服装如何讲故事」一类近义提问中,目标文献已进入前 10,但排序偏后;写作题中的 70.7%、83% 须与原文一致,不得改写为约数。题目与分表见 评测结果,完整问答见 问答实例。
围绕上述定位形成一套可复用文档,可分别打开:
每次实验只改变一类条件。3 篇样例仅用于打通流程,不能作为正式结论。替换为 35 篇真实论文并重写 20 题后,抽取原文的生成方式可读性差,库外题仍会拼凑无关段落,近义提问排序不佳。随后在同一索引与同一题集上仅启用大模型并保留引用校验:表述可读,库外题能够拒答,引用可追溯仍为 1.00;近义题排序没有改善,说明该问题不在生成环节。文献库管理、默认隐藏年份、展示 PDF 原页等界面调整单独进行,不计入检索实验。
| 轮次 | 条件变化 | 结果 |
|---|---|---|
| 流程打通 | 样例文献 + 原文抽取 | 链路可运行,不能外推到真实语料 |
| 替换真实语料 | 35 篇论文 + 新 20 题 | 召回 0.95,nDCG 0.84,忠实度 0.63,可追溯 1.00;库外题未拒答 |
| 仅调整生成 | 同一索引与题集,启用大模型与引用校验 | 召回 1.00,nDCG 0.89,忠实度 0.82,可追溯 1.00;近义题 nDCG 仍为 0.29 |
| 界面与文献库 | 隐藏年份、工作稿结构、原页展示 | 改善使用体验,不改变检索实验口径 |
| 下一步 | 仅替换语义表示方法 | 尚未进行 |
五个阶段目前的差异,主要体现在生成结构,而不是检索策略。中文期刊往往难以稳定切分摘要、方法与结论,阶段加权经常无法生效。语义表示仍为占位方案,近义提问「服装如何讲故事」中目标文献虽进入前 10,nDCG 仅为 0.29。开题案例中,结论已写明仅覆盖《服装设计叙事的体系与方式》一篇,缺口栏却记为「未发现」,说明结构已经给出,执行仍不稳定。
下一步仍只改变一类条件:先替换为更合适的语义表示,题集保持不变,观察较难题目与近义提问的排序是否上升;再完成中文章节识别,以五个阶段命中内容的分布是否分开作为验收,而不是以提示词长度作为验收。在此之前,不将外部文献发现或多模态理解纳入范围。