AI 产品经理 · 项目实践

文献工作台 · 本地论文库研究助手

2026.05 – 至今。面向研究生的本地论文库助手:仅基于用户导入的 PDF 检索原文,按开题至结题的任务约束组织回答;依据不足时明确说明,不代写论文正文。

角色:AI 产品经理(独立实践) 主用户:服装设计 / 设计学研究生 验收语料:35 篇真实论文

背景与目标

研究生撰写学位论文时,关键工作往往不是继续检索新文献,而是判断已经下载入库的论文能否支撑当前任务。现有工具常把「发现尚未阅读的论文」与「使用已经入库的论文」混在同一套问答里。模型容易依据训练语料补全表述,使用者难以区分句子来自本地文献还是模型记忆。开题、综述、方法、写作、结题对合格答案的要求并不相同,通用问答却只有一种输出形态。

本项目要解决的问题是:在用户自己的 PDF 库内,按研究阶段给出有出处、可拒答、不代写的工作稿。具体目标如下。

目标验收标准
仅依据库内文本作答库中无对应结论的题目须输出「未找到依据」,不得编造文献
阶段对应研究任务,而非代写开题说明覆盖与缺口,综述做对照,方法拆解做法,写作核对事实与数字,结题整理可回溯的原话
引用可回溯每条引用须指向本轮命中文献的标题、章节与页码
效果可复验20 题金标可重复运行,不同实验条件的分数分开记录,不得混报

范围上明确排除:不抓取知网或其他学术检索接口,不代替用户发现新论文;不代写开题报告、文献综述、方法章节或论文正文;不以款式图等视觉材料作为检索对象;扫描件若无文字层,标注为空,不将识别结果伪装成已通读。

需求判断

在调研知网 CNKI AI、Elicit、NotebookLM 之后可以看到,常见「学术 AI」实际分属两层。知网与 Elicit 回答的是「还有哪些论文尚未阅读」,属于发现层;NotebookLM 回答的是「如何把已有材料综合成可读文本」,属于通用笔记层。研究者更常遇到的问题是第三层:已经收下的 PDF,是否足以支撑当前这一步。

知网的知识源是平台收录,生成质量不能替代「本篇开题能否成立」。Elicit 默认文献可在开放网络中被索引,中文设计学期刊、本校毕业论文与扫描件并非其主场。NotebookLM 同样使用用户上传材料,但没有开题至结题的任务约束,默认倾向综合成篇,较少主动声明库不足以回答。

因此,本产品定位为使用层工作台:只根据用户导入的 PDF 作答,不承担文献发现,不代写正文。发现类产品无法作答,意味着需要继续检索;本产品无法作答,意味着现有库存在缺口,开题或答辩存在风险。基于这一判断,评测集中写入一道库外题目,标准答案即为「未找到依据」。

知网 CNKI AIElicitNotebookLM文献工作台
主要场景平台内检索与阅读按研究问题抽取证据理解材料并辅助成稿判断本地库能否支撑当前任务
知识来源知网收录开放学术索引用户当次上传用户本地 PDF 库
是否代写偏生成式综述偏结构化抽取偏综合叙述不代写正文
研究阶段偏综述与抽取开题至结题五阶段
库中无依据时继续检索调整问法仍常综合作答明确输出「未找到依据」
中文设计学文献发现能力强覆盖弱一般以真实本地库验收

用户与场景

主要用户为服装设计或设计学方向研究生,手头已有数十篇 PDF,并处于开题至结题之间的某一阶段。次要用户需要本地文献库,不便将全文上传至公有云。当前版本以本机运行为默认形态。

使用过程为:导入既有 PDF,选择当前研究阶段,就覆盖、对照、做法、数字或原话提问,阅读工作稿、引用列表与对应 PDF 页。若系统声明未找到依据,用户再决定补充文献或修改问题,而不是采纳一段流畅但无出处的表述。

阶段用户任务预期产出应避免的产出
开题判断研究方向能否成立说明库中已覆盖的框架与要素,并标出缺口生成开题报告
综述对照既有文献的立场归纳异同与边界,并标注出处可直接粘贴的 Related Work
方法寻找可借鉴的做法整理步骤、分类与工艺,不提出新方法直接给出新的技术方案
写作核对事实、数字与出处一句可引用事实及其页码扩写为论文正文
结题准备答辩表述可回溯至原文的要点;没有则明确说明用无关段落勉强作答

方案设计

五个阶段描述的是当前写作任务,而不是再次筛选论文。同一批 PDF 下,切换阶段只改变取证重点与输出结构,系统不会据此从外部补充文献。时间范围通常已在下载前完成筛选,因此主界面默认不提供年份控件,以免被理解为外部数据库检索。

检索同时使用关键词匹配与语义匹配:篇名、数字、专名依赖前者,近义或口语化提问依赖后者,再按排名融合,避免单一分数尺度主导结果。生成之后校验引用,本轮未命中的文献不得进入出处,否则删除相应句子。若无足够依据,先声明未找到,再说明本轮命中文本实际讨论的内容及其不足。

可信度优先于流畅度。答案仅允许来自本轮检索片段;引用可追溯须达到 1.00,启用大模型后若低于 0.9,视为回归。写作阶段只提供可引用事实,不输出可直接作为论文正文的长段落。

已实现能力包括:PDF 上传与索引重建、中文文件名优先于封面英文题名、无文字层标注、混合检索、分阶段工作稿、引用须来自本轮命中、以 PDF 原页展示依据。自动撰写综述、多模态检索、与知网或文献管理工具实时同步,不在本阶段范围之内。

检索工作台界面

检索界面:左侧选择当前任务,中部输入问题,命中后右侧展示对应 PDF 页。

文献库界面

文献库:支持上传、筛选与删除。无文字层的扫描件单独标注,不视为已入库文本。

评测设计

评测集先于模型迭代完成。共 20 题,覆盖五个阶段、四个难度。较易题目接近标题或摘要用语,其次为同义改写,再次为近义或跨段归纳,最难一档包含跨篇综合、数字核对,以及库中不存在对应结论的题目。每题绑定目标文献;库外题的目标文献为空,期望输出「未找到依据」。

指标定义当前结果
文档召回目标文献是否出现在前 10 条结果中1.00
nDCG@10目标文献的排序质量0.89
忠实度答案语句与命中片段的词重叠程度0.82(词重叠估计,非人工逐句审阅)
引用可追溯所列引用是否均能指向本轮检索结果1.00

样例库与真实论文库使用不同题目,分数不得横向比较。需要单独观察的题目包括:库外题必须整题拒答;「服装如何讲故事」一类近义提问中,目标文献已进入前 10,但排序偏后;写作题中的 70.7%、83% 须与原文一致,不得改写为约数。题目与分表见 评测结果,完整问答见 问答实例

项目文档

围绕上述定位形成一套可复用文档,可分别打开:

迭代闭环

每次实验只改变一类条件。3 篇样例仅用于打通流程,不能作为正式结论。替换为 35 篇真实论文并重写 20 题后,抽取原文的生成方式可读性差,库外题仍会拼凑无关段落,近义提问排序不佳。随后在同一索引与同一题集上仅启用大模型并保留引用校验:表述可读,库外题能够拒答,引用可追溯仍为 1.00;近义题排序没有改善,说明该问题不在生成环节。文献库管理、默认隐藏年份、展示 PDF 原页等界面调整单独进行,不计入检索实验。

轮次条件变化结果
流程打通样例文献 + 原文抽取链路可运行,不能外推到真实语料
替换真实语料35 篇论文 + 新 20 题召回 0.95,nDCG 0.84,忠实度 0.63,可追溯 1.00;库外题未拒答
仅调整生成同一索引与题集,启用大模型与引用校验召回 1.00,nDCG 0.89,忠实度 0.82,可追溯 1.00;近义题 nDCG 仍为 0.29
界面与文献库隐藏年份、工作稿结构、原页展示改善使用体验,不改变检索实验口径
下一步仅替换语义表示方法尚未进行
文档召回
1.00
目标文献进入前 10
nDCG@10
0.89
近义提问排序仍弱
忠实度
0.82
词重叠估计
引用可追溯
1.00
引用均指向本轮结果

已知短板与下一步

五个阶段目前的差异,主要体现在生成结构,而不是检索策略。中文期刊往往难以稳定切分摘要、方法与结论,阶段加权经常无法生效。语义表示仍为占位方案,近义提问「服装如何讲故事」中目标文献虽进入前 10,nDCG 仅为 0.29。开题案例中,结论已写明仅覆盖《服装设计叙事的体系与方式》一篇,缺口栏却记为「未发现」,说明结构已经给出,执行仍不稳定。

下一步仍只改变一类条件:先替换为更合适的语义表示,题集保持不变,观察较难题目与近义提问的排序是否上升;再完成中文章节识别,以五个阶段命中内容的分布是否分开作为验收,而不是以提示词长度作为验收。在此之前,不将外部文献发现或多模态理解纳入范围。