一页纸概览 产品需求文档 竞品分析 评测集设计 迭代记录 技术方案 问答实例集

技术方案说明 · 产品语言

技术方案说明

说明关键决策的产品逻辑,而不展开接口与模块名称。

1. 为何同时使用关键词检索与语义检索

论文库中的提问分为两类,单独使用一路都会偏差。

问法例子更依赖的一路
专名、数字、标题词70.7%、艾瑞咨询、量感关键词匹配,词面必须对上
近义或口语「服装如何讲故事」接近叙事体系语义匹配,意思相近而词面不同

纯语义检索容易被「设计」「服装」「创新」等高频近邻冲淡,数字与模型名称容易丢失。纯关键词检索无法处理近义题目。融合依据排名而非分数加权,因为两路分数量纲不同,加权等于让其中一路主导。按名次融合的含义是:两路都判断靠前的结果优先。

当前限制在于,语义一路仍为占位表示,能够跑通评测,不能代表语义检索已经生效。因此「服装如何讲故事」能够召回目标文献,排序却偏后。这不是混合检索整体失败,而是其中语义一侧尚未成立。下一步仅更换语义表示,即补这一侧。

2. 为何设计拒答,而不是尽量作答

通用助手通常希望降低使用者空手离开的概率。学位论文的风险则是带着一段没有出处的话进入开题或答辩。因此拒答不是客服话术,而是使用层功能。

  1. 库中不存在的结论,标准答案即为「未找到依据」,并写入评测集。
  2. 原文抽取已经证明反面:库外题会把无关段落拼接成答案。若无拒答,前若干条结果永远有字。
  3. 大模型路径下的正确形态是:先声明没有结论,再说明命中文献实际讨论的内容及其不足,便于判断是库中确实没有,还是问法需要调整。
  4. 引用校验是配套机制。句子引用了本轮未命中的文献,即删除该句。流畅但不能回溯的表述,按产品定义属于失败。

产品需求文档中的停止条件为:启用大模型后引用可追溯低于 0.9,视为回归。不允许以更好读为理由放松引用纪律。

3. 阶段区分目前为何不够明显

设计意图是:同一批 PDF,阶段只改变取证章节与输出结构。

阶段希望优先取证的内容希望输出的结构
开题框架、要素、空白已覆盖与缺口
综述主张、对比、边界对照
方法工艺、步骤、分类可借鉴做法
写作数字、原句可引用事实
结题结论与限定可答辩原话,并标出未覆盖问题

实际情况是:中文期刊大多无法稳定切分引言、方法与结论,章节加权经常无法生效,检索差异主要来自问句本身。占位语义表示也无法理解「开题应关注框架词」,阶段提示在语义一侧未生效时几乎不起作用。使用者感受到的阶段差异,多半来自生成结构,而不是前 10 条证据发生了更换。开题案例中,结论已写明仅覆盖一篇,缺口栏却记为「未发现」。

这说明阶段本应是任务策略,目前交付的主要是任务结构。若继续做章节结构化,验收标准应是五个阶段命中内容的分布是否分开,而不是提示词是否更长。

4. 其他已经确定的决策

双栏解析优先于更强的生成模型。中文期刊若按纵坐标混排左右栏,后续检索都在阅读错乱文本。扫描件无文字层即标注为空,不上假识别。

原文区展示 PDF 页图,而不是识别文本。使用者需要核对印刷页。部分文件的文本层本身不可用,页图仍可阅读。

年份不是检索条件。自己建库时,时间范围通常已在下载前完成筛选。界面再提供宽年份区间,会把产品理解成外部搜索引擎。

自动下载不作为主路径。缺少稳定论文库接口时,后台抓取既容易失败,也会把使用层做成发现层。若将来接入目录检索,正确顺序是检索条目、用户确认、再入库。

评测先于更换模型。20 题先按阶段与难度绑定目标文献,再调整生成,再调整语义表示,以免分数变化无法解释。

上述选型服务于同一约束:只在用户声明的库内作答,说不清楚就停止。混合检索是为了让专名与近义都能进入名单;拒答是为了在名单不够时禁止编造;阶段本应改变取证策略,目前仍不充分,因此下一轮验收看分布,而不看提示词长度。