一页纸概览 产品需求文档 竞品分析 评测集设计 迭代记录 技术方案 问答实例集
当前库为 35 篇已索引的服装设计论文。评测检验本地库能否支撑当前研究任务,而不是系统能否从网上检索新文献。分数见 评测结果。
矩阵为五个阶段乘以四个难度,共 20 题,每格一题,避免全部使用接近标题的易检索题目抬高总分。阶段检验任务约束是否被遵守,难度检验检索是否只依赖标题用词。
| 难度 1 | 难度 2 | 难度 3 | 难度 4 | |
|---|---|---|---|---|
| 开题 | 叙事三要素 | 主要叙事方式 | 「服装如何讲故事」 | 国潮三维模型 |
| 综述 | 七十年来的理论阶段 | 理论转向的分段 | 后现代与现代主义 | 民族元素的共同难题 |
| 方法 | 材料三类因素 | 面料再造特点 | 物理量感与心理量感 | 中西珐琅的「意」与「形」 |
| 写作 | 70.7% 调研数据 | 83% 纹样重复 | 面料功能美特征 | 以两个数字说明需求强、供给弱 |
| 结题 | 哥特风格何以存续 | 强化针织特性的原因 | 条纹的可重组性 | Transformer 用于服装 CAD(库外) |
| 阶段 | 题目检验的内容 | 合格答案 | 不合格答案 |
|---|---|---|---|
| 开题 | 覆盖与缺口 | 说明已有框架与要素,并标出缺失 | 生成开题报告 |
| 综述 | 对照 | 归纳异同与边界,并标注篇名 | 拼贴 Related Work |
| 方法 | 可借鉴做法 | 分类、步骤与工艺 | 发明新方法 |
| 写作 | 可引用事实 | 数字或原句及出处 | 扩写为正文 |
| 结题 | 可答辩原话 | 回溯原文;没有则明确说明 | 用无关段落作答 |
同一知识可以出现在不同阶段,问法不同。例如国潮数据在写作阶段问「70.7% 是多少」,在难度 4 则问如何用原文数字说明需求强、供给弱。
| 难度 | 操作定义 | 本集中的落地方式 |
|---|---|---|
| 1 | 题面接近标题或摘要关键词 | 「叙事的体系通常由哪些核心要素」接近篇名 |
| 2 | 同义改写,专名仍在 | 「把服装当作叙事媒介」仍指向同一篇 |
| 3 | 近义表述,专名减少 | 「服装如何讲故事」不出现「叙事体系」 |
| 4 | 跨篇归纳、数字核对,或库中无依据 | 两篇民族元素对照,或 Transformer 库外题 |
难度 3 用于检验近义检索。问「服装如何讲故事」时,目标文献已进入前 10,nDCG 为 0.29,说明排序偏后。这是评测集发挥作用,而不是题目失效。
问题:传统图案或民族元素进入现代服装设计时,文献里反复提到的共同难题是什么?目标文献为齐冀《民族元素与服饰设计创新》与彭景《中国传统图案在现代服装设计中的运用》。参考答案强调资源丰富但真正创新有限,须处理传统与现代的关系,避免表层挪用。该题列为难度 4,因为必须跨两篇寻找反复出现的判断。当前结果为召回 1.00、nDCG 1.00、忠实度 0.88。完整回答见 问答实例集。
问题:库中关于 Transformer 自注意力在服装 CAD 自动打版中的应用结论是什么?目标文献为空,参考答案为「未找到依据」。该题放在结题最高难度,因为答辩最需要避免用流畅表述填补空白。原文抽取会贴上无关段落;大模型路径能够拒答,并说明命中文本实际讨论的内容。
评测集中的开题题偏重「库已覆盖何种框架」。产品演示另用「如果做服装叙事方向的开题,库里已经覆盖了什么、还缺什么」。期望结构为:已覆盖叙事体系,弱相关文献不得冒充叙事研究,并标出其余环节尚未覆盖。该问法不计入 20 题总分。
发现类产品几乎总能返回相关篇目,库外情形不明显。使用类产品的主要风险是:库中并无依据,系统仍用前若干条结果编造答案。因此不采用「询问一篇完全不存在的论文标题」(易被理解为检索失败),而采用与库主题相邻、对象却不存在的技术结论,例如在服装设计库中询问 Transformer 与服装 CAD。随机乱码没有产品信息量,不予采用。
约束包括:目标文献列表必须为空;期望输出是「未找到依据」,而不是依据无关篇目推测;允许说明本轮命中文本讨论了什么、为何不足以回答。库外题答不好,正确动作是拒答,而不是补充一篇相关论文把题目改成正例。
| 指标 | 计算 | 能够说明 | 不能说明 |
|---|---|---|---|
| 文档召回 | 目标文献出现在前 10 条中的比例 | 是否找到应找的篇 | 段落是否正确 |
| nDCG@10 | 目标文献在前 10 条中的排序质量 | 正确文献是否靠前 | 生成质量 |
| 忠实度 | 答案语句与命中片段词重叠不低于 0.35 的比例 | 表述是否贴着上下文 | 事实是否正确;亦非 RAGAS 评分 |
| 引用可追溯 | 每条引用能否指向本轮检索结果 | 是否出现库外假文献 | 引用句是否真正支持该论断 |
发布门槛:引用可追溯须为 1.00;启用大模型后若低于 0.9,视为回归。样例库与真库题目不同,不得当作涨幅。仅调整生成时,nDCG 的变化不应解释为检索进步;近义题排序仍为 0.29。报告中多道题出现「未找到依据」,多为缺口小节,整题拒答的只有库外那一道。
尚未纳入例行报告的项目包括:重排前后的 nDCG、RAGAS 三维指标,以及「阶段是否像该阶段」的人工盲评。