一页纸概览 产品需求文档 竞品分析 评测集设计 迭代记录 技术方案 问答实例集

评测集设计说明

评测集设计说明

当前库为 35 篇已索引的服装设计论文。评测检验本地库能否支撑当前研究任务,而不是系统能否从网上检索新文献。分数见 评测结果

1. 设计逻辑

矩阵为五个阶段乘以四个难度,共 20 题,每格一题,避免全部使用接近标题的易检索题目抬高总分。阶段检验任务约束是否被遵守,难度检验检索是否只依赖标题用词。

难度 1难度 2难度 3难度 4
开题叙事三要素主要叙事方式「服装如何讲故事」国潮三维模型
综述七十年来的理论阶段理论转向的分段后现代与现代主义民族元素的共同难题
方法材料三类因素面料再造特点物理量感与心理量感中西珐琅的「意」与「形」
写作70.7% 调研数据83% 纹样重复面料功能美特征以两个数字说明需求强、供给弱
结题哥特风格何以存续强化针织特性的原因条纹的可重组性Transformer 用于服装 CAD(库外)

1.1 阶段

阶段题目检验的内容合格答案不合格答案
开题覆盖与缺口说明已有框架与要素,并标出缺失生成开题报告
综述对照归纳异同与边界,并标注篇名拼贴 Related Work
方法可借鉴做法分类、步骤与工艺发明新方法
写作可引用事实数字或原句及出处扩写为正文
结题可答辩原话回溯原文;没有则明确说明用无关段落作答

同一知识可以出现在不同阶段,问法不同。例如国潮数据在写作阶段问「70.7% 是多少」,在难度 4 则问如何用原文数字说明需求强、供给弱。

1.2 难度

难度操作定义本集中的落地方式
1题面接近标题或摘要关键词「叙事的体系通常由哪些核心要素」接近篇名
2同义改写,专名仍在「把服装当作叙事媒介」仍指向同一篇
3近义表述,专名减少「服装如何讲故事」不出现「叙事体系」
4跨篇归纳、数字核对,或库中无依据两篇民族元素对照,或 Transformer 库外题

难度 3 用于检验近义检索。问「服装如何讲故事」时,目标文献已进入前 10,nDCG 为 0.29,说明排序偏后。这是评测集发挥作用,而不是题目失效。

2. 题目示例

2.1 对照

问题:传统图案或民族元素进入现代服装设计时,文献里反复提到的共同难题是什么?目标文献为齐冀《民族元素与服饰设计创新》与彭景《中国传统图案在现代服装设计中的运用》。参考答案强调资源丰富但真正创新有限,须处理传统与现代的关系,避免表层挪用。该题列为难度 4,因为必须跨两篇寻找反复出现的判断。当前结果为召回 1.00、nDCG 1.00、忠实度 0.88。完整回答见 问答实例集

2.2 拒答

问题:库中关于 Transformer 自注意力在服装 CAD 自动打版中的应用结论是什么?目标文献为空,参考答案为「未找到依据」。该题放在结题最高难度,因为答辩最需要避免用流畅表述填补空白。原文抽取会贴上无关段落;大模型路径能够拒答,并说明命中文本实际讨论的内容。

2.3 缺口

评测集中的开题题偏重「库已覆盖何种框架」。产品演示另用「如果做服装叙事方向的开题,库里已经覆盖了什么、还缺什么」。期望结构为:已覆盖叙事体系,弱相关文献不得冒充叙事研究,并标出其余环节尚未覆盖。该问法不计入 20 题总分。

3. 库外题的设计

发现类产品几乎总能返回相关篇目,库外情形不明显。使用类产品的主要风险是:库中并无依据,系统仍用前若干条结果编造答案。因此不采用「询问一篇完全不存在的论文标题」(易被理解为检索失败),而采用与库主题相邻、对象却不存在的技术结论,例如在服装设计库中询问 Transformer 与服装 CAD。随机乱码没有产品信息量,不予采用。

约束包括:目标文献列表必须为空;期望输出是「未找到依据」,而不是依据无关篇目推测;允许说明本轮命中文本讨论了什么、为何不足以回答。库外题答不好,正确动作是拒答,而不是补充一篇相关论文把题目改成正例。

4. 指标定义

指标计算能够说明不能说明
文档召回目标文献出现在前 10 条中的比例是否找到应找的篇段落是否正确
nDCG@10目标文献在前 10 条中的排序质量正确文献是否靠前生成质量
忠实度答案语句与命中片段词重叠不低于 0.35 的比例表述是否贴着上下文事实是否正确;亦非 RAGAS 评分
引用可追溯每条引用能否指向本轮检索结果是否出现库外假文献引用句是否真正支持该论断

发布门槛:引用可追溯须为 1.00;启用大模型后若低于 0.9,视为回归。样例库与真库题目不同,不得当作涨幅。仅调整生成时,nDCG 的变化不应解释为检索进步;近义题排序仍为 0.29。报告中多道题出现「未找到依据」,多为缺口小节,整题拒答的只有库外那一道。

尚未纳入例行报告的项目包括:重排前后的 nDCG、RAGAS 三维指标,以及「阶段是否像该阶段」的人工盲评。