检查结论
验证:用误匹配、漏匹配和改动日志检查索引
以已人工确认的相关记录为基准。准确率回答“返回的有多少符合条件”,召回率回答“符合条件的找回了多少”;两者都应注明查询与样本范围。
直接回答
以已人工确认的相关记录为基准。准确率回答“返回的有多少符合条件”,召回率回答“符合条件的找回了多少”;两者都应注明查询与样本范围。
建立可复查的判定集合
沿用实作页 Q1,相关记录集合是 A、D。这个答案来自练习的字段约定,不是从待评估搜索结果反推。真实资料若仍有未知项,应另列待判定集合,不能默认都不相关后报告一个漂亮分数。
算一次,而不是只说更准确
假设一个检索方法返回 A、B、C、E,真正相关的只有 A。准确率 = 1 ÷ 4 = 25%;召回率 = 1 ÷ 2 = 50%。它有三个误匹配 B、C、E,漏掉 D。若使用两个字串同时包含的方法只返回 A,则准确率为100%,召回率仍为50%。两项指标描述不同问题。
记录错误属于哪一层
A、C 因同号被合并,是标识范围错误;把 B 因日本地区词当作日语资料,是字段混淆;漏掉 D,是标签表达与字段内容不一致;把 E 当成已确认日本资料,是未知值处理错误。修正时应改对应规则,而不是不断给标题追加关键词。
词表需要记录变更
可参照 SKOS 对首选标签、替代标签和范围说明的区分,为自用词表记录“名称、别名、含义、不包含什么”。例如本课自定“内容地区”只指资料谈及的地域,排除服务器所在地。新增别名时保留旧值映射与变更理由,再重跑原查询。
什么时候可以说本次检查通过
固定这五条数据和 Q1—Q3 后,字段方案得到预期集合,且没有把未知项补写成事实,就可以说通过本次练习。不能据此声称在更大资料库达到100%效果。返回数为0时准确率分母为0,相关数为0时召回率分母为0,应标记不适用并报告原始计数。
把方法变成行动
- 保存数据版本、查询文字与人工确认的相关集合。
- 记录检索返回集合,逐条列出误匹配与漏匹配。
- 用实际计数计算准确率和召回率,零分母标记不适用。
- 只修正导致错误的字段或映射规则。
- 重跑原查询,并追加一个可能破坏新规则的反例。
数据与判断对照表
| Q1 检索方案 | 返回 / 真正相关 | 准确率 / 召回率 |
|---|---|---|
| 假设宽泛检索 | A、B、C、E / A | 25% / 50% |
| 标签同时含日本和日语 | A / A | 100% / 50% |
| 已确认字段同时满足 | A、D / A、D | 100% / 100%(仅本练习) |
延伸阅读与支持范围
以下链接提供相关领域资料。本站的问题拆解、解释和练习为编辑设计,不表示外部机构认可本站全部内容。
数据透明度
参考资料
- DCMI Metadata Terms:identifier、language、spatial 已核验
- 发布方
- Dublin Core Metadata Initiative
- 访问日期
- 2026-09-11
- 支持字段
- identifier 是给定语境中的明确引用;language 描述资源语言;spatial 描述资源空间特征。仅支持概念区分,不解释原始标签。
- W3C SKOS Reference:词汇标签与说明 已核验
- 发布方
- W3C
- 访问日期
- 2026-09-11
- 支持字段
- prefLabel、altLabel 与 scopeNote 支持首选标签、替代标签和范围说明的区分。本站简化词表和数据均为教学设计。
关于这个问题的问答
对应学习卡片
继续阅读
多个地区加数字是否形成有效索引?
可以作为检索入口,但仅靠地区词与数字的拼接不能保证有效索引。先约定每个字段的含义、编号所属目录和匹配规则,再用已知答案检查误匹配与漏匹配。
包含 5 个可复现步骤
阅读指南实作:把五条虚构资料变成可筛选记录
使用下方五条虚构公开展览资料摘要练习。地区一律指内容涉及地区,语言指摘要语言。先手工写出应命中集合,再比较标签搜索与字段筛选。
包含 5 个可复现步骤
阅读指南