检查结论

验证:用误匹配、漏匹配和改动日志检查索引

以已人工确认的相关记录为基准。准确率回答“返回的有多少符合条件”,召回率回答“符合条件的找回了多少”;两者都应注明查询与样本范围。

编辑日期:2026-09-11 · 教学练习不代表真实个案

直接回答

以已人工确认的相关记录为基准。准确率回答“返回的有多少符合条件”,召回率回答“符合条件的找回了多少”;两者都应注明查询与样本范围。

建立可复查的判定集合

沿用实作页 Q1,相关记录集合是 A、D。这个答案来自练习的字段约定,不是从待评估搜索结果反推。真实资料若仍有未知项,应另列待判定集合,不能默认都不相关后报告一个漂亮分数。

算一次,而不是只说更准确

假设一个检索方法返回 A、B、C、E,真正相关的只有 A。准确率 = 1 ÷ 4 = 25%;召回率 = 1 ÷ 2 = 50%。它有三个误匹配 B、C、E,漏掉 D。若使用两个字串同时包含的方法只返回 A,则准确率为100%,召回率仍为50%。两项指标描述不同问题。

记录错误属于哪一层

A、C 因同号被合并,是标识范围错误;把 B 因日本地区词当作日语资料,是字段混淆;漏掉 D,是标签表达与字段内容不一致;把 E 当成已确认日本资料,是未知值处理错误。修正时应改对应规则,而不是不断给标题追加关键词。

词表需要记录变更

可参照 SKOS 对首选标签、替代标签和范围说明的区分,为自用词表记录“名称、别名、含义、不包含什么”。例如本课自定“内容地区”只指资料谈及的地域,排除服务器所在地。新增别名时保留旧值映射与变更理由,再重跑原查询。

什么时候可以说本次检查通过

固定这五条数据和 Q1—Q3 后,字段方案得到预期集合,且没有把未知项补写成事实,就可以说通过本次练习。不能据此声称在更大资料库达到100%效果。返回数为0时准确率分母为0,相关数为0时召回率分母为0,应标记不适用并报告原始计数。

把方法变成行动

  1. 保存数据版本、查询文字与人工确认的相关集合。
  2. 记录检索返回集合,逐条列出误匹配与漏匹配。
  3. 用实际计数计算准确率和召回率,零分母标记不适用。
  4. 只修正导致错误的字段或映射规则。
  5. 重跑原查询,并追加一个可能破坏新规则的反例。
下载离线练习单

数据与判断对照表

Q1 检索方案返回 / 真正相关准确率 / 召回率
假设宽泛检索A、B、C、E / A25% / 50%
标签同时含日本和日语A / A100% / 50%
已确认字段同时满足A、D / A、D100% / 100%(仅本练习)

延伸阅读与支持范围

以下链接提供相关领域资料。本站的问题拆解、解释和练习为编辑设计,不表示外部机构认可本站全部内容。

数据透明度

参考资料

未核验
  • DCMI Metadata Terms:identifier、language、spatial 已核验
    发布方
    Dublin Core Metadata Initiative
    访问日期
    2026-09-11
    支持字段
    identifier 是给定语境中的明确引用;language 描述资源语言;spatial 描述资源空间特征。仅支持概念区分,不解释原始标签。
    查看来源
  • W3C SKOS Reference:词汇标签与说明 已核验
    发布方
    W3C
    访问日期
    2026-09-11
    支持字段
    prefLabel、altLabel 与 scopeNote 支持首选标签、替代标签和范围说明的区分。本站简化词表和数据均为教学设计。
    查看来源

关于这个问题的问答

地区未知的记录应当删除吗?

不应自动删除。它可能满足已知语言条件;保留未知状态,按查询的 AND / OR 逻辑判断是否属于已确认命中。

为什么找到的都对,仍可能漏掉资料?

准确率只看已返回的记录。Q1只返回A时准确率100%,但相关集合还有D,因此召回率为50%。练习可下载后离线完成,无需上传资料。

对应学习卡片

继续阅读

指南 更新于 2026-09-11

多个地区加数字是否形成有效索引?

可以作为检索入口,但仅靠地区词与数字的拼接不能保证有效索引。先约定每个字段的含义、编号所属目录和匹配规则,再用已知答案检查误匹配与漏匹配。

包含 5 个可复现步骤

阅读指南