跳转至

元数据目录:Metadata Catalog

本章所属 DDA 层:Metadata Catalog

问题

湖仓解决数据进得去。进去之后还得能找到:这张表是什么、谁拥有、从哪条流水线来、这份 ELN 对应哪个候选药、这篇 CSR 登记了没有。

目录管企业数据上下文。它不是第二套图谱。常见翻车有两种。一种是把公开词表全量灌进 Glossary,目录变成术语海。另一种是用目录 SQL 查「ASH-001 作用于哪个靶点」,跟科学知识图谱抢活。

本层只回答资产在哪。关系真相不在这里。

传统方案

传统元数据是给人看的。表注释写在数仓工具里,血缘图挂在治理平台上,术语散在 Confluence。阿斯利华早期把 dwd_compound 的字段说明写进 wiki,ELN 编号只在实验室系统里,文档在电子文档系统里各登各的。

对人够用。找不到表就问人,找不到 ELN 就找实验员。

为什么失效

机器要的是可程序消费的资产身份,不是一张给人浏览的血缘海报。

湖表有物理名,ELN 有实验号,CSR 有文档号,三套互不认识。问「ASH-001 最近一次酶活实验在哪」,目录若没有企业主键,只能靠人拼。

UMLS、ChEBI 全量打进 Glossary,目录会变成第二套图谱。「谁是谁」应走身份服务。

用目录 SQL 查治疗关系,短期好看。目录没有 PROV,也没有 extracted / validated,追责时说不清。

flowchart LR
    subgraph wrong [常见混层]
        G[公开词表灌Glossary] ~~~ S[目录SQL查关系]
    end
    subgraph right [本层职责]
        A[资产身份] --- O[归属与血缘]
        O --- E[企业主键锚点]
    end
    wrong -.不该由目录做.-> right

图:目录管资产在哪,不管世界是什么(DDA 层:Metadata Catalog)

新的设计思想

目录登记湖表、文档对象、证据集合、ELN/LIMS 资产,并尽量挂上企业主键。

Glossary 只放企业术语,比如「在研」「内部研发代号」。公开药理概念留在公开层,用 xref 挂到企业实体。

文档 Asset 是数据身份。登记「有这份 CSR」,不等于承认里面每一句结论。

能买现成目录就买。本层值钱的是纪律,不是再造一套 Catalog。

架构设计

flowchart TB
    ICE[湖表] --> CAT[MetadataCatalog]
    DOC[文档对象] --> CAT
    ELN[ELN_LIMS_assay] --> CAT
    CAT --> OWN[owner_SLA_lineage]
    CAT --> ANK[ASH_ENT锚点]
    CAT -.不承担.-> REL[药靶关系推理]

图:目录汇聚资产身份,关系查询不走这里(DDA 层:Metadata Catalog)

Ontology 用目录确认绑的是真资产。图谱用目录确认实验记录在哪。消费方经上下文接口查资产,不直连目录后台。

工程实践

决策表

决策 选择 放弃
目录职责 资产、归属、血缘、企业术语 生物医学关系推理
公开词表 不进 Glossary 全量 把 UMLS/ChEBI 灌成第二图谱
外部系统 ELN/LIMS/assay 先登记再深挖 未登记就全量同步实验明细
文档 Asset ≠ claim 登记文档即承认知识
产品 复用成熟目录 自建第二套 Catalog

阿斯利华可走通的例子

compound_active 在目录里应能看到 owner、契约版本、上游作业、下游消费者。CSR 资产 csr_ash001_phase1_v3ASH:ENT:DC:savolitinib,并指向对象存储里的原文。ELN 实验 eln_asy_2025_441 先作为资产出现,标注对应候选药。曲线要不要抽成 claim,是知识腿的事。

「这份酶活实验在哪」走目录。「该化合物是否作用于 c-Met」走科学知识图谱。「CSR 3.2 节怎么写」走证据索引。

失败模式

  • Glossary 被当成公开本体副本。检索命中外部 CUI,企业主键对不上。
  • 未登记的 ELN 被全量拉取。许可和归属还没建,存在性已经泄漏。
  • 文档 Asset 被同步成 knowledge 边。登记被当成策展。
  • 消费方拿目录 SQL 当主契约。换产品或改 FQN,调用方一起崩。

业界路线对照

头部药企把临床、组学、影像、样本分成不同数据产品域,先在目录里可发现,再决定哪一层值得深挖。Open PHACTS 把公开源放进整合缓存,企业资产不混进那一层。目录管企业资产发现,公开药理空间另挂。

最佳实践

先登记,再深挖。assay 没有目录身份,就不要先做全量同步。

Glossary 保持小。企业术语进目录,公开概念进公开层。

存在不等于为真。

消费方依赖上下文接口里的资产形态,不依赖某个目录产品的查询语言。

延伸阅读

  • 开放元数据目录里 Glossary、Lineage、Ownership 的职责边界。
  • FAIR 的 Findable:持久标识和资产登记。

Checklist

  • 目录是否只回答资产在哪,不承担药靶关系推理?
  • Glossary 是否只锚企业术语?
  • ELN / LIMS / assay 是否先登记再深挖?
  • 文档 Asset 和 claim 是否分开?
  • 消费方是否经上下文接口查资产?

可发现是 FAIR 的第一项,也最容易和图谱混在一起。目录把已有治理技能收窄成企业数据上下文:表、文档、实验记录要能被程序找到。