元数据目录:Metadata Catalog¶
本章所属 DDA 层:Metadata Catalog
问题¶
湖仓解决数据进得去。进去之后还得能找到:这张表是什么、谁拥有、从哪条流水线来、这份 ELN 对应哪个候选药、这篇 CSR 登记了没有。
目录管企业数据上下文。它不是第二套图谱。常见翻车有两种。一种是把公开词表全量灌进 Glossary,目录变成术语海。另一种是用目录 SQL 查「ASH-001 作用于哪个靶点」,跟科学知识图谱抢活。
本层只回答资产在哪。关系真相不在这里。
传统方案¶
传统元数据是给人看的。表注释写在数仓工具里,血缘图挂在治理平台上,术语散在 Confluence。阿斯利华早期把 dwd_compound 的字段说明写进 wiki,ELN 编号只在实验室系统里,文档在电子文档系统里各登各的。
对人够用。找不到表就问人,找不到 ELN 就找实验员。
为什么失效¶
机器要的是可程序消费的资产身份,不是一张给人浏览的血缘海报。
湖表有物理名,ELN 有实验号,CSR 有文档号,三套互不认识。问「ASH-001 最近一次酶活实验在哪」,目录若没有企业主键,只能靠人拼。
UMLS、ChEBI 全量打进 Glossary,目录会变成第二套图谱。「谁是谁」应走身份服务。
用目录 SQL 查治疗关系,短期好看。目录没有 PROV,也没有 extracted / validated,追责时说不清。
flowchart LR
subgraph wrong [常见混层]
G[公开词表灌Glossary] ~~~ S[目录SQL查关系]
end
subgraph right [本层职责]
A[资产身份] --- O[归属与血缘]
O --- E[企业主键锚点]
end
wrong -.不该由目录做.-> right
图:目录管资产在哪,不管世界是什么(DDA 层:Metadata Catalog)
新的设计思想¶
目录登记湖表、文档对象、证据集合、ELN/LIMS 资产,并尽量挂上企业主键。
Glossary 只放企业术语,比如「在研」「内部研发代号」。公开药理概念留在公开层,用 xref 挂到企业实体。
文档 Asset 是数据身份。登记「有这份 CSR」,不等于承认里面每一句结论。
能买现成目录就买。本层值钱的是纪律,不是再造一套 Catalog。
架构设计¶
flowchart TB
ICE[湖表] --> CAT[MetadataCatalog]
DOC[文档对象] --> CAT
ELN[ELN_LIMS_assay] --> CAT
CAT --> OWN[owner_SLA_lineage]
CAT --> ANK[ASH_ENT锚点]
CAT -.不承担.-> REL[药靶关系推理]
图:目录汇聚资产身份,关系查询不走这里(DDA 层:Metadata Catalog)
Ontology 用目录确认绑的是真资产。图谱用目录确认实验记录在哪。消费方经上下文接口查资产,不直连目录后台。
工程实践¶
决策表¶
| 决策 | 选择 | 放弃 |
|---|---|---|
| 目录职责 | 资产、归属、血缘、企业术语 | 生物医学关系推理 |
| 公开词表 | 不进 Glossary 全量 | 把 UMLS/ChEBI 灌成第二图谱 |
| 外部系统 | ELN/LIMS/assay 先登记再深挖 | 未登记就全量同步实验明细 |
| 文档 | Asset ≠ claim | 登记文档即承认知识 |
| 产品 | 复用成熟目录 | 自建第二套 Catalog |
阿斯利华可走通的例子¶
compound_active 在目录里应能看到 owner、契约版本、上游作业、下游消费者。CSR 资产 csr_ash001_phase1_v3 挂 ASH:ENT:DC:savolitinib,并指向对象存储里的原文。ELN 实验 eln_asy_2025_441 先作为资产出现,标注对应候选药。曲线要不要抽成 claim,是知识腿的事。
「这份酶活实验在哪」走目录。「该化合物是否作用于 c-Met」走科学知识图谱。「CSR 3.2 节怎么写」走证据索引。
失败模式¶
- Glossary 被当成公开本体副本。检索命中外部 CUI,企业主键对不上。
- 未登记的 ELN 被全量拉取。许可和归属还没建,存在性已经泄漏。
- 文档 Asset 被同步成 knowledge 边。登记被当成策展。
- 消费方拿目录 SQL 当主契约。换产品或改 FQN,调用方一起崩。
业界路线对照¶
头部药企把临床、组学、影像、样本分成不同数据产品域,先在目录里可发现,再决定哪一层值得深挖。Open PHACTS 把公开源放进整合缓存,企业资产不混进那一层。目录管企业资产发现,公开药理空间另挂。
最佳实践¶
先登记,再深挖。assay 没有目录身份,就不要先做全量同步。
Glossary 保持小。企业术语进目录,公开概念进公开层。
存在不等于为真。
消费方依赖上下文接口里的资产形态,不依赖某个目录产品的查询语言。
延伸阅读¶
- 开放元数据目录里 Glossary、Lineage、Ownership 的职责边界。
- FAIR 的 Findable:持久标识和资产登记。
Checklist¶
- 目录是否只回答资产在哪,不承担药靶关系推理?
- Glossary 是否只锚企业术语?
- ELN / LIMS / assay 是否先登记再深挖?
- 文档 Asset 和 claim 是否分开?
- 消费方是否经上下文接口查资产?
可发现是 FAIR 的第一项,也最容易和图谱混在一起。目录把已有治理技能收窄成企业数据上下文:表、文档、实验记录要能被程序找到。