科学数据闭环:Scientific Data Loop¶
本章所属 DDA 层:Scientific Data Loop
阿斯利华那套基座刚上线时,别名是对的,CSR 引用是现行版,knowledge 图里的靶点边是人审过的。三个月后,新通用名出现了,SOP 换了版,一篇供应商报告抽出了互相冲突的活性。系统若把这些变化当成「再训一下模型」,答案会继续用旧世界说话。若没有人审就自动改图,世界模型会跟着噪声长。
闭环的产品是企业科学知识层变厚,不是模型权重更新。全书两大核心之一在这里闭合。
问题¶
前面各层解决「如何消费」。Scientific Data Loop 解决「如何把使用中暴露的缺口,变成受控的本体与知识变更」。
业务在变,Ontology 不能是一次性建模。变更若没有版本、影响评估和历史兼容,修一处会震整条链。变更若由管道直接写生产图,审校形同虚设。
传统方案¶
传统数据管道是单向的。研发系统抽数,ETL 入仓,报表消费。错误靠工单。SOP 换版靠有人记得改文档库。本体变更靠临时加字段。
阿斯利华早期也是这样。别名错了提工单,下次批处理跑通。没有人从检索零结果或负反馈里系统挖信号。
为什么失效¶
单向管道没有回流。同样的别名错误会周复一周出现。
把闭环理解成再训练,修的是参数,不是 ASH-001 映射或 CSR 版本。所有消费方仍读旧身份。
把闭环理解成自动写图,抽取噪声会进入 knowledge。Knowledge ≠ Truth 碎在最后一公里。
一次性建模在新管线出现时腐化:实体定义过时、关系缺失、规则失效、别名不全、枚举外溢、资产绑定失效。多半不是当初建错了,是没跟上变化。
科学数据闭环不是新的 ETL,也不是模型再训练。它是研究活动与语义世界之间的受控回路。
flowchart LR
RS[研究系统] --> SF[语义基座]
SF --> AI[AI消费]
AI --> HV[科学家审校]
HV --> KE[知识回写Git]
KE --> SF
图:闭环产品是知识层变厚(DDA 层:Scientific Data Loop)
新的设计思想¶
回路写成五步,而不是「收集反馈再调参」:
研究系统(ELN / LIMS / 登记 / 文献 / 供应商)
→ 语义基座(本体 · 图 · 目录 · 证据 · 词表)
→ AI 消费(检索 · Context Pack · 仓外 Agent)
→ 科学家审校(evidence / claim)
→ 知识回写(映射、validated 事实、词典进 Git → 同步)
AI 只产候选。人审后才进图。apply 写 Git,不直接写生产图。
信号来自真实使用:unmapped、低置信、零结果、负反馈、多源冲突。离线标注可以补充,不能当唯一触发源。
本体演进是闭环的一环:版本化、四个 W、下游影响评估、历史兼容、衰减监控。不再单独虚构一层「演进产品」。
可观测四支柱是传感器。State 必须记下「为什么没选那个」,否则矿工挖不到决策。
架构设计¶
flowchart TB
SIG[信号] --> CAN[候选变更]
CAN --> REV[审校批准]
REV --> GIT[Git_L1_L2]
GIT --> REL[ontology_release]
REL --> SYNC[同步图与索引]
SYNC --> SIG
SIG -.不自动.-> PROD[生产图直写]
图:人审写 Git,同步才进运行时(DDA 层:Scientific Data Loop)
工程实践¶
决策表¶
| 决策 | 选择 | 放弃 |
|---|---|---|
| 产品 | 知识层变厚 | 以模型权重更新当闭环成功标准 |
| 写回 | Git 策展 + 同步 | 管道直写生产图 |
| 触发 | 运行时信号为主 | 只靠离线标注批次 |
| 本体变更 | 版本、四 W、影响评估、兼容 | 工单改枚举、不通知下游 |
| 新概念 | 人决定是否入库 | 文档自动 mint |
| 评估 | 分面合同守门 | 过 CI 即等于可上线 |
阿斯利华可走通的例子¶
用户问 savolitinib 的 Phase I 结果,系统引用了另一化合物的 CSR。用户标记引用错误。
信号类型:negative_feedback,载荷是 mention=savolitinib、错误实体、trace_id。occurrences 达到阈值后升优先级。
候选变更:把 savolitinib 的别名从错误实体挪到 ASH:ENT:DC:savolitinib。变更单写明 Why(该条反馈)、Who(本体评审)、When(生效发版)。
批准后写入 Git 词典,bump ontology_release_id。同步作业重建身份服务与图,不在批准前改生产边。回归跑身份命中与引用忠实度。下次同样问题,Pack 里的身份不再指错。
新管线若出现 ADC,旧 DrugCandidate 模型不够用。这是结构演进:新增实体与组件关系,评估对上下文接口和证据绑定的冲击,历史化合物保留兼容标记,不强制迁移。
失败模式¶
- 无人审自动
validated:噪声进 knowledge。 - apply 直写图:Git 与运行时分叉,发版号撒谎。
- 只采显式点踩:样本稀疏,第三月停滞照旧发生。
- 变更不评估下游:接口字段没了,Pack 合同碎。
- 历史枚举无映射:
status='A'新旧含义相反,同一查询不同时间不同答案。 - 可观测不记落选:永远无法回答「为什么没选 B」。
业界路线对照¶
头部药企把科学家放在验证环上:数据产品嵌入词表,知识地图随研究更新,应用只消费。Open PHACTS 的映射服务持续吸收新的公开标识,而不是一次导入。映射和已验证事实进 Git;公开源按许可增量挂载。不要把「数据飞轮」理解成自动改生产世界模型。
最佳实践¶
隐式信号与显式纠错都要采。反复追问往往比点踩更早暴露缺口。
回流要审批。错误反馈不能污染主键。
修数据层根因。别名修对了,检索、Pack、图谱一起受益。
衰减监控主动找腐化:未命中别名、关系不存在、枚举外溢。
过 CI 不是可上线。还要看发版号、灰度与真实流量。
新概念走 PR。文档只负责把缺口喊出来。
延伸阅读¶
- 科学数据回路:研究系统到语义层到消费到审校的结构,而不是模型再训练蓝图。
- 本体即产品:版本、衰减、下游影响。
- 可观测四支柱:WHERE / WHAT / WHY / WHEN,WHY 不可省。
Checklist¶
- 是否澄清闭环与 ETL、再训练的区别,产品是否定义为知识层变厚?
- AI 是否只产候选,人审后才进图?
- apply 是否写 Git,而非直写生产图?
- 信号是否来自 unmapped、低置信、零结果、负反馈、冲突,而不是只靠离线标注?
- 本体变更是否记录四个 W,并评估对接口与历史数据的影响?
- 可观测是否记下落选候选?
- 是否避免把本体演进写成独立产品层?
第三月停滞,多半是时效问题攒到头。能修的是身份、版本与审校流:信号进来,人审写 Git,同步才进运行时。