跳转至

科学数据闭环:Scientific Data Loop

本章所属 DDA 层:Scientific Data Loop

阿斯利华那套基座刚上线时,别名是对的,CSR 引用是现行版,knowledge 图里的靶点边是人审过的。三个月后,新通用名出现了,SOP 换了版,一篇供应商报告抽出了互相冲突的活性。系统若把这些变化当成「再训一下模型」,答案会继续用旧世界说话。若没有人审就自动改图,世界模型会跟着噪声长。

闭环的产品是企业科学知识层变厚,不是模型权重更新。全书两大核心之一在这里闭合。

问题

前面各层解决「如何消费」。Scientific Data Loop 解决「如何把使用中暴露的缺口,变成受控的本体与知识变更」。

业务在变,Ontology 不能是一次性建模。变更若没有版本、影响评估和历史兼容,修一处会震整条链。变更若由管道直接写生产图,审校形同虚设。

传统方案

传统数据管道是单向的。研发系统抽数,ETL 入仓,报表消费。错误靠工单。SOP 换版靠有人记得改文档库。本体变更靠临时加字段。

阿斯利华早期也是这样。别名错了提工单,下次批处理跑通。没有人从检索零结果或负反馈里系统挖信号。

为什么失效

单向管道没有回流。同样的别名错误会周复一周出现。

把闭环理解成再训练,修的是参数,不是 ASH-001 映射或 CSR 版本。所有消费方仍读旧身份。

把闭环理解成自动写图,抽取噪声会进入 knowledge。Knowledge ≠ Truth 碎在最后一公里。

一次性建模在新管线出现时腐化:实体定义过时、关系缺失、规则失效、别名不全、枚举外溢、资产绑定失效。多半不是当初建错了,是没跟上变化。

科学数据闭环不是新的 ETL,也不是模型再训练。它是研究活动与语义世界之间的受控回路。

flowchart LR
    RS[研究系统] --> SF[语义基座]
    SF --> AI[AI消费]
    AI --> HV[科学家审校]
    HV --> KE[知识回写Git]
    KE --> SF

图:闭环产品是知识层变厚(DDA 层:Scientific Data Loop)

新的设计思想

回路写成五步,而不是「收集反馈再调参」:

研究系统(ELN / LIMS / 登记 / 文献 / 供应商)
  → 语义基座(本体 · 图 · 目录 · 证据 · 词表)
  → AI 消费(检索 · Context Pack · 仓外 Agent)
  → 科学家审校(evidence / claim)
  → 知识回写(映射、validated 事实、词典进 Git → 同步)

AI 只产候选。人审后才进图。apply 写 Git,不直接写生产图。

信号来自真实使用:unmapped、低置信、零结果、负反馈、多源冲突。离线标注可以补充,不能当唯一触发源。

本体演进是闭环的一环:版本化、四个 W、下游影响评估、历史兼容、衰减监控。不再单独虚构一层「演进产品」。

可观测四支柱是传感器。State 必须记下「为什么没选那个」,否则矿工挖不到决策。

架构设计

flowchart TB
    SIG[信号] --> CAN[候选变更]
    CAN --> REV[审校批准]
    REV --> GIT[Git_L1_L2]
    GIT --> REL[ontology_release]
    REL --> SYNC[同步图与索引]
    SYNC --> SIG
    SIG -.不自动.-> PROD[生产图直写]

图:人审写 Git,同步才进运行时(DDA 层:Scientific Data Loop)

工程实践

决策表

决策 选择 放弃
产品 知识层变厚 以模型权重更新当闭环成功标准
写回 Git 策展 + 同步 管道直写生产图
触发 运行时信号为主 只靠离线标注批次
本体变更 版本、四 W、影响评估、兼容 工单改枚举、不通知下游
新概念 人决定是否入库 文档自动 mint
评估 分面合同守门 过 CI 即等于可上线

阿斯利华可走通的例子

用户问 savolitinib 的 Phase I 结果,系统引用了另一化合物的 CSR。用户标记引用错误。

信号类型:negative_feedback,载荷是 mention=savolitinib、错误实体、trace_id。occurrences 达到阈值后升优先级。

候选变更:把 savolitinib 的别名从错误实体挪到 ASH:ENT:DC:savolitinib。变更单写明 Why(该条反馈)、Who(本体评审)、When(生效发版)。

批准后写入 Git 词典,bump ontology_release_id。同步作业重建身份服务与图,不在批准前改生产边。回归跑身份命中与引用忠实度。下次同样问题,Pack 里的身份不再指错。

新管线若出现 ADC,旧 DrugCandidate 模型不够用。这是结构演进:新增实体与组件关系,评估对上下文接口和证据绑定的冲击,历史化合物保留兼容标记,不强制迁移。

失败模式

  • 无人审自动 validated:噪声进 knowledge。
  • apply 直写图:Git 与运行时分叉,发版号撒谎。
  • 只采显式点踩:样本稀疏,第三月停滞照旧发生。
  • 变更不评估下游:接口字段没了,Pack 合同碎。
  • 历史枚举无映射:status='A' 新旧含义相反,同一查询不同时间不同答案。
  • 可观测不记落选:永远无法回答「为什么没选 B」。

业界路线对照

头部药企把科学家放在验证环上:数据产品嵌入词表,知识地图随研究更新,应用只消费。Open PHACTS 的映射服务持续吸收新的公开标识,而不是一次导入。映射和已验证事实进 Git;公开源按许可增量挂载。不要把「数据飞轮」理解成自动改生产世界模型。

最佳实践

隐式信号与显式纠错都要采。反复追问往往比点踩更早暴露缺口。

回流要审批。错误反馈不能污染主键。

修数据层根因。别名修对了,检索、Pack、图谱一起受益。

衰减监控主动找腐化:未命中别名、关系不存在、枚举外溢。

过 CI 不是可上线。还要看发版号、灰度与真实流量。

新概念走 PR。文档只负责把缺口喊出来。

延伸阅读

  • 科学数据回路:研究系统到语义层到消费到审校的结构,而不是模型再训练蓝图。
  • 本体即产品:版本、衰减、下游影响。
  • 可观测四支柱:WHERE / WHAT / WHY / WHEN,WHY 不可省。

Checklist

  • 是否澄清闭环与 ETL、再训练的区别,产品是否定义为知识层变厚?
  • AI 是否只产候选,人审后才进图?
  • apply 是否写 Git,而非直写生产图?
  • 信号是否来自 unmapped、低置信、零结果、负反馈、冲突,而不是只靠离线标注?
  • 本体变更是否记录四个 W,并评估对接口与历史数据的影响?
  • 可观测是否记下落选候选?
  • 是否避免把本体演进写成独立产品层?

第三月停滞,多半是时效问题攒到头。能修的是身份、版本与审校流:信号进来,人审写 Git,同步才进运行时。