跳转至

GLOSSARY.md

全书术语表

本文件是《Data-Driven AI:从数据到智能》的唯一术语来源。

所有章节作者与 AI 协作 Agent 写章节前,必须先查本表。

禁止使用本表以外的译法。


一、使用说明

1.1 术语首次出现

术语首次出现时,给中英文并列。

格式:中文(English)。

示例:数据本体(Ontology)。

1.2 术语后续出现

后续统一用中文。

除非该术语以英文缩写形式更常用,例如 RAG。

1.3 翻译权威

本表是唯一翻译源。

章节作者不得自创新译法。

1.4 禁止混用

禁止在同一章节混用同义词。

例如,同一章不得既用"数据本体"又用"本体论"。

1.5 修订规则

新增术语需要:

  1. 指定唯一中文译法。
  2. 给出一句话定义。
  3. 标注所属 DDA 层。
  4. 如有易混近义词,列入禁止混用对照表。

二、核心术语表

术语按 DDA 层分组。

每条格式:

中文术语(English, 缩写) 定义一句话。 禁止混用:近义词列表。 所属层:层名。

2.1 跨层总称

数据驱动 AI(Data-Driven AI, DDA) 以数据为起点的 AI 系统设计方法。 禁止混用:无。 所属层:跨层。

思维升级(Mindset Shift) 从「数据服务人」转到「数据服务机器」时,设计前提跟着换。 禁止混用:技能升级、能力转型。 所属层:跨层。

AI 原生(AI Native) 以 AI 系统为核心组织企业数据与流程的形态。 禁止混用:智能化、数字化。 所属层:跨层。

AI 原生科研数据基座(AI-Ready Scientific Data Foundation) 面向创新药研发的语义数据底座:湖仓、目录、本体、科学知识图谱、证据索引与上下文接口。 禁止混用:企业知识图谱项目、AI 数仓、发现平台。 所属层:跨层。

业务语义不可靠(Unreliable Business Semantics) 企业业务含义无法被机器稳定、一致、及时地消费的根本问题。 禁止混用:模型幻觉、数据质量差(多为症状或子集)。 所属层:跨层。

语义传递不可靠(Semantic Transmission Unreliability) 业务含义散落在多系统、多口径、多文档中,无法经单一来源稳定传给消费方。 禁止混用:网络故障、接口超时。 所属层:跨层。

语义时效不可靠(Semantic Temporal Unreliability) 业务世界持续变化,而 Ontology、口径、知识资产的定义滞后。 禁止混用:数据新鲜度延迟(仅为子集)、模型知识截止。 所属层:跨层。

知识不等于真理(Knowledge ≠ Truth) 抽取结果与企业承认的事实必须分层;候选断言默认不是世界模型。 禁止混用:数据质量差、幻觉(症状)。 所属层:跨层。

升级版数据产品(AI-ready Data Product) 面向机器消费的数据产品:契约、版本、语义、可追溯血缘。 禁止混用:AI 数仓、向量库项目。 所属层:跨层。

最小可行本体(Minimum Viable Ontology, MVO) 仅覆盖高价值域的实体、别名与关键规则的最小 Ontology。 禁止混用:完整 Ontology、术语表(过窄)。 所属层:跨层。

路线选择与适用边界(Decision Boundary) 跨层决策框架:判断各层应建到哪一档、何时降级或跳过某层。 禁止混用:架构选型(过宽)、技术栈对比。 所属层:跨层。

阿斯利华(Asliva) 全书虚构的创新药企案例公司。 禁止混用:阿斯利康、AstraZeneca、药明诺华、NovaPharm。 所属层:跨层。

公开药理空间(Public Pharmacological Space) 药、靶、病、化合物、活性等公开整合与映射,Open PHACTS 一类范式的后继挂载。 禁止混用:企业本体、企业主键。 所属层:跨层。

FAIR(Findable, Accessible, Interoperable, Reusable) 可发现、可访问、可互操作、可复用。本书把它写成不变量,不是海报。 禁止混用:数据治理(过宽)。 所属层:跨层。

2.2 Lakehouse 层

湖仓(Lakehouse) 科研数据产品落湖的底座,含契约、入湖阶段与入湖质检。 禁止混用:数据中台、仅指对象存储。 所属层:Lakehouse。

数据契约(Data Contract) 数据生产者与消费者之间显式的、可程序校验的约定。 禁止混用:数据协议(口语用法)、SLA(语义不同)。 所属层:Lakehouse。

入湖质检(IngestQA) 判断文档能否入库的闸门,与发版守门分开。 禁止混用:QualityGate、数据质量抽检。 所属层:Lakehouse。

发版守门(QualityGate) 判断知识图或本体发版能否通过的闸门。 禁止混用:IngestQA。 所属层:Scientific KG / Scientific Data Loop。

双线入湖(Dual-leg Ingest) Evidence 腿与 Knowledge 腿并行;文档不自动变成本体类。 禁止混用:ETL 双写、Lambda 架构。 所属层:Lakehouse。

2.3 Metadata Catalog 层

元数据目录(Metadata Catalog) 回答资产在哪、谁拥有、从哪条流水线来的企业数据上下文。 禁止混用:科学知识图谱、第二套本体。 所属层:Metadata Catalog。

数据血缘(Data Lineage) 数据从产生到消费的全链路可追溯关系。 禁止混用:数据流向(口语用法)。 所属层:Metadata Catalog。

2.4 Ontology Services 层

数据本体(Ontology) 机器理解企业业务世界的方式。 禁止混用:知识图谱、本体论、领域模型(语义不同)。 所属层:Ontology Services。

本体服务(Ontology Services) 把 Ontology 做成可解析、可映射、可发版的身份与词表服务。 禁止混用:图数据库、术语表。 所属层:Ontology Services。

业务世界模型(Business World Model) 企业与人类业务共识对齐的显式语义结构。 禁止混用:世界模型(强化学习中的环境动力学)、数字孪生。 所属层:Ontology Services。

实体(Entity) Ontology 中描述的业务对象。 禁止混用:对象(过宽)、表(语义不同)。 所属层:Ontology Services。

关系(Relation) Ontology 中实体之间的显式业务连接。 禁止混用:外键(语义不同)。 所属层:Ontology Services。

身份服务(Identity Service) 把文本或别名落到企业主键的单一入口。 禁止混用:NER、实体识别(过窄)。 所属层:Ontology Services。

企业主键(Enterprise Identifier) 企业内部稳定 CURIE,例如 ASH:ENT:DC:savolitinib。 禁止混用:UMLS CUI、BIOS ID、PubMed ID。 所属层:Ontology Services。

2.5 Scientific KG 层

科学知识图谱(Scientific Knowledge Graph) 已治理的科学知识运行时:身份、已验证关系、PROV、证据挂靠。 禁止混用:与 Ontology 等价、属性图、发现应用。 所属层:Scientific KG。

知识图谱(Knowledge Graph, KG) 一种以图结构组织知识的实现技术。 禁止混用:与 Ontology 等价。 所属层:Scientific KG(实现技术)。

候选断言(Extracted Claim) 抽取得到、尚未被企业承认的结构化断言。 禁止混用:已验证事实、知识边。 所属层:Scientific KG。

已验证断言(Validated Claim) 经策展承认、可物化进 knowledge 图的事实。 禁止混用:抽取结果。 所属层:Scientific KG。

2.6 Evidence Index 层

证据索引(Evidence Index) 回答「证据在哪」的检索与坐标层,与科学知识图谱分工。 禁止混用:向量库、RAG 产品、知识图谱。 所属层:Evidence Index。

检索增强生成(Retrieval-Augmented Generation, RAG) 在证据索引之上做检索与接地的一种消费方式。 禁止混用:向量检索(过窄)、与 Evidence Index 等价。 所属层:Evidence Index(消费方式)。

接地(Grounding) 生成前把输出对齐到企业事实。 禁止混用:事实核查(语义不同)。 所属层:Evidence Index。

引用(Citation) 生成后让输出可追溯到知识来源。 禁止混用:注释、参考(口语用法)。 所属层:Evidence Index。

引用优先(Citationware) 先确定来源再组织陈述的检索落地纪律。 禁止混用:脚注、参考文献列表。 所属层:Evidence Index。

2.7 AI Context APIs 层

上下文接口(AI Context APIs) 把治理过的语义世界暴露给仓外消费方的版本化接口。 禁止混用:BI 语义层、Agent 运行时、裸 SPARQL。 所属层:AI Context APIs。

面向智能体的数据契约(Data-for-Agent) 规定消费方能依赖哪些数据形态与字段,缺什么必须声明。 禁止混用:数据契约(湖表字段约定,过窄)、Prompt 模板。 所属层:AI Context APIs。

推理包(Context Pack) 为推理准备的已治理上下文:身份、关系、证据树、许可、缺失声明。 禁止混用:检索结果列表、提示词上下文窗口。 所属层:AI Context APIs。

语义层(Semantic Layer, SL) 本书中指 Ontology 的工程化访问面,由上下文接口承担。 禁止混用:BI 语义层、MetricFlow(实现选择)。 所属层:AI Context APIs。

BI 语义层(BI Semantic Layer) 面向人读报表的语义封装。 禁止混用:与本书语义层等价。 所属层:AI Context APIs(对照概念)。

AI 智能体(AI Agent) 仓外消费上下文接口的执行单元。本书不建造它。 禁止混用:本书的一层、机器人、助手。 所属层:对照概念(消费方)。

2.8 Scientific Data Loop 层

科学数据闭环(Scientific Data Loop) 研究系统到语义基座到 AI 消费到科学家审校再到知识回写的回路。 禁止混用:ETL、ELT、数据管道、再训练流程。 所属层:Scientific Data Loop。

反馈回流(Feedback Loop) 把消费结果反过来修正数据、证据与 Ontology 的机制。 禁止混用:数据回写(过窄)。 所属层:Scientific Data Loop。

数据本体演进(Ontology Evolution) Ontology 随业务与反馈持续生长;是闭环的一环,不是独立产品层。 禁止混用:模型迭代。 所属层:Scientific Data Loop。


三、禁止混用对照表

概念 A 概念 B 关系 强制选择
数据本体(Ontology) 科学知识图谱(Scientific KG) 图是本体的运行时投影之一 讨论世界怎么被理解用 Ontology;讨论已验证事实怎么存用 Scientific KG
公开药理空间 企业本体 公开层只 xref 企业主键用 ASH:ENT:*
证据索引 科学知识图谱 证据在哪 vs 已验证关系 检索用证据;推理关系用图
候选断言 已验证断言 抽取 ≠ 承认 进 knowledge 图必须已验证
上下文接口 BI 语义层 机器消费 vs 人读报表 仓外消费用上下文接口
推理包 检索结果 已治理上下文 vs 再搜一遍 推理吃 Pack
科学数据闭环 ETL / 再训练 知识层变厚 vs 搬运或调参 讨论回流用 Data Loop
阿斯利华 阿斯利康 虚构案例 vs 真实企业 正文叙事用阿斯利华
入湖质检 发版守门 能否入库 vs 能否发版 不得共用一个闸门

四、缩写表

缩写 展开 首次使用规范
DDA Data-Driven AI 数据驱动 AI(DDA)
RAG Retrieval-Augmented Generation 检索增强生成(RAG)
SL Semantic Layer 语义层(SL)
KG Knowledge Graph 知识图谱(KG)
FAIR Findable, Accessible, Interoperable, Reusable FAIR
MVO Minimum Viable Ontology 最小可行本体(MVO)
BI Business Intelligence 商业智能(BI)
CDC Change Data Capture 变更数据捕获(CDC)
ETL Extract-Transform-Load 抽取-转换-加载(ETL)
ELT Extract-Load-Transform 抽取-加载-转换(ELT)
API Application Programming Interface 应用编程接口(API)
LLM Large Language Model 大语言模型(LLM)
MCP Model Context Protocol 模型上下文协议(MCP)
CSR Clinical Study Report 临床研究报告(CSR)
SOP Standard Operating Procedure 标准操作规程(SOP)

缩写首次出现时,必须先给中文全称与英文全称,再用缩写。

示例:检索增强生成(Retrieval-Augmented Generation,RAG)。

后续直接用 RAG。


五、本文件的修订规则

修订一个术语的中文译法,需要:

  1. 全书搜索旧译法并替换。
  2. 更新禁止混用对照表。
  3. 更新缩写表。

新增一层需要:

  1. 在核心术语表中追加该层的小节。
  2. 确保该层术语与现有层术语无冲突。