GLOSSARY.md¶
全书术语表¶
本文件是《Data-Driven AI:从数据到智能》的唯一术语来源。
所有章节作者与 AI 协作 Agent 写章节前,必须先查本表。
禁止使用本表以外的译法。
一、使用说明¶
1.1 术语首次出现¶
术语首次出现时,给中英文并列。
格式:中文(English)。
示例:数据本体(Ontology)。
1.2 术语后续出现¶
后续统一用中文。
除非该术语以英文缩写形式更常用,例如 RAG。
1.3 翻译权威¶
本表是唯一翻译源。
章节作者不得自创新译法。
1.4 禁止混用¶
禁止在同一章节混用同义词。
例如,同一章不得既用"数据本体"又用"本体论"。
1.5 修订规则¶
新增术语需要:
- 指定唯一中文译法。
- 给出一句话定义。
- 标注所属 DDA 层。
- 如有易混近义词,列入禁止混用对照表。
二、核心术语表¶
术语按 DDA 层分组。
每条格式:
中文术语(English, 缩写) 定义一句话。 禁止混用:近义词列表。 所属层:层名。
2.1 跨层总称¶
数据驱动 AI(Data-Driven AI, DDA) 以数据为起点的 AI 系统设计方法。 禁止混用:无。 所属层:跨层。
思维升级(Mindset Shift) 从「数据服务人」转到「数据服务机器」时,设计前提跟着换。 禁止混用:技能升级、能力转型。 所属层:跨层。
AI 原生(AI Native) 以 AI 系统为核心组织企业数据与流程的形态。 禁止混用:智能化、数字化。 所属层:跨层。
AI 原生科研数据基座(AI-Ready Scientific Data Foundation) 面向创新药研发的语义数据底座:湖仓、目录、本体、科学知识图谱、证据索引与上下文接口。 禁止混用:企业知识图谱项目、AI 数仓、发现平台。 所属层:跨层。
业务语义不可靠(Unreliable Business Semantics) 企业业务含义无法被机器稳定、一致、及时地消费的根本问题。 禁止混用:模型幻觉、数据质量差(多为症状或子集)。 所属层:跨层。
语义传递不可靠(Semantic Transmission Unreliability) 业务含义散落在多系统、多口径、多文档中,无法经单一来源稳定传给消费方。 禁止混用:网络故障、接口超时。 所属层:跨层。
语义时效不可靠(Semantic Temporal Unreliability) 业务世界持续变化,而 Ontology、口径、知识资产的定义滞后。 禁止混用:数据新鲜度延迟(仅为子集)、模型知识截止。 所属层:跨层。
知识不等于真理(Knowledge ≠ Truth) 抽取结果与企业承认的事实必须分层;候选断言默认不是世界模型。 禁止混用:数据质量差、幻觉(症状)。 所属层:跨层。
升级版数据产品(AI-ready Data Product) 面向机器消费的数据产品:契约、版本、语义、可追溯血缘。 禁止混用:AI 数仓、向量库项目。 所属层:跨层。
最小可行本体(Minimum Viable Ontology, MVO) 仅覆盖高价值域的实体、别名与关键规则的最小 Ontology。 禁止混用:完整 Ontology、术语表(过窄)。 所属层:跨层。
路线选择与适用边界(Decision Boundary) 跨层决策框架:判断各层应建到哪一档、何时降级或跳过某层。 禁止混用:架构选型(过宽)、技术栈对比。 所属层:跨层。
阿斯利华(Asliva) 全书虚构的创新药企案例公司。 禁止混用:阿斯利康、AstraZeneca、药明诺华、NovaPharm。 所属层:跨层。
公开药理空间(Public Pharmacological Space) 药、靶、病、化合物、活性等公开整合与映射,Open PHACTS 一类范式的后继挂载。 禁止混用:企业本体、企业主键。 所属层:跨层。
FAIR(Findable, Accessible, Interoperable, Reusable) 可发现、可访问、可互操作、可复用。本书把它写成不变量,不是海报。 禁止混用:数据治理(过宽)。 所属层:跨层。
2.2 Lakehouse 层¶
湖仓(Lakehouse) 科研数据产品落湖的底座,含契约、入湖阶段与入湖质检。 禁止混用:数据中台、仅指对象存储。 所属层:Lakehouse。
数据契约(Data Contract) 数据生产者与消费者之间显式的、可程序校验的约定。 禁止混用:数据协议(口语用法)、SLA(语义不同)。 所属层:Lakehouse。
入湖质检(IngestQA) 判断文档能否入库的闸门,与发版守门分开。 禁止混用:QualityGate、数据质量抽检。 所属层:Lakehouse。
发版守门(QualityGate) 判断知识图或本体发版能否通过的闸门。 禁止混用:IngestQA。 所属层:Scientific KG / Scientific Data Loop。
双线入湖(Dual-leg Ingest) Evidence 腿与 Knowledge 腿并行;文档不自动变成本体类。 禁止混用:ETL 双写、Lambda 架构。 所属层:Lakehouse。
2.3 Metadata Catalog 层¶
元数据目录(Metadata Catalog) 回答资产在哪、谁拥有、从哪条流水线来的企业数据上下文。 禁止混用:科学知识图谱、第二套本体。 所属层:Metadata Catalog。
数据血缘(Data Lineage) 数据从产生到消费的全链路可追溯关系。 禁止混用:数据流向(口语用法)。 所属层:Metadata Catalog。
2.4 Ontology Services 层¶
数据本体(Ontology) 机器理解企业业务世界的方式。 禁止混用:知识图谱、本体论、领域模型(语义不同)。 所属层:Ontology Services。
本体服务(Ontology Services) 把 Ontology 做成可解析、可映射、可发版的身份与词表服务。 禁止混用:图数据库、术语表。 所属层:Ontology Services。
业务世界模型(Business World Model) 企业与人类业务共识对齐的显式语义结构。 禁止混用:世界模型(强化学习中的环境动力学)、数字孪生。 所属层:Ontology Services。
实体(Entity) Ontology 中描述的业务对象。 禁止混用:对象(过宽)、表(语义不同)。 所属层:Ontology Services。
关系(Relation) Ontology 中实体之间的显式业务连接。 禁止混用:外键(语义不同)。 所属层:Ontology Services。
身份服务(Identity Service) 把文本或别名落到企业主键的单一入口。 禁止混用:NER、实体识别(过窄)。 所属层:Ontology Services。
企业主键(Enterprise Identifier)
企业内部稳定 CURIE,例如 ASH:ENT:DC:savolitinib。
禁止混用:UMLS CUI、BIOS ID、PubMed ID。
所属层:Ontology Services。
2.5 Scientific KG 层¶
科学知识图谱(Scientific Knowledge Graph) 已治理的科学知识运行时:身份、已验证关系、PROV、证据挂靠。 禁止混用:与 Ontology 等价、属性图、发现应用。 所属层:Scientific KG。
知识图谱(Knowledge Graph, KG) 一种以图结构组织知识的实现技术。 禁止混用:与 Ontology 等价。 所属层:Scientific KG(实现技术)。
候选断言(Extracted Claim) 抽取得到、尚未被企业承认的结构化断言。 禁止混用:已验证事实、知识边。 所属层:Scientific KG。
已验证断言(Validated Claim) 经策展承认、可物化进 knowledge 图的事实。 禁止混用:抽取结果。 所属层:Scientific KG。
2.6 Evidence Index 层¶
证据索引(Evidence Index) 回答「证据在哪」的检索与坐标层,与科学知识图谱分工。 禁止混用:向量库、RAG 产品、知识图谱。 所属层:Evidence Index。
检索增强生成(Retrieval-Augmented Generation, RAG) 在证据索引之上做检索与接地的一种消费方式。 禁止混用:向量检索(过窄)、与 Evidence Index 等价。 所属层:Evidence Index(消费方式)。
接地(Grounding) 生成前把输出对齐到企业事实。 禁止混用:事实核查(语义不同)。 所属层:Evidence Index。
引用(Citation) 生成后让输出可追溯到知识来源。 禁止混用:注释、参考(口语用法)。 所属层:Evidence Index。
引用优先(Citationware) 先确定来源再组织陈述的检索落地纪律。 禁止混用:脚注、参考文献列表。 所属层:Evidence Index。
2.7 AI Context APIs 层¶
上下文接口(AI Context APIs) 把治理过的语义世界暴露给仓外消费方的版本化接口。 禁止混用:BI 语义层、Agent 运行时、裸 SPARQL。 所属层:AI Context APIs。
面向智能体的数据契约(Data-for-Agent) 规定消费方能依赖哪些数据形态与字段,缺什么必须声明。 禁止混用:数据契约(湖表字段约定,过窄)、Prompt 模板。 所属层:AI Context APIs。
推理包(Context Pack) 为推理准备的已治理上下文:身份、关系、证据树、许可、缺失声明。 禁止混用:检索结果列表、提示词上下文窗口。 所属层:AI Context APIs。
语义层(Semantic Layer, SL) 本书中指 Ontology 的工程化访问面,由上下文接口承担。 禁止混用:BI 语义层、MetricFlow(实现选择)。 所属层:AI Context APIs。
BI 语义层(BI Semantic Layer) 面向人读报表的语义封装。 禁止混用:与本书语义层等价。 所属层:AI Context APIs(对照概念)。
AI 智能体(AI Agent) 仓外消费上下文接口的执行单元。本书不建造它。 禁止混用:本书的一层、机器人、助手。 所属层:对照概念(消费方)。
2.8 Scientific Data Loop 层¶
科学数据闭环(Scientific Data Loop) 研究系统到语义基座到 AI 消费到科学家审校再到知识回写的回路。 禁止混用:ETL、ELT、数据管道、再训练流程。 所属层:Scientific Data Loop。
反馈回流(Feedback Loop) 把消费结果反过来修正数据、证据与 Ontology 的机制。 禁止混用:数据回写(过窄)。 所属层:Scientific Data Loop。
数据本体演进(Ontology Evolution) Ontology 随业务与反馈持续生长;是闭环的一环,不是独立产品层。 禁止混用:模型迭代。 所属层:Scientific Data Loop。
三、禁止混用对照表¶
| 概念 A | 概念 B | 关系 | 强制选择 |
|---|---|---|---|
| 数据本体(Ontology) | 科学知识图谱(Scientific KG) | 图是本体的运行时投影之一 | 讨论世界怎么被理解用 Ontology;讨论已验证事实怎么存用 Scientific KG |
| 公开药理空间 | 企业本体 | 公开层只 xref | 企业主键用 ASH:ENT:* |
| 证据索引 | 科学知识图谱 | 证据在哪 vs 已验证关系 | 检索用证据;推理关系用图 |
| 候选断言 | 已验证断言 | 抽取 ≠ 承认 | 进 knowledge 图必须已验证 |
| 上下文接口 | BI 语义层 | 机器消费 vs 人读报表 | 仓外消费用上下文接口 |
| 推理包 | 检索结果 | 已治理上下文 vs 再搜一遍 | 推理吃 Pack |
| 科学数据闭环 | ETL / 再训练 | 知识层变厚 vs 搬运或调参 | 讨论回流用 Data Loop |
| 阿斯利华 | 阿斯利康 | 虚构案例 vs 真实企业 | 正文叙事用阿斯利华 |
| 入湖质检 | 发版守门 | 能否入库 vs 能否发版 | 不得共用一个闸门 |
四、缩写表¶
| 缩写 | 展开 | 首次使用规范 |
|---|---|---|
| DDA | Data-Driven AI | 数据驱动 AI(DDA) |
| RAG | Retrieval-Augmented Generation | 检索增强生成(RAG) |
| SL | Semantic Layer | 语义层(SL) |
| KG | Knowledge Graph | 知识图谱(KG) |
| FAIR | Findable, Accessible, Interoperable, Reusable | FAIR |
| MVO | Minimum Viable Ontology | 最小可行本体(MVO) |
| BI | Business Intelligence | 商业智能(BI) |
| CDC | Change Data Capture | 变更数据捕获(CDC) |
| ETL | Extract-Transform-Load | 抽取-转换-加载(ETL) |
| ELT | Extract-Load-Transform | 抽取-加载-转换(ELT) |
| API | Application Programming Interface | 应用编程接口(API) |
| LLM | Large Language Model | 大语言模型(LLM) |
| MCP | Model Context Protocol | 模型上下文协议(MCP) |
| CSR | Clinical Study Report | 临床研究报告(CSR) |
| SOP | Standard Operating Procedure | 标准操作规程(SOP) |
缩写首次出现时,必须先给中文全称与英文全称,再用缩写。
示例:检索增强生成(Retrieval-Augmented Generation,RAG)。
后续直接用 RAG。
五、本文件的修订规则¶
修订一个术语的中文译法,需要:
- 全书搜索旧译法并替换。
- 更新禁止混用对照表。
- 更新缩写表。
新增一层需要:
- 在核心术语表中追加该层的小节。
- 确保该层术语与现有层术语无冲突。