术语是路标,不是门槛。
正文以中文为主,第一次出现重要概念时保留英文。定义说明“是什么”,章节实验说明“怎么用、怎样失败”。
- 01人工智能 Artificial Intelligence
- 让机器执行通常需要感知、推理、学习、规划或生成等能力的研究与工程领域。
- 02算法 Algorithm
- 把输入转换为输出的一组明确步骤;算法本身不等于训练后的模型。
- 03模型 Model
- 从数据或规则中得到、用于预测或决策的数学结构及其参数。
- 04参数 Parameter
- 训练过程中被优化的数值,例如神经网络权重。
- 05超参数 Hyperparameter
- 由开发者或搜索过程设定、不是直接从单次梯度更新学得的配置。
- 06数据集 Dataset
- 带有明确来源、字段、许可和用途的一组样本。
- 07特征 Feature
- 模型使用的输入表示。
- 08标签 Label
- 监督学习中希望模型预测的目标值。
- 09训练 Training
- 用目标函数和优化方法调整模型参数的过程。
- 10推理 Inference
- 用已经得到的模型对新输入计算输出。
- 11损失函数 Loss function
- 把预测与目标之间的差异变成可优化数值的函数。
- 12目标函数 Objective
- 训练或决策希望最大化或最小化的量,可能包含多个损失和约束。
- 13梯度 Gradient
- 函数对多个变量的一阶变化率组成的向量。
- 14泛化 Generalization
- 模型在未参与训练、但与目标场景相关的数据上保持能力。
- 15过拟合 Overfitting
- 模型过度适应训练数据细节,导致新数据表现下降。
- 16欠拟合 Underfitting
- 模型或训练不足以捕捉任务中的重要结构。
- 17正则化 Regularization
- 通过惩罚、噪声或结构限制降低过拟合风险的方法。
- 18基线 Baseline
- 用于判断新方法是否真正改进的简单或既有方法。
- 19消融实验 Ablation
- 移除或替换系统一部分,观察它对结果的贡献。
- 20随机种子 Random seed
- 初始化伪随机数生成器的值;固定种子不是完整可复现性的替代品。
- 21张量 Tensor
- 带有一个或多个轴的数值数组。
- 22嵌入 Embedding
- 把离散对象映射到连续向量空间的表示。
- 23注意力 Attention
- 根据查询与键的匹配程度加权汇总值的机制。
- 24Transformer
- 以注意力、前馈层、残差和归一化为核心的序列模型架构。
- 25词元 Token
- 文本经过词元器切分后的基本单位,可是字符、子词或其他片段。
- 26上下文窗口 Context window
- 模型一次计算中能够直接处理的词元范围。
- 27基础模型 Foundation model
- 在广泛数据上训练、可适配多种下游任务的大规模模型。
- 28语言模型 Language model
- 为词元序列分配概率或预测后续词元的模型。
- 29检索增强生成 RAG
- 在生成前检索外部资料,并把证据提供给生成模型的系统模式。
- 30Agent
- 围绕目标执行观察、计划、工具调用、验证和停止循环的系统。
- 31提示注入 Prompt injection
- 不可信输入试图改变模型或Agent原定指令和权限的攻击。
- 32强化学习 Reinforcement learning
- 智能体通过与环境交互、基于奖励学习策略的方法。
- 33策略 Policy
- 在给定状态下选择动作的规则或概率分布。
- 34价值函数 Value function
- 从状态或状态动作对出发的预期累计回报。
- 35马尔可夫决策过程 MDP
- 用状态、动作、转移、奖励和折扣描述序列决策的形式框架。
- 36卷积 Convolution
- 用共享局部核在输入位置上滑动计算的运算。
- 37计算机视觉 Computer vision
- 让机器从图像或视频中提取、生成和使用信息的领域。
- 38自然语言处理 NLP
- 让计算机处理、理解、检索或生成人类语言的领域。
- 39自动语音识别 ASR
- 把语音波形转换为文字或其他符号序列。
- 40扩散模型 Diffusion model
- 通过学习逐步去噪过程生成样本的一类模型。
- 41生成对抗网络 GAN
- 通过生成器与判别器对抗训练学习生成分布的架构。
- 42图神经网络 GNN
- 在图结构上通过邻域聚合或消息传递学习表示的模型。
- 43校准 Calibration
- 预测概率与事件长期发生频率之间的一致程度。
- 44分布偏移 Distribution shift
- 训练、评估与部署数据分布不一致的现象。
- 45分布外 OOD
- 与训练或预期部署分布明显不同的输入。
- 46因果推断 Causal inference
- 在明确假设下估计干预对结果影响的方法。
- 47公平性 Fairness
- 围绕不同群体或个体的机会、错误、待遇和影响制定并审查的规范目标。
- 48鲁棒性 Robustness
- 系统面对扰动、噪声、故障或环境变化仍保持可接受行为的能力。
- 49可解释性 Explainability
- 为模型行为提供可理解说明的方法和性质;解释清楚不等于预测正确。
- 50差分隐私 Differential privacy
- 通过限制单条记录对输出分布的影响提供可量化隐私保证的框架。
- 51联邦学习 Federated learning
- 在数据留在多个设备或组织的情况下协同训练的范式。
- 52模型卡 Model card
- 记录模型用途、评估、限制和风险的结构化文档。
- 53数据表 Datasheet
- 记录数据来源、构建、用途、限制和维护方式的结构化文档。
- 54MLOps
- 管理机器学习数据、训练、部署、监控、版本和事故响应的工程实践。
- 55延迟 Latency
- 一次请求从进入到完成所需的时间。
- 56吞吐 Throughput
- 单位时间内系统能处理的请求或词元数量。
- 57量化 Quantization
- 用较低精度数值表示权重或激活以降低资源成本的方法。
- 58蒸馏 Distillation
- 让较小模型学习较大模型输出或内部结构的方法。
- 59并行训练 Distributed training
- 把训练计算、数据或参数分布到多个设备或进程。
- 60检查点 Checkpoint
- 保存训练状态以便恢复、评估或部署的版本化工件。
- 61可复现 Reproducible
- 他人依据充分工件和说明能够得到相容结果的性质。
- 62同行评审 Peer review
- 由相关领域同行对方法、证据和表述进行独立审查。
- 63置信区间 Confidence interval
- 按指定重复抽样程序构造、具有长期覆盖率解释的区间。
- 64p值 p-value
- 在零假设及检验假设成立时,观察到至少同样极端统计量的概率。
- 65效应量 Effect size
- 差异或关联实际大小的度量。
- 66熵 Entropy
- 概率分布不确定性的度量。
- 67交叉熵 Cross entropy
- 用一个分布编码另一个分布时的平均信息量,也是常见分类损失。
- 68KL散度 KL divergence
- 衡量一个概率分布相对另一个分布差异的非对称量。
- 69贝叶斯更新 Bayesian update
- 用似然把先验信念更新为后验信念。
- 70知识图谱 Knowledge graph
- 用实体、关系和属性构成的结构化知识网络。
- 71本体 Ontology
- 对领域概念、关系和约束的显式规范。
- 72搜索启发式 Heuristic
- 估计距离或代价、用于决定优先探索方向的函数。
- 73约束满足 CSP
- 为变量选择值,使所有约束同时满足的问题。
- 74SLAM
- 机器人同时定位并建立环境地图的问题。
- 75控制 Control
- 根据目标与反馈选择输入,使动态系统按期望演化。
- 76仿真到现实 Sim-to-real
- 把在仿真中得到的方法迁移到真实系统的过程及差距问题。
- 77世界模型 World model
- 学习环境状态和动作如何随时间演化的内部模型。
- 78多模态 Multimodal
- 联合处理文本、图像、音频、视频或动作等多种信息形式。
- 79AI for Science
- 使用AI辅助科学建模、模拟、实验设计、分析和发现的方向。
- 80人机协同 Human-in-the-loop
- 在系统关键环节保留明确人工检查、判断或控制权的设计。
- 81风险 Risk
- 事件发生可能性与后果的组合,必须结合具体情境评估。