大模型常见术语解释
模型介绍页、API 文档和聊天软件里,经常把不同层面的东西放在一起:参数量是 32B,上下文是 128K,输出速度是 50 TPS,还能使用 RAG、调用工具、充当 Agent。
这些词并不都在描述模型本身。有的是模型结构,有的是接口限制,还有的是应用给模型接上的能力。如果不分开,很容易把“能联网”当成模型训练得更好,把“支持长上下文”当成永久记忆。
这篇按实际使用时会碰到的问题分类解释。数值例子只用来说明单位和计算方法,不代表某个产品的当前报价或速度承诺。
一、模型本身:LLM、参数量与训练
LLM:大语言模型
LLM 是 Large Language Model,大语言模型。常见文本生成模型根据已有上下文计算后续 Token 的概率,再逐步生成内容。指令训练等后续训练让它更适合问答、写代码和遵循要求。
“预测下一个 Token”描述的是生成机制,并不意味着它只会简单接词;但生成流畅也不证明内容正确。模型可以写出不存在的文献、函数或事实,这类看起来像真的错误输出常被称为幻觉(Hallucination)。
参数、权重与 B
参数是模型中的数值,训练会调整这些数值。讨论模型大小时说的“权重”,通常指这些学到的参数。它们不是按标题存放的文章,也不是能直接逐条查询的知识库。
参数量里的 B 是 Billion,十亿;M 是 Million,百万:
| 写法 | 参数数量 |
|---|---|
| 7B | 约 70 亿 |
| 32B | 约 320 亿 |
| 671B | 约 6710 亿 |
32B 不是 32GB。参数数量和文件体积还隔着数值精度、文件格式等因素。
参数多不保证每项任务都更强。数据、架构、训练方法和部署方式都会影响结果。选编程模型应该用编程任务测试,不能只按 B 排名;闭源模型没公开参数量时,也不要把猜测当成规格。
Dense 与 MoE:参数怎样参与计算
Dense 指稠密模型,相对于稀疏专家架构,主体参数会参与常规前向计算。MoE 是 Mixture of Experts,混合专家,它通过路由让每个 Token 使用部分专家模块。
因此,MoE 常同时标注“总参数”和“激活参数”。DeepSeek-V3 的官方模型卡给出的主模型规模是 671B 总参数,每个 Token 激活约 37B。前者描述完整规模,后者描述单个 Token 参与计算的部分。
这不等于普通的 37B 模型。部署仍要考虑完整权重,以及跨设备通信、缓存等开销,不能按激活参数直接算所需显存。
预训练、微调、蒸馏
**预训练(Pretraining)**是从大量数据中训练模型,形成基础能力的过程。
**微调(Fine-tuning)**是在已有模型上进一步训练,改变参数以适应任务或行为。监督微调(SFT)通常使用输入与目标输出示例;它不等于把文档上传到聊天窗口。
**蒸馏(Distillation)**利用教师模型的输出、分布或其他信号训练学生模型。目的可能是迁移能力或降低运行成本,不是把一个大模型的文件直接压缩成小文件。学生的效果仍要独立测试。
**推理(Inference)**在部署语境中指使用训练好的模型计算输出。它和聊天里的“开启深度思考”不是完全相同的概念:普通文本生成也在做推理计算。
二、内容容量:Token、提示词与上下文
Token 与 Tokenizer
模型会把文字转换成编号序列,其中的单位叫 Token,负责转换的工具叫 Tokenizer,分词器。
一个 Token 可能对应单词、词的一部分、标点,甚至字符的部分编码。中文没有固定的“一个字等于一个 Token”规则。不同模型使用不同分词器,同一段文本的数量也可能不同。
常见的英文“每 Token 约 4 个字符”只是粗估,不能直接用于中文、代码和所有模型。要准确计算,应使用对应模型的分词器;API 实际用量再看响应里的 usage。
图片和音频也可能有各自的编码与计费规则,不能根据文件大小直接套用文本换算。
Prompt、消息角色与历史对话
Prompt 是提示词,也就是引导本次生成的输入。它不一定只有你刚打的一句话,还可能包含系统要求、开发者说明、聊天历史、工具定义和检索资料。
常见聊天接口用角色组织消息:system 或 developer 说明行为要求,user 提供问题,assistant 保存模型输出,tool 携带工具结果。具体支持哪些角色及如何处理,由接口决定。
系统提示词有助于约束行为,但它不是权限系统。不能因为提示词写了“不允许查看”,就认为敏感数据已经安全隔离。
Context Window:上下文窗口
上下文窗口描述一次计算能够使用的 Token 范围。32K、128K、1M 表示数量级,不是字数。具体上限以文档为准,例如 128K 可能具体写成 128,000 或 131,072。
对常见接口,需要同时考虑输入和生成输出占用的预算。历史消息、系统提示词、资料和工具结果都可能占空间。
假设某接口总预算是 128,000 Token,输入用了 100,000,理论剩余空间只有 28,000。如果接口单独规定最大输出为 8,000,那么也不能生成 28,000。
**最大输出长度(Maximum Output Tokens)**是独立限制。设置 max_tokens、max_completion_tokens 或 max_new_tokens 等参数,通常是在规定上限,不是要求模型一定写满;这些字段的语义和支持情况不能跨接口直接照搬。
推理 Token 与“记忆”
Reasoning Tokens 指部分推理模型使用的内部推理 Token。以 OpenAI 相关接口为例,不可见的推理 Token 也会计入输出用量,因此两句话的最终答案可能对应更大的消耗。其他平台要看各自统计规则。
上下文不是永久记忆。聊天应用可能截断或摘要历史;所谓“长期记忆”也常由外部文件、数据库和检索系统实现,回答时再把信息放回上下文,并不是每轮聊天都在训练模型。
长上下文允许装入更多资料,但不保证模型准确使用每个细节。问长文中的具体事实时,应要求出处并核对原文。
三、速度与限制:TPS、TTFT、吞吐量
TPS:每秒 Token 数
聊天测速里的 TPS 通常是 Tokens Per Second,每秒生成 Token 数,也常写成 tokens/s 或 tok/s。它是速度指标,不是分词器。
假设要输出 600 Token,速度保持稳定:
| 速度 | 生成阶段耗时 |
|---|---|
| 50 TPS | 约 12 秒 |
| 30 TPS | 约 20 秒 |
这没有包含开始输出前的等待时间。不同模型的分词器也可能把同一段文字拆成不同数量的 Token,因此跨模型比较 TPS 时,还要考虑最终完成任务的实际时间。
TTFT、延迟与流式输出
TTFT 是 Time To First Token,从请求发出到收到首个 Token 的时间。排队、处理长输入、网络和部分模型的内部推理都可能增加等待。测评是否把推理内容算作首 Token,也要看定义。
Latency 是延迟,可能指首 Token 延迟,也可能指完整请求耗时。只写“延迟 2 秒”而不说明口径,信息是不完整的。
假设 A 等待 8 秒后以 50 TPS 输出 600 Token,总耗时约 20 秒;B 等待 1 秒后以 30 TPS 输出,总耗时约 21 秒。A 输出快,B 更早开始显示,两者体验不同。
Streaming 是流式输出,允许客户端逐步收到内容。它能让人更早开始阅读,但本身不保证计算更快。网络包和流式事件也未必与 Token 一一对应,不能按收到多少个事件直接算 TPS。
吞吐量、并发与批处理
Throughput 是吞吐量,衡量系统在单位时间完成的工作。服务器整体每秒处理上千 Token,不意味着你的单个请求也有上千 TPS。
Concurrency 是并发,表示同时处理多少请求;Batching 是批处理,把多个请求合并调度以提高资源利用率。整体吞吐量增加时,单个请求的等待或显存需求也可能增加。
比较服务时应在接近实际的输入长度、输出长度和并发下测试,并观察多次结果。不能拿空闲时的一次短回答代表高峰时的稳定表现。
RPM、TPM 与限流
RPM 是每分钟请求限额,TPM 是每分钟 Token 限额。两者与 TPS 的速度概念不同。
限制 60 RPM 的接口可能因为大量短请求触发限流;只发几个请求,也可能因输入太长先碰到 TPM。TPM 的输入、输出和预留预算如何计算,以服务商规则为准,不能直接除以 60 当成单请求速度。
触发限流常见 HTTP 429。相关状态码另见《AI 接口常见错误码》。
四、生成控制:Temperature、Top-p 与结构化输出
Temperature 与 Top-p
Temperature 是温度,影响下一 Token 的概率分布。低温度通常偏向高概率选项,高温度通常让输出更有变化。它不是智力开关:高温度不代表更聪明,低温度不保证正确,设为 0 也不应默认所有服务都能完全复现结果。
Top-p 是核采样,按累计概率选取候选集合。设为 0.9,通常是在考虑累计概率达到 90% 的高概率候选,不是把准确率设为 90%。
Top-k 则按候选数量限制选择范围,例如仅保留概率最高的 k 个候选。它与 Top-p 的累计概率概念不同,也不是每个 API 都支持。
没有明确需求时先使用推荐默认值,避免同时随意调多个采样参数。部分推理模型对这些字段有限制,“OpenAI 兼容”不代表每个参数都支持。
结构化输出与工具调用
Structured Output 是结构化输出,例如按指定 JSON Schema 返回字段。它主要约束格式,不能证明字段里的事实正确,应用仍需校验值、范围和业务规则。
Tool Calling 或 Function Calling 是工具调用:模型提出工具名和参数,由应用检查后执行,再把结果交回模型。模型生成了一段调用信息,不等于工具已经成功运行。
例如模型请求查询天气,应用执行请求并返回结果后,回答才有外部数据依据。涉及写文件、下单或转账时,权限和确认必须由执行层控制。
五、部署与费用:量化、缓存和 Token 计费
FP16、BF16、INT8、INT4 与量化
这些名称描述数值表示。FP16 和 BF16 都是 16 位浮点格式,但范围与精度分配不同;INT8 和 INT4 是 8 位、4 位整数表示,常见于量化方案。
Quantization 是量化,通过降低权重等数值的表示精度减少内存需求。它可能影响效果,能否加速还取决于硬件和推理程序。
以 7B 模型为例,只粗算权重:16 位时约 70 亿 × 2 字节 = 14 GB;4 位时约 70 亿 × 0.5 字节 = 3.5 GB。这是十进制单位的理论体积,不是部署显存要求。实际还有缩放系数、混合精度和运行开销。
KV Cache 与提示词缓存
KV Cache 保存推理过程中与前文相关的中间状态。更长的上下文和更多并发通常增加内存需求,所以权重能装下不代表模型一定能运行。
Prompt Caching 是提示词缓存,服务可复用相同输入前缀已计算的状态,降低重复处理的成本和等待时间。模型仍要根据新问题生成回答,并不是直接返回上次答案。
缓存有长度、有效期和匹配条件,重复上传同一文档也不保证命中。它与应用把完整答案存起来复用的“答案缓存”不同。
输入、输出与缓存输入费用
价格表里的 per 1M tokens 表示每百万 Token 的价格。输入、输出和缓存输入常分开定价。
假设输入每百万 Token 2 美元,输出每百万 8 美元,一次请求用了 10,000 输入和 2,000 计费输出:
输入费用 = 10,000 ÷ 1,000,000 × 2 = 0.020 美元
输出费用 = 2,000 ÷ 1,000,000 × 8 = 0.016 美元
合计 = 0.036 美元
实际还要检查缓存、推理 Token、图片、工具等费用。聊天会员月费与 API 余额通常是两套规则,购买会员不等于获得同额 API 额度。
六、知识与应用:RAG、LLM Wiki、Agent
Embedding、Chunk 与 Reranker
Embedding 是把内容转换成数值向量的表示,常用于语义检索。两个向量相近,表示在该表示空间里相似,不证明两段文字的事实相同。
Chunk 是文档片段,切片是把长资料拆成便于检索与放入上下文的小段。切得太碎可能丢掉例外条款和前后关系,切得太大可能带入无关内容。
Reranker 是重排序模型,在初步检索后重新判断候选与问题的相关性。它有助于筛选,但无法自动修复资料本身的错误。
RAG 与 LLM Wiki
RAG 是 Retrieval-Augmented Generation,检索增强生成。常见流程是先找到相关资料,把资料放进上下文,再让模型回答。检索可以使用关键词、向量或混合方式,不强制等于向量数据库。
LLM Wiki 是让模型协助把资料整理成持续维护、相互链接的知识页。它强调保留总结、比较和来源关系,而不是让有价值的分析只留在聊天记录里。Karpathy 的说明是一种工作方式,不是统一产品或标准协议。
两者默认都不改变模型参数,也可以结合:Wiki 页面进入检索系统,重要结论回到原始资料核对。它们的原理、维护成本与选型单独写在《RAG 与 LLM Wiki:两种 AI 知识库方式怎么选》。
Agent 与 Workflow
Agent 是智能体。这个词的用法很多,常指能根据目标动态决定步骤、调用工具并根据结果继续行动的系统。它通常包含模型、工具和控制逻辑,不能简单理解成另一款更大的模型。
Workflow 是工作流,通常由预先定义的路径组织步骤。例如“检索资料 → 生成摘要 → 校验字段”可以是固定工作流;让模型根据情况决定是否搜索、计算和重试,更接近动态 Agent。
一个产品可以同时使用两种方式。步骤明确时,固定流程往往更容易验证;需要动态探索时,才评估增加自主决策是否值得额外的延迟、费用与风险。
速查:这些术语分别在描述什么
| 分类 | 常见术语 | 不应混淆的地方 |
|---|---|---|
| 模型与训练 | LLM、B、Dense、MoE、SFT、蒸馏 | 参数数量不是文件体积,激活参数不是完整模型 |
| 内容容量 | Token、Prompt、上下文、最大输出 | Token 不是字数,上下文不是永久记忆 |
| 性能与限额 | TPS、TTFT、吞吐量、RPM、TPM | 输出速度、等待时间、整体吞吐量和额度是不同指标 |
| 生成控制 | Temperature、Top-p、Top-k | 采样设置不代表智力或正确率 |
| 部署与计费 | 量化、KV Cache、提示词缓存、usage | 权重体积不是全部显存,缓存状态不是缓存答案 |
| 知识与应用 | RAG、Wiki、工具调用、Agent | 使用外部资料不是重新训练,提出调用不是执行成功 |
读规格时先问:这个词描述的是模型、接口,还是外围应用?然后再看单位、限制和实际任务结果。这样比较两款产品时,才不会把不同层面的能力混成一个“更强”。