术语速查
| 概念 |
一句话 |
| Token |
模型处理的最小文字单位;字符到 token 的比例取决于具体 tokenizer |
| Tokenizer / BPE |
把字符串切成子词的分词器,主流用字节对合并(BPE) |
| Embedding |
把词变成向量(一串数字),语义相近的词向量相近 |
| Self-Attention |
让每个词"看看"上下文,更新自己的含义 |
| Transformer Block |
Attention + FFN,是模型的一层,通常叠 N 层 |
| KV Cache |
缓存已算过的 K/V 向量,避免重复计算,但占显存 |
| Prefill |
一次性处理完整个输入 prompt,决定首字延迟 |
| Decode |
逐个生成 token,决定吐字速度 |
| TTFT |
Time to First Token,首字延迟 |
| TPS |
Tokens Per Second,吐字速度 |
| Sampling |
从概率分布里选下一个 token 的策略(贪心/Top-k/Top-p) |
| Temperature |
采样温度,0 = 每次相同,>1 = 更放飞 |
| 量化 INT4 |
把每个参数压缩到 4 位,体积缩小 4 倍,精度略损 |
| LoRA |
轻量"补丁",插拔式给模型添加特定能力 |
| MoE |
专家混合,每个 token 只激活一部分参数(Mixtral / DeepSeek-V3 都是) |
| CoT |
Chain-of-Thought,在 prompt 里让模型一步步思考 |
| Test-Time Compute |
用推理阶段花更多算力换更好答案,是 o1/R1 一派的核心思路 |
| RoPE |
旋转位置编码,主流大模型的位置编码方案,支持长上下文外推 |
| YaRN / NTK-aware |
对 RoPE 做频率插值,把训练时的短上下文外推到更长 |
| GQA |
多个 Q 共享少量 KV,降低 KV Cache 显存开销 |
| Residual Connection |
残差连接,让深层网络能稳定训练的关键机制 |
| Cross-Attention |
Decoder 查询 Encoder 输出,翻译/多模态融合的核心 |
| 蒸馏 |
小模型学大模型的概率分布(而非只学答案),传递"思维方式" |
参数量 → 显存换算表(推理,仅权重)
选模型跑端侧/私有部署时最先要算的一件事:这个模型能不能塞进我的显存/内存里。
| 参数量 |
FP16(2 字节/参数) |
INT8(1 字节/参数) |
INT4(0.5 字节/参数) |
| 1.5B |
3 GB |
1.5 GB |
0.75 GB |
| 7B |
14 GB |
7 GB |
3.5 GB |
| 13B |
26 GB |
13 GB |
6.5 GB |
| 70B |
140 GB |
70 GB |
35 GB |
| 671B(DeepSeek-V3) |
1342 GB |
671 GB |
336 GB |
注意:这只是理想权重占用,实际推理还要加量化元数据、KV Cache、运行时缓冲和系统余量。70B INT4 的理想权重就约 32.6 GiB,32GB 统一内存设备无法把它当成稳定可用配置;24GB 显存能否运行 13B INT4 或 7B FP16,也要连同上下文长度和推理引擎开销一起测。
量化损失参考表
| 精度 |
体积(相对 FP16) |
典型质量损失 |
| FP16 |
100% |
基准 |
| INT8 |
50% |
< 1% |
| INT4 |
25% |
1%–3%(长上下文会累积放大) |
| INT2 |
12.5% |
明显下降,多数场景不建议 |
读完继续 用互动实验验证上面的内容 开始练习 ↓