第 12 节 / 共 12 节

附录:工程师速查

术语速查

概念 一句话
Token 模型处理的最小文字单位;字符到 token 的比例取决于具体 tokenizer
Tokenizer / BPE 把字符串切成子词的分词器,主流用字节对合并(BPE)
Embedding 把词变成向量(一串数字),语义相近的词向量相近
Self-Attention 让每个词"看看"上下文,更新自己的含义
Transformer Block Attention + FFN,是模型的一层,通常叠 N 层
KV Cache 缓存已算过的 K/V 向量,避免重复计算,但占显存
Prefill 一次性处理完整个输入 prompt,决定首字延迟
Decode 逐个生成 token,决定吐字速度
TTFT Time to First Token,首字延迟
TPS Tokens Per Second,吐字速度
Sampling 从概率分布里选下一个 token 的策略(贪心/Top-k/Top-p)
Temperature 采样温度,0 = 每次相同,>1 = 更放飞
量化 INT4 把每个参数压缩到 4 位,体积缩小 4 倍,精度略损
LoRA 轻量"补丁",插拔式给模型添加特定能力
MoE 专家混合,每个 token 只激活一部分参数(Mixtral / DeepSeek-V3 都是)
CoT Chain-of-Thought,在 prompt 里让模型一步步思考
Test-Time Compute 用推理阶段花更多算力换更好答案,是 o1/R1 一派的核心思路
RoPE 旋转位置编码,主流大模型的位置编码方案,支持长上下文外推
YaRN / NTK-aware 对 RoPE 做频率插值,把训练时的短上下文外推到更长
GQA 多个 Q 共享少量 KV,降低 KV Cache 显存开销
Residual Connection 残差连接,让深层网络能稳定训练的关键机制
Cross-Attention Decoder 查询 Encoder 输出,翻译/多模态融合的核心
蒸馏 小模型学大模型的概率分布(而非只学答案),传递"思维方式"

参数量 → 显存换算表(推理,仅权重)

选模型跑端侧/私有部署时最先要算的一件事:这个模型能不能塞进我的显存/内存里。

参数量 FP16(2 字节/参数) INT8(1 字节/参数) INT4(0.5 字节/参数)
1.5B 3 GB 1.5 GB 0.75 GB
7B 14 GB 7 GB 3.5 GB
13B 26 GB 13 GB 6.5 GB
70B 140 GB 70 GB 35 GB
671B(DeepSeek-V3) 1342 GB 671 GB 336 GB

注意:这只是理想权重占用,实际推理还要加量化元数据、KV Cache、运行时缓冲和系统余量。70B INT4 的理想权重就约 32.6 GiB,32GB 统一内存设备无法把它当成稳定可用配置;24GB 显存能否运行 13B INT4 或 7B FP16,也要连同上下文长度和推理引擎开销一起测。

量化损失参考表

精度 体积(相对 FP16) 典型质量损失
FP16 100% 基准
INT8 50% < 1%
INT4 25% 1%–3%(长上下文会累积放大)
INT2 12.5% 明显下降,多数场景不建议
读完继续 用互动实验验证上面的内容
11 · 互动实验 工程师速查

观察结论怎样随假设变化,并确认结果旁边始终保留计算口径。

100%