← 返回全部文章
锻造手记 · 2026-08-13

开源第一,全球第三:拆开 Kimi K3 的 2.8 万亿参数,看它到底做对了什么

10 min read

图片展示了Kimi K3的架构相关内容。左侧文字说明Kimi K3拥有2.8万亿参数,每次只用1/175,且为开源第一、全球第三。还提到不吹不踩,拆开Kimi K3的两块地基,即拆架构。右侧是一个由黑色正方形组成的网格,其中部分正方形被橙色和绿色突出显示,可能代表模型中的不同组件或模块。该图片与文档中对Kimi K3架构探索的内容相关,直观呈现了其架构部分的结构。

月之暗面刚开源了 Kimi K3——2.8 万亿参数,综合能力全球第三、开源模型里第一。数字很唬人,demo 也很炸:连续自主跑 48 小时用开源 EDA 工具设计出一块 4 平方毫米的芯片,还渲染出了《星际穿越》里那样的黑洞。

但比起”遥遥领先”这类口号,我更关心一个更实在的问题:**它这 2.8 万亿参数,在架构上到底做了哪些事?这些事是不是真前沿?**所以我把它的官方技术稿、API 文档和几篇底层论文都翻了一遍。这篇不吹不踩,就客观拆两块最硬的地基——注意力和 MoE,尽量让有点基础的看到门道,没基础的也能看明白牛在哪。


一、2.8 万亿参数,但每次只用 1/175:超稀疏 MoE

先破一个最容易被”2.8 万亿”唬住的误区。如果每生成一个字都要把 2.8 万亿参数全算一遍,这模型贵到没人用得起。K3 用的是稀疏 MoE(Mixture of Experts,专家混合)——把一个巨大的前馈层拆成很多小的”专家”子网络,每次只激活其中几个。

具体数字:K3 内部有 896 个专家,但每处理一个 token,路由器只挑其中 16 个参与计算,其余 880 个不动。也就是说,总参数 2.8T,单次推理真正参与运算的激活参数只有约 1/175。这就是它敢做”参数最大的开源模型”、却还能给出可商用价格的根本原因——脑容量按 2.8 万亿算,单次账单按 16 个专家算。

MoE 不是新东西,把它做成工业级标准的一个关键参考是 DeepSeek。DeepSeekMoE 提出了两个如今被广泛沿用的动作:把专家切得更细(fine-grained expert segmentation),再单独隔离出几个常驻的”共享专家”(shared expert)承接通用知识,让其余专家去专精[DeepSeekMoE]。到 DeepSeek-V3,这条路被推到 6710 亿总参数 / 370 亿激活,并用”无辅助损失”策略做负载均衡[DeepSeek-V3 Technical Report]

K3 在同一条技术脉络上,把稀疏度推得更激进(896 选 16,激活比例远低于 V3 的约 1/18),并针对”高稀疏度下路由容易崩、专家容易旱涝不均”这个老大难,给了三个自研解法:

技术点它在解决什么做法
Stable LatentMoE高稀疏度下训练容易不稳定在隐空间做更稳的专家组织,让路由在极端稀疏下仍收敛
Quantile Balancing
分位数均衡传统负载均衡靠启发式更新 + 敏感的平衡超参,容易调崩直接按路由分数的分位数分配专家,绕开超参调优,天然均衡
Per-Head Muon大规模训练的优化器不够自适应把 Muon 优化器细化到按注意力头独立优化

官方给的效率账是:靠这套结构,相比上一代 K2,整体扩展效率提升约 2.5 倍。翻译过来就是——同样的算力,换回来更多能力。重点不在”参数堆得多”,在”每一分激活参数花得更值”。


二、注意力的”路线之争”:K3 押的是最硬的一条

如果说 MoE 还算走在一条被验证过的成熟路上,那注意力这块,K3 押的是一条连很多大厂都还在观望的路线。这也是我认为它含金量最高的地方。

2.1 为什么注意力是长文本的命门

标准 Transformer 的自注意力,每生成一个词,都要回头和前面每一个词两两计算相关度。序列长度记为 n,计算和显存都是 O(n²) 量级——长度翻倍,开销翻四倍。这就是”长上下文一直烧钱”的数学根源:上下文拉到几十万 token,平方级的成本就顶不住了。

破解方向叫线性注意力:不再让每个新词和历史里每个词都握一遍手,而是把历史压缩进一个固定大小的”状态”(可以理解成一份滚动更新的记忆摘要),新词只和这个状态交互,成本从 O(n²) 压到 O(n)。这条路这几年大致走过三代:

代际核心机制局限 / 代表
第一代用带衰减的记忆向量做递归更新,旧信息按固定节奏淡忘遗忘是”一刀切”的,记不住该记的(早期线性注意力 / RWKV 类)
第二代把记忆升级成一个状态矩阵,带衰减地累积信息吞吐好,但仍缺”定点修改”能力(Mamba / Mamba-2)
第三代引入 delta 规则:不再无脑衰减,而是定向擦除旧记忆、精准写入新记忆更接近”可控的读写”(DeltaNet / Gated DeltaNet)

2.2 KDA:把第三代又推进一格

K3 的注意力骨架叫 KDA(Kimi Delta Attention),它的血统很清楚——是 Gated DeltaNet 的升级款

先说 Gated DeltaNet:它的贡献是把门控(gating,用于快速、成片地擦除过时记忆)和 delta 规则(对特定内容做定向、精准的更新)结合起来,二者互补,在语言建模和长上下文任务上超过了 Mamba-2 与原始 DeltaNet[Gated Delta Networks]

KDA 在此之上做了两处关键改造:第一,把门控从”整个记忆状态共用一个衰减”细化到按通道(channel-wise)各自控制——相当于给记忆矩阵的每一维配了独立的遗忘旋钮,该忘的维度快忘、该留的维度慢忘;第二,用一种 DPLR(Diagonal-Plus-Low-Rank,对角加低秩)结构的转移矩阵来刻画状态演化,在保留细粒度控制的同时把计算摊平到硬件友好的形式。这套方法最早在月之暗面的 Kimi Linear 论文里系统提出,K3 把它用到了旗舰规模[Kimi Linear]。打个比方:Mamba 那代的记忆像”整块黑板定时擦一次”,KDA 则是给了你一支能精确到每个字、想擦哪擦哪的橡皮。这就是它敢扛 100 万 token 上下文的效率底气。

更值得说的是,这不是 Kimi 一家的孤注一掷,而是一场公开的路线赌局里,各家押了不同的注。你看今天做混合注意力的几家顶尖玩家,“记忆引擎”选型各不相同:

玩家线性注意力路线
阿里 Qwen3-NextGated DeltaNet
月之暗面 KimiKDA + MLA(多头潜在注意力)
蚂蚁 LingLightning Attention
英伟达 NemotronMamba-2

而且这些玩家不约而同收敛到同一个骨架:不是纯线性,而是”线性块 + 全注意力块”混搭,典型是 3:1——每 3 个线性注意力层配 1 个全注意力层。Qwen3-Next 和 Kimi Linear 都用了这个比例。线性层负责扛长度、省算力,少量全注意力层负责在关键处兜住精度(尤其是需要精确检索的场景)。一个配方能被多家独立收敛出来,往往说明它触到了真规律,而不是某一家的宣传话术。

2.3 AttnRes:让信息在深层网络里不失真

KDA 之外还有一个搭档:Attention Residuals(注意力残差,AttnRes)。传统深层网络里,表示是逐层均匀累加的——像传声筒,一句话传到第几十层,最初那点信息早被反复覆写得走样。AttnRes 改成有选择地跨深度去检索表示,而不是层层平摊叠加,相当于给深层开了一条能直接回取浅层原始信息的”电梯”,让信息在很深的网络里也能保持不失真地流动。月之暗面还配了两个辅助模块**:SiTU(Sigmoid Tanh Unit)**增强激活控制、Gated MLA 增强注意力的选择性。


三、除了架构,它还把”便宜好用”焊进了工程里

光有好架构,不等于能便宜地跑起来。真正让”最大的开源模型还能开出可用价格”落地的,是两处容易被忽略的工程取舍——一处在训练端省本钱,一处在推理端省账单。

第一处在训练端:K3 从 SFT 阶段就用上了量化感知训练——权重用 MXFP4、激活用 MXFP8 这种低精度格式直接参与训练,而不是训练完再回头压缩。机制上,这让模型天生就适配低精度硬件,推理时更省显存、能跑在更广的卡上。打个比方:别人是按高标准把楼盖好,再想办法塞进小房子;K3 是打地基时就按小房子的尺寸下料,省下的每一分显存,最后都变成你私有化部署时更低的门槛。

第二处在推理端:靠 Mooncake 分离式推理架构,在编程这种”长前缀被反复复用”的场景里,缓存命中率能超过 90%。反映到账单上——官方给的国内 API 定价是:输入命中缓存 2 元/百万 token、未命中 20 元/百万,输出 100 元/百万;而缓存一旦大面积命中,实际有效输入价可低到标准价的 1/4。更关键的是,100 万 token 的超长上下文不按长度分段涨价,统一按量计费。一句话:上下文给你顶到 100 万,钱却没跟着翻几十倍。这才是”开源第一”能落到实处、而不是只停在参数表上的原因。


四、水分在哪:客观说清边界

把它夸完,也得把边界划清,否则就成了另一种刷榜。K3 确实有”水分”,但水分不在造假,而在官方叙事的”选择性呈现”和测法口径:

  • **真实段位是”全球第三档”,不是”逼平最强”。**中立第三方 Artificial Analysis 的综合智能榜把它放在第 3 档,前面还有 Claude Fable 5 和 GPT-5.6 Sol。官方稿里那些”SOTA / 第一”,多来自单一榜单或自家口径,不是综合结论。
  • **部分亮眼分数是带条件拿的。**比如信息搜索项 91.2 的 SOTA,是用了 30 万 token 的上下文压缩才达到的,并非裸测;不同 benchmark 用不同测试框架,本就不是同一把尺子。
  • **震撼 demo 是”单点展示”不是”稳定水平”。**芯片、编译器、黑洞可视化都是精选案例,不进任何可复现的对比榜单。尤其黑洞——它渲染的是爱因斯坦 1916 年就给出的史瓦西度规闭式解 + 零测地线光线追踪,属于教科书级已知公式;模型的贡献是把人类早已算明白的公式自动誊写成能跑的代码并自主调试,物理拟真来自公式本身,而不是模型”理解”了黑洞。

所以别信”逼平世界第一”,它的准确定位就是四个字——开源第一,全球第三


五、但”全球第三”这四个字,已经很不容易

划完边界,我反而想把调子往上抬一抬。把镜头拉远看,“开源第一、全球第三”这个结果,本身就值得高兴。

它的意义不在”第几名”,而在差距的量纲变了:和最强闭源模型的距离,如今是用”几个月”来衡量,而不是”几个代际”。更关键的是,这几个月的差距,是靠实打实的架构探索换来的——KDA 押注了一条别人还在观望的注意力路线,超稀疏 MoE 把激活比例推到极限还能稳住训练。这些是在模型最底层的地基上做原创取舍,而不是表层调参。月之暗面甚至把带 prefill 缓存的 KDA 实现贡献回了 vLLM 开源社区,随权重一起放出来,让整个生态都能用上。

一个模型能不能长久领先,最终看的不是某次榜单名次,而是它敢不敢在地基层面下注、有没有能力把新架构做稳做出来。K3 在这两点上都给出了正面答案。它现在是第三,但站的位置和前进的方向,都对。

真正值得期待的问题也许是这个:当中国 AI 与世界最前沿的距离已经收窄到”几个月”,而且是靠原创架构在收窄——那再给它几个月,故事会走到哪里?

资料来源:月之暗面 Kimi K3 官方发布稿与 API 开放平台文档、第三方独立评测 Artificial Analysis;架构描述参考 DeepSeekMoE(arXiv 2401.06066)、DeepSeek-V3 Technical Report(arXiv 2412.19437)、Gated Delta Networks(arXiv 2412.06464)、Kimi Linear(arXiv 2510.26692)等公开论文,机制以原论文为准,结论为个人分析。