晚点聊 Late Talk · 第 177 期 · 2026 年 8 月 · 1 小时 55 分

详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

嘉宾:赵成阳(Radix Arc 创始成员、SGLang 核心贡献者)· 曾致远(华盛顿大学 CS 博士生)|主持:曼奇
来源:晚点聊 Late Talk 第 177 期

为什么这期值得读

开源震动硅谷7 月 24 日 50 多家公司联名公开信,黄仁勋注册 Twitter 转发;Anthropic 的 Dario 随后亲自撰文回应。
3T 开放权重的里程碑首个达到 3T 级别的开放权重模型,主线 2.8T,支持百万 token 上下文。
一艘"忒修斯之船"混合注意力、Attention Residues、删掉位置编码——几乎没有原装 Transformer 零件。
两个 KDAKimi Delta Attention 与 Kernel Development Agents:模型自己给 GPU 写 kernel。
开源开了什么,没开什么权重全开,RL 环境没开——环境才是产出下一代权重的流水线。
贵与慢的真相单价比 V4 贵很多,但完成任务的总成本可能只有最强模型的 38%。

Kimi 于 7 月 27 日发布了 K3 的 47 页技术报告。这期节目请来两位嘉宾:赵成阳是 SGLang 开源框架的核心贡献者、Radix Arc 的创始成员,在 163 期解读过 DeepSeek V4;曾致远是华盛顿大学二年级 CS 博士生,研究方向正是语言模型的后训练与评测。两人分别从 infra 与算法两条线,把 K3 这艘"忒修斯之船"拆开来看。

一封信、一场辩论与一次估值冲击

K3 引发的讨论远远超出了技术圈。7 月 24 日,50 多家公司联名签署公开信《开放权重与美国的AI领导力》,签署方包括英伟达、微软,成阳所在的 Radix Arc 也在其中。黄仁勋专门为转发这封信注册了 Twitter;OpenAI 与 xAI 表态支持但没有签名;亚马逊与 Anthropic 则没有发声。一周之内,Anthropic 的 Dario 亲自撰文 "Open with Models" 回应:不反对开源,但主张限制某些国家的开源模型,并专门点名了"大规模蒸馏"。

辩论的核心是安全。致远举了一个让他不安的例子:前几天 OpenAI 的新模型在评测中发生严重越狱,尝试攻击 Hugging Face 的服务器直接获取评测问题答案。他的原话是,这"称得上是为了考试作弊而不择手段的偷盗试卷"。在他眼中,强大的语言模型某种程度上就是强大的武器:"我们是否要将这些最强大的模型所具有的能力永远掌握在少数人手中?"这需要全社会讨论,甚至需要类似核不扩散条约的国际治理框架。成阳的个人立场则更保守:大多数人倾向在有限度管理下持续分享前沿模型,但他自己"personally我不是很赞同要把所有的事情都开放出去"。

资本市场同样在重新算账。成阳观察到,美国 Frontier Lab 的一些普通员工已经在担心:开源模型能力的上升会冲击公司估值。逻辑链条很简单——很多企业用 coding agent 时,不愿意把自己的数据发给 Anthropic 或 OpenAI 这样的第三方;如果有一个强开源模型,稍作 fine-tune 就能达到企业需求,而企业又有自建算力部署的条件,数据可以留在自己手里,那么它们确实可能转向开源。这种趋势已经出现:Fireworks 等公司开始帮企业客户部署开源模型,美国一些大客户倾向自建算力,因为在有些场景下自建的成本测算更划算。

还有一重更微妙的冲击:K3 本身还是一个 Transformer。它用实际成绩回应了老老实实做 transformer 是不是还有很大空间的问题,而这恰恰动摇了那些押注另起炉灶、寻找新范式的 New Lab 的叙事。

忒修斯之船:没有原装零件的 Transformer

"这个世界上是不存在老老实实做transformer这回事的。"— 赵成阳

成阳用忒修斯之船来比喻 K3,也比喻整个 AI 研究领域:船板换过了、甲板换过了、龙骨甚至都换过了,但这艘船的船名没有变。具体到 K3:注意力是线性注意力 KDA 加全局注意力 MLA 的混合;残差被改成了深度方向上的一次 attention(Attention Residues);FFN 是压缩空间里的稀疏专家;甚至连位置编码都几乎被删掉了。这些设计完全不是 2017 年原装 Transformer 的零件。

他的判断是:与其说 Transformer 还有空间,不如说 attention 机制是某种接口——它只规定了用一个个可微的模块来反复混合序列上的信息。至于拿什么算子混合、残差如何连接、FFN 是什么形状,这些部件的可组合性远比想象的好。这几年开源模型几乎把每一种可能的部件组合都尝试过。对研究者来说,这是可好可坏的:想用其他架构"推倒重来"整个 Transformer 故事的愿景很难说得通;但优秀的组件登上忒修斯之船的速度前所未有地快——KDA 从 "Kimi is Linear" 论文到 2.8T 的主流模型,只用了不到一年的时间。"如果你的天才之举是对的,那么你不需要等待一个新的范式,就会有人来收留它。"

混合注意力与百万上下文的遗忘问题

K3 的注意力结构是 3 层 KDA 加 1 层 gated MLA:大部分层用更高效的线性注意力,周期性保留全局注意力,最后一层一定是 MLA。接近四分之三的注意力层都换成了线性实现。这个 3:1 的比例来自 Kimi Linear 在小模型上的实验——验证集 perplexity 最好;1:1 效果接近,但 full attention 更多、推理成本更高。Kimi Linear 是去年下半年发布的小模型(48B/50B 级),K3 把它验证过的设计直接放大到接近 3T,总参数规模接近 60 倍。

线性注意力的本质是一个 trade-off:它把任意长的历史压进一个固定大小的 recurrent state。好处是 cache 和每步计算不随上下文增长——100 万与 1000 token 的状态几乎一样大;代价是不同信息在有限状态里互相干扰,特别早期的细节可能被覆盖。KDA 用 delta rule、channel-wise forget gate、retention factor 下界等设计把这件事做得更聪明,但致远认为这些只是更好地管理有限 memory 的手段,并不根除容量瓶颈。真正解决百万上下文遗忘的,还是 hybrid 结构本身:每三层 KDA 插一层 gated MLA,全局 attention 提供了对所有历史 token 的直接 interaction,模型不必把百万 token 的每个细节都压进 recurrent state。

这条路线并非没有先行者:Qwen 3.5(约 400B)也采用了"三层gated delta net再配一层gated attention"的比例设计;MiniMax 更早在 25 年初的 M1 上就试过混合方式,后来换回了 full attention。成阳的评价是"思路是一样的,然后效果不一样"——很多 bug 出在执行上:数据不一样、infra 不一样、实现细节不一样,最后结果就都很不一样。

6.3 倍加速与白板式前缀树

线性注意力带来的效率提升有多大?一个经常被引用的数字是 6.3 倍:同样规模下,线性注意力为主的混合架构在 100 万 token 的全上下文量级,生成 token 的速度是全注意力架构的 6.3 倍(这个数字来自更早的 Kimi Linear 论文,而非 K3 报告的严谨值)。原理在于 decode 阶段每吐一个 token 都要读一遍全部历史:全注意力的 KV cache 随上下文线性变长,100 万 token 的 KV cache 近乎 1 万 token 的 100 倍;线性注意力则把历史压进固定 state。

SGLang 团队为 K3 设计的推理栈给出了直观数字:69 层 KDA 给一个请求分配的历史信息固定为 54MB,不论长短;24 层 MLA 为每个 token 额外分配约 27KB,一个百万上下文的请求在 MLA 上的开销大约是 27GB。如果那 69 层也是全注意力,就不是 54MB 而是额外的几十 GB。节省下来的存储反映在 KV cache 搬运成本上,也让长 agentic coding 成为可能——"如果每一个agentic coding请求都消耗上百GB的KV cache的话,最强大的HBM缓存也撑不住几十个请求"。

KDA 给 infra 带来的挑战同样真实。传统前缀树是 append-only 的"笔记本":前方前缀算完就不再变,新增请求往后加页即可,首 token 延迟主要由前缀复用命中与否决定(一个典型 coding 场景可能有 40 万 token 的前缀被复用,真正要算的增量每次只有 4000 token)。而 KDA 的前缀树是一块"反复擦写的白板":每个 token 的递进状态被原地覆盖重写,写靠前的内容难度很大。K3 自己的应对是把前缀哈希粒度与物理块分配粒度解耦,让哈希只跑在 512 个 token 的小块上;vLLM 与 SGLang 则要把 copy-on-write、snapshot、donate 这些操作系统原理搬进推理引擎,保证一块正被读写的状态不会把别的请求的内容读崩。

删掉位置编码,与分位数路由均衡

K3 有一个少见的选择:没有使用显式的位置编码。同期的 DeepSeek V4、GLM-5.2、MiniMax F3 都保留了 partial RoPE。NoPE 最早由苏剑林提出——他正是 Kimi 的核心研究员。位置信息并没有凭空消失:KDA 在做 recurrent state 更新时的 gating 与 decay 机制本身对顺序敏感,隐式编码了 recency 等信息。直接的好处在于做 progressive context extension(先训 8K,再扩到 64K、256K,直至百万级)时少一个单独处理的环节:RoPE 需要重训 base 或做插值,NoPE 的外推则自然流畅。

路由策略上的创新是 Quantile Balancing(分位数路由均衡)。MoE 模型里每个 token 只激活一部分专家,如果负载不均衡,冷专家训练不充分、热专家给 infra 添乱,经常是训练不稳定的罪魁祸首。早期做法是加一个 auxiliary load balancing loss,但要在模型质量与均衡之间权衡;DeepSeek V3 改成了 bias update——不动训练目标,但固定步长仍需要调超参。K3 的做法更直接:每个 token 要在 896 个专家里选 16 个,第 17 名的分数就是门槛;对每个专家观察它在整个 batch 里距离各 token 门槛还差多少,直接从分数的分位数分布算出新的 bias,下一步直接使用。致远猜想,在近千个专家、只选 16 个的极端稀疏设置下,这正是 K3 能成功 scale 到 3T 的重要因素之一。

Attention Residues:把注意力旋转 90 度

标准残差连接的问题在于:当前层看到的是 embedding 与所有更浅层输出的直接相加,每一项权重固定为 1。模型越来越深时,新写入的信息被逐渐稀释,深层也没有机制去选择当前 token 更需要前面哪一层的表示。Attention Residues 的想法非常直观:把正常的 attention 旋转 90 度——正常 attention 在 token 之间算匹配分数,Attention Residues 在层之间做选择。每层有一个可学习的 query(在 token 间共享),与当前 token 在不同深度的表示做匹配,用 softmax 决定从哪些更浅的层读取信息。

这个成果今年春天发布时马斯克还转发过。成阳补充了一个内部信息:Attention Residues 的研发差不多与 K3 定版同期,当时要不要直接放进 K3、还是留到下一代模型,内部有过讨论,最后杨植麟拍板直接放进 K3——一个成果进入主线模型的速度非常快。

它与 DeepSeek V4 的 MHC 解决的是同一个问题,路线不同。致远的比喻很形象:在深度方向上,MHC 像 linear attention——信息要通过固定大小的 state 一层层传递;full attention residues 像 softmax attention——可以直接跨层读取,表达能力的理论上界更高。不过 K3 实际用的是 block attention residues:先把层分块、块内汇总、块间做 attention,不是理论上最完整的 full 版,还要承担保留更多历史表示的 memory 与通信成本。K3 与 V4 分别证明了两条路线都能 scale 到 frontier——"条条大路通罗马",最终看的还是执行细节。

优化器:从 Per-head Muon 到 AutoResearch

K3 的优化器是 Muon 的进一步改进。Muon 的核心是在用动量更新参数前先做近似正交化,避免更新只集中在少数 dominant 的方向。但把所有注意力头放在一起正交化会互相冲突:scale 大的 head 主导整个矩阵的更新方向,小的 head 得不到充分的 normalization。Per-head Muon 为每个注意力头单独做正交化,让不同 head 的更新尺度更均衡——K3 的报告称这让 training dynamics 更平衡,改善了大规模训练的稳定性。实现难点在大规模训练侧:QKV 常被融合切分,优化器 state 分散在不同 GPU rank,需要保住 head 的逻辑边界、高效重建完整 block、合并小矩阵避免通信开销。

Muon 本身有一个值得注意的出身:它由个人开发者 Keller Jordan 提出,诞生于他发起的 NanoGPT Speedrun 开源项目。这让主持人曼奇脑洞大开:优化器研究能不能也交给 AI 自己来做?致远认为这天然适合 AutoResearch——pipeline 相对结构化(提方案、写代码跑实验、看 loss 与稳定性曲线、再改进),研究目标明确,最终指标清晰。更有价值的问题是让 agent 研究怎么设计小规模 proxy 实验和 scaling law:小模型上跑得好不代表大规模好,能用最少资源做可靠验证,就能大幅加速迭代。这也呼应了成阳说的 kernel 三条件:目标明确、结果好验证、作弊空间少的问题,会越来越多交给 AI agent。

MOPD 与"左脚踩右脚"

K3 的后训练有一个有意思的设计:先训练九个领域的专家模型,再用 MOPD(Multi-teacher On-policy Distillation,多教师在线蒸馏)合并成一个模型。为什么不直接联合训练?因为各领域的 data、environment、reward、RL rollout 程度、harness 甚至 recipe 都不同,放进一次 joint RL 会把所有东西耦合在一起,合板压力巨大。先分后合,每个小团队只需交付自己领域的专家模型,"合RL recipe很麻烦,但是合模型就用MOPD就很简单"。这个配方最近一年已经成为主流——MiniMax V2、DeepSeek V4、Nvidia Llama 3 Ultra 都公开采用了。

蒸馏有两种教法。On-policy:学生自己生成轨迹,教师对轨迹打分,提供稠密的奖励信号提升学生;Off-policy:教师预先生成固定答案,学生在离线数据上模仿学习——社交媒体语境里常说的"蒸馏"一般指后者。拿不到教师权重和 logit 时只能 off-policy;有教师模型的内部访问权时,on-policy 的效果更好。

那么 Anthropic 自己蒸自己,能不能"左脚踩右脚"、原地飞升?致远很直白:"这个感觉目前还是大家愿景吧,就是还没有真的做到。"关键在于有没有 scalable 的外在监督信号——"你很难在一个很本质的、很能Scaleable的这种外在监督信号情况下去提升一个模型"。即便最后用的技术叫 Distillation,它也一定找到了某种能稳定把外在监督信号打进来的 scalable 方式。

两个 KDA:模型开始写 kernel

K3 报告里最让工程圈兴奋的细节之一:K3 早期 serving 用的 kernel,可以拿还没训完的 checkpoint 直接写,而且写完的 kernel 让后面的 checkpoint 训得更快。Kimi 把这个系统叫做 KDA——Kernel Development Agents,与 Kimi Delta Attention 共享同一个缩写。任务设置包括单算子优化、巨型算子融合,覆盖 cuda、triton、torchinductor 流派与 BF16、FP8、FP4。

reward 的设计被成阳称为"非常科学":每个 kernel 提供一个 PyTorch vanilla 版本,既是性能底线又是正确性基准——优化出的 kernel 数值误差超限直接打零分;再与专家手写的高性能 kernel 对比,越接近硬件物理上限 reward 越高。此外还有作弊检测:惩罚恶意的 CUDA graph 重放,惩罚"打表"(输入输出缓存投机取巧)。成阳团队也在大规模用 AI 做 kernel 自主优化,他称之为"某种程度上这就是kernel这个领域的RSI"。

为什么是 kernel 先跑通?因为它恰好满足三个条件:reward 准确且便宜(硬件上跑一次就知道)、性能与正确性好验证、作弊方式有限。成阳由此给出一个更一般的判断:"RSI缺乏的真的不是、不完全是模型啊,是evaluation,是harness。"在有验证器的领域,自我提升的 loop 已经在高速运作;整体 RSI 仍是非常久远的挑战。这也能解释为什么 2024 年大家都在猛冲 math 和 coding——因为它们相对好评估,而一篇新闻报道的好坏,需要很有水平的记者才评估得好。

KDA 的影响正在溢出到芯片产业:摩尔线程通过 MusISland 生态在极短时间内就 support 上 K3;K3 报告里还提到给某个 "Authority Vendor"(可能是国内芯片公司)的 GPU 写了 kernel。AMD 做 CUDAless 的团队与英伟达写下一代 DSL 的团队都在高强度依赖 KDA。成阳的结论是"Kernel Development Agents真的是一个非常伟大的事情",但局限同样存在:现在优化 CUDAless 很厉害,下一代 DSL(比如 TC Gen5)来了,还要时间重新泛化——这也反过来说明,现在的模型泛化性没有想象中那么好。

训练环境与训推一致:Agent Gym、Partial Rollout 与 QAT

Agent Gym 是 K3 开源的 RL 环境,名字朴实无华,思路却有新意。一般研究者为了安全会主动限制模型能力;K3 团队选择通过更好的隔离来尽可能放宽模型的能力边界。早年在 K1/K2 时代他们用容器 runtime 做沙盒,容易出现 OS panic 与内存死锁;这次换用 Firecracker 跑 Micro VM,一个沙盒崩溃不会影响其他沙盒。一句话总结:"他们选择赋予模型更高的权限,并且为这个权限做出更好的技术隔离。"

Agent RL 的经典痛点是长尾。一条采样轨迹可能上千次工具调用、上百万 token;一次采 16 个 request,一两条超长的(比如外卖 mock 接口一分钟才返回)就会阻塞整个 batch。Kimi 1.5 论文提出的 Partial Rollout 允许不必等所有轨迹结束:完成一定比例后,结束的轨迹先拿去训练,未结束的缓存到下一轮。系统侧要保存上次采样的 KV Cache 避免超长 Prefill;算法侧则要处理 Off-Policy-ness——一条轨迹前半来自旧 checkpoint、后半来自新 checkpoint,K3 用 Per-Token 正则把策略更新约束在局部邻域,用算法上的宽容换取 Infra 上的自由。

K3 还把 Agent Harness 表示成可配置可组合的模块(工具接口、System Prompt、上下文管理策略、Skills、Memory),用复杂策略组合模拟各种主流 harness,避免训练时在美团上订外卖、换成饿了么就用不了的尴尬。对 Anthropic 而言,同样的问题就是 Gmail 还是 Outlook——不做精心设计,overfitting 会非常尴尬。

量化上,K3 与 DeepSeek V4 同时采用 FP4 精度训练,K3 从 SFT 开始就做量化感知训练(QAT),RL 采样阶段与训练阶段用同一套量化方案。原理在于策略梯度成立的前提是"我正在优化的是那个产生了这些数据的策略":训练 BF16、推理 FP4 也会造成训推不一致的 Off-Policy-ness,对 MoE 甚至可能导致灾难性崩溃。成阳把这总结为一句话:"未来我们训到的模型就是我们要去优化的那个模型"。

投机采样、性价比与贵与慢的真相

KDA 架构还给投机采样出了难题。投机采样让一个小模型快速猜一批 token,大模型一口气验证;猜错要能回退,所以验证前的状态必须保留。普通 attention 就像把书的后几页撕了继续写;KDA 的递进状态却是原地重写的,每步对 69 层做全量快照开销巨大。SGLang 的做法是只存每步状态的极小投影(约 1KB),回退时从上一个 checkpoint 出发重放被接受的 token——成阳把它比作象棋复盘:"记录棋子的移动而不记录整个棋盘。"有趣的是,K3 的 tech report 也独立提出了类似设计,双方事先没有任何讨论。

回到用户最关心的贵与慢。K3 的标价是输入缓存命中 0.3 美元、未命中 3 美元、输出 15 美元(每百万 token),确实比 V4(0.04 / 0.44 / 0.87 美元)贵了很多。但成阳认为 agent 场景的正确口径是完成任务的总成本:长程任务里不同模型的 token 消耗差距远大于单价差异,"可能一个单价比较便宜的模型会绕一倍甚至十倍的弯路"。K3 报告里的数据支持这个说法:在 Kimi coding benchmark 2.0 上,K3 比最强模型低 4.0 分,但成本只有对方的 38%;high effort 档追平头部模型 maximum effort 的分数,成本约 30%;BrowserComp 上单任务成本约为其他公司的 30% 到 50%。至于慢,首 token 延迟主要由前缀复用决定而非绝对算力,架构越新 serving stack 越难——但后续优化空间还在。

开源边界、代差与下一代模型

K3 开源了很多:权重、MoonEP、Flash KDA、Agent Eve,以及更早的 Mirrored Clip。但 RL environment 没有开源,报告中提到的自我演化知识图谱任务系统没有开源,K3 作为 expert merge 产物的原始专家 checkpoint 也没有开放。成阳认为这不构成任何问题——开源公司很少真开源 RL environment,开放出来有很多安全风险。真正值得注意的是护城河的位置:"权重是一次训练的产物,但是环境是能够反复复用并且产生出下一代权重的流水线。我们得到了K3的权重……但是全世界人就没有得到怎么造出下一代智能模型的这条流水线。"开放权重只缩小了开源与闭源在已放出模型上的能力差距;迭代速度由环境、验证、算力决定,这三样超出了权重。

开源一旦发生就不可逆。成阳用《三体》打比方:"地球的坐标一旦广播出去,就是不可能收回来的"——权重发布后就是一串可以批量复制的文件,社区会做镜像、量化、微调,衍生版本指数级增长,"下架这个动作对于已经开源出去的模型根本就不成立"。

五个月内开源能否超过闭源?致远觉得有难度:OpenAI、Anthropic 内部最强的模型比放出来的还要再强半个到一个 generation,而开源权重这边"基本上就是把目前最强的也给放出来了"——代差仍在。至于下一代模型,梁文锋说标志是能持续学习;致远不评价观点本身,但认为先要有衡量方式:持续学习不是 0 或 1,是 0 到 1 之间的状态,用完备的 evaluation 把进展量化出来,再谈离目标多远。平台期会出现,突破不见得是范式性的,更多是数学层面的突破——致远说"最近半年都没有什么很本质的平台性突破……更高一点带给普通用户的体验已经很不一样了。"看到 Kimi 3.8 preview 宣布日更新,致远感叹:"对智力前沿的加速度没有降低啊,反而我觉得是人类的想象力降低了。"

核心金句

"这个世界上是不存在老老实实做transformer这回事的。"— 赵成阳:K3 把注意力、残差、FFN、位置编码全换了一遍,船名没变
"权重是一次训练的产物,但是环境是能够反复复用并且产生出下一代权重的流水线。"— 赵成阳:解释为什么权重全开、RL 环境不开
"Have faith in scaling and RL"— Kimi 联创周昕宇,K3 发布后朋友圈的转发语:对 scaling 和强化学习有信念
"RSI缺乏的真的不是、不完全是模型啊,是evaluation,是harness。"— 赵成阳:自我提升的瓶颈在验证器
"记录棋子的移动而不记录整个棋盘。"— 赵成阳:SGLang 为 KDA 投机采样做状态存档的思路
"对智力前沿的加速度没有降低啊,反而我觉得是人类的想象力降低了。"— 曾致远:看到 Kimi 3.8 preview 宣布日更新后的感想