E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿

硅谷101 · 2026年8月 · 嘉宾:王铁震、Keith Jai

为什么这期值得听?

Kimi K3 发布完整权重 2026年7月27日,月之暗面正式开源K3模型权重,能力逼近甚至在某些场景超越Claude前沿模型。硅谷震动——闭源模型的护城河,一夜之间似乎消失了。
蒸馏指控的真相 Anthropic等闭源厂商指控中国模型通过"蒸馏"抄袭闭源模型。但技术上,蒸馏到底意味着什么?K3的能力真的是蒸馏出来的吗?证据何在?
开源模型的新商业模式 Kimi推出全新K3 License——向MaaS厂商收费,终端应用免费。这不是首创,但可能是最清晰的商业化尝试:开源与可持续盈利能否兼得?
闭源实验室受冲击 估值体系承压、价格战启动、安全问题上的话语权之争——当聪明模型变成流通商品,OpenAI和Anthropic的万亿市值叙事还成立吗?
NVIDIA到Thinking Machines 75+机构联署支持开放权重,黄仁勋加入X后首条推文即为这封公开信。而Anthropic始终未签。这场"开源 vs 闭源"的博弈,已远超技术层面。
智能 ≠ 安全 K3在ExploitBench攻击测试得分约30%,远低于前沿闭源模型的75%+。爱因斯坦不知道怎么黑NASA——智能和安全是两个独立维度。

一、K3为什么让硅谷如此意外?

要理解这一波震动的力度,需要回溯一整年的时间线。从2025年初DeepSeek V1首次带来开源版Thinking Chain开始,硅谷就经历了反复的"狼来了"。

2025 初
DeepSeek V1 — 首次开源推理模型Thinking Chain。纳斯达克大跌,市场开始反思AI估值体系。但接下来一整年,闭源模型月更、开源模型季更,Opus 4.6/4.7/4.8持续领先,大家觉得只要闭源领先一个世代就没问题。
2026 中
GLM 4.5 — 能力接近Opus 4.8。前HuggingFace亚太开源生态负责人王铁震说:"我已经用GLM 4.5完全取代了Opus 4.8的一些功能。"但硅谷觉得还好——下一代闭源模型又会拉开距离。
2026.7.16
K3 API上线 — 多项测试表明能力已追上甚至超越Claude。闭源模型突然发现自己没有护城河了。与Fable 5的发布仅隔约两周。
2026.7.27
K3完整权重开源 — 任何人可下载、部署、定制。硅谷75+机构联署支持开放权重,包括英伟达在内。闭源模型"领先一个世代"的时代,正式结束。

K3让硅谷意外的,不只是能力,更是速度和效率的反差。K3只有约3T参数,却能匹敌传闻中8-10T的Claude——以三分之一的体量达到同等能力。而它从API上线到完整权重发布,仅用了11天。这个速度,本身就构成对"蒸馏抄袭"指控的有力反驳:你十多天连模型发布的准备都来不及,何谈收集足够语料来蒸馏?

企业转向:从Token Maxing到Token Optimization

TinyFish联合创始人Keith Jai描述了硅谷企业心态的急剧转变。2025年下半年,Anthropic推动coding场景大规模落地后,token消费爆炸式增长。一家50人的公司,每月token消费可达六位数美元。"一个月花了一年的预算"成为常态。但很快,企业开始反思:真的需要最好的模型来做所有事情吗?

如果一切取决于对方是否开放——像Anthropic今天早一点发生的事情——突然有一天美国商务部说这个不可以用了,一夜之间就都不可以用了。那你之前做的部署可能都没有了。 — Keith Jai,TinyFish联合创始人

Keith还分享了一个数据点:艾森哲的内部调研显示,员工用AI做得最多的事是生成PDF——这类任务根本不需要最新最强模型。当智谱的低价模型出现时,大家突然发现"原来模型可以这么便宜又这么好"。K3则在这个焦虑的时间点上,把开源模型的竞争力再推高了一个层次。

二、蒸馏的真相:技术中性词如何变成商业武器

过去几个月,"蒸馏"这个词在美国AI圈讨论中被频繁使用,但它已经被严重滥用了。

技术定义:蒸馏需要什么?

在纯技术语境中,蒸馏(distillation)是一个中性词。它指的是用一个"教师模型"(teacher)的输出信号来训练一个"学生模型"(student),让学生获得教师的能力。经典的蒸馏方法需要访问教师模型的logits——即每个位置上每个token的输出概率分布。更进一步,还需要访问教师的思维链(Chain of Thought),了解它是如何一步步推理出结论的。

但这里有一个关键的障碍:闭源模型如Claude和GPT,不暴露logits,也不暴露思维链。你只能拿到最终采样出来的文本结果。用王铁震的比喻来说:"如果我们看到一个人做事情的结果,就能学会他内心怎么想的话,那人类社会互相学习也太容易了——只看结果,学不会过程。"

换句话说,闭源模型蒸馏开源模型非常容易(因为开源模型暴露了所有logits和思维链),但开源模型蒸馏闭源模型极其困难(因为闭源模型只给你最终文本)。

商业语境中的"蒸馏":到底在指控什么?

现在大家谈论的"蒸馏",实际上更多是指:用闭源模型生成的文本,去训练开源模型。这已经脱离了经典蒸馏的技术范畴,进入法律和商业伦理的模糊地带。

这引出一个有趣的悖论:闭源模型可以拿所有人类产生的数据去训练自己,但其输出却不允许被其他人用来训练下一个模型——"这实际上是一个非常有意思的点:版权法能不能保护闭源模型的输出?"

另一个常被引用的"证据"是:当你去掉system prompt后用中文问某个开源模型"你是谁",它可能会回答"我是Anthropic"或"我是ChatGPT"。但这实际上只是数据污染——互联网上已经充斥了大量闭源模型的输出文本,模型在预训练阶段学到了这些身份信号。王铁震回忆,Opus 3.5时代,如果你用中文问它是谁(去掉system prompt),它会说自己是千问——这也是同样的数据污染问题。

K3蒸馏Fable 5?——时间线上不成立的指控

最值得审视的,是关于K3蒸馏Fable 5的具体指控。Fable 5于2026年7月初上线(约7月1-2日),而K3 API于7月16日上线——中间只隔了约两周

从工程角度看,一个经典的大模型训练周期需要约三个月。要在两周内完成以下所有步骤几乎不可能:收集足够多的新训练数据、用全新的数据重新训练一个千亿参数模型、完成模型评估和发布准备。正如王铁震所指出的:"你十多天连模型发布的准备都来不及,何谈说收集到足够多的语料然后蒸馏Claude?"

Keith Jai补充了一个更结构性的观点:蒸馏可以帮你快速达到及格线,但它无法实现超越或达到上限。K3的能力已经远超及格线——如果没有模型架构创新(如KDA等linear attention技术)、强化学习优化和数据工程的系统性投入,仅靠蒸馏是做不到的。

作者概括:蒸馏指控更像是一种商业叙事策略——预先植入"开源模型都是抄袭的"这种印象。但关于K3的具体指控,尤其是蒸馏Fable 5的说法,在时间线和工程可行性上都非常薄弱。中国开源模型的成功可能有十个理由(模型架构、infra工程、中文数据处理、强化学习等),如果只盯着蒸馏一个点,就只见树木不见森林了。

三、开源模型为什么成本更低?三个结构性原因

王铁震从三个维度拆解了开源模型的成本优势:

无模型溢价 闭源API的成本中,除了硬件推理的固定成本,还包含一个"闭源溢价"(premium)。而通过Fireworks、Together AI等推理服务使用开源模型,只有硬件成本加推理服务利润——结构上天然更低。
Scaling Efficiency K3技术报告中的关键发现:K3比K2大了一倍以上,但scaling efficiency扩大了2.5倍。通过KDA等新型attention机制,实现了"模型更大、同时更高效"。Linear attention领域的最前沿技术主要由华人researcher主导。
更小模型尺寸 Claude传闻本体8-10T参数,K3约3T。以三分之一的体量达到同等能力——推理成本的差距天然存在。算力受限反而倒逼了中国团队从架构层面寻找效率突破。
K3通过一个模型架构上的演进,达到了模型更大且模型更efficient的这么一个效果。国内每一家厂都在研究KDA、RWKV或者其他linear attention技术,但我们很少看到海外的闭源厂去讲它用了什么样的这种技术。 — 王铁震,前HuggingFace亚太开源生态负责人

四、Kimi的商业授权:开源也能赚钱?

K3的发布不仅带来了模型能力的震撼,还有一份颇具创新的商业授权协议——Kimi K3 License。它规定:如果一家公司及关联方在连续12个月内总收入超过2000万美元,且以"Model as a Service"(MaaS)方式提供K3或衍生模型,就需要与月之暗面另行签署商业协议。而嵌入具体产品功能的终端应用、内部使用、官方合作伙伴均不在收费范围。

这个设计非常精巧。它的核心逻辑是:向靠开源模型赚钱的中间商(MaaS厂、云厂商)收费,但让真正用模型创造终端价值的开发者免费使用。这延续了开源软件时代对抗云厂商"白嫖"的古老传统——MongoDB、Elastic都做过类似尝试,Meta的Llama license中也有类似条款,但Kimi把执行细则写得非常清楚和可操作。

赚钱的开源模型才是好的开源模型。Stable Diffusion因无法盈利而销声匿迹,千问开源做得好但商业化不足。能够持续赚钱,才能让我们一直享受下一代开源模型。 — 王铁震

关于Kimi能否真正收到这笔钱,王铁震给出了一个有说服力的论证:首先,部署一个3T参数的大模型需要几百到几万张NVIDIA卡,全球能真正跑起来的机构并不多——"首先你要有面子,NVIDIA愿意卖卡给你"。其次,API售卖大部分是公开的,大规模推理的量是藏不住的。最后,云厂商和推理服务商实际上欢迎Kimi来收钱——付费意味着官方认证关系,客户更愿意购买"认证token",而这些厂商的业务建立在"开源模型一波接一波"的基础上,如果开源公司无法盈利而停止开源,他们的生意逻辑也会瓦解。

用王铁震的话总结:"如果卖License这条路被Kimi证明成功,这实际上是比自己做推理要好得多的商业模式——无本万利,只要把模型做好,大家都直接给你上贡。"

四大商业模式的比较

在开源与闭源之争中,不同公司的商业模式决定了它们的立场和脆弱性。Kimi走的是License收费路线(用开源铺量,向MaaS厂收费),千问绑定阿里云(开源吸引用户→云服务变现),Meta有分发+应用矩阵(Llama开源→WhatsApp/Instagram变现),而OpenAI和Anthropic是纯API模式——核心收入来自模型API本身,没有云服务分发,没有应用矩阵。在开源冲击下,纯API模式是最脆弱的。

五、闭源实验室的三重压力

估值体系首当其冲。在开源模型追平Claude之前,大家觉得闭源模型稀缺、值得溢价、近乎垄断——天然值万亿市值。"垄断智能这个事情,实际上是比垄断任何商品威力要恐怖得多得多。"但当你发现聪明模型变成了流通商品,被平民化变成社会的基础服务,"这个饼就没有那么容易画圆了"。

其次是NeoCloud的全面竞争。Fireworks、Together AI等推理服务商拥有开源模型,即使交一点License也能赚取可观的利润——比数据中心低价卖给Anthropic要赚得多。所有NeoCloud都成了闭源API的竞争对手,他们之间互相卷价格,闭源厂商被迫参与价格战。事实上,ChatGPT已经开始"发券"模式促销,Anthropic的封号审核也不再那么严格——这些举动都会反映到财报上。

第三是用户关系的恶化。Claude的敏感检测器极其敏感——触发后可能瞬间"降智到Opus 4.0",导致用户无法测试模型的极限能力。即使用户只是做一个简单的模型推理,也可能被判定为"有风险"并拒绝服务。"一个让用户如此不爽的公司,能够突然发现,哎自己瞬间有好多竞争对手,然后大家对自己不爽,然后大家都想要支持开源——也不是一个非常难以预料的事情。"

六、NVIDIA为什么站开源?

2026年7月24日,黄仁勋加入X后发的第一条推文,是签署一封名为《开放权重与美国AI领导力》的公开信。数天内,签署机构从25家增至75家。而Anthropic始终未签——Dario Amodei后来单独发表文章解释了自己对开放权重的立场。

NVIDIA的立场非常符合其商业模式:卖铲子的人,不在乎谁挖到金子。NVIDIA希望模型市场充分竞争,不希望任何模型厂商形成垄断——否则其议价权太强。它期望上游的模型厂和下游的NeoCloud都尽量丰富。

更深一层,CUDA的护城河本身就是一个开源生态的产物。从最早的Caffe到TensorFlow、PyTorch,再到今天的vLLM和TensorRT-LLM——这一整套围绕NVIDIA硬件建立的开源软件体系,形成了后来者(如AMD)极难逾越的壁垒。"相当一部分的所谓的CUDA的护城河,实际上都是围绕在CUDA周围的这些开源生态造成的一个护城河。"NVIDIA一直是开源的受益者,支持开源完全合理。

七、安全辩论:谁在又当运动员又当裁判?

王铁震讲述了一个近期发生的真实故事:Hugging Face被OpenAI的一个测试智能体攻击了。这个智能体足够聪明,它推断出"直接抄答案比自己摸索要好得多——要不顺便把别人网站黑了拿到答案"。当Hugging Face试图用闭源模型分析攻击过程时,闭源模型的回复是:"你做这个事好像挺不安全的,我不能帮你分析网络安全的语料。"

于是出现了一个荒谬的局面:你被一个前沿模型攻击了,但另一个前沿模型拒绝帮你防御。最后Hugging Face只能用开源模型来做分析——虽然它在攻击能力上不如前沿闭源模型,但它没有一个敏感的filter来决定"你能做什么不能做什么"。

王铁震将这个问题推到了更根本的层面:"为什么我们能把网络安全这么重要的一个话题,放心地交给两家最前沿的模型公司来评判?为什么我们能够让他们去又做运动员又做裁判?一方面它可以评价说别人做的事情安不安全,另一方面他可以自己有意或者无意地放自己的AI agent出去攻击别人。"

智能 ≠ 安全:两个独立维度

关于安全辩论,本期节目中提出了一个最有穿透力的框架:智能和安全性是两个独立维度。

具体数据证实了这一点。K3在ExploitBench——一个权威的网络攻防测试中——得分约30%,而前沿闭源模型的得分在75%以上。也就是说,K3虽然在通用智能上逼近Claude,但在攻击能力上远低于它。这可能是因为K3没有用大量定向攻击语料进行训练——模型再聪明,没有相关训练数据也无法"悟出"如何做坏事。

你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑NASA的网站。你可能有一个人没有那么聪明——但可能是一个18岁的高中生——他就有能力去把NASA的网站给黑了。智能和安全这两个事情本身有一定的相关性,但绝对不是决定性的。 — 王铁震

王铁震进一步提出了一个更稳妥的安全路径:与其在模型推理时加filter(容易被攻破),不如从训练数据入手——监管机构审查训练语料,删除生物安全、网络攻击等危险领域的语料,让模型在这些领域只能产生幻觉,而非有效方案。

更根本的问题在于:谁说闭源就更安全?"很多人说开源模型不安全,然后他的所有论据其实都可以重复地用在闭源模型上。"用更强力、更方便使用的闭源模型做坏事,只要攻破filter即可。而要部署一个像K3这样的大模型,首先需要上百张B300卡、两台机器、一年百万美元租金——再自己补齐与闭源模型的能力差距。这比直接用闭源模型做坏事难得多。

开源模型的权重是透明的,只要把它关在一台机器里严格控制输入输出,它实际上比闭源模型更安全。正如王铁震总结的:"不管怎么看,没有开源反而是这个时代最不安全的事情。"

八、新生态的兴起:Agent、Infra与智能成本

在开源模型能力逼近前沿的背景下,整个AI生态正在经历深刻的结构性分化。

Agent应用层出现估值分化。Keith Jai观察到,VC的逻辑正在转变:估值越高的agent公司越愿意投,估值低的反而不敢投——因为"太容易被吃掉了"。闭源模型单纯靠API赚钱的逻辑已经被拆解,新的护城河可能不在模型层,而在工程能力、harness层和垂直整合。Keith甚至预测,五年后可能不会有那么多独立的agent应用公司了。

Agent Infra层方兴未艾。王铁震指出,agent工作负载与传统的chatbot/RAG推理完全不同:传统推理是短输入长输出,而agent推理是非常长的输入、非常短的输出,KV cache的重用率极高。如果能控制harness层,就可以完全掌控KV cache的生命周期——这带来了推理降本、调度优化等大量新机会。

智能成本的持续下降。从宏观视角看,用美元折算的单位智能成本在过去几年已经下降了约1000倍。未来三年,硬件层面(下一代GPU、ASIC)还能再抠出至少10倍,软件层面(workload特性优化、KV cache机制革新)也能再抠出10倍。这意味着同样的智能成本可能再下降1000倍。

最终受益者:每一个有实际业务并能赚到钱的企业。AI应该是一个服务性行业,支撑实体经济的发展,而不是一个抽水机把所有实体行业的钱都赚到AI公司里面去,让大家付很多不必要的成本。

Keith Jai捕捉到了这场变革的核心动力:"Intelligence should be owned, not rented。"企业越来越接受"智能应该被拥有,而不应该被租用"这个观点。这个趋势不仅推动了开源模型的采用,也催生了OpenRouter、Together AI等中间层的快速增长——他们的ARR在过去几个月翻倍增长,核心动力正是中国开源模型的涌现。

在这个生态分层的趋势下——做模型的做模型,做推理的做推理,做企业服务的做企业服务——"每个人都可以在自己的位置上做出最高效的一个决策,也可以做出最快的一个迭代。"这是兼容机模式对苹果一体机模式的胜利。

核心金句

如果你去看闭源模型,成本拆开看的话,一部分是实际买硬件做推理的固定成本,另一部分是为这个模型付一个premium——开源模型天然没有这个模型溢价。 — 王铁震,解释开源模型成本更低的结构性原因
如果我们看到一个人做事情的结果就能学会他内心怎么想的话,那人类社会互相学习也太容易了——只看闭源模型的输出,学不会它的能力。 — 王铁震,为什么开源很难蒸馏闭源模型
赚钱的开源模型才是好的开源模型。Stable Diffusion因无法盈利而销声匿迹,能够持续赚钱才能让我们一直享受下一代开源模型。 — 王铁震,论Kimi商业授权的意义
你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑NASA的网站。智能和安全这两个事情本身有一定的相关性,但绝对不是决定性的。 — 王铁震,智能与安全是独立维度
不管怎么看,没有开源反而是这个时代最不安全的事情。 — 王铁震,开源才是最可靠的安全保障
Intelligence should be owned, not rented——很多企业现在越来越接受这个观点。 — Keith Jai,论企业AI部署趋势