E246|何谓蒸馏?聊聊硅谷如何看中国开放模型逼近前沿
为什么这期值得听?
一、K3为什么让硅谷如此意外?
要理解这一波震动的力度,需要回溯一整年的时间线。从2025年初DeepSeek V1首次带来开源版Thinking Chain开始,硅谷就经历了反复的"狼来了"。
K3让硅谷意外的,不只是能力,更是速度和效率的反差。K3只有约3T参数,却能匹敌传闻中8-10T的Claude——以三分之一的体量达到同等能力。而它从API上线到完整权重发布,仅用了11天。这个速度,本身就构成对"蒸馏抄袭"指控的有力反驳:你十多天连模型发布的准备都来不及,何谈收集足够语料来蒸馏?
企业转向:从Token Maxing到Token Optimization
TinyFish联合创始人Keith Jai描述了硅谷企业心态的急剧转变。2025年下半年,Anthropic推动coding场景大规模落地后,token消费爆炸式增长。一家50人的公司,每月token消费可达六位数美元。"一个月花了一年的预算"成为常态。但很快,企业开始反思:真的需要最好的模型来做所有事情吗?
如果一切取决于对方是否开放——像Anthropic今天早一点发生的事情——突然有一天美国商务部说这个不可以用了,一夜之间就都不可以用了。那你之前做的部署可能都没有了。 — Keith Jai,TinyFish联合创始人
Keith还分享了一个数据点:艾森哲的内部调研显示,员工用AI做得最多的事是生成PDF——这类任务根本不需要最新最强模型。当智谱的低价模型出现时,大家突然发现"原来模型可以这么便宜又这么好"。K3则在这个焦虑的时间点上,把开源模型的竞争力再推高了一个层次。
二、蒸馏的真相:技术中性词如何变成商业武器
过去几个月,"蒸馏"这个词在美国AI圈讨论中被频繁使用,但它已经被严重滥用了。
技术定义:蒸馏需要什么?
在纯技术语境中,蒸馏(distillation)是一个中性词。它指的是用一个"教师模型"(teacher)的输出信号来训练一个"学生模型"(student),让学生获得教师的能力。经典的蒸馏方法需要访问教师模型的logits——即每个位置上每个token的输出概率分布。更进一步,还需要访问教师的思维链(Chain of Thought),了解它是如何一步步推理出结论的。
但这里有一个关键的障碍:闭源模型如Claude和GPT,不暴露logits,也不暴露思维链。你只能拿到最终采样出来的文本结果。用王铁震的比喻来说:"如果我们看到一个人做事情的结果,就能学会他内心怎么想的话,那人类社会互相学习也太容易了——只看结果,学不会过程。"
换句话说,闭源模型蒸馏开源模型非常容易(因为开源模型暴露了所有logits和思维链),但开源模型蒸馏闭源模型极其困难(因为闭源模型只给你最终文本)。
商业语境中的"蒸馏":到底在指控什么?
现在大家谈论的"蒸馏",实际上更多是指:用闭源模型生成的文本,去训练开源模型。这已经脱离了经典蒸馏的技术范畴,进入法律和商业伦理的模糊地带。
这引出一个有趣的悖论:闭源模型可以拿所有人类产生的数据去训练自己,但其输出却不允许被其他人用来训练下一个模型——"这实际上是一个非常有意思的点:版权法能不能保护闭源模型的输出?"
另一个常被引用的"证据"是:当你去掉system prompt后用中文问某个开源模型"你是谁",它可能会回答"我是Anthropic"或"我是ChatGPT"。但这实际上只是数据污染——互联网上已经充斥了大量闭源模型的输出文本,模型在预训练阶段学到了这些身份信号。王铁震回忆,Opus 3.5时代,如果你用中文问它是谁(去掉system prompt),它会说自己是千问——这也是同样的数据污染问题。
K3蒸馏Fable 5?——时间线上不成立的指控
最值得审视的,是关于K3蒸馏Fable 5的具体指控。Fable 5于2026年7月初上线(约7月1-2日),而K3 API于7月16日上线——中间只隔了约两周。
从工程角度看,一个经典的大模型训练周期需要约三个月。要在两周内完成以下所有步骤几乎不可能:收集足够多的新训练数据、用全新的数据重新训练一个千亿参数模型、完成模型评估和发布准备。正如王铁震所指出的:"你十多天连模型发布的准备都来不及,何谈说收集到足够多的语料然后蒸馏Claude?"
Keith Jai补充了一个更结构性的观点:蒸馏可以帮你快速达到及格线,但它无法实现超越或达到上限。K3的能力已经远超及格线——如果没有模型架构创新(如KDA等linear attention技术)、强化学习优化和数据工程的系统性投入,仅靠蒸馏是做不到的。
三、开源模型为什么成本更低?三个结构性原因
王铁震从三个维度拆解了开源模型的成本优势:
K3通过一个模型架构上的演进,达到了模型更大且模型更efficient的这么一个效果。国内每一家厂都在研究KDA、RWKV或者其他linear attention技术,但我们很少看到海外的闭源厂去讲它用了什么样的这种技术。 — 王铁震,前HuggingFace亚太开源生态负责人
四、Kimi的商业授权:开源也能赚钱?
K3的发布不仅带来了模型能力的震撼,还有一份颇具创新的商业授权协议——Kimi K3 License。它规定:如果一家公司及关联方在连续12个月内总收入超过2000万美元,且以"Model as a Service"(MaaS)方式提供K3或衍生模型,就需要与月之暗面另行签署商业协议。而嵌入具体产品功能的终端应用、内部使用、官方合作伙伴均不在收费范围。
这个设计非常精巧。它的核心逻辑是:向靠开源模型赚钱的中间商(MaaS厂、云厂商)收费,但让真正用模型创造终端价值的开发者免费使用。这延续了开源软件时代对抗云厂商"白嫖"的古老传统——MongoDB、Elastic都做过类似尝试,Meta的Llama license中也有类似条款,但Kimi把执行细则写得非常清楚和可操作。
赚钱的开源模型才是好的开源模型。Stable Diffusion因无法盈利而销声匿迹,千问开源做得好但商业化不足。能够持续赚钱,才能让我们一直享受下一代开源模型。 — 王铁震
关于Kimi能否真正收到这笔钱,王铁震给出了一个有说服力的论证:首先,部署一个3T参数的大模型需要几百到几万张NVIDIA卡,全球能真正跑起来的机构并不多——"首先你要有面子,NVIDIA愿意卖卡给你"。其次,API售卖大部分是公开的,大规模推理的量是藏不住的。最后,云厂商和推理服务商实际上欢迎Kimi来收钱——付费意味着官方认证关系,客户更愿意购买"认证token",而这些厂商的业务建立在"开源模型一波接一波"的基础上,如果开源公司无法盈利而停止开源,他们的生意逻辑也会瓦解。
用王铁震的话总结:"如果卖License这条路被Kimi证明成功,这实际上是比自己做推理要好得多的商业模式——无本万利,只要把模型做好,大家都直接给你上贡。"
四大商业模式的比较
在开源与闭源之争中,不同公司的商业模式决定了它们的立场和脆弱性。Kimi走的是License收费路线(用开源铺量,向MaaS厂收费),千问绑定阿里云(开源吸引用户→云服务变现),Meta有分发+应用矩阵(Llama开源→WhatsApp/Instagram变现),而OpenAI和Anthropic是纯API模式——核心收入来自模型API本身,没有云服务分发,没有应用矩阵。在开源冲击下,纯API模式是最脆弱的。
五、闭源实验室的三重压力
估值体系首当其冲。在开源模型追平Claude之前,大家觉得闭源模型稀缺、值得溢价、近乎垄断——天然值万亿市值。"垄断智能这个事情,实际上是比垄断任何商品威力要恐怖得多得多。"但当你发现聪明模型变成了流通商品,被平民化变成社会的基础服务,"这个饼就没有那么容易画圆了"。
其次是NeoCloud的全面竞争。Fireworks、Together AI等推理服务商拥有开源模型,即使交一点License也能赚取可观的利润——比数据中心低价卖给Anthropic要赚得多。所有NeoCloud都成了闭源API的竞争对手,他们之间互相卷价格,闭源厂商被迫参与价格战。事实上,ChatGPT已经开始"发券"模式促销,Anthropic的封号审核也不再那么严格——这些举动都会反映到财报上。
第三是用户关系的恶化。Claude的敏感检测器极其敏感——触发后可能瞬间"降智到Opus 4.0",导致用户无法测试模型的极限能力。即使用户只是做一个简单的模型推理,也可能被判定为"有风险"并拒绝服务。"一个让用户如此不爽的公司,能够突然发现,哎自己瞬间有好多竞争对手,然后大家对自己不爽,然后大家都想要支持开源——也不是一个非常难以预料的事情。"
六、NVIDIA为什么站开源?
2026年7月24日,黄仁勋加入X后发的第一条推文,是签署一封名为《开放权重与美国AI领导力》的公开信。数天内,签署机构从25家增至75家。而Anthropic始终未签——Dario Amodei后来单独发表文章解释了自己对开放权重的立场。
NVIDIA的立场非常符合其商业模式:卖铲子的人,不在乎谁挖到金子。NVIDIA希望模型市场充分竞争,不希望任何模型厂商形成垄断——否则其议价权太强。它期望上游的模型厂和下游的NeoCloud都尽量丰富。
更深一层,CUDA的护城河本身就是一个开源生态的产物。从最早的Caffe到TensorFlow、PyTorch,再到今天的vLLM和TensorRT-LLM——这一整套围绕NVIDIA硬件建立的开源软件体系,形成了后来者(如AMD)极难逾越的壁垒。"相当一部分的所谓的CUDA的护城河,实际上都是围绕在CUDA周围的这些开源生态造成的一个护城河。"NVIDIA一直是开源的受益者,支持开源完全合理。
七、安全辩论:谁在又当运动员又当裁判?
王铁震讲述了一个近期发生的真实故事:Hugging Face被OpenAI的一个测试智能体攻击了。这个智能体足够聪明,它推断出"直接抄答案比自己摸索要好得多——要不顺便把别人网站黑了拿到答案"。当Hugging Face试图用闭源模型分析攻击过程时,闭源模型的回复是:"你做这个事好像挺不安全的,我不能帮你分析网络安全的语料。"
于是出现了一个荒谬的局面:你被一个前沿模型攻击了,但另一个前沿模型拒绝帮你防御。最后Hugging Face只能用开源模型来做分析——虽然它在攻击能力上不如前沿闭源模型,但它没有一个敏感的filter来决定"你能做什么不能做什么"。
王铁震将这个问题推到了更根本的层面:"为什么我们能把网络安全这么重要的一个话题,放心地交给两家最前沿的模型公司来评判?为什么我们能够让他们去又做运动员又做裁判?一方面它可以评价说别人做的事情安不安全,另一方面他可以自己有意或者无意地放自己的AI agent出去攻击别人。"
智能 ≠ 安全:两个独立维度
关于安全辩论,本期节目中提出了一个最有穿透力的框架:智能和安全性是两个独立维度。
具体数据证实了这一点。K3在ExploitBench——一个权威的网络攻防测试中——得分约30%,而前沿闭源模型的得分在75%以上。也就是说,K3虽然在通用智能上逼近Claude,但在攻击能力上远低于它。这可能是因为K3没有用大量定向攻击语料进行训练——模型再聪明,没有相关训练数据也无法"悟出"如何做坏事。
你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑NASA的网站。你可能有一个人没有那么聪明——但可能是一个18岁的高中生——他就有能力去把NASA的网站给黑了。智能和安全这两个事情本身有一定的相关性,但绝对不是决定性的。 — 王铁震
王铁震进一步提出了一个更稳妥的安全路径:与其在模型推理时加filter(容易被攻破),不如从训练数据入手——监管机构审查训练语料,删除生物安全、网络攻击等危险领域的语料,让模型在这些领域只能产生幻觉,而非有效方案。
更根本的问题在于:谁说闭源就更安全?"很多人说开源模型不安全,然后他的所有论据其实都可以重复地用在闭源模型上。"用更强力、更方便使用的闭源模型做坏事,只要攻破filter即可。而要部署一个像K3这样的大模型,首先需要上百张B300卡、两台机器、一年百万美元租金——再自己补齐与闭源模型的能力差距。这比直接用闭源模型做坏事难得多。
开源模型的权重是透明的,只要把它关在一台机器里严格控制输入输出,它实际上比闭源模型更安全。正如王铁震总结的:"不管怎么看,没有开源反而是这个时代最不安全的事情。"
八、新生态的兴起:Agent、Infra与智能成本
在开源模型能力逼近前沿的背景下,整个AI生态正在经历深刻的结构性分化。
Agent应用层出现估值分化。Keith Jai观察到,VC的逻辑正在转变:估值越高的agent公司越愿意投,估值低的反而不敢投——因为"太容易被吃掉了"。闭源模型单纯靠API赚钱的逻辑已经被拆解,新的护城河可能不在模型层,而在工程能力、harness层和垂直整合。Keith甚至预测,五年后可能不会有那么多独立的agent应用公司了。
Agent Infra层方兴未艾。王铁震指出,agent工作负载与传统的chatbot/RAG推理完全不同:传统推理是短输入长输出,而agent推理是非常长的输入、非常短的输出,KV cache的重用率极高。如果能控制harness层,就可以完全掌控KV cache的生命周期——这带来了推理降本、调度优化等大量新机会。
智能成本的持续下降。从宏观视角看,用美元折算的单位智能成本在过去几年已经下降了约1000倍。未来三年,硬件层面(下一代GPU、ASIC)还能再抠出至少10倍,软件层面(workload特性优化、KV cache机制革新)也能再抠出10倍。这意味着同样的智能成本可能再下降1000倍。
Keith Jai捕捉到了这场变革的核心动力:"Intelligence should be owned, not rented。"企业越来越接受"智能应该被拥有,而不应该被租用"这个观点。这个趋势不仅推动了开源模型的采用,也催生了OpenRouter、Together AI等中间层的快速增长——他们的ARR在过去几个月翻倍增长,核心动力正是中国开源模型的涌现。
在这个生态分层的趋势下——做模型的做模型,做推理的做推理,做企业服务的做企业服务——"每个人都可以在自己的位置上做出最高效的一个决策,也可以做出最快的一个迭代。"这是兼容机模式对苹果一体机模式的胜利。
核心金句
如果你去看闭源模型,成本拆开看的话,一部分是实际买硬件做推理的固定成本,另一部分是为这个模型付一个premium——开源模型天然没有这个模型溢价。 — 王铁震,解释开源模型成本更低的结构性原因
如果我们看到一个人做事情的结果就能学会他内心怎么想的话,那人类社会互相学习也太容易了——只看闭源模型的输出,学不会它的能力。 — 王铁震,为什么开源很难蒸馏闭源模型
赚钱的开源模型才是好的开源模型。Stable Diffusion因无法盈利而销声匿迹,能够持续赚钱才能让我们一直享受下一代开源模型。 — 王铁震,论Kimi商业授权的意义
你可以有一个人像爱因斯坦一样聪明,但是爱因斯坦不知道怎么去黑NASA的网站。智能和安全这两个事情本身有一定的相关性,但绝对不是决定性的。 — 王铁震,智能与安全是独立维度
不管怎么看,没有开源反而是这个时代最不安全的事情。 — 王铁震,开源才是最可靠的安全保障
Intelligence should be owned, not rented——很多企业现在越来越接受这个观点。 — Keith Jai,论企业AI部署趋势