Open-Source AI Battle, Google Throttles Meta, Micron Margins Moon
为什么这期值得关注
本期 TBPN 是 2026 年 6 月最具信息密度的一集。三条主线交织——开源 AI 打破闭源领先的叙事、AI 算力瓶颈暴露、记忆芯片厂商攫取超额利润——再加上八位身处前沿的创始人和工程师的深度访谈。以下是你需要知道的:
开源 AI 重回牌桌:GLM 5.2 的冲击波
6 月 13 日,智谱 AI(z.ai)发布了 GLM 5.2——一个开放权重的 AI 模型。两周后,《华尔街日报》把这个故事放在了头版:"中国重塑与美国的 AI 竞赛,安全模型取得突破"。
核心数据令人侧目:安全公司 Semgrep 的基准测试显示,GLM 5.2 在安全漏洞发现能力上超越了 Anthropic 的 Claude Opus 4.8,并能与 Mythos 匹敌。这在几周前还不可想象——开源模型在安全这个最前沿的能力上追平了闭源。
但事情没那么简单。Tyler 指出了一个容易被忽视的细节:
这就是"成本幻觉"——per-token 价格低不代表 per-task 成本低。GLM 5.2 的 token 消耗量远超闭源模型,使得实际任务成本并不如表面数字那样有优势。这和测试时计算扩展(test-time scaling)面临的是同一类问题:你可以烧 100 万美元算力让任何模型表现好,但这在真实企业场景中完全不可行。
蒸馏争议
GLM 5.2 的出色表现不可避免地引发了蒸馏的讨论。Tyler 指出,蒸馏模型一般泛化能力更差——基准测试分很高,但创意写作等难以 benchmark 的任务表现就差了。
更深层的问题是:随着互联网越来越多地被 LLM 输出填满,任何在公开数据上训练的模型都会不可避免地学习到闭源模型的"风味"。GitHub 上的开源仓库越来越多地被闭源模型重写,Amazon Kindle 书籍中也混入了 LLM 生成的"it's not this, it's that"的表达模式。广义上说,这构成了一种间接蒸馏。
Google 掐住 Meta 的算力命脉
《金融时报》的独家报道揭示了一个令人震惊的现实:Google 在 3 月左右告诉 Meta,无法提供后者想购买的全部 Gemini 容量。三位知情人士确认,这导致 Meta 部分内部 AI 项目被干扰和延迟。
令人震惊之处在于:Google 年投资 2000 亿美元在 CapEx 上,但需求——包括 Google 自身产品的需求——仍然超出了供应能力。AI 搜索概览可能消耗着 quintillion 级别的 token,YouTube 的 Gemini 视频互动、Gemini App 的免费和付费用户都在吞噬算力。
与此同时,ZeroHedge 报道 Meta 限制内部使用 Claude 和 Codex,理由令人玩味:担心蒸馏风险。这形成了一个奇特的局面——Meta 一边大量向闭源前沿实验室付费购买 API 访问(而他们自己开源 Llama 系列的初衷正是"商品化你的互补品"),一边又担心员工在内部使用这些 API 会导致意外蒸馏。
Instagram 拥有约 20 亿用户,即使每个用户只是"不小心滑进 LLM 驱动的搜索结果",产生的 token 消耗也是天量级别。Meta 在 Llama 4 和 Muse Spark 上的自有推理、再加上向 Google 和 Anthropic 购买的外部推理——这个需求结构解释了为什么 Meta 是 Google 限制政策中"受影响最严重"的客户。
巨大的利润转移:AI 公司的钱流向了记忆芯片厂商
《华尔街日报》商业版封面故事用一句话概括了这个现象:
具体数字令人咋舌:Micron 的 DRAM 芯片价格在截至 5 月 28 日的季度里较前三个月上涨超过 60%,NAND 闪存价格上涨超过 80%。仅这一个季度,Micron 客户就多付了 180 亿美元。而这一切发生在一个通常每年降价的行业——消费者去年买的内存现在价格翻了三倍,比 CPU 还贵。
Micron 借此成为第一家总部在爱达荷州博伊西的万亿市值公司——爱达荷州比纽约、佛罗里达、奥斯汀都更早拥有了万亿市值公司。Barron's 的分析师 Adam Levine 认为股价可能再翻一倍,牛市逻辑很清晰:AI 数据中心的 HBM 需求远未见顶。
但这里存在一个深层矛盾:芯片厂赚钱是因为 AI 公司亏本烧钱——而 AI 公司的最终用户并没有以覆盖成本的价格支付服务。更高的投入成本意味着:要么亏损更大,要么提价赶走潜在客户。
Dario Amodei 三年前的警告
节目中重新播放了 Dario Amodei 2023 年在国会的证词片段——这段三年前的视频最近重新在网络流传:
关键细节:他是在 2023 年说这番话的,所指的时间点是 2025-2026 年——也就是现在。值得庆幸的是,安全公司 CEO 们(CrowdStrike、Palo Alto Networks)已经在和 Mythos、GPT 5.5 Cyber 合作加固系统。闭源和开源之间的差距仍然存在,白帽黑客可以利用这个时间窗口在漏洞被黑帽利用前修复。
但如果差距不再扩大——正如 GLM 5.2 所暗示的那样——安全策略需要从根本上重新思考。"等开源追上来再修"可能不再是可行的假设。
深度访谈:八家前沿公司的关键洞察
National Design Studio — 政府的创业模式
Edward Coristine 和 Tai Groot 是政府机构里的"另类"——一周工作七天,靠红牛撑着,用创业公司的节奏推进项目。他们刚刚发布了 Ramparts:一个仅 15MB、完全在浏览器本地运行的 PII(个人身份信息)红化模型。
"我们本来只是在做一个聊天机器人,"Edward 说,"然后发现所有前沿模型都无法放进浏览器,所以无法在浏览器里做 PII 移除。个人数据需要离开你的设备,你就只能信任服务器——而这是产品失去信任的断点。"
他们尝试了 72 种基础模型,最终选择了 MiniLM 进行微调。团队已有成功案例:TrumpRX 拥有 1500 万用户,节省了超过 5 亿美元的药品成本。
Sigletree — 量子加速 AI 服务器
Chad Rigetti 是量子计算领域的老兵——他在 2014 年创立了 Rigetti Computing,2022 年通过 SPAC 上市。现在他带着新公司 Sigletree 回来了。
Sigletree 的独特之处在于其多模态量子硬件策略。不像 IBM(押注超导量子比特)、IonQ 和 Quantinuum(押注离子阱),Sigletree 认为没有一种量子硬件模态能满足所有 AI 负载需求——所以它从 AI 负载向后反推系统规格,组合使用多种量子技术。
Chad 认为,把"瓦特高效地转化为智能"是量子计算的核心价值主张——这比"把数据中心放到太空"更根本,因为后者只改变了能源获取方式,没有改变计算复杂度本身。
General Intuition — 万亿动作 Token 的 AGI 路径
Pim de Witte 带着一个大胆的赌注回来了:General Intuition 融资 3.2 亿美元,正在训练一个通过预测动作来理解世界的 AI 模型。
核心数据:大约 1 万亿动作 token 的训练数据(作为对比,前沿 LLM 用 5-10 万亿文本 token)。与 Meta 的合作提供了关键优势——不仅是视频帧,还有精确的动作输入(走、开门、跳),由数千名人工标注员转换。
Pim 做出的一个大胆预测格外引人注目:
逻辑是:大多数机器人已经搭载了游戏手柄接口。如果 AGI 层的智能瓶颈通过动作预测模型被突破,为什么要追求复杂的人形形态?关键在于接口——而不是物理形态。
Tracer — 地下防御的新战场
Yadin Soffer 创造了"subterra"(地下防御)这个概念,并围绕它建立了 Tracer——全球第一家 subterra defense tech 公司。融资 2500 万美元种子轮。
他引用了 Palmer Luckey 的名言来阐述核心理念:"直径贵,长度免费。"增加隧道直径会指数级增加成本和工程量(更多泥土需要移除和处理),但增加长度几乎不增加边际成本。
Tracer 的军事应用场景:DARPA 最近发布 RFI,寻找"非动能穿透弹药"——能用冲击波方法诱导伊朗等国的地下设施坍塌。Tracer 的方案是特种部队在地面部署的近距离精确打击,而非空中投放。但目前的挑战是先推动五角大楼建立"subterra doctrine"(地下作战理论),然后才能争取大规模原型合同。
Engram — 让模型认识你的 AI
Jack Morris 的观点一针见血:每次让 AI 执行任务时,它都要重新读取 100 份文件来了解你是谁——这本身就是在浪费 token。Engram 的持续学习方案让模型在"认识你"之后,可能只需要读 4 份文件。
早期客户包括 Microsoft、Notion 和 Harvey——都是拥有海量工作空间上下文、对 AI 有早期采用经验的企业。
Sail Research — 让 Token 极其充裕
Neil Movva 是 NVIDIA 十年老兵,曾经认为"游戏收入永远是 NVIDIA 最大业务"。现在他在做极致推理效率。
Sail 只做开源模型的推理优化。GLM 5.2 的发布对他们来说是一个重要时刻。Neil 的商业哲学不是帮客户省钱——是让 ROI 好到客户愿意"花更多钱"。
Cadence — AI 自动化慢性病治疗
Chris Altchek 分享了本期最令人振奋的数字:
Cadence 正在用 AI 改变慢性病管理的范式:全美 90% 的心衰患者没有用对药——尽管用对药可以延长寿命 5-7 年。问题不是没有好医生,而是在一年内需要调整 5-7 次药物剂量,需要持续的血压、心率和体重监测,传统系统无法做到。
Cadence 的方案分三步:给患者配蜂窝联网的血压计和体重秤 → AI 分析全量医疗记录并开具处方调整(人类最终确认)→ 如果患者血压异常,语音 Agent 在 2.5 分钟内打电话做症状分诊。目前已经管理超过 10 万患者,每周为 Medicare 节省约 270 万美元住院费。
更多精彩片段
Facebook 与 Yahoo 的失之交臂:2006 年 7 月,Mark Zuckerberg 口头同意以 10 亿美元将 Facebook 卖给 Yahoo。然后 Yahoo 宣布盈利预警,CEO Terry Semmel 把报价砍到 8 亿美元。两个月后恢复原报价,但 Zuckerberg 已经确信 Yahoo 不是认真的合作伙伴——他拒绝了。这也是一个关于"最好的创始人从不卖公司"这个命题的复杂注脚。
Roger Ebert 的粉丝文化终极解构:这位已故影评人在多年前写下了对粉丝文化最犀利的批判——"很多粉丝本质上是粉丝文化的粉丝。一切关于他们自己。如果有人愿意在街边人行道上搭帐篷排几周队只为第一个看到电影,那他们对搭帐篷露营的兴趣大于对电影的兴趣。"
欧洲游客眼中的美国:世界杯让荷兰球迷涌入了密苏里州的郊区,他们对 Costco 的体量、双车库、步入式衣帽间感到震惊。"这里的人好富有——也许这就是为什么他们如此友善。"一个英国小哥第一次吃 Chick-fil-A 时的评价:"Absolutely banging."