Open-Source AI Battle, Google Throttles Meta, Micron Margins Moon

TBPN · 2026 年 6 月 29 日 · 2h21m
嘉宾:Edward Coristine & Tai Groot · Chad Rigetti · Pim de Witte · Yadin Soffer · Jack Morris · Neil Movva · Jakob Diepenbrock · Chris Altchek

为什么这期值得关注

本期 TBPN 是 2026 年 6 月最具信息密度的一集。三条主线交织——开源 AI 打破闭源领先的叙事、AI 算力瓶颈暴露、记忆芯片厂商攫取超额利润——再加上八位身处前沿的创始人和工程师的深度访谈。以下是你需要知道的:

GLM 5.2 改变棋局 中国开源模型首次在安全漏洞发现能力上匹配美国前沿模型。《华尔街日报》头版报道,华盛顿震动。
Google 掐住 Meta 算力 Google 无法满足 Meta 对 Gemini 的全部需求,导致该项目延迟——即使 Google 年投 2000 亿美元 CapEx。
Micron 万亿市值 DRAM 价格单季度涨 60%,NAND 涨 80%。AI 公司的成本正在大规模转移给记忆芯片厂商。
量子加速 AI 数据中心 Chad Rigetti 的新公司 Sigletree 正在构建量子加速 AI 服务器,目标几个数量级的训练加速。
万亿动作 token 的 AGI General Intuition 融资 3.2 亿美元,用游戏动作空间数据训练通用智能体。
AI 拯救慢性病 Cadence 融资 1 亿美元,用 AI 自动化心衰、高血压、糖尿病治疗——每周避免 270 万美元住院费。

开源 AI 重回牌桌:GLM 5.2 的冲击波

6 月 13 日,智谱 AI(z.ai)发布了 GLM 5.2——一个开放权重的 AI 模型。两周后,《华尔街日报》把这个故事放在了头版:"中国重塑与美国的 AI 竞赛,安全模型取得突破"。

核心数据令人侧目:安全公司 Semgrep 的基准测试显示,GLM 5.2 在安全漏洞发现能力上超越了 Anthropic 的 Claude Opus 4.8,并能与 Mythos 匹敌。这在几周前还不可想象——开源模型在安全这个最前沿的能力上追平了闭源。

但事情没那么简单。Tyler 指出了一个容易被忽视的细节:

"大多数人说 5.2 非常吃 token。在 per-token 基础上它便宜得多,但在具体任务上可能更贵。" — Tyler,TBPN 技术分析师

这就是"成本幻觉"——per-token 价格低不代表 per-task 成本低。GLM 5.2 的 token 消耗量远超闭源模型,使得实际任务成本并不如表面数字那样有优势。这和测试时计算扩展(test-time scaling)面临的是同一类问题:你可以烧 100 万美元算力让任何模型表现好,但这在真实企业场景中完全不可行。

AI 模型市场正在分化成沙漏形状:顶层是少数几个前沿模型(用于编程 Agent 和网络安全——"你付任何价格都要用最好的"),底层是大量超小型/超便宜模型(用于收据 OCR、欺诈检测等重复任务)。中间层——GLM 5.2 这个级别的模型——正在被挤压,找不到明确的商业用例。
Top 10GLM 5.2 在 OpenRouter 400+ 模型中使用量排名
60%DRAM 价格单季度涨幅
80%NAND 闪存价格单季度涨幅
$180亿Micron 客户一个季度多付的金额

蒸馏争议

GLM 5.2 的出色表现不可避免地引发了蒸馏的讨论。Tyler 指出,蒸馏模型一般泛化能力更差——基准测试分很高,但创意写作等难以 benchmark 的任务表现就差了。

更深层的问题是:随着互联网越来越多地被 LLM 输出填满,任何在公开数据上训练的模型都会不可避免地学习到闭源模型的"风味"。GitHub 上的开源仓库越来越多地被闭源模型重写,Amazon Kindle 书籍中也混入了 LLM 生成的"it's not this, it's that"的表达模式。广义上说,这构成了一种间接蒸馏。

Anthropic 曾公开指控阿里巴巴蒸馏其模型。与此同时,"灰色市场"正在专业化——有人专门收集多个 API 订阅,通过 VPN 大量调用模型来构建蒸馏数据集。这是一个越来越难以定义和监管的灰色地带。

Google 掐住 Meta 的算力命脉

《金融时报》的独家报道揭示了一个令人震惊的现实:Google 在 3 月左右告诉 Meta,无法提供后者想购买的全部 Gemini 容量。三位知情人士确认,这导致 Meta 部分内部 AI 项目被干扰和延迟。

令人震惊之处在于:Google 年投资 2000 亿美元在 CapEx 上,但需求——包括 Google 自身产品的需求——仍然超出了供应能力。AI 搜索概览可能消耗着 quintillion 级别的 token,YouTube 的 Gemini 视频互动、Gemini App 的免费和付费用户都在吞噬算力。

与此同时,ZeroHedge 报道 Meta 限制内部使用 Claude 和 Codex,理由令人玩味:担心蒸馏风险。这形成了一个奇特的局面——Meta 一边大量向闭源前沿实验室付费购买 API 访问(而他们自己开源 Llama 系列的初衷正是"商品化你的互补品"),一边又担心员工在内部使用这些 API 会导致意外蒸馏。

"Surging appetite for advanced models is turning computing power into the tech industry's scarcest commodity." — Financial Times

Instagram 拥有约 20 亿用户,即使每个用户只是"不小心滑进 LLM 驱动的搜索结果",产生的 token 消耗也是天量级别。Meta 在 Llama 4 和 Muse Spark 上的自有推理、再加上向 Google 和 Anthropic 购买的外部推理——这个需求结构解释了为什么 Meta 是 Google 限制政策中"受影响最严重"的客户。

巨大的利润转移:AI 公司的钱流向了记忆芯片厂商

《华尔街日报》商业版封面故事用一句话概括了这个现象:

"We are witnessing an extraordinary transfer of cash from the providers of AI and perhaps one day AI users to memory chip makers." — The Wall Street Journal,2026 年 6 月 29 日

具体数字令人咋舌:Micron 的 DRAM 芯片价格在截至 5 月 28 日的季度里较前三个月上涨超过 60%,NAND 闪存价格上涨超过 80%。仅这一个季度,Micron 客户就多付了 180 亿美元。而这一切发生在一个通常每年降价的行业——消费者去年买的内存现在价格翻了三倍,比 CPU 还贵。

类比非常精准:Micron、Samsung、SK Hynix 对 AI 公司的关系,就像石油生产商对航空公司——供应一种突然变得极其昂贵的关键投入品,因为高带宽内存(HBM)的产能扩张需要 3-5 年。

Micron 借此成为第一家总部在爱达荷州博伊西的万亿市值公司——爱达荷州比纽约、佛罗里达、奥斯汀都更早拥有了万亿市值公司。Barron's 的分析师 Adam Levine 认为股价可能再翻一倍,牛市逻辑很清晰:AI 数据中心的 HBM 需求远未见顶。

但这里存在一个深层矛盾:芯片厂赚钱是因为 AI 公司亏本烧钱——而 AI 公司的最终用户并没有以覆盖成本的价格支付服务。更高的投入成本意味着:要么亏损更大,要么提价赶走潜在客户。

Dario Amodei 三年前的警告

节目中重新播放了 Dario Amodei 2023 年在国会的证词片段——这段三年前的视频最近重新在网络流传:

"I'm very concerned about where things are going. If we talk about two to three years for the frontier models for the bio risks... I think the path that things are going in terms of the scaling of the open source models, I think it's going down a very dangerous path." — Dario Amodei(Anthropic CEO),2023 年国会证词

关键细节:他是在 2023 年说这番话的,所指的时间点是 2025-2026 年——也就是现在。值得庆幸的是,安全公司 CEO 们(CrowdStrike、Palo Alto Networks)已经在和 Mythos、GPT 5.5 Cyber 合作加固系统。闭源和开源之间的差距仍然存在,白帽黑客可以利用这个时间窗口在漏洞被黑帽利用前修复。

但如果差距不再扩大——正如 GLM 5.2 所暗示的那样——安全策略需要从根本上重新思考。"等开源追上来再修"可能不再是可行的假设。

深度访谈:八家前沿公司的关键洞察

National Design Studio — 政府的创业模式

Edward Coristine 和 Tai Groot 是政府机构里的"另类"——一周工作七天,靠红牛撑着,用创业公司的节奏推进项目。他们刚刚发布了 Ramparts:一个仅 15MB、完全在浏览器本地运行的 PII(个人身份信息)红化模型。

"我们本来只是在做一个聊天机器人,"Edward 说,"然后发现所有前沿模型都无法放进浏览器,所以无法在浏览器里做 PII 移除。个人数据需要离开你的设备,你就只能信任服务器——而这是产品失去信任的断点。"

他们尝试了 72 种基础模型,最终选择了 MiniLM 进行微调。团队已有成功案例:TrumpRX 拥有 1500 万用户,节省了超过 5 亿美元的药品成本。

Sigletree — 量子加速 AI 服务器

Chad Rigetti 是量子计算领域的老兵——他在 2014 年创立了 Rigetti Computing,2022 年通过 SPAC 上市。现在他带着新公司 Sigletree 回来了。

"This is not a factor of two or a factor of five increase that we're targeting with quantum acceleration inside the data center. It's several orders of magnitude." — Chad Rigetti,Sigletree 创始人兼 CEO

Sigletree 的独特之处在于其多模态量子硬件策略。不像 IBM(押注超导量子比特)、IonQ 和 Quantinuum(押注离子阱),Sigletree 认为没有一种量子硬件模态能满足所有 AI 负载需求——所以它从 AI 负载向后反推系统规格,组合使用多种量子技术。

"When we have quantum computers in the data center running production workloads, and you don't have to say 'that's a quantum computer' for someone to care — that's when quantum becomes mainstream." — Chad Rigetti

Chad 认为,把"瓦特高效地转化为智能"是量子计算的核心价值主张——这比"把数据中心放到太空"更根本,因为后者只改变了能源获取方式,没有改变计算复杂度本身。

General Intuition — 万亿动作 Token 的 AGI 路径

Pim de Witte 带着一个大胆的赌注回来了:General Intuition 融资 3.2 亿美元,正在训练一个通过预测动作来理解世界的 AI 模型。

"It's going to be like comparing coffee to water. This model is going to be incredibly good at navigating unforeseen environments." — Pim de Witte,General Intuition 创始人兼 CEO

核心数据:大约 1 万亿动作 token 的训练数据(作为对比,前沿 LLM 用 5-10 万亿文本 token)。与 Meta 的合作提供了关键优势——不仅是视频帧,还有精确的动作输入(走、开门、跳),由数千名人工标注员转换。

Pim 做出的一个大胆预测格外引人注目:

"If this is correct at scale, the supply chain will converge on gaming inputs instead of humanoid robots." — Pim de Witte

逻辑是:大多数机器人已经搭载了游戏手柄接口。如果 AGI 层的智能瓶颈通过动作预测模型被突破,为什么要追求复杂的人形形态?关键在于接口——而不是物理形态。

Tracer — 地下防御的新战场

Yadin Soffer 创造了"subterra"(地下防御)这个概念,并围绕它建立了 Tracer——全球第一家 subterra defense tech 公司。融资 2500 万美元种子轮。

他引用了 Palmer Luckey 的名言来阐述核心理念:"直径贵,长度免费。"增加隧道直径会指数级增加成本和工程量(更多泥土需要移除和处理),但增加长度几乎不增加边际成本。

Tracer 的军事应用场景:DARPA 最近发布 RFI,寻找"非动能穿透弹药"——能用冲击波方法诱导伊朗等国的地下设施坍塌。Tracer 的方案是特种部队在地面部署的近距离精确打击,而非空中投放。但目前的挑战是先推动五角大楼建立"subterra doctrine"(地下作战理论),然后才能争取大规模原型合同。

Engram — 让模型认识你的 AI

"The model doesn't need to get smarter every month — it needs to know you better." — Jack Morris,Engram 联合创始人兼研究负责人

Jack Morris 的观点一针见血:每次让 AI 执行任务时,它都要重新读取 100 份文件来了解你是谁——这本身就是在浪费 token。Engram 的持续学习方案让模型在"认识你"之后,可能只需要读 4 份文件。

早期客户包括 Microsoft、Notion 和 Harvey——都是拥有海量工作空间上下文、对 AI 有早期采用经验的企业。

Sail Research — 让 Token 极其充裕

Neil Movva 是 NVIDIA 十年老兵,曾经认为"游戏收入永远是 NVIDIA 最大业务"。现在他在做极致推理效率。

"Today I'd estimate it's like 80% of stuff is human in the loop and 20% is background. But that number is going to shift, and I actually expect the crossover to happen this year." — Neil Movva,Sail Research 联合创始人兼 CEO

Sail 只做开源模型的推理优化。GLM 5.2 的发布对他们来说是一个重要时刻。Neil 的商业哲学不是帮客户省钱——是让 ROI 好到客户愿意"花更多钱"。

Cadence — AI 自动化慢性病治疗

Chris Altchek 分享了本期最令人振奋的数字:

"We're catching about 20 strokes a week right now before the patients know that they're having a stroke." — Chris Altchek,Cadence 创始人兼 CEO

Cadence 正在用 AI 改变慢性病管理的范式:全美 90% 的心衰患者没有用对药——尽管用对药可以延长寿命 5-7 年。问题不是没有好医生,而是在一年内需要调整 5-7 次药物剂量,需要持续的血压、心率和体重监测,传统系统无法做到。

Cadence 的方案分三步:给患者配蜂窝联网的血压计和体重秤 → AI 分析全量医疗记录并开具处方调整(人类最终确认)→ 如果患者血压异常,语音 Agent 在 2.5 分钟内打电话做症状分诊。目前已经管理超过 10 万患者,每周为 Medicare 节省约 270 万美元住院费。

100K+患者正在被管理
$2.7M/周节省的 Medicare 住院费
~20次/周在患者察觉前拦截的中风
75岁患者平均年龄

更多精彩片段

Facebook 与 Yahoo 的失之交臂:2006 年 7 月,Mark Zuckerberg 口头同意以 10 亿美元将 Facebook 卖给 Yahoo。然后 Yahoo 宣布盈利预警,CEO Terry Semmel 把报价砍到 8 亿美元。两个月后恢复原报价,但 Zuckerberg 已经确信 Yahoo 不是认真的合作伙伴——他拒绝了。这也是一个关于"最好的创始人从不卖公司"这个命题的复杂注脚。

Roger Ebert 的粉丝文化终极解构:这位已故影评人在多年前写下了对粉丝文化最犀利的批判——"很多粉丝本质上是粉丝文化的粉丝。一切关于他们自己。如果有人愿意在街边人行道上搭帐篷排几周队只为第一个看到电影,那他们对搭帐篷露营的兴趣大于对电影的兴趣。"

欧洲游客眼中的美国:世界杯让荷兰球迷涌入了密苏里州的郊区,他们对 Costco 的体量、双车库、步入式衣帽间感到震惊。"这里的人好富有——也许这就是为什么他们如此友善。"一个英国小哥第一次吃 Chick-fil-A 时的评价:"Absolutely banging."

核心金句

"Open weight models are ideal for users who want unfettered access to systems they control, but they're also ideal for hackers who want to run them in the shadows." — The Wall Street Journal 对开放权重模型的描述
"We are witnessing an extraordinary transfer of cash from the providers of AI to memory chip makers." — The Wall Street Journal 商业版封面
"That marginal IQ point of the models is like extremely expensive." — Tyler,TBPN 技术分析师
"The only reason why we have a shot is because we have a dataset that nobody else has." — Pim de Witte,General Intuition
"When quantum computers are in the data center running production workloads and you don't have to say 'that's a quantum computer' for someone to care — that's when quantum becomes mainstream." — Chad Rigetti,Sigletree
"We're catching about 20 strokes a week right now before the patients know that they're having a stroke." — Chris Altchek,Cadence
"I'd estimate it's like 80% of stuff is human in the loop today and 20% is background. But the crossover will happen this year." — Neil Movva,Sail Research
"The model doesn't need to get smarter every month — it needs to know you better." — Jack Morris,Engram
"This is definitely the only place in the government where people who work seven days a week, consumed on Red Bulls." — Edward Coristine,National Design Studio
"If this is correct at scale, the supply chain will converge on gaming inputs instead of humanoid robots." — Pim de Witte,General Intuition
"A lot of fans are basically fans of fandom itself. It's all about them." — Roger Ebert,著名影评人
"A good rule is to never take out your phone to show someone a thing you're talking about. It will ruin the convo 100% of the time." — John Fiorentina,TBPN 社区成员(41,000 赞)