导语:8月,五源资本合伙人孟醒从旧金山机场驶上101高速。湾区广告牌从两年前的SaaS、去年的消费品牌,变成清一色AI公司。钱、卡、人仍在涌入AI,但更意外的是,硅谷核心研究者开始说出过去很难听到的判断:“打不过国内。”

图一:Kimi也加入了旧金山“AI广告牌”大战;图二:Codex的广告牌在旧金山越来越多,花了血本与Claude Code竞争。
“打不过国内”:从核心圈传出的新判断
几位OpenAI的朋友复盘过去一年押错方向,也拆解中国模型公司强在哪;Google做多模态的researcher直接说“打不过国内”。xAI和其他frontier lab的人,以及研究美国开源模型的人,也有类似判断。这里的“打不过国内”指向具体方向:多模态看Seedance,开源盯K3,有人看到数据和operation。Google王牌多模态团队被砍算力,Nano Banana、Veo(现Omni)虽在美国第一梯队,但不少人转方向。过去用一张榜单、一条scaling curve给中美模型排总名次的方式,已经失效。
预训练:方法论接近,差距在卡和系统工程
中国模型公司补得最快的是“爬ladder”:先在小模型验证数据、架构和训练方法,再逐级scale。几位frontier lab预训练朋友称,今年国内头部Lab的scaling ladder已明显完善,训练方法越来越科学。因此预训练呈现反直觉状态:中美差距看起来仍大,但方法论已接近,剩下主要是卡和系统工程经验。最前沿预训练仍需巨量算力,美国Lab跑过更多超大规模训练,有更多卡、更成熟集群,更清楚几万张GPU跑起来后会出现什么问题。
Frontier Lab算力重心正快速转移,预训练占比持续下降,后训练/RL快速上升。过去拼把模型“训出来”,接下来越来越多算力花在让模型“变得更好”和真正跑起来。
后训练:大规模RL、human operation与蒸馏分化
后训练不是统一方法。中美最容易拉开差距的地方有三项:大规模RL、human operation和蒸馏。最难补的是大规模RL。前沿后训练一次Big Run可能同时占用上万张卡,一个任务连续跑上千步,任何环节不稳定都可能让整条trajectory报废。中国过去卡少,也没跑过足够多这种规模RL,差距反而比预训练方法论更深。
但目标清楚后,就需要大量人把数据、标注、评测和反馈铺出来。Seedance是好例子。字节拥有最终视频分发平台,更容易知道什么叫“好”:什么运镜用户喜欢、什么人物一致性不可接受、哪种生成结果有人愿意发出去。OpenAI和Google的朋友把这种差距概括为operation能力。Meta最近组建约6500人的内部团队Applied AI,大量员工被调去出题、造场景、做评测。
蒸馏是第三种。DeepSeek训练R1时,用RL后的模型生成并筛出约60万条推理数据,再配合约20万条来自V3的非推理数据,回头重新训练V3-Base。今年几家frontier lab开始集体关掉完整CoT输出,但门关得并不严。5月有研究者发现,即使完整CoT被隐藏,推理信息仍可能通过加密reasoning block泄露,Anthropic、OpenAI、Google三家均中招。还有美国Neo lab在蒸馏K3。
但Coding没有呈现多模态式优势。它更依赖大规模RL。代码能否运行、测试能否通过、任务是否完成,结果清楚,但一条trajectory到上千步,最后往往只拿到成功或失败,困难在credit assignment。Anthropic很多高质量Coding数据来自内部100多名很强coder,普通Claude Code用户数据反而嘈杂。这类任务要精锐,不是人力越多越好。因此后训练很难简单归结为“谁operation强就一定更强”。
Neo lab祛魅:跳车之后,旧地图失效
“Thinking Machines Lab经历的所有痛苦,其他Neo lab都会再经历一遍。”过去两年,Neo lab是硅谷最昂贵的创业方式:最顶尖researcher从OpenAI、Google、Anthropic跳出,VC跟着人下注。没有产品、没有收入也没关系,只要团队足够豪华,先给几亿美元再说。但无论TML还是SSI,今天结果都低于预期。一位长期看frontier lab的投资人感叹:“上一波在美国融到大钱的顶级Neo lab们,没有一家做出来。”
TML成立五个月、没有产品和收入,就融了20亿美元,投后估值120亿美元,是史上最大种子轮。去年11月又按500亿美元估值谈新一轮,有人报到600亿。两个月后,CTO和核心成员离职回OpenAI,那轮融资未落地。直到最近,TML才又开始谈400亿美元估值新融资。估值虽在涨,但新一轮数字已低于去年底想要的价格。
更意外的是,TML自己人也觉得公司从一开始就有很强“拼起来”的感觉。几位联创想做的东西差很远:Mira Murati更想做enterprise,Lilian Weng对interaction model更感兴趣,John Schulman更偏纯research。官网宣言是各写一段再拼起来,最后选human-AI collaboration做愿景,很大程度因为这是少数能重合的地方。TML从第一天起缺少足够具体的共同目标。算力也没外界想象宽裕,一线researcher体感实验互相挤,“很多基本实验都跑不了”。
最疼的一课是Tinker。一位曾参与Tinker训练的朋友复盘说,Tinker是“目前最优雅的单场景框架”,但团队一度太享受把框架做漂亮:“当你有ego,觉得自己推出了一个漂亮框架而自满的时候,就不会去把脏活做完。”prefix caching、成本优化、部署、稳定性这些脏活,产品最后毛利偏偏死在这些地方。结果这块生意反被把脏活做得更扎实的Fireworks抢走不少。TML暴露的是Neo lab 1.0最根本矛盾:一群靠taste出来的人,最缺的恰恰是一个不需要taste的目标。下一批真正跑出来的Neo lab,可能先有产品,再有environment,最后才长出自己的模型。Cursor、Harvey、OpenEvidence都有类似条件。
AI stack互相越位:Neo cloud、Neo lab与数据公司
过去两年AI stack里分得很清楚的几类公司,都在往别人位置上走。Neo cloud最明显。CoreWeave收购Weights & Biases后,把pre-training、post-training、inference、agent evaluation装进产品栈;今年4月推出的managed inference,ARR三个月从100万美元涨到1亿美元。Nebius的Token Factory直接提供模型推理,二季度production inference workload环比增长超3倍。GPU是重生意,只卖算力margin难一直往上走;有卡、有客户,继续往inference、模型服务和eval走几乎必然。另一边,一些新型Neo lab开始往数据公司走。Lab在做数据,Neo cloud在往模型和inference走,有些Neo lab又想握算力和服务。每一家都有变的理由,大家都在往别人的位置上走。
除了TML,Google也在经历剧烈人事动荡。一位在Google待了十三四年的朋友很难想象Jeff Dean的离开:“Jeff Dean is Google。”在他眼里,Jeff Dean比Eric Schmidt更能代表这家公司的本质。他走,就是“Google的一部分走了”。
全硅谷抢数据:数商站到战争中央
美国Spirit航空5月停飞,但留下的东西突然值钱。8月,Google在破产拍卖里出价1000万美元,想买走这家公司几十年积下的内部数据:上亿封邮件、几亿条Teams消息,还有代码、财务、运营和项目管理记录。Mercor出到750万美元,后来Micro1把价格抬到1250万美元。今年大家已成建制买破产公司,姿势标准化。一位Mercor朋友说,把破产公司买回来后第一件事是“救活”数据。几十年邮件、表格、聊天记录堆在那里,外人不知道什么意思。买完数据,往往还得留一两个老员工,像给废墟做导游。
背后原因简单:容易拿的互联网文本早被AI吃过。整个互联网可抓文本约100T,清洗完能用于pre-train可能只剩15T;把网页背后难抓信息扒到极致,最多约300T,也早被用完。模型公司把目光转向还没被整理成训练数据的真实世界。更进一步,“数据”这个词已不够用,模型真正想要的,正从一份dataset变成一个可不断产生新任务、新过程和新反馈的environment。Vending-Bench 2是缩影。它让AI agent自己经营自动售货机,跑完365天,每天扣两美元场地费,最后按账户剩多少钱计分。今年4月,Andon Labs在旧金山签下三年租约,把10万美元和一张信用卡交给一个叫Luna的agent,让它从零开店,选品、定价都由它决定。
真正值钱的environment在活着的公司里。模型公司更想进入活公司,大致四种办法,越往下成本越高:最轻是让agent进入工作流;再往前进入沟通场景,如Slack;如果产品进不去,就派FDE住进客户公司;最重是干脆把公司买下来。一位Scale AI朋友说,FDE最多捡到一些trajectory,把公司买下来,拿到的却是整个environment。数商站在中间,越来越像行业know-how交换机。老一派按人头计价,新一派按environment和trajectory计价。两派最后往同一个地方靠:单纯卖人力越来越不够,谁更接近真实environment,谁就更值钱。
不管哪一派,核心都是“加工”。一位Scale AI朋友把自己形容成“厨子”,买公司数据只是买原材料,麻烦全在后厨。一个核心动作叫“退档”:把一家公司已完成的工作,重新拆回任务刚开始那一刻,再把整个过程打包成RL environment。然后最难一步:把行业老师傅说不清、只能靠手感的判断,翻译成一条条rubric,让结果可被机器自动验证。独家数据尤其值钱。一份数据卖给所有人,一年可能值1万美元;只卖给一家,价格可翻几倍。一位frontier lab负责训练数据的朋友说:“如果我有钱,把所有data vendor都买了,这些data我甚至都不用。我买掉的,是别人赶超我的可能性。”现在行业里有一个简单粗暴判断标准:哪里的token在快速增长,数据就往哪里去。
数据越卖越贵,来源问题也出现。一位大厂做数据采购的朋友说,合同规定交付数据不能由GPT等模型生成,但有次拿到外采数据,用检测工具一扫,几乎100%像GPT写的。供应商解释:我们英语不好,所以先用印度语写,再用ChatGPT翻译成英文,被你们检测出来不是很正常吗?于是形成“你只要别让我知道来源就行”的局面。数商因此留下微妙位置:替lab找数据、找人、做加工,也把买方不愿直接面对的来源、合规和交付风险隔离在外。同一条call trace,来路有问题的报价3美元;通过美国供应商合法拿到,要300美元。一百倍差价,买的是风险转嫁。
数据生意再往前走,还有一种更深“加工”。旧金山创业公司Noetik积累了几亿个带空间位置信息的人体细胞数据,拥有肿瘤领域规模最大的空间生物学数据集。它没有只卖数据集,而是拿它们训练自己的模型。今年GSK和Noetik签下五年合作,拿到的是模型使用权。加工越深,越有机会卖出更高溢价。
硅谷也是一座“围城”
那些从AI浪潮里得到最多的人,已开始认真思考接下来人生怎么过。一位年轻AI researcher说:“你不觉得这里就跟缅甸园区差不多吗?一个大的园区,大家在这上班,聊的全是agent、infra、startup,同质化特别严重。”他读博时所在实验室,去年毕业5个PhD,只有一个人到现在没换过工作。“在一个公司待满一年,已经是很漫长的事。”过去两年,AI浪潮给researcher定出前所未有的高价:以前50万美元年薪已很体面,但现在100万以下offer,很多人已不看。
离开旧金山时,机场碰到工人抗议,要求把时薪提高到30美元。20年前我在美国上学时,打工时薪大概只有6美元。另一边,AI正在给湾区制造超级财富:今年旧金山都会区三成购房交易是现金全款;去年10月OpenAI一次员工股票出售,就套现66亿美元,其中75人每人套现3000多万美元。可最早怀疑这个价格还能维持多久的,也是他们自己。有人仍像“传教士”一样相信AGI,也有人更像“雇佣兵”,“没有太多conviction,能赚多久赚多久,不行再换一家”。两三年后,AI researcher也许就不再是今天这样的稀缺品。研究员饭桌上,模型之外,买什么股票、投什么项目,和下一份工作能不能承载现在薪酬包,越来越常见。
一位年轻研究员说过一句话:“没有什么问题,是只有我能回答,而ChatGPT不能的。剩下还需要人的,是人与人的沟通,以及在一个人年轻的时候,如何影响他、塑造他。”当公司、技术、壁垒,甚至一个人最相信的能力,都可能在几年里被重新定价,最后总会剩下一个没法交给模型回答的问题:我们到底想把自己的时间花在哪里?
来硅谷之前,我在法罗群岛休了个假。那里离这一切很远,海上终年是雾,山坡上只有羊、草和零星的房子。但好几次当地打车,司机不会说英语,只会说法罗语和丹麦语,我们比划半天还是讲不明白,最后只得掏出手机,让ChatGPT在中间翻译。AI越来越像一个不会消失的背景。模型可以一次次rollout,沿不同路径试错,再从头来过。人不行,我们无法把几种人生都活一遍,再回头挑一个最好的答案。时间无法回滚。每个选择,都只有一次。
二十年前留学时,我经常爬上Telegraph Hill,看旧金山的万家灯火。二十年后再站到这里,城市天际线没有任何变化,可未来五年因为AI,这些灯光背后的生活,必然会发生很大改变。AI带来的变化,最终会落到每个具体的人身上。也许再过五年回头看,我们才会真正意识到,今天正处在怎样的巨变之中。
