Jev美黑机和HTTP

✋⏩

Posted by Sam Ready on September 23, 2026

我有个朋友在 AI 圈混。具体干什么我不太清楚,大概是那种在咖啡馆里对着 MacBook 敲键盘、偶尔抬头说一句“这个模型不行”的人。他跟我说 Jev 火了,火得一塌糊涂,24 小时之内 13% 的 Vercel 付费团队在用,36 小时刷屏,14 万开发者排队。他说这话的时候眼睛发亮,像超市里那个穿红马甲的小姑娘看见我捏芒果时的表情,只不过她是义正辞严,他是眉飞色舞。

我说:“Jev 是个什么东西?”

他说:“你不懂,这是革命。”

我说:“那你给我讲讲。”

他讲了四十分钟。从 RLHF 之父叛逃讲到 System One Model,从并行采样讲到类型化输出,从 70 毫秒延迟讲到输出免费。我听完之后,脑子里只剩一个画面:一个人站在台上挥舞手臂,说“这不是一个模型,这是一个新品类”,台下疯狂鼓掌,没有人问一句“这东西到底能干什么”。

我对“革命”这个词一直有戒心。小时候老师评三好学生,德智体全面发展,分数最高的那个就是最好的。但那个分数最高的同学,你愿意跟他做朋友吗?你愿意跟他同桌吗?评测不管这些,评测只管分数。后来我长大了,发现所有“革命”都像三好学生评选,标准是别人定的,你只能负责鼓掌。

Jev 说自己不生成文本,只返回决策。官方管这叫“Decisions, not strings”。听起来像哲学宣言,其实就是说:我不写字,我只在你给的选项里选一个。你问它“这封邮件该转技术部还是财务部”,它不回答,它直接给你一个概率。你问它“这条日志是不是严重错误”,它不解释,它给你一个 0 到 1 之间的数。你问它“这个客户是不是要流失了”,它不说话,它给你一个标签。

这让我想起 HTTP 的 304。

早期互联网只有 200。你请求一个静态文件,服务器得遍历磁盘、索引、拼接、返回。这个过程本身就是“逐块生成”的雏形。后来加了 304,告诉客户端“东西没变,别重新下载了”。省的是传输,不是判断。服务端再省,也得查缓存、比对时间戳、决定返回 304 还是 200。这个判断本身消耗 CPU、内存、IO。

Jev 也一样。它“不生成文本”,但推理过程本身要跑一次前向计算。你给它输入,它要把输入编码进 hidden states,并行算所有候选选项的 logits,再归一化成概率分布。这个计算消耗的 GPU 算力,不会因为它“输出短”就消失。你让一个人不说话,只举手,他举手之前也得先把问题听明白,这个“听明白”的过程,跟说话一样费脑子。

所以“输出免费”是一个定价策略,不是一个物理事实。官方原话是“便宜到不值得计费”。翻译一下:单次推理中,输出部分的边际成本低到在商业上可以忽略,不是因为它是零,而是因为计费本身有运营成本。维护计费系统、核对账单、处理争议,这些成本可能比输出那点算力还高。就好比你开饭馆,米饭不要钱,因为盛米饭的人工比米贵。

但这话不能细想。细想就会发现,米饭不要钱是因为你把米饭钱算进菜里了。Jev 的输出免费,是因为它把输出成本算进输入定价里了。输入端每百万 token 0.042 美元,这个价格刚好覆盖住整个推理成本,包括输出部分的算力。输出端就当成获客赠品。你看着免费,其实人家早算好了。

半年前,Agent 产品还在讲“我能替你干活”。但“干活”需要部署、需要环境、需要 API Key、需要跑起来。这套东西有物理成本,也有认知门槛。普通人听完的第一反应是:“听起来很酷,但我怎么用?”然后就没有然后了。

Jev 不一样。它把“用”这件事压缩到了一个数字上:70 毫秒、0.042 美元、免费。你不需要知道它怎么部署,因为它没有部署。它就是一个 API 调用,返回一个 JSON,一个概率值。任何人看完演示视频,脑子里留下的不是“这东西怎么跑起来的”,而是“这东西跑得真快,而且不要钱”。

这个传播逻辑很聪明。当试用成本是零的时候,吹的成本也是零。14 万开发者涌入内测,36 小时刷屏,不是因为每个人都跑通了业务,而是因为跑通的门槛低到可以忽略。你打开浏览器,注册,拿到 API Key,复制一段代码,就能看到它返回“96% 紧急”。这个流程太短了,短到吹和用之间没有缝隙。

但这也是它最脆弱的地方。当试用成本是零的时候,质疑成本也是零。任何一个开发者花五分钟测试,发现它在中文客服场景下的准确率并没有碾压同级模型,就能立刻发一条推说“这玩意被吹过头了”。Jev 的护城河不在技术,在叙事势能。当叙事势能消散,吹和黑之间只隔一条推文。

我那个朋友不懂这个。他觉得 Jev 火是因为它好。我问他:“你觉得它好在哪里?”他说:“它快,它便宜,它不会胡言乱语。”我说:“这些优点,半年前就有人做到了。”他想了想,说:“但没人吹。”我说:“对,所以你现在吹的到底是什么?”他不说话了。

AI 圈的核心玩家就那么几个。OpenAI 系、Google 系、Meta 系、Anthropic 系。创始人和研究员在几家公司之间来回流动,今天在 OpenAI 训模型,明天去 Anthropic 讲安全,后天自己创业。技术路线互相抄,人互相挖,叙事互相借。这不是一个开放市场,是一个近亲繁殖的宫廷。

纯 LLM 的叙事开始疲软了。模型越来越贵,Agent 落地越来越难,“AGI 即将到来”喊了几年,企业端的 ROI 还是算不过来。于是他们从现有技术里挑几个底子能用、但被主流叙事忽略的方向。决策模型、分类器、结构化输出。这些都不是新东西,但不够性感,没人愿意吹。

现在他们决定集体吹。不是一个人吹,是协调过的叙事轰炸。今天这个发推说“Jev 改变了我对 AI 的理解”,明天那个发视频说“70 毫秒是什么概念,就是你眨一下眼它已经做了十次判断”。后天 Almeida 本人出来说“RLHF 是一条弯路”。你看着像百花齐放,其实是统一行动。

Diogo Almeida 的身份太特殊了。他是 RLHF 的核心贡献者之一,InstructGPT 论文的作者之一。换句话说,他亲手参与了“教会 AI 说话”这件事。然后他转身说:RLHF 是一条弯路。这句话的分量,不是随便一个创业者能说的。只有当年造过这把剑的人,才有资格说“这把剑铸错了方向”。

如果是一个无名小卒出来说“RLHF 错了,决策模型才是未来”,没人理。但 Almeida 说这句话,整个圈子都得停下来听。这不是骗局,这是宫廷内部的品类轮换。美黑机是不是真的比美白机好用,不重要。重要的是谁在推、什么时候推、推给谁看。

我那个朋友就是被推的那个。他看了 Almeida 的演讲,激动得不行,觉得找到了人生方向。我问他:“你知道 Almeida 是 RLHF 的核心作者吗?”他说知道。我说:“那你有没有想过,一个亲手参与造剑的人说剑铸错了,他是在否定自己,还是在给自己的新剑找买家?”他愣了一下,说:“你这个人怎么这么阴暗。”我说:“我不是阴暗,我是没钱。”

现在 LLM 是王,HTTP 为其服务。所有人聊 AI,默认主语是模型。HTTP、gRPC、向量数据库,都是为了让 LLM 跑起来而存在的管道。你调一个 API,本质是“请模型说话”,HTTP 只是把这句话送过去的手段。模型是目的,协议是手段。

但十年后,LLM 只是 HTTP 后面的第一个 microservice。

这个反转的意思是:协议层重新变成“王”,模型降格成“链路上的一个处理单元”。一旦这个视角成立,很多今天被当成“革命”的东西会立刻掉价。

Jev 的“决策输出”,无非是某个 microservice 的响应 schema,跟“返回 JSON 还是返回 text”同级。LLM 的“生成能力”,只是某个 service 的内部实现,上层根本不关心你是自回归还是并行采样,只关心输入输出契约。Agent 编排,就是服务编排,跟微服务时代的工作流引擎没有本质区别。

你调一个接口,它内部调了 LLM、调了 Jev、调了规则引擎、调了缓存。调用方只看到 HTTP 状态码和一个结构化响应。模型是什么、有几个、谁快谁慢,全被协议层屏蔽掉了。这正是微服务架构干了十几年的事:把实现细节藏在接口后面。

这个反转为什么成立?因为协议层比模型层更稳定。HTTP 活了三十多年,模型三年换一代。今天你写的 Agent 代码,明年模型一升级可能全得重写。但你写的 HTTP 接口,十年后大概率还能跑。所以长期看,价值会往协议层沉淀,而不是往模型层沉淀。模型会变成可替换的零件,协议和接口定义才是真正的资产。

这就好比早期计算机太庞大,为了用它需要专门盖仓库。等到普及了,计算机只是扔到仓库角落检测老鼠出没。今天被供在机房中央的东西,明天就是墙角一个不起眼的零件。区别只在于,有人靠“它现在是中心”赚钱,有人靠“它明天是零件”布局。

我那个朋友听了这套,说:“你这是在否定 AI 的进步。”我说:“我不否定进步,我否定的是把进步说成革命。”他说:“那 Jev 到底算不算进步?”我说:“算。它让判断变便宜了。但便宜的东西,通常不被叫做革命。革命是贵的,是稀有的,是你愿意为它排队的。Jev 不值得排队,它值得你把代码里的 if 语句换掉。”

他想了想,说:“那我该不该用?”我说:“你用呗,反正不要钱。”他笑了,说:“你还是觉得我在交智商税。”我说:“不是智商税,是认知税。你交的不是钱,是注意力。等哪天你发现它其实没那么神,你的注意力已经回不来了。”

现在有了 200 和 304,后续还会有 400 和 502。

HTTP 状态码的演化史,本来就是先有能用的,再有省事的,最后有一堆报错的。200 是“一切正常”,304 是“没变,别烦我”,400 是“你请求写错了”,502 是“上游挂了,别怪我”。Jev 现在处在“304 被吹成革命”的阶段,等它真进了生产环境,400 和 502 会自己长出来。到那时候,华尔街大概已经在聊下一个“范式转移”了。

我那个朋友还在跟我讲 Jev 的革命性。我听着,点点头。甜就点点头,不甜也点点头。然后继续捏我的芒果,等它慢慢变软。

他说:“你怎么不说话?”

我说:“我在想一件事。”

他说:“什么事?”

我说:“如果十年后 LLM 只是 HTTP 后面的一个 microservice,那今天我们吵的这些,到底在吵什么?”

他说:“你在说 Jev 不重要?”

我说:“重要。但它的重要,不是因为它是什么新品类,而是因为它让判断变便宜了。便宜到你可以把它当成空气来用。空气重要吗?重要。但没人会为空气开新闻发布会。”

他不说话了。我拍拍他的肩膀,说:“走吧,喝咖啡去。Jev 不会跑,但咖啡凉了就不好喝了。”