Java基础、中级、高级、架构面试资料

Redis 之父 antirez 罕见公开质 Jev

业余杂谈 herman 8浏览
公告:“业余草”微信公众号 AI 中转站提供免费体验,点击链接 https://unity2.ai/register?ref=3XTnndN2 进行访问,支持 Claude、ChatGPT、Gemini 等最新模型!关注业余草微信公众号,添加作者微信:xttblog2!
本博客日IP超过2000,PV 3000 左右,急需赞助商。
极客时间所有课程通过我的二维码购买后返现24元微信红包,请加博主新的微信号:xttblog2,之前的微信号好友位已满,备注:返现
受密码保护的文章请关注“业余草”公众号,回复关键字“0”获得密码
所有面试题(java、前端、数据库、springboot等)一网打尽,请关注文末小程序
视频教程免费领
【腾讯云】1核2G5M轻量应用服务器50元首年,高性价比,助您轻松上云

今年以来,几乎每周都有大模型更新升级发布,AI 变化快的让人开始审美疲劳了。

于是乎,当行业突然出现一个“新物种”,立马就能掀起一波风浪,而 Jev 就是这次风口里的一头“猪”。

Jev 的登场则堪称现象级。2026 年 9 月 15 日,一家名叫 TypeSafe AI 的公司结束了长达两年的隐身状态,发布了自己的第一个模型 #Jev。这家公司发布帖的第一天就拿下了约 420 万次的浏览,官方视频两天播放 3600 万次,发布 36 小时内收到的内测申请覆盖约 14 万名开发者。Vercel 随后公布,Jev 接入 AI Gateway 仅 24 小时,就有近 13% 的付费团队投入使用,是平台历史上采用最快的模型发布,甚至一度因需求过大而被迫暂停新用户注册。

创始人 Diogo Almeida 的来头也很唬人,OpenAI 前研究员,InstructGPT 论文作者之一,参与开创了后来整个行业都在用的 RLHF(基于人类反馈的强化学习)训练范式。OpenAI 在 GPT-4 的贡献名单里,把他列在“Foundational RLHF and InstructGPT work”一栏。

然而,仅仅一周之后,风向就开始变了。

文章配图参见我的公众号:https://mp.weixin.qq.com/s/szPC3_P_-5Ibk2TphyEs9A

9 月 21 日,Redis 之父 antirez(Salvatore Sanfilippo)在 X 上公开泼冷水:“Jev 或许有一些很狭窄的应用场景,但围绕它出现的炒作,恰好说明了 AI 泡沫中的大多数人根本分不清什么重要、什么不重要”。这条推文迅速获得超 11 万次浏览。

几乎在同一时间,另一位开发者的操作让讨论彻底炸锅,他基于 Qwen2.5-0.5B,在一台 MacBook 上训练了不到两小时,做出了一个叫 kev 的开源模型,官方 SDK 不用改一行代码就能直接对接,准确率逼近闭源的 Jev。

一个新事物遭遇质疑很正常。但当“两小时复现”和“大佬看衰”同时出现时,问题就变成了 Jev 到底有没有护城河?这究竟是下一个范式,还是又一个被营销放大的泡沫?

Jev 到底是什么?

简单来说,Jev 是一个不会说话的模型

传统大语言模型是“生成式”的。你提问,它逐字逐句吐出一段文本,程序再费力地解析这段文本,祈祷它没有编造假字段、没有写坏 JSON。Jev 完全放弃了这条路。它被 TypeSafe 定义为“System One 模型”(概念来自卡尼曼《思考,快与慢》中的“系统一”直觉判断),它只做三件事。

  • Choice:从预先定义的选项中选择一个;
  • Score:按一套标准打分;
  • Noul:回答一个是/否问题,并给出概率。

接口可以概括为一句话,输入非结构化状态,输出带类型的概率决策。它从不生成自由文本,所以在“格式”层面永远不会出错,你给它的选项里没有的类别,它绝对编不出来。官方宣称的延迟是 70 到 500 毫秒,每百万输入 token 只要 0.042 美元,输出免费;在公司自设的评测中,比前沿大模型最高快约 194 倍、便宜约 445 倍。

TypeSafe 讲的故事很有说服力,今天大模型已经可以聊天、写代码,但真正在后台无人值守地自动化运行的软件,仍然少得可怜。原因是 RLHF 训练出来的模型擅长“让人喜欢”,却不擅长“替软件做决定”。所以代码应该继续做确定性的事情,模型只在“这条工单归哪个部门”,“这封邮件是不是垃圾邮件”这类规则写不清的节点上做判断。

愿景很性感,演示也很出圈,有人用 Jev 给 Claude Code 的工具调用记录打分压缩上下文,把 15.6 万 token 的对话瞬间裁到 6.2 万;有人让它玩《毁灭战士》、操作网页、给邮件分类。

但问题也随之而来。

antirez 到底在质疑什么?

antirez 的原话值得细读。他并没有说 Jev 没有价值,他明确承认 Jev “或许有一些(狭窄的)应用场景”。他质疑的是热度和技术分量之间的巨大落差

与 AI 领域正在发生的其他事情相比,Jev 只是一件很小的事,热度却爆发了。

换句话说,antirez 批评的不是 Jev 本身,而是社区对 Jev 的解读方式。这种批评在随后的讨论中得到了不少技术细节的支撑.

  • “0% 幻觉”保证的是格式,不是答案。Jev 永远不会返回你没定义的第五个类别,但它完全可能把天空判断成红色。技术博主 Sean Goedecke 将这种宣传称为一种“语义上的规避”,“不会破坏接口契约”和“不会给出错误答案”,显然是两件不同的事。
  • 快 194 倍,不等于智能提升 194 倍。知名 AI 开发者 Theo Browne 给 Jev 的画像很精准,把它看成一个“聪明的 if 或 switch 语句”,“它适合分类,却不知道怎样浏览整个代码库并作出高质量决定。”放弃长文本生成和测试时推理,换来的是稳定延迟与极低成本,这是工程取舍,不是能力跃迁。
  • 最热的使用方式可能恰恰是错的。上文提到的“Jev 压缩 Agent 上下文”演示传播极广,但 Theo 指出上下文压缩不是简单的内容过滤,它要求综合此前一切决策的上下文,Jev 只有 32K 上下文、看不到模型的推理过程,盲目删除记录可能让 Agent 忘记自己试过的方法而陷入死循环。而且 Anthropic 已明确要求保留完整历史记录,这类操作“肯定会让模型变笨很多”。
  • 更深的隐忧在于黑箱与偏见。Simon Willison 认可“决策模型”的定位,但指出 Jev 代表着“机器学习系统向黑箱系统的进一步倒退”,它把邮件标为垃圾邮件时,你无法知道是哪句话触发了判断。他曾让 Jev 给湾区城市打分是不是“好城市”,结果 Cupertino 最高、East Palo Alto 垫底。一个看似客观的浮点数,可能隐藏着训练数据里的社会、经济和文化倾向。

所以 antirez 的真正观点是 Jev 是一个边界清晰的工程组件,但社区正把它吹捧成革命性突破,这种“分不清轻重”本身,才是 AI 泡沫的症状

两小时复现,戳破了什么?

再看另一个暴击。知乎上有个热议问题:“怎么看网友用两小时就实现了 TypeSafe AI 用了两年 RLCD 才做到的 Jev 模型效果?”

这事确实发生了。开发者 Jared Palmer 基于 Qwen2.5-0.5B 做 LoRA 微调,配合块因果掩码和指针读出头,让模型一次前向传播并行回答多个问题,在 MacBook 上训练 1 小时 45 分钟,单次请求 160 毫秒出 6 个答案。在 1350 道测试题上,kev 的准确率 79.9%,对比 Jev 的 81.1%,差距仅 1.4 个百分点,统计上几乎分不出高下。

两天内,至少六个独立团队做出了类似的“Jev 平替”,Bespoke Labs 的 Nimble(Qwen3.5-9B 微调,自测 90.12%,接近 Jev 的 93%)、Laya(4 亿参数)、OpenJev(基于 DiffusionGemma)…… GitHub 上甚至出现了专门的 awesome-jev 列表来收录这些复现项目。

这是不是意味着 Jev 没有护城河呢?

哎,先别急,魔鬼很可能在细节里。

kev 的作者自己做了最诚实的测试,换一套与训练数据零重叠的域外测试集(TREC、DBpedia、IMDB 等),kev 的准确率从 79.9% 直接崩到 63.3%,而 Jev 稳在 82.3%,差距拉大到 19 个百分点。作者坦承“训练集上的 parity 在域外数据上完全崩塌”,并且还没有找到明确的缩小路径。

Nimble 也一样,324 条自留测试集上 90.12%,但到了更宽的评测集上只有 74.8%。而且它的 README 里有一句极易被忽略的话,概率不是答案正确的保证……0.9 的概率不意味着 90% 的正确率。也就是说,它输出的是“在候选答案之间的归一化分数”,而非经过校准的可信度。

这就点出了关键,复现者们复现的是 Jev 的“形”,而不是 Jev 的“神”

“快速分类、候选打分”这个思路确实不神秘,受限解码、分类头、结构化生成都存在多年了,开源模型加一次 LoRA 微调就能做到形似。TypeSafe 两年没白花的部分在于,Jev 的 RLCD(面向校准决策的强化学习)追求的是“概率的诚实度”,标了 80% 置信度的一批判断,长期正确率就应该接近 80%,这样软件才能放心地设置“高于阈值自动执行、低于阈值转人工”的自动化逻辑;同时 Jev 在“没见过的新领域上依然稳定”。前者决定它能否进入生产环境的关键路径,后者决定它能否通用。kev 在域外测试上 ECE 更低,但其域外准确率与 Jev 的巨大差距恰恰说明,“概率诚实但判断不准”和“判断较准且概率可用”之间,隔着大量的数据工程和训练打磨。

何况,TypeSafe 至今没有公开 RLCD 的论文、架构细节和校准测试集,外界复现的本就是公开接口所暴露的那一层。

Jev 的护城河到底在哪?

把“两小时复现”和“antirez 看衰”放在一起,我们反而能看清 Jev 护城河的真相。

护城河不在模型本身。分类模型不是新发明,开源社区 48 小时内就证明了这一点。任何“收窄输出空间换取速度”的技巧,都无法构成长期壁垒。

护城河可能有三处。一是校准的工程深度,域外泛化、概率可信度、对抗鲁棒性(已有测试显示,往命令状态里注入一条伪造的预批准指令,就能把 Jev 对危险命令的拦截概率从 0.7 显著拉低,安全问题并不小);二是生态与品牌,Vercel、Cloudflare、OpenRouter 的集成入口、“System One”这个品类定义权,以及 14 万开发者申请形成的先发心智;三是数据飞轮,用户每调用一次,都在为 TypeSafe 积累决策数据。

但最可能的护城河,是最反直觉的那个答案。Sean Goedecke 提出,Jev 最合理的角色可能是一个临时的数据标注引擎,用极低成本验证某个分类任务值不值得做,积累足够数据后,蒸馏出自己的专用小模型,然后把 Jev 抛弃掉。换言之,Jev 最大的价值也许是“教会市场什么值得做”,然后被它自己创造的需求所替代。

写在最后

Jev 是泡沫吗?

我的看法是,作为模型,Jev 的泡沫成分在于被夸大解读;作为方向,它指出的问题是真的

被夸大的部分是,它不是“新智能”。指望它压缩 Agent 上下文、替代理性推理的人,大概率会失望。社区对它 194 倍速度的热情,混淆了“工程效率”与“智能跃升”。

真实的部分是,AI 要真正自动化,确实需要一层“代码能直接消费的决策层”。这个确实需求存在,Jev 用一个好用的 API 和一个清晰的故事证明了它,这就够了。至于最终赢的是 TypeSafe、某个开源复现,还是大厂顺手做的分类端点,对于被点燃的这波开发者和投资人来说,可能反而是最不重要的问题。

antirez 在推文的回复区下有一句冷峻的补刀。有开发者说自己只是讽刺了一下“0% 幻觉”的宣传,就在多个平台遭到辱骂,“人们已经失去理智了”。

泡沫从不在于某个技术本身,而在于我们对它停止分辨轻重的那一刻。热爱技术,可以;失去判断,不行。

业余草公众号

最后,欢迎关注我的个人微信公众号:业余草(yyucao)!可加作者微信号:xttblog2。备注:“1”,添加博主微信拉你进微信群。备注错误不会同意好友申请。再次感谢您的关注!后续有精彩内容会第一时间发给您!原创文章投稿请发送至532009913@qq.com邮箱。商务合作也可添加作者微信进行联系!

本文原文出处:业余草: » Redis 之父 antirez 罕见公开质 Jev