📖 文章导读:
首个System One模型Jev问世。针对LLM落地“慢、贵、爱废话”的痛点,Jev放弃字符串,直接输出概率化决策。具备70毫秒极速、零幻觉及附带置信度三大能力,且输出免费。它不取代聊天模型,而是给Agent补上毫秒级决策神经,专为海量小决策而生,以极致降本解锁全新生态。
重要的事提前说:302.AI目前免费提供Jev模型,欢迎使用

这两年你可能见过那种 AI 玩游戏,比如通关宝可梦的视频:LLM 操控角色闯关,弹幕一片「哇好智能」——但角色每动一下,要等两三秒。
人类玩家一秒反应三四次,AI 一秒思考 0.3 次。它不是在玩游戏,是在批奏折。
这是过去两年所有Agent 落地的缩影:模型明明很聪明,可一旦塞进真实系统——客服路由、风控打分、机器人控制、游戏 AI——就会有个瓶颈:
它太慢了,太贵了,而且它忍不住要多说两句。
多说两句的代价是巨大的:问它这个用户要退款吗?,它回你三百字小作文,你还得自己从里面把“要”字抠出来。
这就是 TypeSafe 创始人 Diogo Almeida 盯着的问题,这个疑问他追了四年。四年前他还在 OpenAI,参与ChatGPT 的底座研究,他亲手把聊天这件事推上了神坛。
四年后他出来创业,第一个产品却是个不会聊天的模型。
2026 年 9 月 16 日,隐身两年后,答案公布了:Jev,第一个 System One 模型。

LLM 这条线:GPT-6 Astra、Claude Fable 5.1……训练方式是 RLHF/RLVR(人类偏好或可验证奖励),输入文本,输出字符串——聊天回复、代码、拒答、甚至幻觉,本质上都是同一种东西:一段话。
Jev 则是完全不同的栈。新架构 + 并行采样器 + 一种叫 RLCD(Reinforcement Learning for Calibrated Decisions,为校准决策做强化学习) 的新训练法。输入是程序状态,输出不是话,是决策。
用 TypeSafe 自己的公式概括,一句话:
Jev = 一个前沿智能的函数调用:非结构化状态进,类型安全的概率化决策出。 (unstructured state in, typed probabilistic decisions out)
官方那句 slogan 值得单独引用——因为整篇文章的钥匙都在里面:
「Think of Jev as a frontier-intelligence function call.」 把 Jev 当成一个「自带前沿智力的函数调用」,一次
query()直接返回结果。
放弃字符串(give up strings)是这个模型最反直觉、也最核心的设计。TypeSafe 的原话是:字符串极其强大且通用,但极其昂贵。放弃它,反而换来三个超能力。我们一个个看。

能力一:70 毫秒的极速
Jev 的端到端响应时间:70-500 毫秒。
对比一下:前沿 LLM 的端到端响应时间,官方引用的数据是 3 到 329 秒。
同级别智能下,System One 任务上快 40-200 倍;他们首页最激进的口径是工作流层面 193.6 倍。
为什么能快?答案藏在采样方式里。LLM 是「串行」的:一个 token 一个 token 往外蹦,每个词都得等上一个词。Jev 是「并行」的:一次查询,所有输出同时生成——它并非在写作文,而是在填表格,表格的所有格子本来就可以同时填。
快这件事值多少,看官方演示才知道。
Doom 演示:一个 AI bot 实时打《毁灭战士》,每秒做 10 次决策。团队里那位工程师本来还担心“一秒问 10 次,成本要烧到每小时 7 美元”——结果同事们说:比你想象的便宜多了。
换成 LLM 来做?3 秒一次决策,bot 的眼里 Doom 是 PPT。
Wikiracing 演示:从一篇维基百科跳板另一篇,每步面对成百上千个链接选择——高基数决策 + 不能幻觉,充分展示能力。
用大白话翻译这些演示的意义:
LLM 的速度服务人类阅读,System One 的速度服务代码调用。 人在屏幕前的耐心是秒,程序的耐心是毫秒。这不是快一点,是跨了一个物理单位。
能力二:绝不产生幻觉
It can’t hallucinate.(它无法产生幻觉。)
注意措辞。不是幻觉率低,不是大幅改善,是can’t:绝对的否定词。
一家初创公司敢在自己的发布公告里用这么绝对的措辞,想必是真有东西。我们看看他们的逻辑。
幻觉的本质是什么?是自由发挥。
LLM 的输出空间是一切可能的字符串。它可以回你“要退款”,也可以回你“这个问题需要我思考,以下是我的三点分析”,还可以回你一个你 schema 里根本不存在的选项 maybe。它说什么都合规,所以它胡说八道时也毫无障碍,就像作文题没有标准答案格式,跑题就是一种幻觉。
Jev 把这道题改成了选择题。
调用 Jev 之前,开发者先用 schema 定义好:答案只能是 A/B/C,概率加起来是 100%,结构一个字段不能少。模型的整个输出空间被数学约束在这个集合里。
这个选择题化的哲学,对开发者意味着什么?
用 LLM 做自动化,真实工程的样貌是:prompt 要求它只输出 JSON→ 输出还是带 markdown 代码块 → 加 parser → parser 偶尔炸 → 加 try-catch 重试 → 重试三次它开始道歉而不是输出 JSON → 加不准道歉的规则……
这像是伺候一个会写散文的数据库。
TypeSafe 把这条逻辑钉得很死:幻觉在聊天产品里只是尴尬,在自动化系统里却致命。一个错误的 tool call 藏在延迟敏感的机器人控制栈第五层,不是 bug,是事故。所以他们给这个属性起的名字很讲究:
Type-safety 不是加分项,是 table stakes(上桌资格)。
顺带一提,上文提到演示 Doom 和 Wikiracing 的测试点也在这里:高基数选择,上千个链接里挑一个,这就是幻觉成本最高的场景。选错链接不是回答差一点,是整个方向错误。
能力三:每次开口先报有几成把握
类型安全保证 Jev不会说错格式的话。第三个超能力解决的是更隐蔽的问题:它不知道的时候,会老实说不知道。
自动化的拦路虎从来不是“AI 平均准确率 95%”,而是你不知道这单任务落在那 5% 还是 95% 里。所以只能加上人工复核,自动化又变回了AI 完成草稿,人工校对签字。
Jev 的回答机制改成了一个词:calibrated(校准)。
RLCD 训练法优化的目标,官方叫 epistemically honest probabilities(认知诚实的概率),它每次决策都附带概率分布和置信分数:分数更高时,准确率真的更高;输入相似时,给出的判断也稳定相似。
校准的价值不在模型层,在系统层。因为概率是一个可编程的信号:
置信度 > 95% → 机器直接放行
70-95% → 走保守分支
< 70% → 自动升级给人处理
于是 AI 还是人来做决定这个老问题,从产品问题变成了配置问题。 一个 if 语句的事。TypeSafe 管这类应用叫 “smart if-statements”(智能 if 语句),这是全文档里最朴素也最准确的产品定义。
LLM 交付的是一段话,Jev 交付的是一个自带可信度的数。对软件来说,后者才是可执行的知识。
读完以上,如果你还是《绝命毒师》系列粉丝,Meme神图一张:

定价:输出 token 免费
最后把商业模型摊开,因为这张价格表比很多发布会都有信息量。
| 现有 LLM | Jev | |
| 输入 | $0.20 – $30 / MTok | $0.042 / MTok |
| 输出 | 约为输入的 5 倍 | 免费 |
| 速度 | 3–329 秒 | 70–500 毫秒 |
先看 LLM 的定价结构:最贵的部分是输出,恰恰是幻觉、废话和跑偏发生的地方。你为每个字付钱,而模型的存在方式就是不停地产字。
Jev 把这块直接删了。官方括号里那句注释堪称凡尔赛:
Output tokens: FREE (too cheap to meter)(太便宜了,无需计量)
为什么敢免费?因为并行采样 + 输出是定长结构(几个概率值而已,不是几千 token 的散文)。它不是降价,是把生成这个成本大头从产品里物理删除了。
这套定价瞄准的是什么?回看官方列的场景:在海量数据上做 map-reduce、给每一条 LLM 输出做验证和越狱检测、给每个用户请求打风控分——共同点是调用次数以亿计,每次调用内容极少。
LLM 的账单结构适合少量贵问题,Jev 的账单结构适合海量小决策。
TypeSafe 也大方地承认了未来可能会有调整,“我们没法证明这价格没有补贴,可持续性让时间来回答。”
关于定价,还可以看看他们给模型起名的小心思。
Jev 取自经济学家威廉·斯坦利·杰文斯——创立了“杰文斯悖论”:蒸汽机效率提升后,煤炭不是用得少了,而是用得更疯了,因为每单位做功的成本下降解锁了海量新用途。
TypeSafe 自己把话挑明了:
我们预期机器智能会重演煤炭的路径:智能成本每降一个数量级,就会解锁数量级更多的用例。
当一次决策比一次数据库查询还便宜时,要不要用 AI这个问题就不存在了,剩下的问题是:你的代码里,还留着多少本该是概率判断、却写成了硬编码的 if?
用户评价:

2.Jev 热门使用案例
案例1:40 秒分析 724 条竞品广告
Matthew Berman(AI 圈头部测评博主)| 推文

jev is INSANE. 40 秒拆解 37 个品牌的 724 条真实广告——hook、format、offer、CTA、认知阶段、落地页错配,全维度。用了 9 美分的 token。
案例2:一小时内复刻特斯拉 FSD
jpschroeder | 推文

视频传播极广的”降维打击”叙事——过去需要一个团队做一年的驾驶决策层,现在一小时交付。注意:这是模拟环境复刻。
案例3:Jev 代打杀戮尖塔2
coolish | 推文

博主明说之前用 GPT-6 Astra 打——”旗舰推理模型 vs System One 决策模型”的直接对比,比任何官方 benchmark 表格都有体感。Astra 强在会玩,Jev 强在玩得快到人类跟不上。
案例4:模型路由器
ephraimduncan(Zapier 高管) | 推文

Jev 决定你的请求适合哪个模型,然后路由过去。
案例5:税务文档分类器,成本砍 34 倍
@nedwize | 推文

用 Jev 搭了税务文档分类器。Jev 以每页 $0.001 的价格分类我们 100% 的税务文档库。比 LLM 方案便宜 34 倍、快 6 倍。
案例6:20 个开源项目清单
Pluvio9yte | 1,155 赞 / 8.2 万浏览 | 推文

发布一周内社区就长出一个微型生态,代表作:
jev-ultrafast(browser-use 官方出品):高速浏览器 Agent,Jev 每步只判断”点哪个”,Google Flights 查一次航班约 7 秒
fast-jev-compaction / Winnow:给 Claude Code 做上下文压缩/垃圾回收——Jev 当 Agent 系统的”记忆力”
jev-codex-router:先让 Jev 判断任务难度再分配模型档位
SemDecide:Jev 做成命令行工具,接爬虫和 CI 流水线
Canny:专治 Coding Agent 嘴硬说”我做完了”——核验完成声明
3.Jev 小结

杰文斯悖论说,蒸汽机效率每提升一次,煤炭需求反而暴涨。智能也是。
每一次成本骤降,解锁的不是同样的事做便宜点,而是以前根本不成立的事。70 毫秒的工单路由、一美分的 50 局游戏、$0.001 一页的税务分类——这些场景过去不是没人想到,是账单与响应速度的制约。
当然,System One 不是来取代 Astra 和 Fable 的——它是给那些模型准备的手脚。过去两年我们给 AI 装上了大脑,又给它装上了工具,现在又补上了:中间的一层神经。
快,从来不是噱头。 在聊天里,快是体验;在系统里,快是资格。
AGI 会不会从聊天里走出来,没人知道。但现在有一个答案几乎可以肯定——如果它来了,那一刻它不需要跟你说话。它只需要在几毫秒内,做对下一个决定。
常见问题 FAQ
Q1:Jev 是什么?和 GPT、Claude 这类大模型有什么区别?
Jev 是 TypeSafe 于 2026年9月16日发布的第一个 System One 模型,由前 OpenAI 研究员、TypeSafe 创始人 Diogo Almeida 团队打造。它和 GPT-6 Astra、Claude Fable 5.1 这类聊天模型根本不同:LLM 输入文本输出字符串(一段话),Jev 放弃字符串,输入程序状态、直接输出类型安全的概率化决策——非结构化状态进,类型化决策出。它不是取代聊天模型,而是给 Agent 补上毫秒级决策神经。
Q2:Jev 为什么能做到 70 毫秒响应?
Jev 端到端响应时间仅 70-500 毫秒,核心在于采样方式:LLM 是串行的,一个 token 一个 token 往外蹦,每个词都得等上一个词;Jev 是并行的,一次查询所有输出同时生成——它不是在写作文,而是在填表格,表格的所有格子本来就可以同时填。官方 Doom 演示中 AI bot 每秒可做 10 次决策实时打《毁灭战士》,换成 LLM 来做 3 秒一次决策,游戏画面就成了 PPT。
Q3:Jev 为什么说不会产生幻觉?
因为输出空间被数学约束死了。调用 Jev 前,开发者用 schema 定义好答案范围(比如只能是 A/B/C、概率加和 100%、结构字段不能少),模型把开放作文题改成了选择题,无法返回 schema 之外的内容。TypeSafe 的措辞是绝对的 can’t hallucinate——幻觉在聊天产品里只是尴尬,在自动化系统里却致命,一个错误的 tool call 藏在机器人控制栈里不是 bug 而是事故。
Q4:Jev 的置信度是怎么回事?
Jev 用 RLCD(Reinforcement Learning for Calibrated Decisions,为校准决策做强化学习)训练,优化目标是认知诚实的概率:每次决策都附带概率分布和置信分数,分数更高时准确率真的更高,输入相似时判断也稳定相似。LLM 交付的是一段话,Jev 交付的是自带可信度的数。这让 AI 还是人来做决定从产品问题变成配置问题——一个 if 语句的事,TypeSafe 称之为 smart if-statements。
Q5:Jev 的价格是多少?302.AI 可以免费用吗?
Jev 的定价策略是用免费打成本痛点:输出 token 完全免费(LLM 恰恰输出最贵,约为输入的 5 倍),输入价格 $0.042/MTok,而主流 LLM 输入价在 $0.20-$30/MTok。这套定价瞄准调用次数以亿计、每次内容极少的场景(map-reduce、输出验证、风控打分)。TypeSafe 承认价格可能有补贴。302.AI 目前免费提供 Jev 模型使用,欢迎体验。
Q6:Jev 适合哪些使用场景?
官方与社区的典型场景:1)海量数据 map-reduce——40 秒拆解 37 个品牌 724 条真实广告,仅花 9 美分;2)Agent 决策与路由——模型路由器决定请求适合哪个模型;3)文档分类器——每页 $0.001 分类 100% 税务文档库,比 LLM 方案便宜 34 倍、快 6 倍;4)游戏与实时控制——代打杀戮尖塔2、Doom 每秒 10 次决策;5)高基数选择——Wikiracing 上千链接挑一个。
Q7:Jev 生态里有哪些开源项目?
发布一周内社区长出一个微型生态,代表作:1)jev-ultrafast(browser-use 官方出品)——高速浏览器 Agent,Jev 每步只判断点哪个,Google Flights 查航班约 7 秒;2)fast-jev-compaction / Winnow——给 Claude Code 做上下文压缩,Jev 当 Agent 系统的记忆力;3)jev-codex-router——先判断任务难度再分配模型档位;4)SemDecide——命令行工具,接爬虫和 CI 流水线;5)Canny——核验 Coding Agent 的完成声明。
Q8:Jev 会取代 LLM 吗?和聊天模型怎么选?
不会取代,它们是分工关系:System One 不是来取代 Astra 和 Fable 的,而是给那些模型准备的手脚。需要生成文本、代码、对话推理的任务用 LLM;高频、低延迟、结构化的海量小决策(路由、分类、核验、每帧判断)用 Jev。背后的逻辑是杰文斯悖论:智能成本每骤降一次,解锁的不是同样的事做便宜点,而是以前根本不成立的事。
即刻免费体验Jev模型
👉立即注册免费试用302.AI,开启你的AI之旅!👈
为什么选择302.AI?
● 灵活付费:无需月费,按需付费,成本可控
● 丰富功能:从文字、图片到视频,应有尽有,满足多种场景需求
● 开源生态:支持开发者深度定制,打造专属AI应用
● 易用性:界面友好,操作简单,快速上手
