美国创业公司TypeSafe AI于2026年9月15日正式发布决策专用模型Jev,该模型不生成文本、不参与对话,仅针对预设问题输出带概率和置信度的判断结果。发布一周内,其官宣帖在X平台浏览量达数千万次,主流AI模型网关Vercel上线24小时内即有近13%的付费团队接入。发布36小时内,TypeSafe收到约14万名开发者的内测申请,9月21日Jev向所有用户开放,每位新用户获赠5美元额度。
Jev来自TypeSafe AI,创始人Diogo Almeida为OpenAI前研究员,是InstructGPT和RLHF论文的共同作者。2024年离开OpenAI后,Almeida带队进行了两年隐身研发。资本层面,DCVC领投了该公司4000万美元种子轮。公司名称中的Jev取自19世纪英国经济学家威廉·杰文斯,其「杰文斯悖论」指出效率提升可能带来更大的总体消耗,这一命名指向该公司对效率问题的关注。
Jev的核心设计思路是将「判断」从生成式AI的能力中剥离出来。当前主流大模型如GPT、Claude均采用逐字推演的生成路线,处理「是或否」类简单判断时仍需生成大段分析文本,按字数计费且延迟较高。TypeSafe将这类模型命名为「System One」,借用诺贝尔经济学奖得主卡尼曼在《思考,快与慢》中提出的人脑双系统框架:System 1负责快速直觉判断,System 2负责缓慢深度推理。Jev是首个公开的System One模型,放弃文本生成,专做决策输出。
在工作流程上,Jev的使用分为五步:用户先描述决策需求,系统生成问题集供挑选;再从历史标注数据中选样本优化判断逻辑;最终对每个输入返回决策结果和置信概率,用户可设置阈值,低于阈值的转人工或交回大模型处理。Jev本身无状态、不记忆历史,所谓复用需通过外部配置层沉淀高置信度判断模式。输出形式仅三种强类型:Choice(从选项中选择)、Score(在刻度上打分)、Noul(判断事件成立与否,返回0到1的概率)。由于输出被限制在预设类型内,Jev从结构上杜绝了生成式模型常见的幻觉问题。
性能数据方面,按TypeSafe官方口径,Jev端到端响应时间70至500毫秒,传统大模型需3秒至300多秒,速度快20至200倍;每百万输入token收费0.042美元,输出免费,成本低40至400倍。一次请求可并行回答多个判断问题,问题数量增加时延迟基本不变。官方同时说明,上述区间的上限为厂商在自家工作流中跑出的最乐观值,独立实测通常达不到该倍数。训练方法上,TypeSafe采用RLCD(面向校准决策的强化学习),目标是让模型声称有95%把握的答案在真实世界中约有95%正确率,但官方尚未公布可靠性图或期望校准误差数据。
社区实测案例显示了Jev的多种用法:有开发者将其接入Claude Code做上下文清理,避免长对话质量衰减;也有开发者将其用于实时判断跑酷游戏中的平台落点、Agent任务验收、40秒内分类724条实时广告等场景。在代码审查场景中,有开发者实测6个PR后推算,审查1000个PR仅需7美分,而同等工作交给Claude Opus 5需14.5美元。另有测试显示,Jev与GPT-6 Astra在《我的世界》中用时8分43秒击败末影龙,总花销不到1美元,其中Jev占0.01美元。发布后,OpenRouter、Cloudflare、LangChain等平台先后接入,社区也出现了开源仿制版本。
Jev的走红反映了当前AI Agent落地过程中的一个结构性矛盾:Agent运行时需要大量高频判断,包括调用哪个工具、保留哪些上下文、操作是否存在风险、结果是否需要人工复查,这些任务交给具备深度推理能力的大模型处理,在成本和延迟上均不经济。TypeSafe的切入点是将判断能力从生成能力中分离,以专用模型替代通用模型处理低风险、高频次的决策任务。这一路线能否在可靠性验证和实际部署中达到预期效果,仍有待更多独立测试数据的支撑。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。