导语 最近看到了一个挺有意思的东西,就是TypeSafe AI 做的 Jev。Reddit 上很多人用它玩 DOOM,也有人拿它玩 Mario。我申请之后,拿到 API Key 后,也做了一个网页小游戏,想看看它到底在里面起什么作用。一开始,我最想弄清楚的其实很简单:同样是让 AI 操作游戏,为什么要用 Jev?GPT 不能做吗?当然能。做完这个 demo,再看了一圈资料,我觉得可能值得讨论的是另一个问题:我们现在搭 Agent,经常让一个通用大模型反复决定下一步。这里面有多少事情,真的需要大模型完整的生成和推理能力?
Jev 是 TypeSafe AI 在 9 月份推出的决策模型。创始人是 Diogo Almeida ,他曾在 OpenAI 参与过让语言模型更会听指令、跟人对话的相关研究。

TypeSafe 默默开发了两年,发布一个官方称为 System One Models的模型。使用方式简单可以理解成:把当前情况和问题给它,让它返回程序能直接使用的结果。其实本质上是分类模型。官方介绍
接口主要有三种类型:

例如,在游戏的使用场景,我们可以每一步都问它:
我现在有多少血,怪物和金币在哪里,出口在哪里。目标是拿到金币并活着出去。现在应该按哪个键?
可选项提前定义好:上、下、左、右、攻击、喝药。Jev 返回其中一个动作,游戏执行,然后把变化后的局面再发给它。这个模型的好处是没有任何幻觉,严格按照大家提前定义好的输出标签来执行。

视频故意在每一步多停留了几秒,方便看清右侧的三个部分:它看到了什么、选了哪个动作、执行后发生了什么。 停留时间是为了演示,不是模型响应时间。
这一局里,Jev 先攻击挡路的怪物,再往右移动,拿到金币,最后走到出口,一共 6 次真实 API 调用。第一步返回的“攻击”概率约为 95%,界面上的置信度约为 93%。这是两个不同的数,也都不是“这局有多大概率能赢”。这个视频能说明:模型的选择确实驱动了游戏,响应也足够支持这种回合制交互。它还不能说明 Jev 比 GPT 更会玩。我们已经搭了相同地图、相同规则的对比版本,但目前没有完成有效的双模型实测,所以这里不放胜负和性能结论。还有一次低血量测试挺有意思:角色只剩 20 点血时,Jev 第一手选了攻击,怪物反击后剩 5 点血。这个动作是不是最优,要看后续局面,不能只凭“没喝药”就下结论。它至少提醒我,模型会作出自己的取舍,演示不应该把结果改成我们预先想看的答案。

图 1:我们这个 demo 的实际分工。地图、伤害、碰撞由游戏代码处理;每一步按哪个键,由 Jev 返回。这里我觉得最容易理解的一句话是:Jev 是拿手柄的玩家,普通代码是游戏本身。它没有负责画地图,也没有生成整个游戏。我们也没有给勇者写一条自动通关路线。代码把局面整理成文字和数据,再把模型选出的动作交给游戏引擎执行。它看到的是状态描述,不是屏幕截图。
可以先看 Browser Use 做的这个航班查询例子,这个例子 它把“判断”和“生成”分得挺直观的。

动图与视频来自 Browser Use / jev-ultrafast。
页面先被整理成带编号的元素,Jev 决定操作什么、点哪个目标。需要填写城市名称时,再调用生成模型产生文字。
作者记录的一次查询用了 7.073 秒,其中有 17 次 Jev 请求、2 次文字生成调用。初始打开网页和最后的独立结果校验不在这个计时里。这是一次具体任务的记录,没有购票,也不能推广成“所有浏览器任务都能七秒完成”。测量说明
这个例子有意思,是因为在这一趟操作里,选择下一步的次数明显多于写文字的次数。它展示了一种可以实际搭出来的分工。
其他几个社区的例子也值得看看:

看游戏演示时,还有个区别要记住:每秒做十次决策,不等于接管每一帧的物理和控制。渲染、碰撞、动画、执行仍然是游戏系统的工作。DOOM 的输入与调用说明
为什么还要专门做一个 Jev?
目前的自回归的大模型当然能分类,也能只返回一个动作。例如,现在的 Structured Outputs 还能约束输出字段和枚举值,所以不能拿“通用模型总要写一大段话”当作比较前提。OpenAI Docs
但是真正的区别,还是要放到调用频率和整个使用场景里看。
如果只是偶尔分一条工单,模型多花几百毫秒,可能没什么感觉。但如果一个 Agent系统要反复判断几十次,或者一个系统每天要处理百万条内容,单次多花的时间和钱就会累积。
Jev正是基于这个假设,收窄了自己的训练任务。按照 官方TypeSafe 的描述,它采用面向决策的架构、并行采样,以及名为 RLCD 的训练方法,重点优化判断和概率校准。公开资料能让我们理解这个方向,但还不足以完整还原模型内部实现。官方说明
总体来看,目前三个方向可能的收益。
一是更适合反复调用线上场景。 官方公布的响应范围约为 70—500ms,输入价格为每百万 tokens 0.042 美元,输出免费。这是厂商口径,实际延迟会受网络、输入和负载影响。按每次总输入 1,000 tokens 粗算,一百万次请求的模型费用约 42 美元,其他服务和回退成本另算。价格与延迟口径
二是减少没必要的串行步骤。 比如收到一条反馈,可以同时判断业务类别、紧急程度和信息是否齐全,再由代码组合结果。它们如果只依赖同一份输入,就不必排队问三次。官方的智能家居例子也是这样做的:一次判断设备、范围和动作,再挑出相关结果执行。智能家居演示
三是让程序有机会识别犹豫。 同样是选 A,“明显偏向 A”和“A、B 很接近”,后续处理可以不同。程序可以补充信息、换一个模型,或者把问题交给人。
不过这里有个容易混淆的细节:confidence 是从答案的概率分布计算出来的统计量,不是“这次一定有多大概率正确”。我们视频里,攻击的概率约为 95%,confidence 约为 93%;它们也都不是通关概率。置信度说明
如果要拿它决定是否自动执行,得先用自己的数据检验。所谓概率校准,是看一批样本中,模型给出的概率和实际结果是否相符。不能看到一个 0.9,就替业务定下一条通用的自动执行规则。
更具体点,在应用场景会主要有以下四大类:
在需要每秒多次决策、但底层物理和渲染交给游戏引擎本身的场景中,用大模型逐字生成回答成本极高且延迟不可接受。
上/下/左/右/攻击/喝药)中瞬间挑选最合适的操作。在复杂的 AI Agent 工作流中,最容易出故障且高频发生的操作往往不是“写一整段话”,而是“选哪个工具”或“判断下一步去哪”。
Allow(允许)、Deny(拒绝)或 Ask(二次确认)对于每天需要处理百万级工单、邮件或长文档的业务系统,如果每个步骤都调用通用生成大模型,成本与推理时间不可承受。
如果直接问我怎么看,我的判断偏乐观。它抓住了 Agent 开发里一个常见问题:很多调用只是为了做一个判断,却动用了完整的文本生成过程。过去调用量小、产品还在验证阶段,大家不会太计较。等一个任务需要几十次模型调用、同时服务大量用户时,延迟和成本就很难忽略了。
因此,在需要快速理解语义、再作出有限选择的任务,值得长期做。至于 Jev 能不能成为这个方向上的主要选择,现在还早。
我认为,这个是Jev 最容易切入的机会,是替换 Agent 里那些高频、边界清楚的调用,比如选工具、筛选检索结果、判断下一步操作、决定是否升级到更强模型——这些任务虽然需要语义理解,但输出空间小,若效果接近,开发者自然会选择更快、更便宜的方案。更重要的是,成本和延迟下降之后,以前因为不划算而没做的判断,现在可能也变得值得做了。
复杂部分还是靠强模型规划,运行中的局部判断尽量交给轻模型,遇到新情况或高风险再升级处理。但难点在切换时机、上下文传递、计划失效等边缘条件,没处理好,省下的推理时间可能被重试和恢复抵消。在这里,概率信息很重要,但前提是业务校准。我们需要知道在什么错误率下,哪些任务可以稳定交给快模型,而不只是看平均准确率。Jev 有机会做的,不只是便宜推理,还包括评测、阈值选择、回退和监控。如果这些能力足够好,Jev 的价值就不只是低成本,而是帮开发者把一部分判断稳定自动化。至于实时语音,不一定需要外接 Jev。全双工音频模型本身也可能解决打断、接话等问题,只有独立判断层带来明确收益时,才值得增加远程调用。
一边是大模型厂商。结构化输出、工具调用、低延迟模型和蒸馏都在推进。大厂只要在核心任务上做到够好、够便宜,用平台和服务能力留住客户,Jev 的空间会受到挤压。开发者也会考虑接入成本,没必要多接一家供应商。
另一边是传统分类器和专用小模型。如果任务稳定、标签固定、数据充足,专用模型往往更便宜、易部署,简单任务甚至用规则就行。
所以,Jev 比较有吸引力的位置,是在这两者之间:任务需要通用语义理解,规则和候选变化频繁,开发者又不愿意为每个小判断单独训练模型。这个市场不小,特别是在企业流程、研发工具和交互应用里。但长期来看,Jev 能否持续做到“好用、稳妥、迁移成本低”,比单次推理便宜更关键。如果每换一个场景都要大量调优和修错,就算 API 便宜也未必真省钱。
最后,调用量大并不等于利润高。只要模型价格持续下降、迁移门槛低,Jev 还得靠服务质量和集成能力留住客户。技术方向成立,独立公司的商业空间还得进一步验证。
补充一下: 看到有社区用 JEV 实现了对话

https://github.com/kyle-pena-nlp/jevchat/
大家什么感受,又回到了 Language model 的最初的开始!
文章来自于"腾讯技术工程",作者 "mason,Principal Research Leader"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。
项目地址:https://github.com/Henry-23/VideoChat
在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat
【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。
项目地址:https://github.com/PeterH0323/Streamer-Sales