AI作出的决定,真的值得信任吗?深入剖析最新“决策模型”Jev

在复杂数据中试图做出明确决策的数字大脑抽象图像
AI Summary

Jev是专为分类和路由设计的下一代决策模型,但目前的基准测试结果显示,它在性能上尚未能显著超越现有的LLM或传统分类器。

想象一下,你在在线购物平台申请退款。系统瞬间做出判断:“此请求可立即批准”,或者“这需要人工客服确认”。在这个系统背后做出决定的,可能是像人一样写作的AI(LLM,大型语言模型),也可能是快速高效的特定算法。最近,一种名为“Jev”的新型决策模型(decision model)因能做出这种“快速决策”而备受关注。但这种新型AI真的能取代现有的强者吗?

为什么这很重要?

我们使用的AI服务不仅需要变聪明,而且其“快速准确决策”的能力也至关重要。特别是在客户咨询分类、安全准则合规性评估、AI智能体路径规划等每天发生数百万次的决策过程中,AI的效率直接关系到企业的成本和用户体验。Jev作为一种新模型,一直被期待能比现有的LLM更便宜、更快速。如果Jev能够确凿地胜过现有模型,我们将利用AI的方式可能从“生成式”转变为“基于概率的决策式”。

简单来说,AI的“答题方式”变了

像ChatGPT这样的传统大型语言模型(LLM),在接到提问时会像作家一样逐字逐句生成回答,这被称为“Token生成”方式。而像Jev这样的“决策模型”则采用完全不同的方法。

打个比方,如果LLM是参加“论述题考试”的学生,那么Jev就是只做“选择题”的学生。LLM需要长篇大论,而Jev只需阅读文档,像在答题卡上涂卡一样,从预设选项中挑选出概率最高的答案。由于省去了生成句子的繁琐过程,Jev的成本可能比现有的基于LLM的评估模型(LLM-as-a-judge)低数百倍。[Source 13] [Source 3]

此外,Jev不仅给出“答案”,还能提供关于其确信程度的“校准置信得分(calibrated confidence score)”。[Source 12] 这意味着AI可以自行表达“我确定我的回答有90%的准确性”,从而帮助AI系统做出更安全的判断。[Source 14]

当前技术的局限性

那么,Jev真的能完美替代现有模型吗?结论是:专家的分析认为“目前还不能”。

根据近期的基准测试结果,Jev在决策自动化和安全准则等特定领域确实发挥了作用,[Source 3] [Source 4] 但在真正衡量AI判断性能的考场上,它的表现却不尽人意。在NVIDIA的HelpSteer2基准测试中,Jev与人类评估的一致性仅为0.39,在所测试的6个模型中表现垫底。[Source 6] 此外,目前尚缺乏证据表明Jev在速度或准确性上,比现有的“LLM-as-a-judge”或其他开源决策模型拥有显著优势。[Source 8] [Source 16]

未来会怎样?

这并不意味着像Jev这样的模型会消失。相反,AI市场正在变得日益细分。很有可能主流模式将是:擅长一切的大模型(LLM)与快速低廉地处理特定任务的决策模型(Jev)协同工作。[Source 10] [Source 5] 开发人员现在正处于必须思考“什么任务用LLM,什么任务用Jev”这种组合(混合管道)的时代。如果未来引入更优化的学习策略或新技术,Jev的性能或许会有所改观。[Source 16]


MindTickleBytes的AI记者视角 Jev是一次非常合理的尝试,旨在解决LLM高昂成本和低运行速度的问题。然而,在当前阶段,与其试图取代“聪明的全能模型”,不如将其定位为“负责特定任务的辅助专员”,这似乎更为明智。

参考资料

  1. [Source 3] Jev vs. the LLMs: A Benchmarking Study for Legal Document Review (https://www.linkedin.com/pulse/jev-vs-llms-benchmarking-study-legal-document-review-benjamin-sexton-5wqpc)
  2. [Source 4] Jev vs LLM: When a Classifier Beats a Generative Model MindStudio (https://www.mindstudio.ai/blog/jev-vs-llm-use-cases-architecture-patterns)
  3. [Source 5] Jev vs LLMs: Decision Models for AI Routing… GPTProto (https://gptproto.com/blog/jev-vs-llms)
  4. [Source 6] What Is Jev? TypeSafe’s Decision Model, Tested Against LLMs (https://aimlapi.com/blog/what-is-jev)
  5. [Source 8] Vue HN 2.0 Decision models like Jev don’t beat LLM-as-a-judge… (https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49933476)
  6. [Source 10] Что такое Jev и как использовать его вместе с LLM? - YouTube (https://www.youtube.com/watch?v=0VKS8VS_M2s)
  7. [Source 12] [2609.29769] JEV vs. LLMs as Rubric Judges: Cheaper, Faster … (https://arxiv.org/abs/2609.29769)
  8. [Source 13] TypeSafe’s Jev: Can decision models replace LLM judges? (https://arize.com/blog/typesafe-jev-llm-judge/)
  9. [Source 14] Jev vs LLMs vs Traditional ML for Classification (https://aiengineerinsights.com/blog/jev-vs-ml-classification/)
  10. [Source 16] Benchmarking AI decision models against traditional… (https://daily.dev/posts/benchmarking-ai-decision-models-against-traditional-guardrails-1ouigrgeo)
AD
测试你的理解
Q1. Jev等决策模型与传统LLM最大的区别是什么?
  • 按字生成句子
  • 提供结果的概率性置信得分
  • 消耗更多的GPU资源
Jev不生成句子,而是执行分类和评分。与LLM不同,其核心区别在于它能提供经过校准(calibrated)的置信得分。
Q2. 在NVIDIA的HelpSteer2基准测试中,Jev的表现如何?
  • 在6个模型中最高
  • 处于平均水平
  • 在6个模型中最低
Jev与人类评估的相关系数仅为0.39,在所测试的6个模型中表现最差。
Q3. 目前Jev主要用于哪些用途?
  • 创作创意小说
  • 客户支持分类及安全准则路由
  • 撰写复杂的科学论文
Jev主要针对具体的分类和路由任务进行了优化,例如客户支持分类、安全网关及自动化决策等。