最近Jev爆火。这是ChatGPT的核心开发者之一离开OpenAI后,花两年时间打造的新模型。
但是,它不是个大语言模型(LLM)!至少不是传统意义上的大语言模型。开发者说Jev能产出经过校准的决策,所以有人把它叫做决策模型(Decision Model)。
所谓“经过校准”,就是它报出的自信值应该靠谱:它说有八成自信的那些答案,实际应该大约有八成是对的。这样,程序就能根据这个数字,决定直接采用答案,还是交给人或其它模型再检查。
那它和大语言模型有什么区别?
简单地说,大语言模型根据你输入的内容生成新的文本;但决策模型只会帮你做选择或者打分,你不能用Jev来写文章或者报告(虽然也不是绝对不行,例子看下面)。
比如,你可以问它“太阳和地球哪个是恒星?”,然后提供“太阳”和“地球”两个选项,它会返回“太阳”和一个0至1之间的数字,表示它对结果有多大的自信。
你可能觉得,这些大语言模型不是也可以吗?
是的,但Jev非常非常地快。同样的问题,大语言模型可能要好几秒才得到答案,而Jev只需要几十到几百毫秒。
而且,Jev性价比奇高。大语言模型输入和输出都要钱,而且一般输出都是输入价格的好几倍。比如GPT-5.6 Terra输入要$2(每百万token),输出则要$12。然而,Jev输出免费,输入也只要$0.042!
至于模型性能,目前还缺少足够可信的独立评测,但Jev的开发者TypeSafe说,Jev大概相当于GPT-5.6 Terra的水平。
所以,Jev又快又便宜,一下子让大家多了很多新玩法。
Jev特别像一个分类器(classifier),并且因为它像大语言模型一样自带知识,你不需要像传统的分类器一样先训练。所以基本上,你可以把Jev看成是一个无需训练的分类器(zero-shot classifier)。当然,如果你让它分类的是主观偏好或内部的业务定义,那仍然需要事先在输入中说明偏好或规则。
比如,你可以让它标记邮箱中的垃圾邮件,博客上的垃圾评论(我很久前还用PHP折腾过贝叶斯算法)、或者判断用户评价是正面还是负面的……这些例子都太常见了,我说说我打算用它做什么:
此外还有个特别神奇的用法:有人用Jev做了个聊天机器人。原理是把26个英文字母、标点符号和一个特殊的停止符号一起作为选项发给Jev,让它选一个字符返回,直到它发回停止符号,就算是它说了一句话。
还有,像browser/computer-use这种本来基于大语言模型的应用,因为Jev在速度和价格上的巨大优势,一下子也变得实用很多(看jev-browser和jev-ultrafast)。
我觉得现在人们还在理解和消化Jev,接下来一定会出现很多新的用法。