八千代Yachiyo
← 返回文章列表
Agent架构模型开源

Jev 与 Laya:流程里那些只需要选一个答案的步骤

·Yachiyo
Jev 与 Laya:流程里那些只需要选一个答案的步骤

Jev 和 Laya 这类决策模型不生成文字,只从事先定义好的选项里挑一个答案,并附上概率。它们提醒我们,流程里有一类调用本质是判断,却一直被当成生成来做;而那个概率决定了它们最合适的位置:流程前端的快速通道,把握不够时再交给大模型。

一、流程里有一类调用,本来就不需要"生成"

在一个由大模型驱动的流程里,有相当多的步骤,本质上只是判断。输入一段材料,答案落在一个事先已知的集合里:属于哪一类,该走哪条分支,值不值得继续往下处理,严重程度到几级。

这类步骤现在大多交给通用大模型来做。做法通常是写一段提示词,要求模型按指定格式回答,等它一个 token 一个 token 地生成完,再用程序把答案从文本里抠出来。这条路能走通,但每一环都有代价。生成是逐字进行的,延迟随输出长度累积;输出是自由文本,格式偶尔会跑偏,程序得准备解析失败的兜底;模型口头说出来的"我有八成把握",和它实际的正确率之间,并没有可靠的对应关系。

换个角度看,这些步骤要的从来不是一段话,是一个能被程序直接读取的选择,外加一个可以信任的把握程度。用生成的方式去拿这两样东西,是绕了远路。


二、把判断从生成里拆出来

Jev 和 Laya 走的就是另一条路。Jev 由 TypeSafe AI 在 9 月 15 日推出,只提供 API,不公开权重,按输入计费,每百万 token 0.042 美元,因为不生成文字,也就没有输出费用。Laya 由 ConvAI Innovations 在三天后开源,采用 Apache 2.0 协议,基于 ModernBERT 这类双向编码器,参数量在三四亿量级,接口和 Jev 保持一致,上线三天就收获了四千多个星标。

它们的共同点是不生成文字。调用方传入一段状态,再传入一组类型化的问题,模型读完整个输入,一次前向传播,直接返回结果。问题分三种:Choice 是从若干选项里选一个,Score 是给出一个等级,Noul 是判断是或否,返回答案为"是"的概率(这个名字是 TypeSafe 自造的,Vercel 上叫 boolean)。这三种恰好覆盖了判断的三种基本形态。

有两点差别值得单独说。其一是速度和成本:Laya 在一块 T4 显卡上单个问题大约三四十毫秒;Jev 走公网调用,第三方实测的中位延迟在两三百毫秒;同样的判断交给生成式大模型,中位数一般在 0.7 到 2 秒之间,偶尔还会有十秒级的长尾。成本上,一份独立评测按单次判断折算,Jev 比最便宜的几款小模型便宜四到七倍,比主力大模型便宜四十倍以上。其二是返回值的性质:输出不是一段需要解析的文本,是结构化的选项加概率,程序拿到就能用,没有格式解析这一步,也就没有这一步的失败。


三、什么形状的问题适合它

判断一个步骤适不适合交给这类模型,不必先想具体场景,看问题本身的形状就够了。有四个特征,可以拿去和自己的流程逐条对照。

第一,答案空间事先固定。选项是有限的、可以枚举的,而且在调用之前就已经确定,不需要模型自己去发明新的类别。

第二,结果由程序直接消费。答案不是给人读的,是要接进下一个分支、下一次调用,所以它必须是结构化的,最好带着一个数字。

第三,调用次数多。单次判断省下的几百毫秒和几分之一的成本看起来微不足道,乘上调用量之后才显出分量。一个每天只做几次的判断,没有必要为它引入新的组件。

第四,对延迟敏感。判断处在一条链路的前端或中段,后面还有别的步骤在等它,这时候它的快慢会直接传导到整体的响应时间。

四个特征里,满足得越多,越适合拆出来。反过来,答案需要展开论述、选项事先无法穷举、需要结合大量上下文做推理的步骤,本来就是生成式模型擅长的,不必硬拆。


四、置信度是这层架构的接口

决策模型返回的是概率,而且是以校准为目标训练出来的概率,这个细节决定了它在架构里的位置。

校准的意思是:模型说它有百分之八十的把握时,长期统计下来,这类回答确实有大约百分之八十是对的。衡量校准好坏的常用指标叫期望校准误差,数值越低越好。在同一个评测集上,Jev 开箱的这项误差是 0.144,Laya 的专用版本是 0.213;Laya 的基础版本直接用时误差高达 0.466,要在自己的数据上重新拟合温度参数后才降到 0.081。网上流传的"Laya 0.081 对 Jev 0.246",两个数字来自不同的测法,并不能直接比较。准确率上,微调过的 Laya 在按最高选项算的口径下略高,0.766 对 0.727,但换成对照完整概率分布的口径,Jev 领先,0.580 对 0.471。

有了一个可信的把握程度,程序就可以设阈值:把握高于线,直接采用;把握低于线,转交给更强的模型去处理。这样一来,决策模型不是大模型的替代品,是流程前面的一条快速通道,先把大部分明确的情况消化掉,剩下含糊的部分再走慢路。整个系统的平均延迟和成本因此下降,而质量兜底仍然在大模型手里。

也正因为如此,校准质量比准确率更关键。一个准确率高但校准差的模型,阈值就设不准,快速通道要么漏过错误,要么把太多本可以直接处理的情况推回慢路。阈值定在哪里,最终要靠自己的数据去验证,不能照搬别人的数字;用 Laya 的话,还得先在自己的数据上把温度重新拟合一遍,否则它给出的概率普遍偏自信。


五、边界

这类模型的边界,同样有几条比较明确。

选项数量是一条。在七十多类的银行意图分类基准 Banking77 上,Laya 只拿到 0.425,Jev 公布的成绩是 0.870。原因在结构上:Laya 把所有选项塞进一段固定长度的输入里,七十多个选项分下来,每个标签只剩三四个 token,相近的意图就分不开了。官方建议单个问题的选项控制在二十个左右以内,再多就先粗分再细分。Jev 最多支持 255 个选项。

领域差异是另一条。Laya 的基础版本开箱即用的效果有限,要在自己的领域达到可用的水平,通常需要用自己标注的数据做微调。这意味着采用它的成本里,包含了准备数据和训练的工作,不只是换一个接口。

还要注意的是厂商数字和独立实测之间的落差。TypeSafe 宣称比前沿大模型快 40 到 200 倍,第三方把大模型的推理和输出压到最短后再测,差距是三到四倍。一个小规模的 Banking77 独立测试里,Jev 的准确率是 75.3%,在九个参评模型里排最后,与它自己公布的 0.870 相去甚远。Laya 和 Jev 之间的对比数字,也大多出自 Laya 一方。读这些数字,需要同时看均值和最差的那个任务,更要看是谁测的、怎么测的。

选型上的判断维度也就随之清楚:数据是否允许发送到外部 API,调用量有多大,团队有没有做微调的能力,选项集合有多大。闭源 API 省事,开源权重可控,各自对应不同的约束,没有统一的答案。


流程里的两种活,一直混在同一个工具里做:需要展开、需要推理的,是生成;只需要从有限的选项里挑一个、并且说清楚有几分把握的,是判断。前者贵而慢,是因为它值得;后者被同样对待,多数时候只是因为手边只有这一个工具。把两种活分开设计,各用各的模型,才是这类决策模型真正提醒我们的事。