哪个 AI 花得更少、做得更多?
在这里,我们在同一时刻把同一份工作交给多个 AI 模型,并实时测量每个模型的表现:同一任务上的速度、成本和准确度。选一个案例开始吧。
新闻
同一个 RSS 源里的标题同时发给多个 AI 模型。每个分类结果一到就显示:谁先冲线,谁先出现。我们比较每次请求的耗时、成本以及模型之间的一致性。
客户流失
从真实的电信数据集(IBM/Kaggle 的经典 Telco 数据)中随机抽取客户发给模型——不包含 Churn 列。每个模型估算退订概率,评分很简单:对照真实答案,对还是错。一个在同一数据上训练的逻辑回归作为经典方法的参照。
猜词游戏:一个字母一个字母地揭开单词
这里任务的性质变了:模型不再是分类或估算,而是要按顺序做决定。每个模型拿到同一个隐藏单词,一个字母一个字母地猜,直到猜出为止。我们比较每个解法花了多少时间、多少轮和多少钱。
累计排行榜
这里跑过的每一场比赛都会计入此表。它是实验室所有记录的平均值——每个模型每项耗时多久、花费多少,以及在流失案例中对照真实答案的准确率。
标记为参照的行不参与排名:逻辑回归是经典统计方法,而前沿模型——Claude Opus 5、Kimi K3 和 GPT-5.6 Sol——不参加实时比赛(又贵又慢)。我们于 2026 年 9 月 20 日 用相同的提示词,在每个案例中对每个前沿模型测量了 50 次请求。它们只作为参照尺。
正在汇总历史记录…
JEV 是什么?
大多数 AI 模型是为对话而生的:你提问,它写作。而 TypeSafe AI 的 JEV 生来是为了另一件事——做决定。它不返回需要我们去解读的文字,而是直接给出决定,并附带置信度:“这条新闻属于经济类,确定度 92%”。TypeSafe 称之为 System One 模型:快速、直接、不闲聊。
而这正是本实验室——jev.welljose.net——要检验的。一个为决策而生的模型,真的比被改造来做同样任务的对话模型更快、更准、更便宜吗?在这里我们不做假设:我们测量。
所有模型都通过 OpenRouter, 运行,使用同一把尺子和同样的材料——JEV 以 typesafe/jev-1.13身份参赛。想看官方来源?TypeSafe 的发布公告在 typesafe.ai/blog.