跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精選

第 1–1 條 · 共 1 條
9月22日週二
  1. Simon Willison83

    Simon Willison 评测 TypeSafe AI 推出的 Jev 决策模型

    TypeSafe AI 近期推出了名为 Jev 的 System One 决策模型,它接收非结构化文本输入并返回对应类别的浮点数置信度分数。Jev 仅对输入收费且价格低至每百万 token 0.042 美元,支持 Yes/No、多选和评分三类问题并在后台并行评估。作者指出 Jev 的黑盒特性和偏差问题需要谨慎对待,但社区已围绕其展开了丰富的创意应用和开源复现尝试。

    推薦理由:原文介绍了 TypeSafe AI 推出的决策模型 Jev 及其独特的工作机制和定价模式,读者可以借此了解这类新型模型在分类与检索重排场景中的应用与局限。