decision.host

新闻与动态

决策模型这个品类从 2026 年 9 月 15 日 Jev 发布开始,两周内就出现了 100 多个开源复刻、 两套公开评测与多家大厂的对标产品。这里按时间线整理关键事件,每条都附一手来源链接。

 共 14 条(时间线共 14 条,每条都带一手链接)
2026-10-06
★★★★
Decision Index 0.3 发布:Perplexity Decider v1.1 登顶,Jev 掉到第 3 榜单
新版权重为 0.2×public + 0.5×same_skills + 0.3×new_domains。Perplexity Decider v1.1 (27B) 以 62.8 分第一,Fastino GLiDE 60.2 第二,Jev 1.13 60.1 第三。同版还发布了 Vision 子榜,JEV-27B-VL 以 69.8 分领先。
2026-10-06
★★★
Intern-Decision 0.8B/2B/4B 发布:微调语言主干、冻结视觉塔 开源
上海 AI Lab 系的开源多模态决策模型,每字段一个 <decision> token,单张 RTX 4090 约 33 ms/query,训练代码一并开源。
2026-10-01
★★★★★
Cloudflare 开源 Clef / Clef-flash,并推出 RL 微调平台 发布
Clef 27B(Qwen3.8-27B 底座)、Clef-flash 9B(Qwen3.5-9B),Apache-2.0,带视觉编码器、64K 上下文,一轮前向并行给所有选项打分。训练用 label-smoothed CE + Brier loss 做校准,再加 RLCD。这是第一个既有开源权重、又有官方微调服务的决策模型。
2026-10-01
★★★
OpenAI 推出 Decisions API(public beta),也是多模态的 文档
端点 POST /v1/decisions,只有 gpt-6-luna 一个模型,支持 text + image 输入,三种问法 predicate / choice / score。输入 $0.10/百万 token,输出免费。支持 ZDR 与 HIPAA,区域限美国与欧洲。
2026-10-01
★★★
Perplexity Decisions API 文档发布,直接沿用 S1MB 的 noul/choice/score 命名 文档
端点 POST /v1/decisions,模型 pplx-decider-v1.1-27b,支持图像(base64),$0.02/百万输入 token,输出免费——是所有决策端点里最便宜的。其 v1 权重已按 Apache-2.0 开源。
2026-09-30
★★★★
S1MB(System One Mosaic Benchmark)发布:137 个基准、106 个数据子集 榜单
由 bekko 作者 hotchpotch 构建,专注 Noul / Choice / Score 三类决策,覆盖 14,009 个 case、26,269 个 judgment,并另设 6 个合成泛化基准。评测代码、数据集与 adapter 协议全部开源。
2026-09-30
★★★★
bekko-system-one-v0 发布:17M / 68M / 400M,可跑在浏览器里 开源
基于 Ettin-reranker(ModernBERT)的极小决策模型,17M 版 ONNX+INT8 仅约 29 MB,在 RTX 5090 上跑完 26,269 个判断只要 13 秒。400M 版在 S1MB 上超过不少 10B+ 模型。训练代码、153 个训练子集与超参全部开源。
2026-09-29
★★★★
Liquid AI 发布 d1:首次在 Decision Index 上超过 Jev 发布
d1 在 Decision Index 0.2.1 上得 58.9,Jev 1.13 得 57.9。三原语兼容,艺术判断、语言理解、检索分类三项领先,工具调用略低,知识推理落后 8 分。
2026-09-23
★★★
Together AI 发布 Tev1-4B-experimental,并公开训练配方 开源
Qwen3.5-4B 上的 LoRA SFT(rank 8、1 epoch、lr 5e-5),37,840 train / 4,568 val,官方称约 $17 就能训一个自己的。注意:权重许可证至今未定稿。
2026-09-22
★★★★★
Jev Decision Index 上线:132,422 个请求、37 个基准 榜单
第三方维护的决策模型排行榜,house rules 禁止调 prompt、截断与丢弃选项,未答/出错一律计 0 分再做机会校正。这是该品类第一个可比的横向评测。
2026-09-19
★★★
本地运行时爆发:laya-mlx、laya-coreml、laya.cpp、jevmlx 工具
社区把决策模型搬上 Apple Silicon 与边缘设备,M3 Max 上短决策 5–14 ms。「不生成文本」这一设计使得推理可以极度轻量。
2026-09-18
★★★★
Laya(Convai Innovations)与 Kev(Jared Palmer)发布 开源
两个最重要的开源决策模型家族。Laya 用 ModernBERT-large,主打端侧与毫秒级;Kev 覆盖 0.5B–27B,文档最完整的微调路径(0.8B 仅需 4 GB 显存)。
2026-09-16
★★★★
社区在数天内开始复刻:Mapika decider、pngwn typed-decisions、OpenDecision 等 开源
Jev 发布后 24 小时内,Hugging Face 上出现第一批开源复刻与类型化决策数据集。至今已累计 101 个原创 checkpoint / 67 个模型家族。
2026-09-15
★★★★★
TypeSafe AI 发布 Jev 1.13,提出 System One 决策模型 发布
首个「返回类型化概率、不生成文本」的决策模型。三原语 Choice / Noul / Score 由此成为事实标准,输入价 $0.042/百万 token,输出免费,官方称延迟 70–500 ms。