ggml-org 于 2026-10-02 宣布 llama.cpp server 合并 PR #29818,新增 /v1/systemone:对状态(文本/JSON/截图)与 typed 问题做单次前向打分,兼容 TypeSafe Jev / System One 客户端。首批模型:Julia-1(144M)、Laya(421M)、Kev-4B、lev、OpenJev(27B+视觉)。Cloudflare Clef 列为后续。

核心要点速览 (Key Takeaways)

  • ✓官方博文:New in llama.cpp: Decision Models(2026-10-02);实现:PR #29818 合并于 2026-10-02T09:56Z(+2139/−15)
  • ✓API:POST /v1/systemone;问题类型 choice / score / noul;响应含 probabilities + confidence;output_tokens: 0
  • ✓首批 GGUF:ggml-org/{Julia-1,Laya,Kev-4B,lev,OpenJev}-GGUF;RTX PRO 6000 官方中位时延约 3–43 ms/问
  • ✓与已入库 Ollama 0.35 / Cloudflare Clef 不同栈:本地 llama.cpp 推理运行时原生 System One;博文写明 Clef 将跟进
  • ✓开箱:llama serve -hf ggml-org/Kev-4B-GGUF 后 curl localhost:8080/v1/systemone;router 模式可按请求选模型
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点

Agent 流水线里大量步骤其实是分流、门控、验收:该不该调工具、这一步是否成功、工单归哪个团队。用聊天模型会浪费一次次 token 生成,还要解析自由文本。Decision Model(决策模型)换思路:你给定选项,模型在单次前向里给每个选项概率,输出永远落在选项集合内。TypeSafe 的 Jev 把这套协议定成 System One;Ollama 0.35、Cloudflare Clef 已分别在容器与 Workers AI 侧落地。缺的是本地 GGUF 主流运行时——llama.cpp——的原生端点。约 2026-10-02,ggml-org 官方博文宣布 server 支持 Decision Models;对应 PR #29818 于 2026-10-02T09:56Z 合并(标注 highlight)。

架构亮点与底层机制

新增 POST /v1/systemone:请求体含 state(文本、JSON、聊天消息,或带 images/image_url)与 questions。三类题型——choice(带 criteria 的选项)、score(2–10 等级)、noul(是/否概率)。响应给出 choice/score/noul、分项 probabilities 与 confidence,且 usage.output_tokens 为 0。PR 说明决策头是 embedding/分类图上的薄封装,经 GGUF metadata {arch}.decision.type 切换;主逻辑在 server_decision_context。支持 router 模式按请求选模型。博文明确:Cloudflare Clef 将作为后续跟进(与已入库 Clef Workers AI 托管新闻互补,而非重复)。

权威 Benchmark 与实测跑分对比

本稿不编造 SWE-bench 类榜。可核对锚点:(1)官方速度表(单卡 NVIDIA RTX PRO 6000、一问中位):Julia-1 3 ms、Laya 5 ms、Kev-4B 12 ms、lev 36 ms、OpenJev 43 ms;(2)PR 内与参考实现的概率对齐表(最差概率差约 1.8e-4~2.2e-2,因模型而异);(3)模型规格:Julia-1 144M(mmBERT-small,50+ 语)、Laya 421M(ModernBERT-large)、Kev-4B / lev 基于 Qwen3.5-4B 系、OpenJev 27B(Qwen3.8-27B,含视觉,CC BY-NC 4.0)。集合页见 Decision models。预转换权重:llama serve -hf ggml-org/Kev-4B-GGUF 等。

开发者实战落地与开箱指南

  1. 升级最新 llama.cpp(llama.app 或 llama update)。
  2. llama serve -hf ggml-org/Kev-4B-GGUF(或 Julia-1 / Laya / lev / OpenJev)。
  3. curl http://localhost:8080/v1/systemone,投递 state + questions(可并行多题;大模型只编码一次 state)。
  4. Router:llama serve 后在 JSON 同级加 "model": "ggml-org/Julia-1-GGUF:Q8_0"。
  5. 提示:给选项写描述(裸标签易误路由);按模型自测 confidence 阈值;量化需在合并决策头之后再做。完整参考见 server README。