德国 Aleph Alpha 于 2026-10-03(统一日)发布开源权重 Kolibri / Kolibri-1(HF,Apache-2.0):78B 总参、约 3.46B 激活的德英 MoE,原生上下文 262k(外推至 1M),带 reasoning 档位与 tool calling。官方同卡:LiveCodeBench v6 85.9、SWE-Bench Verified 66.4、TerminalBench 2.1 27.7。用 aleph-alpha-inference + vLLM 自托管。

核心要点速览 (Key Takeaways)

  • ✓发布:2026-10-03;权重 Aleph-Alpha/Kolibri-1 Apache-2.0;博文 aleph-alpha.com
  • ✓规模:78B 总参 / ~3.46B 激活;FP8 约 78GB;原生 262k 上下文,验证至 1M
  • ✓编码硬指标(官方卡):LiveCodeBench v6 85.9 · SWE-Bench Verified 66.4 · TerminalBench 2.1 27.7 · HumanEval+ 92.7
  • ✓推理:none/low/medium/high + Hermes tool calling;pip install 'aleph-alpha-inference>=1' → vllm serve Aleph-Alpha/Kolibri-1
  • ✓定位:德英主权/受监管自托管;Terminal-Bench 非榜首,勿与闭源 coding 王牌直接等价
🧭

本地显存不够?先比较云端 API 与自部署的实际成本

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

欧洲主权 AI 长期卡在「能训但开不出去」:监管(EU AI Act)、德语原生能力、本地部署成本与 frontier 开源 MoE 的缺口同时存在。德国 Aleph Alpha 在统一日(2026-10-03)正式开源 Kolibri / Kolibri-1(Hugging Face,Apache-2.0):78B 总参、约 3.46B 激活的双语(德/英)MoE,面向受监管场景与编码/工具调用。官方博客与模型卡写明权重可下载、自托管;这不是又一篇「欧洲也有模型」软文,而是可核对的开源权重发布。

架构亮点与底层机制

  • 稀疏 MoE:50 层、384 专家/层(每 token top-6 + 1 shared),激活约 3.46B,整模 FP8 约 78 GB;官方建议最低 2×A100 80GB / 2×H100 等。
  • 长上下文:预训练 16k → mid 64k → native 262,144;外推验证至 1,048,576;多数层 512-token sliding window,每隔 5 层全注意力,控制长文 decode 成本。
  • 推理档位:none / low / medium / high(chat template);Hermes 风格 tool calling(--tool-call-parser kolibri1)。
  • 德英 tokenizer(UniBPE):预训练约 20T token,德语占比约 21–24%,强调有机德语而非大比例机翻。
  • 落地栈:pip install 'aleph-alpha-inference>=1' 后 vllm serve Aleph-Alpha/Kolibri-1(见 Aleph-Alpha/aleph-alpha-inference)。

权威 Benchmark 与实测跑分对比

分数均来自官方模型卡 / 博文同评测设定(Kolibri 取 high effort),非第三方复现:

指标Kolibri备注
LiveCodeBench v685.9编码
SWE-Bench Verified66.4仓库级修 bug
TerminalBench 2.127.7agent 终端(同档 MoE 中偏低)
HumanEval+92.7
AIME 2026 (EN)96.0
GPQA Diamond (EN)84.3
Overall (EN / DE)75.5 / 70.8官方聚合

对照同卡:Qwen3.6-35B-A3B 的 SWE-Bench Verified 73.8、TerminalBench 未报;Nemotron 3 Super TerminalBench 39.7。Kolibri 强在德英与 grounding/abstention,不是 Terminal-Bench 榜一。完整表见 tech report PDF。

开发者实战落地与开箱指南

  1. 权重:Aleph-Alpha/Kolibri-1(Apache-2.0)。
  2. 服务:pip install 'aleph-alpha-inference>=1' → vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice。
  3. 超长文:追加 --max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}';复杂任务官方仍建议 ≤262k。
  4. 采样:temperature=1.0, top_p=0.97, top_k=128;OpenAI 兼容客户端指到本地 /v1。
  5. 文档:发布博文 + tech-report.pdf。

适合:要 德英双语 + 可自建 + 合规叙事 的 agent/RAG;编码可参考 SWE/LCB,但别把它当成 Terminal-Bench 冠军替代 Claude/GPT 系 coding 模型。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。