开发者 3 秒速决决策指标
德国 Aleph Alpha 于 2026-10-03(统一日)发布开源权重 Kolibri / Kolibri-1(HF,Apache-2.0):78B 总参、约 3.46B 激活的德英 MoE,原生上下文 262k(外推至 1M),带 reasoning 档位与 tool calling。官方同卡:LiveCodeBench v6 85.9、SWE-Bench Verified 66.4、TerminalBench 2.1 27.7。用 aleph-alpha-inference + vLLM 自托管。
核心要点速览 (Key Takeaways)
- ✓发布:2026-10-03;权重 Aleph-Alpha/Kolibri-1 Apache-2.0;博文 aleph-alpha.com
- ✓规模:78B 总参 / ~3.46B 激活;FP8 约 78GB;原生 262k 上下文,验证至 1M
- ✓编码硬指标(官方卡):LiveCodeBench v6 85.9 · SWE-Bench Verified 66.4 · TerminalBench 2.1 27.7 · HumanEval+ 92.7
- ✓推理:
none/low/medium/high+ Hermes tool calling;pip install 'aleph-alpha-inference>=1'→vllm serve Aleph-Alpha/Kolibri-1 - ✓定位:德英主权/受监管自托管;Terminal-Bench 非榜首,勿与闭源 coding 王牌直接等价
本地显存不够?先比较云端 API 与自部署的实际成本
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
欧洲主权 AI 长期卡在「能训但开不出去」:监管(EU AI Act)、德语原生能力、本地部署成本与 frontier 开源 MoE 的缺口同时存在。德国 Aleph Alpha 在统一日(2026-10-03)正式开源 Kolibri / Kolibri-1(Hugging Face,Apache-2.0):78B 总参、约 3.46B 激活的双语(德/英)MoE,面向受监管场景与编码/工具调用。官方博客与模型卡写明权重可下载、自托管;这不是又一篇「欧洲也有模型」软文,而是可核对的开源权重发布。
架构亮点与底层机制
- 稀疏 MoE:50 层、384 专家/层(每 token top-6 + 1 shared),激活约 3.46B,整模 FP8 约 78 GB;官方建议最低 2×A100 80GB / 2×H100 等。
- 长上下文:预训练 16k → mid 64k → native 262,144;外推验证至 1,048,576;多数层 512-token sliding window,每隔 5 层全注意力,控制长文 decode 成本。
- 推理档位:
none / low / medium / high(chat template);Hermes 风格 tool calling(--tool-call-parser kolibri1)。 - 德英 tokenizer(UniBPE):预训练约 20T token,德语占比约 21–24%,强调有机德语而非大比例机翻。
- 落地栈:
pip install 'aleph-alpha-inference>=1'后vllm serve Aleph-Alpha/Kolibri-1(见 Aleph-Alpha/aleph-alpha-inference)。
权威 Benchmark 与实测跑分对比
分数均来自官方模型卡 / 博文同评测设定(Kolibri 取 high effort),非第三方复现:
| 指标 | Kolibri | 备注 |
|---|---|---|
| LiveCodeBench v6 | 85.9 | 编码 |
| SWE-Bench Verified | 66.4 | 仓库级修 bug |
| TerminalBench 2.1 | 27.7 | agent 终端(同档 MoE 中偏低) |
| HumanEval+ | 92.7 | |
| AIME 2026 (EN) | 96.0 | |
| GPQA Diamond (EN) | 84.3 | |
| Overall (EN / DE) | 75.5 / 70.8 | 官方聚合 |
对照同卡:Qwen3.6-35B-A3B 的 SWE-Bench Verified 73.8、TerminalBench 未报;Nemotron 3 Super TerminalBench 39.7。Kolibri 强在德英与 grounding/abstention,不是 Terminal-Bench 榜一。完整表见 tech report PDF。
开发者实战落地与开箱指南
- 权重:Aleph-Alpha/Kolibri-1(Apache-2.0)。
- 服务:
pip install 'aleph-alpha-inference>=1'→vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice。 - 超长文:追加
--max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}';复杂任务官方仍建议 ≤262k。 - 采样:
temperature=1.0,top_p=0.97,top_k=128;OpenAI 兼容客户端指到本地/v1。 - 文档:发布博文 + tech-report.pdf。
适合:要 德英双语 + 可自建 + 合规叙事 的 agent/RAG;编码可参考 SWE/LCB,但别把它当成 Terminal-Bench 冠军替代 Claude/GPT 系 coding 模型。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察