Ai2 发布 Olmo-core 3:开源万亿级 MoE 训练栈;B300 上 1.2T 达 858 TFLOP/s/GPU
Allen Institute for AI 于 [2026-10-01](https://allenai.org/blog/olmocore3) 发布 **Olmo-core 3**:面向大规模 **MoE** 的开源训练框架([GitHub](https://github.com/allenai/OLMo-core)、PyPI `ai2-olmo-core`)。相对旧 FSDP 路径改走 **DDP + Expert Parallelism**;8×B300 上 47B MoE 吞吐约 **2.7×**(52k vs 19.4k tok/s/GPU);系统基准含 **1.2T**(512 GPU,最高 **858** useful-model TFLOP/s/GPU)与 DeepEP v2 短测 **2.38T**。技术报告见 [allenai.org/papers/olmocore3](https://allenai.org/papers/olmocore3)。

- •公告日 2026-10-01:Ai2 官博 + HF 镜像 + 代码 allenai/OLMo-core
- •并行:Expert / Pipeline / 分布式优化器;rowwise EP(NVSHMEM)+ GPU-resident routing + grouped GEMM;可选 DeepEP v2
- •吞吐锚点(官博):专家池 8→128、active≈3.2B 时吞吐跌幅 <5%;8×B300 上 47B MoE 52k vs 旧栈 19.4k tok/s/GPU(约 2.7×)
- •规模:1.2T / 58.36B active / 512 GPU,最高 858 TFLOP/s/GPU(随机路由系统基准);DeepEP v2 短测达 2.38T
- •精度与内存:MXFP8 相对 BF16 吞吐约 +21%、峰值活跃内存 103→95 GiB;拓扑无关 checkpoint;下一代 Olmo 将用 MoE












