开发者 3 秒速决决策指标
Allen Institute for AI 于 2026-10-01 发布 Olmo-core 3:面向大规模 MoE 的开源训练框架(GitHub、PyPI ai2-olmo-core)。相对旧 FSDP 路径改走 DDP + Expert Parallelism;8×B300 上 47B MoE 吞吐约 2.7×(52k vs 19.4k tok/s/GPU);系统基准含 1.2T(512 GPU,最高 858 useful-model TFLOP/s/GPU)与 DeepEP v2 短测 2.38T。技术报告见 allenai.org/papers/olmocore3。
核心要点速览 (Key Takeaways)
- ✓公告日 2026-10-01:Ai2 官博 + HF 镜像 + 代码 allenai/OLMo-core
- ✓并行:Expert / Pipeline / 分布式优化器;rowwise EP(NVSHMEM)+ GPU-resident routing + grouped GEMM;可选 DeepEP v2
- ✓吞吐锚点(官博):专家池 8→128、active≈3.2B 时吞吐跌幅 <5%;8×B300 上 47B MoE 52k vs 旧栈 19.4k tok/s/GPU(约 2.7×)
- ✓规模:1.2T / 58.36B active / 512 GPU,最高 858 TFLOP/s/GPU(随机路由系统基准);DeepEP v2 短测达 2.38T
- ✓精度与内存:MXFP8 相对 BF16 吞吐约 +21%、峰值活跃内存 103→95 GiB;拓扑无关 checkpoint;下一代 Olmo 将用 MoE
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
前沿模型越来越「总参数巨大、每 token 只激活一小撮专家」。训练侧却常把 dense 时代的 FSDP 全重分片硬套到 MoE:每次 microbatch 仍按总专家容量 gather/reshard 权重,吞吐随专家池膨胀而下坠——官博称之为 capacity tax。学术与中小实验室更缺一套开源、可复现、能摸到万亿量级的 MoE 训练栈。Ai2 于 2026-10-01 发布 Olmo-core 3(同步 HF Blog),并明确它是下一代 Olmo(将改回 MoE)的核心基础设施。
架构亮点与底层机制
相对旧路径,新栈以 Distributed Data Parallel(DDP) 为底座:专家驻留 GPU,把 token 行路由过去,而不是反复 gather 权重。之上叠加 Expert Parallelism(EP)、Pipeline Parallelism(PP) 与分布式优化器。通信侧提出基于 NVSHMEM 的 rowwise EP(token 直写专家缓冲)、GPU-resident routing(去掉稳态环路上的 D2H 同步)与 device-scheduled grouped GEMM;精度侧集成 MXFP8;checkpoint 记录与并行拓扑解耦的全局 FP32,便于换拓扑续训。可选 DeepEP v2 后端做跨节点专家组。代码:allenai/OLMo-core(Apache-2.0),PyPI 包名 ai2-olmo-core;技术报告 Supercharging Olmo-core…(2026-10)。
权威 Benchmark 与实测跑分对比
数字均来自 Ai2 官博/报告的系统吞吐,随机路由测基础设施,不是最终模型质量或 time-to-quality。容量扫描:top-4、active≈3.2B,专家池 8→128(总参 4.6B→47B)时吞吐跌幅 <5%。初步对比:8×NVIDIA B300 上 47B MoE,新栈约 52,000 tok/s/GPU vs 旧 FSDP 约 19,400(约 2.7×)。万亿级:1.2T 总参 / 58.36B active / 512 GPU,最高观察到 858 useful-model TFLOP/s/GPU;DeepEP v2 短测容量摸到 2.38T(非持续训练 SLA)。MXFP8(4×B300 受控):相对 BF16 吞吐约 +21%,峰值活跃内存 103→95 GiB。报告另记录 token gerrymandering(负载均衡损失「好看」但负载更歪)等负结果——勿把营销句当 Megatron-Core 全面替代声明。
开发者实战落地与开箱指南
- 读 官博 与 技术报告,对照 Section 14 的拓扑/精度/recompute 条件再读吞吐表。
pip install ai2-olmo-core或 clone OLMo-core;从官方 OLMo3 scripts 目录起步,先在小规模复现 EP/PP 组合。- 生产配置优先核对:专家并行度、流水线级数、MXFP8 作用域、activation recompute 与随机路由基准的差异。
- 与 NVIDIA Megatron-Core 对照选型:Olmo-core 3 强调「Olmo 家族一体 MoE 栈 + 开源决策过程」,不是宣称全面碾压。
- 定位:预训练/大规模 MoE 系统研究;与同日 Ai2 的 AstaBrief 推理模型新闻勿混写。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察