Together AI 正式在其算力平台提供 GLM-5.3 Flash 原生多模态推理服务。该模型采用 320B 总参、18B 激活与 100 万 Token 混合注意力架构,在 DeepSWE 编程基准上对齐前沿模型,且同等预算下完成工作量翻倍以上。

核心要点速览 (Key Takeaways)

  • ✓极致性价比架构:320B-A18B MoE 稀疏激活在保持高精度的同时大幅压缩单 Token 成本;
  • ✓原生多模态 + 百万上下文:支持在超长代码库、架构图纸与系统日志中进行精准跨模态定位;
  • ✓为长周期自主编程 Agent 提供了兼顾推理吞吐与质量的云端托管方案。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算