Together AI 宣布在其无服务器推理平台全面上线 GLM-5.3 Flash。作为首款 320B-A18B 原生多模态 MoE 模型,具备 100 万超长上下文与混合注意力,在 DeepSWE 编程基准中性能直逼 Luna,同等成本下产出翻倍。

核心要点速览 (Key Takeaways)

  • ✓320B 总参、18B 激活的原生多模态模型正式进入托管 API 矩阵,支持秒级自动扩缩容;
  • ✓原生视觉与混合注意力融合,兼顾大图表与海量代码库解析,大幅降低智能体开发调用开销;
  • ✓在 DeepSWE 软件工程基准评测中展现极高性价比,同等 Token 预算下完成的真实编程任务超两倍。
🧭

阅读完核心要点?测算glm-5-3-flash的真实费率与实战跑分

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。