智谱发布并开源多模态模型 GLM-5.3-Flash:对标 DeepSeek,由 10 万国产卡支持
上周三
智谱上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,总参数 320B,能力超 GLM-5.2,在 AA 综合智能指数中获 57 分,与 Claude Opus 4.8 得分持平,编程表现也相当。该模型定价为 GLM-5.3 的 1/10,限时折扣为其 1/20、Opus 4.8 的 1/40。此前它以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 测试,成当周最受欢迎模型,调用量创双平台新高,算力由国产芯片支持。GLM-5.3-Flash 采用全新低成本架构,激活参数量与层数近乎减半,是首个采用稀疏与线性注意力混合架构的开源前沿模型,还采用流形约束超连接提升 Scaling 能力。其注意力计算量较 GLM-5.3 降 3.01 倍,KV 缓存大小降 4.44 倍,注意力计算量为基线模型中最低。智谱用国产芯片集群为其提供服务,自研推理引擎,借助 GLM-5.3 驱动的 infra agent 加速构建,通过多项内存优化及 EPD 分离式架构,使端到端服务性能较初始基线提升 3 倍,硬件效率和单 token 成本达主流英伟达 GPU 水平。目前该模型已面向全球开源,接入 ZCode 等平台,纳入 GLM Coding Plan 并开放 API 调用。
体验专业版特色功能,拓展更丰富、更全面的相关内容。