智谱:GLM-5.3-Flash 跑在国产芯片上
8 月 26 日晚间,智谱官微发布,为收集广大用户的广泛、专业反馈,GLM-5.3-Flash 在正式发布前,以匿名模型 Ox-Alpha(中文社区称作“牛来”)在 OpenCode 和 OpenRouter 上进行了大规模测试。Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。“过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”智谱表示。在集群层面,该公司采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。“与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”智谱称。
8 月 26 日晚间,智谱官微发布,为收集广大用户的广泛、专业反馈,GLM-5.3-Flash 在正式发布前,以匿名模型 Ox-Alpha(中文社区称作“牛来”)在 OpenCode 和 OpenRouter 上进行了大规模测试。Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。“过去一周,我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”智谱表示。在集群层面,该公司采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,从而在国产加速芯片上实现了高效、可靠的服务。“与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。这证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。”智谱称。