news_article.exe
📰
#GPT#Claude#Anthropic#开源#大模型#多模态

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

2026年8月28日1 次浏览来源:量子位 阅读原文

国产异构助力前沿智能进入普惠时代

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持 量子位

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

8月26日晚,智谱正式上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型。其总参数320B,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。GLM-5.3-Flash的架构专为极低成本而设计,结合智谱最新的30T Token多模态预训练语料,能够以更少的计算资源实现更强的性能。

依托先进的国产异构混推技术,商汤大装置为GLM-5.3-Flash上线提供大规模国产算力支持与Token服务,打造国产算力规模化商用又一硬核落地标杆。

这一合作的背后,正是商汤打造的 “一套模型、一座 Token(词元)工厂、一套智能体管控系统” 核心能力体系。其中 Token 工厂承担着把智能能力规模化生产出来的关键作用:它通过多模态模型和大装置基础设施的联合优化,把不同芯片、集群、能源和交付节点组织起来,持续生产更高质量、成本更低的Token。同时Token工厂与大模型之间构建起双向反哺闭环,更好适配原生多模态模型的迭代需求。商汤大装置高效支持了智谱 GLM-5.3-Flash的上线工作,正是这套闭环能力的有力印证。

长期以来,市场对国产算力的认知是,性价比不高、难以规模商用。而在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试,Token调用量高达62T,这些请求流量全部由国产芯片提供算力支持。且相较同一硬件环境下的初始基线,GLM-5.3-Flash基于国产芯片集群,端到端服务性能提升3倍,硬件效率和单Token成本已达到主流英伟达GPU相当水平。

这一实践表明,国产算力已经能够在大规模真实业务场景下,高效、经济地支撑前沿大模型推理需求。

作为最懂大模型的AI基础设施,商汤大装置全面拥抱国产化,并持续推动国产算力从“单点可用”走向“大规模商用”。今年WAIC期间,针对当前国产算力规模化商用卡点,商汤大装置从“性价比、适配性、能效比”三个维度系统性破题。

在性价比层面,商汤大装置跳出单卡性能比拼的传统思路,通过先进的异构混合推理技术,根据不同推理阶段对计算、带宽的不同需求让不同架构、不同定位的国产芯片各尽其长、高效协同,整体推理性价比达到 NVIDIA H系列的 1.25 倍,相比国产同构推理,同等成本下Token产能扩大约2.5倍。

在适配性上,通过底层算子优化、多卡并行调优和工具链适配等,大幅降低国产算力应用门槛。在能效比层面,商汤大装置推出算电协同Agent,并重新定义TPW(Tokens Per Watt)作为AIDC全新价值标尺。

此外,通过整合多元算力,并持续优化推理引擎与芯片性能,商汤大装置Token Factory正在形成大规模、高效率、低成本的Token供给能力,7月日均Token服务量已达到 2.42万亿,预计2026年年底突破日均10万亿,全年Token量级增长25倍。

未来,商汤大装置将持续投入基于国产化算力的Token服务建设,打造高性能、低成本、可规模交付的AI基础设施,推动国产算力从单点技术突破走向产业体系化繁荣。

e生涯斩获浙江一等奖,同蚂蚁、浙大一道晋级数据要素国赛2026-08-28

Łukasz Kaiser领衔,2026 奇点智能技术大会北京站正式官宣2026-08-28

商汤大装置助力智象未来实现视频生成业务向国产算力无感迁移2026-08-28

高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon,以12帧重建万帧3D场景2026-08-28

开源模型首超Opus4.6!智谱GLM-5.1登场,14小时后CUDA专家被冲了

商汤版ChatGPT「商量」来了!开放API,基于千亿参数大模型,体验实录在此

商汤「日日新V6.5」登顶OpenCompass全球多模态大模型榜单

匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的

英伟达AI服务器将涨价15%!1GW数据中心成本激增50亿美元

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

> 分享: