跳转到内容

模型:GLM-5.2

来自封神榜 Wiki
名称 GLM-5.2
厂商 智谱AI(Z.ai)
发布日期 2026-06-13
上下文 1M
最大输出 131072
价格 $1.4/$4.4
定位 开源新皇

glm-5-2glm74.4开源、编程、长程

模型content/models/glm-5-2.md

一句话点评

1M 上下文吞下整个仓库、FrontierSWE 单代跃升 43.9 分加冕开源新皇,代价是推理 token 全梯队最啰嗦——脑子追上了前沿,腿还没跟上。

社区反馈 · 编程

正面为主但分化:SWE-bench Pro 62.1 反超 GPT-5.5(58.6),r/ClaudeCode 个人基准 110/110 满分,「GLM 5.2 via Claude Code is the first non-Claude model that feels close to Opus」帖成 r/ClaudeAI 热帖;但 CursorBench 官方仅 55.0%(Max),落后 Opus 4.8 Max 的 62.3% 约 7 分,r/codex 在 50 个真实 Go/Rust PR 上实测「last on quality」,theprimeagen 独立基准 9.0 vs Fable 9.1、SWE-bench Pro 0.621 vs 0.800。共识:常见框架舒适(HN 用户实测后端 Rust/C++「very capable」)、二线框架与偏门命令行搞不定(知乎),超过 200k 上下文后能力明显退化(HN LaurensBER:plan-first + 短命子代理更稳)。

社区反馈 · 推理

数学天花板但效率全梯队最差:AIME 2026 99.2 居首、GPQA-Diamond 91.2(AA 口径 89)、HLE(带工具) 54.7(AA +12 至 40%);但 AA 实测 43,000 token/任务(GLM-5.1 仅 26k)远超 GPT-5.5 xhigh 的 16k,HN 实测 15 分钟/45k token 推理才写首行代码(Tiberium)。反直觉亮点:AA-Omniscience 幻觉率仅 28%,GPT-5.5 高达 86%——「GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2」帖 585 分/294 评论(arrowtsx.dev),同一 Python 架构陷阱题 GLM-5.2 12 秒/799 token 识别不可能性,DS V4 Pro 3m52s/7.7k token 自信地错。

社区反馈 · 中文

中文编程社区正面为主,获封「国产编程模型天花板」(知乎深度测评 10 万+ 阅读);LINUX DO 实测帖「GLM 5.2测评:跻身第一梯队」(t/2394670)获 200+ 回复,「很强,实际体验已处于跟 GPT、Claude 第一梯队」(t/2397728);但搜索、知识问答非强项(知乎「如何评价」帖),有 Reddit 用户报告语言混乱(「I said hi, it replied in Chinese…we were still in 2025」,疑似特定部署配置所致,r/LocalLLaMA creative_writing 帖)。

升级共识

编程与长程任务强烈建议升级:SWE-bench Pro 62.1 反超 GPT-5.5(58.6)、1M 上下文让全仓重构成常态(88 万 token 三端一次交付),Nathan Lambert 实测「the model capabilities immediately felt right」、r/ClaudeAI 帖称「first non-Claude model that feels close to Opus」;但纯速度/成本敏感场景需权衡——43k token/任务(GLM-5.1 仅 26k)使实际花费并不便宜,AA 实测 $0.46/任务高于 Kimi K2.6($0.31) 与 MiniMax-M3($0.18),HN KronisLV 实测订阅 $100→$200 档「approximately as capable as Opus but less annoying」;可留在 GLM-5.1 或换 GPT-5.5 high(10k token/任务)。

榜单与实测落差

分数追平闭源前沿但实测三落后:速度(43k token/任务、Demo 任务 13 分钟 vs 竞品 3 分钟,HN Tiberium「spent over 15 minutes reasoning…45k tokens」)、前端审美(Design Arena 1360 Elo 第一 vs 实际 UI「挤得像早高峰秋石高架」,r/opencode「no vision, text only」帖)、真实 PR 质量(r/codex 实测 last on quality、CursorBench 官方 55.0% 落后 Opus 4.8 的 62.3%)。根因是 1M 上下文撑高跑分而 token 效率未优化(AA 43k/任务全梯队最高),第三方量化版又虚高(HN CuriouslyC「Kimi 官方 API vs 第三方差 20-40%」)。缓解:场景分流(长程重活给 GLM-5.2、快速迭代给 flash/旗舰)+ 关注 reasoning early stopping;超过 200k 上下文建议 plan-first + 子代理拆分(HN LaurensBER 实测)。

数据来源

本页由仓库 content/models/glm-5-2.md 初始化。后续修订通过公开审核队列发布。