模型:GLM-5
| 名称 | GLM-5 |
|---|---|
| 厂商 | 智谱 AI / Z.ai(清华系) |
| 发布日期 | 2026-04-16 |
| 上下文 | 256k |
| 最大输出 | 32000 |
| 价格 | $0.9/$2.8 |
| 定位 | 国产 Agent 主力 |
一句话点评
国产模型中工具调用最成熟,中文 Agent 场景稳定。
社区反馈 · 编程
核心卖点,社区共识是「工程能力站到 Opus 同梯队」:新智元实测「25 分钟一镜到底搓出完整系统」(X 平台监控系统)、开发者 1 天复刻「丐版 Cursor」(GLMLIFE,Monorepo Core/CLI/Desktop + Electron + React 18)、oneshot 出 roguelike 整游戏。分歧在档位:max effort 下逼近 Opus 但「三倍价格才能搞定」,低 effort 退化明显需人工干预(「oneshot 整个 roguelike 后,现在实现两个功能都要手把手」);第三方 FP4 量化后编程推理能力崩塌。
社区反馈 · 推理
发布初期 AA 全球第四、开源第一(HN 高赞:「GLM-5 is at #4 after Claude Opus 4.5, GPT-5.2-xhigh and Claude Opus 4.6」),Intelligence Index 50 分、Extended NYT Connections 81.8 开源第一,AA 实测幻觉率开源最低(HN:「z.ai → GLM-5 (lowest hallucination rate on Artificial Analysis)」)。但存在「知行脱节」:FoodTruck Bench 30 天评测中模型在思维链得出正确诊断却忽略自身分析——写下 123 条记忆、每天早上收回却无一转化为行动,最终破产于第 28 天(中位净资产 -$210)。
社区反馈 · 中文
中文创作与理解表现优秀,代码与中文混排自然流畅;智谱清华系中文语料优势明显,知乎评测称中文指令理解优于同档开源竞品。新智元实测中中文提示「页面还是一片黑,初始化时没有出现第一个内容……」GLM-5 一次定位渲染 bug 根因;无明显负面反馈。
升级共识
国产开源模型的分水岭,高 effort 下工程能力逼近 Opus,值得从 GLM-4.7 升级;新智元实测结论「某种程度上,GLM-5 或许是一个能改变行业格局的模型」获社区共鸣。但初版低/中 effort 退化明显、发布节奏混乱(软启动 + 流量十倍激增)、涨价惹议(2/12 涨幅自 30% 起、7/30 MAX 469→862 元/月)——工程重活可立即升,简单日常任务建议开高 effort,或等 5.1/5.2 迭代(5.1 发布后官方修复了初版体验问题,HN 用户 4/14 反馈「working MUCH MUCH MUCH better」)。
榜单与实测落差
榜单顶尖但细节粗糙:SWE-bench 77.8 开源登顶、AA 发布初期全球第四开源第一,FoodTruck Bench 30 天模拟却破产于第 28 天——写下 123 条记忆、每天早上收回却无一执行,awareness 与 execution 明显脱节(5 次运行 4 次破产、中位净资产 -$210)。低/中 effort 退化(「连两个功能都要手把手」)、第三方 FP4 量化降智进一步拉大落差;AA 页面 GLM-5 本体 Intelligence 分已随 Index 版本重排(发布时 50 → 8 月口径 41/#17),需注意数字口径。缓解:直连 Z.ai、开高 effort、避开 FP4 平台。
数据来源
本页由仓库 content/models/glm-5.md 初始化。后续修订通过公开审核队列发布。