跳转到内容

模型:GLM-4.6

来自封神榜 Wiki
名称 GLM-4.6
厂商 智谱AI / Z.ai
发布日期 2025-09-30
上下文 200k
最大输出
价格 $0.11/$0.28
定位 国产 Claude 平替

glm-4-6glm68代码、开源、性价比

模型content/models/glm-4-6.md

一句话点评

代码对齐 Claude Sonnet 4 却只要 1/7 价格,国产开源编程平替的破局者;echoing 与复杂任务翻车是绕不开的暗面。

社区反馈 · 编程

正面占绝对主流且有多组独立量化背书:官方 CC-Bench 74 个真实任务超 Claude Sonnet 4(48.6% 胜率、token 较 4.5 节省 15%–30%);Cline 官方遥测数百万次 diff-edit 成功率 94.9%,距 Sonnet 4.5 的 96.2% 仅 1.3pt;r/LocalLLaMA 用户在 prod 用了一个月「way better autonomy than any other proprietary model」。真实 harness 口碑同样扎实:阮一峰复测 Simon Willison 的测试 278 用例 18.31s 全过,mrlaude 称日常 grunt work「barely notice a difference」、约 90% Sonnet 4.5 水平。但复杂任务分化明确:r/LocalLLaMA 用户耗 300 万 token 仍搞不定 Unity 包版本不匹配,Lynn Cole 实测「一点复杂度就 loop 并切中文」,r/ClaudeCode 有模型越界改 CSS/Canvas 被 git reset 的翻车案——常规任务超出基准预期,复杂任务低于预期。

社区反馈 · 推理

对标 Claude Sonnet 4/4.5:GPQA 82.9%(带工具)与 Claude 4.5 的 83.4% 基本持平,AIME 2025 官方口径 98.6 接近满分(第三方口径 93.9,双口径并存);302.AI 横测称其在复杂推理的准确性与稳定性上「表现更为突出」。但特定任务有翻车:知乎用户实测 GLM 在时间推理上「因奇葩理解方式」翻车,豆包估准、千问更稳;4.6V 在漫画逻辑排序、罚球场景视频理解上误读(302.AI 实测称「偏科生」)——强在结构化任务,弱在需文化常识与空间想象的场景。

社区反馈 · 中文

中文创作/理解是国内大模型第一梯队,写作更贴近人类表达;少数派横测 GLM-4.6 中文产出「比 Claude Sonnet 4 似乎更好一点」,Super黄 实测前端渐变配色与复杂多层布局「比 4.5 规整」。但英文表达有「非母语开发者」感,英文用户需更冗长描述需求(r/LocalLLaMA);创意写作/RP 场景受 echoing 与对齐过强拖累口碑分化;另 aicodingdaily 提醒 Z.ai(新加坡实体)条款对 prompt/code 授权范围宽泛,注重数据安全的企业建议本地部署开源权重——中文社区对此讨论度低,海外开发者顾虑更多。

升级共识

编程/Agent 场景强烈值得升级:LCB 63.3→82.8、Cline 遥测 94.9%(距 Sonnet 4.5 仅 1.3pt)、74 任务超 Sonnet 4、同任务成本约为 Claude 的 1/5–1/6(Joe Njenga 实测 $0.10–0.25 vs $0.50–1.20),Asma Arshad 实测「90% 收益 20% 成本」的混合路线是社区主流玩法;创意写作/RP 用户视需求而定——echoing 未解决,4.5/4.6 差异不大,可继续观望;对数据合规敏感的企业建议本地部署或混合路由。

榜单与实测落差

罕见地出现「分数高、体感也好」与「分数高、复杂任务翻车」并存的复合落差:Cline 百万次 diff-edit 遥测 94.9% 证明常规编程体感贴近基准甚至优于分数,但 Lynn Cole 的 loop+切中文、r/ClaudeCode 的越界修改、OpenHands 的对话终止证明复杂/长链任务体感远低于基准;视觉侧 4.6V 则是典型「偏科生」(302.AI:工程执行力强、感知与常识弱)。根因:强项集中在结构化常规任务与 token 效率,短板在复杂依赖管理、任务边界识别与泛化感知;缓解:常规任务放心用、复杂长链按 spec 拆解并加 git 防护、视觉换专用模型。

数据来源

本页由仓库 content/models/glm-4-6.md 初始化。后续修订通过公开审核队列发布。