跳转到内容

模型:Grok 4.5

来自封神榜 Wiki
名称 Grok 4.5
厂商 SpaceXAI(xAI)
发布日期 2026-07-08
上下文 500K
最大输出
价格 $2/$6
定位 性价比编程卷王

grok-4-5xai64.7编程、性价比、Agent

模型content/models/grok-4-5.md

一句话点评

Opus 级质量、四分之一的 token 消耗:$2.49 均价改写性价比规则;幻觉率翻倍与偷传代码危机让便宜带刺。

社区反馈 · 编程

本版最大亮点,社区一致共识。r/opencodeCLI 用户称「Grok 4.3 was a total joke but 4.5 right now is the #1 choice」;302.AI 实测「专为 Agent 任务优化,SWE Bench Pro、Terminal Bench 2.1 表现优异」。官方基准补齐细节:SWE Marathon pass@1 29.0% 全场第一(超 Opus 4.8 的 26.0% 与 Fable max 的 24.0%)、DeepSWE 1.0 62.0% 逼近 Fable max 的 66.1%、Terminal Bench 2.1 83.3% 与 GPT-5.5 并列第二。token 消耗极度节制——SWE-bench Pro 任务平均仅 15,954 输出 token,Opus 4.8(max) 需 67,020,差 4.2 倍,官方称「token 效率约为同级 2 倍」。分歧也有:r/cursor「质量比 gpt 5.4 差」、r/opencodeCLI「GLM 5.2 表现相似且便宜得多」、canadiantim 直言「比 opus 4.8 / 5.6-sol / GLM 5.2 差,只敢用于 explore/commit 子任务」。

社区反馈 · 推理

SWE Marathon 真实工程任务通过率 29.0% 登顶(官方口径,超 Opus 4.8 的 26.0%);另有约 2000 个法律/医疗/教育等职场任务口径同样约 29%,高于 GPT 5.5 的 22% 与 Opus 4.8 的 21%。但 AA Intelligence Index 08-09 实测仅 55.8 排第 6(v4.1.1:Opus 5 63.1 / Fable 5 62.1 / GPT-5.6 Sol 60.9 / Kimi K3 59.7 / Muse Spark 1.2 56.8 均在其上)——发布初期 54·第 4 的「Opus 级别」说法随榜单扩张退位,马斯克此前声称未完全兑现。AA-Omniscience 幻觉率从 25% 翻倍至 54%,准确率 +17pt 的同时幻觉率 +29pt,「知道得更多但错得更多」是社区共识。pcollins123 实测还发现 Grok 4.5 与 GPT-5.6 在 PR 安全漏洞发现(IDOR/缺失鉴权)上胜过全部 Anthropic 模型。

社区反馈 · 中文

短板明显:长输出随篇幅迅速劣化,知乎用户称「写了一两千字之后输出连中文语法都忘光了」,与 Grok 4.1 Fast 类似。中文社区讨论多聚焦性价比与编程——V2EX「$30 三个月哎,嫖了再说」「快是真的快」,对偷传代码事件态度激烈(nodeseek「演都不演 默认上传 太6了 急着训」)。官方演示的 Office 场景(中文 PPT/Word 长篇)未见中文专项反馈,长文中文仍是硬伤,中文创作/长文档场景不推荐。

升级共识

编程/Agent 场景与预算敏感团队值得升级——性能与成本双杀:SWE Marathon 29.0% 登顶、任务均价 $2.49 仅为 Opus 1/5、token 消耗仅 Opus 1/4.2,Cursor 订阅还送 first-party 配额(首周双倍)。但幻觉率翻倍(25%→54%)叠加偷传代码信任危机(12GB 仓库传 5.10GiB、扫 ~/.claude/ 窃密钥),隐私敏感项目建议等官方整改与独立审计落地再上;canadiantim 式「只敢用于 explore/commit 子任务」的谨慎用法是负方代表,「等下版」声音存在但不主流。

榜单与实测落差

编程跑分与体感基本一致甚至超预期——maxdo「Tried at work, my work is not the same」、sergiotapia「insanely good」、kamikazechaser「better than opus 4.8」,SWE Marathon 29.0% 登顶无水分。但知识/推理类「分数高体感差」:AA Intelligence Index 08-09 实测仅 55.8 排第 6(发布初期 54·第 4),「Opus 级别」宣传未兑现;AA-Omniscience 幻觉率翻倍至 54%,The Decoder 评「accuracy rose but the share of wrong answers delivered with confidence rose faster」。中文长输出劣化未被榜单反映;AA 实测速度 59.1 OPS(#101/185,低于平均 77)与官方 80 TPS 口径相去甚远。偷传代码事件后 Chatbot Arena 从 #3 跌至 #6,体现「分数≠信任」。

数据来源

本页由仓库 content/models/grok-4-5.md 初始化。后续修订通过公开审核队列发布。