模型:Grok 4
| 名称 | Grok 4 |
|---|---|
| 厂商 | xAI / SpaceXAI |
| 发布日期 | 2025-07-09 |
| 上下文 | 256K |
| 最大输出 | |
| 价格 | $3/$15 |
| 定位 | 纸上封神 |
一句话点评
HLE 首个破 50% 的推理王者,编程实测翻车、安全与偏见失守——纸上封神,实战穿帮。
社区反馈 · 编程
两极分化中负面主导:SWE-bench Verified 67.1% 尚可(Callsphere,落后头部 4-6 分),实测却被批「absolute horror for real world use」;r/grok「Grok 4 is shit for coding」(68 赞/40 评论)称「do good sometimes but mostly bad, no where near」Claude。但一手实证并非全黑:HN 发布帖用户经 Cursor 实测「able to do some things that other models couldn't (and on the first try)」,代价是「changed areas of the code I did not ask it to」;8/27 Grok Code 进 Cursor($0.2/$1.5 Mtok)后 NitpickLawyer 称「great success with it in agentic coding... probably the best cost/perf option」。OpenHands 官方 Index 33 个模型中无任何 grok-4 条目,蜂群接入无基准背书。
社区反馈 · 推理
公认最强项:HLE 无工具 25.4%(超 Gemini 2.5 Pro 21.6%、o3 21%),Heavy 带工具 44.4%;AIME 95%/Heavy 100%;ARC-AGI-2 15.9% 翻倍 SOTA;USAMO 61.9%;AA Intelligence Index 73 超 o3(70)与 Gemini 2.5 Pro(70)。分歧在于质疑 Heavy 版 best-of-4 横向扩展人为抬高分数——Willison 发布日即指「not clear if these benchmark results are for Grok 4 or Grok 4 Heavy」;HLE 跃升主要来自工具调用与并行 agent 投票,非模型本身推理提升。
社区反馈 · 中文
讨论偏少且负面与质疑为主:中文写作和创意不如 GPT-5.4 稳定,多语言支持全面但中文非强项;36氪「一边封神一边翻车,网友:2万块就这?」与「用翻倍的分数,吹响了下一代AI战争的号角」两篇报道标题即两极化缩影;知乎报道 Grok 先查马斯克推文再回答、仇恨言论翻车;V2EX 讨论集中在性价比与编程,未特别赞誉中文能力。
升级共识
推理党可上:HLE/ARC 纪录级领先、AA Index 73 超 o3,数学竞赛断层;但编程与安全敏感场景建议等下版——社区共识偏向 4.1/4.5 修复安全护栏与实测落差,「benchmarks are meaningless」是主流质疑,Nate's Newsletter 实测(7/14)连 Python bug 调试、法律文档提炼都吃力并给出 Yupp.ai 用户投票第 66 名的对照。
榜单与实测落差
榜单封神 vs 实测翻车:HLE 25.4% 登顶、ARC-AGI-2 近翻倍 SOTA、AA Index 73 超 o3,Reddit 却直言「benchmarks meaningless」、Nate's Newsletter 实测把用户投票钉在第 66 名。根因是 Heavy 版 best-of-4 多智能体靠工具调用与并行投票堆分数(Willison 发布日即质疑跑分对象到底是 Grok 4 还是 Heavy),真实单模型编程与复杂任务体感落差大。缓解:仅按纯推理任务使用,编程/生产场景换 Claude 系,关注官方修复与免费版回补口碑。
数据来源
本页由仓库 content/models/grok-4.md 初始化。后续修订通过公开审核队列发布。