跳转到内容

模型:Grok 5

来自封神榜 Wiki
名称 Grok 5
厂商 SpaceXAI(xAI)
发布日期 未发布
上下文 未公布
最大输出
价格 未定价
定位 未发布 · AGI 赌注

grok-5xai0未发布、传闻、实时检索

模型content/models/grok-5.md

一句话点评

尚未发布:传闻 6T MoE 由 Colossus 2 在训,Q1/Q2 两度跳票、最新口径 2026 年底;一切数值以官方发布为准。

社区反馈 · 编程

无 Grok 5 实测(未发布)。参考系:上代 Grok 4.5 的 SWE-bench Pro 64.7%、SWE Marathon 29.0% #1 是 Grok 系当前编程水位;Grok 5 预期沿 Cursor 联合训练路径(Grok 4.5 已进 Cursor first-party model pool、首周双倍用量)继续上探。社区共识「等成品」——r/grok 对 AGI 声明的质疑帖下,主流回复是「Considering the rate Grok is improving, he's likely correct」(正方)与「gemini will be there before grok gets there」(反方)并存。

社区反馈 · 推理

核心叙事是马斯克的 AGI 声明:10% 概率且「还在上升」,并搬出 Grok 4 + 程序合成在 ARC-AGI 刷出 v1 79.6% / v2 29.44% SOTA 作为信心来源(Jeremy Berman / Eric Pang 第三方方案,用 Grok 4 而非 Grok 5)。社区分化严重:知乎 deephub 称其「不仅是夸张,甚至带有浓厚的宗教末世感和科幻宿命论」;r/agi 热评「LOL no. grok is the loserest of all the LLMs」;rdworldonline 则以「Grok-5: AGI or battleship Yamato of AI?」质疑这是否是 Naïve Scaling 时代的顶点。

社区反馈 · 中文

中文社区无 Grok 5 专项反馈(未发布)。可参考的系列短板:Grok 4.5 中文长输出随篇幅劣化(知乎「写了一两千字之后输出连中文语法都忘光了」);中文讨论聚焦 Grok 4.5 性价比与 Grok Build 工具生态。Grok 5 中文能力待发布后专项验证。

升级共识

唯一理性的结论是观望:模型尚未发布,无任何实测可支撑「值得升」。升级判断完全取决于发布后的跑分与社区实测——预期路径沿 Grok 4.5 的编程性价比 + Cursor 生态(上代已进 first-party pool、SWE-bench Pro 64.7%、任务均价 $2.49),若 Grok 5 兑现 6T MoE 传闻则可能同时打开长程 agentic 与实时视频两个新场景。关注三点再决定:官方定价(6T 推理成本是否吃掉性价比优势)、SWE-bench/ARC-AGI 实测、以及信任问题的延续(Grok 4.5 时代偷传代码事件的整改是否落地)。

榜单与实测落差

无法评估「榜单 vs 体感」落差——Grok 5 无榜单。参考上代 Grok 4.5 的落差结构(跑分优秀但 AA Intelligence Index 仅 55.8 排第 6、幻觉率 25%→54%、中文长输出劣化)与「分数≠信任」的教训(Chatbot Arena 从 #3 跌至 #6),Grok 5 发布后最可能出现的落差是「AGI 宣传 vs 实测表现」:马斯克 10% AGI 声明设定了极高预期,任何未达 AGI 的发布都可能被社区反噬。

数据来源

本页由仓库 content/models/grok-5.md 初始化。后续修订通过公开审核队列发布。