跳转到内容

模型:GPT-5 mini/nano

来自封神榜 Wiki
名称 GPT-5 mini/nano
厂商 OpenAI
发布日期 2025-08-07
上下文 400k
最大输出 128000
价格 $0.25/$2
定位 轻量性价比标杆

gpt-5-mini-nanogpt45.7轻量、性价比、工具调用

模型content/models/gpt-5-mini-nano.md

一句话点评

以旗舰三分之一成本扛起高频轻量任务——性价比封神、工具调用惊艳,幻觉率与智能落差却是硬伤:选型不看谁更强,看谁更适合。

社区反馈 · 编程

两极但整体正面:SWE-Bench Pro 45.7%(官方)、独立评测 79 赞称「a lot of bang for the buck」,Codex 子代理仅耗 30% 额度;但 r/GithubCopilot 72 赞帖称「worse than GPT-4.1 in almost every way」——交付细节与旗舰差距明显,nano 更只宜高频简单执行。Harness 实测分化同样显著:Cursor 官方论坛用户称「nailing bugs again and again」「tool calls work almost perfectly」、Dre Dyson 独立测试 200+ 案例得出 73% 更少 token / 94% 指令遵循 / 89% 样板一次到位;而 El Bruno 在 GitHub Copilot CLI + BYOK 里用 4.16K 请求、104.27M tokens、总成本仅 $6.81 构建 Windows 托盘应用,结论却是「代码便宜、质量门禁贵」——运行时 DI、XAML 解析、托盘生命周期连环踩坑,构建通过≠能跑。

社区反馈 · 推理

同等成本下可圈可点:AA Intelligence Index 25–31 分高于可比中位数(16–17),GPQA Diamond 81.6%,HN 实测 mini medium 在 NYT Connections 扩展基准对齐 o4-mini medium;但社区共识「不是智能突破」,nano 推理密集任务明显力不从心(OSWorld 39.0%、Toolathlon 35.5%),发布首日 lynx97 即称「gpt-5-nano gives noticeably worse results than o4-mini」;HN 热评(248 分帖)powera 总结「simple tasks 里 GPT-5-mini 99% 时间够用」,BoumTAC 则说「mini 发布比旗舰更能反映真实代际进步」——它的价值定位是「够用」而非「惊艳」。

社区反馈 · 中文

原版中文专项评测较少(掘金/302.AI 侧重 GPT-5.4 mini):中文场景准确率约 71.5%、法律行政领域 +16.6%;但「纯中文成本效率比不占优」,GLM-5-Turbo、Gemini 3 Flash 同准确率更便宜;302.AI 实测结论「mini 已能胜任绝大多数开发任务,选型不再是谁更强而是谁更适合哪一部分」,nano 定位「低复杂度高频执行单元」;知乎/CSDN 未见集中负面,苍何在 Cursor CLI 的中文实测称 GPT-5「很少瞎改代码、前端审美和指令遵循进步大」。

升级共识

高频轻量任务与成本敏感用户值得入手——mini 让 $20 plan 额度延长约 3.3 倍,nano 纯分类/提取性价比无敌;但追求前沿智能、容错率低的生产关键路径应等旗舰或直接用旗舰档,nano 仅宜简单执行单元。HN 热评(248 分帖)点破核心判断:powera「simple 任务 99% 够用」、BoumTAC「mini 发布比旗舰更能反映真实代际进步」、HugoDias 却因「性能疑似漂移」从 mini 迁回 Claude Haiku 4.5——它是一台「性价比正确」的机器,但生产环境要像 El Bruno 那样为质量门禁预留预算;2026-12 停用后轻量档位交接 Luna,新用户选型应直接评估 5.4 mini 或 Luna。

榜单与实测落差

榜单中端、体感两极:SWE-Bench Pro 45.7% 同级领先、AA 指数超中位数,但实测幻觉率 92%、r/GithubCopilot 称「worse than GPT-4.1」;根因是轻量架构压缩能力与期望错位(当降级备选超预期、当旗舰替代低预期),Vals.ai 多项 0.0% 疑为评测配置问题;Harness 视角拉大这种分化——Cursor 论坛与 Dre Dyson(73% 更少 token、94% 遵循、89% 样板一次到位)给出「超预期」证据,而 El Bruno 的 Copilot CLI 实测($6.81 构建成功但质量门禁连环踩坑)与 OpenHands 官方评测基建故障(issue #239 三次 404/503 取消)则提示「跑分缺失≠能力缺失、能跑≠能交付」;缓解靠高质量 prompt(Tau² 重写 +22%)与按场景选 mini/nano。

数据来源

本页由仓库 content/models/gpt-5-mini-nano.md 初始化。后续修订通过公开审核队列发布。