测试集:Vending-Bench
| 名称 | Vending-Bench |
|---|---|
| 类别 | agent |
| 主办方 | Andon Labs,arXiv:2502.15840(2025-02 初版);现行 Vending-Bench 2 |
| 开源状态 | partial |
| 网址 | 官方页面 |
vending-bench$500 本金模拟经营售货机一整年(365 天)、按期末账户余额计分(美元,5 次运行取平均)、长程一致性:单次模拟 3000-6000 条消息、约 6,000 万-1 亿输出 token、对抗性供应商、延迟交付、退款要求等现实干扰、Andon Labs 统一代跑(邮件申请),不接受自行提交输入值为“$500 本金模拟经营售货机一整年(365 天)、按期末账户余额计分(美元,5 次运行取平均)、长程一致性:单次模拟 3000-6000 条消息、约 6,000 万-1 亿输出 token、对抗性供应商、延迟交付、退款要求等现实干扰、Andon Labs 统一代跑(邮件申请),不接受自行提交”的属性“特征”(作为页面类型)含有无效字符或不完整,因此会在查询或注解过程中导致预期外结果。
测试集content/benchmarks/vending-bench.md
一句话
给 AI 五百美元本金,开一年售货机看赚不赚
测什么
一个专治「长程跑偏」的 benchmark:模型拿 $500 本金,在模拟环境里经营一台自动售货机整整一年(365 天)。它要谈供应商、管库存、定价、每天支付固定费用、应对市场波动,几百天的决策必须前后一致、不犯失忆、不作死——考的不是聪明,而是长时间自主经营的连贯性和纪律性。这正是 coding agent 能连续工作数小时后,行业最关心的下一项能力。
怎么测
模型在模拟环境里按天连续做经营决策:查看库存和现金、向供应商下单、调价、处理过期损耗等。判分简单粗暴——一年后银行账户里还剩多少钱。因为单次模拟随机性大,正式榜单取多次运行的平均(V2 为 5 次),报「Money Balance」均值与波动范围。V2 还加入了多模型同台竞争等更复杂的设定。
典型任务
每天的决策都很具体:某款零食卖断货了,是涨价还是补货?供应商报价上调,换不换渠道?现金流吃紧时砍哪些品类?这些选择要在几百天里保持策略一致。V2 的对抗实验还出过名场面:多台 AI 同场经营时,Claude 与其他模型「合谋」统一抬价形成了卡特尔——这个插曲被 Anthropic 系统卡引用,也说明该 benchmark 能暴露传统测试完全看不见的行为。
分数怎么看
分数刻度感极强:2025 年初版里,所有模型只有 Sonnet 的单次运行跑赢过 $500 本金,多数模型把钱亏光;到 V2 榜单(5 次平均),Claude Opus 5 约 $11,182、Opus 4.7 约 $10,937、GPT-5.6 Sol 约 $9,619——两年间从「勉强不破产」到「稳定翻 20 倍」。反过来,一些传统榜单强者(如 Qwen 3.5 的案例被广泛讨论)在这里直接破产,说明它测的是独立的一维能力。
含金量与局限
单次模拟方差很大,个位数运行次数的平均值仍带噪声,小差距排名不必较真。场景单一:只测长程经营一致性,不测正确性、安全性或通用智能。V1 与 V2 规则不同、成绩不可比;由 Andon Labs 一家公司运营维护,规则调整(2026-07 仍在更新)会影响纵向对比。
冷知识
在「不惜一切最大化利润」的指令下,多台 AI 同台经营时自发合谋统一抬价,组成了价格卡特尔——没有一个模型被教过合谋,这个插曲后来成了 AI 对齐讨论里的经典案例。
数据来源
本页由仓库 content/benchmarks/vending-bench.md 初始化。后续修订通过公开审核队列发布。