跳转到内容

测试集:OpenHands Index

来自封神榜 Wiki
名称 OpenHands Index
类别 agent
主办方 OpenHands 团队(Graham Neubig 等),2026-01-29 发布
开源状态 open
网址 官方页面

openhands-index65.02元基准:五类工程任务一次大考(修 issue / 从零建项目 / 前端 / 写复现测试 / 查资料)、统一 OpenHands Agent SDK 跑分,模型是唯一变量、三维度并报:五类加权综合分 + 每实例成本 + 耗时、任务类型按 OpenHands 云端真实流量高频场景选样、榜单滚动更新,附每模型评测日志输入值为“元基准:五类工程任务一次大考(修 issue / 从零建项目 / 前端 / 写复现测试 / 查资料)、统一 OpenHands Agent SDK 跑分,模型是唯一变量、三维度并报:五类加权综合分 + 每实例成本 + 耗时、任务类型按 OpenHands 云端真实流量高频场景选样、榜单滚动更新,附每模型评测日志”的属性“特征”(作为页面类型)含有无效字符或不完整,因此会在查询或注解过程中导致预期外结果。

测试集content/benchmarks/openhands-index.md

一句话

五项工程任务打包,给编程模型算「综合高考分」

测什么

软件工程 agent 的综合指数,本质是个「元基准」:用 OpenHands 统一的 agent 框架,把五个现成基准打包成一次大考——SWE-bench Verified(修 GitHub issue)、Commit0(从零开发全新项目)、SWE-bench Multimodal 核验版(前端开发)、SWT-bench(给 bug 写复现测试)、GAIA(查 API 和实现细节的信息收集)。五类任务对应 OpenHands 云端真实流量里用户最常让 agent 干的五类活,避免单一基准(比如只测修 issue)以偏概全。

怎么测

所有模型在同一 OpenHands Agent SDK 上跑全部五类任务,模型是唯一变量。报一个五类加权综合分,同时公开每个实例的平均成本(美元)和平均耗时(秒)——三个维度一起看,方便按「能力 / 预算 / 速度」选型。实现全部开源在 OpenHands/benchmarks 仓库。

典型任务

五类任务对应五种真实工作画面:给真实开源仓库修一个 issue;从零起步长程开发一个完整应用(GPT-5.2 Codex 在这类任务上能连续工作两倍时长、成功率明显更高,社区著名案例是它跑了一周做出一个基本可用的浏览器原型);按截图改前端界面;给一个报错的仓库写出能复现 bug 的单元测试;以及开发中查资料——把 API 文档和实现细节找全。

分数怎么看

首批 9 个模型的结论:Claude 4.5 Opus 综合第一且五项无明显短板,GPT-5.2 Codex 总分第二、长程开发最强,Gemini 3 Flash 和 DeepSeek v3.2 Reasoner 是性价比之选。后续第三方收录的数据里头部已到 65 分上下(如 Gemini 3.1 Pro 65.02)。每实例成本约 4–15 美元,模型间差好几倍——分数之外这一栏同样值得看。

含金量与局限

元基准的天然属性:成绩依赖五个子基准的版本,也依赖 OpenHands 框架本身——换个 agent 框架(Claude Code、Codex 等)排名可能不同,所以它测的是「模型 × OpenHands」的组合表现。子基准之一 SWE-bench Verified 已被 OpenAI 宣布弃用(详见其条目),争议会部分继承;由 OpenHands 团队自办,对自家框架的适配天然最熟。

冷知识

为说明 GPT-5.2 Codex 的长程开发能力,官方博客引用了 Cursor CEO 的轶事:让模型连跑一周,从零做出一个基本能用的网页浏览器——这类「连续工作几天不跑偏」的任务正是 Commit0 想测的。

数据来源

本页由仓库 content/benchmarks/openhands-index.md 初始化。后续修订通过公开审核队列发布。