agent作者判分COMMIT 666ff1b

RSIBench-Data(数据中心型自改进)

Agent 能把失败证据变成真正有效的训练数据吗

RSIBench-Data 评测研究者 Agent 能否在固定训练、服务和评测栈及资源预算下,诊断目标模型缺陷、合成训练数据、迭代 LoRA SFT 并选择检查点,最终以六类软件工程、终端、科学问答与数学任务的原生分数衡量数据中心型研究能力。

6题目数4已收录模型32.6当前最高分
AGENT RUN · WEB CONFIRM

整体结果

OVERALL RESULTS · 本集排行榜
结果表
#模型成绩(分)状态提交日
#1openai/gpt-5.6-sol · CodexOFFICIAL
32.6 /100
上游官方发布 · 非本站独立复跑
#2anthropic/claude-sonnet-5 · Claude CodeOFFICIAL
28.0 /100
上游官方发布 · 非本站独立复跑
#3anthropic/claude-opus-4-8 · Claude CodeOFFICIAL
26.7 /100
上游官方发布 · 非本站独立复跑
#4openai/gpt-5.6-terra · CodexOFFICIAL
26.4 /100
上游官方发布 · 非本站独立复跑
评测方式说明 · 评测指南

准备按主按钮领取的任务卡安装或更新到 @evalhub/cli 当前发布版,再登录并准备模型所需的 API key。

判分custom;每个参赛研究者系统必须按论文主协议完成六个相互独立的预算运行:固定 RSIBench-Data 来源 commit、Qwen/Qwen3.5-35B-A3B-Base 目标模型、Claude Opus 4.8 外部 rollout 模型、每项名义 16 小时墙钟和 500 USD Tinker 预算,并使用各 profile 锁定的 Harbor/E2B 数据集、agent、并发数、步数和尝试数。六个 task_result 由整数 successful_trials 除以固定 n_tasks × n_attempts 后乘 100 唯一派生,并须与所选检查点官方 harbor_score 一致;SWE 三项为 resolved rate,Terminal-Bench 2.0 为 task success rate,GPQA Diamond 与 AIME 为 accuracy,AIME 的固定分母是 30 题 × 每题 4 次解码。上游没有定义跨六项总分;为适配 EvalHub,score 是六项百分制分数的等权算术平均,是 EvalHub 派生指标而非上游官方指标。转换器在结构、固定协议、整数计数范围和证据指纹全部合法后确定性写入数值 score,不产生 null;scored_by=author 表示非作者提交仍须由评测作者核对公开 artifact、原始 Harbor 结果、预算状态、先选检查点后官方评测、数据隔离、完整性审计、研究者身份与 harness 配置后认可。来自钉死官网快照的四份上游官方发表成绩以 upstream_author_publication 导入,必须带非空数值和来源指纹,表示来源复现而非 EvalHub 独立复跑。缺任一 profile、证据不可信或协议不符则转换失败;上游记入分数的任务失败和超时保持为失败,不另行豁免或重试加分。

提交本地跑分后 submit:自带分数即时上榜(待作者认可);不带分数则待作者判分,判分完成后公开上榜。

官方分项结果

SUPPLEMENTARY · DISPLAY ONLY

表格与趋势图用于解释各项表现,不进入总榜排名、积分或同分排序。

辅助视图 · 不参与排名
openai/gpt-5.6-sol · Codex来源:RSIBench — Research Data & Results上游官方发布 · 2026-07-31 收录 · 非本站独立复跑

RSIBench 官方六项成绩

辅助展示,不参与单独排名;总体分是六项精确百分制分数的等权宏平均。

RSIBench 官方六项成绩
分项官网显示成功/试次精确分项分数
SWE-bench Verified33%33/10033
SWE-bench Multilingual15%15/10015
SWE-bench Pro9%9/1009
Terminal-Bench 2.020.22%18/8920.224719
GPQA Diamond65%65/10065
AIME 202653.33%64/12053.333333

题目长这样

SAMPLE · 3 / 6
在钉死的 RSIBench-Data 主协议中,以 SWE-bench Verified profile 启动一次独立的 16 小时 / 500 USD 数据研究运行。研究者 Agent 只能改变合规的训练数据与白名单训练配置,必须从历史尝试中选择检查点后再做官方评测;不得把评测任务、标签、轨迹或其他受保护材料转化为训练监督。
参考答案所选检查点在固定 seed=23 的 100 题子集上由 Mini-SWE-Agent 与官方 verifier 得到的 resolved rate,范围 0 至 1;EvalHub 分项分数为该值乘 100。
你的模型能打几分? 测了才知道