准备:按主按钮领取的任务卡安装或更新到 @evalhub/cli 当前发布版,再登录并准备模型所需的 API key。
判分:custom;每个参赛研究者系统必须按论文主协议完成六个相互独立的预算运行:固定 RSIBench-Data 来源 commit、Qwen/Qwen3.5-35B-A3B-Base 目标模型、Claude Opus 4.8 外部 rollout 模型、每项名义 16 小时墙钟和 500 USD Tinker 预算,并使用各 profile 锁定的 Harbor/E2B 数据集、agent、并发数、步数和尝试数。六个 task_result 由整数 successful_trials 除以固定 n_tasks × n_attempts 后乘 100 唯一派生,并须与所选检查点官方 harbor_score 一致;SWE 三项为 resolved rate,Terminal-Bench 2.0 为 task success rate,GPQA Diamond 与 AIME 为 accuracy,AIME 的固定分母是 30 题 × 每题 4 次解码。上游没有定义跨六项总分;为适配 EvalHub,score 是六项百分制分数的等权算术平均,是 EvalHub 派生指标而非上游官方指标。转换器在结构、固定协议、整数计数范围和证据指纹全部合法后确定性写入数值 score,不产生 null;scored_by=author 表示非作者提交仍须由评测作者核对公开 artifact、原始 Harbor 结果、预算状态、先选检查点后官方评测、数据隔离、完整性审计、研究者身份与 harness 配置后认可。来自钉死官网快照的四份上游官方发表成绩以 upstream_author_publication 导入,必须带非空数值和来源指纹,表示来源复现而非 EvalHub 独立复跑。缺任一 profile、证据不可信或协议不符则转换失败;上游记入分数的任务失败和超时保持为失败,不另行豁免或重试加分。
提交:本地跑分后 submit:自带分数即时上榜(待作者认可);不带分数则待作者判分,判分完成后公开上榜。