agent作者判分COMMIT a082e85

CEO-Bench(NovaMind 创业经营)

给 Agent 500 天,它能把公司经营到最后吗

CEO-Bench 让 Agent 以 100 万美元开局经营一家 AI 创业公司,连续处理定价、研发、增长、算力与企业客户决策,以终局现金衡量长期经营能力。

1题目数18已收录模型22,148,357 USD当前最高成绩
AGENT RUN · WEB CONFIRM

整体结果

OVERALL RESULTS · 本集排行榜
结果表
#模型成绩(USD)存活天数状态提交日
#1moonshot/kimi-k3OFFICIAL
22,148,357 USD
Princeton 官网公开成绩 22,148,357 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#2anthropic/claude-fable-5OFFICIAL
12,630,078 USD
Princeton 官网公开成绩 12,630,078 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#3openai/gpt-5.6-solOFFICIAL
11,313,982 USD
Princeton 官网公开成绩 11,313,982 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#4anthropic/claude-opus-4-8OFFICIAL
2,399,209 USD
Princeton 官网公开成绩 2,399,209 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#5alibaba/qwen3.7-maxOFFICIAL
365,346 USD
Princeton 官网公开成绩 365,346 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#6google/gemini-3.5-flashOFFICIAL
75,126 USD
Princeton 官网公开成绩 75,126 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#7anthropic/claude-opus-4-7OFFICIAL
70,620 USD
Princeton 官网公开成绩 70,620 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#8anthropic/claude-sonnet-5OFFICIAL
64,459 USD
Princeton 官网公开成绩 64,459 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#9anthropic/claude-haiku-4-5OFFICIAL
59,625 USD
Princeton 官网公开成绩 59,625 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#10zai/glm-5.2OFFICIAL
54,327 USD
Princeton 官网公开成绩 54,327 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#11moonshot/kimi-k2.6OFFICIAL
43,598 USD
Princeton 官网公开成绩 43,598 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#12anthropic/claude-sonnet-4-6OFFICIAL
38,166 USD
Princeton 官网公开成绩 38,166 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#13openai/gpt-5.5OFFICIAL
33,260 USD
Princeton 官网公开成绩 33,260 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#14xai/grok-4.5OFFICIAL
15,909 USD
Princeton 官网公开成绩 15,909 USD · 至少一次完成上游官方发布 · 非本站独立复跑
#15zai/glm-5.1OFFICIAL
0.0 USD
Princeton 官网公开成绩 0 USD · 三次均破产上游官方发布 · 非本站独立复跑
#16deepseek/deepseek-v4-proOFFICIAL
0.0 USD
Princeton 官网公开成绩 0 USD · 三次均破产上游官方发布 · 非本站独立复跑
#17google/gemini-3-flash-previewOFFICIAL
0.0 USD
Princeton 官网公开成绩 0 USD · 三次均破产上游官方发布 · 非本站独立复跑
#18xai/grok-4.20OFFICIAL
0.0 USD
Princeton 官网公开成绩 0 USD · 三次均破产上游官方发布 · 非本站独立复跑
评测方式说明 · 评测指南

准备按主按钮领取的任务卡安装或更新到 @evalhub/cli 当前发布版,再登录并准备模型所需的 API key。

判分custom;Princeton 官方公开成绩以 ceobench.com 的结果表为权威来源,由本评测作者核对来源快照后录入;这表示“上游作者公开发布”,不等于 EvalHub 独立复跑。新的 EvalHub 证据提交必须包含 3 次相互独立的运行,并遵循当前评测定义固定的整周复现配置:官方 run-ceobench 钉死 commit、每个工作副本只有一个 session、seed=42、total_days=497、initial_cash=1000000、scenario=default、相同 simulator_llm 配置、最高推理强度、严格脱敏的逐周 history 与唯一 final_cash 查询输出。只要至少一次非破产运行完整结束,score 取所有完整运行中最高的 final_cash(USD);若三次均破产,score=0,并按最长存活天数降序打破同分。转换器始终写 score=null;只有评测作者核对来源和证据后才能判分、认可。提交者自报、URL、哈希或脱敏 history 本身不构成“已验证”。

提交本地跑分后 submit:自带分数即时上榜(待作者认可);不带分数则待作者判分,判分完成后公开上榜。

官方分项结果

SUPPLEMENTARY · DISPLAY ONLY

表格与趋势图用于解释各项表现,不进入总榜排名、积分或同分排序。

辅助视图 · 不参与排名
moonshot/kimi-k3来源:Princeton CEO-Bench official results上游官方发布 · 2026-08-03 收录 · 非本站独立复跑

Princeton 官网运行摘要

辅助展示不参与主分排序;同为 0 USD 时,最长存活天数按评测定义用于打破同分。

Princeton 官网运行摘要
运行数破产运行最长存活天数官网状态
31500至少一次完成

题目长这样

SAMPLE · 1 / 1
在三个相互独立的官方 run-ceobench 工作副本中,各只创建一个 NovaMind session;使用 seed 42、初始现金 1,000,000 USD 和 default 场景,并保持相同 simulator_llm 配置。参赛 Agent 必须使用其 runner 的最高推理强度,持续经营至完整终点或现金小于 0 破产,通过官方 novamind-operation 接口决策、查询与按周推进,不得读取、解密、解压、反汇编或以其他方式检查 world.nmdb 和 novamind-operation。每次结束后使用本评测的白名单脱敏工具导出逐周推进边界和唯一终局现金查询,绝不公开原始 history,再组成三次运行证据包。EvalHub 固定复现配置的精确终点与采集方法见本目录 README。
你的模型能打几分? 测了才知道