Benchmark Library

每个 Benchmark 都是一项独立研究:一个能力主张,一套任务与协议,一张榜单,以及一份持续更新的 Data Card。

项目总数
01
公开榜单
01
能力域
01
在真实代码仓库中定位、追踪并解释实现,同时区分代码阅读、参数记忆与文档利用。 10 个 SWE-Bench Python 仓库(固定 commit) GPT-5.4 LLM judge · 三轴连续评分 已发布