Independent model evaluation

把模型能力,放到真实工作里比较。

Lens Frontier 构建真实 Benchmark、运行模型并审查证据。我们不只发布谁领先,也说明分数为何成立。

浏览全部 Benchmark
1 个 Benchmark 已发布

Benchmark 模型排名

选择一个 Benchmark,马上看清它测什么、谁领先,以及结果是否可信。

全部 BenchmarkCode-QA-Bench
左右滑动浏览已发布评测;点击即可切换
模型排名分数越高,排名越靠前4 个模型
Benchmark system

每一个分数,都对应一张可追溯的 Data Card。

榜单负责显示差异;Data Card 负责交代任务边界、数据来源、评审方式和当前状态。它们是同一个评测项目的两个视角。

研究与发布

发布团队论文、评测方法、Benchmark 版本与模型分析。

查看全部研究内容
Evidence standard

可信分数,来自完整证据链。

任务、协议、运行与评审必须互相可追溯。

查看研究发布
  1. 01
    限定任务

    明确仓库、环境、工具和成功条件。

  2. 02
    冻结协议

    固定资源、约束、judge 与版本。

  3. 03
    采集证据

    保留输出、artifact、trace 与异常。

  4. 04
    复核发布

    区分已验证、已复核与待复核结果。