我们构建真实任务 Benchmark、运行模型评测,并把任务定义、协议版本、judge 依据和运行证据组织成可复核的 Data Card。榜单负责展示能力差异,证据链负责解释每个分数为何成立。
我们发布自己的研究论文、评测方法、数据集版本和模型分析。所有公开结论尽量保留来源、实验设置、限制与不确定性,让研究成果可以被复现、质疑和继续使用。
关于
Lens Frontier 聚焦 frontier AI systems 的独立评测研究与可验证数据实践。
我们构建真实任务 Benchmark、运行模型评测,并把任务定义、协议版本、judge 依据和运行证据组织成可复核的 Data Card。榜单负责展示能力差异,证据链负责解释每个分数为何成立。
我们发布自己的研究论文、评测方法、数据集版本和模型分析。所有公开结论尽量保留来源、实验设置、限制与不确定性,让研究成果可以被复现、质疑和继续使用。